补充一些关于 Evals 这个事情的大的认知框架:
1. evals 是个产品问题,出题出指标就是把自己脑子里对于什么是好的给呈现出来,这个东西的 best practice 也跟做产品一样,就是先跑起来在说,很多效果优化项拍脑袋拍不出来,用什么麦肯锡方法论纸上谈兵在那儿MECE也分不出来,跑一遍看看效果才能想得出来哪儿好哪儿不好,才能知道怎么出题,怎么定指标,怎么设计打分机制。
2. Agent evals 是一个更难的事情,这个事情有两个角度:
2-1. 从显而易见的需求出发的角度看,我们要做端到端的针对用户需求的效果评测,比如定义一些指标来判断什么样的报告或者视觉设计是好的或者什么样的样式格式是产品希望呈现的。这跟产品经理驱动模型微调大致是一样的。
2-2. 另外一个角度是,至少几个季度内,agent 是个用户们(至少是高阶用户们)要学着去怎么用的更好的一个东西,这个角度看做 Agent 像做个精密的工具,那么从这个角度出发,我们就要针对内部结构的运转去做评测。也就是评 trajectory,这个难点是建立指标不能从传统的需求理解出发,但是好在 best practice 依然适用,跑起来看看就能知道什么样的 trajectory 是好的。
3. 评测的最终目的是指导迭代,单个指标/功能迭代得好倒是不难,但是做个全能的 agent,大部分工作是在做 trade off,很多 evals 最后变成了 regression 和 capability 定义,这个是让人苦恼的,我目前看到的唯一解就是有一个人了解模型+了解模型落地+了解产品+非常又责任心的超级大哥抱着享受探索未知领域的 mindset 去全盘负责这个事情,可想而知目前没有几个团队做得好这个事情。这不是人力/钱角度的难,这是一个伟大的为人类进步探索未知的任务!
4.话说回市场现状,贵行业拥有可能是人类历史最疯狂的一次钱和生产力角度的增长,那么享受这个探索未知的过程吧。