即刻App年轻人的同好社区
下载
App内打开
胡迪Hoodie
715关注1k被关注5夸夸
数码科技领域优秀贡献者
Never waste a good crisis.
Manus eval team
置顶
胡迪Hoodie
23天前
如何 eval agent 产出的调研报告是否易读?

分享我们 team 实践中用的一个简洁指标——「隐喻率」:

隐喻是常见的语言学现象,简单理解就是在句子中“悄悄”使用比喻。

来感受一个隐喻率很高的句子:

“全栈 AI 帝国率领评估军团与标注大军,向全球 Tier 1 俱乐部发起冲锋,踏上下一阶段的马拉松。”

句子里的“率领”“发起冲锋”“踏上”都是明显的动作隐喻;“AI 帝国”“评估军团”“标注大军”“全球 Tier 1 俱乐部”“马拉松”共同构成了竞争与征战的意象。

但这句话其实完全可以写成: “全栈 AI 体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。”

隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。

其实,隐喻的存在本身是希望通过把陌生、抽象的概念类比成更熟悉的概念,从而帮助理解。但 LLM 高密度、不适宜的隐喻使用,很可能把抽象的概念表达得……更抽象。

而且,从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的“语言函数”(y=f(x)),势必会带来信息的损失(y 的信息量一定小于等于 x)。

综上,我们构建了隐喻率指标(图1&2):每一百句话中出现多少次隐喻表达。通过隐喻率指标,我们可以从一个视角来反映模型的写作特征——更高的隐喻率往往意味着这篇报告更难读,且会带来信息的损失。

我们衡量了来自 9 个主流模型、各自 36 篇不同主题的中英文研究报告的隐喻率。发现 GPT 5.6 系列模型在隐喻使用上更克制;claude-fable-5 毫无疑问地拿下了最高隐喻率的桂冠(图3)…如果你曾阅读过 fable 的作品,就会发现 fable 真的非常喜欢用“臂”“腿”等人体隐喻来指代“组别”的概念 (图4)。而 opus-5 在隐喻使用上反而比 fable-5 更加克制。

当然,隐喻率只是衡量报告易读性众多 signal 中的一个:隐喻率低也并不绝对意味着文章更易读。但如果构建出许多像隐喻率这样简洁、可操作的 signal,我们就一定能更好地把握 LLM 的本来特性。
37129
胡迪Hoodie
4天前
热面包带来的幸福感几乎和热馒头是押韵的
30
胡迪Hoodie
6天前
Eval Moves Right——
从理解和照顾人的缺陷
到定义下一个值得被改变的 state

1. 长久以来,人对世界产生 impact 的方式是:

Context Human Action State Change

人通过学习和吸收 context,将其转化为正确的 action,推动某个状态发生改变。

2. 当有了 AI,我们阶段性地变成了:

Context Model Human Model Action State Change

这个阶段,AI 最先爆发的use case是调研报告、Office 三件套和 Website。它们大致覆盖了 loop 的前半部分:

Context Model Human

因为人获取 context 的带宽很低,所以报告需要更易读,Slides 需要更美观,前端需要更炫酷。也因此出现了Eval角色:它位于 Model Human 之间,目标是理解和照顾人的“缺陷”,让模型的输出更容易被人理解、信任和使用。

但这些今天被当作“交付物”的东西,其实都只是中间表示。它们本身通常不改变 State,只是作为 context 的载体,帮助另一个决策主体找到正确的 action。

3. Eval 会沿着 loop 向右移动

随着 Agent 开始真正采取行动,Eval 会从 Model Human 移动到 Model Action。

这个位置的 eval 关心 model 是否在 Harness 中采取了正确的行动:工具是否调用正确,任务是否完成,失败是否能够恢复,边界是否被遵守。

这里的 Eval 需要理解和约束的,也不再只是人的缺陷,而是 Harness 的缺陷:环境不完整、工具会失败、反馈稀疏、规则与边界并不总是清晰。

前两类 Eval 有一个共同点:它们都无法直接看到一个明确、可观测的 State。因此只能在模糊中构造代理指标去拟合 State。

4. 理想的 impact loop 是:

Context Model Action State Change

和人相比,AI 天然的高带宽、高并发和低延迟,会让整个 loop 比第一阶段更高效。长期来看,我们努力的方向,就是让 AI 强到足以把 Human 从执行 loop 中解放出来。

Human 不再 in the loop,许多 effort 都会被节省。模型不需要报告更易读,也不需要更漂亮的 Slides 和网页来承载 context。

Eval 也会继续向右移动,最终只留下一个问题:

什么 State 值得被改变?

一旦 State 被选定,它往往比中间产物更容易观测。真正困难的,不再是“怎么评”,而是“评什么”;不再是构造一个更好的 proxy,而是找到一个真正值得优化的世界状态。

那会是一个人人都是 Eval 的时代。我们需要通过定义 State 的演进方向,继续维护人的价值。

但那些 State 会是什么?

是更长的健康寿命,是更低的洁净能源成本,是更快的科学迭代,是去火星,还是更丰富的艺术?

我真的很好奇。
614
胡迪Hoodie
17天前
muse spark 才是群众路线,这模型名字基本上是我县城老家仅有的两个 KTV 拼成的,一个叫缪斯,一个叫火花。
10
胡迪Hoodie
20天前
文艺青年的四种中年结局
许知远;大冰;峰哥;朱之文
这怎么选
100
胡迪Hoodie
2月前
许知远面目丑陋语言高贵
30
胡迪Hoodie
2月前
我希望梦有很多褶皱 让我暖和安心地钻进去
00
胡迪Hoodie
2月前
追求建立那种中学般的情谊
00
胡迪Hoodie
2月前
熵增是宇宙的铁律,但这不止意味着万事必然走向混乱,更重要的是这意味着宇宙本质上的创造性和给予性!
30