即刻App年轻人的同好社区
下载
App内打开
胡迪Hoodie
692关注758被关注3夸夸
Never waste a good crisis.
Manus eval team
置顶
胡迪Hoodie
2月前
online eval 发现消极指标往往比积极指标更有效。比如点踩比例或负向情绪比例。这好像是个常识,比起了解自己喜欢什么,人对自己讨厌什么更不容易产生幻觉。
00
胡迪Hoodie
1天前
如何 eval agent 产出的调研报告是否易读?

分享我们 team 实践中用的一个简洁指标——「隐喻率」:

隐喻是常见的语言学现象,简单理解就是在句子中“悄悄”使用比喻。

来感受一个隐喻率很高的句子:

“全栈 AI 帝国率领评估军团与标注大军,向全球 Tier 1 俱乐部发起冲锋,踏上下一阶段的马拉松。”

句子里的“率领”“发起冲锋”“踏上”都是明显的动作隐喻;“AI 帝国”“评估军团”“标注大军”“全球 Tier 1 俱乐部”“马拉松”共同构成了竞争与征战的意象。

但这句话其实完全可以写成: “全栈 AI 体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。”

隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。

其实,隐喻的存在本身是希望通过把陌生、抽象的概念类比成更熟悉的概念,从而帮助理解。但 LLM 高密度、不适宜的隐喻使用,很可能把抽象的概念表达得……更抽象。

而且,从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的“语言函数”(y=f(x)),势必会带来信息的损失(y 的信息量一定小于等于 x)。

综上,我们构建了隐喻率指标(图1&2):每一百句话中出现多少次隐喻表达。通过隐喻率指标,我们可以从一个视角来反映模型的写作特征——更高的隐喻率往往意味着这篇报告更难读,且会带来信息的损失。

我们衡量了来自 9 个主流模型、各自 36 篇不同主题的中英文研究报告的隐喻率。发现 GPT 5.6 系列模型在隐喻使用上更克制;claude-fable-5 毫无疑问地拿下了最高隐喻率的桂冠(图3)…如果你曾阅读过 fable 的作品,就会发现 fable 真的非常喜欢用“臂”“腿”等人体隐喻来指代“组别”的概念 (图4)。而 opus-5 在隐喻使用上反而比 fable-5 更加克制。

当然,隐喻率只是衡量报告易读性众多 signal 中的一个:隐喻率低也并不绝对意味着文章更易读。但如果构建出许多像隐喻率这样简洁、可操作的 signal,我们就一定能更好地把握 LLM 的本来特性。
2085
胡迪Hoodie
26天前
许知远面目丑陋语言高贵
10
胡迪Hoodie
1月前
我希望梦有很多褶皱 让我暖和安心地钻进去
00
胡迪Hoodie
1月前
追求建立那种中学般的情谊
00
胡迪Hoodie
1月前
熵增是宇宙的铁律,但这不止意味着万事必然走向混乱,更重要的是这意味着宇宙本质上的创造性和给予性!
30
胡迪Hoodie
1月前
球队的后腰,做得越好越没存在感,做得差了就很明显。
每个组织都有后腰般的角色。
21
胡迪Hoodie
2月前
50
胡迪Hoodie
2月前
技术栈不够AI native 就快被同事和组织节奏拉爆啦🥹
00
胡迪Hoodie
2月前
我在想 如果对人生没有游戏心态的话,是不是就在被游戏人生的兄弟玩儿呢。
20