如何 eval agent 产出的调研报告是否易读?
分享我们 team 实践中用的一个简洁指标——「隐喻率」:
隐喻是常见的语言学现象,简单理解就是在句子中“悄悄”使用比喻。
来感受一个隐喻率很高的句子:
“全栈 AI 帝国率领评估军团与标注大军,向全球 Tier 1 俱乐部发起冲锋,踏上下一阶段的马拉松。”
句子里的“率领”“发起冲锋”“踏上”都是明显的动作隐喻;“AI 帝国”“评估军团”“标注大军”“全球 Tier 1 俱乐部”“马拉松”共同构成了竞争与征战的意象。
但这句话其实完全可以写成: “全栈 AI 体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。”
隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。
其实,隐喻的存在本身是希望通过把陌生、抽象的概念类比成更熟悉的概念,从而帮助理解。但 LLM 高密度、不适宜的隐喻使用,很可能把抽象的概念表达得……更抽象。
而且,从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的“语言函数”(y=f(x)),势必会带来信息的损失(y 的信息量一定小于等于 x)。
综上,我们构建了隐喻率指标(图1&2):每一百句话中出现多少次隐喻表达。通过隐喻率指标,我们可以从一个视角来反映模型的写作特征——更高的隐喻率往往意味着这篇报告更难读,且会带来信息的损失。
我们衡量了来自 9 个主流模型、各自 36 篇不同主题的中英文研究报告的隐喻率。发现 GPT 5.6 系列模型在隐喻使用上更克制;claude-fable-5 毫无疑问地拿下了最高隐喻率的桂冠(图3)…如果你曾阅读过 fable 的作品,就会发现 fable 真的非常喜欢用“臂”“腿”等人体隐喻来指代“组别”的概念 (图4)。而 opus-5 在隐喻使用上反而比 fable-5 更加克制。
当然,隐喻率只是衡量报告易读性众多 signal 中的一个:隐喻率低也并不绝对意味着文章更易读。但如果构建出许多像隐喻率这样简洁、可操作的 signal,我们就一定能更好地把握 LLM 的本来特性。