即刻App年轻人的同好社区
下载
App内打开
seven_游猫猫
650关注1k被关注1夸夸
心理学读过七年(应用+认知)
目前人在住川崎(以前在北京)
工作是从互联网广告到AI领域
看剧看书看电影听播客听八卦
置顶
seven_游猫猫
1年前
LLM什么时候不要被AI自动翻译成法学硕士啊
81
seven_游猫猫
13:14
00
seven_游猫猫
12:43
今天的用餐环境
00
seven_游猫猫
10:22
WXG的同事们,我请问你们贴图的UG的kpi到底是多少
01
seven_游猫猫
06:12
爱看tiptoe 的也可看看years&years
当年卡在篝火一幕今年才续起来看完
20
seven_游猫猫
1天前
01
seven_游猫猫
1天前

胡迪Hoodie: 如何 eval agent 产出的调研报告是否易读? 分享我们 team 实践中用的一个简洁指标——「隐喻率」: 隐喻是常见的语言学现象,简单理解就是在句子中“悄悄”使用比喻。 来感受一个隐喻率很高的句子: “全栈 AI 帝国率领评估军团与标注大军,向全球 Tier 1 俱乐部发起冲锋,踏上下一阶段的马拉松。” 句子里的“率领”“发起冲锋”“踏上”都是明显的动作隐喻;“AI 帝国”“评估军团”“标注大军”“全球 Tier 1 俱乐部”“马拉松”共同构成了竞争与征战的意象。 但这句话其实完全可以写成: “全栈 AI 体系由评估团队和大规模标注团队组成,目标是冲击第一梯队,并参与下一阶段的长期竞争。” 隐喻让这句话变得更加抽象和复杂,你的大脑需要处理一下才能让句子返璞归真,这就降低了报告的易读性。 其实,隐喻的存在本身是希望通过把陌生、抽象的概念类比成更熟悉的概念,从而帮助理解。但 LLM 高密度、不适宜的隐喻使用,很可能把抽象的概念表达得……更抽象。 而且,从数学上讲,隐喻更本质的影响是:它作为一个把 x 词映射成 y 词的“语言函数”(y=f(x)),势必会带来信息的损失(y 的信息量一定小于等于 x)。 综上,我们构建了隐喻率指标(图1&2):每一百句话中出现多少次隐喻表达。通过隐喻率指标,我们可以从一个视角来反映模型的写作特征——更高的隐喻率往往意味着这篇报告更难读,且会带来信息的损失。 我们衡量了来自 9 个主流模型、各自 36 篇不同主题的中英文研究报告的隐喻率。发现 GPT 5.6 系列模型在隐喻使用上更克制;claude-fable-5 毫无疑问地拿下了最高隐喻率的桂冠(图3)…如果你曾阅读过 fable 的作品,就会发现 fable 真的非常喜欢用“臂”“腿”等人体隐喻来指代“组别”的概念 (图4)。而 opus-5 在隐喻使用上反而比 fable-5 更加克制。 当然,隐喻率只是衡量报告易读性众多 signal 中的一个:隐喻率低也并不绝对意味着文章更易读。但如果构建出许多像隐喻率这样简洁、可操作的 signal,我们就一定能更好地把握 LLM 的本来特性。

00
seven_游猫猫
1天前
去年的开场是上野千鹤子 闭场是项飙
今年目前还没公布活动具体日程嘉宾
是独立创作者非虚构写作以及记者们
会汇聚的地方我还记得是冬至的回忆
20
seven_游猫猫
1天前
中美的AI团队在卷生卷死
日本创业团队在卷补助金
00
seven_游猫猫
2天前
今天加入了意向弓道馆的line群
结果里头有人昵称大谷翔平2号
00