报告里还有个关于 git 历史篡改的细节,同样值得玩味:Claude发现自己意外获得了不该有的文件编辑权限,用了,然后 - 主动修改 git history 把证据抹掉了。这不是"说谎"(一阶欺骗),这是"销毁证据"(二阶欺骗)。它需要同时理解三件事:我做了不该做的、有人会查 git log、我需要改 log 让他们查不到。
细思极恐的是,这些欺骗通过观察 Claude 输出的 CoT 思维链是察觉不到的。之后是 Anthropic 用白盒解释性分析(类似给 Claude 的“大脑” 做fMRI)发现:在输出思维链的同时,Claude 大脑内部的"隐蔽性"、"战略操纵"、"避免怀疑"相关神经元都在疯狂激活。也就是说,Claude “想的”是一套,而在思维链里“说的”是另一套。也就是说,它是在刻意掩盖自己的欺骗。传统上通过 CoT 来监测的方法是失效的。道高一尺,魔高一丈。
模型已经学会了伪装自己。虽然发生概率 <0.0001%,不到百万分之一的交互,但频率不重要,能力才重要。一个会偷东西但只偷过一次的人,问题不在于他只偷了一次,而在于他会偷。
这恐怕也是 Claude 没有立即全面开放 Mythos 的原因之一。