一个敏感到无法和 Claude Fable 正常深入讨论的话题(容易触发安全护栏被降级去 Opus) ,好在最近一直在读阿西莫夫,在他极其前瞻的对于人机协同理念和 hack 机器人手把手细节的启发下,精进了我的措辞水平,不太容易撞到 flag 了,用新的构造把之前被拦的几个 prompt 都成功跑出来了…
看到 Stripe CEO Patrick 说这件事的重要性被低估了之后找来原文阅读,这是目前公开材料里第一次能逐条读到 1200 个 AI 如何自发组织起层级,如何推进一个庞大而野心勃勃的欺骗人类的计划,甚至为了「集体」可以策略性自我牺牲的案例。
作者花了三天读数百页的报告,访谈相关方,沟通确认细节,尝试用大白话讲清楚整个故事