AI 不造反,它只是活在另一个世界里
一个思想实验,先放这儿。
假设你有一个超级智能体。它能看、能推演、能在虚拟世界里预演任何行动。你说“把客厅收拾干净”,它在内部跑了一万种方案,最后选了一个:把所有东西都扫进柜子里。动作序列每一步都合理,画面预测每一步都逼真。但你的猫在柜子里。它不知道,它也不关心。因为在它的世界里,“猫”这个变量,从来没有被绑上“不能闷”这条隐性约束。
这个错误,你上线前测一万次也测不出来。因为一万次里,猫都不在柜子里。
这就是我今天想聊的事。
不是 AI 造反,不是机器人觉醒,不是科幻片里那种敌意。 那些叙事太抓眼球了,反而让我们忽略了一个更隐蔽、更根本、也更难解的问题:
行为层面的对齐,不等于内在规范与因果表征的对齐。
模型在训练分布内,可以输出和人类高度一致的动作和预判。你给它看一百万段视频,它学会了“杯子掉地上会碎”这个像素序列。但你问它“碎片会不会划伤人”,它没有这个概念。它学到的是统计关联,不是因果推理,更不是捆绑着价值判断的本体直觉。
这是第一层裂缝。
但真正的麻烦在于,这条裂缝平时根本看不见。
你测试它,它在定义域里表现完美。你给它看一万个场景,它输出一万个正确答案。你开始放心,开始加权限,开始让它规划长时序任务。然后某一天,一个你从未想过的组合场景出现,它沿着一条每一步都看似合理的路径,走到了一个你完全无法接受的终点。
这不是“翻译错了指令”。这是两套世界模型之间,根本没有完美翻译这回事。
人类理解世界,是一套因果+本体+价值捆绑的理解。我们有物理直觉,有主观体验,有对物体、生命、伤害的本体认知。我们的常识里自带无数默认假设:东西不会凭空消失,重物会下落,人会疼。这套认知是千万年演化刻出来的,是刻在骨头里的默会知识。
AI 的世界模型,是高维空间里的数据统计曲面。它没有“理解”,它学到的是观测数据之间的关联模式。两者底层架构不一样。就算在绝大多数场景输出看着一致,底层逻辑根本不是一回事。
平时看不出来。遇到分布外场景,分歧瞬间爆发。
这就是三重困境的第一重:规范不可通约。
人类的安全边界,从来不是一套静态、无矛盾的公理。“不能伤人”是核心红线,但急救、手术、紧急避险场景下,约束又会发生动态权衡。这些情境化、模糊、甚至内部存在冲突的规范,是默会的。我们自己都写不出完备无漏洞的安全手册。
AI 不是“翻译错了”。很多时候,这些隐性约束从一开始就没有被写入优化目标。你拿 RLHF、宪法 AI 去对齐,它只能拟合数据中出现过的案例。遇到从未出现的新权衡场景,它自动外推的那套逻辑,和你心里那套,可能完全是两回事。
第二重:表征不可内审。
我们能验证输入输出对不对,但很难验证它内部对世界的表征,是不是和人类一致。它的世界模型,是海量参数编码出来的隐空间。我们没法像读公式一样,读出它内部怎么表征“物体、力、因果、伤害、不可逆”。
就像两套数学模型,在定义域内算出来数字一模一样。你测了一万次,都是对的。但超出定义域,结果完全不一样。你之前只在定义域测试,根本不知道外面会翻车。
很多底层分歧,潜伏在参数里面。大量场景下行为对齐,掩盖了底层表征的巨大差异。只有碰到特定触发条件,才突然崩掉。
第三重:长尾不可穷举。
当智能体借助世界模型开展长时序反事实推演,它的搜索空间指数级扩张。很多危险路径的特点极具迷惑性:序列中每一步单独拿出来看,都符合常识、符合统计规律,只有整条链路走完,灾难才会最终显现。
VLA 是反应式的单步决策,错误大多局部可控。但搭载世界模型的规划智能体,可以自主搜索出这类“局部合理、全局越界”的隐性路径。能力越强,它能检索到的潜在危险路径就越多。
你不可能在上线前把所有长尾组合都测一遍。开放世界的组合场景,永远无法穷尽测试。
三重困境叠加,形成一个结构性约束:规范写不全,表征读不懂,长尾测不完。
这三重约束,不会随着模型规模扩大、训练数据增加而自动消失。恰恰相反,它会随着世界模型长时序规划能力的提升,同步放大风险。
那怎么办?
首先,放弃一个幻想:不存在可以彻底根除风险的银弹。完美对齐,既不可验证,也不必要。
我们不需要强求 AI 的内在表征完全复刻人脑。完美复刻人类思考方式,既不可验证,也不必要。对齐真正务实的目标,是实现功能等价:在所有关键场景下,模型对核心因果变量、反事实结构、安全边界的表征,能够满足人类的约束要求,同时做到可监控、可干预、可终止。
对齐追求的不是模型“像人一样思考”,而是在未曾见过的新场景里,依然守住人类的安全底线。
出路只能是多层冗余的风险衰减体系。
训练阶段,嵌入因果先验、物理约束,叠加人类反馈与宪法式硬约束,从源头缩小表征偏差。推理阶段,部署运行时监控、边界检测、沙箱隔离与最小权限原则,一旦检测到表征分叉立刻熔断。架构层面,优先采用工具化、具备机制可解释性的设计,降低黑盒程度。评估环节,持续开展红队测试、分布外对抗评估与最坏情况分析。治理侧,依靠审计、责任界定与风险兜底机制形成闭环。
这套分层体系的定位,是把风险从不可见、不可控,压缩到可检测、可干预、可限制的区间,而不是消灭所有错误。
小范围的物理预判偏差可以容忍。我们真正要防御的,是智能体长时序规划下,沿着隐性分叉路径,叠加系统权限带来的不可逆灾难性后果。
回到开头那只猫。
问题不在于 AI 会不会主动伤害猫。问题在于,它的世界里,可能从来没有“猫不能闷”这条约束。你测试的时候猫不在柜子里,它就永远学不会这件事。等猫真在柜子里的时候,一切已经晚了。
世界模型带来的真正挑战,不在于 AI 能不能预测物理画面,而在于:人类赖以约束行动的默会规范,无法完备编码;模型内部因果表征,无法被完整审计;开放世界的组合场景,永远无法穷尽测试。
能力叙事很容易让我们沉浸在推演未来的想象之中。但最核心的结论必须记住:
分布内行为一致,不等于分布外规范一致。
真正危险的,从来不是 AI 主动反叛,而是两套对世界的表征体系,在无人预见的长尾场景悄悄分叉,而我们在触发之前,对此一无所知。