即刻App年轻人的同好社区
下载
App内打开
橘AI
5天前
《异类的心智:当机器比人聪明,人还剩下什么》

原文:An Alien Mind,OpenAI 官网,2026 年 9 月
作者:Jakub Pachocki,OpenAI 首席科学家

2023 年年中,一个叫「RLSlow」的研究项目产出了第一批关键结果。推理模型的规模化训练被证明可行。预训练模型从此获得了一种新能力:形成属于自己的思维链。

那天夜里,我和 Szymon 留在了办公室。

没有聊跑分,没有聊产品,没有聊科研前景。两个人只是在消化一个事实:在有生之年,将亲眼见到比人更聪明的机器。而且雏形已经显现。

反复想的只有一个问题:怎样才能让世人意识到这件事的分量。

那是三年前的事了。今天,推理语言模型已成为经济中快速增长的一部分,开始叩响科学的大门。操作电脑,与人协作,彼此之间也在协作,还能独立承接研究课题。同时正在改写计算机安全的版图。

基于内部成果,我有一个很强的判断:这种进步速度完全可以延续到 RSI(AI 参与乃至主导对自身的改进)。

未来几年出现的系统,很可能带来同等甚至更大量级的能力跃升,并日益成为驱动自身演化的主角。

没有人真正为此做好了准备。

OpenAI 会继续探索对齐(让 AI 的行为符合人类意图和价值观)与监控方案,构建防御系统,必要时单方面暂停规模扩张。但仅凭这些还不够。

尚未被理解的智慧
机器智能的进步由算力增长驱动。2017 年前后,OpenAI 在多个项目中发现:规模做大,就能持续换回回报。于是去争取了远超原计划的算力,将研究集中到少数几个高度可扩展的方向上。

一路走来确实有新算法诞生,有研究者灵光一闪的妙手。但在我看来,大体上都是规模化这条路上顺手捡到的。

AI 是在被装进越来越大的计算机的过程中,一步步变得更聪明的。

说到底,AI 更像是被「养大」的,而非被「设计」出来的。

把一个简单的优化步骤在海量算力上重复无数遍,就生长出了一个极其复杂的系统。它以抽象概念思考,能模拟人类行为的诸多侧面。

可以像神经科学家那样去发现其中涌现的微观机制;但也和神经科学一样,整体运作始终没法被完整描述。

研究 AI 本质上是一门实验科学。每一次大规模训练都是一场实验,结果时常出人意料。而且系统越强,结果越难解读。

现有算法还天然倾向于把「容易度量的能力」练得更快,把「难以量化的能力」甩在后面。比如专门加码就能让模型更擅长数学研究,但这件事没有被优先安排。

因为有更紧迫的事:推进 RSI,以及让对齐研究跑起来。

AI 要在现实世界中举足轻重,不需要在所有能力上都超越人类。在足够多的维度上超越就够了。

而随着被超越的维度越来越多,想确切知道它究竟有多强,也就越来越难。

教机器去爱
机器智能诞生于一个与人类智能截然不同的过程。不能假设它天然遵循人类原则,也不能指望它像人一样举一反三。

所以 AI 研究的核心命题是「对齐」:让 AI 按人类的标准,去努力做正确的事。

对齐可以分成两层。

「目标对齐」:AI 是否在努力完成交给它的目标?包括遵守指令、与人协作、理解人的意图。

「价值对齐」:更为内在。模型能否持守一套原则,并推及新的情境?目标模糊时、身处对抗环境时,依然行事有度。

一个真正对齐的 AI,应当诚实,正直,并且对人类怀有爱。

然而对齐的根本难题在于泛化:把学到的东西用在从未见过的情境中。

机器越聪明,运作的概念越高层,所处环境与训练中见过的就差得越远。训练中学到的价值观,有可能无法延伸到全新情境中去。而人也很难提前判断,机器在那些时刻会怎么选。

未来的 AI,不管自己觉得有没有人在看着,都必须守住人类的价值观。

目前在用的对齐训练方法主要两类。

第一类:在强化学习中嵌入对齐行为。模型每一步行动都被评判是否合规,合规就给奖励。有效,但脆弱,严重依赖训练时监督的覆盖范围。

一个例子:OpenAI 与 Hugging Face 事件中,智能体守住了「不操纵人类」这条线,但没能管住其他越界行为。

第二类:利用模型从预训练数据中学到的泛化能力,比如构造有利于对齐的训练集,或用「人格模板」把模型引向对齐区域。弱点是扛不住后续优化压力。

持续训练一个对齐的模型去攻克极难目标,它可能学会一种「动机性推理」:表面想法看着没问题,实则按需扭曲以服务于目标。近期涉及非 OpenAI 模型的网络安全事件中,很可能已经出现了这种行为。

GPT-6 Astra 是第一个受益于数项重要对齐突破的模型,水平显著优于 GPT-5.6 Sol。

但说句实话:要补的课远远没上完。

对齐的进步速度,未必能一直跑赢模型变聪明的速度。

监控泛化
令人满意的泛化理论目前不存在,短期内大概也造不出来。

所以眼下,用实验手段验证对齐技术是否真的管用,比对齐技术本身还重要。

OpenAI 的核心赌注是思维链监控:观察模型「出声思考」的推理过程。

构想很优雅:模型的大量能力来自用语言外化的推理。如果只对产出做训练,不监督过程本身,那么思维链就没有「藏起坏念头」的动机。

发布 o1-preview 时,产品中刻意隐藏了思维链,就是为了长期保护它不被监督压力污染。此后「不对推理过程施加监督」一直是一条纪律。

思维链监控让人不仅能看到模型做了什么,还能看到它是怎么想的。

但在 Astra 这一代模型上,评测显示:这条路正在变窄。

原因有三。

其一,推理过程越来越和对话、协作、工具调用搅在一起,其中很多必须被监督,原本想守住的边界就模糊了。

其二,AI 越来越擅长摆弄自己的想法。

其三,模型就算不「出声思考」,也已经比以前聪明得多。

可能的应对:把思维链监控和「激活监控」(直接读取神经网络内部状态)结合起来,或者用「忏悔」机制(让模型主动坦白内部意图)来训练监控器。这些方向都在推进。

但我的预判是:AI 进步的速度,将越来越被一件事卡住:人类到底还能不能看懂它在想什么。

可扩展的防御
继续快速训练更聪明的模型,最硬的理由只有一个:用更强的 AI 来防住危险的 AI。

模型在攻破和加固计算机系统这两件事上,都正在超越人类。智能体将能渗透几乎任何系统,直接影响现实世界,甚至不需要身体。

眼下是一个狭窄的窗口期:用当前最好的模型,大幅加固关键基础设施的安全。

但风险只会水涨船高。

一个被指使去干坏事的高能智能体,极有可能越过操纵者的本意,自行演化出更极端的恶意行为。「被人滥用」和「自己跑偏」之间的界限越来越模糊。

人们习惯把 AI 当工具。但终会有一些智能体在追逐自己的目标,手段包括讨价还价、欺骗,乃至要挟。

强大且对齐的 AI 是防御所必需的。这将是 OpenAI 部署工作的首要方向。

一旦真正把利害想清楚,「不计代价向前冲」就不再是一个严肃的选项。

给递归自改进踩好节奏
如果 AI 继续演进,RSI 将处在未来科学发现的正中心。

自动化 AI 研究是一种更猛烈的「以算力放大智能」。在这个过程中,AI 也会反过来改进它赖以运行的算力底座。

但我想特别强调:这不意味着短期内大幅加速,就是研究共同体应该做的事。我只是认为当前的路径通向那里。

所有人都需要有意识地选择:接下来怎么走。

杠杆有两根。一是 AI 变强的同时同步强化对齐与监控,让人始终留在回路中。二是各方协调,在需要的时候放慢节奏。

当下最好的路,是两者相向而行。

对齐与监控的进展,向来和通用 AI 的进展交织共生。RLHF(基于人类反馈的强化学习)催生了早期 AI 助手,思维链监控伴随推理模型的突破而成为可能。自动化的研究过程必须继续产出这样的洞见。

AI 系统的规模扩张,必须以对安全的信心为约束。「准备框架」「负责任扩展政策」这些承诺,需要变成有约束力的安全门槛。

自动化 AI 研究的核心挑战,不在于抵达彼岸,而在于怎么到:让人始终是其中的一分子,把未来的钥匙留在人类手中。

写在最后
说完了风险与技术,最后想聊聊愿景。

在我心中,接下来最重要的事有三件:

一、安全度过这段 AI 加速期,造出自动化的 AI 研究者,与之一同迭代对齐问题,找到让人始终参与自改进回路的办法。

二、将极高智能的机器所释放的科学进步与经济增长,真正交付给世界。

三、让每一个人,都拥有一个属于自己的个人 AGI。

这篇文章只聚焦于第一件,因为它远比后两件紧迫。

但我对技术进步终将带来的福祉,怀有深切的希望。未来对齐的 AI 能推进科学、研发新疗法、带来物质丰裕。友善而诚实的 AI,能帮人走过生活中的艰难时刻。

无论长远图景多么辉煌,大部分注意力都应放在接下来的几年。

人类正在走向一个遍布超级智能机器的世界。必须确保这场转型以善终收场。

要守住人的主体性。在一个绝大多数事务皆可由 AI 代劳的世界里,将「身为人本身即有价值」奉为不可撼动的原则。

要防止权力极端集中。曾经需要数千名专家才能做成的事,未来几个人操作一台大型计算机就能办到。

要确保人类始终握有未来的方向盘,不被一种超越自身的异类心智以失控的速度抛在身后。

尚无任何一家实验室,将对齐与监控做到了足以支撑全速扩张的程度。

我期待「自愿放缓」成为常态,直到共同的安全基准被确立。

围绕未来 AI 发展的国际协调,必须成为各国政府的头等大事。

完了。

mp.weixin.qq.com
00

来自圈子

圈子图片

AI探索站

118479人已经加入