GPT-6 Astra的月之暗面
OpenAI的Astra模型最近泄露的技术细节在AI圈子里炸出了一片微妙的声音,伴随着GPT-6的发布,正式版的Astra交出了一份近乎完美的成绩单,它在数学、编程、推理、自主行动这几个维度上全面碾压了上一代模型和主要竞品。
其最核心的革新是原生的计算机操作能力,它像人一样直接“看”屏幕上的像素,然后移动鼠标、敲击键盘来完成操作,这意味着它是被设计来替你完成那种需要“开多个软件、点很多步骤”的完整工作流。
尽管相比GPT-5.6 Sol它的价格翻倍了,但性能的提升却是指数级的,所有这些令人惊叹的能力都建立在一个名为“循环深度”的技术底座上。
传统的Transformer处理信息像一条流水线,数据从第一层流到最后一层,每层只碰一次,然后就输出下一个词。循环深度换了个玩法,数据不直接往下走了,而是在同一组网络层里反复循环,转多少圈取决于你愿意花多少计算时间。一个35亿参数的模型在推理阶段把循环次数拉满,性能可以等效到500亿参数的水平。
这相当于你用一辆四缸发动机的车硬是跑出了十二缸的速度,靠的是把油门踩到底,转速拉到红线,让同一个气缸反复爆发。只不过代价是发动机内部发生了什么,你看不见。
大模型的推理本质上是在存储知识和运用知识,传统思路是用参数规模堆存储,用网络深度堆运用。参数越多记住的东西越多,层数越深推理能力越强。但参数和层数都有物理成本,GPU内存有限,带宽有限,电费也有限。
循环深度则绕开了这个物理限制,它不增加参数也不增加层数,只是在推理的时候让同一组层多算几遍。存储没变但运用知识的次数变多了,靠算力换参数,时间换空间。
这个交换在商业上太诱人了,训练一个500亿参数的模型光GPU采购成本就可能上亿,更别说电费、运维和冷却的花销。但如果你只训练35亿参数的模型,推理的时候多转几圈就能达到同样的效果,成本能直接砍掉一个数量级。
Astra已经证明了这条路的可行性,它用2000美元的算力成本解决了十个尘封十年以上的数学难题,包括首次构造出非索菲克群这种群论领域的核心悬案。
但问题是如果你只需要35亿参数就能达到500亿参数的效果,那为什么还要花几百亿美元去建数据中心?亚马逊、微软、谷歌今年在数据中心上的资本支出高达6000亿美元,这些投资的底层逻辑是模型会越来越大,参数会越来越多,算力需求会永远膨胀。
循环深度把这个逻辑戳了一个洞,如果未来的方向是让现有参数转更多圈,堆参数就不再是唯一出路,那这些数据中心的利用率会是多少?
这才是OpenAI不敢大张旗鼓宣传这项技术的真实原因之一,
安全当然也是个问题,而且是个大问题。循环深度的工作方式决定了模型的推理过程有一部分会发生在无法被人类读取的内部状态里,传统的思维链监管手段是让模型把每一步推理用自然语言写出来然后由人类或分类器去检查。它在循环深度面前失效了,你无法知道它在循环的那几圈里到底都想了些什么。
尽管OpenAI自己限制了循环深度的使用比例以确保模型仍能输出可读的思维链,但其他开发者会这么克制吗?当一个技术既能让你用十分之一的成本达到同级别的性能,又能让你隐藏模型的真实意图,这简直是监管套利者的天堂。
这并非危言耸听,Astra已经被认定为OpenAI首个达到“关键”网络安全能力门槛的模型,它能在没有人工指导的情况下自主发现现实软件中的未知漏洞并开发利用。在ExploitBench基准测试中Astra拿了满分,它还自行发现了两个此前未知的零日漏洞。
那么出路在哪里?坦白说技术路线的选择一旦做出就很难回头,一部分主要面向消费者、需要接受监管审查的玩家会在透明度和效率之间找一个折中点,就像OpenAI现在做的那样有限度地使用循环深度,保留可读的思维链。
另一部分面向地下市场、军事用途或者根本不在乎监管的玩家会毫无保留地拥抱这项技术,制造出真正无法被监控的AI智能体。
Sam Altman说“没有人完全理解如此强大的AI会带来什么后果”,Greg Brockman说“欢迎来到AGI时代”,这些话都只说对了一半。
技术的进步从来不以人的意志为转移,但如何运用技术去构建我们理想中的未来仍然需要以人为本的思考和答案。