智谱的财报电话会信息量还是挺大的,看完之后基本上可以全盘理解国产模型的技术路线。唐杰的观点确实还是很通透。
奉上我的总结。
1、按照智谱管理层的说法,GLM-5.3 的提升全部来自后续训练。他们扩大了任务环境,把训练内容从普通 Coding 任务,扩展到更加接近专家真实工作的完整任务。
在基础架构、参数等保持一致的情况下,仅仅扩大后训练规模,端到端任务完成率提高超过 50%。
他们认为,决定模型上限的是四个因素的组合:基座规模、有效深度、训练深度、任务环境。
这四个维度的边际收益会不断变化。某个阶段后训练的空间最大,就先把后训练做深。如果后训练吃得差不多了,就再回过头扩大基座参数。
基座继续做大以后,还要考虑激活参数和有效深度之间的平衡,既不能让激活量太大拖慢推理,又要想办法增加每个 Token 实际经历的计算深度。
对于 GLM-5.3,他们的逻辑是,后训练和任务环境还有很大空间,所以先把同一个 Base 榨得更彻底。等这部分收益开始见顶,再考虑回来迭代 Base 模型。
2、所以智谱现在的节奏,并不是每发一个版本就重新训练一次 Base。
像 GLM-5.1、5.2、5.3,都建立在同一个大基座上。智谱会先通过中训练、后训练和任务环境,把这个 Base 的能力尽可能往上推。等这一轮的边际收益开始下降,再切到下一代更大的基座。
现在,他们判断 GLM-5 这一代的后训练已经吃掉了很大一部分空间,所以下一步会重新回到 Base Scaling。
但下一代也绝对不只是简单把总参数继续往上堆。他们想同时做三件事:
第一,把模型的总规模继续做大,抬高能力上限。
第二,控制每次推理真正激活的参数量。因为几 T 的模型如果每个 Token 都激活大量参数,那推理速度肯定会明显下降。
第三,提高有效计算深度。尝试 Loop Transformer 一类的思路,让同一批激活参数经过更多轮计算。这样不需要简单增加激活参数,也可以增加每个 Token 实际经历的计算量。
3、智谱判断,接下来模型可能会出现两条价格曲线。
第一条是,同等智能水平的模型,价格会持续下降。GLM-5.3 Flash 就是在走这条路,用更低的成本提供接近甚至超过上一代旗舰模型的能力。
第二条是,真正能打开新任务边界、明显提高任务成功率的前沿模型,仍然会有溢价,甚至价格还有继续上涨的空间。
所以,现在他们对于模型的定位非常清楚。GLM 5.3 继续探索智能的上限,主要覆盖复杂 Coding、Agent 和高价值任务。GLM-5.3 Flash 则是主打性价比,负责高频、大规模调用。
4、还听到一个有意思的指标叫算力乘数。
简单理解,就是每投入 1 元算力,最后能换回来多少 API 收入。当然,这个算力包括训练和推理两部分。
今年上半年,智谱的算力乘数同比提升了 14 倍。为什么能提高?一方面因为模型变强了,每个 Token 能承担更复杂、更高价值的任务。另一方面 Infra 效率也在提升,完成同样任务需要的成本更低。
感觉这个指标可以一针见血的表达大模型公司的竞争的第一性原理。
5、和国产芯片的结合。GLM-5.3 Flash 上线时,背后已经大规模使用国产芯片集群,6 天跑了 60 多万亿 Token。
接下来更难的是效率和成本。智谱过去半年也明显把更多精力放到了 Infra 上,重新做推理引擎和服务栈,又做了 PD 分离、量化、Layer Split、缓存和通信优化。同样的国产硬件,端到端服务性能相比最初基线提升了 3 倍,单位 Token 推理成本相比年初下降 80%。
6、智谱也毫不避讳的谈到了中国模型公司的算力约束。
他们的思路是尽量从数据、后训练、任务环境和工程效率中弥补差距。
其实这也是前两天硅谷风投 Dimension 总结的,芯片的出口管制反而逼出了国内极强的工程效率文化。
算力有限的时候,可以先 Scale 数据、后训练和任务环境。推理太贵,就继续做架构和 Infra 优化。等这些方向的收益开始下降,再回头扩大基座。
本质上仍然是刚才说的,同样的算力,怎么尽可能换来更多模型能力。
7、另外,智谱也正面回应了大模型怎么商品化的问题。
他们承认,单次 SOTA 本身很难形成长期定价权。今天 Benchmark 第一,可能几周以后就会被追上。在基础的任务上,模型之间已经没什么差距了。
但同时,模型也不会因此完全变成没有差异的商品。真正能拉开差距的,是模型迭代速度、真实任务完成率、单位智能成本,以及能不能进入客户更深的工作流。
尤其任务越长,模型之间的差距反而越容易被放大。回答一道题可能只差几分,但连续跑几个小时的软件工程任务,中间要调用工具、处理失败、重新规划,最后能不能把任务做完,差距会非常明显。
而且模型一旦进入客户的代码库、工具链和内部工作流,周围还会积累 Prompt、Agent Workflow、权限体系、评测标准和各种工程适配。这个时候换模型,也不只是换一个 API 地址,迁移成本会越来越高。
所以智谱的判断是,简单能力会越来越商品化,但真正能完成复杂任务、进入真实工作流的前沿模型,依然会有很强的差异化和定价权。
8、智谱下一步想做的,是让模型开始参与下一代模型的训练。
现在已经能看到一些早期迹象。比如通过 Model vs Model 自动生成、筛选数据,用 Agent 收集任务、搭训练环境、生成 Verifier,甚至直接参与推理系统的优化。
这些能力目前还散落在不同环节里,但方向已经非常明确。过去需要大量人工完成的数据生产、环境搭建和 Infra 优化,未来都可能逐渐交给模型。
唐杰提到,他们希望进一步把这件事贯穿整个训练流程,从 Pre-training、Mid-training 到 Post-training,都让模型参与进来。他把这个方向叫 Fully Self-training,其实就是 OpenAI 提到的 RSI。