昨晚 Kimi K3 发布后,我看到参数量真的很意外,K3 的模型参数已经来到了 2.8T,我原以为这个参数规模的开源模型,要等到 Q4 才会有,因为这是很多国内模型下半年最重要的计划,而 Kimi 在 7 月中旬已经训练完成了(通常实际训练完成的时间比发布时间更早,很有可能是在 6 月就训练完成的)。
有人从推理速度和价格推断,Opus 模型的参数量大约是 2.5T,马斯克有一次说大概是 5T,都不一定准确,但大概率就是在 2-5T 之间,GPT 5.6 Sol 也差不多这样,大差不差。
而 Mythos/Fable 明显是 next level 的模型参数量,很多人预估接近 10T,估计下个月发布的 GPT 6 也会差不多。
所以我说,K3 这个参数量,已经达到了 Opus 的级别,代表了中国开源模型追平了今年年初 Opus 4.5/4.6 的参数量。也就是说中国模型距离世界一线开源模型的差距,可能缩短到了半年左右。
训练超大参数模型这件事绝非易事,预训练做大,除了需要很多钱之外,还需要充足的算力是多次的试错,参数量翻1倍,训练成本和风险可能要翻3倍。一次训练崩掉,数千万美元可能就蒸发了。
这就是为什么 K3 的发布,意义是非常重大的,因为在今年上半年, Opus 是一座高山,人人都说超越 Opus,但要真正超越 Opus,2T 以上的参数几乎是必须的,全球能把模型训练到这个规模的公司也是一只手能数的过来的。
Kimi K3 是第一个有望全面对齐甚至在部分领域超越 Opus 的开源模型。
如果真的如此,那 K3 就把大模型两个代差缩短到了一个代差。
这也是为什么我会说,Kimi 接下来的模型,是要照着 Fable 去了。
越过一座山丘,望向下一座更高的山,next level。
对这个模型的真实体验,可以在我的公众号里看到
mp.weixin.qq.com