后训练为什么突然变得容易了
我自己的看法是: 第一,可用于后训练的开源模型数量大大增加,且开源与闭源模型的差距在缩小,尤其是国内公司卷得飞起,通通都开源。
第二,更重要的原因是开源模型的智能水平跨过了一个分水岭,本身的泛化能力足够强了。如果去年这时候用 R1 做后训练,即便拥有现在的后训练基础设施,也没办法很好地应用到具体业务中,因为业务场景千变万化,底座推理模型本身需要具备足够被泛化的智能,而这在上一代还不够明显。特别是大多数应用公司训不了太大的模型,但现在一个 27B 的千问,至少在 Benchmark 上就能比肩 Opus 4.6,这个压缩水平是非常夸张的。
为什么这个原因很重要?是因为如果用一个本身基础智能水平不到位的模型来做后训练,其实对AI 应用公司有更高的要求:我需要更多的数据,而且它只能用于更少的场景。假设一家 AI 应用公司现在有 20 个场景在用大模型,过去做后训练之后可能只能替换 4 个场景,但现在能替换的场景变成了 16 个,我做一次后训练的经验,可以更多地被复用了。也就是说,这个 ROI 在过去是很不值得的,但现在变得值得了。各种原因叠加导致后训练的可达性提高了,复用性也提高了,进而让很多 AI 应用公司开始做这个选择。
同时,现在的后训练生态设施也更完善了,像 Cursor、Harvey 也是找其他公司帮忙做后训练。
所以我感觉这不一定是个轮回(大模型进步快就靠大模型、进步慢了就自己搞后训练),而是从这个时间点开始,后训练就成了一种固有的选择,不会再倒退回去了。当基础智能跨过泛化门槛,就能满足很多低阶需求;这些低阶需求不需要更顶级的模型,并且它们还在不断向大众扩散。