仔细回去研读了K3的技术报告,尤其里面关于模型拟合和泛化能力的内容,之前看了很多分析,都讲的都云里雾里的,现在感觉大概懂了一点
就好比大模型是一个运动能力极强的人,但是精力是有限的,本来这个人,做各种运动类型(篮球,跑步,跳远,足球等等)都能做到80分左右
然后你现在把大模型放在一个专门训练篮球的地方,有各种配套和工具,那么他打篮球的能力就会变的越来越强,学习过程中也会消耗他的精力,然后打篮球就能做到95分
那么当你再把大模型放出来,去干其他的“运动”类型的时候,反而能力会下降,就只能做到70分了,因为相关的配套工具不一样,并且学习精力已经被篮球极大的消耗掉了
这些配套/工具/提示词,其实就是harness工具,所以如果要提升大模型在各种环境的智能和产出能力,选择方向之一是去适配尽可能多的harness环境,这样子就会得到相应稳定的产出能力
另外一种思路,就是精简harness环境,这就完全贴合了最近PI 框架和DSH 框架的逻辑了,结合之前Claude大范围的精简系统提示词,也发现了模型性能并没有下降,说明这个方向是对的
这么来看的话,harness环境应该会收敛,而不是百花齐放,因为harness环境的目的是为了提高模型产出,如果反倒压制了模型产出,这就得不偿失了,那么核心环境就要简单,配套就应该是即插即用,随意可弃的,而不是无限的叠加与优化