1
B 站上线了「AI 无限竞技场」,把站内 up 主对不同大模型的实测聚在一起做了个评测榜。现在专业 Benchmark 已经多到看不过来了,再搞一套民间测评是不是有点噱头?我倒觉得不是。
2
现在公开评测集有一个越来越明显的问题:考题要是重要,模型就会不断「过拟合」。一道题进了 benchmark,模型厂商就会研究它,相关题型、解法乃至原题也迟早会以各种形式进入训练数据。
而 up 主自己临时攒的题反而有个朴素的优势,每次的题库都可以不一样。它不够标准,天然比较难针对性刷榜。
3
另外,真实用户用 AI,本来就不是在做考试。比如这次榜单里面有个「屎山论剑」,让模型去修真实世界里最让程序员头疼的烂代码;有量化 up 主让模型直接模拟交易;有人只用一小段自然语言,让 AI 复刻 B 站首页;还有独立游戏开发者在 12 小时里同时调度几个 AI 做游戏。
这些题不代表着量化的「推理能力 83 分、编程能力 91 分」(我本身也怀疑这种量化的意义,尤其是更细的颗粒度上),同时特别接近用户真正的需求和问题,并且代表着真实的「交付」。交付才更加重要。
Benchmark 上差两三分,有时已经没那么重要了。能力切片和最终交付之间的距离正在动态变化,而且更值得探讨。有的开源小模型能在 Workbuddy 上很好地解决长辈的小问题,让他们用 GPT 最新版本,反而未必有意义。
4
还有一点很有意思:视频本身就是评测结果的一部分。它完整呈现了 AI 的使用过程,而不是黑盒。因此可以回溯,并且理解 AI 目前能做到的程度。单纯看「比上一代提升了 30%」更多是宣传口号,体现不出具体场景。
5
当然,这种测评的缺点也很明显。单个 up 主样本很小,题目主观, 使用方法不一样,都会影响结果。
拿 GPT-6 Astra 的第一名举例,它在目前收录的测试里拿到榜首的次数最多:被测 16 次、拿过 10 次榜首。这个样本量下,出题的类目如何选择、up 主如何选择,会大幅影响结果。
但聚合起来还是有意义。LMArena 本身也是把大量主观选择聚起来,只是这里的颗粒度更粗。
6
B 站本来已经的确是 AI 应用学习和讨论的最重要的中文社区,可能没有之一。
官方的数据是,过去一年 AI 知识内容消费时长同比增长 72%,月均观看 AI 内容的用户超过 1.9 亿。
期待能看到之后的更有意思也更有说服力的榜单。