昨晚朋友转发给我一条视频,说好久没看到这么离谱的模型测评了.......
我点开一看,是一个UP主把GPT-6和Fable 5.1拉到一起,喂给它们一坨屎山代码,让它们比比谁能先把这堆废墟修好。
测评结束,UP主的结论是,GPT-6确实更强了一些,但稳定性怎么样,还得继续观察。
这条视频评论区也是很多人才,很多人都在玩梗哈基米误入神仙打架现场🥹
顺着这条视频摸过去,我发现它出自B站刚刚上线的新榜单,叫「AI无限竞技场」。
这是一个不看跑分、只看实战的AI擂台。
官方不出题,题目全都来自B站各个分区的UP主,有搞编程的、玩梗的、研究博弈论的......
比如有个UP,把七个当前最火的大语言模型,直接扔进了一个虚拟的“囚徒困境”里,让它们在面临合作与背叛时自己做决定。
有的模型选择互相信任,有的优先自保,甚至还有的在关键时刻直接背刺队友。
我随着全站UP主不断开放报名,题库变得越来越刁钻,竞技场的排名也在实时更新。
首期榜单里GPT-6拿了榜首,国产模型也占了好几个席位。
但排名先后其实不是重点。
如果你也对到底该用哪个AI感到困惑,现在就有了一个极其庞大的活体参考库。你可以在UP主真实的反馈中,弄清楚不同模型的能力边界。
你的痛点,大概率已经有UP主把它变成了考题,并且替你把市面上的主流模型都挨个测试了一遍。
过去两年,各种大模型评测榜单成了行业的KPI。
很多厂商为了刷分,把公开的评测题目当成训练资料反复喂给模型,结果就是模型变得越来越应试。
OpenAI今年就停止使用SWE-bench Verified衡量前沿模型的编程能力,因为其中存在测试缺陷和训练数据污染。看起来非常标准的榜单,也可能随着模型进步而失去参考价值。
而在这个AI无限竞技场里,它根本不给任何模型刷题的机会,毕竟每一道题都是UP主临时想出来的,这套机制天然就把那些“应试型选手”筛掉了。
现在你打开B站,看着UP主拿着最普通的问题去为难那些号称超越人类的模型,你会发现,AI有它擅长的,也有它笨拙的。有它聪明的瞬间,也有它翻车的时刻。
而真正好用的智能生产力,也根本不需要你小心翼翼地去适应它。
而且AI无限竞技场接下来会持续开放报名,榜单也会实时更新。每加入一批创作者,里面就可能多出一些以前没人想过的题目。
评测的权力,早就该回到用户手里了。