@葬愛咸鱼 今天给视频模型整了一个meme bench我觉得也很有意思,至少角度非常刁钻。
他精选了50个短视频热梗,比如华强买瓜之类,提取出提示词让视频模型做题,然后给网吧老哥和大学生发红包,让他们盲测对比,也就是Arena AI的那套2选1PK机制,最后统计出动态的ELO积分和排名。
在这套测试集里,H3目前的评分是最高的,甚至Seedance 2.0都比2.5还高,是不是有点反直觉?
他也解释了,meme bench的目的在于众测视频成片是否在走群众路线,也就是所谓的「接地气」,传统意义上视频能力表现,在下沉市场的用户看来未必算是加分项。
而你觉得六根手指、局部变形是硬伤,但可能刷短剧、看直播的大多数人根本不在乎,他们只看视频内容是不是整活到位了。
包括Seedance 2.0的评分高于2.5,这个我在前几天的测试里也有隐约察觉到,在一些高识别度的段子复刻层面,Seedance 2.0的工业化已经相当成熟了,反而是Seedance 2.5会自作主张的跳出模板,想做更多的事。
有更强的自主创作意识,理论上是好事,但同时也意味着失败率的提升,会拖累meme bench那套标准的评分。
再就是,和语言模型的迭代一样,不能简单的把新一代模型理解为旧模型的升级,它们的训练路径,差异性远远高于重叠性,所以Seedance 2.5也绝对不是一个画质更好、更惊喜的Seedance 2.0,在实操上你得完全把它当成一个全新的模型。
总之,前沿级视频模型的价格还是太不友好了,经不起沉迷,我甚至看到有人用最便宜的480P出片,然后再搬到第三方平台超分放大,就为省点费用⋯⋯
只能说这个世界还是太缺梁圣了啊!