到底什么场景是需要 jev 这种高频,实时,决策,人类互动的?
最近抖音热门歌曲+动漫剪辑看的比较多,这种 mad,以及漫剧宣发这种有大量的 ai 素材,可能要从近万个镜头中去寻找,并拼接在一起,每个寻找还需要一系列决策,是否插入这个,是否去掉原声,是否添加特效,转场等。
于是做了个尝试:
让 类jev的模型(本地gemma4魔改版)去驱动剪辑,根据前面镜头和故事线的上下文来从6000+镜头在5090上以80~500ms(取决于传入多少图片)决策出下一个镜头,并以合适的方式插入进来踩点。
用简单的打标测试效果还可以(人工审查其实有的标识不太好),后续通过优化打标清洗准备镜头的精度,选择/微调更有节奏理解的多模态决策模型,效果可预见的会更好。
以及在单纯的素材检索和召回场景,因为有上下文的传入,可以对于“凸出晓美焰守护的决心”这种抽象的情绪场景,决策出在rag排序中靠后,但是更贴合前面镜头的片段。
挑选了魔法少女小圆作为例子,gemini3.8flash对用户输入和音频进行故事线的理解编写,然后 jev 和rag配合执行66个问题的三轮决策去判断6000+镜头使用哪个,怎么样插入,不断往后。
哈基米幻觉还是有点多,再改改harness发出来