即刻App年轻人的同好社区
下载
App内打开
莫唯书Mark
4天前
真实世界的智能不可能只靠文字堆出来

DeepSeek今天在官方交流群里放出了一个内测模型,V4.1 Flash的中间版本,两天后过期。

官方没开发布会,没晒跑分,一群开发者改个模型名就开始测了。而这次内测真正的信号,藏在“原生多模态”这几个字里。

DeepSeek之前已经发过多模态模型,8月21日上线的V4-Flash-Vision-Exp是一个实验性质的视觉理解模型,能同时接受图片和文本输入。但那个版本的处理方式是把V4-Flash和Vision-Exp并列成两个独立的模型,视觉能力是外挂的。就像一个后装的车载屏幕,能用,但不是车的一部分。

有意思的是之前梁文锋在一场投资闭门会上明确说过多模态在他看来“只是一个组件,不是主线和智能本身”,在那个多模态几乎成了大模型出厂标配的周期里,这种表态显得有些格格不入。但他也给自己留了一个口子说“我们应该会上相关的模型,就是V4的后续版本会支持原生的多模态”, V4.1 Flash就是那个口子的兑现版。

那为什么要做原生多模态? 因为物理世界本身就是多模态的, 纯文本模型对“红”的理解靠的是所有提到“红”的文字形成的语义网络。它能通过上下文知道红灯代表停止、红旗代表某种文化符号,但这是二手的、间接的。就像一个人通过阅读学会了游泳的所有原理但从来没下过水,他能在书面上完美解释游泳的力学分解,但他对“水”的认知是残缺的。

文本模型对世界的理解也处于同样的状态,它能读懂“水流过障碍物时产生涡旋”的每一个字,但永远无法像亲眼看到涡旋脱落那样在直觉层面建立对流体行为的物理感,这种认知维度的差距不是靠知识量就能弥补的。

过去几年的主流做法是用文本基座加视觉模块的拼装路线,语言模型负责思考,视觉模块负责看图,中间用投影层连接。这种架构能刷出不错的评测分数,但它有一个致命缺陷是视觉编码器学到的特征在映射到语言空间的过程中已经损失了大量空间关系、纹理细节和因果直觉层面的信息。

原生多模态的意义就在这里,它不再区分视觉模块和语言模块,直接让图像和文字在同样的参数空间里迭代,在每一层互相塑造。

梁文锋说AGI只有一条主线就是模型能力本身,这句话没有错。但一个只能通过二手文字理解世界的模型,能力再强也是有天花板的。物理世界的真实结构由图像、声音、空间关系交织而成,文本只是其中一种表征。如果AGI的目标是达到或超越人类的智能水平,那它必须从根本上具备多模态的认知结构。

更值得细品的是梁文锋的另一句话,他曾说“当站在一个技术的高位上来做相对低一级别的技术是降维打击,产品是在AGI路上的副产物”。 这个判断背后的假设是AGI是一个可以被独立追求的技术目标,产品只是这个目标达成之后自然流出来的结果。

但真实世界的反馈机制不是这样的,一家AI公司每天处理的上亿次用户请求不只是用算力换钱。每一次提示词、每一次纠偏、每一次用户关掉对话重新提问都是对模型行为模式的校准信号,模型就是在这些信号里一步步逼近“更智能”的方向。

这些信号从哪里来?从产品里来。没有产品把模型暴露给真实用户就无法获得这些信号,一个纯在实验室里迭代的模型无论堆多少算力,学到的永远是被标注过的旧知识,它学不到真实世界里那些模糊的、未被标记的、反直觉的需求。

“副产物”思维的问题就在这里,它把产品当成了出口。但产品同时也是入口,是真实世界反馈进入技术系统的唯一通道。没有产品,技术就失去了进化的土壤。

当然以DeepSeek一贯的务实调性大概率不会高调宣扬“我们调整了方向”,而是默默把新能力塞进V4.1 Flash里让开发者去测,让反馈和价格来说话。

当原生多模态正在从一个可选项变成必选项,背后代表的判断是真实世界的智能不可能只靠文字堆出来。

这个判断既会让很多现有的技术路线显得过时,也会让很多曾经正确的话听起来像自我安慰。
33

来自圈子

圈子图片

AI探索站

118479人已经加入