Deepseek-V4.1-Flash 这个模型
感觉是 Deepseek 的阶段性成果的集大成者了:
这次把此前公开论文里的技术几乎都塞到这个模型里了。
🔹mHC 流形约束超连接:这次升级成 Single-Pass mHC,激活内存流量减半
arxiv.org🔹Engram 条件记忆:把"记忆"从"计算"里解耦的稀疏查表模块,196B 参数,放在第 1、14 层,推理时从主机内存 RDMA 预取
arxiv.org🔹DSpark 投机解码:半自回归草稿 + 置信度调度验证,3 层草稿器一次前向并行算 5 个草稿位置
arxiv.org🔹DeepSeek-ViT:从零训的 ViT 补齐原生多模态(2D-RoPE、3×3 pixel-unshuffle 把视觉 token 压到 1/9)。之前发布了论文,但后来又悄悄删除了。
当然也有不少新东西,这次新增的主架构:
🔸CED 因果编解码器:40 层切成 20 层编码器 + 20 层解码器,解码器的全局 KV 不再自己算,直接用逐层投影权重从编码器末层隐状态投影出来。所以读输入只跑 20 层(8B 激活),写输出要跑 40 层(16B)。
类似 YOCO:
arxiv.org🔸CSA2 压缩稀疏注意力:前代 CSA 的升级版。每层静态指定 Full / Reindex / Reuse 三种模式,跨层共享 main KV 和 indexer K,并可复用 Top-K 稀疏索引。全局 KV 压到 890 bytes/token,约 V4-Flash 的 1/4。
同源思路见 IndexCache:
arxiv.org🔸 SWA Bounded Replay:滑动窗口有界重放,部署层的优化。使得持久化 KV 占用进一步降到 V4-Flash 的约 1/8。
这次的论文真的看爽了了
新模型介绍:
www.deepseek.com技术报告:
huggingface.co