DeepSeek V4.1 Flash:5520 亿参数,编码器与解码器不对称
2026 年 9 月 10 日发布。这个多模态 Mixture-of-Experts 模型有 5520 亿参数,读入 token 时激活 80 亿,生成回答时激活 160 亿。变的是架构,不只是规模。

2026 年 9 月 10 日,DeepSeek 发布 DeepSeek-V4.1-Flash。这是一个多模态 Mixture-of-Experts 模型,基础参数 5520 亿,上下文最长 100 万 token。这不是例行更新:架构变了,注意力缓存的计算方式也变了。按模型卡的说法,V4.1-Flash 在预填充(prefill)阶段每个 token 只激活 80 亿参数,生成回答(decode)时激活 160 亿。
成本刻意分摊不均
结构核心是 Causal Encoder-Decoder(CED)架构:40 层 Transformer 分成 20 层因果编码器和 20 层解码器。经典模型里,解码器每一层都各自算一份隐藏状态;这里解码器的全局 KV cache 由编码器的最终隐藏状态投影而来。80 亿对 160 亿的不对称是设计出来的。agent 负载主要花在读取长上下文上,所以厂商优先优化输入侧。
MoE 层有 1 个共享专家和 384 个路由专家,每个 token 选 6 个。模型卡还列出几个组件:Single-Pass mHC,改过的残差流混合,配 Mega-mHC 内核;Engram,一个 1960 亿参数的条件记忆,靠 token 检索稀疏调用;以及 DSpark,半自回归草稿生成加置信度调度验证的推测解码。
45 万亿 token,视觉从第一步就参与
模型从零开始在 45 万亿 token 的多模态语料上训练。稀疏注意力在 6.4 万 token 的序列长度上训练,上下文扩到 100 万 token 是到 34 万亿 token 阶段才做的,也就是训练大半程之后。预训练之后走标准流程:先 SFT,再强化学习,最后 on-policy 蒸馏。厂商说改的不是算法而是数据:任务和 agent 环境被大规模自动合成。
图像输入由 DeepSeek-ViT 编码器处理,从零训练,用了 2D-RoPE 和 3×3 pixel-unshuffle 下采样,再加两层 MLP 投影器。图像和文本从预训练一开始就进同一个空间,不是后期接上去的适配器。
Hugging Face 上的模型卡记录最近一个月 621,396 次下载,许可为 MIT。官方准备了 vLLM、SGLang、TensorRT 和 Docker Model Runner 的部署变体,以及 FP8、BF16、GPTQ、AWG 和 GGUF 量化。中文站点 IT之家 和模型卡盯的是同一点:在 agent 场景里,账单大部分出在缓存命中上,把 KV cache 压得更小,直接等于降低一次任务的成本。DeepSeek 还宣布下线旧的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp,并把原本发往 V4-Pro 的请求按 V4.1-Flash 的价格转过去。
资料来源
3- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。