跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

DeepSeek V4.1 Flash:5520 亿参数,编码器与解码器不对称

2026 年 9 月 10 日发布。这个多模态 Mixture-of-Experts 模型有 5520 亿参数,读入 token 时激活 80 亿,生成回答时激活 160 亿。变的是架构,不只是规模。

人工智能与模型分析王雅琴发布: 2026年9月26日5 分钟阅读资料来源 3
DeepSeek V4.1 Flash:5520 亿参数,编码器与解码器不对称

2026 年 9 月 10 日,DeepSeek 发布 DeepSeek-V4.1-Flash。这是一个多模态 Mixture-of-Experts 模型,基础参数 5520 亿,上下文最长 100 万 token。这不是例行更新:架构变了,注意力缓存的计算方式也变了。按模型卡的说法,V4.1-Flash 在预填充(prefill)阶段每个 token 只激活 80 亿参数,生成回答(decode)时激活 160 亿。

成本刻意分摊不均

结构核心是 Causal Encoder-Decoder(CED)架构:40 层 Transformer 分成 20 层因果编码器和 20 层解码器。经典模型里,解码器每一层都各自算一份隐藏状态;这里解码器的全局 KV cache 由编码器的最终隐藏状态投影而来。80 亿对 160 亿的不对称是设计出来的。agent 负载主要花在读取长上下文上,所以厂商优先优化输入侧。

MoE 层有 1 个共享专家和 384 个路由专家,每个 token 选 6 个。模型卡还列出几个组件:Single-Pass mHC,改过的残差流混合,配 Mega-mHC 内核;Engram,一个 1960 亿参数的条件记忆,靠 token 检索稀疏调用;以及 DSpark,半自回归草稿生成加置信度调度验证的推测解码。

45 万亿 token,视觉从第一步就参与

模型从零开始在 45 万亿 token 的多模态语料上训练。稀疏注意力在 6.4 万 token 的序列长度上训练,上下文扩到 100 万 token 是到 34 万亿 token 阶段才做的,也就是训练大半程之后。预训练之后走标准流程:先 SFT,再强化学习,最后 on-policy 蒸馏。厂商说改的不是算法而是数据:任务和 agent 环境被大规模自动合成。

图像输入由 DeepSeek-ViT 编码器处理,从零训练,用了 2D-RoPE 和 3×3 pixel-unshuffle 下采样,再加两层 MLP 投影器。图像和文本从预训练一开始就进同一个空间,不是后期接上去的适配器。

Hugging Face 上的模型卡记录最近一个月 621,396 次下载,许可为 MIT。官方准备了 vLLM、SGLang、TensorRT 和 Docker Model Runner 的部署变体,以及 FP8、BF16、GPTQ、AWG 和 GGUF 量化。中文站点 IT之家 和模型卡盯的是同一点:在 agent 场景里,账单大部分出在缓存命中上,把 KV cache 压得更小,直接等于降低一次任务的成本。DeepSeek 还宣布下线旧的 deepseek-v4-flash 和 deepseek-v4-flash-vision-exp,并把原本发往 V4-Pro 的请求按 V4.1-Flash 的价格转过去。

评论 0

资料来源

3
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。