DeepSeek V4.1 Flash 正式发布:5520 亿参数、原生多模态、定价下调
北京时间 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型,它采用 5520 亿参数的 MoE 新结构,输入只激活 80 亿参数,并把 KV Cache 对 HBM 的需求降到上一代四分之一。

北京时间 2026 年 9 月 10 日,DeepSeek 正式 发布 V4.1 Flash 模型。官方 称 它 是 全新 模型 结构 系列 中 最小 尺寸 的 一款,具备 原生 多模态 视觉 理解 能力。模型 已 同步 上线 DeepSeek API,调用 时 把 模型名 改成 deepseek-flash 即可。
结构 上,V4.1 Flash 是 5520 亿 参数 的 MoE 模型,采用 全新 的 Causal-Encoder-Decoder 架构。它 的 输入 与 输出 不对称:输入 阶段 只 激活 80 亿 参数,输出 阶段 激活 160 亿 参数。官方 表示,新 结构 的 设计 初衷 是 能力 上限 更高、推理 速度 更快、吞吐 更大,并且 可以 扩展 到 参数 规模 更大 的 模型。
缓存 是 这次 更新 的 另一个 重点。相比 上一代,V4.1 Flash 的 KV Cache 对 HBM 的 需求 减少 到 四分之一,对 SSD 的 需求 减少 到 八分之一。官方 说,在 Agent 使用 场景 中,缓存 命中 的 费用 往往 占比 很高,压缩 KV Cache 能 大幅 降低 这 类 任务 的 成本。官方 还 给 出 一条 长期 曲线:相对 初代 模型,KV Cache 已经 缩小 了 437 倍。
价格 同步 调整。空闲 时段,输入 缓存 命中 为 每 百万 Token 0.02 元,缓存 未命中 为 每 百万 Token 1 元,输出 为 每 百万 Token 4 元;高峰 时段 各项 价格 是 空闲 时段 的 两倍。新 价格 于 2026 年 9 月 10 日 12 时 起 生效。
开源 方面,模型 权重 以 MIT 许可 发布。官方 称 会 全力 支持 开源 社区 做 推理 适配,并 尝试 各种 方式 扩大 部署 范围;如果 有 大规模 部署 需求 且 具备 相应 资源,可以 与 团队 联系。
旧 版本 的 去向 也 一并 公布。V4 Flash 与 V4 Flash Vision Exp 已 下线,出于 兼容 考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 暂时 路由 到 V4.1 Flash。官方 还 计划 有序 下线 V4 Pro,相关 请求 在 一定 时间 后 将 全部 路由 到 V4.1 Flash,并 按 V4.1 Flash 单价 计费。官方 合作 伙伴 WorkBuddy(含 CodeBuddy)与 OpenCode 已 全量 接入。
部署 与 生态 方面,V4.1 Flash 支持 vLLM、SGLang 与 TensorRT 等 主流 推理 框架,提供 FP8、BF16、GPTQ、AWG、GGUF 等 量化 格式,上下文 长度 最高 100 万 Token。这 意味 着 国内 外 团队 可以 在 既有 推理 栈 上,以 较 低 的 改造成本 接入 新 模型。
资料来源
3- 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。