跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

DeepSeek V4.1 Flash 正式发布:5520 亿参数、原生多模态、定价下调

北京时间 9 月 10 日,DeepSeek 正式发布 V4.1 Flash 模型,它采用 5520 亿参数的 MoE 新结构,输入只激活 80 亿参数,并把 KV Cache 对 HBM 的需求降到上一代四分之一。

人工智能与模型新闻王雅琴发布: 2026年9月10日5 分钟阅读资料来源 3
DeepSeek V4.1 Flash 正式发布:5520 亿参数、原生多模态、定价下调

北京时间 2026 年 9 月 10 日,DeepSeek 正式 发布 V4.1 Flash 模型。官方 称 它 是 全新 模型 结构 系列 中 最小 尺寸 的 一款,具备 原生 多模态 视觉 理解 能力。模型 已 同步 上线 DeepSeek API,调用 时 把 模型名 改成 deepseek-flash 即可。

结构 上,V4.1 Flash 是 5520 亿 参数 的 MoE 模型,采用 全新 的 Causal-Encoder-Decoder 架构。它 的 输入 与 输出 不对称:输入 阶段 只 激活 80 亿 参数,输出 阶段 激活 160 亿 参数。官方 表示,新 结构 的 设计 初衷 是 能力 上限 更高、推理 速度 更快、吞吐 更大,并且 可以 扩展 到 参数 规模 更大 的 模型。

缓存 是 这次 更新 的 另一个 重点。相比 上一代,V4.1 Flash 的 KV Cache 对 HBM 的 需求 减少 到 四分之一,对 SSD 的 需求 减少 到 八分之一。官方 说,在 Agent 使用 场景 中,缓存 命中 的 费用 往往 占比 很高,压缩 KV Cache 能 大幅 降低 这 类 任务 的 成本。官方 还 给 出 一条 长期 曲线:相对 初代 模型,KV Cache 已经 缩小 了 437 倍。

价格 同步 调整。空闲 时段,输入 缓存 命中 为 每 百万 Token 0.02 元,缓存 未命中 为 每 百万 Token 1 元,输出 为 每 百万 Token 4 元;高峰 时段 各项 价格 是 空闲 时段 的 两倍。新 价格 于 2026 年 9 月 10 日 12 时 起 生效。

开源 方面,模型 权重 以 MIT 许可 发布。官方 称 会 全力 支持 开源 社区 做 推理 适配,并 尝试 各种 方式 扩大 部署 范围;如果 有 大规模 部署 需求 且 具备 相应 资源,可以 与 团队 联系。

旧 版本 的 去向 也 一并 公布。V4 Flash 与 V4 Flash Vision Exp 已 下线,出于 兼容 考虑,模型名 deepseek-v4-flash、deepseek-v4-flash-vision-exp 暂时 路由 到 V4.1 Flash。官方 还 计划 有序 下线 V4 Pro,相关 请求 在 一定 时间 后 将 全部 路由 到 V4.1 Flash,并 按 V4.1 Flash 单价 计费。官方 合作 伙伴 WorkBuddy(含 CodeBuddy)与 OpenCode 已 全量 接入。

部署 与 生态 方面,V4.1 Flash 支持 vLLM、SGLang 与 TensorRT 等 主流 推理 框架,提供 FP8、BF16、GPTQ、AWG、GGUF 等 量化 格式,上下文 长度 最高 100 万 Token。这 意味 着 国内 外 团队 可以 在 既有 推理 栈 上,以 较 低 的 改造成本 接入 新 模型。

评论 0

资料来源

3
  1. 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
  2. 02DeepSeek-V4.1-Flash ReleaseEN
  3. 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。