跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

DeepSeek V4.1 Flash 接入中国国家超算网络

发布当天,模型就上线国家超算互联网中心。用户登录官网,进入模型服务页面,即可调用 V4.1 Flash 的 API。

科技新闻林晓雯发布: 2026年9月23日5 分钟阅读资料来源 2
DeepSeek V4.1 Flash 接入中国国家超算网络

据中国门户网站 IT之家报道,2026年9月10日发布当天,DeepSeek V4.1 Flash 已上线国家超算互联网中心。用户登录官方网站,进入模型服务板块,就能打开 V4.1 Flash 的 API 调用接口。模型不只出现在商业供应商那里,也进入了公共基础设施。

IT之家在报道中介绍了模型本身,说法与厂商的模型卡一致:采用混合专家(MoE)架构,共 5520 亿参数;新的因果编码器-解码器结构;输入与输出不对称,输入侧 80 亿激活参数,输出侧 160 亿激活参数;成本明显低于规模相近的同类模型。该门户还指出,经过更大规模的强化学习训练后,模型在对比测试中超过了多个对手,其中包括旗舰 DeepSeek V4 Pro。

对公共基础设施来说,最关键的是内存。据 IT之家,V4.1 Flash 把 HBM 需求降到上一代的四分之一,SSD 需求降到八分之一。智能体场景里,缓存命中的开销通常占账单很大一部分。KV cache 压缩后,这类任务的运行成本会直接下降。共享基础设施上,这一点最重要。

为什么这不只是一条营销消息

这一决定的背景,见 CorCom 于 2026 年 9 月 7 日发布的独立分析。来自瑞士隆奥银行(Banque Lombard Odier)的作者认为,中国厂商建立优势不只靠模型价格,也靠能源供应和算力上线速度。美国生态在最难的任务、云基础设施和自有数据上仍占优势,产业链中的价值则逐步向半导体和大规模运营商转移。

在这一格局中,公共超算网络是技术政策工具。它让中国企业和机构不用中间商,也不依赖境外云,就能快速调用模型。DeepSeek 并非这里唯一的供应商。同一时期,中国行业媒体上还出现了其他国产竞争模型,例如 GLM-5.3 系列和 Moonshot 的 Kimi。不过,模型能进入这一网络本身就说明,国产模型被视为关键基础设施的一部分,而不只是商业产品。

对终端用户来说,差别很实际。部署在公共网络中的模型沿用 DeepSeek 的高峰与非高峰时段计价,休息日提交的批处理任务,费用只有高峰时段的一半。HBM 与 SSD 需求低,再叠加更便宜的夜间价格,单位成本就压了下来,只在西方商业云中运行的同类模型达不到这个水平。中国行业媒体如今围绕 V4.1 Flash 的竞争,不在测试成绩,而在每百万 token 的价格和高峰期的算力可用性。这并非偶然。

不过解读时仍需谨慎。模型出现在国家网络中,并不意味着其底层基础设施全部来自中国。显卡仍大量依赖进口,中国研究机构也在密集研发国产加速器方案。因此,今天的公共超算网络首先是接入与分发层,而不是硬件完全自主的证明。

评论 0

资料来源

2
  1. 01DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  2. 02AI, la Cina sfida i big Usa sui prezzi (CorCom)IT

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。