跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

DeepSeek-V4.1-Flash:PCIe 显卡上吞吐量提升近七倍

一个中国团队报告称,DeepSeek-V4.1-Flash 在无 NVLink 的 PCIe 系统上吞吐量大幅跃升。这个案例说明,软件里还藏着多少性能。

科技分析王雅琴发布: 2026年9月24日6 分钟阅读资料来源 2
DeepSeek-V4.1-Flash:PCIe 显卡上吞吐量提升近七倍

QbitAI(量子位)2026 年 9 月 24 日发布了一篇实践报告,主角是中国公司 METASTONE(是石科技)。团队在八块 GPU 组成的系统上运行 DeepSeek-V4.1-Flash。这些 GPU 只通过 PCIe 连接,没有 NVLink,也就没有这类模型通常依赖的高速耦合。

起点与终点

作者给出的第一天标准值是每秒 1.932 个 token 的输入吞吐量。第一轮优化做了内核修正,为基于 sparse attention 的预处理选了更快的路径,更换 FP8 dense GEMM 内核,并加速 PCIe IPC 路径。吞吐量随即达到每秒 5.850 个 token。之后团队又做了 attention 算子融合,缩短推测解码中的草稿,让计算与通信重叠,并调整显存参数。系统最终达到每秒 13.274 个 token,约为起始值的 6.87 倍。据报告称,最高一百万 token 的上下文长度得以保持。

对比测量表明这不是孤例。DeepSeek-V4-Flash 的输入吞吐量从每秒 14.546 个 token 升至 22.584 个 token,倍数为 1.55。模型 GLM 5.3 从每秒 3.236,78 个 token 提升至 6.222,72 个 token。

为什么这对德国有意义

这份报告有两个层面。第一个是技术层面:模型跑在没有高速互连的硬件上,性能优势的很大一部分不是丢在硬件上,而是丢在显存与通信路径上。谁优化这些路径,拿到的是倍数,不是百分点。

第二个层面涉及运营。DeepSeek-V4.1-Flash 于 2026 年 9 月 10 日发布,采用 Mixture-of-Experts 结构,共 5520 亿参数,prefill 阶段激活 80 亿参数,decode 阶段激活 160 亿参数。KV-Cache 为每个 token 890 Byte,约为 V4-Flash 数值的四分之一。该模型采用 MIT 许可证,可处理每张图最多 384 token 的图像,可通过 vLLM、SGLang 或 TensorRT 部署;支持 FP8、BF16、GPTQ、AWQ 和 GGUF。

METASTONE 自称管理超过 20.000 Petaflops 算力,运营十多个智能数据中心和两个国家超级计算中心;三项 Gordon Bell 奖被列为参考。对于本地推理,这份报告真正的信息是价值创造发生了转移:决定性的不是新购硬件,而是针对具体模型驾驭显存层级与并发的能力。

不换新硬件就快六倍,从每秒 1.932 到 13.274 个 token 的差距就是软件。

评论 0

资料来源

2
  1. 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
  2. 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。