DeepSeek-V4.1-Flash:PCIe 显卡上吞吐量提升近七倍
一个中国团队报告称,DeepSeek-V4.1-Flash 在无 NVLink 的 PCIe 系统上吞吐量大幅跃升。这个案例说明,软件里还藏着多少性能。

QbitAI(量子位)2026 年 9 月 24 日发布了一篇实践报告,主角是中国公司 METASTONE(是石科技)。团队在八块 GPU 组成的系统上运行 DeepSeek-V4.1-Flash。这些 GPU 只通过 PCIe 连接,没有 NVLink,也就没有这类模型通常依赖的高速耦合。
起点与终点
作者给出的第一天标准值是每秒 1.932 个 token 的输入吞吐量。第一轮优化做了内核修正,为基于 sparse attention 的预处理选了更快的路径,更换 FP8 dense GEMM 内核,并加速 PCIe IPC 路径。吞吐量随即达到每秒 5.850 个 token。之后团队又做了 attention 算子融合,缩短推测解码中的草稿,让计算与通信重叠,并调整显存参数。系统最终达到每秒 13.274 个 token,约为起始值的 6.87 倍。据报告称,最高一百万 token 的上下文长度得以保持。
对比测量表明这不是孤例。DeepSeek-V4-Flash 的输入吞吐量从每秒 14.546 个 token 升至 22.584 个 token,倍数为 1.55。模型 GLM 5.3 从每秒 3.236,78 个 token 提升至 6.222,72 个 token。
为什么这对德国有意义
这份报告有两个层面。第一个是技术层面:模型跑在没有高速互连的硬件上,性能优势的很大一部分不是丢在硬件上,而是丢在显存与通信路径上。谁优化这些路径,拿到的是倍数,不是百分点。
第二个层面涉及运营。DeepSeek-V4.1-Flash 于 2026 年 9 月 10 日发布,采用 Mixture-of-Experts 结构,共 5520 亿参数,prefill 阶段激活 80 亿参数,decode 阶段激活 160 亿参数。KV-Cache 为每个 token 890 Byte,约为 V4-Flash 数值的四分之一。该模型采用 MIT 许可证,可处理每张图最多 384 token 的图像,可通过 vLLM、SGLang 或 TensorRT 部署;支持 FP8、BF16、GPTQ、AWQ 和 GGUF。
METASTONE 自称管理超过 20.000 Petaflops 算力,运营十多个智能数据中心和两个国家超级计算中心;三项 Gordon Bell 奖被列为参考。对于本地推理,这份报告真正的信息是价值创造发生了转移:决定性的不是新购硬件,而是针对具体模型驾驭显存层级与并发的能力。
不换新硬件就快六倍,从每秒 1.932 到 13.274 个 token 的差距就是软件。
资料来源
2- 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
- 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。