八张 PCIe 卡,输入吞吐量提升 6.87 倍:软件补上硬件差距
中国公司是石科技把八张 PCIe 卡上 V4.1-Flash 的输入吞吐量从每秒 1932 个 token 提到 13274 个,模型和硬件都没换。

“模型能跑起来”和“模型能跑出像样的吞吐量”,今天往往差得比两代显卡还远。量子位报道了是石科技(METASTONE)的一个案例。这家公司只做优化,不改模型结构,也不换硬件。
起点是这类卡常见的问题:卡间没有高速互联,也不在主流框架的官方支持矩阵里。框架不报错,它悄悄绕开加速路径,退回通用的慢速实现。八张纯 PCIe 卡上,V4.1-Flash 在发布当天的基线版本里输入吞吐量是每秒 1932 个 token。团队补齐缺失的算子内核,修好稀疏注意力的快速预处理路径,换掉稠密 GEMM 上偏慢的 FP8 内核,再扩大 PCIe 上快速 IPC 通信的覆盖范围。结果升到每秒 5850 个 token。这是第一阶段,他们叫它“模型与硬件的协同”。
第二阶段:通信、显存、缓存
真正的工作从这里才开始。工程师把注意力和投影算子融合到一起,把计算藏进集合通信的空隙里,按 PCIe 的真实带宽重写通信逻辑。预填充阶段和生成阶段的并行策略,他们分开调。最后再动态调节静态显存占比、KV 缓存容量和显存复用机制。输入吞吐量从 5850 升到每秒 13274 个 token,合计 6.87 倍,上下文仍然支持到一百万 token。
同一套方法在其他模型上也管用。DeepSeek-V4-Flash 的输入吞吐量从每秒 14546 升到 22584 个 token,1.55 倍。GLM5.3 从 3236.78 升到 6222.72,1.92 倍。首个 token 的 P95 延迟从 141.6 秒降到 46.6 秒,上下文上限从 27 万扩展到 105 万 token。仅第一阶段,就在几个模型上带来 20% 到 33% 的增幅。
相对顶级硬件是什么水平
作者如实给出了参照。同样的并发水平下,B300 的输入吞吐量大约是这台八卡机器的 4.9 到 5.6 倍,比较用的是 DeepSeek-V4-Flash;GLM-5.3 上的比值是 3.5 到 4.7 倍。差距没有消失,但明显小于只比规格时会得到的印象。视频生成上,基于 MiniMax H3 模型,用参考图生成 15 秒视频的速度提升了 2.48 倍。这套方法也在国产 GPU 上验证过。那里需要显式打开 NSA 稀疏注意力,并关掉为 NVIDIA 和 AMD 平台写的机制。
有些比较不看峰值规格,只看机房里真实运行的硬件上每个 token 的成本。对这些比较来说,这是一个不错的参照。
资料来源
2- 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
- 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。