跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

八张 PCIe 卡,输入吞吐量提升 6.87 倍:软件补上硬件差距

中国公司是石科技把八张 PCIe 卡上 V4.1-Flash 的输入吞吐量从每秒 1932 个 token 提到 13274 个,模型和硬件都没换。

科技分析林晓雯发布: 2026年9月24日6 分钟阅读资料来源 2
八张 PCIe 卡,输入吞吐量提升 6.87 倍:软件补上硬件差距

“模型能跑起来”和“模型能跑出像样的吞吐量”,今天往往差得比两代显卡还远。量子位报道了是石科技(METASTONE)的一个案例。这家公司只做优化,不改模型结构,也不换硬件。

起点是这类卡常见的问题:卡间没有高速互联,也不在主流框架的官方支持矩阵里。框架不报错,它悄悄绕开加速路径,退回通用的慢速实现。八张纯 PCIe 卡上,V4.1-Flash 在发布当天的基线版本里输入吞吐量是每秒 1932 个 token。团队补齐缺失的算子内核,修好稀疏注意力的快速预处理路径,换掉稠密 GEMM 上偏慢的 FP8 内核,再扩大 PCIe 上快速 IPC 通信的覆盖范围。结果升到每秒 5850 个 token。这是第一阶段,他们叫它“模型与硬件的协同”。

第二阶段:通信、显存、缓存

真正的工作从这里才开始。工程师把注意力和投影算子融合到一起,把计算藏进集合通信的空隙里,按 PCIe 的真实带宽重写通信逻辑。预填充阶段和生成阶段的并行策略,他们分开调。最后再动态调节静态显存占比、KV 缓存容量和显存复用机制。输入吞吐量从 5850 升到每秒 13274 个 token,合计 6.87 倍,上下文仍然支持到一百万 token。

同一套方法在其他模型上也管用。DeepSeek-V4-Flash 的输入吞吐量从每秒 14546 升到 22584 个 token,1.55 倍。GLM5.3 从 3236.78 升到 6222.72,1.92 倍。首个 token 的 P95 延迟从 141.6 秒降到 46.6 秒,上下文上限从 27 万扩展到 105 万 token。仅第一阶段,就在几个模型上带来 20% 到 33% 的增幅。

相对顶级硬件是什么水平

作者如实给出了参照。同样的并发水平下,B300 的输入吞吐量大约是这台八卡机器的 4.9 到 5.6 倍,比较用的是 DeepSeek-V4-Flash;GLM-5.3 上的比值是 3.5 到 4.7 倍。差距没有消失,但明显小于只比规格时会得到的印象。视频生成上,基于 MiniMax H3 模型,用参考图生成 15 秒视频的速度提升了 2.48 倍。这套方法也在国产 GPU 上验证过。那里需要显式打开 NSA 稀疏注意力,并关掉为 NVIDIA 和 AMD 平台写的机制。

有些比较不看峰值规格,只看机房里真实运行的硬件上每个 token 的成本。对这些比较来说,这是一个不错的参照。

评论 0

资料来源

2
  1. 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
  2. 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

林晓雯

林晓雯

人工智能、模型与技术

林晓雯负责FLASH24的人工智能、模型与技术方向,主要写科技、人工智能与模型、媒体与互联网三个领域。她习惯从论文预印本、开源代码库和厂商技术文档入手,先核对训练数据来源和评测口径,再决定是否落笔。遇到模型跑分,她会自己复现一遍小规模测试,并对照独立第三方榜单,确认数字没有注水。她常联系一线工程师和产品经理,也盯着各大会议截稿日,把不同版本的技术报告放在一起比。业余时间她玩3D打印、折腾老电脑,还关心模型从网络垃圾里学到的偏见问题,这让她对数据清洗格外敏感。她有一条原则:拿不到原始数据的性能宣称,不写。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。