跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

一张B300顶1.5张卡:八卡PCIe把吞吐量做到6.87倍

中国算力服务商METASTONE用八张只走PCIe的显卡,把DeepSeek-V4.1-Flash的吞吐量从每秒1932个token提到13274个token。模型没换,换的是软件栈。

科技分析王雅琴发布: 2026年9月25日7 分钟阅读资料来源 3
一张B300顶1.5张卡:八卡PCIe把吞吐量做到6.87倍

AI竞赛的重心在变。以前问的是“谁买到最好的硬件”,现在问的是“谁把手里的硬件用得更好”。中国媒体量子位(qbitai)报道了是石科技(METASTONE)的做法。八张显卡只靠PCIe总线互联,卡与卡之间没有高速互连。团队就在这套配置上跑DeepSeek-V4.1-Flash,拿到的加速幅度很难说只是小修小补。

起点是一套普通的社区版部署方案。同一台机器上,输入吞吐量是每秒1932个token。第一阶段优化补上缺失的算子核,换掉偏慢的FP8核,又扩大了快速通信路径的覆盖范围,吞吐量升到每秒5850个token。第二阶段做注意力算子融合,把计算和通信重叠起来,预填充和生成两个阶段各用一套并行策略,结果达到每秒13274个token。上下文最长到一百万token,整体提升6.87倍。

同一套方法,其他模型也管用

METASTONE说这套做法适用范围更广。在DeepSeek-V4-Flash上,输入吞吐量从每秒14546个token升到22584个token,即1.55倍。GLM5.3从每秒3236.78个token升到6222.72个token,1.92倍;首token的P95延迟从141.6秒降到46.6秒,可支持的上下文从27万token升到105万token。公司还表示,这套方法在国产加速器上同样有效。这些芯片和PCIe卡一样,都没被写进主流框架的官方支持矩阵。

背后是这家公司的算力家底。按它自己的数据,METASTONE管理超过2万P算力,运营十余个AI计算中心,还有两个国家超算中心,集群可用性宣称达到99.95%以上的SLA。团队称拿过三次戈登·贝尔奖。

离旗舰卡还有多远

认真比一比,结果没有“七倍提升”这个标题那么漂亮。同一负载点上,一张B300的输入吞吐量约是这台八卡PCIe机器的4.9到5.6倍。单图生视频任务里,如果额外用上LoRA,优势缩到一张B300相当于1.5到1.7台机器。便宜卡追不上顶级硬件,但差距不再是一道鸿沟。

一张没被写进框架支持矩阵的卡,不会因此丢掉算力。它丢掉的算力,被保守的默认配置吃掉了。

对中国以外的读者来说,结论很实际。自建硬件上的大多数部署,都是跑在非旗舰卡上的vLLM或SGLang服务器。真正的增量不是再加一张卡,而是工程能力:正确的算子核、与链路实际带宽匹配的通信方式,以及预填充和生成阶段各自不同的并行策略。DeepSeek-V4.1-Flash有5520亿参数,MoE架构,以MIT许可证开放,如今是这类实验的好靶场。这个模型每token的KV cache只有890字节,约为V4-Flash的四分之一。

评论 0

资料来源

3
  1. 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
  2. 02DeepSeek-V4.1-Flash – model cardEN
  3. 03Artificial Analysis: DeepSeek V4.1 FlashEN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

王雅琴

王雅琴

人工智能、模型与技术

王雅琴负责FLASH24的人工智能、模型与技术报道,覆盖科技、人工智能与模型、媒体与互联网领域。她习惯直接查阅技术文档、模型卡与官方博客,而非依赖新闻稿,对未经核实的参数和跑分数据一概不放行。每篇报道前,她会逐项核对基准测试结果,对照论文原文与开源代码,确认版本号、数据集和评测条件是否一致。她常联系开发者与研究人员求证细节,也盯着各大厂商的发布会和论文截稿日期,横向比较同类模型的实际表现。私下她自建服务、折腾家庭网络,这让她对部署成本和真实算力需求有直观判断。她的原则是:没有可复现来源的数字,不写进稿子。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。