1,5 Karten für eine B300: Wie aus PCIe der 6,87-fache Durchsatz geholt wurde
Der chinesische Betreiber Meta-Infer hat auf acht PCIe-Karten den Durchsatz von DeepSeek-V4.1-Flash von 1932 auf 13274 Token pro Sekunde gesteigert. Das Modell blieb unverändert, geändert wurde nur der Software-Stack.

Im Wettrennen um KI geht es nicht mehr darum, wer die beste Hardware kauft, sondern darum, wer besser nutzt, was schon da ist. Das chinesische Portal qbitai beschrieb die Arbeit der Firma METASTONE. Deren Team verband acht Grafikkarten ausschließlich über den PCIe-Bus, ohne schnelle Verbindung zwischen den Karten. Auf DeepSeek-V4.1-Flash erreichte es eine Beschleunigung, die sich kaum als Kosmetik abtun lässt.
Ausgangspunkt war ein gewöhnliches Community-Laufzeitset. Auf derselben Hardware lag der Eingangsdurchsatz bei 1932 Token pro Sekunde. In der ersten Optimierungsstufe ergänzte das Team fehlende Rechenkerne, tauschte den langsamen FP8-Kern aus und erweiterte den schnellen Kommunikationspfad. Damit stieg der Durchsatz auf 5850 Token pro Sekunde. In der zweiten Stufe kamen die Fusion der Attention-Operatoren, die Überlagerung von Berechnung und Kommunikation sowie getrennte Parallelisierungsstrategien für die Vorlaufphase und die Generierung hinzu. Das hob das Ergebnis auf 13274 Token pro Sekunde. Insgesamt ist das 6,87-mal mehr bei einem Kontext von bis zu einer Million Token.
Dieselbe Methode, andere Modelle
METASTONE gibt an, dass dasselbe Verfahren breiter wirkt. Beim Modell DeepSeek-V4-Flash stieg der Eingangsdurchsatz von 14546 auf 22584 Token pro Sekunde, also um das 1,55-Fache. Bei GLM5.3 sprang der Wert von 3236,78 auf 6222,72 Token pro Sekunde, das ist das 1,92-Fache. Die P95-Latenz des ersten Tokens fiel von 141,6 auf 46,6 Sekunden, der unterstützte Kontext wuchs von 270 Tausend auf 1,05 Millionen Token. Das Unternehmen hält zudem fest, dass sich die Methodik auch auf inländischen chinesischen Beschleunigern bewährt. Diese stehen ebenso wie PCIe-Karten nicht in den offiziellen Support-Matrizen gängiger Frameworks.
Im Hintergrund steht die Logistik des Betreibers. Nach eigenen Angaben verwaltet METASTONE mehr als 20 000 P Rechenleistung und betreibt mehrere Rechenzentren für KI sowie zwei nationale Supercomputer-Zentren. Die Verfügbarkeit der Cluster gibt das Unternehmen mit einer SLA von über 99,95 Prozent an. Das Team soll drei Gordon-Bell-Preise vorweisen können.
Wie weit der Abstand zur Flaggschiff-Karte noch ist
Der ehrliche Vergleich fällt weniger eindrucksvoll aus als die Schlagzeile vom siebenfachen Zuwachs. An demselben Lastpunkt erreichte eine B300-Karte etwa das 4,9- bis 5,6-Fache des Eingangsdurchsatzes einer Acht-Karten-Maschine auf PCIe. Bei Aufgaben zur Videogenerierung aus einem einzigen Bild schrumpfte der Vorsprung auf 1,5 bis 1,7 Maschinen pro B300-Karte, wenn zusätzlich LoRA zum Einsatz kam. Billige Karten holen die Top-Hardware also nicht ein, doch der Unterschied ist keine Kluft mehr.
Eine Karte, die niemand in die Support-Matrix eines Frameworks eingetragen hat, verliert keine Leistung. Sie verliert sie an die voreingestellten, konservativen Werte.
Für den Adressaten außerhalb Chinas ist die Schlussfolgerung praktisch. Die meisten Installationen auf eigener Hardware sind vLLM- oder SGLang-Server auf Karten, die keine Flaggschiffe sind. Der Mehrwert liegt nicht in einer weiteren Karte, sondern in der Ingenieursarbeit: korrekte Kerne, auf die reale Bandbreite der Verbindung abgestimmte Kommunikation und unterschiedliche Parallelisierungsstrategien für die Vorlaufphase und die Generierung. DeepSeek-V4.1-Flash mit 552 Milliarden Parametern und einer MoE-Architektur ist unter der MIT-Lizenz verfügbar und heute ein gutes Übungsfeld für solche Experimente. Das Modell selbst hat einen KV-Cache von 890 Byte pro Token, also rund viermal kleiner als V4-Flash.
Quellen
3- 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
- 02DeepSeek-V4.1-Flash – model cardEN
- 03Artificial Analysis: DeepSeek V4.1 FlashEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.