Acht PCIe-Karten, 6,87-facher Durchsatz: Software holt auf, was die Hardware nicht liefert
Das chinesische Unternehmen METASTONE hat den Eingangsdurchsatz von V4.1-Flash auf acht PCIe-Karten von 1932 auf 13274 Token pro Sekunde gesteigert. Am Modell und an der Hardware wurde nichts geändert.

Zwischen „das Modell läuft" und „das Modell liefert brauchbaren Durchsatz" liegt heute oft mehr als zwischen zwei Kartengenerationen. Das chinesische Fachportal beschreibt den Fall der Firma METASTONE. Sie optimiert ausschließlich, ohne die Modellstruktur und ohne die Hardware zu verändern.
Ausgangspunkt ist ein typisches Problem von Karten ohne schnelle Verbindung untereinander und ohne Platz in der offiziellen Support-Matrix der großen Frameworks. Das Framework meldet keinen Fehler. Es umgeht still die beschleunigten Pfade und fällt auf langsame, allgemeine Implementierungen zurück. Auf acht reinen PCIe-Karten erreichte V4.1-Flash in der Basisversion vom Tag der Veröffentlichung einen Eingangsdurchsatz von 1932 Token pro Sekunde. Das Team ergänzte fehlende Kerne, reparierte den schnellen Vorverarbeitungspfad der Sparse-Attention, ersetzte den langsamen FP8-Kern für die dichte GEMM-Operation und erweiterte den Bereich der schnellen IPC-Kommunikation über PCIe. Danach lag der Wert bei 5850 Token pro Sekunde. Das ist die erste Stufe, genannt „Koordination von Modell und Hardware".
Zweite Stufe: Kommunikation, Speicher, Cache
Erst danach beginnt die eigentliche Arbeit. Die Ingenieure legten Attention- und Projektionsoperatoren zusammen und versteckten Berechnungen in den Lücken der kollektiven Kommunikation. Sie schrieben die Kommunikationslogik auf die real erreichbare PCIe-Bandbreite um und stimmten die Parallelisierungsstrategien für die Vorverarbeitungsphase und die Generierungsphase getrennt ab. Zum Schluss regelten sie die Anteile des statischen Speichers, die Kapazität des KV-Cache und den Mechanismus zur Speicherwiederverwendung dynamisch nach. Der Eingangsdurchsatz stieg von 5850 auf 13274 Token pro Sekunde, insgesamt um den Faktor 6,87, bei einem Kontext von bis zu einer Million Token.
Dieselbe Methodik wirkt auch bei anderen Modellen. Für DeepSeek-V4-Flash stieg der Eingangsdurchsatz von 14546 auf 22584 Token pro Sekunde (Faktor 1,55), für GLM5.3 von 3236,78 auf 6222,72 (Faktor 1,92). Gleichzeitig sank die P95-Latenz des ersten Tokens von 141,6 Sekunden auf 46,6 Sekunden, und das Kontextlimit wuchs von 270 000 auf 1,05 Millionen Token. Allein die erste Stufe brachte bei mehreren Modellen Zuwächse von 20 bis 33 Prozent.
Was das im Vergleich zu Spitzenhardware bedeutet
Die Autoren zeigen den Referenzpunkt offen. Bei gleichem Grad an Nebenläufigkeit hat eine B300-Karte einen etwa 4,9- bis 5,6-fach höheren Eingangsdurchsatz als diese Acht-Karten-Maschine (Vergleich auf DeepSeek-V4-Flash), für GLM-5.3 liegt das Verhältnis bei 3,5- bis 4,7-fach. Der Abstand verschwindet nicht, ist aber deutlich kleiner, als der bloße Vergleich der Datenblätter nahelegen würde. Bei der Videogenerierung auf dem Modell MiniMax H3 wurde ein 15-sekündiges Video aus einem Referenzbild um den Faktor 2,48 beschleunigt. Die Methodik wurde zudem auf chinesischen GPU-Karten getestet. Dort musste die Sparse-Attention NSA ausdrücklich aktiviert und Mechanismen abgeschaltet werden, die für NVIDIA- und AMD-Plattformen geschrieben sind.
Das ist ein guter Kontext für Vergleiche, bei denen nicht die Spitzenspezifikation zählt, sondern die Kosten für ein einzelnes Token auf Hardware, die tatsächlich im Serverraum steht.
Quellen
2- 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
- 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.