Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

1,5 Karten für eine B300: Wie aus PCIe der 6,87-fache Durchsatz geholt wurde

Der chinesische Betreiber Meta-Infer hat auf acht PCIe-Karten den Durchsatz von DeepSeek-V4.1-Flash von 1932 auf 13274 Token pro Sekunde gesteigert. Das Modell blieb unverändert, geändert wurde nur der Software-Stack.

TechnologieAnalyseKatrin HoffmannVeröffentlicht: 25. September 20267 Min. LesezeitQuellen 3
1,5 Karten für eine B300: Wie aus PCIe der 6,87-fache Durchsatz geholt wurde

Im Wettrennen um KI geht es nicht mehr darum, wer die beste Hardware kauft, sondern darum, wer besser nutzt, was schon da ist. Das chinesische Portal qbitai beschrieb die Arbeit der Firma METASTONE. Deren Team verband acht Grafikkarten ausschließlich über den PCIe-Bus, ohne schnelle Verbindung zwischen den Karten. Auf DeepSeek-V4.1-Flash erreichte es eine Beschleunigung, die sich kaum als Kosmetik abtun lässt.

Ausgangspunkt war ein gewöhnliches Community-Laufzeitset. Auf derselben Hardware lag der Eingangsdurchsatz bei 1932 Token pro Sekunde. In der ersten Optimierungsstufe ergänzte das Team fehlende Rechenkerne, tauschte den langsamen FP8-Kern aus und erweiterte den schnellen Kommunikationspfad. Damit stieg der Durchsatz auf 5850 Token pro Sekunde. In der zweiten Stufe kamen die Fusion der Attention-Operatoren, die Überlagerung von Berechnung und Kommunikation sowie getrennte Parallelisierungsstrategien für die Vorlaufphase und die Generierung hinzu. Das hob das Ergebnis auf 13274 Token pro Sekunde. Insgesamt ist das 6,87-mal mehr bei einem Kontext von bis zu einer Million Token.

Dieselbe Methode, andere Modelle

METASTONE gibt an, dass dasselbe Verfahren breiter wirkt. Beim Modell DeepSeek-V4-Flash stieg der Eingangsdurchsatz von 14546 auf 22584 Token pro Sekunde, also um das 1,55-Fache. Bei GLM5.3 sprang der Wert von 3236,78 auf 6222,72 Token pro Sekunde, das ist das 1,92-Fache. Die P95-Latenz des ersten Tokens fiel von 141,6 auf 46,6 Sekunden, der unterstützte Kontext wuchs von 270 Tausend auf 1,05 Millionen Token. Das Unternehmen hält zudem fest, dass sich die Methodik auch auf inländischen chinesischen Beschleunigern bewährt. Diese stehen ebenso wie PCIe-Karten nicht in den offiziellen Support-Matrizen gängiger Frameworks.

Im Hintergrund steht die Logistik des Betreibers. Nach eigenen Angaben verwaltet METASTONE mehr als 20 000 P Rechenleistung und betreibt mehrere Rechenzentren für KI sowie zwei nationale Supercomputer-Zentren. Die Verfügbarkeit der Cluster gibt das Unternehmen mit einer SLA von über 99,95 Prozent an. Das Team soll drei Gordon-Bell-Preise vorweisen können.

Wie weit der Abstand zur Flaggschiff-Karte noch ist

Der ehrliche Vergleich fällt weniger eindrucksvoll aus als die Schlagzeile vom siebenfachen Zuwachs. An demselben Lastpunkt erreichte eine B300-Karte etwa das 4,9- bis 5,6-Fache des Eingangsdurchsatzes einer Acht-Karten-Maschine auf PCIe. Bei Aufgaben zur Videogenerierung aus einem einzigen Bild schrumpfte der Vorsprung auf 1,5 bis 1,7 Maschinen pro B300-Karte, wenn zusätzlich LoRA zum Einsatz kam. Billige Karten holen die Top-Hardware also nicht ein, doch der Unterschied ist keine Kluft mehr.

Eine Karte, die niemand in die Support-Matrix eines Frameworks eingetragen hat, verliert keine Leistung. Sie verliert sie an die voreingestellten, konservativen Werte.

Für den Adressaten außerhalb Chinas ist die Schlussfolgerung praktisch. Die meisten Installationen auf eigener Hardware sind vLLM- oder SGLang-Server auf Karten, die keine Flaggschiffe sind. Der Mehrwert liegt nicht in einer weiteren Karte, sondern in der Ingenieursarbeit: korrekte Kerne, auf die reale Bandbreite der Verbindung abgestimmte Kommunikation und unterschiedliche Parallelisierungsstrategien für die Vorlaufphase und die Generierung. DeepSeek-V4.1-Flash mit 552 Milliarden Parametern und einer MoE-Architektur ist unter der MIT-Lizenz verfügbar und heute ein gutes Übungsfeld für solche Experimente. Das Modell selbst hat einen KV-Cache von 890 Byte pro Token, also rund viermal kleiner als V4-Flash.

Kommentare 0

Quellen

3
  1. 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
  2. 02DeepSeek-V4.1-Flash – model cardEN
  3. 03Artificial Analysis: DeepSeek V4.1 FlashEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.