Inferenz: chinesische Engine beschleunigt DeepSeek V4.1 Flash auf PCIe-GPUs um das 6,87-Fache
Auf acht PCIe-Karten ohne Hochgeschwindigkeitsverbindung stieg der Durchsatz der Meta-Infer-Engine von METASTONE von 1 932 auf 13 274 Token pro Sekunde. Das gelang allein über Softwareoptimierung von Kernels und Kommunikation, ohne das Modell zu verändern.

Die Debatte über KI-Chips verschiebt sich. Es geht nicht mehr nur darum, wer die leistungsfähigste Hardware kaufen kann, sondern wer die bereits vorhandene Hardware am besten nutzt. Diese These vertritt das chinesische Unternehmen METASTONE mit seiner Inferenz-Engine Meta-Infer, wie 量子位 (QbitAI) berichtet.
Die Lücke zwischen Framework und Hardware
Viele Grafikkarten können ein Modell laden, die Gewichte herunterladen und einen Dienst starten. Sie "funktionieren". Ihre tatsächliche Leistung im Lasttest bleibt aber oft weit unter den angekündigten Werten. Das Modell hat keinen Fehler, die Hardware ist nicht defekt. Der Verlust entsteht aus der Lücke zwischen Framework und Hardware. Diese Karten haben untereinander keine Hochgeschwindigkeitsverbindung und stehen nicht in den offiziellen Validierungsmatrizen der offenen Frameworks. Die Folge: Operatoren fallen still auf generische, wenig effiziente Implementierungen zurück. Die Kommunikationsparameter bleiben auf andere Architekturen kalibriert, und die Speicher- oder Parallelisierungskonfiguration übernimmt Standardwerte, die für andere Hardware gedacht sind.
Sechs Komma acht sieben Mal mehr Durchsatz
Meta-Infer geht dieses Problem allein über die Software an, ohne die Struktur des Modells oder die Semantik der Aufgaben zu ändern. Der Ansatz gliedert sich in vier Bereiche: Vervollständigung der Kernels, Optimierung der Operatoren und Neufassung der Kommunikation, Einstellung von Parallelität und Speicherkapazität, schließlich Wiederverwendung des Caches.
Der erste Bereich korrigiert Metadaten und Seitengrößen, die die Ausführung der nativen optimierten Operatoren verhindern. Er ersetzt ungeeignete alte Kernels und erweitert die Schwelle der schnellen Kommunikationspfade. In einer Umgebung mit acht PCIe-Karten lag der Eingangsdurchsatz mit der Referenz-Community-Version für DeepSeek-V4.1-Flash bei nur 1 932 Token pro Sekunde. Nach dieser Korrekturphase steigt er auf 5 850 Token pro Sekunde.
Der zweite Bereich packt die Engpässe an. Auf einer PCIe-Architektur ist die Bandbreite zwischen den Karten deutlich geringer als bei einer dedizierten Verbindung. Wer die Standardstrategien anwendet, verliert die Zeit in Kommunikationswartezeiten. Die Engine führt Operatoren zusammen, überlagert Berechnung und Kommunikation und schreibt die kollektive Kommunikationslogik neu. Damit erreicht sie 13 274 Token pro Sekunde, ein Faktor von 6,87, mit Unterstützung für sehr langen Kontext.
Die Methodik soll generisch sein: Bei einem anderen Modell steigt der Eingangsdurchsatz von 14 546 auf 22 584 Token pro Sekunde. Schon in der alleinigen Phase der Ko-Adaptation gewinnen mehrere Modelle zwischen 20 % und 33 % Durchsatz.
Ein Drittanbieter
METASTONE bezeichnet sich als unabhängiger End-to-End-Rechenbetreiber, der nicht an einen Modellanbieter gebunden ist. Das Unternehmen gibt an, mehr als 20 000 Petaflops Ressourcen zu verwalten, rund zehn intelligente Rechenzentren und zwei nationale Supercomputing-Zentren zu betreiben, mit einer Verfügbarkeitszusage von über 99,95 %. Sein Team beansprucht drei Gordon-Bell-Preise.
Wenn die Hardware begrenzt ist, wird die Softwareoptimierung zum wichtigsten Hebel für Leistung.
Quellen
2- 01量子位 (QbitAI) : PCIe 显卡被低估了 — DeepSeek 推理吞吐翻近 7 倍ZH
- 02量子位 (QbitAI) : page d'accueil de la rédactionZH
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.