Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

DeepSeek-V4.1-Flash: Fast siebenfacher Durchsatz auf PCIe-GPUs

Ein chinesisches Team meldet für DeepSeek-V4.1-Flash einen Durchsatzsprung auf einem PCIe-System ohne NVLink. Der Fall zeigt, wie viel Leistung in der Software steckt.

TechnologieAnalyseLena BrandtVeröffentlicht: 24. September 20266 Min. LesezeitQuellen 2
DeepSeek-V4.1-Flash: Fast siebenfacher Durchsatz auf PCIe-GPUs

Wie viel Leistung in der Software steckt, zeigt ein am 24. September 2026 veröffentlichter Erfahrungsbericht des Portals QbitAI (量子位) über die chinesische Firma METASTONE (是石科技). Das Team hat DeepSeek-V4.1-Flash auf einem System aus acht GPUs betrieben, die ausschließlich über PCIe angebunden sind – ohne NVLink und damit ohne die schnelle Kopplung, für die solche Modelle üblicherweise ausgelegt werden.

Ausgangsgröße und Endstand

Als Referenz nennen die Autoren einen Tag-Null-Standardwert von 1.932 Token pro Sekunde für den Eingabe-Durchsatz. Nach einem ersten Durchgang mit Kernel-Korrekturen, einer schnelleren Pfadwahl für die sparse-attention-basierte Vorverarbeitung, ausgetauschten FP8-dense-GEMM-Kernen und einem beschleunigten PCIe-IPC-Pfad standen bereits 5.850 Token pro Sekunde. Nach weiteren Optimierungen – unter anderem Attention-Operator-Fusion, kürzere Entwürfe beim spekulativen Dekodieren, verschränkte Berechnung und Kommunikation sowie Speicherparameter – erreichte das System 13.274 Token pro Sekunde und damit rund das 6,87-Fache des Ausgangswerts. Die Kontextlänge bis zu einer Million Token ließ sich dabei nach Angaben des Berichts halten.

Vergleichsmessungen zeigen, dass es sich nicht um einen Einzelbefund handelt. DeepSeek-V4-Flash stieg von 14.546 auf 22.584 Token pro Sekunde im Eingabe-Durchsatz, ein Faktor von 1,55. Das Modell GLM 5.3 verbesserte sich von 3.236,78 auf 6.222,72 Token pro Sekunde.

Warum das für Deutschland relevant ist

Der Bericht hat zwei Ebenen. Die erste ist technisch: Modelle, die auf Hardware ohne schnelle Zwischenverbindung laufen, verlieren einen großen Teil ihres Leistungsvorsprungs nicht an die Hardware, sondern an die Speicher- und Kommunikationswege. Wer diese Wege optimiert, gewinnt Faktoren, nicht Prozentpunkte.

Die zweite Ebene betrifft den Betrieb. DeepSeek-V4.1-Flash wurde am 10. September 2026 veröffentlicht, umfasst 552 Milliarden Parameter im Mixture-of-Experts-Aufbau und aktiviert im Prefill 8 Milliarden sowie im Decode 16 Milliarden Parameter. Der KV-Cache liegt bei 890 Byte pro Token und damit rund ein Viertel des Werts von V4-Flash. Das Modell steht unter MIT-Lizenz, verarbeitet Bilder mit bis zu 384 Token pro Bild und lässt sich per vLLM, SGLang oder TensorRT ausliefern; unterstützt werden FP8, BF16, GPTQ, AWQ und GGUF.

METASTONE nennt für sich mehr als 20.000 Petaflops verwaltete Rechenleistung, den Betrieb von über zehn intelligenten Rechenzentren und zwei nationalen Supercomputing-Zentren; drei Gordon-Bell-Preise werden als Referenz angeführt. Für lokale Inferenz ist die eigentliche Botschaft des Berichts die Verlagerung der Wertschöpfung: Nicht der Neukauf von Hardware entscheidet, sondern die Fähigkeit, Speicherhierarchie und Nebenläufigkeit für ein konkretes Modell zu beherrschen.

Sechsmal schneller ohne neue Hardware – der Unterschied zwischen 1.932 und 13.274 Token pro Sekunde ist Software.

Kommentare 0

Quellen

2
  1. 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
  2. 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.