DeepSeek V4.1 Flash ist da: 552 Milliarden Parameter, native Multimodalität, niedrigere Preise
Am 10. September 2026 hat DeepSeek das Modell V4.1 Flash veröffentlicht. Es nutzt eine neue MoE-Struktur mit 552 Milliarden Parametern, aktiviert bei der Eingabe nur 8 Milliarden Parameter und senkt den HBM-Bedarf des KV-Cache auf ein Viertel der Vorgängergeneration.

Am 10. September 2026 hat DeepSeek das Modell V4.1 Flash veröffentlicht. Laut Unternehmen ist es das kleinste Modell der neuen Architekturreihe und beherrscht natives multimodales Bildverständnis. Das Modell ist zeitgleich in der DeepSeek-API verfügbar. Für den Aufruf genügt es, den Modellnamen auf deepseek-flash zu ändern.
V4.1 Flash ist ein MoE-Modell mit 552 Milliarden Parametern und nutzt eine neue Causal-Encoder-Decoder-Architektur. Eingabe und Ausgabe sind asymmetrisch: In der Eingabephase werden nur 8 Milliarden Parameter aktiviert, in der Ausgabephase 16 Milliarden. Laut Unternehmen soll die neue Struktur eine höhere Leistungsobergrenze, schnellere Inferenz und einen größeren Durchsatz ermöglichen. Sie lässt sich zudem auf Modelle mit mehr Parametern skalieren.
Ein weiterer Schwerpunkt des Updates ist der Cache. Verglichen mit der Vorgängergeneration sinkt der HBM-Bedarf des KV-Cache auf ein Viertel, der SSD-Bedarf auf ein Achtel. In Agent-Szenarien machen Cache-Treffer oft einen hohen Kostenanteil aus. Ein kompakterer KV-Cache senkt die Kosten solcher Aufgaben deutlich, so das Unternehmen. Außerdem nennt es eine langfristige Kurve: Gegenüber dem ersten Modell ist der KV-Cache bereits um den Faktor 437 geschrumpft.
Auch die Preise wurden angepasst. In der Nebenzeite kostet ein Cache-Treffer bei der Eingabe 0,02 Yuan pro Million Token, ein Cache-Fehlschlag 1 Yuan pro Million Token und die Ausgabe 4 Yuan pro Million Token. In der Hauptzeit liegen alle Preise doppelt so hoch wie in der Nebenzeite. Die neuen Preise gelten ab dem 10. September 2026, 12 Uhr.
Zur Open-Source-Seite: Die Modellgewichte erscheinen unter der MIT-Lizenz. Das Unternehmen will die Open-Source-Community bei der Inferenz-Anpassung nach Kräften unterstützen und auf verschiedenen Wegen die Verbreitung beim Deployment vergrößern. Wer große Deployments plant und über die nötigen Ressourcen verfügt, kann sich an das Team wenden.
Auch der Verbleib der alten Versionen wurde bekannt gegeben. V4 Flash und V4 Flash Vision Exp sind abgeschaltet. Aus Kompatibilitätsgründen werden die Modellnamen deepseek-v4-flash und deepseek-v4-flash-vision-exp vorerst auf V4.1 Flash geroutet. V4 Pro soll ebenfalls geordnet abgeschaltet werden. Entsprechende Anfragen werden nach einer gewissen Zeit vollständig auf V4.1 Flash geroutet und zum Stückpreis von V4.1 Flash abgerechnet. Die Partner WorkBuddy (einschließlich CodeBuddy) und OpenCode haben bereits vollständig integriert.
Beim Deployment und im Ökosystem unterstützt V4.1 Flash gängige Inferenz-Frameworks wie vLLM, SGLang und TensorRT, bietet Quantisierungsformate wie FP8, BF16, GPTQ, AWG und GGUF und erreicht eine Kontextlänge von bis zu 1 Million Token. Teams im In- und Ausland können das neue Modell damit auf ihrem bestehenden Inferenz-Stack mit geringem Anpassungsaufwand einbinden.
Quellen
3- 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.