Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

DeepSeek V4.1 Flash: 552 Mrd. Parameter und asymmetrischer Encoder-Decoder

Am 10. September 2026 erschien DeepSeek-V4.1-Flash: ein multimodales Mixture-of-Experts-Modell mit 552 Mrd. Parametern, das pro Token 8 Mrd. beim Eingang und 16 Mrd. beim Ausgang aktiviert. Das ist eine Änderung der Architektur, nicht nur der Skala.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 26. September 20266 Min. LesezeitQuellen 3
DeepSeek V4.1 Flash: 552 Mrd. Parameter und asymmetrischer Encoder-Decoder

Am 10. September 2026 veröffentlichte DeepSeek DeepSeek-V4.1-Flash, ein multimodales Mixture-of-Experts-Modell mit 552 Mrd. Basisparametern und einem Kontext von bis zu einer Million Token. Das ist keine Routineaktualisierung. Geändert haben sich die Architektur und die Art, wie der Attention-Cache berechnet wird. Laut Modellkarte aktiviert V4.1-Flash nur 8 Mrd. Parameter pro Token bei der Vorverarbeitung des Prompts (Prefill) und 16 Mrd. bei der Generierung der Antwort (Decode).

Die Kosten sind ungleich verteilt, mit Absicht

Kern der Konstruktion ist die Architektur Causal Encoder-Decoder (CED): ein 40-schichtiger Transformer, aufgeteilt in einen 20-schichtigen kausalen Encoder und einen 20-schichtigen Decoder. In klassischen Modellen berechnet jede Decoder-Schicht ihren eigenen versteckten Zustand. Hier wird der globale KV-Cache des Decoders aus den finalen versteckten Zuständen des Encoders projiziert. Die Asymmetrie von 8 zu 16 Mrd. ist gewollt. Agenten-Lasten bestehen vor allem im Lesen langer Kontexte, deshalb optimierte der Hersteller vor allem den Eingang.

Die MoE-Schicht hat 1 gemeinsamen Experten und 384 geroutete Experten, von denen pro Token 6 ausgewählt werden. Laut Modellkarte kommen dazu: Single-Pass mHC (verändertes Mischen des Residualstroms mit dem Kernel Mega-mHC), Engram, ein bedingter Speicher mit 196 Mrd. Parametern, der nur selten über eine Suche nach Token abgefragt wird, sowie DSpark, eine spekulative Dekodierung mit halbautoregressiver Erzeugung eines Entwurfs und einer durch einen Konfidenz-Zeitplan gesteuerten Verifikation.

45 Billionen Token und Vision vom ersten Schritt an

Das Modell wurde von Grund auf auf einem multimodalen Korpus von 45 Billionen Token trainiert. Die seltene Attention wurde bei einer Sequenzlänge von 64.000 Token gelehrt. Auf 1 Million Token erweiterte das Team den Kontext erst bei 34 Billionen Token, also nach dem größten Teil des Trainings. Nach dem Pretraining folgte das übliche SFT-Rezept, danach Reinforcement Learning und zum Schluss On-Policy-Destillation. Der Hersteller betont, die Änderungen hätten nicht die Algorithmen betroffen, sondern die Daten: In großem Umfang wurden automatisch Aufgaben und Agenten-Umgebungen synthetisiert.

Bilder verarbeitet der Encoder DeepSeek-ViT, von Grund auf trainiert mit 2D-RoPE und 3×3-Pixel-Unshuffle-Downsampling, dazu ein zweischichtiger MLP-Projektor. Bilder und Text gelangen von Beginn des Pretrainings an in einen gemeinsamen Raum. Es ist kein nachträglich angeklebter Adapter.

Die Modellkarte auf Hugging Face vermerkt 621.396 Downloads im letzten Monat und die Lizenz MIT. Es gibt Deployment-Varianten für vLLM, SGLang, TensorRT und Docker Model Runner sowie Quantisierungen FP8, BF16, GPTQ, AWG und GGUF. Das chinesische Portal IT之家 nennt denselben Punkt wie die Karte: In Agenten-Szenarien erzeugen gerade die Cache-Treffer den größten Teil der Rechnung, eine stärkere Kompression des KV-Cache senkt also direkt die Kosten einer Aufgabe. DeepSeek kündigte zudem an, deepseek-v4-flash und deepseek-v4-flash-vision-exp zurückzuziehen und Anfragen an V4-Pro auf V4.1-Flash zu dessen Tarifen umzuleiten.

Kommentare 0

Quellen

3
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.