Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

KV-Cache mit 890 Byte pro Token: Wie DeepSeek den Attention-Speicher verkleinert hat

Das Model-Card nennt 890 Byte Cache-Speicher pro Token, etwa ein Viertel dessen, was V4-Flash braucht, sowie einen HBM-Bedarf von einem Viertel der vorherigen Generation.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 26. September 20265 Min. LesezeitQuellen 4
KV-Cache mit 890 Byte pro Token: Wie DeepSeek den Attention-Speicher verkleinert hat

Die interessanteste Zahl in der Spezifikation von DeepSeek-V4.1-Flash betrifft nicht die Parameter, sondern den Speicher. Das Model-Card gibt an, dass der globale KV-Cache 890 Byte pro Token belegt, etwa ein Viertel dessen, was DeepSeek-V4-Flash braucht. Die Mitteilung des Anbieters beschreibt denselben Effekt von der Infrastrukturseite: Der Bedarf an HBM-Speicher sinkt auf ein Viertel, der an SSDs auf ein Achtel im Vergleich zur vorherigen Generation.

Das ist wichtig, weil das Modell in agentischen Aufgaben lange Kontexte mehrfach liest. Cache-Treffer machen einen großen Teil der Rechnung aus, und gleichzeitig muss der KV-Cache irgendwo physisch liegen. Wenn der Kontext Hunderttausende Token umfasst, ist der Cache kein Implementierungsdetail mehr, sondern die Hauptgrenze für Durchsatz und Serverkosten.

Drei Mechanismen statt eines Tricks

Die Kompression gelang mit mehreren unabhängigen Verfahren. Das erste ist SWA Bounded Replay: Fehlende Zustände des Attention-Fensters werden rekonstruiert, indem nur die letzten Token des Fensters wiederholt werden. Sie müssen also nicht dauerhaft auf der SSD liegen. Die dauerhafte KV-Spur sinkt auf etwa ein Achtel des Zustands vor der Änderung.

Das zweite ist Comprossed Sparse Attention 2 (CSA2). Sie weist jeder Attention-Schicht einen von drei Modi zu: Full, Reindex oder Reuse. Dadurch teilen die Schichten den Haupt-KV und den Indexer-Schlüssel, und die Indizes der Sparse Attention werden wiederverwendet. Im Decoder begrenzt der hierarchische Sparse-Indexer die tieferen Indexierungsschichten auf einen Kandidatenpool, den die erste Schicht im Modus Full aufgebaut hat. Die Indexierungskosten wachsen nicht mehr mit der Kontextlänge.

Das dritte ist die Speicherung des Haupt-KV im Format FP4: Werte in der Darstellung E2M1 mit einer E4M3-Skala pro 16 Kanäle. Erst diese drei Elemente zusammen ergeben 890 Byte pro Token.

Was das in der Praxis ändert

Eine kleinere KV-Spur bedeutet, dass auf demselben Server mehr parallele Sitzungen und längere Kontexte Platz finden und weniger Daten zwischen Speicher und Festplatte bewegt werden müssen. In der Mitteilung des Anbieters steht ausdrücklich das Versprechen niedrigerer Betriebskosten und der Weitergabe der Einsparungen an die Nutzer, zusammen mit einem Mechanismus für Spitzen- und Nebenzeittarife. DeepSeek beschreibt das als „pushing the limits of KV cache compression“, also als Wettlauf nicht darum, wer mehr Parameter hat, sondern darum, wer den Speicher für langen Kontext billiger hält.

Das chinesische Portal IT之家 weist darauf hin, dass V4.1-Flash auf der Einsatzseite unter anderem in einem nationalen Supercomputernetz angekommen ist, wo die Begrenzung des Bedarfs an HBM und SSD die Voraussetzung dafür ist, viele Nutzer gleichzeitig zu bedienen.

Kommentare 0

Quellen

4
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  4. 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.