Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

KV cache 890 bajtów na token: jak DeepSeek ściśnął pamięć uwagi

Karta modelu podaje 890 bajtów pamięci podręcznej na token, około cztery razy mniej niż V4-Flash, oraz zapotrzebowanie na HBM na poziomie jednej czwartej poprzedniej generacji.

AI i modeleWyjaśnienieMarta ZielińskaOpublikowano: 26 września 20265 min czytaniaŹródła 4
KV cache 890 bajtów na token: jak DeepSeek ściśnął pamięć uwagi

Najciekawsza liczba w specyfikacji DeepSeek-V4.1-Flash nie dotyczy parametrów, tylko pamięci. Karta modelu podaje, że globalny KV cache zajmuje 890 bajtów na token, około jednej czwartej tego, co w DeepSeek-V4-Flash. Komunikat wydawcy opisuje ten sam efekt od strony infrastruktury: zapotrzebowanie na pamięć HBM spada do jednej czwartej, a na dyski SSD do jednej ósmej w stosunku do poprzedniej generacji.

To ma znaczenie, bo w zadaniach agentowych model czyta długie konteksty wielokrotnie. Trafienia w pamięć podręczną odpowiadają za dużą część rachunku, a jednocześnie KV cache musi gdzieś fizycznie leżeć. Gdy kontekst liczy setki tysięcy tokenów, pamięć podręczna przestaje być szczegółem implementacyjnym i staje się głównym ograniczeniem przepustowości i kosztu serwera.

Trzy mechanizmy zamiast jednej sztuczki

Kompresję osiągnięto kilkoma niezależnymi metodami. Pierwsza to SWA Bounded Replay: brakujące stany okna uwagi są odtwarzane przez powtórzenie jedynie ostatnich tokenów okna, więc nie trzeba ich trwale zapisywać na SSD. Trwały ślad KV spada do około jednej ósmej stanu sprzed zmiany.

Druga to Comprossed Sparse Attention 2 (CSA2). Nadaje ona każdej warstwie uwagi jeden z trzech trybów: Full, Reindex albo Reuse. Dzięki temu warstwy współdzielą główny KV oraz klucz indeksera, a indeksy rzadkiej uwagi są wykorzystywane ponownie. W dekoderze hierarchiczny indekser rzadki ogranicza głębsze warstwy indeksowania do puli kandydatów, którą zbudowała pierwsza warstwa w trybie Full. Koszt indeksowania przestaje więc rosnąć wraz z długością kontekstu.

Trzecia to składowanie głównego KV w formacie FP4: wartości w reprezentacji E2M1 z jedną skalą E4M3 na każde 16 kanałów. Dopiero te trzy elementy razem dają 890 bajtów na token.

Co to zmienia w praktyce

Mniejszy ślad KV oznacza, że na tym samym serwerze mieści się więcej równoległych sesji i dłuższe konteksty, a mniej danych trzeba przenosić między pamięcią a dyskiem. W komunikacie wydawcy pojawia się wprost obietnica niższych kosztów obsługi i przekazania oszczędności użytkownikom, wraz z mechanizmem cen szczytowych i pozaszczytowych. DeepSeek opisuje to jako „pushing the limits of KV cache compression”, czyli wyścig nie o to, kto ma więcej parametrów, lecz o to, kto taniej utrzymuje pamięć długiego kontekstu.

Chiński portal IT之家 zwraca uwagę, że po stronie wdrożeń V4.1-Flash trafił m.in. do krajowej sieci superkomputerów, gdzie ograniczenie zapotrzebowania na HBM i SSD jest warunkiem obsłużenia wielu użytkowników naraz.

Komentarze 0

Źródła

4
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek V4.1 Flash 模型上线国家超算互联网 (IT之家)ZH
  4. 04DeepSeek V4.1 Flash — dane wydania i benchmarki (Artificial Analysis)EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.