Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

DeepSeek V4.1 Flash: 552 mld parametrów i asymetryczny koder-dekoder

Premiera 10 września 2026: multimodalny Mixture-of-Experts o 552 mld parametrów aktywuje 8 mld na token przy wejściu i 16 mld przy wyjściu. Zmienia się architektura, nie tylko skala.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 26 września 20265 min czytaniaŹródła 3
DeepSeek V4.1 Flash: 552 mld parametrów i asymetryczny koder-dekoder

Dziesiątego września 2026 roku DeepSeek wypuścił DeepSeek-V4.1-Flash, multimodalny model Mixture-of-Experts o 552 mld parametrów bazowych i kontekście do miliona tokenów. To nie rutynowa aktualizacja. Zmieniła się architektura i sposób liczenia pamięci podręcznej uwagi. Karta modelu podaje, że V4.1-Flash uruchamia 8 mld parametrów na token przy wstępnym przetwarzaniu promptu (prefill) i 16 mld przy generowaniu odpowiedzi (decode).

Koszty rozłożone nierówno, i to celowo

Konstrukcja opiera się na architekturze Causal Encoder-Decoder (CED): 40-warstwowy Transformer dzieli się na 20-warstwowy przyczynowy koder i 20-warstwowy dekoder. W klasycznych modelach każda warstwa dekodera liczy własny stan ukryty. Tutaj globalny KV cache dekodera powstaje z finalnych stanów ukrytych kodera. Asymetria 8 do 16 mld jest zamierzona. Obciążenia agentowe polegają głównie na czytaniu długich kontekstów, więc producent optymalizował przede wszystkim wejście.

Warstwa MoE ma 1 wspólnego eksperta i 384 ekspertów routowanych, z których na token wybieranych jest 6. Karta modelu wymienia pozostałe komponenty: Single-Pass mHC (zmienione mieszanie strumienia resztowego z kernelem Mega-mHC), Engram, czyli pamięć warunkową o 196 mld parametrów, rzadko odpytywaną przez wyszukiwanie po tokenach, oraz DSpark, dekodowanie spekulatywne z półautoregresyjnym generowaniem szkicu i weryfikacją sterowaną harmonogramem pewności.

45 bln tokenów i wizja od pierwszego kroku

Model trenowano od zera na multimodalnym korpusie 45 bln tokenów. Rzadką uwagę uczono przy długości sekwencji 64 tys. tokenów, a kontekst rozszerzono do 1 mln tokenów dopiero na etapie 34 bln tokenów, czyli po większości treningu. Po pretreningu przyszedł standardowy przepis SFT, potem uczenie ze wzmocnieniem, na końcu destylacja on-policy. Zmiany nie dotyczyły algorytmów, lecz danych. Producent na dużą skalę automatycznie syntetyzował zadania i środowiska agentowe.

Wejście obrazowe obsługuje koder DeepSeek-ViT, trenowany od zera z 2D-RoPE i downsamplingiem 3×3 pixel-unshuffle, plus dwuwarstwowy projektor MLP. Obrazy i tekst trafiają do wspólnej przestrzeni już od początku pretreningu, a nie dopiero przez doklejony adapter.

Karta modelu na Hugging Face notuje 621 396 pobrań w ostatnim miesiącu i licencję MIT. Powstały warianty wdrożeniowe dla vLLM, SGLang, TensorRT i Docker Model Runner oraz kwantyzacje FP8, BF16, GPTQ, AWG i GGUF. Chiński portal IT之家 zwraca uwagę na ten sam punkt co karta: w scenariuszach agentowych to trafienia w pamięć podręczną generują większość rachunku, więc mocniejsze ściśnięcie KV cache przekłada się wprost na koszt zadania. DeepSeek zapowiedział też wycofanie starszych deepseek-v4-flash i deepseek-v4-flash-vision-exp oraz przekierowanie żądań do V4-Pro na V4.1-Flash po jego stawkach.

Komentarze 0

Źródła

3
  1. 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
  2. 02DeepSeek V4.1-Flash — komunikat wydaniaEN
  3. 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.