DeepSeek V4.1 Flash: 552 mld parametrów i asymetryczny koder-dekoder
Premiera 10 września 2026: multimodalny Mixture-of-Experts o 552 mld parametrów aktywuje 8 mld na token przy wejściu i 16 mld przy wyjściu. Zmienia się architektura, nie tylko skala.

Dziesiątego września 2026 roku DeepSeek wypuścił DeepSeek-V4.1-Flash, multimodalny model Mixture-of-Experts o 552 mld parametrów bazowych i kontekście do miliona tokenów. To nie rutynowa aktualizacja. Zmieniła się architektura i sposób liczenia pamięci podręcznej uwagi. Karta modelu podaje, że V4.1-Flash uruchamia 8 mld parametrów na token przy wstępnym przetwarzaniu promptu (prefill) i 16 mld przy generowaniu odpowiedzi (decode).
Koszty rozłożone nierówno, i to celowo
Konstrukcja opiera się na architekturze Causal Encoder-Decoder (CED): 40-warstwowy Transformer dzieli się na 20-warstwowy przyczynowy koder i 20-warstwowy dekoder. W klasycznych modelach każda warstwa dekodera liczy własny stan ukryty. Tutaj globalny KV cache dekodera powstaje z finalnych stanów ukrytych kodera. Asymetria 8 do 16 mld jest zamierzona. Obciążenia agentowe polegają głównie na czytaniu długich kontekstów, więc producent optymalizował przede wszystkim wejście.
Warstwa MoE ma 1 wspólnego eksperta i 384 ekspertów routowanych, z których na token wybieranych jest 6. Karta modelu wymienia pozostałe komponenty: Single-Pass mHC (zmienione mieszanie strumienia resztowego z kernelem Mega-mHC), Engram, czyli pamięć warunkową o 196 mld parametrów, rzadko odpytywaną przez wyszukiwanie po tokenach, oraz DSpark, dekodowanie spekulatywne z półautoregresyjnym generowaniem szkicu i weryfikacją sterowaną harmonogramem pewności.
45 bln tokenów i wizja od pierwszego kroku
Model trenowano od zera na multimodalnym korpusie 45 bln tokenów. Rzadką uwagę uczono przy długości sekwencji 64 tys. tokenów, a kontekst rozszerzono do 1 mln tokenów dopiero na etapie 34 bln tokenów, czyli po większości treningu. Po pretreningu przyszedł standardowy przepis SFT, potem uczenie ze wzmocnieniem, na końcu destylacja on-policy. Zmiany nie dotyczyły algorytmów, lecz danych. Producent na dużą skalę automatycznie syntetyzował zadania i środowiska agentowe.
Wejście obrazowe obsługuje koder DeepSeek-ViT, trenowany od zera z 2D-RoPE i downsamplingiem 3×3 pixel-unshuffle, plus dwuwarstwowy projektor MLP. Obrazy i tekst trafiają do wspólnej przestrzeni już od początku pretreningu, a nie dopiero przez doklejony adapter.
Karta modelu na Hugging Face notuje 621 396 pobrań w ostatnim miesiącu i licencję MIT. Powstały warianty wdrożeniowe dla vLLM, SGLang, TensorRT i Docker Model Runner oraz kwantyzacje FP8, BF16, GPTQ, AWG i GGUF. Chiński portal IT之家 zwraca uwagę na ten sam punkt co karta: w scenariuszach agentowych to trafienia w pamięć podręczną generują większość rachunku, więc mocniejsze ściśnięcie KV cache przekłada się wprost na koszt zadania. DeepSeek zapowiedział też wycofanie starszych deepseek-v4-flash i deepseek-v4-flash-vision-exp oraz przekierowanie żądań do V4-Pro na V4.1-Flash po jego stawkach.
Źródła
3- 01DeepSeek-V4.1-Flash — karta modelu (Hugging Face)EN
- 02DeepSeek V4.1-Flash — komunikat wydaniaEN
- 03DeepSeek 计划 9 月 10 日前后发布 V4.1 Flash 模型 (IT之家)ZH
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.