Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

DeepSeek V4.1 Flash: 552 mld parametrów, natywna multimodalność, niższe ceny

10 września czasu pekińskiego DeepSeek udostępnił model V4.1 Flash. Nowa struktura MoE ma 552 mld parametrów, przy odczycie promptu pracuje 8 mld, a zapotrzebowanie KV Cache na HBM spadło do jednej czwartej w stosunku do poprzedniej generacji.

AI i modeleNewsAnna KaczmarekOpublikowano: 10 września 20265 min czytaniaŹródła 3
DeepSeek V4.1 Flash: 552 mld parametrów, natywna multimodalność, niższe ceny

10 września 2026 roku czasu pekińskiego DeepSeek udostępnił model V4.1 Flash. Firma podaje, że to najmniejszy model w nowej serii struktur i że rozumie obrazy natywnie. Model trafił równocześnie do DeepSeek API. Wystarczy zmienić nazwę modelu na deepseek-flash.

V4.1 Flash to model MoE o 552 mld parametrów, zbudowany na nowej architekturze Causal-Encoder-Decoder. Wejście i wyjście nie są symetryczne: przy odczycie promptu pracuje 8 mld parametrów, przy generowaniu odpowiedzi 16 mld. DeepSeek tłumaczy, że nowa struktura ma podnieść górną granicę możliwości, przyspieszyć wnioskowanie i zwiększyć przepustowość. Ma też dać się skalować do modeli o większej liczbie parametrów.

Drugim punktem aktualizacji jest pamięć podręczna. W porównaniu z poprzednią generacją KV Cache w V4.1 Flash potrzebuje o jedną czwartą mniej HBM i o jedną ósmą mniej przestrzeni na SSD. Firma zwraca uwagę, że w zastosowaniach agentowych trafienia w cache odpowiadają za dużą część kosztów, więc kompresja KV Cache mocno obniża wydatki na takie zadania. Podaje też długą krzywą: względem pierwszego modelu KV Cache zmniejszył się 437 razy.

Ceny również się zmieniły. W godzinach poza szczytem trafienie w cache wejściowy kosztuje 0,02 juana za milion tokenów, brak trafienia 1 juana za milion tokenów, a wyjście 4 juany za milion tokenów. W szczycie wszystkie stawki są dwa razy wyższe. Nowy cennik obowiązuje od 10 września 2026 roku, od godziny 12.

Wagi modelu opublikowano na licencji MIT. DeepSeek zapowiada pełne wsparcie dla społeczności open source przy dostosowywaniu wnioskowania i próby rozszerzania zakresu wdrożeń różnymi metodami. Zespoły, które potrzebują wdrożenia na dużą skalę i mają odpowiednie zasoby, mogą się z firmą kontaktować.

Firma podała też, co dzieje się ze starszymi wersjami. V4 Flash oraz V4 Flash Vision Exp zostały wyłączone, ale dla zgodności nazwy deepseek-v4-flash i deepseek-v4-flash-vision-exp są tymczasowo kierowane do V4.1 Flash. DeepSeek planuje też uporządkowane wyłączanie V4 Pro. Po pewnym czasie wszystkie takie żądania będą kierowane do V4.1 Flash i rozliczane według jego stawek. Partnerzy firmy, WorkBuddy (wraz z CodeBuddy) i OpenCode, podłączyli nowy model w pełnym zakresie.

V4.1 Flash obsługuje popularne frameworki wnioskowania, takie jak vLLM, SGLang i TensorRT, oferuje formaty kwantyzacji FP8, BF16, GPTQ, AWG i GGUF, a długość kontekstu sięga 1 mln tokenów. Zespoły w Chinach i za granicą mogą więc podłączyć nowy model do istniejącego stosu wnioskowania przy niskim koszcie zmian.

Komentarze 0

Źródła

3
  1. 01DeepSeek V4.1 Flash:更强、更快、更普惠ZH
  2. 02DeepSeek-V4.1-Flash ReleaseEN
  3. 03DeepSeek V4.1 Flash 模型今日发布,V4 Pro 服务推迟到 9 月 14 日下线ZH

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.