Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

DeepSeek-V4.1-Flash: prawie siedmiokrotny wzrost przepustowości na kartach PCIe

Chiński zespół podaje, że DeepSeek-V4.1-Flash osiągnął skok przepustowości w systemie PCIe bez NVLink. Ten przypadek pokazuje, ile wydajności siedzi w oprogramowaniu.

TechnologiaAnalizaAnna KaczmarekOpublikowano: 24 września 20266 min czytaniaŹródła 2
DeepSeek-V4.1-Flash: prawie siedmiokrotny wzrost przepustowości na kartach PCIe

Ile wydajności siedzi w oprogramowaniu, pokazuje raport z doświadczeń, który portal QbitAI (量子位) opublikował 24 września 2026 roku. Chodzi o chińską firmę METASTONE (是石科技). Jej zespół uruchomił DeepSeek-V4.1-Flash na ośmiu kartach GPU podłączonych wyłącznie przez PCIe, bez NVLink. Zabrakło więc szybkiego sprzężenia, na które takie modele zwykle się projektuje.

Punkt wyjścia i stan końcowy

Jako odniesienie autorzy podają wartość z dnia zerowego: 1.932 tokeny na sekundę dla przepustowości wejściowej. Po pierwszym przejściu z poprawkami jąder, szybszym wyborem ścieżki dla wstępnego przetwarzania opartego na sparse attention, wymienionymi jądrami FP8 dense GEMM i przyspieszoną ścieżką PCIe IPC system osiągał już 5.850 tokenów na sekundę. Potem przyszły kolejne optymalizacje: fuzja operatorów attention, krótsze szkice przy dekodowaniu spekulatywnym, przeplatanie obliczeń z komunikacją i parametry pamięci. System doszedł do 13.274 tokenów na sekundę, czyli około 6,87 razy więcej niż na starcie. Długość kontekstu do miliona tokenów udało się przy tym utrzymać.

Pomiary porównawcze pokazują, że to nie pojedynczy wynik. DeepSeek-V4-Flash wzrósł z 14.546 do 22.584 tokenów na sekundę w przepustowości wejściowej, czyli o czynnik 1,55. Model GLM 5.3 poprawił się z 3.236,78 do 6.222,72 tokenów na sekundę.

Dlaczego to istotne dla Niemiec

Raport ma dwa poziomy. Pierwszy jest techniczny: modele działające na sprzęcie bez szybkiego połączenia pośredniego tracą dużą część przewagi wydajności nie na rzecz sprzętu, lecz na rzecz ścieżek pamięci i komunikacji. Kto te ścieżki optymalizuje, ten zyskuje czynniki, nie punkty procentowe.

Drugi poziom dotyczy eksploatacji. DeepSeek-V4.1-Flash opublikowano 10 września 2026 roku. Model ma 552 miliardy parametrów w układzie Mixture-of-Experts i aktywuje 8 miliardów parametrów w prefill oraz 16 miliardów w decode. Pamięć KV cache wynosi 890 bajtów na token, czyli około jednej czwartej wartości V4-Flash. Model jest dostępny na licencji MIT, przetwarza obrazy do 384 tokenów na obraz i można go uruchamiać przez vLLM, SGLang lub TensorRT; obsługiwane są FP8, BF16, GPTQ, AWQ i GGUF.

METASTONE podaje, że zarządza ponad 20.000 petaflopsów mocy obliczeniowej, prowadzi ponad dziesięć inteligentnych centrów danych i dwa krajowe centra superkomputerowe; jako referencję wymienia trzy nagrody Gordona Bella. Dla lokalnej inferencji właściwym przesłaniem raportu jest przesunięcie tworzenia wartości: nie decyduje zakup nowego sprzętu, lecz umiejętność opanowania hierarchii pamięci i współbieżności dla konkretnego modelu.

Sześć razy szybciej bez nowego sprzętu. Różnica między 1.932 a 13.274 tokenami na sekundę to oprogramowanie.

Komentarze 0

Źródła

2
  1. 01量子位 (QbitAI): 8卡PCIe纯软优化, DeepSeek-V4.1-Flash 吞吐提升 6.87 倍ZH
  2. 02Hugging Face: DeepSeek-V4.1-Flash model card (552B MoE, MIT, 1M context)EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.