Osiem kart PCIe i 6,87 raza wyższa przepustowość: oprogramowanie nadrabia sprzęt
Chińska firma 是石科技 podniosła przepustowość wejściową V4.1-Flash na ośmiu kartach PCIe z 1932 do 13274 tokenów na sekundę. Nie zmieniła przy tym ani modelu, ani sprzętu.

Różnica między „model się uruchamia” a „model wydaje sensowną przepustowość” bywa dziś większa niż różnica między generacjami kart. Chiński portal 量子位 opisuje przypadek firmy 是石科技 (METASTONE), która zajmuje się wyłącznie optymalizacją. Nie zmienia struktury modelu ani sprzętu.
Punktem wyjścia jest typowy problem kart bez szybkiego łącza między kartami i bez miejsca w oficjalnej macierzy wsparcia głównych frameworków. Framework nie zgłasza błędu. Po cichu omija przyspieszane ścieżki i schodzi na wolne, ogólne implementacje. Na ośmiu kartach PCIe-only, w bazowej wersji z dnia premiery, V4.1-Flash osiągał przepustowość wejściową 1932 tokenów na sekundę. Zespół uzupełnił brakujące jądra, naprawił ścieżkę szybkiego wstępnego przetwarzania rzadkiej uwagi, zastąpił wolne jądro FP8 dla gęstej operacji GEMM i poszerzył zakres szybkiej komunikacji IPC przez PCIe. Wynik wzrósł do 5850 tokenów na sekundę. To pierwszy etap, nazwany „koordynacją modelu i sprzętu”.
Drugi etap: komunikacja, pamięć, cache
Dopiero potem zaczyna się praca właściwa. Inżynierowie połączyli operatory uwagi i projekcji, ukryli obliczenia w szczelinach komunikacji zbiorowej, przepisali logikę komunikacji pod realną przepustowość PCIe i osobno dostroili strategie równoległości dla fazy wstępnej i fazy generowania. Na końcu dynamicznie doregulowali udziały pamięci statycznej, pojemność KV cache i mechanizm ponownego użycia pamięci. Przepustowość wejściowa wzrosła z 5850 do 13274 tokenów na sekundę, czyli łącznie 6,87 raza, przy zachowaniu kontekstu do miliona tokenów.
Ta sama metodyka działa też na innych modelach. Dla DeepSeek-V4-Flash przepustowość wejściowa wzrosła z 14546 do 22584 tokenów na sekundę (1,55 raza), a dla GLM5.3 z 3236,78 do 6222,72 (1,92 raza). Opóźnienie P95 pierwszego tokenu spadło przy tym z 141,6 sekundy do 46,6 sekundy, a limit kontekstu rozszerzył się z 270 tys. do 1,05 mln tokenów. Sam pierwszy etap dawał na kilku modelach wzrosty rzędu 20–33 proc.
Ile to znaczy względem topowego sprzętu
Autorzy uczciwie pokazują punkt odniesienia. Na tym samym poziomie współbieżności karta B300 ma około 4,9–5,6 raza wyższą przepustowość wejściową od tej ośmiokartowej maszyny (porównanie na DeepSeek-V4-Flash), a dla GLM-5.3 stosunek wynosi 3,5–4,7 raza. Dystans nie znika, ale jest wyraźnie mniejszy, niż sugerowałoby samo porównanie specyfikacji. W generowaniu wideo, na modelu MiniMax H3, 15-sekundowe wideo z obrazu referencyjnego przyspieszyło 2,48 raza. Metodykę sprawdzono też na chińskich kartach GPU. Trzeba było tam jawnie włączyć rzadką uwagę NSA i wyłączyć mechanizmy pisane pod platformy NVIDIA i AMD.
To dobry kontekst dla porównań, w których liczy się nie szczytowa specyfikacja, tylko koszt wytworzenia jednego tokenu na sprzęcie, który naprawdę stoi w serwerowni.
Źródła
2- 01PCIe 显卡被低估了!DeepSeek 推理吞吐翻近 7 倍 (量子位)ZH
- 02DeepSeek V4.1 Flash — prędkość i opóźnienie (Artificial Analysis)EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.