1,5 karty za jedną B300: jak z PCIe wyciskano 6,87 razy więcej przepustowości
Chiński operator Meta-Infer pokazał na ośmiu kartach PCIe wzrost przepustowości DeepSeek-V4.1-Flash z 1932 do 13274 tokenów na sekundę. Modelu nie zmienił, poprawił stos oprogramowania.

Chiński portal qbitai (量子位) opisał prace firmy 是石科技 (METASTONE). Firma wzięła osiem kart graficznych połączonych wyłącznie szyną PCIe, bez szybkiej magistrali między kartami, i uruchomiła na nich model DeepSeek-V4.1-Flash. Uzyskane przyspieszenie trudno uznać za kosmetykę.
Punktem wyjścia był zwykły, wspólnotowy zestaw uruchomieniowy. Na tym samym sprzęcie przepustowość wejściowa wynosiła 1932 tokeny na sekundę. Po pierwszym etapie optymalizacji wzrosła do 5850 tokenów na sekundę. Na ten etap złożyły się trzy zmiany: uzupełnienie brakujących jąder obliczeniowych, podmiana wolnego jądra FP8 i poszerzenie zakresu szybkiej ścieżki komunikacji. Drugi etap, czyli fuzja operatorów uwagi, nakładanie obliczeń na komunikację i osobne strategie równoległości dla fazy wstępnej i generowania, podniósł wynik do 13274 tokenów na sekundę. Łącznie 6,87 razy więcej przy kontekście do miliona tokenów.
Ta sama metoda, inne modele
METASTONE podaje, że ten sam sposób działa szerzej. Na modelu DeepSeek-V4-Flash przepustowość wejściowa wzrosła z 14546 do 22584 tokenów na sekundę, czyli 1,55 razy. W przypadku GLM5.3 skok był z 3236,78 do 6222,72 tokenów na sekundę (1,92 razy), opóźnienie P95 pierwszego tokenu spadło ze 141,6 do 46,6 sekundy, a obsługiwany kontekst wzrósł z 270 tysięcy do 1,05 miliona tokenów. Firma utrzymuje też, że metodologia sprawdza się na krajowych, chińskich akceleratorach. Te podobnie jak karty PCIe nie są wpisane do oficjalnych matryc wsparcia popularnych frameworków.
W tle jest logistyka operatora. Według własnych danych METASTONE zarządza ponad 20 000 P mocy obliczeniowej, prowadzi kilkanaście centrów obliczeniowych dla AI i dwa narodowe centra superkomputerowe, a dostępność klastrów deklaruje na poziomie SLA powyżej 99,95 procent. Zespół ma mieć na koncie trzy nagrody Gordona Bella.
Ile jeszcze dzieli od flagowca
Uczciwe porównanie wygląda mniej efektownie niż nagłówek o siedmiokrotnym wzroście. W tym samym punkcie obciążenia karta B300 osiągała około 4,9–5,6 razy większą przepustowość wejściową niż ośmiokartowa maszyna na PCIe. W zadaniach generowania wideo z jednego obrazu przewaga zawężała się do 1,5–1,7 maszyny na jedną kartę B300, gdy użyto dodatkowo LoRA. Tanie karty nie dogonią topowego sprzętu, ale różnica przestaje być przepaścią.
Karta, której nikt nie wpisał do matrycy wsparcia frameworka, nie traci mocy. Traci ją na rzecz domyślnych, zachowawczych ustawień.
Dla odbiorcy poza Chinami wniosek jest praktyczny. Większość wdrożeń na własnym sprzęcie to serwery vLLM albo SGLang na kartach, które nie są flagowcami. Wartością dodaną nie jest kolejna karta, lecz inżynieria: poprawne jądra, komunikacja dopasowana do realnej przepustowości łącza i różne strategie równoległości dla fazy wstępnej i generowania. DeepSeek-V4.1-Flash z 552 miliardami parametrów i architekturą MoE, dostępny na licencji MIT, jest dziś dobrym poligonem dla takich eksperymentów. Sam model ma KV cache wielkości 890 bajtów na token, czyli około czterokrotnie mniejszy niż V4-Flash.
Źródła
3- 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
- 02DeepSeek-V4.1-Flash – model cardEN
- 03Artificial Analysis: DeepSeek V4.1 FlashEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.