Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

1,5 karty za jedną B300: jak z PCIe wyciskano 6,87 razy więcej przepustowości

Chiński operator Meta-Infer pokazał na ośmiu kartach PCIe wzrost przepustowości DeepSeek-V4.1-Flash z 1932 do 13274 tokenów na sekundę. Modelu nie zmienił, poprawił stos oprogramowania.

TechnologiaAnalizaAnna KaczmarekOpublikowano: 25 września 20267 min czytaniaŹródła 3
1,5 karty za jedną B300: jak z PCIe wyciskano 6,87 razy więcej przepustowości

Chiński portal qbitai (量子位) opisał prace firmy 是石科技 (METASTONE). Firma wzięła osiem kart graficznych połączonych wyłącznie szyną PCIe, bez szybkiej magistrali między kartami, i uruchomiła na nich model DeepSeek-V4.1-Flash. Uzyskane przyspieszenie trudno uznać za kosmetykę.

Punktem wyjścia był zwykły, wspólnotowy zestaw uruchomieniowy. Na tym samym sprzęcie przepustowość wejściowa wynosiła 1932 tokeny na sekundę. Po pierwszym etapie optymalizacji wzrosła do 5850 tokenów na sekundę. Na ten etap złożyły się trzy zmiany: uzupełnienie brakujących jąder obliczeniowych, podmiana wolnego jądra FP8 i poszerzenie zakresu szybkiej ścieżki komunikacji. Drugi etap, czyli fuzja operatorów uwagi, nakładanie obliczeń na komunikację i osobne strategie równoległości dla fazy wstępnej i generowania, podniósł wynik do 13274 tokenów na sekundę. Łącznie 6,87 razy więcej przy kontekście do miliona tokenów.

Ta sama metoda, inne modele

METASTONE podaje, że ten sam sposób działa szerzej. Na modelu DeepSeek-V4-Flash przepustowość wejściowa wzrosła z 14546 do 22584 tokenów na sekundę, czyli 1,55 razy. W przypadku GLM5.3 skok był z 3236,78 do 6222,72 tokenów na sekundę (1,92 razy), opóźnienie P95 pierwszego tokenu spadło ze 141,6 do 46,6 sekundy, a obsługiwany kontekst wzrósł z 270 tysięcy do 1,05 miliona tokenów. Firma utrzymuje też, że metodologia sprawdza się na krajowych, chińskich akceleratorach. Te podobnie jak karty PCIe nie są wpisane do oficjalnych matryc wsparcia popularnych frameworków.

W tle jest logistyka operatora. Według własnych danych METASTONE zarządza ponad 20 000 P mocy obliczeniowej, prowadzi kilkanaście centrów obliczeniowych dla AI i dwa narodowe centra superkomputerowe, a dostępność klastrów deklaruje na poziomie SLA powyżej 99,95 procent. Zespół ma mieć na koncie trzy nagrody Gordona Bella.

Ile jeszcze dzieli od flagowca

Uczciwe porównanie wygląda mniej efektownie niż nagłówek o siedmiokrotnym wzroście. W tym samym punkcie obciążenia karta B300 osiągała około 4,9–5,6 razy większą przepustowość wejściową niż ośmiokartowa maszyna na PCIe. W zadaniach generowania wideo z jednego obrazu przewaga zawężała się do 1,5–1,7 maszyny na jedną kartę B300, gdy użyto dodatkowo LoRA. Tanie karty nie dogonią topowego sprzętu, ale różnica przestaje być przepaścią.

Karta, której nikt nie wpisał do matrycy wsparcia frameworka, nie traci mocy. Traci ją na rzecz domyślnych, zachowawczych ustawień.

Dla odbiorcy poza Chinami wniosek jest praktyczny. Większość wdrożeń na własnym sprzęcie to serwery vLLM albo SGLang na kartach, które nie są flagowcami. Wartością dodaną nie jest kolejna karta, lecz inżynieria: poprawne jądra, komunikacja dopasowana do realnej przepustowości łącza i różne strategie równoległości dla fazy wstępnej i generowania. DeepSeek-V4.1-Flash z 552 miliardami parametrów i architekturą MoE, dostępny na licencji MIT, jest dziś dobrym poligonem dla takich eksperymentów. Sam model ma KV cache wielkości 890 bajtów na token, czyli około czterokrotnie mniejszy niż V4-Flash.

Komentarze 0

Źródła

3
  1. 01量子位 (qbitai): PCIe显卡被低估了 — 内核补齐+通信重构ZH
  2. 02DeepSeek-V4.1-Flash – model cardEN
  3. 03Artificial Analysis: DeepSeek V4.1 FlashEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.