Inferencja: chiński silnik przyspiesza DeepSeek V4.1 Flash 6,87 razy na kartach PCIe
Na ośmiu kartach PCIe bez szybkiej magistrali silnik Meta-Infer firmy METASTONE podniósł przepływ z 1 932 do 13 274 tokenów na sekundę. Zespół poprawił kernele i komunikację w warstwie oprogramowania, nie zmieniając modelu.

Spór o układy do AI zmienia temat. Nie chodzi już tylko o to, kto kupi najwydajniejszy sprzęt, ale kto lepiej wykorzysta ten, który ma. Taką tezę stawia chińska firma METASTONE, o której pisze 量子位 (QbitAI), przez swój silnik inferencji Meta-Infer.
Szczelina między frameworkiem a sprzętem
Wiele kart graficznych potrafi wczytać model, pobrać wagi i uruchomić usługę. Działają. Ich rzeczywista wydajność w teście obciążeniowym bywa jednak znacznie niższa od deklarowanej. Model nie ma wady, sprzęt się nie zepsuł: strata bierze się z rozjazdu między frameworkiem a sprzętem. Karty nie mają między sobą szybkiej magistrali i nie trafiają do oficjalnych macierzy walidacyjnych otwartych frameworków. Efekt: operatory po cichu schodzą do mało wydajnych implementacji ogólnych, parametry komunikacji zostają skalibrowane pod inne architektury, a konfiguracja pamięci i równoległości przejmuje wartości domyślne przewidziane dla innego sprzętu.
Sześć i osiemdziesiąt siedem setnych razy większy przepływ
Meta-Infer bierze się za ten problem wyłącznie w warstwie oprogramowania. Nie zmienia struktury modelu ani semantyki zadań. Podejście dzieli się na cztery części: uzupełnienie kerneli, optymalizacja operatorów i przebudowa komunikacji, dostrojenie równoległości i pojemności pamięci, wreszcie ponowne użycie cache.
Pierwsza część poprawia metadane i rozmiary stron, które blokują uruchomienie natywnych zoptymalizowanych operatorów, zastępuje stare, niedopasowane kernele i podnosi próg szybkich ścieżek komunikacji. W środowisku ośmiu kart PCIe, ze wspólnotową wersją referencyjną dla DeepSeek-V4.1-Flash, przepływ wejściowy wynosił tylko 1 932 tokeny na sekundę. Po tej fazie poprawek rośnie do 5 850 tokenów na sekundę.
Druga część bierze się za wąskie gardła. Na architekturze PCIe przepustowość między kartami jest dużo niższa niż w dedykowanej magistrali, a domyślne strategie sprawiają, że czas schodzi na czekanie na komunikację. Zespół scalił operatory, przykrył obliczenia komunikacją i przepisał logikę komunikacji zbiorowej. Silnik osiąga 13 274 tokeny na sekundę, czyli 6,87 razy więcej, przy obsłudze bardzo długiego kontekstu.
Metodologia ma być uniwersalna: na innym modelu przepływ wejściowy rośnie z 14 546 do 22 584 tokenów na sekundę. Już sam etap wspólnej adaptacji daje kilku modelom od 20 % do 33 % większy przepływ.
Zewnętrzny operator
METASTONE przedstawia się jako niezależny operator obliczeń od początku do końca, niepowiązany z dostawcą modeli. Firma podaje, że zarządza ponad 20 000 petaflopsów zasobów, prowadzi kilkanaście inteligentnych centrów obliczeniowych i dwa krajowe centra superkomputerowe, z deklarowaną dostępnością powyżej 99,95 %. Jej zespół ma na koncie trzy nagrody Gordon Bell.
Gdy sprzęt jest ograniczony, optymalizacja oprogramowania staje się główną dźwignią wydajności.
Źródła
2- 01量子位 (QbitAI) : PCIe 显卡被低估了 — DeepSeek 推理吞吐翻近 7 倍ZH
- 02量子位 (QbitAI) : page d'accueil de la rédactionZH
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.