Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Inferencja: chiński silnik przyspiesza DeepSeek V4.1 Flash 6,87 razy na kartach PCIe

Na ośmiu kartach PCIe bez szybkiej magistrali silnik Meta-Infer firmy METASTONE podniósł przepływ z 1 932 do 13 274 tokenów na sekundę. Zespół poprawił kernele i komunikację w warstwie oprogramowania, nie zmieniając modelu.

TechnologiaAnalizaAnna KaczmarekOpublikowano: 24 września 20266 min czytaniaŹródła 2
Inferencja: chiński silnik przyspiesza DeepSeek V4.1 Flash 6,87 razy na kartach PCIe

Spór o układy do AI zmienia temat. Nie chodzi już tylko o to, kto kupi najwydajniejszy sprzęt, ale kto lepiej wykorzysta ten, który ma. Taką tezę stawia chińska firma METASTONE, o której pisze 量子位 (QbitAI), przez swój silnik inferencji Meta-Infer.

Szczelina między frameworkiem a sprzętem

Wiele kart graficznych potrafi wczytać model, pobrać wagi i uruchomić usługę. Działają. Ich rzeczywista wydajność w teście obciążeniowym bywa jednak znacznie niższa od deklarowanej. Model nie ma wady, sprzęt się nie zepsuł: strata bierze się z rozjazdu między frameworkiem a sprzętem. Karty nie mają między sobą szybkiej magistrali i nie trafiają do oficjalnych macierzy walidacyjnych otwartych frameworków. Efekt: operatory po cichu schodzą do mało wydajnych implementacji ogólnych, parametry komunikacji zostają skalibrowane pod inne architektury, a konfiguracja pamięci i równoległości przejmuje wartości domyślne przewidziane dla innego sprzętu.

Sześć i osiemdziesiąt siedem setnych razy większy przepływ

Meta-Infer bierze się za ten problem wyłącznie w warstwie oprogramowania. Nie zmienia struktury modelu ani semantyki zadań. Podejście dzieli się na cztery części: uzupełnienie kerneli, optymalizacja operatorów i przebudowa komunikacji, dostrojenie równoległości i pojemności pamięci, wreszcie ponowne użycie cache.

Pierwsza część poprawia metadane i rozmiary stron, które blokują uruchomienie natywnych zoptymalizowanych operatorów, zastępuje stare, niedopasowane kernele i podnosi próg szybkich ścieżek komunikacji. W środowisku ośmiu kart PCIe, ze wspólnotową wersją referencyjną dla DeepSeek-V4.1-Flash, przepływ wejściowy wynosił tylko 1 932 tokeny na sekundę. Po tej fazie poprawek rośnie do 5 850 tokenów na sekundę.

Druga część bierze się za wąskie gardła. Na architekturze PCIe przepustowość między kartami jest dużo niższa niż w dedykowanej magistrali, a domyślne strategie sprawiają, że czas schodzi na czekanie na komunikację. Zespół scalił operatory, przykrył obliczenia komunikacją i przepisał logikę komunikacji zbiorowej. Silnik osiąga 13 274 tokeny na sekundę, czyli 6,87 razy więcej, przy obsłudze bardzo długiego kontekstu.

Metodologia ma być uniwersalna: na innym modelu przepływ wejściowy rośnie z 14 546 do 22 584 tokenów na sekundę. Już sam etap wspólnej adaptacji daje kilku modelom od 20 % do 33 % większy przepływ.

Zewnętrzny operator

METASTONE przedstawia się jako niezależny operator obliczeń od początku do końca, niepowiązany z dostawcą modeli. Firma podaje, że zarządza ponad 20 000 petaflopsów zasobów, prowadzi kilkanaście inteligentnych centrów obliczeniowych i dwa krajowe centra superkomputerowe, z deklarowaną dostępnością powyżej 99,95 %. Jej zespół ma na koncie trzy nagrody Gordon Bell.

Gdy sprzęt jest ograniczony, optymalizacja oprogramowania staje się główną dźwignią wydajności.

Komentarze 0

Źródła

2
  1. 01量子位 (QbitAI) : PCIe 显卡被低估了 — DeepSeek 推理吞吐翻近 7 倍ZH
  2. 02量子位 (QbitAI) : page d'accueil de la rédactionZH

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.