Wyścig o koszt inferencji: Quail twierdzi, że przetwarza miliard tokenów na minutę, Magnitude dostraja jądra na urządzeniu
Dwa zespoły inżynierskie opublikowały 30 września osobne twierdzenia, że koszt uruchamiania otwartych modeli można obniżyć, przepisując sposób, w jaki silniki inferencji obsługują sprzęt i strukturę zapytań, a nie czekając na tańsze karty GPU.

Modal i Full Stack Data Lab z Carnegie Mellon University podały 30 września, że Quail, wspólnie zbudowany przez nie silnik inferencji, przetworzył ponad miliard tokenów na minutę na jednej karcie H100 przy jednym zapytaniu AI-SQL z wieloma złączeniami. To ponad 10 razy więcej niż ich punkt odniesienia na vLLM na tym samym sprzęcie, jak podano w wpisie na blogu Modal, co daje mniej niż 6 centów za miliard tokenów w chmurze Modal.
Twierdzenie opiera się na konkretnym obciążeniu. AI-SQL rozszerza zwykły SQL o funkcje wywołujące model językowy, więc filtr może uruchamiać jedno wywołanie modelu na wiersz, a złączenie jedno na parę wierszy. Opis techniczny Full Stack Data Lab przedstawia zapytanie benchmarkowe BIO-4 na 5 000 raportów medycznych i 4 144 terminach reakcji. Uruchomienie go na vLLM 0.26.0 z Qwen3 4B FP8 na jednej H100 zajęło 6,84 godziny przy współczynniku skali 1,0. Według autorów to 27,55 razy więcej niż szacunek roofline wynoszący 14,91 minuty.
Praca nad silnikiem, nie nad krzemem
Ta różnica jest argumentem. Autorzy przypisują stratę narzutowi hosta: procesor planuje żądania, a H100 stoi bezczynnie. Drugi powód to tak zwany żal KV, czyli to, że vLLM odrzuca pamięć podręczną kluczy i wartości, której później znów potrzebuje. Blog laboratorium podaje, że zapytanie przetworzyło 174 600 000 tokenów zmarnowanej pracy KV. Quail zamiast tego przyjmuje plan zapytania jako dane wejściowe, dzięki czemu może uporządkować żądania tak, by ponownie użyć pamięci podręcznej i celowo ją usuwać.
Oba opisy nie kładą nacisku na to samo. Modal przedstawia wynik wokół jednego najlepszego zapytania i liczby miliarda tokenów na minutę. Full Stack Data Lab podaje z kolei, że Quail działa 1,84 razy szybciej niż vLLM, gdy uśrednić geometrycznie wyniki w nowym benchmarku AI-SQL, w tym w dwóch zapytaniach, które autorzy zaprojektowali, by ujawnić pozostałe słabości. Obydwa zestawy liczb pochodzą z tej samej współpracy, więc nie są niezależnym potwierdzeniem.
Tego samego dnia Magnitude, firma z programu Y Combinator S25, otworzyła kod swojego silnika inferencji na licencji Apache 2.0. Jej repozytorium na GitHubie twierdzi, że otwarte modele działają do 2 razy szybciej niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA. Mechanizm jest inny niż w Quail: Magnitude kompiluje i dostraja jądra na urządzeniu użytkownika przed uruchomieniem modelu, celując w Apple Silicon, Nvidię, AMD albo zwykły procesor. Repozytorium podaje też o 27% mniejsze zużycie pamięci na agenta i współdzielenie pamięci podręcznej prefiksów między równoczesnymi sesjami.
Kontekstem dla obu wydań jest rynek, na którym ceny katalogowe nie spadają równomiernie. Wrześniowy przegląd AICostBudget, zamrożony na granicy 30 września czasu UTC, obejmuje 81 publicznych rekordów cenowych od 11 dostawców. Mediana wejścia wynosi 1,32 dolara za milion tokenów, a mediana wyjścia 6 dolarów, czyli stosunek 5,0 razy. Mediana rabatu na wejście z pamięci podręcznej to 90%, a ceny wsadowe 50%. To wyjście, a nie wczytywanie promptu, jest zwykle droższym składnikiem.
Prace na poziomie sprzętu mierzy się też energią, a nie wykorzystaniem. Artykuł opublikowany na SOSP '26 28 września, Beyond Utilization, przekonuje, że optymalizacja multipleksowania GPU wyłącznie pod kątem wykorzystania może podnieść zużycie energii. Ich system EnerTune korzysta z analitycznych modeli poboru mocy przez poszczególne modele oraz poboru mocy modeli współlokowanych. Autorzy podają spadki energii od 1,4 do 2,3 razy i spadki mocy od 1,3 do 2,6 razy względem nienazwanych najlepszych rozwiązań, przy zachowaniu celów wydajnościowych.
Jedna uwaga ostrzegawcza pochodzi z zupełnie innego obszaru niż infrastruktura. Gaurav Kogan z Pinecone opisał 30 września, jak firma usunęła swój kalkulator cen opartych na zużyciu po teście A/B. Odwiedzający, którzy go nie widzieli, o 16% częściej się rejestrowali i o 90% częściej nawiązywali kontakt, bez wzrostu liczby zgłoszeń do wsparcia w sprawie cen, napisał. Wniosek się przenosi: narzędzie mające wyjaśniać koszt może wypaczać decyzję, do której powstało.
Źródła
6- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Building an Ultra-High Throughput AI-SQL EngineEN
- 03Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.