Quail i Magnitude obniżają koszty wnioskowania
Modal i Full Stack Data Lab z Carnegie Mellon poinformowały 30 września, że ich silnik Quail przetworzył ponad miliard tokenów na minutę na jednym GPU H100, ponad 10 razy więcej niż ich bazowy vLLM. Firma wyceniła tę pracę na mniej niż 6 centów za miliard tokenów na platformie Modal.

Ta deklaracja pojawia się tego samego dnia, w którym wspierany przez Y Combinator projekt Magnitude udostępnił otwartoźródłowy silnik wnioskowania. Silnik sam dostraja swoje jądra na sprzęcie użytkownika. Oba projekty mówią o tym samym: model przestał być drogą częścią. Droga jest warstwa obsługi.
Quail to wspólna praca badaczy wnioskowania z Modal i badaczy baz danych z Full Stack Data Lab na Carnegie Mellon. Opisano ją we wpisie z 30 września na blogu Modal oraz w towarzyszącym tekście laboratorium. Problem, który autorzy atakują, to AI-SQL, gdzie zapytania SQL wywołują modele językowe wiersz po wierszu. Jeden filtr wymaga jednego wywołania modelu na wiersz. Naiwne złączenie wymaga jednego wywołania dla każdej pary wierszy. Własne zapytanie referencyjne laboratorium, BIO-4, filtruje 5 000 raportów medycznych względem 4 144 terminów działań niepożądanych, a potem złącza je dwukrotnie. W ich wpisie szacowany czas działania z prędkością światła to 894,37 sekundy, czyli 14,91 minuty. Podstawą jest model roofline, który zakłada szczytową przepustowość GPU, pełne nakładanie się pracy CPU i GPU oraz nieograniczoną przestrzeń KV cache.
Uruchomienie vLLM 0.26.0 z Qwen3 4B FP8 na jednym H100 przy współczynniku skali 1,0 zajęło 6,84 godziny, twierdzi laboratorium. To 27,55 razy więcej niż szacunek idealny.
Autorzy wskazują dwie przyczyny. Pierwsza to narzut hosta: CPU planuje żądania, a GPU stoi bezczynnie. Druga to tak zwany żal KV, gdzie vLLM wyrzuca stan klucz-wartość, którego znów potrzebuje. Laboratorium dolicza się 174,6 miliona zmarnowanych tokenów w tym przebiegu.
Na jednym zapytaniu z wielokrotnym złączeniem, gdzie planowanie jest szczególnie ważne, Quail osiąga ponad miliard tokenów przetworzonych na minutę na GPU H100 (TPM/GPU), ponad 10 razy szybciej niż nasz bazowy vLLM na tym samym sprzęcie.
Wpis Modal przypisuje to zwycięstwo znajomości struktury zapytania z góry. Dzięki niej silnik lepiej uporządkowuje żądania pod kątem buforowania i usuwania stanu KV. Wymagało to zmiany uwagi kaskadowej w stylu Hydragen. W całym zestawie testów Quail działa 1,84 razy szybciej niż vLLM, średnio geometrycznie. W tym w dwóch zapytaniach, które autorzy zaprojektowali, by pokazać, gdzie wnioskowanie AI-SQL wciąż wymaga pracy.
Magnitude stawia na twój własny krzem
Magnitude, notowany jako spółka YC S25, wybrał przeciwną drogę do tego samego problemu kosztów. Jego README na GitHubie, zaktualizowane 30 września, opisuje silnik, który kompiluje i dostraja jądra na urządzeniu użytkownika przed uruchomieniem modelu, zamiast dostarczać wstępnie skompilowane jądra dla klas sprzętu. Projekt twierdzi, że jest do 2 razy szybszy niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA, a także o 27% mniejszym zużyciem pamięci na agenta. Działa na Apple Silicon, NVIDIA, AMD albo samym CPU. Łączy się z agentami takimi jak Pi, OpenCode, Hermes, Codex i Claude Code jednym kliknięciem i ma licencję Apache 2.0. Prompty, pliki i modele zostają lokalnie, czytamy w README.
Oba projekty gonią tę samą ekonomię.
Indeks cen opublikowany 30 września przez AICostBudget obejmuje 81 publicznych rekordów od 11 dostawców. Podaje medianę ceny wejścia na 1,32 dolara za milion tokenów i medianę ceny wyjścia na 6 dolarów. Wyjście kosztuje około pięć razy więcej niż wejście przy medianie. Ten sam zapis pokazał medianę rabatu za buforowane wejście na poziomie 90% w 58 porównywalnych rekordach i medianę rabatu za wsad na poziomie 50% w 44. To szczegół istotny dla każdego, kto uruchamia AI-SQL. Obciążenia, które da się wsadzić i buforować, płacą ułamek ceny katalogowej. Te, których nie da się, płacą pełną stawkę.
Rachunek przychodzi gdzie indziej
Energia to druga liczba w pokoju.
Praca przedstawiona na SOSP '26 28 września, autorstwa Prasoona Sinhy, Dimitriosa Liakopoulosa, Nathana Lemmy i Neerai J. Yadwadkar, dowodzi, że optymalizowanie klastrów GPU wyłącznie pod wykorzystanie może podnieść zużycie energii. Ich system, EnerTune, korzysta z analitycznych modeli wydajności i mocy dla poszczególnych modeli, w tym poboru mocy modeli współdzielących jeden GPU, oraz z algorytmu pakowania z uwzględnieniem energii. Autorzy raportują 1,4 do 2,3 razy niższą energię i 1,3 do 2,6 razy niższy pobór mocy niż najnowsze rozwiązania bazowe, przy zachowaniu celów wydajnościowych.
Autorzy Quaila nie twierdzą, że ich test rozstrzyga cokolwiek. Mówią, że dwa zapytania zaprojektowano, by pokazać, gdzie wnioskowanie AI-SQL wymaga poprawy. Średnią geometryczną 1,84 traktują jako punkt wyjścia, nie pułap. Idealne 14,91 minuty laboratorium pozostaje ideałem: żadna implementacja nie spełni wszystkich jego założeń.
Jeszcze jeden punkt danych, z drugiej strony sporu o ceny.
Wpis z 30 września autorstwa Gagana Kogana, relacjonujący pracę w Pinecone, opisuje test A/B. Usunięcie kalkulatora cen opartych na zużyciu ze strony z cennikiem sprawiło, że odwiedzający o 16% częściej się rejestrowali i o 90% częściej kontaktowali się z firmą, bez wzrostu liczby zgłoszeń do wsparcia w sprawie cen. Siedmiu na dziesięciu pracowników przewidywało, że kalkulator wygra. Przejrzystość kosztów okazuje się swojego rodzaju złożonością.
Dla kupujących praktyczny wniosek jest węższy niż nagłówki. Cena za token spada w przypadku obciążeń ustrukturyzowanych, które da się buforować, a dostawcy publikują progi, które ten spadek umożliwiają. Infrastruktura pod spodem, GPU, energia i planowanie między nimi, to miejsce, gdzie teraz toczy się walka o koszty.
Źródła
6- 01Building an Ultra-High Throughput AI-SQL EngineEN
- 02Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
- 03magnitudedev/magnitude: Open source inference engine for agentsEN
- 04AI API Pricing Index, September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06The pricing calculator made people more confused about pricingEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.