Silnik wnioskowania Quail przekracza miliard tokenów na minutę, a ceny u dostawców rosną
Quail, silnik wnioskowania zbudowany przez Full Stack Data Lab, przetworzył ponad miliard tokenów na minutę na jednym GPU H100. Wyniki opublikowano 30 września. To ponad 10 razy szybciej niż vLLM na tym samym sprzęcie i poniżej 6 centów za miliard tokenów na Modal.

Te liczby pojawiają się w momencie, gdy moc obliczeniowa GPU drożeje. AWS miał zgłosić 15-procentową podwyżkę cen mocy GPU od 7 października, a Nebius podniósł ceny wnioskowania o 18,3 procent pod koniec września, wynika z osobnych doniesień. Na tym tle seria projektów warstwy wnioskowania opublikowała w tym tygodniu wyniki testów, które atakują koszty od strony oprogramowania.
Quail, skrót od QUery-Aware Inference Layer, wyszedł z Full Stack Data Lab. Zespół opisuje go jako wspólną optymalizację planisty zapytań SQL i silnika wnioskowania, zbudowaną dla AI-SQL: SQL rozszerzonego o funkcje definiowane przez użytkownika, które wywołują LLM. Własny opis testów silnika podaje 1,84 razy szybciej niż vLLM, uśredniając geometrycznie po zadaniach. Wśród nich są dwa zapytania zaprojektowane przez autorów, żeby pokazać, gdzie wnioskowanie AI-SQL wciąż wymaga pracy.
To obciążenie nie przypomina czatbota.
Funkcja AI ocenia swój prompt wiersz po wierszu, więc jedno zapytanie SQL może wygenerować setki tysięcy albo miliony wywołań modelu, czytamy w technicznym wpisie laboratorium z 30 września. Filtr potrzebuje jednego wywołania LLM na wiersz. Naiwne złączenie potrzebuje jednego wywołania dla każdej pary wierszy z dwóch tabel wejściowych. Wysyłanie ich jako osobnych żądań do silnika ogólnego przeznaczenia, takiego jak vLLM, wiąże się z dużym narzutem, przekonuje wpis, bo żądania dzielą prefiksy, które można by wykorzystać ponownie.
Zapytanie BIO-4 z benchmarku QUAIL-B pokazuje skalę: 5 000 długich raportów medycznych złączonych z 4 144 terminami reakcji, przy czym lista reakcji jest użyta dwa razy do dwóch złączeń. Plan filtruje zbiory terminów pod kątem reakcji sercowo-naczyniowych i neurologicznych, a potem łączy ocalałe raporty z każdym z nich. Naiwne wykonanie oznaczałoby jeden prompt na wejście filtra i jeden na każdą rozważaną parę raport-reakcja.
Quail odpowiada na to wzajemnym uświadomieniem planisty i silnika. Silnik jest opublikowany w wersji 0.1.0, z przykładem, który uruchamia zapytanie na zbiorze IMDB z qwen3-4b-fp8 na urządzeniu h100-sxm. Opis testów podaje miliard tokenów na minutę na jednym zapytaniu z wieloma złączeniami, tam gdzie planowanie ma największe znaczenie. To ponad 10 razy szybciej niż vLLM na identycznym sprzęcie.
Modal, który hostuje demo, podaje koszt poniżej 6 centów za miliard tokenów. Ta liczba dotyczy konkretnego profilu zapytania: małych modeli o otwartych wagach, podejmujących krótkie, ograniczone decyzje, a nie długich łańcuchów agentowych. Autorzy z laboratorium wymieniają DocETL z UC Berkeley, LOTUS ze Stanford, Palimpzest z MIT i ThalamusDB z Cornell wśród systemów akademickich w tej samej dziedzinie. Technikom takim jak MOAR, Task Cascades, Abacus i BARGAIN przypisują zasługę w ograniczaniu liczby wywołań i rozmiarów modeli.
Twierdzą, że nawet po tych optymalizacjach plan wciąż może wymagać setek tysięcy albo milionów wywołań. I właśnie tu silnik zbudowany do tego celu zarabia na siebie.
Quail nie jest sam w celowaniu w lokalny sprzęt. Magnitude, spółka z YC S25, uruchomiła 30 września otwartoźródłowy silnik wnioskowania dla agentów i opublikowała go na GitHubie na licencji Apache 2.0. Jej README twierdzi, że otwarte modele działają do 2 razy szybciej niż llama.cpp. Rozbija to na 92 procent szybsze dekodowanie na Metal i 19 procent na CUDA. Mechanizm to kompilacja i dostrajanie jąder na własnym urządzeniu użytkownika przed uruchomieniem modelu, a nie dostarczanie wstępnie skompilowanych jąder dla szerokich klas sprzętu.
Magnitude twierdzi też, że zużywa 27 procent mniej pamięci na agenta, zwalnianej, gdy agenci kończą pracę, i że współdzieli pamięć podręczną prefiksów między równoległymi sesjami. Obsługuje Apple Silicon, NVIDIA, AMD albo sam CPU. Łączy się z Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi i Cline, z API zgodnym z OpenAI dla wszystkiego innego. Firma mówi, że prompty, pliki i modele zostają na maszynie, a po pobraniu modelu internet nie jest potrzebny.
Oba projekty sprzedają tę samą ekonomię: przenieść wnioskowanie z rozliczanych w chmurze punktów końcowych na sprzęt, który nabywca już ma albo wynajmuje za stałą stawkę. Dane o cenach podpowiadają, dlaczego ten przekaz trafia.
Wrześniowy indeks cen AICostBudget, zamrożony na 30 września, obejmuje 81 publicznych rekordów od 11 dostawców. Mediana ceny wejścia wśród 69 niepustych wartości to 1,32 dolara za milion tokenów; mediana ceny wyjścia to 6 dolarów. Mediana wyjścia jest 5,0 razy wyższa od wejścia. Obserwowane przedziały są szerokie: wejście od 0,10 do 30 dolarów za milion tokenów, wyjście od 0,10 do 180 dolarów.
Indeks pokazuje też struktury rabatów, które sprawiają, że ceny z nagłówków mylą. Wśród 58 porównywalnych rekordów mediana rabatu na wejście z pamięci podręcznej wynosi 90 procent, a obserwowany przedział to 75 do 98 procent. Wśród 44 rekordów obsługujących przetwarzanie wsadowe mediana rabatu Batch na wejście to 50 procent, obserwowany przedział 20 do 50 procent. Własny wniosek raportu jest dosadny: porównanie obciążeń, które pomija pamięć podręczną i ceny Batch, pomija opublikowane tryby oszczędzania dla dużej części śledzonych rekordów.
Mediany poszczególnych dostawców w tym samym zbiorze danych stawiają OpenAI na 2 dolarach wejścia i 11 dolarach wyjścia w 18 rekordach, Google Gemini na 0,75 i 4,125 dolara w 14, Anthropic na 5 i 25 dolarach w 13, xAI na 1,25 i 2,5 dolara w dziewięciu, Mistral AI na 0,20 i 0,60 dolara w siedmiu, DeepSeek na 0,30 i 1,2 dolara w trzech, Moonshot AI na 0,95 i 4 dolarach w trzech, a Cohere na 1,5 i 5,75 dolara w dwóch. Raport ostrzega, że stron dokumentów, pamięci masowej, czasu trwania sesji i innych jednostek opartych na czasie nie da się spłaszczyć do tabeli z samymi tokenami. Dodaje, że 13 rekordów zawiera składniki inne niż tokeny.
Nie każdy problem z kosztami to problem z cennikiem. Praca przedstawiona na SOSP '26 28 września dowodzi, że optymalizowanie klastrów GPU wyłącznie pod kątem wykorzystania może podnieść zużycie energii. Autorzy, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma i Neeraja J. Yadwadkar, przedstawiają EnerTune. Narzędzie używa analitycznych modeli wydajności i mocy dla poszczególnych modeli, a także poboru mocy modeli współlokowanych na współdzielonych GPU, w algorytmie pakowania do pojemników świadomym energii, który wybiera rozmieszczenie i konfigurację razem.
Ich streszczenie podaje redukcje energii od 1,4 do 2,3 razy i redukcje poboru mocy od 1,3 do 2,6 razy względem najlepszych istniejących rozwiązań, przy spełnieniu celów wydajnościowych SLO. Praca dowodzi, że profilowanie każdego modelu w setkach konfiguracji jest zbyt kosztowne w skali. Dlatego podejście opiera się na modelach, a nie na pomiarach.
W fizycznej sztucznej inteligencji ograniczeniem jest opóźnienie, nie przepustowość. MindOn opublikował 30 września Mind-1, twierdząc, że skraca opóźnienie wnioskowania robota z 82 ms do 32 ms. Firma zauważa, że przy prędkości efektora końcowego 3 m/s 10 ms opóźnienia odpowiada mniej więcej 3 cm ruchu. To dość, żeby wpłynąć na precyzyjne chwytanie, wkładanie albo manipulację wymagającą kontaktu. MindOn wskazuje też na tempo danych treningowych: dużo danych o manipulacji pochodzi z teleoperacji, która jest wolniejsza niż naturalny ruch człowieka, a modele uczą się tempa razem z zadaniem.
Ta sama logika efektywności pojawia się poza AI. CleanTechnica poinformowała 29 września, że analiza Transport & Environment stawia koszty eksploatacji samochodu elektrycznego na mniej niż połowie kosztów diesla na kilometr. Opiera się na zużyciu 6,9 l/100 km dla diesla wobec 20,2 kWh/100 km dla elektryka i cenie prądu 0,343 euro/kWh. Antony Froggatt z T&E powiedział, że UE powinna opodatkować zyski z ropy, żeby sfinansować wsparcie dla gospodarstw domowych o niskich dochodach i programy złomowania. Szacunek T&E dotyczący ładowania jest w ich własnej metodologii opisany jako prawdopodobnie górna granica.
Operatorzy telekomunikacyjni realizują ten sam scenariusz przez konsolidację. Light Reading podał 30 września, że StarHub i M1 prowadzą rozmowy o fuzji w Singapurze. Obie firmy dzielą już widmo 5G i sieć dostępu radiowego przez spółkę joint venture o nazwie Antina. Singtel miał w czerwcu 43 procent udziału w rynku komórkowym, M1 22 procent, StarHub 21 procent, a Simba 14 procent. W Nowej Zelandii 2degrees i OneNZ zaproponowały połączenie swoich sieci radiowych we wspólnie posiadany podmiot, a decyzja Komisji Handlu spodziewana jest w przyszłym roku. Light Reading cytuje porozumienie 5G China Telecom i China Unicom jako największe tego typu partnerstwo. Obejmuje ono 1 500 000 stacji bazowych i deklarowane oszczędności capeksu rzędu 56 000 000 000 dolarów.
Nie jest jeszcze ustalone, czy przepustowość Quaila przekłada się na niższe rachunki dla zwykłych użytkowników AI-SQL. Liczba miliarda tokenów na minutę pochodzi z jednego zapytania z wieloma złączeniami, wybranego, bo planowanie ma tam największe znaczenie. Uśredniony wynik silnika na pełnym zestawie zadań to 1,84 razy, nie 10 razy. Samo laboratorium dołączyło dwa zapytania zaprojektowane, żeby obnażyć obecne słabości. Quail jest w wersji 0.1.0.
Źródła
9- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03AI API pricing index - September 2026EN
- 04Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 07The pricing calculator made people more confused about pricingEN
- 08Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.