Quail przetwarza AI-SQL z szybkością miliarda tokenów na minutę na jednym H100, 10 razy szybciej niż vLLM
Modal i Full Stack Data Lab z Carnegie Mellon opublikowały 30 września Quail, silnik wnioskowania, który łącznie optymalizuje planowanie zapytań SQL i wykonanie LLM. Na pojedynczym H100 osiąga ponad miliard tokenów na minutę, ponad 10 razy więcej niż bazowy vLLM.

Liczby mówią same za siebie. Na jednym zapytaniu z wieloma złączeniami Quail przetwarza ponad miliard tokenów na minutę na jeden GPU H100, według Modal, które zbudowało silnik razem z Full Stack Data Lab na Carnegie Mellon University. Na sprzęcie Modala to mniej niż 6 centów za miliard tokenów. W nowym benchmarku dla zapytań AI-SQL Quail działa 1,84 razy szybciej niż vLLM, średnio geometrycznie po zadaniach.
Towarzyszący wpis z Full Stack Data Lab, opublikowany tego samego dnia, wyjaśnia, gdzie bazowy model zawodzi. Zespół uruchomił vLLM 0.26.0 z Qwen3 4B FP8 na jednym H100 przeciwko BIO-4, zapytaniu, które filtruje 5000 raportów medycznych względem 4144 terminów reakcji, złączonych dwukrotnie. Ich szacunek prędkości światła dla planu wynosił 894,37 sekundy, czyli 14,91 minuty. vLLM zajął 6,84 godziny, 27,55 razy więcej niż ten szacunek.
Dwie przyczyny. Narzut hosta, gdzie CPU planuje i śledzi żądania, podczas gdy H100 stoi bezczynnie. Oraz żal KV: vLLM odrzuca pamięć podręczną klucz-wartość, której potrzebuje ponownie później, więc przy współczynniku skali 1.0 przebieg przetworzył 174,6 miliona tokenów zmarnowanego prefillu.
Naprawa Quail jest strukturalna. Mając plan zapytania, silnik może celowo porządkować i usuwać pamięć podręczną KV, co jest modyfikacją uwagi kaskadowej w stylu Hydragen, i może grupować małe żądania, aby GPU pozostawało zajęte. Modal opisuje wynik jako punkt, w którym planowanie bazy danych i harmonogramowanie wnioskowania przestają być odrębnymi problemami.
Dlaczego to ma znaczenie dla rachunku
AI-SQL to wzorzec, w którym SQL jest rozszerzany o funkcje zdefiniowane przez użytkownika, które wywołują LLM. Snowflake Cortex AISQL, funkcje AI BigQuery, Databricks AI Functions i ostatnio MotherDuck wszystkie to obsługują, zauważa Full Stack Data Lab. Filtr oznacza jedno wywołanie modelu na wiersz. Naiwne złączenie oznacza jedno wywołanie dla każdej pary wierszy. Jedno zapytanie może wygenerować setki tysięcy lub miliony wywołań.
Na tym tle ogólny obraz cen staje się bardziej chaotyczny, a nie czystszy. Wrześniowy indeks cen AICostBudget, zamrożony na granicy 2026-09-30 UTC, obejmuje 81 publicznych rekordów od 11 dostawców. Mediana ceny wejściowej to 1,32 dolara za milion tokenów; mediana ceny wyjściowej to 6 dolarów. Mediana rabatu na wejście z pamięci podręcznej to 90%, a mediana rabatu wsadowego to 50%. Ta sama strona ostrzega, że ceny katalogowe to dane do planowania, a nie faktury.
Surowe stawki godzinowe za GPU opowiadają podobną historię rozbieżności. GPUAdvisor, który śledzi 14 dostawców, ostatnio aktualizowany 1 października, podaje A4000 16GB u Hyperstack za 0,15 dolara za godzinę, RTX 3090 u Lium za 0,22 dolara i L40S u Lium za 0,38 dolara, co oznacza jako 89% poniżej AWS. Własne podsumowanie strony jest bezpośrednie: chmury specjalizujące się w GPU oferują 2 do 4 razy niższe ceny za GPU niż hiperskalerzy, a spot może zaoszczędzić 60 do 70% na treningach z checkpointingiem.
FitMyLLM przelicza stawki godzinowe na koszt za milion tokenów i ranking się odwraca. Najtańsza zmierzona opcja to RTX 3060 12GB na Vast.ai za 0,261 dolara za milion tokenów. RTX 5090 na Vast.ai to najszybsza zmierzona karta z 227 tokenami na sekundę, ale kosztuje 0,576 dolara za milion. Karty dla centrów danych wypadają słabo w tym ujęciu pojedynczego strumienia, i FitMyLLM to przyznaje: H100 zarabia na swoją cenę, obsługując wiele strumieni naraz, a przy jednym strumieniu jej przepustowość w większości stoi bezczynnie.
Pytanie o efektywność, które leży pod spodem
Energia to następna oś. Praca przedstawiona na SOSP '26 28 września, autorstwa Prasoona Sinhy, Dimitriosa Liakopoulosa, Nathana Lemmy i Neeraji J. Yadwadkar, dowodzi, że optymalizacja wyłącznie pod kątem wykorzystania GPU może zwiększyć zużycie energii. Ich system, EnerTune, deklaruje 1,4 do 2,3 razy niższe zużycie energii i 1,3 do 2,6 razy niższy pobór mocy w porównaniu z najnowocześniejszymi rozwiązaniami bazowymi przy jednoczesnym spełnieniu SLO wydajności.
Nie każdy dostawca goni za tą samą krzywą. Mind-1 od MindOn, ogłoszony 30 września, celuje w opóźnienie wnioskowania robotów, skracając je z 82 ms do 32 ms, inny zakątek tego samego problemu: co faktycznie daje godzina obliczeń.
Źródła
7- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03AI API pricing index - September 2026EN
- 04Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 05Cloud GPU prices for LLM inference - cost per million tokensEN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.