Quail schafft auf einer H100 eine Milliarde AI-SQL-Token pro Minute und ist zehnmal schneller als vLLM
Modal und das Full Stack Data Lab der Carnegie Mellon University haben am 30. September Quail vorgestellt. Die Inferenz-Engine optimiert SQL-Abfrageplanung und LLM-Ausführung gemeinsam. Auf einer einzelnen H100 erreicht sie mehr als eine Milliarde Token pro Minute, über das Zehnfache einer vLLM-Basislinie.

Die Zahlen sind die Geschichte. Bei einer Abfrage mit mehreren Joins verarbeitet Quail laut Modal über eine Milliarde Token pro Minute pro H100-GPU. Die Engine entstand bei Modal zusammen mit dem Full Stack Data Lab der Carnegie Mellon University. Auf Modals eigener Hardware sind das weniger als 6 Cent pro Milliarde Token. In einem neuen Benchmark für AI-SQL-Abfragen ist Quail im geometrischen Mittel über alle Aufgaben 1,84-mal schneller als vLLM.
Der begleitende Beitrag des Full Stack Data Lab erschien am selben Tag und erklärt, wo die Basislinie falsch abbiegt. Das Team ließ vLLM 0.26.0 mit Qwen3 4B FP8 auf einer H100 gegen BIO-4 laufen. Diese Abfrage filtert 5.000 medizinische Berichte gegen 4.144 Reaktionsbegriffe und wird zweimal gejoint. Die eigene Lichtgeschwindigkeits-Schätzung für den Plan lag bei 894,37 Sekunden, also 14,91 Minuten. vLLM brauchte 6,84 Stunden, das 27,55-Fache dieser Schätzung.
Zwei Ursachen. Zum einen der Host-Overhead: Die CPU plant und verfolgt Anfragen, während die H100 untätig bleibt. Zum anderen KV-Regret: vLLM verwirft Key-Value-Cache, den es später wieder braucht. Bei Skalierungsfaktor 1,0 verarbeitete der Lauf so 174,6 Millionen Token verschwendeten Prefill.
Quails Ansatz setzt strukturell an. Mit einem Abfrageplan in der Hand kann die Engine den KV-Cache gezielt ordnen und verwerfen, eine Weiterentwicklung der Cascade Attention im Stil von Hydragen. Außerdem bündelt sie kleine Anfragen, damit die GPU beschäftigt bleibt. Modal beschreibt das Ergebnis als Punkt, an dem Datenbankplanung und Inferenz-Scheduling aufhören, getrennte Probleme zu sein.
Warum das für die Rechnung zählt
AI-SQL ist das Muster, bei dem SQL um benutzerdefinierte Funktionen erweitert wird, die ein LLM aufrufen. Snowflake Cortex AISQL, BigQuery AI Functions, Databricks AI Functions und seit Kurzem auch MotherDuck unterstützen das, wie das Full Stack Data Lab anmerkt. Ein Filter bedeutet einen Modellaufruf pro Zeile. Ein naiver Join bedeutet einen Aufruf für jedes Zeilenpaar. Eine einzige Abfrage kann Hunderttausende oder Millionen Aufrufe erzeugen.
Vor diesem Hintergrund wird das allgemeine Preisbild unübersichtlicher, nicht klarer. Der September-Preisindex von AICostBudget, eingefroren mit Stichtag 2026-09-30 UTC, umfasst 81 öffentliche Datensätze von 11 Anbietern. Der Median des Eingabepreises liegt bei 1,32 US-Dollar pro Million Token, der Median des Ausgabepreises bei 6 US-Dollar. Der mittlere Rabatt auf gecachte Eingaben beträgt 90%, der mittlere Batch-Rabatt 50%. Dieselbe Seite warnt, dass Listenpreise Planungsgrößen sind, keine Rechnungen.
Die rohen GPU-Stundensätze erzählen eine ähnliche Geschichte der Auseinanderentwicklung. GPUAdvisor verfolgt 14 Anbieter und hat zuletzt am 1. Oktober erfasst. Die Seite listet eine A4000 16GB bei Hyperstack für 0,15 US-Dollar pro Stunde, eine RTX 3090 bei Lium für 0,22 US-Dollar und eine L40S bei Lium für 0,38 US-Dollar, die sie als 89% unter AWS markiert. Die eigene Zusammenfassung der Seite ist deutlich: GPU-Spezialisten-Clouds bieten 2- bis 4-mal niedrigere Preise pro GPU als Hyperscaler, und Spot kann bei Trainingsläufen mit Checkpointing 60 bis 70% sparen.
FitMyLLM rechnet Stundensätze in Kosten pro Million Token um, und die Rangfolge kippt. Die günstigste gemessene Option ist eine RTX 3060 12GB bei Vast.ai für 0,261 US-Dollar pro Million Token. Eine RTX 5090 bei Vast.ai ist die schnellste gemessene Karte mit 227 Token pro Sekunde, kostet aber 0,576 US-Dollar pro Million. Datacenter-Karten schneiden in dieser Single-Stream-Betrachtung schlecht ab, und FitMyLLM sagt das auch: Eine H100 verdient ihren Preis damit, viele Streams gleichzeitig zu bedienen. Bei einem einzigen Stream liegt ihre Bandbreite weitgehend brach.
Die Effizienzfrage darunter
Energie ist die nächste Achse. Ein am 28. September auf der SOSP '26 vorgestelltes Papier von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar argumentiert, dass die Optimierung allein auf GPU-Auslastung den Energieverbrauch erhöhen kann. Ihr System EnerTune beansprucht 1,4- bis 2,3-mal weniger Energie und 1,3- bis 2,6-mal geringere Leistungsaufnahme gegenüber dem Stand der Technik, während es die Performance-SLOs einhält.
Nicht jeder Anbieter verfolgt dieselbe Kurve. MindOns Mind-1, am 30. September angekündigt, zielt auf die Latenz der Roboterinferenz und senkt sie von 82ms auf 32ms. Das ist eine andere Ecke desselben Problems: was eine Stunde Rechenzeit tatsächlich einbringt.
Quellen
7- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03AI API pricing index - September 2026EN
- 04Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 05Cloud GPU prices for LLM inference - cost per million tokensEN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.