Quail schafft eine Milliarde Token pro Minute auf einer H100, doch die GPU-Preise werden unübersichtlich
Modal und das Full Stack Data Lab der Carnegie Mellon University schreiben, ihre Quail-Engine habe eine AI-SQL-Abfrage mit mehreren Joins auf einer einzigen H100 über eine Milliarde Token pro Minute getrieben. Das sei mehr als das Zehnfache ihrer vLLM-Basislinie, heißt es in einem am 30. September veröffentlichten Beitrag.

Zu der Behauptung gehört ein Preis: unter 6 Cent pro Milliarde Token auf Modal, schreibt das Unternehmen im Blog. Solche Zahlen entscheiden, ob AI-SQL ausgerollt oder still zu den Akten gelegt wird. Denn ein Filter über eine Million Zeilen bedeutet eine Million Modellaufrufe.
Zwei Engpässe, zwei Korrekturen
Das Full Stack Data Lab beschreibt das Problem in seiner Ausarbeitung vom 24. September in Datenbankbegriffen. Eine Abfrage, die 5.000 medizinische Berichte gegen 4.144 Reaktionsbegriffe joint, wächst zu Millionen einzelner Inferenzanfragen an. Lief man sie einzeln durch vLLM 0.26.0 mit Qwen3 4B FP8 auf einer H100, dauerte das 6,84 Stunden. Die Autoren rechnen vor, dass dies das 27,55-Fache ihrer Roofline-Schätzung von 894,37 Sekunden oder 14,91 Minuten ist. Sie nennen zwei Ursachen. Erstens den Host-Overhead: Die CPU plant Anfragen, während die H100 untätig bleibt. Zweitens das KV-Regret: Die Engine verwirft Key-Value-Zustand, den sie später wieder braucht. In diesem Benchmark bei Skalierungsfaktor 1,0 verarbeitete vLLM 174,6 Millionen Token, die es nicht gebraucht hätte.
Quail sieht den Abfrageplan an, bevor er ausgeführt wird. Wer die Form der Joins kennt, kann Anfragen so ordnen, dass gemeinsame Präfixe im Cache bleiben. Arbeit, die eine Allzweck-Engine als unzusammenhängend behandelt, lässt sich bündeln. Der Modal-Beitrag beschreibt das als Überarbeitung der Cascade Attention im Stil von Hydragen. Beide Teams bezeichnen das Projekt als Zusammenarbeit zwischen Modals Inferenzforschern und der Datenbankgruppe der CMU.
Über den gesamten Benchmark ist die Zahl kleiner: 1,84-mal schneller als vLLM, geometrisch gemittelt. Darin stecken zwei Abfragen, die die Autoren eigens gebaut haben, um zu zeigen, wo AI-SQL-Inferenz noch scheitert.
Die Preisdaten darunter
Kostenaussagen wirken unterschiedlich, je nachdem, was eine GPU-Stunde überhaupt kostet. Diese Zahl bewegt sich inzwischen wöchentlich. GPUAdvisor verfolgt 14 Anbieter und listet Hyperstack mit 0,15 Dollar pro Stunde für eine A4000 16GB. Lium steht mit 0,22 Dollar für eine RTX 3090 und 0,38 Dollar für eine L40S in der Liste, RunPods RTX A5000 mit 0,27 Dollar auf Abruf gegenüber 0,16 Dollar in der geteilten Community-Cloud-Stufe. Die Seite, zuletzt erfasst am 1. Oktober, stellt schlicht fest, dass GPU-Preise keine stabile Nachschlagetabelle mehr sind.
FitMyLLM geht dieselbe Frage von der Token-Seite an. Ein Stundensatz sagt ohne Durchsatzangabe nichts aus, argumentiert die Seite. Ihre Live-Tabelle liest Tarife alle drei Minuten über die APIs der Anbieter aus und sortiert nach Kosten pro Million Ausgabe-Token bei einem Stream. Vast.ais RTX 3060 kommt mit 0,261 Dollar pro Million Token am günstigsten weg. Eine RTX 5090 bei Vast.ai läuft mit 227 Token pro Sekunde und 0,576 Dollar pro Million. Die Seite räumt offen ein, dass Datacenter-Karten in dieser Kennzahl konstruktionsbedingt schlecht abschneiden. Eine H100 oder H200 verdient ihren Preis damit, viele Streams gleichzeitig zu bedienen. Diese Zeilen sind Schätzungen und keine Messungen.
"Ein Marktplatzpreis ist das Angebot eines einzelnen Hosts, kein veröffentlichter Tarif: Er kann verschwinden, und Hosts betreiben eine Karte möglicherweise unter ihrem Standard-Power-Limit, was Geschwindigkeit kostet, die der Preis nicht zeigt."
Für API-Käufer statt GPU-Mieter friert der September-Index von AICostBudget 81 öffentliche Datensätze über 11 Anbieter mit Stichtag 2026-09-30 ein. Der Median des Eingabepreises liegt bei 1,32 Dollar pro Million Token, der Median der Ausgabe bei 6 Dollar. Das mediane Verhältnis von Ausgabe zu Eingabe beträgt das 5,0-Fache. Datensätze mit gecachter Eingabe zeigen einen Median-Rabatt von 90 Prozent, Datensätze mit Batch-Preis einen Median von 50 Prozent, über 58 beziehungsweise 44 vergleichbare Zeilen. Der Index warnt ausdrücklich, dass seine Anbieter-Mediane keine nutzungsgewichteten Marktpreise sind und dass er keinen branchenweiten jährlichen Rückgang behauptet.
Effizienz rückt im Stack nach oben
Energie ist der nächste Posten. Ein am 28. September auf der SOSP '26 veröffentlichtes Paper von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar argumentiert, dass eine Optimierung allein auf GPU-Auslastung den Energieverbrauch erhöhen kann. Ihr System EnerTune nutzt analytische Modelle der Leistung und des Verbrauchs einzelner Modelle, einschließlich der Last gleichzeitig laufender Modelle auf einer geteilten GPU, in einem energiebewussten Bin-Packing-Algorithmus. Die Autoren berichten, dass sie Leistungs-SLOs einhalten und dabei Energie um das 1,4- bis 2,3-Fache und Leistungsaufnahme um das 1,3- bis 2,6-Fache gegenüber dem Stand der Technik senken. Jede Konfiguration zu profilieren ist im Maßstab selbst zu teuer. Deshalb sind die Modelle analytisch und nicht gemessen.
Inferenz auf dem Gerät argumentiert dasselbe von der anderen Seite. Magnitude, ein Unternehmen aus dem YC-S25-Jahrgang, das am 30. September auf Hacker News schrieb, liefert eine Open-Source-Engine unter Apache 2.0. Sie kompiliert und stimmt Kernel auf der Hardware des Nutzers ab, bevor ein Modell läuft. Das README behauptet bis zu 2-mal schneller als llama.cpp, mit 92 Prozent schnellerem Decode auf Metal und 19 Prozent auf CUDA sowie 27 Prozent weniger Speicher pro Agent. Keine Token-Kosten, nichts verlässt die Maschine. Der Kompromiss: Es laufen offene Modelle auf der eigenen GPU, kein Frontier-Modell auf der eines anderen.
Worauf Käufer achten sollten
Drei Zahlen im Dossier zeigen in verschiedene Richtungen. Quails durchschnittliche Beschleunigung von 1,84-mal ist real, aber bescheiden neben der Schlagzeile von einer Milliarde Token pro Minute. Das sagen die Autoren selbst. FitMyLLMs günstigster gemessener Tarif von 0,261 Dollar pro Million Token liegt auf einer Consumer-Karte, die die meisten Produktionsteams nicht einsetzen würden. Der mediane Ausgabepreis von AICostBudget von 6 Dollar pro Million Token spiegelt Listenpreise wider, nicht die gecachten oder gebündelten Tarife, die die meisten großen Workloads tatsächlich zahlen.
Die praktische Lesart: Stundensätze pro GPU sind inzwischen ein Rohstoffvergleich. Die Differenzierung hat sich auf Durchsatz pro Dollar, Cache-Verhalten und Energie verlagert. Quails Autoren sagen ausdrücklich, dass dies ein Anfang ist und kein Abschluss. Sie bitten um genau das, was ihr Benchmark allein nicht liefern kann: echte Workloads von Teams, die AI-SQL im großen Maßstab betreiben.
Quellen
7- 01Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
- 02Building an Ultra-High Throughput AI-SQL EngineEN
- 03Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 04Cloud GPU prices for LLM inference — cost per million tokensEN
- 05AI API Pricing Index — September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.