Quail will eine Milliarde Token pro Minute auf einer GPU schaffen, während die Debatte um Inferenzkosten schärfer wird
Eine Forschungsgruppe will mit ihrer abfragebewussten Inferenzschicht auf einer einzelnen Nvidia-H100-GPU mehr als eine Milliarde Token pro Minute verarbeitet haben, über 10x schneller als eine vLLM-Baseline. Es ist der jüngste Versuch, die Kosten für den Betrieb großer Sprachmodelle im großen Maßstab zu senken. Die Angaben wurden am 30. September veröffentlicht, am selben Tag, an dem OpenAI eine ChatGPT-Stufe für 500 Dollar im Monat ankündigte und eine Open-Source-Engine doppelt so schnelle lokale Inferenz versprach.

Die Zahlen stammen vom Full Stack Data Lab und von Modal, die am 30. September getrennte Beiträge über ein System namens Quail veröffentlichten, kurz für QUery-Aware Inference Layer. Modals Blog gibt an, dass Quail bei einer Multi-Join-Abfrage pro H100-GPU mehr als eine Milliarde Token pro Minute verarbeitete. Das sei über 10x schneller als die vLLM-Baseline auf derselben Hardware. Bei Modal ergibt das weniger als 6 Cent pro Milliarde Token.
Die beiden Beiträge beschreiben dasselbe Projekt aus unterschiedlichen Blickwinkeln. Der Beitrag des Full Stack Data Lab ist auf den 24. September datiert, erschien auf der Seite aber am 30. September. Er erklärt das Problem. AI-SQL erweitert SQL um Funktionen, die Modelle Zeile für Zeile aufrufen. Ein Filter kann damit einen Modellaufruf pro Zeile bedeuten, ein Join einen Aufruf für jedes Zeilenpaar. Die Benchmark-Abfrage des Labors, BIO-4 in einer Suite namens QUAIL-B, läuft über 5.000 medizinische Berichte und 4.144 Reaktionsbegriffe.
Kleine Modelle, riesige Mengen
Modals Text beschreibt AI-SQL als stilleren Verwandten des Booms von Agenten und Chatbots. Die Beispielabfrage dort verknüpft Kunden und Produkte mit einem Prompt, der fragt, ob der eine beim anderen kaufen könnte. Eine solche Abfrage, schreibt Modal, kann Millionen Sequenzen von Tausenden Token erzeugen. Diese Sequenzen brauchen oft weniger als Spitzenintelligenz, kleine Modelle mit offenen Gewichten bewältigen sie. Der Engpass ist laut Modal nicht die Modellqualität, sondern der Preis dafür, Millionen zusammenhängender Anfragen an eine Engine zu liefern, die für beliebigen, vom Nutzer gesteuerten Verkehr gebaut wurde.
Quail plant die SQL-Abfrage und die Inferenzlast gemeinsam, statt die Engine als generischen Endpunkt zu behandeln. Modal nennt eine geometrische mittlere Beschleunigung von 1,84x gegenüber vLLM über den neuen AI-SQL-Benchmark. Das ist ein deutlich kleinerer Wert als der vielzitierte Fall mit einer Milliarde Token pro Minute. Das Unternehmen sagt ausdrücklich, dass zwei Abfragen im Benchmark darauf angelegt waren, Bereiche für künftige Verbesserungen sichtbar zu machen.
"I see it as a point on the LLM pareto optimal curve in a regime that had a large revealed latent demand (no thinking, single token, low latency acceptable intelligence) that was under-invested into because of a race to higher intelligence."
Modal schreibt dieses Zitat Karpathy zu und beschreibt dabei das Jev-Modell von TypeSafe AI. Derselbe Beitrag merkt an, dass viele Datenbankanbieter inzwischen AI-Funktionen anbieten. Die Liste umfasst Snowflake Cortex AISQL, BigQuery AI functions, Databricks AI Functions und seit Kurzem MotherDuck.
Akademische Systeme gehen denselben Verschwendungsfall an. Das Full Stack Data Lab nennt DocETL von der UC Berkeley, LOTUS von Stanford, Palimpzest vom MIT und ThalamusDB von Cornell. Es nennt außerdem Techniken wie MOAR, Task Cascades, Abacus und BARGAIN, die die Zahl der Aufrufe senken oder günstigere Modelle wählen. Selbst dann, so schreibt das Labor, kann ein Plan noch Hunderttausende oder Millionen Aufrufe erfordern.
Preisliste gegen Preisstruktur
Während Quail die Kosten einer Abfrage angreift, verfolgt eine unabhängige Momentaufnahme vom 30. September, was Anbieter berechnen. Der AICostBudget AI API Pricing Index erfasst 81 eingefrorene öffentliche Datensätze von 11 Anbietern mit Stichtag 2026-09-30 UTC. Über 69 Datensätze mit einem Input-Token-Skalar reicht die beobachtete Spanne von 0,10 bis 30 Dollar pro Million Token. Die Output-Preise reichen von 0,10 bis 180 Dollar. Der Median des Input-Preises liegt bei 1,32 Dollar, der Median des Output-Preises bei 6 Dollar, ein Verhältnis von 5,0x.
Der Index macht einen Punkt, der für jeden wichtig ist, der Inferenzausgaben modelliert: Cache- und Batch-Preise sind keine Rundungsfehler. Über 58 vergleichbare Datensätze liegt der Median des Rabatts auf gecachte Eingaben bei 90%. Über 44 batchfähige Datensätze liegt der Median des Batch-Rabatts bei 50%. Ein Workload-Vergleich, der beides ignoriert, so heißt es im Bericht, lässt veröffentlichte Sparmodelle für einen großen Teil der erfassten Datensätze weg. Die Medianwerte auf Anbieterebene umfassen OpenAI mit 2 Dollar Input und 11 Dollar Output über 18 Datensätze, Google Gemini mit 0,75 und 4.125 Dollar über 14 sowie Anthropic mit 5 und 25 Dollar über 13. Mistral AI, DeepSeek, Cohere und Moonshot AI erscheinen ebenfalls.
Die Preise für Endnutzer bewegten sich am selben Tag in die entgegengesetzte Richtung. Business Insider berichtete, dass OpenAI auf seinem Dienstag-DevDay eine neue Pro-500-Stufe ankündigte, die 500 Dollar im Monat kostet, eine Steigerung um 300 Dollar gegenüber dem vorherigen Top-Tarif. Sie enthält Zugang zu "Ultrafast"-Rechenleistung für GPT-6 Astra in ChatGPT Work und Codex sowie die Angabe, dass Codex 8x schneller sei. OpenAI öffnete außerdem den 200-Dollar-Pro-Tarif wieder, halbierte aber das Rechenkontingent auf das 10x des 20-Dollar-Plus-Tarifs, gegenüber zuvor 20x. Die Zahl der GPT-6-Pro-Chatnachrichten wurde von 200 auf 100 pro Woche gesenkt. Thibault Sottiaux, Engineering-Lead für Codex, sagte in einem X-Beitrag vom Montag, die Änderungen summierten sich auf die Hälfte der API-Ausgaben in Dollar im Vergleich zum vorherigen Tarif.
Auf der Hardwareseite ist das Bild unübersichtlicher. Ein GitHub-Beitrag zum Start von Magnitude, einem Unternehmen aus dem YC-S25-Jahrgang, behauptet, seine Open-Source-Engine stimme Kernel auf dem Gerät des Nutzers ab und lasse offene Modelle bis zu 2x schneller laufen als llama.cpp. Er nennt 92% schnelleres Decoding auf Metal und 19% auf CUDA sowie 27% weniger Speicher pro Agent. Das sind Anbieter-Benchmarks, keine unabhängigen Tests, und der Beitrag nennt keine Prüfung durch Dritte.
Separat argumentiert das SOSP-'26-Papier "Beyond Utilization" von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar, dass die Optimierung von GPU-Clustern allein auf Auslastung den Energieverbrauch erhöhen kann. Es stellt ein System namens EnerTune vor, das laut den Autoren den Energieverbrauch um 1,4-2,3x und die Leistungsaufnahme um 1,3-2,6x gegenüber dem Stand der Technik senkt. Das Papier wurde am 28. September veröffentlicht. Am 30. September berichtete CleanTechnica über eine Analyse von Transport & Environment, wonach Fahrer von Elektroautos in Europa pro Kilometer weniger als die Hälfte dessen zahlen, was Dieselfahrer zahlen, wobei Diesel pro Tank 32 Euro mehr kostet als zu Jahresbeginn und davon etwa 16 Euro auf die zusätzliche Raffineriemarge entfallen.
Quellen
10- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03AI API Pricing Index - September 2026EN
- 04ChatGPT's new plan costs $500 a monthEN
- 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 09The pricing calculator made people more confused about pricingEN
- 10Singapore, New Zealand operators seek partnerships to cut costsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.