Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenz-Engine Quail schafft eine Milliarde Token pro Minute auf einer H100

Zwei Forschungsteams haben am 30. September neue Ergebnisse zu Inferenz-Engines veröffentlicht. Sie behaupten, AI-SQL-Abfragen liefen auf derselben Hardware mehr als zehnmal schneller als eine vLLM-Basislinie.

KI & ModelleNachrichtLena BrandtVeröffentlicht: 30. September 20264 Min. LesezeitQuellen 7
Inferenz-Engine Quail schafft eine Milliarde Token pro Minute auf einer H100

Am 30. September veröffentlichten Modal und das Full Stack Data Lab der Carnegie Mellon University Ergebnisse zu Quail, einer abfragebewussten Inferenzschicht. Nach Angaben der Teams verarbeitet sie bei einer Abfrage mit mehreren Joins über eine Milliarde Token pro Minute auf einer H100-GPU, mehr als 10x schneller als ihre vLLM-Basislinie auf derselben Hardware. Zu der Behauptung gehört eine Kostenzahl: unter 6 Cent pro Milliarde Token bei Modal.

Die Arbeit zielt auf AI-SQL, die Erweiterung von SQL, mit der eine Abfrage ein Sprachmodell Zeile für Zeile aufrufen kann. Der Blog des Full Stack Data Lab beschreibt einen Filter, der einen LLM-Aufruf pro Zeile braucht, und einen naiven Join, der einen Aufruf für jedes Paar von Zeilen aus seinen beiden Eingabetabellen benötigt. Diese Rechnung wächst schnell. In einer Benchmark-Abfrage, die das Lab BIO-4 nennt, werden 5.000 medizinische Berichte gegen 4.144 Reaktionsbegriffe gejoint, wobei die Reaktionsliste zweimal verwendet wird. Eine vLLM-0.26.0-Basislinie mit Qwen3 4B FP8 auf einer H100 brauchte bei Skalenfaktor 1.0 laut Lab 6,84 Stunden. Das Lab rechnet das als 27,55x einer optimistischen Roofline-Schätzung von 14,91 Minuten.

Das Lab führt die Lücke auf zwei Dinge zurück.

Das erste ist Host-Overhead: Die CPU verbringt lange Phasen damit, Anfragen zu planen, während die GPU wartet. Das zweite nennt es KV-Regret: vLLM verwirft Key- und Value-Zustand, den es später wieder braucht, sodass der BIO-4-Lauf 174.600.000 Token verarbeitet, die nicht nötig gewesen wären.

„Der große Gewinn ist, dass man mit einer strukturierten Abfrage in der Hand Anfragen so ordnen kann, dass KV besser gecacht (und verdrängt) wird", heißt es im Modal-Blog.

Quail ist mit diesem Ziel nicht allein. Magnitude, ein Unternehmen aus dem Y-Combinator-Batch S25, öffnete sein Repository am 30. September auf GitHub mit einem anderen Ansatz: eine Open-Source-Inferenz-Engine für Agenten, die Kernel auf dem Gerät des Nutzers kompiliert und abstimmt. Das README behauptet, offene Modelle liefen bis zu 2x schneller als llama.cpp, mit 92% schnellerem Decode auf Metal und 19% auf CUDA sowie 27% weniger Speicher pro Agent. Als Ziele listet es Apple Silicon, NVIDIA, AMD und einfache CPUs, die Lizenz ist Apache 2.0. Beide Projekte argumentieren, dass der universelle Serving-Stack Leistung liegen lässt. Quails Antwort ist, die Abfragestruktur im Voraus zu kennen. Magnitudes Antwort ist, den Silizium zu kennen.

Die Ökonomie hinter diesem Argument zeigt sich in den Preisdaten. Der September-Index von AICostBudget, eingefroren mit Stichtag 30. September UTC, umfasst 81 öffentliche Preisangaben von 11 Anbietern. Über 69 Datensätze mit einem aktuellen Input-Token-Skalar reichen die Preise von $0,10 bis $30 pro 1M Token. Der Output reicht von $0,10 bis $180. Das mediane Verhältnis von Output zu Input über die 69 Datensätze mit beiden Skalaren liegt bei 5,0x. Rabatte zählen ebenso viel wie Listenpreise. Über 58 vergleichbare Datensätze meldet der Index einen medianen Rabatt auf gecachten Input von 90%. Über 44 batchfähige Datensätze liegt der mediane Batch-Input-Rabatt bei 50%. Die Methodenseite stellt ausdrücklich klar, dass regionale Preise und ausgehandelte Sätze nicht erfasst werden und dass es sich um Planungsgrößen handelt, nicht um Rechnungen.

Auch die Forschung auf der Hardwareseite bewegt sich in dieselbe Richtung. Ein am 28. September auf der SOSP '26 veröffentlichtes Paper stellt EnerTune vor, ein Serving-System, das analytische Modelle der Leistung und des Verbrauchs einzelner Modelle sowie die Leistungsaufnahme gemeinsam platzierter Modelle auf geteilten GPUs nutzt, um einen energiebewussten Bin-Packing-Algorithmus zu steuern. Die Autoren Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar berichten von Energieeinsparungen um den Faktor 1,4 bis 2,3 und einer um den Faktor 1,3 bis 2,6 geringeren Leistungsaufnahme gegenüber dem Stand der Technik, bei Einhaltung der Performance-SLOs.

Ihr Ausgangspunkt ist, dass GPU-Cluster weiterhin stark unterausgelastet sind und dass eine Optimierung allein auf Auslastung den Energieverbrauch erhöhen kann. In großem Maßstab, so argumentieren sie, sei das Profiling jedes Modells über Hunderte Konfigurationen unverhältnismäßig teuer, weshalb Schätzung die Messung ersetzen müsse.

Nicht jedes neue Ergebnis betrifft den Serving-Stack. MindOn stellte am 30. September Mind-1 vor, ein Physical-AI-Modell, das nach Angaben des Unternehmens die Inferenzlatenz von Robotern von 82ms auf 32ms senkt und Manipulationsaufgaben damit auf menschliche Zykluszeiten bringt. Der Beitrag des Unternehmens merkt an, dass bei einer Endeffektor-Geschwindigkeit von 3 m/s 10 ms Latenz etwa 3 cm Bewegung entsprechen, genug, um präzises Greifen und Einführen zu beeinträchtigen. Es ist dasselbe Argument über das Latenzbudget, nur auf einen Roboterarm statt auf ein Data Warehouse angewandt.

Es gibt ein Gegengewicht, das erwähnenswert ist. Ein am 30. September veröffentlichter Beitrag von Gleb Kogan beschreibt, wie Pinecone einen nutzungsbasierten Preisrechner von seiner Preisseite entfernte. In einem A/B-Test war die Wahrscheinlichkeit, dass Besucher sich anmeldeten, um 16% höher und dass sie das Unternehmen kontaktierten, um 90% höher, wenn sie den Rechner nicht sahen, ohne Anstieg der Support-Tickets zum Thema Preise. Die interne Umfrage vor dem Test ergab, dass 7 von 10 Mitarbeitern erwarteten, die Version mit Rechner würde gewinnen. Kostenwerkzeuge können also ebenso leicht in die Irre führen wie informieren, eine Warnung für jeden, der Token-Benchmarks als Rechnung liest.

Die Quail-Zahlen bleiben herstellerveröffentlichte Forschung, und die 1,84x, die das Team für seinen neu veröffentlichten Benchmark angibt, geometrisch über Aufgaben gemittelt, sind eine deutlich bescheidenere Behauptung als die Schlagzeile von einer Milliarde Token pro Minute. Der Benchmark selbst enthält zwei Abfragen, die die Autoren nach eigenen Angaben entworfen haben, um zu zeigen, wo AI-SQL-Inferenz noch Arbeit braucht.

Kommentare 0

Quellen

7
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Building an Ultra-High Throughput AI-SQL EngineEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04AI API Pricing Index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06Mind-1: Physical AI at Human Speed, Built for Real WorkEN
  7. 07The pricing calculator made people more confused about pricingEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.