Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenz-Engine Quail schafft über eine Milliarde Token pro Minute, während die Preise steigen

Quail, eine Inferenz-Engine aus dem Full Stack Data Lab, hat am 30. September Ergebnisse veröffentlicht: Auf einer einzelnen H100 GPU verarbeitete sie mehr als eine Milliarde Token pro Minute. Das ist über 10x schneller als die vLLM-Basis auf derselben Hardware und kostet auf Modal unter 6 Cent pro Milliarde Token.

KI & ModelleNachrichtLena BrandtVeröffentlicht: 30. September 20267 Min. LesezeitQuellen 9
Inferenz-Engine Quail schafft über eine Milliarde Token pro Minute, während die Preise steigen

Die Zahlen kommen zu einem Zeitpunkt, an dem GPU-Kapazität teurer wird. Laut Berichten hat AWS eine Erhöhung der GPU-Kapazitätspreise um 15% zum 7. Oktober angekündigt, Nebius hob die Inferenzpreise Ende September um 18,3% an. Vor diesem Hintergrund veröffentlichten diese Woche mehrere Projekte aus der Inferenzschicht Benchmarks, die die Kosten von der Softwareseite angehen.

Quail steht für QUery-Aware Inference Layer und stammt aus dem Full Stack Data Lab. Das Team beschreibt es als gemeinsame Optimierung von SQL-Abfrageplaner und Inferenz-Engine, gebaut für AI-SQL: SQL, erweitert um benutzerdefinierte Funktionen, die ein LLM aufrufen. Der eigene Benchmark-Bericht der Engine nennt 1,84x schneller als vLLM, geometrisch gemittelt über die Aufgaben. Darunter sind zwei Abfragen, die die Autoren entworfen haben, um zu zeigen, wo die AI-SQL-Inferenz noch Arbeit braucht.

Die Arbeitslast sieht überhaupt nicht wie ein Chatbot aus.

Eine AI-Funktion wertet ihren Prompt Zeile für Zeile aus. So kann eine einzelne SQL-Abfrage Hunderttausende oder Millionen Modellaufrufe erzeugen, heißt es in dem technischen Beitrag des Labors vom 30. September. Ein Filter braucht einen LLM-Aufruf pro Zeile, ein naiver Join einen Aufruf für jedes Paar von Zeilen aus zwei Eingabetabellen. Schickt man diese als einzelne Anfragen an eine Allzweck-Engine wie vLLM, entsteht laut dem Beitrag ein großer Overhead, weil die Anfragen Präfixe teilen, die wiederverwendet werden könnten.

Die BIO-4-Abfrage des Labors in seinem QUAIL-B-Benchmark zeigt das Ausmaß: 5.000 lange medizinische Berichte, verknüpft mit 4.144 Reaktionstermen, wobei die Reaktionsliste zweimal für zwei Joins verwendet wird. Der Plan filtert die Termmengen für kardiovaskuläre und neurologische Reaktionen und verknüpft dann die verbleibenden Berichte mit jeder von ihnen. Eine naive Ausführung würde einen Prompt pro Filtereingabe und einen Prompt pro Kandidatenpaar aus Bericht und Reaktion bedeuten.

Quails Antwort besteht darin, Planer und Engine füreinander empfänglich zu machen. Quail ist als Version 0.1.0 veröffentlicht, mit einem Beispiel, das eine Abfrage gegen den IMDB-Datensatz mit qwen3-4b-fp8 auf einem h100-sxm-Gerät ausführt. Der Benchmark-Bericht der Engine nennt die Zahl von einer Milliarde Token pro Minute für eine Multi-Join-Abfrage, bei der die Planung am wichtigsten ist, mehr als 10x schneller als die vLLM-Basis auf identischer Hardware.

Modal, wo die Demo gehostet wird, gibt die Kosten mit unter 6 Cent pro Milliarde Token an. Diese Zahl gilt für ein bestimmtes Abfrageprofil: kleine Open-Weights-Modelle, die kurze, begrenzte Entscheidungen treffen, statt langer agentischer Ketten. Die Autoren des Labors nennen DocETL von der UC Berkeley, LOTUS von Stanford, Palimpzest vom MIT und ThalamusDB von Cornell als akademische Systeme im selben Feld. Als Techniken, die Aufrufzahlen und Modellgrößen senken, nennen sie MOAR, Task Cascades, Abacus und BARGAIN.

Ihre Behauptung ist, dass selbst nach diesen Optimierungen ein Plan noch Hunderttausende oder Millionen Aufrufe erfordern kann. Genau hier zahlt sich eine zweckgebundene Engine aus.

Quail ist nicht allein darin, lokale Hardware ins Visier zu nehmen. Magnitude, ein Unternehmen aus dem YC S25, hat am 30. September eine Open-Source-Inferenz-Engine für Agenten gestartet und sie auf GitHub unter Apache 2.0 veröffentlicht. Das README behauptet, offene Modelle liefen bis zu 2x schneller als llama.cpp, aufgeschlüsselt als 92% schnelleres Decode auf Metal und 19% auf CUDA. Der Mechanismus ist Kompilierung und Kernel-Tuning auf dem Gerät des Nutzers, bevor ein Modell läuft, statt vorkompilierte Kernel für breite Hardwareklassen auszuliefern.

Magnitude behauptet außerdem 27% weniger Speicher pro Agent, freigegeben, wenn Agenten stoppen, sowie Prefix-Cache-Sharing über gleichzeitige Sitzungen hinweg. Es unterstützt Apple Silicon, NVIDIA, AMD oder reine CPU und verbindet sich mit Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi und Cline, mit einer OpenAI-kompatiblen API für alles andere. Das Unternehmen sagt, Prompts, Dateien und Modelle blieben auf dem Rechner, ohne Internet, sobald ein Modell heruntergeladen ist.

Beide Projekte werben mit derselben Ökonomie: Inferenz weg von abgerechneten Cloud-Endpunkten und hin zu Hardware, die der Käufer bereits besitzt oder zu einem Festpreis mietet. Die Preisdaten deuten an, warum dieses Argument ankommt.

Der September-Preisindex von AICostBudget, eingefroren mit Stichtag 30. September, umfasst 81 öffentliche Datensätze über 11 Anbieter. Der mediane Eingabepreis über 69 nicht-leere Skalare liegt bei $1,32 pro Million Token, der mediane Ausgabepreis bei $6. Der mediane Ausgabepreis liegt 5,0x über dem Eingabepreis. Die beobachteten Spannen sind weit: Die Eingabe reicht von $0,10 bis $30 pro Million Token, die Ausgabe von $0,10 bis $180.

Der Index quantifiziert außerdem die Rabattstrukturen, die Schlagzeilenpreise irreführend machen. Über 58 vergleichbare Datensätze liegt der mediane Rabatt auf zwischengespeicherte Eingaben bei 90%, mit einer beobachteten Spanne von 75% bis 98%. Über 44 batch-fähige Datensätze liegt der mediane Batch-Eingaberabatt bei 50%, beobachtete Spanne 20% bis 50%. Die eigene Schlussfolgerung des Berichts ist deutlich: Ein Workload-Vergleich, der Cache- und Batch-Preise ignoriert, lässt veröffentlichte Sparmodelle für einen großen Teil der erfassten Datensätze weg.

Die Medianwerte pro Anbieter im selben Datensatz setzen OpenAI bei $2 Eingabe und $11 Ausgabe über 18 Datensätze, Google Gemini bei $0,75 und $4,125 über 14, Anthropic bei $5 und $25 über 13, xAI bei $1,25 und $2,5 über neun, Mistral AI bei $0,20 und $0,60 über sieben, DeepSeek bei $0,30 und $1,2 über drei, Moonshot AI bei $0,95 und $4 über drei und Cohere bei $1,5 und $5,75 über zwei. Der Bericht warnt, dass Dokumentseiten, Speicher, Sitzungsdauer und andere zeitbasierte Einheiten nicht in eine reine Token-Tabelle gepresst werden können und dass 13 Datensätze Nicht-Token-Komponenten enthalten.

Nicht jedes Kostenproblem ist ein Preisproblem. Ein am 28. September auf dem SOSP '26 vorgestelltes Paper argumentiert, dass die Optimierung von GPU-Clustern allein auf Auslastung den Energieverbrauch erhöhen kann. Die Autoren Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar stellen EnerTune vor. Es nutzt analytische Modelle für Leistung und Energieverbrauch pro Modell sowie die Leistungsaufnahme gemeinsam platzierter Modelle auf geteilten GPUs in einem energiebewussten Bin-Packing-Algorithmus, der Platzierung und Konfiguration zusammen auswählt.

Ihr Abstract nennt Energieeinsparungen von 1,4x bis 2,3x und Reduktionen der Leistungsaufnahme von 1,3x bis 2,6x gegenüber dem Stand der Technik, während Leistungs-SLOs eingehalten werden. Das Paper argumentiert, dass das Profiling jedes Modells über Hunderte von Konfigurationen im Maßstab zu teuer ist. Deshalb beruht der Ansatz auf Modellen statt auf Messung.

Latenz, nicht Durchsatz, ist die Einschränkung in der physischen KI. MindOn hat am 30. September Mind-1 veröffentlicht und behauptet, die Roboter-Inferenzlatenz von 82ms auf 32ms zu senken. Der Beitrag des Unternehmens merkt an, dass bei einer Endeffektor-Geschwindigkeit von 3 m/s 10ms Latenz etwa 3cm Bewegung entsprechen, genug, um präzises Greifen, Einführen oder kontaktintensive Manipulation zu beeinflussen. MindOn weist auch auf das Tempo der Trainingsdaten hin: Ein großer Teil der Manipulationsdaten stammt aus der Teleoperation, die langsamer ist als natürliche menschliche Bewegung, und Modelle lernen das Tempo zusammen mit der Aufgabe.

Dieselbe Effizienzlogik zeigt sich außerhalb der KI. CleanTechnica berichtete am 29. September, dass eine Analyse von Transport & Environment die Betriebskosten von E-Autos auf weniger als die Hälfte von Diesel pro Kilometer setzt, basierend auf 6,9 L/100 km Dieselverbrauch gegenüber 20,2 kWh/100 km elektrisch und einem Strompreis von €0,343/kWh. T&Es Antony Froggatt sagte, die EU solle Ölgewinne besteuern, um Unterstützung für einkommensschwache Haushalte und Verschrottungsprogramme zu finanzieren. T&Es Ladeschätzung wird in der eigenen Methodik als wahrscheinlich obere Grenze beschrieben.

Telekommunikationsanbieter verfolgen dieselbe Strategie über Konsolidierung. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur Fusionsgespräche führen, wo das Paar bereits 5G-Spektrum und Funkzugangsnetz über ein gemeinsam gehaltenes Unternehmen namens Antina teilt. Singtel soll im Juni einen Mobilfunkanteil von 43% gehalten haben, M1 bei 22%, StarHub bei 21% und Simba bei 14%. In Neuseeland haben 2degrees und OneNZ vorgeschlagen, ihre Funknetze in einer gemeinsam gehaltenen Einheit zusammenzulegen, mit einer Entscheidung der Commerce Commission, die nächstes Jahr erwartet wird. Light Reading nennt die 5G-Vereinbarung von China Telecom und China Unicom als größte derartige Partnerschaft, mit 1.500.000 Basisstationen und behaupteten Capex-Einsparungen von $56.000.000.000.

Ob Quails Durchsatz sich in niedrigeren Rechnungen für gewöhnliche AI-SQL-Nutzer niederschlägt, ist noch nicht geklärt. Die Zahl von einer Milliarde Token pro Minute stammt aus einer einzigen Multi-Join-Abfrage, die gewählt wurde, weil die Planung dort am wichtigsten ist. Der gemittelte Benchmark der Engine über den gesamten Aufgabensatz liegt bei 1,84x, nicht bei 10x. Das Labor selbst hat zwei Abfragen aufgenommen, die aktuelle Schwächen offenlegen sollen. Quail steht bei Version 0.1.0.

Kommentare 0

Quellen

9
  1. 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03AI API pricing index - September 2026EN
  4. 04Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
  7. 07The pricing calculator made people more confused about pricingEN
  8. 08Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.