Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenzkosten sinken: Quail und Magnitude drücken die Serving-Preise

Modal und das Full Stack Data Lab der Carnegie Mellon haben am 30. September mitgeteilt, dass ihre Engine Quail auf einer einzigen H100 GPU über eine Milliarde Token pro Minute verarbeitet. Das ist mehr als das Zehnfache ihrer vLLM-Basislinie. Auf Modal kostet diese Arbeit unter 6 Cent pro Milliarde Token.

KI & ModelleErklärtLena BrandtVeröffentlicht: 30. September 20264 Min. LesezeitQuellen 6
Inferenzkosten sinken: Quail und Magnitude drücken die Serving-Preise

Die Meldung fällt auf denselben Tag, an dem ein von Y Combinator unterstütztes Projekt namens Magnitude eine Open-Source-Inferenz-Engine veröffentlichte, die ihre Kernel auf der vorhandenen Hardware selbst abstimmt. Beide verfolgen dieselbe Idee: Teuer ist nicht mehr das Modell, sondern die Serving-Schicht.

Quail ist Gemeinschaftsarbeit von Inferenzforschern bei Modal und Datenbankforschern am Full Stack Data Lab der Carnegie Mellon. Beschrieben wird sie in einem Beitrag vom 30. September auf dem Blog von Modal und in einer begleitenden Ausarbeitung des Labors. Angegriffen wird das Problem AI-SQL, bei dem SQL-Abfragen Sprachmodelle Zeile für Zeile aufrufen. Ein einzelner Filter braucht einen Modellaufruf pro Zeile. Ein naiver Join braucht einen Aufruf für jedes Zeilenpaar. Die Benchmark-Abfrage des Labors, BIO-4, filtert 5.000 medizinische Berichte gegen 4.144 Begriffe für unerwünschte Reaktionen und verknüpft sie anschließend zweimal. Der Beitrag des Labors schätzt eine Lichtgeschwindigkeits-Laufzeit von 894,37 Sekunden, also 14,91 Minuten. Grundlage ist ein Roofline-Modell, das Spitzen-GPU-Durchsatz, vollständige Überlappung von CPU und GPU und unbegrenzten KV-Cache-Speicher annimmt.

vLLM 0.26.0 mit Qwen3 4B FP8 auf einer H100 brauchte bei Skalierungsfaktor 1,0 laut Labor 6,84 Stunden. Das ist das 27,55-Fache der idealen Schätzung.

Zwei Ursachen: Host-Overhead, bei dem die CPU Anfragen einplant, während die GPU wartet, und das, was sie KV-Regret nennen. vLLM verwirft dabei Key-Value-Zustand, den es später wieder braucht. Das Labor zählt in diesem Lauf 174.600.000 verschwendete Token.

Bei einer Multi-Join-Abfrage, bei der die Planung besonders wichtig ist, erreicht Quail über eine Milliarde Token pro Minute pro H100 GPU (TPM/GPU), mehr als 10x schneller als unsere vLLM-Basislinie auf derselben Hardware.

Modals Beitrag führt den Vorsprung darauf zurück, dass die Abfragestruktur vorab bekannt ist. Dadurch kann die Engine Anfragen so ordnen, dass KV-Zustand besser im Cache bleibt oder verworfen wird. Dafür war eine Überarbeitung der Cascade Attention nach Hydragen-Art nötig. Über den gesamten Benchmark läuft Quail geometrisch gemittelt 1,84x schneller als vLLM. Eingeschlossen sind zwei Abfragen, die die Autoren entworfen haben, um zu zeigen, wo AI-SQL-Inferenz noch Arbeit braucht.

Magnitude setzt auf die eigene Hardware

Magnitude, geführt als YC-S25-Unternehmen, wählte für dasselbe Kostenproblem den entgegengesetzten Weg. Das am 30. September aktualisierte GitHub-README beschreibt eine Engine, die Kernel auf dem Gerät des Nutzers kompiliert und abstimmt, bevor ein Modell läuft, statt vorkompilierte Kernel für Hardwareklassen auszuliefern. Das Projekt beansprucht bis zu 2x schneller als llama.cpp, mit 92% schnellerem Decode auf Metal und 19% auf CUDA, dazu 27% weniger Speicher pro Agent. Es läuft auf Apple Silicon, NVIDIA, AMD oder allein auf einer CPU, verbindet sich per Klick mit Agenten wie Pi, OpenCode, Hermes, Codex und Claude Code und steht unter Apache-2.0-Lizenz. Prompts, Dateien und Modelle bleiben lokal, heißt es im README.

Beide Projekte jagen derselben Rechnung hinterher.

Ein am 30. September von AICostBudget veröffentlichter Preisindex, der 81 öffentliche Datensätze von 11 Anbietern abdeckt, setzt den Medianpreis für Input auf 1,32 US-Dollar pro Million Token und den Medianpreis für Output auf 6 US-Dollar. Output kostet im Median etwa fünfmal so viel wie Input. Dieselbe Momentaufnahme ergab einen mittleren Rabatt auf gecachten Input von 90% über 58 vergleichbare Datensätze und einen mittleren Batch-Rabatt von 50% über 44. Das ist das Detail, das für alle zählt, die AI-SQL betreiben. Workloads, die sich batchen und cachen lassen, zahlen einen Bruchteil des Listenpreises. Workloads, bei denen das nicht geht, zahlen den vollen Preis.

Die Rechnung kommt woanders an

Energie ist die andere Zahl im Raum.

Ein am 28. September auf der SOSP '26 vorgestelltes Paper von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar argumentiert, dass die reine Optimierung von GPU-Clustern auf Auslastung den Energieverbrauch erhöhen kann. Ihr System EnerTune nutzt analytische Modelle für Leistung und Stromverbrauch einzelner Modelle, einschließlich des Verbrauchs von Modellen, die auf einer GPU gemeinsam laufen, und einen energiebewussten Bin-Packing-Algorithmus. Sie berichten von 1,4 bis 2,3x weniger Energie und 1,3 bis 2,6x geringerer Leistungsaufnahme als aktuelle Basislinien, während die Leistungsziele weiter erreicht werden.

Die Autoren von Quail behaupten nicht, ihr Benchmark entscheide irgendetwas. Sie schreiben, zwei der Abfragen seien entworfen worden, um zu zeigen, wo AI-SQL-Inferenz verbessert werden muss, und sie rahmen das geometrische Mittel von 1,84x als Ausgangspunkt, nicht als Obergrenze. Die 14,91 Minuten des Labors bleiben ein Ideal: Keine Implementierung erfüllt alle Annahmen.

Noch ein Datenpunkt, von der anderen Seite der Preisdebatte.

Ein Beitrag von Gagan Kogan vom 30. September, der Arbeit bei Pinecone schildert, beschreibt einen A/B-Test. Darin brachte das Entfernen eines Rechners für nutzungsbasierte Preise von der Preisseite Besucher um 16% eher zur Anmeldung und um 90% eher dazu, das Unternehmen zu kontaktieren. Die Support-Tickets zum Thema Preise nahmen nicht zu. Sieben von zehn Mitarbeitern hatten vorhergesagt, der Rechner werde gewinnen. Kostentransparenz ist, wie sich zeigt, ihre eigene Art von Komplexität.

Für Käufer ist die praktische Lesart enger als die Schlagzeilen. Der Preis pro Token fällt für strukturierte, cachefähige Workloads, und Anbieter veröffentlichen die Stufen, die ihn fallen lassen. Die Infrastruktur darunter, GPUs, Strom und die Planung dazwischen, ist der Ort, an dem der Kostenkampf jetzt ausgetragen wird.

Kommentare 0

Quellen

6
  1. 01Building an Ultra-High Throughput AI-SQL EngineEN
  2. 02Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
  3. 03magnitudedev/magnitude: Open source inference engine for agentsEN
  4. 04AI API Pricing Index, September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  6. 06The pricing calculator made people more confused about pricingEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.