Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Quail reklamiert 1B Token pro Minute auf einer einzelnen H100, während sich die Inferenzkosten aufspalten

Zwei neue Inferenz-Engines behaupten Effizienzgewinne in Größenordnungen auf derselben GPU-Hardware, während OpenAIs neues 500-Dollar-Abo und eine Preisaufnahme von September zeigen, dass sich der Markt pro Token weiterhin in entgegengesetzte Richtungen bewegt.

KI & ModelleNachrichtKatrin HoffmannVeröffentlicht: 30. September 20267 Min. LesezeitQuellen 10
Quail reklamiert 1B Token pro Minute auf einer einzelnen H100, während sich die Inferenzkosten aufspalten

Am 30. September veröffentlichte das Full Stack Data Lab einen Blogbeitrag über Quail, eine Inferenz-Engine, die speziell für AI-SQL gebaut wurde, die SQL-Erweiterungen, mit denen Abfragen große Sprachmodelle Zeile für Zeile aufrufen können. Das Projekt behauptet, auf einer einzelnen H100 GPU bei einer Multi-Join-Abfrage mehr als 1B Token pro Minute verarbeitet zu haben, und einen geometrischen Mittelwert von 1,84-facher Beschleunigung gegenüber vLLM über einen neuen Benchmark für AI-SQL-Workloads.

Das ist die Schlagzeilenzahl. Sie ist auch eine enge.

Die Zahl von 1B Token pro Minute stammt aus einer einzelnen Abfrage, die das Team als eine beschreibt, bei der "die Planung besonders wichtig ist", nicht aus einem Durchschnitt. Die breitere Benchmark-Zahl, 1,84x, ist diejenige, die die Autoren als allgemeines Ergebnis präsentieren. Am selben Tag startete Magnitude, ein Unternehmen aus dem Y Combinator S25, eine Open-Source-Inferenz-Engine, die nach eigenen Angaben ihre Kernel auf der Hardware des Nutzers abstimmt, bevor ein Modell läuft. Das GitHub-README behauptet bis zu 2x schneller als llama.cpp, mit 92% schnellerem Decode auf Apple Metal und 19% auf CUDA, und 27% weniger Speicher pro Agent. Das Projekt erscheint unter Apache 2.0 und läuft auf Apple Silicon, NVIDIA, AMD oder nur CPU.

Was die Zahlen tatsächlich vergleichen

Keine der beiden Behauptungen ist eine allgemeine Aussage über den Preis der Inferenz. Magnitude benchmarkt gegen llama.cpp, eine Allzweck-Engine, und schreibt seinen Vorsprung handgeschriebenen Kernels für populäre Open-Weight-Modellfamilien zu. Quail benchmarkt gegen vLLM und schreibt seinen Vorsprung der gemeinsamen Optimierung des SQL-Abfrageplans und der Inferenz-Engine zu, sodass Millionen verwandter Modellaufrufe Präfix-Caches teilen, statt als separate Anfragen einzutreffen.

Der Beitrag des Full Stack Data Lab vom 24. September legt das Kostenproblem direkt dar: Eine AI-Funktion in einer SQL-Abfrage wertet ihren Prompt pro Zeile aus, sodass ein Filter einen LLM-Aufruf pro Zeile benötigt und ein naiver Join einen Aufruf für jedes Paar von Zeilen in seinen beiden Eingaben.

Die Benchmark-Abfrage des Teams, BIO-4, läuft über 5.000 lange medizinische Berichte, die gegen 4.144 Reaktionsbegriffe gejoint werden. Die Autoren sagen, dass das Senden dieser Aufrufe an eine Allzweck-Engine als separate Anfragen hohe Kosten verursacht. Ihre Lösung ist, auf Abfrageebene zu planen. Der Blog von Modal zur selben Arbeit nennt die Ökonomie deutlicher: unter 6 Cent pro Milliarde Token auf Modal-Hardware für die Abfrage mit 1B TPM. Diese Zahl ist die eigene Zahl eines Anbieters für seine eigene Plattform, und sie deckt eine Abfrageform ab, nicht einen repräsentativen Workload.

Verschiedene Inferenzanwendungen erzeugen verschiedene Inferenz-Workloads, und AI-SQL ist keine Ausnahme. Eine Abfrage wie die obige kann Millionen von Sequenzen mit Tausenden von Token erzeugen.

Abonnement-Preise bewegen sich in die andere Richtung

Auf der Verbraucherseite ging OpenAI den anderen Weg. Auf seinem Dienstags-DevDay kündigte das Unternehmen eine Pro-500-Stufe für 500 Dollar im Monat an, 300 Dollar mehr als sein vorheriger Top-Tarif, laut Business Insider. Die Stufe enthält Zugang zu "Ultrafast"-Compute für GPT-6 Astra in ChatGPT Work und Codex, was laut OpenAI eine 8-fache Geschwindigkeitssteigerung in Codex bedeutet, sowie die höchste enthaltene Nutzung des Unternehmens.

OpenAI öffnete außerdem seinen 200-Dollar-Pro-Tarif wieder, halbierte jedoch das Compute-Kontingent.

Das Kontingent beträgt jetzt das 10-fache des 20-Dollar-Plus-Tarifs, gegenüber einem 20-fachen zuvor, und die GPT-6-Pro-Chat-Nachrichten sinken von 200 auf 100 pro Woche. Thibault Sottiaux, Engineering-Lead für Codex, schrieb in einem X-Post am Montag, dass die Änderungen unterm Strich bei der Hälfte der API-Ausgaben in Dollar gegenüber dem vorherigen Tarif landen. "Ich wollte diese Änderung unbedingt vorab teilen, damit ihr sie alle versteht, bevor wir euch mit guten Nachrichten überschütten", schrieb er, zitiert von Business Insider. Die beiden Schritte weisen in entgegengesetzte Richtungen: ein günstigeres Kontingent pro Token auf der 200-Dollar-Ebene, eine deutlich teurere Stufe darüber. Bestehende Pro-Abonnenten erhalten während der Übergangszeit eine einmalige Gutschrift.

Eine separate Aufnahme, veröffentlicht am 30. September von AICostBudget, umfasst 81 öffentliche Preisaufzeichnungen über 11 Anbieter und setzt den Median für Input auf 1,32 Dollar und den Median für Output auf 6 Dollar pro Million Token. Die beobachtete Spanne über 69 Aufzeichnungen mit einem Input-Skalar reicht von 0,10 bis 30 Dollar und bei Output von 0,10 bis 180 Dollar. Output ist üblicherweise die höhere Listenpreis-Komponente, mit einem medianen Output-zu-Input-Verhältnis von 5,0x.

Derselbe Datensatz berichtet einen medianen Rabatt auf gecachten Input von 90% über 58 vergleichbare Aufzeichnungen und einen medianen Batch-Input-Rabatt von 50% über 44. Das ist der Teil des Marktes, in dem der effektive Preis stark vom Listenpreis abweichen kann, und der Teil, den ein naiver Kostenvergleich meist übersieht.

Hardware, Energie und der Rest des Stacks

Effizienzarbeit dreht sich nicht nur um Token pro Sekunde. Ein auf der SOSP '26 am 28. September vorgestelltes Paper beschreibt EnerTune, ein Serving-System, das den Stromverbrauch pro Modell und den Verbrauch von Modellen modelliert, die auf gemeinsam genutzten GPUs kolokalisiert sind, und dann einen energiebewussten Bin-Packing-Algorithmus verwendet, um sie zu platzieren und zu konfigurieren. Die Autoren berichten von 1,4- bis 2,3-fach niedrigerem Energieverbrauch und 1,3- bis 2,6-fach niedrigerer Leistungsaufnahme als modernste Baselines, während Performance-SLOs eingehalten werden. Ihr Argument ist, dass eine Optimierung rein auf Auslastung den Energieverbrauch erhöhen kann, was zählt, wenn die Rechnung nicht nur pro Token geht.

Auf der Robotikseite stellte MindOn am 30. September Mind-1 vor, ein Physical-AI-Modell, das nach eigenen Angaben die Roboter-Inferenzlatenz von 82ms auf 32ms senkt.

Das Unternehmen merkt an, dass bei einer Endeffektor-Geschwindigkeit von 3 m/s 10ms Latenz etwa 3cm Bewegung entsprechen, genug, um präzises Greifen zu beeinflussen. Das ist ein anderer Markt als Data-Center-Inferenz, aber dieselbe Einschränkung: Latenz und Kosten werden von der gesamten Pipeline bestimmt, nicht vom Modell allein.

Telekommunikationsbetreiber verfolgen eine verwandte Logik bei Infrastrukturkosten. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur in Fusionsgesprächen sind, wo sie bereits 5G-Spektrum und Funkzugangsnetz über ein gemeinsames Unternehmen namens Antina teilen. In Neuseeland haben 2degrees und OneNZ vorgeschlagen, ihre Funknetze in eine gemeinsam gehaltene Einheit zu bündeln. Der Artikel zitiert Singtels berichteten Anteil von 43% am mobilen Markt Singapurs im Juni, gegenüber 22% für M1, 21% für StarHub und 14% für Simba, und sagt, dass ein kombiniertes StarHub-M1 in ähnlichem Maßstab wie Singtel wäre. Die 5G-Vereinbarung von China Telecom und China Unicom wird als größter solcher Sharing-Deal genannt, mit 1.500.000 Basisstationen und behaupteten Einsparungen von 56.000.000.000 Dollar an Capex.

Nicht jeder Versuch, Kosten durch zusätzliche Maschinerie zu senken, funktioniert. Ein am 30. September von Gokul Kogan veröffentlichter Beitrag beschreibt, wie Pinecone einen nutzungsbasierten Preisrechner nach A/B-Tests entfernte. Besucher, die den Rechner nicht sahen, meldeten sich 16% häufiger an und kontaktierten das Unternehmen 90% häufiger, ohne Zunahme der Pricing-Support-Tickets, laut dem Beitrag. In einer internen Umfrage erwarteten sieben von zehn Mitarbeitern, dass die Version mit dem Rechner besser abschneiden würde. Die Lehre ist eine Warnung für jeden, der einen Kostenschätzer für einen token-bepreisten Dienst baut: Eine Schätzung, die um eine Größenordnung falsch liegt, kann den Kunden vollständig verlieren.

Zusammengenommen ist das Bild weniger ein einzelner fallender Preis als eine Reihe von Engineering-Wetten. Quail setzt auf abfragebewusstes Batching. Magnitude setzt auf Kernel-Kompilierung pro Gerät. EnerTune setzt auf leistungsbewusste Platzierung. OpenAI testet, wie viel eine kleine Zahl schwerer Nutzer für Geschwindigkeit zahlen wird, während seine günstigere Stufe weniger Compute als zuvor erhält. Die einzige Zahl, die über das Dossier hinweg stabil ist, ist die Form der Rechnung: Output-Token kosten mehr als Input, Cache- und Batch-Rabatte sind groß, und die Schlagzeilenzahlen eines einzelnen Benchmarks beschreiben eine Abfrage, auf einer Maschine, an einem Tag.

Kommentare 0

Quellen

10
  1. 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04ChatGPT's new plan costs $500 a monthEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN
  10. 10Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.