Inference-Preise spalten sich: offene Engines drücken Tokens, Hardware-Kosten steigen
Eine Open-Source-Inference-Engine, die ihre CPU-Kernel auf dem eigenen Gerät abstimmt, ist am 30. September erschienen. Sie verspricht Decode-Geschwindigkeiten bis zu 92% schneller als llama.cpp auf Metal. Neue Forschung und Preisdaten deuten auf eine wachsende Kluft bei den Kosten für den Betrieb von KI hin.

Am 30. September veröffentlichte Magnitude, ein Unternehmen aus dem Y-Combinator-Programm S25, eine Open-Source-Inference-Engine für Agenten. Sie kompiliert und optimiert ihre Kernel auf der Hardware des Nutzers. Das Repository gibt an, offene Modelle liefen "bis zu 2x schneller als llama.cpp", mit 92% schnellerem Decode auf Metal und 19% auf CUDA sowie 27% weniger Speicher pro Agent. Die Engine läuft auf Apple Silicon, NVIDIA, AMD oder einer CPU und verbindet sich mit Pi, OpenCode, Hermes, Codex, Claude Code und Cline, so die GitHub-Seite des Projekts.
Das ist der jüngste Eintrag in einer Woche konkurrierender Behauptungen darüber, was Inference kosten sollte. Am selben Tag meldeten die Forscher hinter Quail, einer query-bewussten Inference-Schicht, sie hätten eine Multi-Join-AI-SQL-Abfrage mit mehr als einer Milliarde Tokens pro Minute auf einer einzelnen H100-GPU ausgeführt. Nach ihren Angaben ist das über 10x schneller als ihre vLLM-Baseline auf derselben Hardware.
Die Token-Seite: Planung schlägt rohe Gewalt
Die Quail-Arbeit erschien im Blog des Full Stack Data Lab und ausführlicher im Blog von Modal. Sie greift eine bestimmte Last an: AI-SQL, bei dem SQL-Abfragen Sprachmodelle Zeile für Zeile aufrufen. Ein Filter braucht einen Aufruf pro Zeile, ein naiver Join einen Aufruf für jedes Zeilenpaar. Bei einer Benchmark-Abfrage, die die Forscher BIO-4 nennen, enthalten die Eingaben 5.000 lange medizinische Berichte und 4.144 Reaktionsbegriffe, die zweimal über zwei Joins verwendet werden. Ihr Argument: Wer Millionen zusammenhängender Aufrufe als einzelne Anfragen an eine Allzweck-Engine schickt, verschwendet den gemeinsamen Prefix-Zustand. Indem sie den Query-Plan und die Inference-Engine gemeinsam optimieren, senken sie diesen Overhead. Modals Text beziffert die Kosten auf unter 6 Cent pro Milliarde Tokens auf seiner Plattform. Er meldet Quail mit 1,84x schneller als vLLM, geometrisch gemittelt über einen neuen AI-SQL-Benchmark, einschließlich zweier Abfragen, die das Team entworfen hat, um verbleibende Schwächen offenzulegen.
"Verschiedene Inference-Anwendungen erzeugen verschiedene Inference-Workloads, und AI-SQL ist keine Ausnahme", heißt es im Modal-Beitrag. Eine einzelne Abfrage kann demnach Millionen von Sequenzen mit Tausenden Tokens erzeugen.
Beide Zahlen stammen von den Teams, die die Systeme bauen, und keine wurde aus dem veröffentlichten Material unabhängig reproduziert. Dieser Vorbehalt zählt, denn das weitere Preisbild ist unordentlicher, als es jede einzelne Beschleunigung nahelegt.
Der September-Preisindex von AICostBudget, eingefroren mit Stichtag 2026-09-30 UTC, erfasst 81 öffentliche Einträge bei 11 Anbietern. Er setzt den medianen Eingabepreis auf $1,32 pro 1M Tokens und den medianen Ausgabepreis auf $6, ein Verhältnis von 5,0x über die 69 Einträge, die beide Werte tragen. Die beobachteten Spannen reichen von $0,10 bis $30 für Eingaben und von $0,10 bis $180 für Ausgaben. Derselbe Datensatz meldet einen medianen Rabatt auf gecachte Eingaben von 90% über 58 vergleichbare Einträge und einen medianen Batch-Rabatt von 50% über 44 batchfähige Zeilen. Listenpreise sind also ein schlechter Wegweiser dafür, was ein Workload tatsächlich zahlt. Die Anbieter-Mediane im Index reichen von Mistral AI mit $0,20 Eingabe und $0,60 Ausgabe über drei Einträge bis zu Anthropic mit $5 und $25 über 13. OpenAIs 18 Einträge liegen bei $2 und $11, Googles Gemini mit 14 bei $0,75 und $4,125.
Die Hardware-Seite: Energie, nicht nur Auslastung
Wenn die Token-Ökonomie besser wird, folgt die GPU-Ökonomie nicht automatisch. Ein am 28. September auf dem SOSP '26 vorgestelltes Paper argumentiert, dass die Optimierung von GPU-Clustern allein auf Auslastung den Energieverbrauch erhöhen kann. Die Autoren Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar beschreiben EnerTune, ein Serving-System, das Leistung und Leistungsaufnahme pro Modell modelliert, einschließlich kolokierter Modelle auf geteilten GPUs. Es nutzt einen energiebewussten Bin-Packing-Algorithmus, um Modelle zu platzieren und zu konfigurieren. Das Paper beansprucht Energieeinsparungen von 1,4-2,3x und Reduktionen der Leistungsaufnahme von 1,3-2,6x gegenüber dem Stand der Technik, während Performance-SLOs eingehalten werden. Es macht außerdem einen praktischen Punkt zur Skala: Jedes Modell unter Hunderten von Konfigurationen zu profilieren, ist unverhältnismäßig teuer, und das Profiling selbst verbraucht Energie.
Das ist ein akademisches Ergebnis, kein Anbieter-Benchmark. Es fällt in eine Zeit, in der Betreiber im Asien-Pazifik-Raum einen anderen Weg zur Kostensenkung gehen. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur Fusionsgespräche führen. Dort teilen sie bereits 5G-Spektrum und Funkzugangsnetz über ein gemeinsam gehaltenes Unternehmen namens Antina. Singtel hielt im Juni Berichten zufolge einen Anteil von 43% am Mobilfunkmarkt, M1 lag bei 22%, StarHub bei 21% und Simba bei 14%.
In Neuseeland haben 2degrees und OneNZ vorgeschlagen, ihre Funknetze in einer gemeinsam gehaltenen Einheit zusammenzulegen. Das Geschäft soll im kommenden Jahr die Commerce Commission erreichen. Light Reading verweist auf den Präzedenzfall: Die gemeinsame 5G-Infrastruktur von China Telecom und China Unicom umfasst inzwischen 1.500.000 Basisstationen und beanspruchte Einsparungen von $56.000.000.000 an Investitionsausgaben. Das sind Konnektivitätsgeschäfte, keine KI-Compute-Geschäfte. Sie zeigen aber denselben Instinkt: Teure feste Anlagen zu teilen ist besser, als sie zu verdoppeln.
Was die Käufer sehen
Für alle, die tatsächlich für Inference zahlen, ist der nützlichste Datenpunkt der Woche vielleicht ein warnender. Gaurav Kogan beschrieb am 30. September, wie er bei Pinecone nach einem A/B-Test einen nutzungsbasierten Preisrechner entfernte. Besucher, die den Rechner nicht sahen, meldeten sich 16% häufiger an und kontaktierten das Unternehmen 90% häufiger, schrieb er, ohne Zunahme der Support-Tickets zum Thema Preise. Seine Begründung für die Entfernung ist konkret: Eine leichte Fehlinterpretation konnte eine Schätzung erzeugen, die um bis zu 1.000x zu hoch lag, und der Rechner gab den Nutzern falsche Sicherheit. Eine interne Umfrage ergab, dass 7 von 10 Mitarbeitern erwarteten, die Version mit dem Rechner würde besser abschneiden. Die Lehre überträgt sich auf Inference-Preise. Dort können Cache- und Batch-Tarife eine Rechnung um eine Größenordnung verschieben, und die Schlagzeilenzahl spiegelt den Workload selten wider.
Zwei weitere Punkte vom 30. September liegen am Rand dieser Geschichte. MindOn stellte Mind-1 vor, ein Physical-AI-Modell, das nach Angaben des Unternehmens die Inferenzlatenz von Robotern von 82ms auf 32ms senkt. Bei einer Endeffektor-Geschwindigkeit von 3 m/s entsprechen 10ms Latenz etwa 3cm Bewegung. Und Transport & Environment veröffentlichte eine Analyse, über die CleanTechnica am 29. September berichtete. Danach zahlen EV-Fahrer weniger als die Hälfte dessen, was Diesel-Fahrer pro Kilometer zahlen, wobei Diesel-Fahrer pro Tank 32 Euro mehr zahlen als zu Jahresbeginn.
Beides sind keine Rechenzentrumsgeschichten. Beide erinnern daran, dass Inference-Kosten heute eine physische Beschränkung sind, gemessen in Millisekunden, Joule und Euro, nicht nur in Dollar pro Million Tokens.
Der rote Faden der Woche ist, dass keine einzelne Zahl die Frage entscheidet. Magnitudes 92%-Decode-Behauptung ist Metal-spezifisch und selbst berichtet. Quails Milliarde Tokens pro Minute stammt aus einer einzigen Multi-Join-Abfrage auf einer H100, wobei das Team selbst zwei Benchmark-Abfragen als verbesserungswürdig markiert. EnerTunes Einsparungen sind in einem Paper gegen Baselines modelliert. Der Preisindex ist eine eingefrorene Momentaufnahme von Listenpreisen, die die meisten Käufer nicht zahlen.
Konstant ist die Richtung der Technik: Kernel auf den genauen Chip abstimmen, Abfragen um das Modell herum planen und Leistung als erstklassige Kennzahl behandeln. Ob das als billigere Inference sichtbar wird, hängt weniger von einem einzelnen Benchmark ab als davon, wie viel davon in die Produktion gelangt.
Quellen
9- 01Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 06Singapore, New Zealand operators seek partnerships to cut costsEN
- 07The pricing calculator made people more confused about pricingEN
- 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.