Inferenzkosten rücken in den Mittelpunkt des KI-Stacks, während neue Engines erscheinen
Magnitude, ein Startup aus dem Y-Combinator-Programm S25, hat seine Open-Source-Inferenz-Engine am 30. September auf GitHub veröffentlicht. Das Unternehmen behauptet, offene Modelle liefen auf derselben Hardware bis zu 2x schneller als llama.cpp.

Laut dem GitHub-Eintrag hat Magnitude sein Repository am 30. September um 17:37 UTC veröffentlicht. Das Versprechen ist eng und konkret: eine Inferenz-Engine für Agenten, die Kernel auf dem Gerät kompiliert und abstimmt, auf dem sie läuft. Das Unternehmen sagt, das ergebe bis zu 2x schnellere Leistung als llama.cpp, mit 92% schnellerem Decode auf Apples Metal-Backend und 19% auf CUDA.
Die Angabe ist ein Hersteller-Benchmark. Niemand außerhalb von Magnitude hat ihn bisher reproduziert. Das Repository nennt weder die Modelle noch die Prompt-Längen oder Batch-Größen hinter den Zahlen. Die 2x sind eine Marketingzahl, bis jemand Unabhängiges sie nachfährt.
Wichtiger ist, worauf das Unternehmen zielt. Magnitude liefert nach eigenen Angaben eine Desktop-App, die sich mit Agenten verbindet, die Menschen bereits nutzen, und nennt Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi und Cline. Alles andere läuft über eine OpenAI-kompatible API. Die Engine läuft laut Repo auf Apple Silicon, NVIDIA- oder AMD-GPUs oder allein auf einer CPU. Magnitude behauptet außerdem 27% weniger Speicher pro Agent, freigegeben, wenn Agenten stoppen, und sagt, Sitzungen teilten Prefix-Caches, um Verlangsamungen bei Nebenläufigkeit zu vermeiden.
Dieselbe Woche, eine andere Ebene des Stacks
Zwei Stunden später am 30. September landete eine zweite Veröffentlichung. Full Stack Data Lab publizierte einen Blogbeitrag über Quail, eine query-bewusste Inferenzschicht, die mit Modal gebaut wurde. Modal stellte am selben Tag um 17:38 UTC eine eigene Beschreibung online. Quail greift AI-SQL an, die Praxis, Sprachmodelle Zeile für Zeile aus SQL-Abfragen heraus aufzurufen.
Die Zahlen sind groß und die Einordnung ist direkt. Full Stack Data Lab sagt, eine einzelne Abfrage könne Hunderttausende oder Millionen Modellaufrufe erzeugen. Der Grund: Eine AI-Funktion wertet einen Prompt pro Zeile aus, ein naiver Join einen Prompt pro Zeilenpaar. Bei einer Benchmark-Abfrage namens BIO-4, die 5.000 medizinische Berichte mit 4.144 Reaktionsbegriffen verknüpft, geht das Labor die Kosten durch, diese Aufrufe als einzelne Anfragen an eine Allzweck-Engine wie vLLM zu schicken.
Modals Beitrag nennt das Ergebnis: Quail verarbeitet über eine Milliarde Token pro Minute pro H100-GPU bei einer Multi-Join-Abfrage, mehr als 10x schneller als die vLLM-Baseline auf derselben Hardware, bei unter 6 Cent pro Milliarde Token auf Modal. Über einen neu veröffentlichten Benchmark hinweg läuft Quail laut Modal 1,84x schneller als vLLM, geometrisch gemittelt über die Aufgaben. Modal weist darauf hin, dass der Satz zwei Abfragen enthält, die zeigen sollen, wo AI-SQL-Inferenz noch Arbeit braucht.
Ich sehe es als einen Punkt auf der pareto-optimalen Kurve der LLMs in einem Regime, in dem eine große offengelegte latente Nachfrage bestand (kein Denken, einzelnes Token, akzeptable Intelligenz bei niedriger Latenz), in das zu wenig investiert wurde, weil alle dem Rennen um höhere Intelligenz folgten. Karpathy-san, über Jev
Dieses Zitat steht in Modals Beitrag und wird dort Karpathy zugeschrieben, mit Blick auf das Jev-Modell von TypeSafe AI. Das Argument lautet, dass ein großer Teil der Inferenznachfrage am billigen Ende mit niedriger Latenz liegt und unterversorgt wurde, weil die Labore stattdessen der Frontier-Fähigkeit nachjagten. Magnitude und Quail sind beides Wetten auf diese Lücke.
Keine der beiden Beschreibungen ist peer-reviewt. Beide sind Unternehmensblogs zu Code-Veröffentlichungen, und die Vergleichsbaselines, einmal gegen llama.cpp, einmal gegen vLLM, wählen die Autoren selbst. Die Richtung ist einheitlich, aber die Größenordnungen sollten nicht als gesichert gelten.
Was der Strom und die Preisliste sagen
Wissenschaftliche Arbeit, die diese Woche veröffentlicht wurde, zeigt auf ein verwandtes Problem, das schnellere Token allein nicht lösen. Ein auf der SOSP '26 vorgestelltes Paper, datiert auf den 28. September und in den ACM-Proceedings gelistet, argumentiert, dass die Optimierung von GPU-Clustern rein auf Auslastung den Energieverbrauch erhöhen kann. Die Autoren Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar beschreiben ein System namens EnerTune. Es modelliert Leistung und Verbrauch pro Modell analytisch, statt jede Konfiguration zu profilieren, und packt Modelle entsprechend auf gemeinsam genutzte GPUs. Sie berichten von 1,4 bis 2,3 Mal weniger Energieverbrauch und 1,3 bis 2,6 Mal weniger Leistungsaufnahme gegenüber dem Stand der Technik, während die Leistungsziele weiter erfüllt werden.
Dann ist da die Seite der Listenpreise. AICostBudget veröffentlichte am 30. September seinen Preisindex für September, eine eingefrorene Momentaufnahme mit Stichtag 2026-09-30 UTC, die 81 öffentliche Preisangaben von 11 Anbietern abdeckt. Der mediane Eingabepreis über 69 Einträge liegt bei $1.32 pro Million Token und der mediane Ausgabepreis bei $6 pro Million, ein Verhältnis von 5,0x. Der Ausgabepreis, nicht die Prompt-Verarbeitung, ist meist der größere Anteil.
Dieser Index untergräbt außerdem eine verbreitete Abkürzung in Kostendiskussionen. Von 58 vergleichbaren Einträgen mit gecachtem Input liegt der mediane Rabatt bei 90%. Von 44 Einträgen mit Batch-Preisen liegt der mediane Rabatt bei 50%. Jeder Workload-Vergleich, der Caching und Batch-Preise ignoriert, beschreibt eine Rechnung, die die meisten Kunden nie sehen, und der Index sagt das direkt. Auf Anbieterseite reichen die Mediane von Mistral AI mit $0.20 Input und $0.60 Output pro Million Token über 7 Einträge und DeepSeek mit $0.30 und $1.20 über 3 bis zu Anthropic mit $5 und $25 über 13 Einträge und OpenAI mit $2 und $11 über 18. Das sind Mediane öffentlicher Listenpreise, keine effektiven Preise nach Rabatten. Die Grundgesamtheiten unterscheiden sich in der Größe, es ist also kein Modellvergleich Gleicher gegen Gleicher.
Geschwindigkeit ist nur eine der Kosten
Außerhalb des Rechenzentrums hat Latenz messbare physische Kosten. MindOn stellte am 30. September sein physisches KI-Modell Mind-1 vor und sagt, es senke die Inferenzlatenz von Robotern von 82ms auf 32ms und bringe Manipulationsaufgaben auf Zykluszeiten menschlichen Niveaus. Die eigene Erklärung des Unternehmens, warum das zählt, ist der nützliche Teil: Bei einer Endeffektor-Geschwindigkeit von 3 Metern pro Sekunde entsprechen 10ms Latenz etwa 3cm Bewegung, genug, um präzises Greifen oder Einführen zu beeinflussen. MindOn zeigt auch auf ein Datenproblem und merkt an, dass viele Manipulationsdaten aus Teleoperation stammen, die langsamer ist als natürliche menschliche Bewegung. Modelle lernen so zusammen mit der Aufgabe ein langsameres Tempo.
Eine Kostenstory für Verbraucher gibt es im selben Zeitfenster. CleanTechnica berichtete am 29. September, dass eine Analyse von Transport & Environment die Betriebskosten von E-Autos in Europa auf weniger als die Hälfte von Diesel pro Kilometer setzt. Grundlage sind ein Durchschnittsverbrauch von 6,9 Litern pro 100km für Diesel und 20,2 kWh pro 100km für Batterie-Elektrische, bei Strom zu €0.343 pro kWh. T&Es Antony Froggatt sagte im Beitrag, Dieselfahrer zahlten €32 mehr pro Tank als zu Jahresbeginn, und warnte vor Versorgungsrisiken, falls die USA Diesel-Exporte blockieren. T&E merkt an, dass seine Ladeschätzung wahrscheinlich eine Obergrenze ist.
Und die Preisseite selbst kann Kosten verursachen. Ein am 30. September veröffentlichter Ich-Bericht von Gokhan Kogan über seine Zeit bei Pinecone berichtet, dass ein Nutzungsrechner auf der Preisseite Schätzungen lieferte, die nach einer einzigen fehlinterpretierten Eingabe um bis zu 1.000x zu hoch lagen. In einem A/B-Test, schreibt er, meldeten sich Besucher, die den Rechner nicht sahen, 16% häufiger an und kontaktierten das Unternehmen 90% häufiger, ohne Zunahme der Support-Tickets zu Preisen. Er merkt außerdem an, dass 7 von 10 intern befragten Mitarbeitern erwarteten, die Version mit Rechner würde besser abschneiden. Das ist die Erfahrung eines Unternehmens, kein allgemeines Gesetz, aber es erinnert daran, dass wahrgenommene und tatsächliche Kosten leicht auseinandergehen.
Auch auf der Netzwerkebene ändert sich die Kapazitätsökonomie. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur Fusionsgespräche führen, wo sie bereits 5G-Spektrum und Funkzugangsnetz über ein gemeinsam gehaltenes Unternehmen namens Antina teilen. Singtel hielt im Juni 43% des Mobilfunkmarkts, mit M1 bei 22%, StarHub bei 21% und Simba bei 14%, laut dem Bericht. In Neuseeland haben 2degrees und OneNZ vorgeschlagen, ihre Funknetze zusammenzulegen, eine Entscheidung der Commerce Commission wird im nächsten Jahr erwartet.
Der rote Faden ist nicht, dass Inferenz bald kostenlos wird. Er ist, dass die Optimierungen dieser Woche auf bestimmte Engpässe zielen: Decode-Geschwindigkeit von Agenten auf Verbraucherhardware, zeilenweise SQL-Aufrufe und Leerlaufleistung von GPUs. Jede bringt ihren eigenen Benchmark und ihren eigenen Anbieter mit. Der Preisindex legt nahe, dass sich die Listenpreise selbst kaum bewegt haben. Die Einsparungen werden auf der Ebene der Engines verkauft, und Käufer müssen sie an ihren eigenen Workloads testen.
Quellen
9- 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04AI API pricing index - September 2026EN
- 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 06The pricing calculator made people more confused about pricingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.