Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenzkosten teilen sich auf: günstiger pro Token, teurer pro GPU

Magnitude, ein Startup aus dem Y-Combinator-Batch S25, hat am 30. September eine Open-Source-Inferenz-Engine veröffentlicht. Offene Modelle laufen damit nach Angaben des Unternehmens auf Apple Silicon, NVIDIA, AMD oder einer gewöhnlichen CPU bis zu zweimal schneller als mit llama.cpp, ohne Token-Kosten. Am selben Tag lag der Median des gelisteten Output-Preises in einem Preisindex über 81 öffentliche Datensätze bei 6 US-Dollar pro Million Token, gegenüber 1,32 US-Dollar für Input.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 30. September 20266 Min. LesezeitQuellen 10
Inferenzkosten teilen sich auf: günstiger pro Token, teurer pro GPU

Das Repository von Magnitude ging am 30. September online. Der Ansatz ist geradlinig: Die Engine kompiliert und optimiert ihre Kernel auf dem jeweiligen Gerät, bevor ein Modell läuft. Sie liefert also keine vorkompilierten Binärdateien für breite Hardwareklassen aus. Das Unternehmen meldet 92 % schnelleres Decoding auf Metal und 19 % auf CUDA gegenüber llama.cpp, dazu 27 % weniger Speicher pro Agent. Dieser Speicher wird freigegeben, sobald Agenten stoppen. Die Lizenz ist Apache 2.0.

Das ist eine Antwort auf das Kostenproblem: aufhören, pro Token zu zahlen.

Es ist nicht die einzige, und es ist nicht die, auf die der Rest des Materials dieser Woche zeigt. Quail, eine Inferenz-Engine des Full Stack Data Lab, des Teams hinter DocETL, zielt auf die andere Hälfte der Rechnung. Ihre Autoren argumentieren, dass AI-SQL-Abfragen von Allzweck-Engines schlecht bedient werden. Bei ihnen läuft ein LLM-Aufruf pro Zeile oder pro Zeilenpaar. Millionen zusammenhängender Modellaufrufe als einzelne Anfragen an vLLM zu schicken, verursacht hohe Kosten, schreiben sie. Quail plant stattdessen die Abfrage und die Inferenz gemeinsam.

Die Zahlen sind konkret. Bei einer Multi-Join-Abfrage, bei der die Planung am meisten zählt, erreicht Quail über eine Milliarde verarbeitete Token pro Minute auf einer einzigen H100-GPU. Laut Team ist das mehr als das Zehnfache seiner vLLM-Basis auf derselben Hardware. Auf Modal ergibt das weniger als 6 Cent pro Milliarde Token. Im eigenen AI-SQL-Benchmark des Teams fällt der Gewinn kleiner aus: 1,84-mal schneller als vLLM, geometrisch gemittelt. Darin enthalten sind zwei Abfragen, die sie entworfen haben, um zu zeigen, wo AI-SQL-Inferenz noch zurückbleibt.

Token-Preise sind nicht die ganze Rechnung

Der September-Index von AICostBudget, eingefroren zum UTC-Stichtag am 30. September, umfasst 81 öffentliche Preisangaben von 11 Anbietern. Über 69 Datensätze mit einem aktuellen Input-Token-Skalar reicht die Spanne von 0,10 bis 30 US-Dollar pro Million Token. Beim Output reicht sie von 0,10 bis 180 US-Dollar. Der Median des Input-Preises liegt bei 1,32 US-Dollar, der Median des Output-Preises bei 6 US-Dollar. Das ist ein Verhältnis von 5,0x über die 69 Datensätze, die beide Angaben tragen.

Die Mediane der Anbieter gehen deutlich auseinander. OpenAIs 18 Input-Datensätze und 18 Output-Datensätze liegen im Median bei 2 und 11 US-Dollar. Google Gemini liegt bei je 14 Datensätzen im Median bei 0,75 und 4,125 US-Dollar. Die 13 Datensätze von Anthropic liegen im Median bei 5 und 25 US-Dollar. Die neun von xAI liegen bei 1,25 und 2,50 US-Dollar, die sieben von Mistral bei 0,20 und 0,60 US-Dollar, die drei von DeepSeek bei 0,30 und 1,20 US-Dollar.

Der Index markiert außerdem, was ein naiver Vergleich übersieht. Über 58 vergleichbare Datensätze beträgt der mediane Rabatt auf gecachten Input 90 %, und über 44 Batch-fähige Datensätze beträgt der mediane Batch-Input-Rabatt 50 %. Die eigene Einordnung des Berichts ist deutlich: Ein Workload-Vergleich, der Cache- und Batch-Preise ignoriert, lässt veröffentlichte Sparmodi für einen großen Teil der erfassten Datensätze weg. Er ergänzt, dass Dokumentseiten, Speicher, Sitzungsdauer und andere zeitbasierte Einheiten nicht sicher in eine reine Token-Tabelle gepresst werden können. Das ist eine berechtigte Warnung für jeden, der eine einzige Kostentabelle pro Token baut.

Die Preisdaten sind eine Momentaufnahme, kein Markträumungspreis. Die GPU-Kapazität bewegt sich getrennt davon.

Wohin das GPU-Geld fließt

Business Insider berichtete am 30. September, dass OpenAI auf seinem Dienstag-DevDay eine ChatGPT-Stufe für 500 US-Dollar im Monat angekündigt hat. Das sind 300 US-Dollar mehr als beim bisher teuersten Tarif des Unternehmens. Die Stufe enthält "Ultrafast"-Rechnen für GPT-6 Astra in ChatGPT Work und Codex, laut OpenAI eine achtfache Geschwindigkeitssteigerung in Codex, dazu die höchste inkludierte Nutzung des Unternehmens. Business Insider berichtete außerdem, dass OpenAI seinen 200-Dollar-Pro-Tarif wieder öffnet und dabei das Compute-Kontingent halbiert, von 20x des 20-Dollar-Plus-Tarifs auf 10x. Die GPT-6-Pro-Chat-Nachrichten sinken von 200 auf 100 pro Woche. Thibault Sottiaux, der Engineering-Lead für Codex, sagte in einem X-Post vom Montag, die Änderungen summierten sich auf die Hälfte der API-Ausgaben in Dollar im Vergleich zum vorherigen Tarif.

Auf der Hardwareseite argumentiert das SOSP-'26-Paper von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar, veröffentlicht am 28. September, gegen die übliche Auslastungskennzahl. GPUs sind teuer, doch Inferenz-Cluster bleiben stark unterausgelastet, weshalb Systeme auf Multiplexing setzen. Die Autoren schreiben jedoch, dass eine Optimierung allein auf Auslastung den Energieverbrauch kontraintuitiv erhöhen kann. Ihr System EnerTune nutzt analytische Modelle der Leistung und des Verbrauchs je Modell, einschließlich der Aufnahme kolokierter Modelle auf geteilten GPUs, innerhalb eines energiebewussten Bin-Packing-Algorithmus. Es meldet 1,4-mal bis 2,3-mal niedrigeren Energieverbrauch und 1,3-mal bis 2,6-mal niedrigere Leistungsaufnahme als moderne Baselines, während die Performance-SLOs eingehalten werden.

Das ist eine Kostenaussage über eine Rechnung, die die meisten Token-Preistabellen nicht zeigen.

Die Robotik spielt dasselbe Spiel in einem anderen Umfeld. MindOns Mind-1, angekündigt am 30. September, senkt die Inferenzlatenz von 82 ms auf 32 ms, laut der eigenen Darstellung des Unternehmens. Der Beitrag erklärt, warum das zählt: Bei einer Endeffektor-Geschwindigkeit von 3 m/s entsprechen 10 ms Latenz ungefähr 3 cm Bewegung. Das reicht, um präzises Greifen, Einführen oder kontaktintensive Manipulation zu beeinflussen. MindOn verweist außerdem auf das Tempo der Trainingsdaten und argumentiert, dass teleoperierte Demonstrationen langsamer sind als natürliche menschliche Bewegung und dass Modelle das Tempo ebenso lernen wie die Aufgabe.

Zwei Rechnungen, zwei Strategien

Pinecones Erfahrung mit einem Preisrechner, erzählt von Gabriel Kogan am 30. September, erinnert daran, dass die Kostenzahl, die Kunden sehen, selbst eine Produktentscheidung ist. Der Rechner erzeugte Schätzungen, die nach einer Fehlinterpretation um bis zu 1.000x zu hoch lagen, und gab Nutzern ein falsches Vertrauen, das sie davon abhielt, die Doku zu prüfen. Als das Unternehmen im A/B-Test das Entfernen testete, waren Besucher, die den Rechner nicht sahen, 16 % wahrscheinlicher bereit, sich anzumelden, und 90 % wahrscheinlicher, das Unternehmen zu kontaktieren. Die Support-Tickets zum Thema Preise stiegen nicht. In einer internen Umfrage erwarteten 7 von 10 Mitarbeitern, dass die Version mit dem Rechner besser abschneidet.

Zwei weitere Datenpunkte liegen außerhalb des AI-Stacks, rahmen aber dasselbe Argument über das Ersetzen von Treibstoff durch Kapital. Transport & Environment, analysiert von CleanTechnica am 29. September, erklärt, dass EV-Fahrer weniger als die Hälfte dessen zahlen, was Diesel-Fahrer pro Kilometer zahlen. Grundlage sind 6,9 L/100 km für Diesel, 20,2 kWh/100 km für Batterie-Elektrische und ein Strompreis von 0,343 Euro/kWh. Antony Froggatt von der Gruppe sagte, Diesel-Fahrer zahlten 32 Euro mehr pro Tankfüllung als zu Jahresbeginn, wovon rund 16 Euro auf die zusätzliche Raffineriemarge entfielen.

Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur Fusionsgespräche führen, wobei das kombinierte Unternehmen ungefähr die Größe von Singtel erreicht. Außerdem haben 2degrees und OneNZ in Neuseeland vorgeschlagen, ihre Funknetze zu bündeln. Die 5G-Vereinbarung von China Telecom und China Unicom, der größte derartige Sharing-Deal, umfasst 1,5 Millionen Basisstationen und beanspruchte 56 Milliarden US-Dollar an Capex-Einsparungen. Nichts davon ist KI-Inferenz. Alles davon ist derselbe Handel: das feste Asset teilen, die Grenzkosten senken.

Für Käufer ist die praktische Aufteilung inzwischen klar. Die Token-Preise fallen in den veröffentlichten Tabellen, und Caching- und Batch-Modi senken sie weiter. Kosten pro GPU-Stunde sind ein anderer Markt, und die Forschung dieser Woche legt nahe, dass davon noch viel verschwendet wird. Weder Magnitudes lokale Kernel noch Quails Abfrageplaner beheben das. Sie verschieben nur, wo der Zähler steht.

Kommentare 0

Quellen

10
  1. 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  4. 04AI API pricing index - September 2026EN
  5. 05ChatGPT's new plan costs $500 a monthEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  10. 10Singapore, New Zealand operators seek partnerships to cut costsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.