Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Inferenzkosten teilen sich: 500-Dollar-ChatGPT-Tarif, doppelt so schnelle offene Engines, 6 Cent pro Milliarde Tokens

OpenAI hat am 29. September einen ChatGPT-Pro-Tarif für 500 Dollar im Monat geöffnet, den bislang teuersten Plan und einen Sprung von 300 Dollar gegenüber dem bisherigen Spitzentarif, wie Business Insider berichtet. Zugleich unterbieten günstigere offene Inferenz-Stacks das Angebot.

KI & ModelleNachrichtLena BrandtVeröffentlicht: 30. September 20265 Min. LesezeitQuellen 9
Inferenzkosten teilen sich: 500-Dollar-ChatGPT-Tarif, doppelt so schnelle offene Engines, 6 Cent pro Milliarde Tokens

Der neue Plan, vorgestellt am Dienstag auf dem DevDay des Unternehmens, bündelt den Zugang zu "Ultrafast"-Rechenleistung für GPT-6 Astra in ChatGPT Work und Codex. Business Insider berichtet, für diesen Modus werde eine 8-fache Geschwindigkeitssteigerung in Codex versprochen. Derselbe Bericht besagt, OpenAI öffne seinen 200-Dollar-Pro-Tarif wieder, den es am 10. September ausgesetzt hatte. Das Rechenkontingent sinkt aber auf das 10-Fache des 20-Dollar-Plus-Tarifs statt auf das 20-Fache, und die GPT-6-Pro-Chatnachrichten fallen von 200 auf 100 pro Woche.

Thibault Sottiaux, der für Codex verantwortliche Engineering-Leiter, schrieb am Montag in einem Beitrag auf X, die Änderungen ergäben unterm Strich die Hälfte der API-Ausgaben in Dollar im Vergleich zum vorherigen Plan, so Business Insider.

"Ich wollte diese Änderung unbedingt vorab mitteilen, damit ihr sie alle versteht, bevor wir euch mit guten Nachrichten überschütten", schrieb er.

Das ist die Spitze des Marktes. Der Boden bewegt sich schneller.

Offene Engines und selbst abstimmende Kernel

Am 30. September veröffentlichte das von YC unterstützte Unternehmen Magnitude eine Open-Source-Inferenz-Engine. Sie kompiliert und stimmt Kernel auf der Hardware des Nutzers ab, bevor ein Modell läuft, und soll offene Modelle bis zu 2x schneller ausführen als llama.cpp. Das GitHub-README nennt 92% schnelleres Decoding auf Apples Metal-Backend und 19% auf CUDA, dazu 27% weniger Speicher pro Agent und gemeinsame Prefix-Caches für gleichzeitige Sitzungen.

Sie erscheint als Desktop-App unter Apache 2.0, unterstützt Apple Silicon, NVIDIA, AMD oder reine CPU-Ausführung und verbindet sich mit Pi, OpenCode, Hermes, Codex und anderen Agenten. Zwei Stunden zuvor veröffentlichten Modal und das Full Stack Data Lab eine gemeinsame SQL-plus-Inferenz-Engine namens Quail. Modals Bericht zufolge verarbeitet Quail bei einer Multi-Join-Abfrage auf einer einzigen H100-GPU über eine Milliarde Tokens pro Minute, mehr als das 10-Fache seiner vLLM-Basislinie auf derselben Hardware, bei unter 6 Cent pro Milliarde Tokens auf Modal. Über den neuen AI-SQL-Benchmark des Teams liegt das geometrische Mittel des Speedups gegenüber vLLM bei 1.84x. Der Beitrag nennt zwei Abfragen, die zeigen sollen, wo der Ansatz noch zurückbleibt.

Die Autoren sagen ausdrücklich, generische Engines hätten für diese Arbeitslast die falsche Form. Im Beitrag des Full Stack Data Lab schreiben Shreya Shankar, Charles Frye, Fergus Finn, Arnav Dhariya, Joseph Barrow und Meryem Arik, Millionen zusammenhängender Modellaufrufe als einzelne Anfragen an eine Engine wie vLLM zu schicken, verursache hohe Kosten. Ihre Beispielabfrage, BIO-4 im QUAIL-B-Benchmark, filtert 5.000 lange medizinische Berichte gegen 4.144 Reaktionsbegriffe, die zweimal verwendet werden. Eine naive Ausführung macht aus einer SQL-Anweisung damit eine sehr große Zahl von Modellaufrufen.

Der Preisboden ist veröffentlicht, und er ist nicht flach

Der Preisindex von AICostBudget für September, eingefroren mit Stichtag 2026-09-30 UTC, umfasst 81 öffentliche Einträge von 11 Anbietern. Er setzt den mittleren Eingabepreis auf 1,32 Dollar pro Million Tokens und den mittleren Ausgabepreis auf 6 Dollar. Über die 69 Einträge mit beiden Zahlen kostet die Ausgabe im Median das 5,0-Fache der Eingabe. Die beobachteten Spannen reichen von 0,10 bis 30 Dollar pro Million Eingabe-Tokens und von 0,10 bis 180 Dollar pro Million Ausgabe-Tokens.

Derselbe Datensatz liefert Medianwerte je Anbieter: OpenAI bei 2 Dollar Eingabe und 11 Dollar Ausgabe über 18 Einträge, Google Gemini bei 0,75 und 4,125 über 14, Anthropic bei 5 und 25 über 13, xAI bei 1,25 und 2,5 über neun, Mistral AI bei 0,20 und 0,60 über sieben, DeepSeek bei 0,30 und 1,2 über drei und Moonshot AI bei 0,95 und 4 über drei. Über 58 vergleichbare Einträge mit gecachtem Input liegt der mittlere Rabatt bei 90%, über 44 Einträge mit Batch-Preisen liegt der mittlere Batch-Rabatt bei 50%. Wer einen dieser Modi ignoriert, vergleicht Listenpreise, nicht Rechnungen.

Bei der Hardware wird die Debatte schwerer zu entscheiden. EnerTune, ein Paper von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar auf der SOSP '26 am 28. September, argumentiert, dass das alleinige Multiplexen von GPUs zur Steigerung der Auslastung den Energieverbrauch erhöhen kann. Die Autoren berichten, ihr energiebewusstes Bin-Packing-System erfülle Leistungs-SLOs und senke zugleich den Energieverbrauch um das 1,4- bis 2,3-Fache und die Leistungsaufnahme um das 1,3- bis 2,6-Fache gegenüber dem Stand der Technik.

Nicht jede Kostennachricht dieser Woche dreht sich um Rechenzentren. Am 29. September ausgewertete Daten von Transport & Environment setzen die Betriebskosten von Elektroautos auf weniger als die Hälfte der Dieselkosten pro Kilometer. Grundlage sind 6,9 Liter pro 100 km für Diesel und 20,2 kWh pro 100 km für Batterieelektrische bei einem Strompreis von EUR 0,343 pro kWh. Diesel-Fahrer zahlen laut ECB-Schätzungen, die CleanTechnica zitiert, 32 EUR mehr pro 50-Liter-Tank als zu Jahresbeginn, davon etwa 16 EUR zusätzliche Raffineriemarge.

Zwei Lehren der Woche liegen ganz außerhalb der KI. Pinecone entfernte den Preisrechner von seiner Preisseite, nachdem ein A/B-Test ergab, dass Besucher, die ihn nicht sahen, sich 16% häufiger anmeldeten und 90% häufiger das Unternehmen kontaktierten, ohne dass die Support-Tickets zum Preis stiegen, so Gründer Greg Kogan. Und in der Telekommunikation berichtete Light Reading am 30. September, dass Singapurs StarHub und M1 Fusionsgespräche führen, während Neuseelands 2degrees und OneNZ vorgeschlagen haben, ihre Funkzugangsnetze zusammenzulegen.

Der rote Faden: Wenn eine Arbeitseinheit billig genug wird, hören Käufer auf, den Rechner zu lesen, und beginnen, die Rechnung zu messen.

Kommentare 0

Quellen

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05AI API pricing index - September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08The pricing calculator made people more confused about pricingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.