Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

OpenAIs 500-Dollar-ChatGPT-Tarif kommt Tage nach dem Median-Schnappschuss von 1,32 Dollar pro Million Input-Token

OpenAI hat am Dienstag auf seinem DevDay ein ChatGPT-Abo für 500 Dollar im Monat vorgestellt. In derselben Woche setzte ein Monatsend-Schnappschuss den Median-Listenpreis für eine Million Input-Token auf 1,32 Dollar, erhoben über 81 öffentliche Datensätze.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 30. September 20265 Min. LesezeitQuellen 9
OpenAIs 500-Dollar-ChatGPT-Tarif kommt Tage nach dem Median-Schnappschuss von 1,32 Dollar pro Million Input-Token

OpenAI hat seinen DevDay am Dienstag genutzt, um einen neuen obersten Abo-Tarif anzukündigen: Pro 500 für 500 Dollar im Monat, wie Business Insider berichtet. Das sind 300 Dollar mehr als beim bisherigen Spitzentarif des Unternehmens. Aufs Jahr gerechnet sind es 6.000 Dollar für einen einzigen Arbeitsplatz.

Der Tarif bündelt den Zugang zu dem, was OpenAI "Ultrafast"-Rechenleistung für GPT-6 Astra in ChatGPT Work und Codex nennt. Laut Business Insider verspricht die Option eine 8-fache Geschwindigkeitssteigerung in Codex und bringt die höchste enthaltene Nutzung mit, die das Unternehmen anbietet. Derselbe Bericht besagt, OpenAI öffne seinen älteren Pro-Tarif für 200 Dollar im Monat wieder, den es am 10. September pausiert hatte. Dessen Rechenbudget wird jedoch halbiert: Der Umfang sinkt auf das 10-Fache des 20-Dollar-Plus-Tarifs, nach zuvor dem 20-Fachen. Die wöchentlichen Chat-Nachrichten in GPT-6 Pro fallen von 200 auf 100.

Thibault Sottiaux, der Entwicklungsleiter für Codex bei OpenAI, schrieb am Montag auf X, die Änderungen summierten sich auf den halben Dollar-Betrag an API-Ausgaben im Vergleich zum vorherigen Tarif. Business Insider zitiert ihn direkt. Keine andere Quelle in diesem Dossier bestätigt die Preisdetails, und OpenAI hat keine öffentliche Preisliste veröffentlicht, die dieser Text unabhängig prüfen könnte.

Der Zeitpunkt ist wichtig, weil ein September-Schnappschuss veröffentlichter API-Preise zeigt, dass der Listenpreis-Boden für die meisten Arbeitslasten weit von 500 Dollar im Monat entfernt liegt. Der AI API Pricing Index von AICostBudget, eingefroren mit Stichtag 2026-09-30 UTC, umfasst 81 öffentliche Preisangaben von 11 Anbietern. Über 69 Datensätze mit einem aktuellen Input-Token-Skalar reicht die beobachtete Spanne von 0,10 bis 30 Dollar pro Million Token. Über dieselben 69 Datensätze für Output-Token reicht die Spanne von 0,10 bis 180 Dollar pro Million.

Rabatte, Caching und der Listenpreis

Die Schlagzeilen-Mediane des Index liegen bei 1,32 Dollar pro Million Input-Token und 6 Dollar pro Million Output-Token. Daraus ergibt sich ein Median-Verhältnis von Output zu Input von 5,0x. Diese Zahlen sind Listenpreise, und der Index sagt ausdrücklich, dass Listenpreise nicht das sind, was die meisten Käufer zahlen. Über 58 vergleichbare Datensätze reicht der beobachtete Rabatt auf gecachten Input von 75% bis 98%, mit einem Median von 90%. Über 44 Batch-fähige Datensätze reicht der beobachtete Batch-Input-Rabatt von 20% bis 50%, mit einem Median von 50%.

Diese Lücke ist das ganze Argument für die Projekte zur Inferenz-Engine und Query-Optimierung, die in der vergangenen Woche auftauchten. Kann eine Arbeitslast ihre wiederkehrenden Präfixe in den Cache verschieben und ihre Massenaufträge in den Batch, fällt der effektive Preis pro Token weit unter den Median. Kann sie das nicht, ist der Listenpreis die Rechnung.

Zwei Projekte, veröffentlicht am 30. September, greifen das Problem von entgegengesetzten Enden des Stacks an. Auf der Datenbankseite optimiert die QUAIL-Arbeit des Full Stack Data Lab SQL-Query-Planung und LLM-Inferenz gemeinsam. Ihre Benchmark-Query BIO-4 läuft über mehr als 5.000 lange medizinische Berichte und 4.144 Reaktionsterme, wobei die Reaktionsliste zweimal über zwei Joins verwendet wird. Die Autoren argumentieren, dass es teuer ist, Millionen zusammengehöriger Modellaufrufe als einzelne Anfragen an eine Allzweck-Engine wie vLLM zu schicken. Jeder Prompt wird dabei als eigenständige Inferenzanfrage gerendert und bedient.

Modals Beschreibung desselben Systems, ebenfalls vom 30. September, liefert Zahlen dazu. Quail verarbeitet über eine Milliarde Token pro Minute pro H100-GPU bei einer Multi-Join-Query. Laut Modal ist das mehr als 10x schneller als die eigene vLLM-Basislinie auf identischer Hardware, und bei Modal kostet es unter 6 Cent pro Milliarde Token. Über den neu veröffentlichten AI-SQL-Benchmark meldet Modal Quail mit 1,84x schneller als vLLM, geometrisch gemittelt über die Aufgaben. Darunter sind zwei Queries, die die Autoren entwarfen, um zu zeigen, wo AI-SQL-Inferenz noch Arbeit braucht.

Der geometrische Mittelwert von 1,84x und die 10x bei der einzelnen Query stammen vom selben Team und sollten nicht als dieselbe Messung gelesen werden.

Lokale Kernel und Roboter-Latenz

Auf der Client-Seite startete Magnitude, ein Unternehmen aus dem Y-Combinator-Programm S25, am 30. September eine Open-Source-Inferenz-Engine. Sie kompiliert und optimiert ihre Kernel auf dem Gerät des Nutzers, bevor ein Modell läuft. Das README auf GitHub behauptet, offene Modelle liefen bis zu 2x schneller als mit llama.cpp, mit 92% schnellerem Decode auf Metal und 19% auf CUDA sowie 27% weniger Speicher pro Agent. Unterstützt werden Apple Silicon, NVIDIA, AMD oder nur CPU. Diese Zahlen stammen vom Projekt selbst und wurden in diesem Dossier nicht unabhängig nachvollzogen.

Die Roboter-Inferenz jagt dieselbe Uhr. MindOn stellte am 30. September Mind-1 vor und behauptet, die Inferenzlatenz von Robotern von 82ms auf 32ms zu senken. Das Unternehmen merkt an, dass bei einer Endeffektor-Geschwindigkeit von 3 m/s 10 ms Latenz etwa 3 cm Weg entsprechen. Das reicht, um präzises Greifen, Einführen oder kontaktintensive Manipulation zu beeinflussen. Die Geschwindigkeitsangaben decken Logistik und alltägliche menschliche Umgebungen ab und stammen aus MindOns eigenen Tests.

Akademische Arbeit zeigt auf einen Preis, den Auslastungsmetriken verbergen. Ein am 28. September auf dem SOSP '26 vorgestelltes Paper von Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma und Neeraja J. Yadwadkar beschreibt EnerTune. Das Serving-System modelliert die Leistungsaufnahme einzelner Modelle und die von mitplatzierten Modellen auf geteilten GPUs. Die Autoren berichten von Energieeinsparungen um den Faktor 1,4 bis 2,3 und einer Senkung der Leistungsaufnahme um den Faktor 1,3 bis 2,6 gegenüber dem Stand der Technik, während die Leistungs-SLOs eingehalten werden. Ihr Argument: Wer rein auf Auslastung optimiert, kann den Energieverbrauch erhöhen. Jede Konfiguration im großen Maßstab zu profilieren kostet zu viel Energie, um praktikabel zu sein.

Wo das Geld tatsächlich landet, ist weiter umstritten. Light Reading berichtete am 30. September, dass StarHub und M1 in Singapur Fusionsgespräche führen und dass 2degrees und OneNZ in Neuseeland vorgeschlagen haben, ihre Funknetze zusammenzulegen. StarHub warnt, die Verhandlungen liefen noch. Light Reading merkt an, dass ein zusammengelegtes StarHub und M1 ungefähr die Größe von Singtel hätte. Singtel hielt im Juni Berichten zufolge einen Mobilfunkanteil von 43%, M1 lag bei 22%, StarHub bei 21% und Simba bei 14%.

Eine Preis-Lektion aus derselben Woche hat nichts mit GPUs zu tun. Pinecone entfernte seinen Preisrechner, nachdem sich zeigte, dass eine einzige falsch interpretierte Eingabe eine Schätzung um bis zu 1.000x zu hoch ansetzen konnte. Das geht aus einem Ich-Bericht von Gkogan hervor, veröffentlicht am 30. September. Besucher, die den Rechner nicht sahen, meldeten sich 16% häufiger an und kontaktierten das Unternehmen 90% häufiger, ohne Anstieg bei Support-Tickets zum Preis. Sieben von zehn Mitarbeitern hatten erwartet, dass die Version mit Rechner gewinnt.

Kommentare 0

Quellen

9
  1. 01ChatGPT's new plan costs $500 a monthEN
  2. 02AI API Pricing Index - September 2026EN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
  7. 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  8. 08Singapore, New Zealand operators seek partnerships to cut costsEN
  9. 09The pricing calculator made people more confused about pricingEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.