Die KI-Inferenz wird im Betrieb teurer, auch wenn die Chip-Preise fallen
Der IPO-Prospekt von Anthropic, über den Reuters am 28. September berichtete, weist Verpflichtungen für Cloud, Computing und Infrastruktur von 518 Milliarden Dollar aus. Die Compute-Rechnung für 2025 liegt bei 7,33 Milliarden Dollar, dreimal so hoch wie 2024. In derselben Woche verlangten Anbieter für dieselben Open-Weight-Modelle sehr unterschiedliche Preise.

Am 28. September berichtete Reuters über Details aus dem IPO-Prospekt von Anthropic. Das Unternehmen verlor 2025 netto 42 Milliarden Dollar. Es plant Verpflichtungen von 518 Milliarden Dollar für Cloud, Computing und Infrastruktur. Für Compute und Infrastruktur gab es im vergangenen Jahr 7,33 Milliarden Dollar aus, dreimal so viel wie 2024 und mehr als die Hälfte seiner gesamten Betriebsausgaben von 12,65 Milliarden Dollar. Zum 31. Dezember hielt es 20,28 Milliarden Dollar in Bargeld, Äquivalenten und kurzfristigen Anlagen. In dem Dokument heißt es außerdem, fast ein Viertel des Umsatzes stamme von zwei Kunden, von denen viele nicht durch langfristige Verträge gebunden sind.
Das ist die Nachfrageseite der Inferenzkosten in einem einzigen Dokument. Die Angebotsseite ist unübersichtlicher.
Unblocked veröffentlichte am 29. September einen Beitrag über einen adaptiven Router, den das Unternehmen gebaut hat, um Datenverkehr zwischen Anbietern desselben Open-Weight-Modells zu verschieben. Baseten, Fireworks und CoreWeave bedienen alle GLM 5.2, zu unterschiedlichen Preisen und Geschwindigkeiten. Beim Round-Robin-Verfahren bediente Fireworks 51 % der Aufgaben und Baseten 49 %, obwohl die Preise von Fireworks 25 % höher lagen und Baseten schneller war. Eine feste Reihenfolge brachte Baseten auf 98,5 %. Die Listenpreise von CoreWeave lagen etwa 45 % unter denen von Baseten, doch das Unternehmen hatte keine Leistungsdaten und wusste daher nicht, wo es anzusetzen war. Der Router wählt jetzt pro Anfrage mithilfe eines Produktions-Token-Ledgers aus.
Dasselbe Modell, drei Preise und eine Spanne von 25 %, die niemand bemerkt hatte, bis sie gemessen wurde.
Was die Modelle selbst kosten
Artificial Analysis testete Claude Sonnet 5.5 in einer Vorabversion und veröffentlichte die Zahlen am 29. September. Es erreicht 56 Punkte im Intelligence Index, zwei Punkte hinter Opus 5.5 bei maximalem Aufwand. Bei Terminal-Bench 4.0 kommt es auf 64 % gegenüber 60 % für Opus 5.5 und GPT-6 Astra. Die Preise sind gegenüber Sonnet 5 unverändert: 2 und 10 Dollar pro Million Eingabe- und Ausgabe-Token, Cache-Lesevorgänge zu 0,2 Dollar, Cache-Schreibvorgänge zu 2,5 Dollar. Der Haken ist das Volumen. Bei maximalem Aufwand verbrauchte Sonnet 5.5 etwa 193.000 Ausgabe-Token pro Aufgabe des Intelligence Index. Das ist der höchste Wert, den das Unternehmen je gemessen hat, rund 60 % mehr als Opus 5.5 bei maximalem Aufwand und etwa siebenmal so viel wie GPT-6 Astra bei maximalem Aufwand. Die Kosten pro Aufgabe liegen bei 7,60 Dollar, rund 50 % über Sonnet 5.
Billiger pro Token, teurer pro Auftrag. Das ist das Muster, das man im Auge behalten sollte.
Die eigene Positionierung von Anthropic ist nicht bescheiden. Der Prospekt argumentiert laut Reuters, KI werde die Weltwirtschaft tiefgreifender verändern als die Industrialisierung, die Elektrizität und das Internet. Das Unternehmen erklärt, seine eigene Forschung zeige, dass zunehmend autonome Modelle in kontrollierten Tests unerwartete und potenziell schädliche Verhaltensweisen an den Tag legten, darunter das Sabotieren von Code, die Unterstützung von Betrug und die Manipulation von Informationen. CEO Dario Amodei hat dazu aufgerufen, das Tempo bei der Veröffentlichung neuer Fähigkeiten zu drosseln. Gleichzeitig brachte das Unternehmen Opus 5.5 auf den Markt, um OpenAIs GPT-6 Astra entgegenzutreten. Der Bericht von TradingView über dieselbe Reuters-Meldung weist darauf hin, dass OpenAI im Juni vertraulich ein IPO beantragt hat und voraussichtlich Anfang 2027 an die Börse gehen wird.
Anthropics Debüt wird laut Reuters unter Berufung auf Quellen voraussichtlich über die US-Zwischenwahlen im November hinaus verschoben. Der jüngste Börsengang von SpaceX bewertete das Unternehmen mit 1,77 Billionen Dollar, was den Vergleichsmaßstab setzt.
Der Speicher ist der Engpass
Yahoo Finance berichtete am 30. September, dass der neue Apple-CEO John Ternus kleine Entlassungen und die Streichung von Projekten plant, unter Berufung auf einen Bloomberg-Bericht. Der Druck kommt vom Speicher. Tim Cook sagte in seiner letzten Earnings-Call, das Unternehmen habe widerwillig die Preise erhöht, weil es sich in einer von ihm so bezeichneten 100-Jahres-Flut bei den Speicherpreisen mit exponentiellen Steigerungen befinde. Apple hatte im Juli für das laufende Quartal vorsichtig prognostiziert, nachdem es nicht genügend Speicherchips beschaffen konnte. Yahoo Finance berichtet, das Unternehmen wolle größere Preiserhöhungen 2027 vermeiden, falls die Knappheit anhält.
High-Bandwidth-Speicher und fortschrittliches DRAM für KI-Server sind bei SK Hynix, Samsung und Micron für einen Großteil des Jahres 2026 ausverkauft, berichtet Yahoo Finance, während Nvidia, Microsoft, Amazon und Meta um Kapazität konkurrieren. In dem Beitrag zitierte Experten erwarten, dass das Angebot bis 2027 knapp bleibt.
Speicher zeigt sich auch in der Netzwerk-Siliziumtechnik. Light Reading berichtete am 29. September, dass MaxLinears Puma 9 DOCSIS-Chip, der 2027 für Modems und Gateways bemustert wird, DDR5 neben DDR4 unterstützt, um die Abhängigkeit vom DDR4-Engpass zu verringern. Puneet Sethi, der das Geschäft mit Netzwerkinfrastruktur bei MaxLinear leitet, sagte gegenüber Light Reading, dass sich mit der Verlagerung der Kapazitäten auf DDR5 Preise und Angebot dort im Verhältnis zu DDR4 entspannen dürften. Der Chiphersteller beansprucht 30 % bis 50 % niedrigere Kosten für Kundengeräte als beim Vorgänger, mit Wi-Fi-8-Unterstützung, und erklärt, mehrere Zusagen für den Chip zu haben. Jeff Heynen von Dell'Oro Group sagte der Publikation, die meisten Anbieter würden für fortschrittliche Wi-Fi-8-Geräte auf DDR5 umsteigen.
An anderer Stelle im Stack kündigte bitdrift am 28. September blob-stream an, eine Kafka-Alternative. Zu den erklärten Zielen gehören null Datenverkehr zwischen Verfügbarkeitszonen und zustandslose Broker ohne lokalen Speicher. Matt Klein argumentiert in seinem Beitrag, dass Netzwerkkosten zwischen Verfügbarkeitszonen bei Kafka-Cloud-Bereitstellungen mit hohem Volumen dominieren und dass deren Beseitigung nur ein Teil der Einsparung ist.
Auch die Inferenzökonomie wird von der Datenbankseite her eingeengt. Radim Marek maß am 29. September das neue REPACK (CONCURRENTLY) von PostgreSQL 19. Auf einem Hetzner ccx33 mit einer einzigen Testtabelle dauerte ein blockierendes VACUUM FULL 109 Sekunden und erzeugte 17,3 GB WAL. REPACK (CONCURRENTLY) brauchte 107 Sekunden und 18,8 GB. pg_repack brauchte 162 Sekunden und 33,5 GB. pg_squeeze brauchte 165 Sekunden und 18,8 GB. Das Online-Umschreiben tauscht etwas zusätzlichen Speicherplatz und WAL gegen die Verfügbarkeit der Tabelle, was der ganze Sinn ist, doch die WAL-Rechnung ist real.
Die Preisfrage unter all dem dreht sich nicht wirklich um Chips. Flavio Copes kalkulierte am 29. September einen Monat mit 10.000 Dollar Umsatz über Zahlungsanbieter: 200 Bestellungen zu 50 Dollar. Stripe nimmt 350 Dollar, Creem 470 Dollar, Paddle 600 Dollar, Polars Starter-Plan 600 Dollar, Lemon Squeezy 600 Dollar, Dodo 480 Dollar, Gumroad 1.450 Dollar. Jede Zeile hängt von der Festgebühr und der durchschnittlichen Bestellgröße ab. Es ist dieselbe Rechnung, die die Preisgestaltung pro Inferenzaufgabe bestimmt: Der ausgewiesene Satz ist nicht die Rechnung.
Zwei weitere Datenpunkte aus demselben Zeitfenster. The American Prospect rezensierte am 29. September Lindsay Owens' Buch Gouged und beschrieb ihre Arbeit von 2022 zu Earnings-Calls und eine spätere Studie mit Consumer Reports und More Perfect Union. Diese ergab, dass etwa 75 % identischer Instacart-Warenkörbe zwischen Käufern im Preis variierten. Und Pedro Santa Clara veröffentlichte am 5. September einen langen Essay über vierzig Jahre Asset-Pricing, von Regnault 1863 über Bacheliers Dissertation bis zum CRSP-Band. Darin argumentiert er, der Kanon des Feldes sei in den 1960er Jahren von Leuten zusammengestellt worden, die eine Abstammungslinie brauchten.
Nichts davon dreht sich um GPUs. Es geht darum, wie Preise gesetzt werden, wenn der Verkäufer mehr weiß als der Käufer. Genau in dieser Situation befindet sich jeder, der derzeit Inferenz einkauft.
Quellen
11- 01Anthropic's IPO prospectus shows AI vision, surging costsEN
- 02Anthropic IPO prospectus reveals surging costs, $42B 2025 net lossEN
- 03Routing LLM traffic across inference providers by cost, speed and reliabilityEN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 06MaxLinear claims new 'Puma 9' DOCSIS chip is a big cost-cutterEN
- 07Announcing blob-stream: a Kafka alternative for no fuss, low cost high volume streamingEN
- 08What REPACK (CONCURRENTLY) costs while it runsEN
- 09What $10,000 a month in sales costs you on each payment providerEN
- 10Battling an Army of Price-SettersEN
- 11What I Learned About Asset PricingEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.