GPU-Preise steigen, Cloud-Listenpreise sinken: Was Inferenz wirklich kostet
Der IPO-Prospekt von Anthropic, über den Reuters am 28. September berichtete, stellt 518 Milliarden Dollar künftiger Cloud- und Compute-Verpflichtungen einem Nettoverlust von 42 Milliarden Dollar für 2025 gegenüber. Die Preisdaten, die diese Woche eintreffen, legen nahe, dass Käufer die zweite Zahl genau lesen sollten.

Die Listenpreise sind nicht der Ort, an dem das Geld verschwindet. Meetrix hat AWS und GCP verglichen, mit Preisen vom 28. September. Eine On-Demand-H100 kostet bei AWS 6,88 Dollar pro Stunde, bei GCP 10,98 Dollar. Diese 37 Prozent Unterschied sind real. Sie sind aber kleiner als die Schwankung, die entsteht, wenn dieselbe Karte nur zu einem Viertel ausgelastet läuft: 0,76 Dollar pro Million Tokens bei voller Auslastung der GPU, 3,06 Dollar bei 25 Prozent Auslastung. Meetrix rechnet dabei mit einem Platzhalter-Durchsatz von 2.500 Tokens pro Sekunde.
Das ist das ganze Argument in einem Satz. Untätige Siliziumfläche kostet mehr als jede Anbieterwahl.
GPUAdvisor verfolgt 14 Anbieter, die Daten stammen laut eigener Angabe vom 1. Oktober. Die spezialisierten Clouds unterbieten die Hyperscaler bei älteren Karten deutlich: eine A4000 für 0,15 Dollar pro GPU-Stunde bei Hyperstack, eine L40S für 0,38 Dollar bei Lium, eine RTX 4090 für 0,40 Dollar. Die Seite kennzeichnet diese Werte als nachverfolgte Näherungen und rät Käufern, die Preise auf der Anbieterseite zu prüfen. Das ist berechtigt, denn dieselbe Seite listet eine RTX 4090 bei RunPod für 0,74 Dollar. Zwei Preise, dasselbe Modell, fast das Doppelte.
Die Token-Rechnung ist wieder eine andere Zahl
Artificial Analysis veröffentlichte am 29. September seine Bewertung von Anthropics Claude Sonnet 5.5. Das Modell erreicht demnach auf dem Intelligence Index 56, zwei Punkte hinter Opus 5.5 bei maximalem Aufwand, verbraucht aber rund 193.000 Output-Tokens pro Aufgabe. Das sind etwa 60 Prozent mehr als bei Opus 5.5 und rund siebenmal so viel wie GPT-6 Astra bei maximalem Aufwand, so das Labor. Anthropic ließ die Preise bei 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output unverändert. Die Kosten pro Aufgabe landen trotzdem bei 7,60 Dollar, rund 50 Prozent über Sonnet 5.
Gleiche Preisliste. Andere Rechnung. Die Tokens richten den Schaden an.
AI Pricing Guru aktualisiert die Preise täglich, zuletzt am 1. Oktober. Für allgemeine APIs gibt die Seite die nutzbare Spanne mit 0,50 bis 15 Dollar pro Million Output-Tokens an. Input ist typischerweise zwei- bis achtmal günstiger, zwischengespeicherter Input spart weitere 75 bis 90 Prozent, wo der Anbieter das unterstützt. Der Rechner erfasst 154 aktive Modelle bei mehr als 10 Anbietern.
Retrieval verändert die Rechnung, bevor die Generierung überhaupt beginnt. Die Kostenaufstellung von Spheron, veröffentlicht am 29. September, merkt an, dass ein Standard-RAG-Aufbau, der fünf Chunks von je 500 Tokens zieht, pro Anfrage 2.500 Tokens Kontext hinzufügt. Eine Frage, die als einfacher Chat 100 bis 200 Input-Tokens kosten würde, kann auf der Input-Seite also 15- bis 20-mal teurer werden.
Unblocked beschrieb am 29. September seine eigene Routing-Arbeit. Der GLM-5.2-Verkehr wurde zwischen Baseten, Fireworks und CoreWeave nach einem Score verschoben, der zu 70 Prozent auf Kosten und zu 30 Prozent auf Latenz gewichtet ist. Bei einer festen Reihenfolge, die Baseten bevorzugt, bediente dieser Anbieter in der ersten vollen Woche 98,5 Prozent der Aufgaben. Das Unternehmen gibt an, dass die Listenpreise von CoreWeave etwa 45 Prozent unter denen von Baseten lagen. Leistungsdaten, um CoreWeave einzuordnen, hatte es nicht. Das ist der Stand der Beschaffung: Die günstigste Option ist oft die, die niemand gemessen hat.
Quellen
7- 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05AI Token Cost Calculator 2026: 154 Models by TierEN
- 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
- 07Routing LLM traffic across inference providers with TCP-style congestion controlEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.