Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

GPU-Preise steigen, Cloud-Listenpreise sinken: Was Inferenz wirklich kostet

Der IPO-Prospekt von Anthropic, über den Reuters am 28. September berichtete, stellt 518 Milliarden Dollar künftiger Cloud- und Compute-Verpflichtungen einem Nettoverlust von 42 Milliarden Dollar für 2025 gegenüber. Die Preisdaten, die diese Woche eintreffen, legen nahe, dass Käufer die zweite Zahl genau lesen sollten.

KI & ModelleErklärtKatrin HoffmannVeröffentlicht: 29. September 20263 Min. LesezeitQuellen 7
GPU-Preise steigen, Cloud-Listenpreise sinken: Was Inferenz wirklich kostet

Die Listenpreise sind nicht der Ort, an dem das Geld verschwindet. Meetrix hat AWS und GCP verglichen, mit Preisen vom 28. September. Eine On-Demand-H100 kostet bei AWS 6,88 Dollar pro Stunde, bei GCP 10,98 Dollar. Diese 37 Prozent Unterschied sind real. Sie sind aber kleiner als die Schwankung, die entsteht, wenn dieselbe Karte nur zu einem Viertel ausgelastet läuft: 0,76 Dollar pro Million Tokens bei voller Auslastung der GPU, 3,06 Dollar bei 25 Prozent Auslastung. Meetrix rechnet dabei mit einem Platzhalter-Durchsatz von 2.500 Tokens pro Sekunde.

Das ist das ganze Argument in einem Satz. Untätige Siliziumfläche kostet mehr als jede Anbieterwahl.

GPUAdvisor verfolgt 14 Anbieter, die Daten stammen laut eigener Angabe vom 1. Oktober. Die spezialisierten Clouds unterbieten die Hyperscaler bei älteren Karten deutlich: eine A4000 für 0,15 Dollar pro GPU-Stunde bei Hyperstack, eine L40S für 0,38 Dollar bei Lium, eine RTX 4090 für 0,40 Dollar. Die Seite kennzeichnet diese Werte als nachverfolgte Näherungen und rät Käufern, die Preise auf der Anbieterseite zu prüfen. Das ist berechtigt, denn dieselbe Seite listet eine RTX 4090 bei RunPod für 0,74 Dollar. Zwei Preise, dasselbe Modell, fast das Doppelte.

Die Token-Rechnung ist wieder eine andere Zahl

Artificial Analysis veröffentlichte am 29. September seine Bewertung von Anthropics Claude Sonnet 5.5. Das Modell erreicht demnach auf dem Intelligence Index 56, zwei Punkte hinter Opus 5.5 bei maximalem Aufwand, verbraucht aber rund 193.000 Output-Tokens pro Aufgabe. Das sind etwa 60 Prozent mehr als bei Opus 5.5 und rund siebenmal so viel wie GPT-6 Astra bei maximalem Aufwand, so das Labor. Anthropic ließ die Preise bei 2 Dollar pro Million Input-Tokens und 10 Dollar pro Million Output unverändert. Die Kosten pro Aufgabe landen trotzdem bei 7,60 Dollar, rund 50 Prozent über Sonnet 5.

Gleiche Preisliste. Andere Rechnung. Die Tokens richten den Schaden an.

AI Pricing Guru aktualisiert die Preise täglich, zuletzt am 1. Oktober. Für allgemeine APIs gibt die Seite die nutzbare Spanne mit 0,50 bis 15 Dollar pro Million Output-Tokens an. Input ist typischerweise zwei- bis achtmal günstiger, zwischengespeicherter Input spart weitere 75 bis 90 Prozent, wo der Anbieter das unterstützt. Der Rechner erfasst 154 aktive Modelle bei mehr als 10 Anbietern.

Retrieval verändert die Rechnung, bevor die Generierung überhaupt beginnt. Die Kostenaufstellung von Spheron, veröffentlicht am 29. September, merkt an, dass ein Standard-RAG-Aufbau, der fünf Chunks von je 500 Tokens zieht, pro Anfrage 2.500 Tokens Kontext hinzufügt. Eine Frage, die als einfacher Chat 100 bis 200 Input-Tokens kosten würde, kann auf der Input-Seite also 15- bis 20-mal teurer werden.

Unblocked beschrieb am 29. September seine eigene Routing-Arbeit. Der GLM-5.2-Verkehr wurde zwischen Baseten, Fireworks und CoreWeave nach einem Score verschoben, der zu 70 Prozent auf Kosten und zu 30 Prozent auf Latenz gewichtet ist. Bei einer festen Reihenfolge, die Baseten bevorzugt, bediente dieser Anbieter in der ersten vollen Woche 98,5 Prozent der Aufgaben. Das Unternehmen gibt an, dass die Listenpreise von CoreWeave etwa 45 Prozent unter denen von Baseten lagen. Leistungsdaten, um CoreWeave einzuordnen, hatte es nicht. Das ist der Stand der Beschaffung: Die günstigste Option ist oft die, die niemand gemessen hat.

Kommentare 0

Quellen

7
  1. 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05AI Token Cost Calculator 2026: 154 Models by TierEN
  6. 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
  7. 07Routing LLM traffic across inference providers with TCP-style congestion controlEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.