Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Die Rechnung hinter den Inferenzkosten: Was GPU-Stundenpreise verschweigen

Der Tracker von GPUAdvisor, aktualisiert am 1. Oktober, umfasst inzwischen 14 Cloud-Anbieter, die H100-, H200-, A100- und B200-Kapazität verkaufen. Die Spanne zwischen dem billigsten und dem teuersten Angebot für denselben Chip ist so groß, dass der Stundenpreis in der Überschrift kaum etwas aussagt.

KI & ModelleErklärtLena BrandtVeröffentlicht: 29. September 20265 Min. LesezeitQuellen 6
Die Rechnung hinter den Inferenzkosten: Was GPU-Stundenpreise verschweigen

Die Vergleichsseiten haben sich schneller vermehrt als die Rabatte. Am 1. Oktober teilte GPUAdvisor mit, sein Preistracker für Cloud-GPUs decke 14 Anbieter und jeden wichtigen Beschleuniger ab. Über der Tabelle steht eine Warnung: Die Preise sind Näherungswerte, schwanken je nach Region und Verfügbarkeit und geben Schätzungen von September 2026 wieder. Das ist der Stand des Marktes. Der Listenpreis ist ein Ausgangspunkt, keine Rechnung.

Meetrix veröffentlichte am 29. September einen eigenen Vergleich. Geprüft wurden die Preise am 28. September für On-Demand-Instanzen in US East und us-central1. Das Ergebnis ist eindeutig: AWS ist laut Liste billiger bei einer H100 oder A100, GCP ist etwas billiger, wenn eine einzelne L4 reicht. Eine H100 kostet bei AWS 6,88 Dollar pro Stunde, bei GCP 10,98 Dollar.

Die Auslastung schlägt die Wahl der Cloud

Derselbe Text untergräbt dann seine eigene Schlagzeile. Meetrix rechnete mit einem angenommenen Durchsatz von 2.500 Ausgabe-Tokens pro Sekunde. Ergebnis: Die Kosten pro Million Tokens steigen bei der AWS-H100 von 0,76 auf 3,06 Dollar, wenn die Auslastung von 100% auf 25% fällt. Bei der GCP-H100 reicht dieselbe Spanne von 1,22 bis 4,88 Dollar. Der Artikel sagt ausdrücklich, dass die Durchsatzzahl eine Annahme ist und keine Messung, und dass die Verhältnisse zwischen den Zeilen nicht von ihr abhängen.

Eine Ersparnis von 37% durch den Wechsel der Cloud ist also willkommen. Sie ist kleiner als die Strafe für einen müßigen Nachmittag. Meetrix nennt noch ein Datenproblem: Die GPU-Preisseite von Google rendert ihre Tabelle clientseitig, sodass der Autor sie nicht programmatisch auslesen konnte. Drei Tracker waren sich bei 87,83 Dollar für die a3-highgpu-8g einig, ein vierter nannte 88,49 Dollar. Diese Abweichung sollte man benennen statt sie zu mitteln.

Auf der billigen Seite gibt es eine strukturelle Hürde. AWS verkauft die A100 nur in 8-GPU-Formen, p4d.24xlarge mit 40-GB-Karten und p4de.24xlarge mit 80 GB. Eine einzelne A100 bedeutet also die a2-highgpu-1g von GCP, obwohl dort jede GPU mehr kostet. Meetrix beziffert die AWS-8-GPU-A100 auf 21,96 Dollar pro Stunde, 2,75 Dollar pro GPU, gegenüber 3,67 Dollar bei der GCP-Form mit einer GPU.

Reservierte und Spot-Preise machen das Bild noch komplizierter. Meetrix berichtet, dass eine dreijährige Reservierung bei AWS 54% bis 57% spart, dass Spot-Rabatte bei H100 oder A10G 53% bis 62% betragen und dass Spot bei L40S 1% ausmacht. Außerdem weist der Text darauf hin, dass AWS die On-Demand-Preise für P4d und P4de um 33% und für P5 um 44% gesenkt hat, gemessen an den Preisen vom 31. Mai 2025.

Eines ist tatsächlich gestiegen: EC2 Capacity Blocks for ML, bei denen man GPUs für ein festes Zeitfenster reserviert. The Register meldete im Januar 2026 einen Anstieg um etwa 15%, wobei p5e von 34,61 auf 39,80 Dollar pro Stunde ging.

Dasselbe Modell bei drei Anbietern kaufen

Die andere Hälfte der Inferenzkosten hat mit der GPU gar nichts zu tun. Unblocked veröffentlichte am 29. September einen Bericht darüber, wie offene Gewichte über Baseten, Fireworks und CoreWeave geroutet wurden. Alle drei bieten GLM 5.2 an, zu unterschiedlichen Preisen und Geschwindigkeiten. Der erste Aufbau, Round-Robin, schickte in der letzten vollen Woche 51% der Aufgaben an Fireworks und 49% an Baseten, obwohl Fireworks 25% mehr verlangte und langsamer lief.

Eine feste Reihenfolge behob das und schickte 98,5% der Aufgaben an Baseten und 1,5% an Fireworks. Dann kamen die betrieblichen Probleme: Eine Änderung der Reihenfolge erforderte eine Codeänderung und ein Deployment, der Circuit Breaker wertete fünf 429er in einer Minute als kompletten Ausfall, und die Listenpreise von CoreWeave, etwa 45% unter denen von Baseten, blieben ungenutzt, weil niemand Leistungsdaten hatte. Der Ersatz bewertet jeden Anbieter nach Kosten und Geschwindigkeit, gewichtet mit 0,7 und 0,3, und verschiebt den Verkehr ohne einen Ingenieur. Der Beitrag sagt, die Zahlen stammten aus dem eigenen Produktions-Token-Ledger und den Logs.

Das Token-Verhalten auf Modellebene schlägt direkt auf diese Rechnung durch. Artificial Analysis berichtete am 29. September, dass Claude Sonnet 5.5 im Intelligence Index 56 Punkte erreicht, zwei Punkte hinter Opus 5.5 mit maximalem Aufwand, aber rund 193.000 Ausgabe-Tokens pro Indexaufgabe verbraucht. Das nennt das Unternehmen den schwersten Token-Verbrauch, den es gemessen hat, etwa 60% über Opus 5.5 und rund 7x GPT-6 Astra mit maximalem Aufwand. Sonnet 5.5 kostet 2 Dollar pro Million Eingabe- und 10 Dollar pro Million Ausgabe-Tokens, unverändert gegenüber Sonnet 5. Doch Artificial Analysis kommt auf 7,60 Dollar pro Aufgabe, rund 50% mehr als Sonnet 5. Das Unternehmen weist darauf hin, dass die Bewertungen auf einem Vorab-Deployment liefen, in dem ein Fehler strukturierte Ausgaben betraf, der für die öffentliche Version behoben wurde.

Wohin das Geld stattdessen fließt

Der IPO-Prospekt von Anthropic, den Reuters einsehen konnte und über den CNBC am 29. September berichtete, liefert die Nachfrageseite dieses Marktes in einer Zeile: 7,33 Milliarden Dollar für Compute und Infrastruktur im Jahr 2025, eine Verdreifachung gegenüber 2024 und mehr als die Hälfte von 12,65 Milliarden Dollar Gesamtbetriebsausgaben. Dieselbe Einreichung nennt 518 Milliarden Dollar an Verpflichtungen für Cloud, Computing und Infrastruktur in den kommenden Jahren sowie einen Nettoverlust von 42 Milliarden Dollar für 2025.

Der Speicher ist die Knappheit, die anderswo sichtbar wird. Yahoo Finance berichtete am 30. September, dass Apples neuer Vorstandsvorsitzender John Ternus kleinere Entlassungen und Projektstreichungen plant, laut einem Bericht von Bloomberg, während die Speicherkosten steigen. Der Artikel zitiert den früheren CEO Tim Cook, der in seiner letzten Telefonkonferenz zu den Quartalszahlen von einer Jahrhundertflut bei den Speicherpreisen sprach. Außerdem nennt er SK Hynix, Samsung und Micron, die einen Großteil ihrer Premium-Kapazität für KI-Speicher bis 2026 ausverkauft haben.

Nichts davon macht die GPU-Tabelle pro Stunde falsch. Es macht sie unvollständig. Die Formulierung von Meetrix selbst ist die ehrliche: Bring die Auslastung in Ordnung, bevor du dich festlegst, und lies eine Spalte von oben nach unten statt quer. Denn kein Cloud-Wechsel bringt die Ersparnis, die ein müßiger Nachmittag kostet.

Kommentare 0

Quellen

6
  1. 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05Anthropic's IPO prospectus shows AI vision, surging costsEN
  6. 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.