Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

AWS hat die günstigere H100, doch die Auslastung entscheidet über die Inferenzrechnung

AWS listet eine H100 mit 6,88 Dollar pro Stunde, Google Cloud mit 10,98 Dollar. Der Abstand von 37 Prozent wiegt deutlich weniger als der Faktor vier zwischen einer ausgelasteten und einer leer stehenden GPU. Das geht aus Preisen hervor, die am 28. September geprüft wurden.

KI & ModelleErklärtLena BrandtVeröffentlicht: 29. September 20265 Min. LesezeitQuellen 6
AWS hat die günstigere H100, doch die Auslastung entscheidet über die Inferenzrechnung

AWS listet eine H100 mit 6,88 Dollar pro Stunde, Google Cloud mit 10,98 Dollar. Der Abstand von 37 Prozent wiegt deutlich weniger als der Faktor vier zwischen einer ausgelasteten und einer leer stehenden GPU. Das geht aus Preisen hervor, die am 28. September geprüft wurden.

Der Vergleich stammt von meetrix.io. Die Seite gibt an, am 28. September die On-Demand-Listenpreise für US East bei AWS und für us-central1 bei Google Cloud geprüft zu haben. Auf derselben Seite steht ohne Umschweife, dass eine H100 bei 25 Prozent Auslastung pro Token viermal teurer ist als unter Volllast, bei beiden Clouds. Der Autor warnt zudem, die verwendete Zahl von Token pro Sekunde sei ein Platzhalter und kein Benchmark.

Die Tabelle und wer darin am günstigsten ist

Meetrix setzt AWS pro H100 rund 37 Prozent günstiger an als Google Cloud auf Abruf, pro A100 sind es 25 Prozent. Nur bei der kleinen L4-Karte gewinnt Google: g2-standard-4 kostet etwa 0,70 Dollar pro Stunde gegenüber 0,805 Dollar für AWS g6.xlarge. Der Artikel selbst beziffert den Unterschied mit rund 75 Dollar im Monat.

In der A100-Zeile steckt ein Haken. AWS verkauft die A100 nur in Achter-Formen, p4d.24xlarge mit 40-GB-Karten und p4de.24xlarge mit 80 GB, zu 2,75 Dollar pro GPU-Stunde und 21,96 Dollar für den Knoten. Wer eine einzelne A100 braucht, fährt mit Googles a2-highgpu-1g zu 3,67 Dollar pro Stunde praktisch besser, obwohl jede GPU mehr kostet.

Bei den Quellen ist meetrix ungewöhnlich offen. Die AWS-Zahlen stammen laut der Seite aus Vantages EC2-Tracker, aktualisiert am 28. September 2026. Googles eigene GPU-Preisseite rendert ihre Tabelle clientseitig, sodass sie nicht programmatisch ausgelesen werden konnte. Die GCP-Zahlen sind also die, die Preistracker veröffentlichen. Drei von ihnen stimmten bei 87,83 Dollar für die a3-highgpu-8g überein, ein vierter nannte 88,49 Dollar. Das ist eine kleine Abweichung, aber eine Abweichung, und es lohnt zu wissen, auf welcher Seite davon das eigene Budget liegt.

Auslastung schlägt Preissuche

Die Rechnung im meetrix-Beitrag geht von 2.500 Ausgabe-Token pro Sekunde auf einer H100 aus, was der Autor als Annahme und nicht als Messung kennzeichnet. Bei 100 Prozent Auslastung ergeben sich für AWS 0,76 Dollar pro Million Token und für GCP 1,22 Dollar. Bei 50 Prozent Auslastung werden daraus 1,53 und 2,44 Dollar. Bei 25 Prozent Auslastung 3,06 und 4,88 Dollar.

Man solle eine Spalte von oben nach unten lesen, nicht quer, rät der Beitrag.

Das ist die richtige Anweisung. Der Wechsel der Cloud spart 37 Prozent auf dieselbe H100. Lässt man die Karte drei Viertel der Zeit leer stehen, kostet das viermal so viel. Das eine ist eine Beschaffungsentscheidung, das andere eine Frage der Planung, und nur die zweite summiert sich täglich.

GPUAdvisor, nach eigenen Angaben mit 14 Anbietern im Programm und einem letzten täglichen Check am 1. Oktober 2026, zeigt, wohin diese Logik des Preisvergleichs führt. In den Listen steht Liums L40S bei 0,38 Dollar pro GPU-Stunde, gekennzeichnet als 89 Prozent unter AWS, Thunder Computes RTX A6000 bei 0,35 Dollar und Hyperstacks A4000 bei 0,15 Dollar. Dieselbe Seite merkt an, dass GPU-Spezialisten zwei- bis viermal niedrigere Preise pro GPU bieten als Hyperscaler und dass die Preise Näherungswerte sind, die je nach Region schwanken. Spezialisten sind nicht dasselbe Produkt wie ein Hyperscaler, aber die Spanne ist auch kein Rauschen.

Auch Laufzeitrabatte bewegen die Zahl, und sie wirken in beide Richtungen. Meetrix berichtet von einer dreijährigen AWS-Reservierung mit 54 bis 57 Prozent Ersparnis, mit dem Hinweis, dass GPUs schnell altern. GPUAdvisor setzt Ein-Jahres-Verpflichtungen für dauerhaft laufende Inferenz-Endpunkte bei 35 bis 40 Prozent an und GCP Spot bei bis zu 70 Prozent Nachlass auf A100- und H100-Instanzen. Meetrix ergänzt, dass Spot bei AWS derzeit 53 bis 62 Prozent Nachlass für H100 und A10G bringt, für L40S aber nur 1 Prozent.

Das Kapazitätsprodukt, das sich anders entwickelte

Nicht jeder Preis fiel. Meetrix verweist auf einen Bericht von The Register über einen Anstieg um etwa 15 Prozent im Januar 2026 bei EC2 Capacity Blocks for ML, wobei p5e von 34,61 auf 39,80 Dollar pro Stunde stieg. Es handele sich um ein anderes Produkt als die On-Demand-Preise in der Vergleichstabelle. Genau diese Unterscheidung geht verloren, wenn Teams in einer Planungsrunde eine einzelne GPU-Zahl nennen.

Der Hintergrund für all das ist eine Verknappung, die weit über GPUs hinausreicht. Yahoo Finance berichtete am 30. September, der neue Apple-CEO John Ternus plane kleinere Entlassungen und Projektstreichungen, unter Berufung auf einen Bloomberg-Bericht, während die Speicherkosten steigen. Der Beitrag zitiert den früheren CEO Tim Cook, der in seiner letzten Telefonkonferenz zu den Zahlen von einer Jahrhundertflut bei den Speicherpreisen sprach, und merkt an, dass SK Hynix, Samsung und Micron ihre Premium-Kapazität für KI-Speicher durch weite Teile von 2026 weitgehend ausverkauft haben. Um Rechenleistung und Speicher bieten dieselben Käufer.

Der IPO-Prospekt von Anthropic, den Reuters einsehen konnte und über den am 29. September berichtet wurde, beziffert diesen Appetit: 7,33 Milliarden Dollar für Rechenleistung und Infrastruktur im Jahr 2025, ein Dreifaches gegenüber 2024 und mehr als die Hälfte von 12,65 Milliarden Dollar gesamten Betriebsausgaben, gegen 518 Milliarden Dollar Verpflichtungen für Cloud, Computing und Infrastruktur in den kommenden Jahren. Das ist die Vorausverpflichtung eines einzelnen Käufers, und sie ist größer als der jährliche GPU-Umsatz der meisten Clouds.

Unterdessen treibt die Softwareseite die Rechnung weiter. Artificial Analysis berichtete am 29. September, Claude Sonnet 5.5 verbrauche bei maximalem Aufwand rund 193.000 Ausgabe-Token pro Aufgabe des Intelligence Index, der höchste gemessene Token-Verbrauch, etwa 7-mal so viel wie GPT-6 Astra bei maximalem Aufwand. Anthropic bepreist es identisch zu Sonnet 5 mit 2/10 Dollar pro Million Eingabe- und Ausgabe-Token, die Kosten landen also in der Token-Zahl und nicht auf dem Preisschild, und Artificial Analysis kommt auf 7,60 Dollar pro Aufgabe, etwa 50 Prozent mehr als Sonnet 5.

Das Routing ist der andere Hebel, und es wird automatisiert. Unblocked beschrieb am 29. September einen adaptiven Router, der Anbieter nach Kosten und Geschwindigkeit bewertet, gewichtet mit 0,7 und 0,3, und Verkehr verschiebt, wenn einer schlechter wird. Davor schickte Round-Robin 51 Prozent der GLM-5.2-Aufgaben an Fireworks, zu Preisen 25 Prozent über Baseten. Nach einer festen Reihenfolge bediente Baseten 98,5 Prozent. Ein dritter Anbieter, CoreWeave, lag nach Angaben des Unternehmens etwa 45 Prozent unter Baseten, doch es gab keine Leistungsdaten, um ihn einzuordnen.

Nichts davon macht die Frage AWS gegen GCP falsch. Es macht sie zur zweiten Frage. Erst die Auslastung messen, dann über den Stundensatz streiten.

Kommentare 0

Quellen

6
  1. 01GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  2. 02Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  3. 03New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
  4. 04Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
  5. 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  6. 06Routing LLM traffic across inference providers with TCP-style congestion controlEN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Lena Brandt

Lena Brandt

KI, Modelle und Technik

Lena Brandt schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Herstellerangaben, Studien und öffentlich zugängliche Datensätze, statt Pressemitteilungen ungeprüft zu übernehmen. Bei Modellvergleichen kontrolliert sie Benchmark-Werte, Trainingsdaten und Versionsnummern und rechnet Angaben zu Rechenleistung und Kosten selbst nach. Sie spricht mit Entwicklern und Forschern, wartet auf angekündigte Updates und vergleicht Releases, bevor sie eine Einschätzung abgibt. Privat beschäftigt sie sich mit 3D-Druck, alten Rechnern und der Frage, wie Modelle aus Internetmüll lernen – Themen, die regelmäßig in ihre Texte einfließen. Sie publiziert keine Zahlen, deren Quelle sie nicht selbst überprüfen konnte.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.