AWS ma tańszy H100, ale o rachunku za inferencję decyduje wykorzystanie
AWS wycenia H100 na 6,88 dolara za godzinę, Google Cloud na 10,98 dolara. Ta 37-procentowa różnica znaczy jednak znacznie mniej niż czterokrotna rozpiętość między zajętą i bezczynną kartą. Ceny sprawdzono 28 września.

AWS wycenia H100 na 6,88 dolara za godzinę, Google Cloud na 10,98 dolara. Ta 37-procentowa różnica znaczy jednak znacznie mniej niż czterokrotna rozpiętość między zajętą i bezczynną kartą. Ceny sprawdzono 28 września.
Porównanie pochodzi z meetrix.io. Serwis podaje, że 28 września sprawdził ceny katalogowe na żądanie dla regionu US East w AWS i us-central1 w Google Cloud. Na tej samej stronie napisano wprost, że przy 25-procentowym wykorzystaniu H100 kosztuje cztery razy więcej za token niż przy pełnym obciążeniu, i to w obu chmurach. Autor ostrzega też, że liczba tokenów na sekundę w przykładzie to wartość zastępcza, a nie wynik pomiaru.
Tabela i kto w niej wypada najtaniej
Według meetrix AWS jest około 37 procent tańszy za H100 i 25 procent tańszy za A100 niż Google Cloud przy cenach na żądanie. Google wygrywa w jednym miejscu, na małej karcie L4. g2-standard-4 kosztuje około 0,70 dolara za godzinę, a g6.xlarge w AWS 0,805 dolara. Sam artykuł nazywa tę różnicę mniej więcej 75 dolarami miesięcznie.
Wiersz z A100 kryje haczyk. AWS sprzedaje A100 tylko w konfiguracjach ośmiokartowych: p4d.24xlarge z kartami 40 GB i p4de.24xlarge z kartami 80 GB, po 2,75 dolara za godzinę pracy GPU i 21,96 dolara za cały węzeł. Jeśli potrzebujesz jednej A100, praktycznym wyborem jest a2-highgpu-1g od Google za 3,67 dolara za godzinę, choć każda karta kosztuje wtedy więcej.
W kwestii źródeł meetrix jest zaskakująco otwarty. Podaje, że dane AWS pochodzą z trackera EC2 firmy Vantage, aktualizowanego 28 września 2026, a strona Google z cenami GPU renderuje tabelę po stronie klienta, więc nie dało się jej odczytać programowo. Liczby dla GCP pochodzą zatem z publikacji trackerów cen. Trzy z nich zgodziły się na 87,83 dolara za a3-highgpu-8g, a czwarty podał 88,49 dolara. To niewielka rozbieżność, ale rozbieżność, i warto wiedzieć, po której jej stronie mieści się twój budżet.
Wykorzystanie bije szukanie okazji
W obliczeniach z wpisu meetrix przyjęto 2 500 tokenów wyjściowych na sekundę na jednym H100. Autor nazywa to założeniem, nie pomiarem. Przy pełnym obciążeniu AWS wypada na 0,76 dolara za milion tokenów, a GCP na 1,22 dolara. Przy 50 procentach obciążenia to 1,53 i 2,44 dolara. Przy 25 procentach: 3,06 i 4,88 dolara.
Czytaj w dół kolumny, nie w poprzek wierszy, radzi wpis.
To słuszna wskazówka. Zmiana chmury oszczędza 37 procent na tym samym H100. Bezczynna karta przez trzy czwarte czasu kosztuje cztery razy więcej. Jedno jest decyzją zakupową, drugie decyzją o planowaniu zadań, i tylko to drugie narasta z każdym dniem.
GPUAdvisor, który twierdzi, że śledzi 14 dostawców i ostatni raz uruchomił codzienne sprawdzenie 1 października 2026, pokazuje, dokąd prowadzi logika szukania okazji. W jego zestawieniu L40S od Lium kosztuje 0,38 dolara za godzinę pracy GPU i jest oznaczony jako 89 procent tańszy od AWS, RTX A6000 od Thunder Compute 0,35 dolara, a A4000 od Hyperstack 0,15 dolara. Ta sama strona zauważa, że chmury specjalizujące się w GPU oferują dwa do czterech razy niższe ceny za kartę niż hyperscalerzy, a ceny są przybliżone i zależą od regionu. Specjalista to nie to samo co hyperscaler, ale ta rozpiętość też nie jest szumem.
Rabaty za zobowiązania również zmieniają wynik, i działają w obie strony. Meetrix podaje, że trzyletnia rezerwacja w AWS daje oszczędność 54 do 57 procent, z zastrzeżeniem, że GPU szybko się starzeją. GPUAdvisor wycenia roczne zobowiązania na 35 do 40 procent dla stale działających punktów końcowych inferencji, a GCP Spot na nawet 70 procent zniżki dla instancji A100 i H100. Meetrix dodaje, że Spot w AWS daje dziś 53 do 62 procent zniżki dla H100 i A10G, ale tylko 1 procent dla L40S.
Produkt pojemnościowy, który podrożał
Nie każda cena spadła. Meetrix przytacza doniesienie The Register o wzroście o około 15 procent w styczniu 2026 w EC2 Capacity Blocks for ML, gdzie p5e podrożał z 34,61 do 39,80 dolara za godzinę. Zauważa, że to osobny produkt od stawek na żądanie z tabeli porównawczej, a właśnie takie rozróżnienie ginie, gdy zespoły podają jedną liczbę za GPU na spotkaniu planistycznym.
Tłem dla tego wszystkiego jest zacisk na podaży, który wykracza daleko poza GPU. Yahoo Finance podał 30 września, że nowy dyrektor generalny Apple, John Ternus, planuje niewielkie zwolnienia i anulowanie projektów, powołując się na doniesienie Bloomberga, w miarę jak rosną koszty pamięci. Tekst cytuje byłego dyrektora generalnego Tima Cooka, który na swojej ostatniej konferencji wynikowej mówił o stuletniej powodzi w cenach pamięci, i zauważa, że SK Hynix, Samsung i Micron sprzedały niemal całe moce produkcyjne pamięci premium dla AI na większą część 2026. O moce obliczeniowe i pamięć licytują ci sami kupujący.
Prospekt IPO Anthropic, widziany przez Reutersa i opisany 29 września, podaje liczbę dla tego apetytu: 7 330 000 000 dolarów wydanych na moc obliczeniową i infrastrukturę w 2025, trzykrotny wzrost wobec 2024, ponad połowa z 12 650 000 000 dolarów całkowitych kosztów operacyjnych, wobec 518 000 000 000 dolarów zobowiązań w chmurze, informatyce i infrastrukturze zaplanowanych na najbliższe lata. To zobowiązanie jednego kupującego i jest większe niż roczne przychody z GPU większości chmur.
Tymczasem strona programowa wciąż rozdyma rachunek. Artificial Analysis podało 29 września, że Claude Sonnet 5.5 zużywa około 193 000 tokenów wyjściowych na zadanie w Intelligence Index przy maksymalnym wysiłku. To najcięższe zużycie tokenów, jakie firma zmierzyła, około 7 razy więcej niż GPT-6 Astra przy maksimum. Anthropic wyceniło go identycznie jak Sonnet 5, po 2 i 10 dolarów za milion tokenów wejściowych i wyjściowych, więc koszt siedzi w liczbie tokenów, a nie w cenniku. Artificial Analysis podaje 7,60 dolara za zadanie, około 50 procent więcej niż Sonnet 5.
Routing to druga dźwignia i coraz częściej działa automatycznie. Unblocked opisał 29 września adaptacyjny router, który ocenia dostawców pod kątem kosztu i szybkości, z wagami 0,7 i 0,3, i przenosi ruch, gdy jeden z nich się psuje. Wcześniej tryb round-robin wysyłał 51 procent zadań GLM 5.2 do Fireworks po cenach o 25 procent wyższych niż w Baseten. Po ustaleniu kolejności Baseten obsłużył 98,5 procent. Firma podaje, że trzeci dostawca, CoreWeave, miał ceny około 45 procent niższe niż Baseten, ale nie miała danych o wydajności, by go sklasyfikować.
Nic z tego nie czyni pytania AWS kontra GCP błędnym. Czyni je drugim pytaniem. Najpierw zmierz wykorzystanie, potem spieraj się o stawkę godzinową.
Źródła
6- 01GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 02Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
- 03New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN
- 04Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 05Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 06Routing LLM traffic across inference providers with TCP-style congestion controlEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.