Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Matematyka kosztu inferencji: co ukrywa cena godziny GPU

Tracker GPUAdvisor, aktualizowany 1 października, obejmuje już 14 dostawców chmury sprzedających moce H100, H200, A100 i B200. Rozrzut między najtańszą a najdroższą ofertą na tym samym układzie jest tak duży, że cena za godzinę z nagłówka mówi bardzo niewiele.

AI i modeleWyjaśnienieMarta ZielińskaOpublikowano: 29 września 20265 min czytaniaŹródła 6
Matematyka kosztu inferencji: co ukrywa cena godziny GPU

Serwisy porównujące ceny mnożą się szybciej niż rabaty. 1 października GPUAdvisor podał, że jego tracker cen GPU w chmurze obejmuje 14 dostawców i wszystkie najważniejsze akceleratory. Nad tabelą wisi ostrzeżenie: ceny są przybliżone, zależą od regionu i dostępności i odzwierciedlają szacunki z września 2026 roku. Taki jest stan rynku. Cena z cennika to punkt wyjścia, nie rachunek.

Meetrix opublikował własne porównanie 29 września. Ceny sprawdzono 28 września dla instancji on-demand w US East i us-central1. Wniosek jest prosty: na papierze AWS jest tańszy przy H100 i A100, GCP wypada trochę taniej, jeśli wystarczy jedna L4. H100 kosztuje 6,88 dolara za godzinę w AWS, a 10,98 dolara w GCP.

Wykorzystanie liczy się bardziej niż wybór chmury

Ten sam tekst podkopuje jednak własny nagłówek. Meetrix policzył wszystko na przykładowej przepustowości 2 500 tokenów wyjściowych na sekundę. Wyszło mu, że koszt miliona tokenów rośnie z 0,76 do 3,06 dolara na H100 w AWS, gdy wykorzystanie spada ze 100% do 25%. Na H100 w GCP ten sam skok to 1,22 do 4,88 dolara. Artykuł wyraźnie zaznacza, że przepustowość jest założeniem, nie pomiarem, a relacje między wierszami od niej nie zależą.

Oszczędność 37% z tytułu zmiany chmury jest więc warta zachodu. Jest mniejsza niż kara za bezczynne popołudnie. Meetrix wskazuje też problem z danymi: strona Google z cenami GPU renderuje tabelę po stronie klienta, więc autor nie mógł jej odczytać programowo. Trzy trackery zgadzały się co do 87,83 dolara dla a3-highgpu-8g, a czwarty podawał 88,49 dolara. Taką rozbieżność warto nazwać, a nie uśredniać.

Po taniej stronie jest strukturalny haczyk. AWS sprzedaje A100 wyłącznie w konfiguracjach po 8 GPU: p4d.24xlarge z kartami 40 GB i p4de.24xlarge z 80 GB. Pojedyncza A100 oznacza więc a2-highgpu-1g w GCP, choć każdy układ kosztuje tam więcej. Meetrix podaje cenę 8-GPU A100 w AWS na 21,96 dolara za godzinę, czyli 2,75 dolara za GPU, wobec 3,67 dolara za jednoukładową konfigurację w GCP.

Ceny rezerwacji i spot komplikują obraz jeszcze bardziej. Meetrix donosi, że trzyletnia rezerwacja daje 54% do 57% oszczędności w AWS, rabaty spot na H100 i A10G wynoszą 53% do 62%, a spot na L40S to 1%. Zauważa też, że AWS obniżył ceny on-demand o 33% dla P4d i P4de oraz o 44% dla P5, licząc od cen z 31 maja 2025 roku.

Jedna rzecz poszła w górę: EC2 Capacity Blocks for ML, gdzie rezerwuje się GPU na stałe okno. The Register podał wzrost o około 15% w styczniu 2026 roku, przy p5e z 34,61 do 39,80 dolara za godzinę.

Ten sam model od trzech sprzedawców

Druga połowa kosztu inferencji to wcale nie GPU. Unblocked opisał 29 września, jak kierował ruch do modeli o otwartych wagach między Baseten, Fireworks i CoreWeave, gdzie wszyscy serwują GLM 5.2 w różnych cenach i z różną szybkością. Pierwszy układ, round-robin, wysłał 51% zadań do Fireworks i 49% do Baseten w ostatnim pełnym tygodniu, mimo że Fireworks liczył sobie 25% więcej i działał wolniej.

Stała kolejność to naprawiła: 98,5% zadań trafiło do Baseten, a 1,5% do Fireworks. Potem przyszły problemy operacyjne. Zmiana kolejności wymagała zmiany kodu i wdrożenia, bezpiecznik traktował pięć odpowiedzi 429 w ciągu minuty jako pełną awarię, a ceny katalogowe CoreWeave, około 45% niższe niż u Baseten, leżały bezużyteczne, bo nikt nie miał danych o wydajności. Nowy mechanizm ocenia każdego dostawcę pod kątem kosztu i szybkości, z wagami 0,7 i 0,3, i przenosi ruch bez udziału inżyniera. Wpis podaje, że liczby pochodzą z produkcyjnego rejestru tokenów i logów.

Zachowanie modelu na poziomie tokenów przekłada się wprost na ten rachunek. Artificial Analysis podało 29 września, że Claude Sonnet 5.5 zdobywa 56 punktów w ich Intelligence Index, dwa punkty za Opus 5.5 przy maksymalnym wysiłku. Zużywa jednak około 193 000 tokenów wyjściowych na zadanie indeksu. Sami nazywają to najcięższym zużyciem tokenów, jakie zmierzyli: około 60% więcej niż Opus 5.5 i jakieś 7 razy więcej niż GPT-6 Astra przy maksymalnym wysiłku. Sonnet 5.5 kosztuje 2 dolary za milion tokenów wejściowych i 10 dolarów za milion wyjściowych, tyle samo co Sonnet 5, a jednak Artificial Analysis wylicza go na 7,60 dolara za zadanie, około 50% drożej niż Sonnet 5. Firma zaznacza, że testy biegły na wdrożeniu przedpremierowym z błędem wpływającym na dane strukturalne, który naprawiono na potrzeby publicznego wydania.

Gdzie te pieniądze idą zamiast tego

Prospekt IPO Anthropic, do którego dotarł Reuters i o którym pisał CNBC 29 września, pokazuje stronę popytową tego rynku w jednej linii: 7 330 000 000 dolarów wydanych na moc obliczeniową i infrastrukturę w 2025 roku, trzykrotnie więcej niż w 2024 roku, ponad połowa z 12 650 000 000 dolarów całkowitych kosztów operacyjnych. Ten sam dokument opisuje 518 000 000 000 dolarów zobowiązań wobec chmury, mocy obliczeniowych i infrastruktury na najbliższe lata oraz 42 000 000 000 dolarów straty netto za 2025 rok.

Pamięć to ograniczenie, które wychodzi gdzie indziej. Yahoo Finance podał 30 września, że nowy dyrektor generalny Apple, John Ternus, planuje niewielkie zwolnienia i anulowanie projektów, powołując się na doniesienia Bloomberga, w miarę jak rosną koszty pamięci. Artykuł cytuje byłego prezesa Tima Cooka, który na swojej ostatniej konferencji wynikowej mówił o stuletniej powodzi w cenach pamięci. Wymienia też SK Hynix, Samsunga i Microna, które wyprzedały większość swoich najlepszych mocy produkcyjnych pamięci dla AI na cały 2026 rok.

Nic z tego nie czyni tabeli cen GPU za godzinę błędną. Czyni ją niepełną. Sam Meetrix ujmuje to uczciwie: uporządkuj wykorzystanie, zanim się zobowiążesz, i czytaj w dół kolumny, a nie w poprzek wierszy, bo żadna zmiana chmury nie da oszczędności równej kosztowi bezczynnego popołudnia.

Komentarze 0

Źródła

6
  1. 01Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  2. 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
  3. 03Routing LLM traffic across inference providers with TCP-style congestion controlEN
  4. 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
  5. 05Anthropic's IPO prospectus shows AI vision, surging costsEN
  6. 06New Apple CEO John Ternus is reportedly planning layoffs as memory chip costs riseEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.