Ceny GPU rosną, stawki katalogowe chmury spadają. Ile naprawdę kosztuje inferencja
Prospekt IPO Anthropic, o którym Reuters pisał 28 września, zestawia 518 000 000 000 dolarów przyszłych zobowiązań wobec chmury i mocy obliczeniowych z 42 000 000 000 dolarów straty netto za 2025 rok. Dane o cenach z tego tygodnia podpowiadają, że to drugą liczbę kupujący powinni czytać uważnie.

Pieniądze nie znikają na stawkach z cennika. Meetrix porównał AWS i GCP, sprawdzając ceny 28 września: H100 na żądanie kosztuje 6,88 dolara za godzinę w AWS i 10,98 dolara w GCP. Ta 37-procentowa różnica jest prawdziwa. Jest jednak mniejsza niż wahnięcie, jakie daje uruchomienie tej samej karty przy jednej czwartej obciążenia. Gdy GPU pracuje pełną mocą, milion tokenów kosztuje 0,76 dolara, a przy 25 procentach wykorzystania już 3,06 dolara. To wyliczenia Meetrix przy przyjętej przepustowości 2 500 tokenów na sekundę.
Cały problem mieści się w jednym zdaniu: bezczynny krzem kosztuje więcej niż jakikolwiek wybór dostawcy.
GPUAdvisor śledzi 14 dostawców i twierdzi, że ostatni raz odświeżał dane 1 października. Wynika z nich, że wyspecjalizowane chmury schodzą znacznie poniżej hiperskalerów na starszych kartach: A4000 za 0,15 dolara za godzinę GPU w Hyperstack, L40S za 0,38 dolara w Lium, RTX 4090 za 0,40 dolara. Serwis oznacza te stawki jako śledzone przybliżenia i radzi kupującym potwierdzić ceny na stronie dostawcy. Słusznie, bo ta sama strona podaje RTX 4090 za 0,74 dolara w RunPod. Dwie ceny, ten sam model, prawie dwa razy więcej.
Rachunek za tokeny to jeszcze inna liczba
Artificial Analysis opublikowało 29 września ocenę Claude Sonnet 5.5 od Anthropic. Model osiąga 56 punktów w ich Intelligence Index, dwa punkty za Opus 5.5 przy maksymalnym wysiłku, i zużywa około 193 000 tokenów wyjściowych na zadanie. To jakieś 60 procent więcej niż Opus 5.5 i około siedmiu razy więcej niż GPT-6 Astra przy maksymalnym wysiłku, jak podaje laboratorium. Anthropic nie zmieniło cennika: 2 dolary za milion tokenów wejściowych i 10 dolarów za milion wyjściowych. Koszt zadania wynosi jednak 7,60 dolara, około 50 procent więcej niż w Sonnet 5.
Ten sam cennik, inny rachunek. Szkodę robią tokeny.
AI Pricing Guru odświeża stawki codziennie, ostatni raz 1 października. Podaje użyteczny zakres dla ogólnych API: od 0,50 do 15 dolarów za milion tokenów wyjściowych. Tokeny wejściowe są zwykle dwa do ośmiu razy tańsze, a buforowane wejście obniża koszt o kolejne 75 do 90 procent tam, gdzie dostawca to obsługuje. Kalkulator serwisu obejmuje 154 aktywne modele u ponad 10 dostawców.
Wyszukiwanie zmienia arytmetykę, zanim rozpocznie się generowanie. Spheron w analizie kosztów z 29 września zauważa, że standardowa konfiguracja RAG pobierająca pięć fragmentów po 500 tokenów dokłada 2 500 tokenów kontekstu na zapytanie. Pytanie, które jako zwykły czat kosztowałoby 100 do 200 tokenów wejściowych, może więc po stronie wejścia kosztować 15 do 20 razy więcej.
Unblocked opisał 29 września własny system routingu. Kieruje on ruch GLM 5.2 między Baseten, Fireworks i CoreWeave według oceny z wagą 70 procent dla kosztu i 30 procent dla opóźnienia. Przy stałej kolejności preferującej Baseten ten dostawca obsłużył 98,5 procent zadań w pierwszym pełnym tygodniu. Firma podaje, że ceny katalogowe CoreWeave były około 45 procent niższe od cen Baseten, ale nie miała danych o wydajności, żeby go uszeregować. Taki jest dziś stan zakupów: najtańsza opcja bywa tą, której nikt nie zmierzył.
Źródła
7- 01Anthropic's IPO prospectus shows sweeping AI vision, surging costs: ReutersEN
- 02GPU Costs for LLM Inference: AWS vs GCP (2026)EN
- 03Cloud GPU Pricing - Cost Intelligence for H100, A100 & B200EN
- 04Sonnet 5.5 has the heaviest token use we've measured; pricing matches GPT-6 SolEN
- 05AI Token Cost Calculator 2026: 154 Models by TierEN
- 06RAG Inference Cost Calculator: Cost Per Token, Broken Down (2026)EN
- 07Routing LLM traffic across inference providers with TCP-style congestion controlEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.