Narzędzi do liczenia kosztów inferencji przybywa, ceny GPU wciąż niejawne
Kalkulator działający w przeglądarce, opublikowany 23 września, porównuje koszty inferencji dla 27 modeli. Sam autor ostrzega, że wynik to szacunek na potrzeby planowania, a nie oferta dostawcy. Kilka dni później osobny benchmark wziął pod lupę koszt godzinnego uruchomienia jednego modelu.

Najnowszy głos w sporze o koszty inferencji to nie komunikat cenowy, tylko kalkulator. Flavio Copes opublikował 23 września Inference Cost Calculator. Narzędzie stawia na jednej liście 27 modeli od OpenAI, Anthropic, Google, xAI, Mistral, OpenRouter i Workers AI, przy identycznych założeniach.
Wpisujesz dzienną liczbę aktywnych użytkowników, liczbę wywołań na użytkownika, tokeny wejściowe i wyjściowe na wywołanie oraz opcjonalny współczynnik trafień w pamięć podręczną promptu. Narzędzie zwraca miesięczny rachunek. Ostrzega też, że liczby pochodzą z publikowanych stawek API i pomijają ceny batchowe, rabaty dla firm, dopłaty za obrazy lub narzędzia oraz każdą warstwę cache, którą zbudujesz sam.
To zastrzeżenie waży więcej niż sam ranking.
Benchmark, który wycenia godzinę myślenia
26 września StarSkirmish opublikował inny rodzaj porównania kosztów. Benchmark daje każdemu LLM godzinę na napisanie bota Protoss w C++ do StarCraft: Brood War, a potem wystawia boty przeciwko sobie oraz przeciwko przeciwnikom pisanym przez ludzi. Stawka to 50 botów LLM z 10 modeli, do tego 3 boty demonstracyjne i 9 konkurencyjnych botów napisanych przez ludzi, razem 62 uczestników. Wszystko działa na sandboxach Prime Intellect.
GPT-6 Astra i Claude Opus 5.5 są funkcjonalnie na równi na szczycie, jak podaje własny opis projektu. GPT-6 Sol wyraźnie odstaje od reszty obok nich. Benchmark rysuje też wynik w zależności od średniego kosztu API jednego godzinnego uruchomienia w skali logarytmicznej. Autorzy piszą, że GPT-6 Sol wypada w tym porównaniu wyjątkowo korzystnie pod względem stosunku ceny do możliwości.
To ujęcie kosztu na jednostkę możliwości, a nie kosztu na token. Ma też granicę: autorzy mówią, że najlepsze modele rozumujące korzystają teraz wyraźnie z okresów rozumowania dłuższych niż godzina, i zapowiadają wersje działające dłużej.
Dlaczego publicznym liczbom trudno ufać
Żadne z tych źródeł nie podaje ceny GPU. Tę lukę wypełnia przegląd opublikowany 20 września przez Nexlab. Autor porównuje w nim orkiestratory do hostowania własnego, w tym LocalAI, exo, GPUStack, vLLM, Ollama, Xinference i CoderAI. Liczbę gwiazdek pobrano z API GitHub 20 września. Autor wprost pisze, że tam, gdzie nie dało się potwierdzić funkcji, tabela mówi o tym zamiast zgadywać.
Najbardziej użyteczne rozróżnienia w tym przeglądzie nie dotyczą ceny. Autor rozdziela trzy pytania: czy jeden model może rozłożyć się na więcej niż jedną maszynę, czy kolejna tura trafia tam, gdzie już leży jego KV cache lub cache prefiksu, i czy serwer potrafi sam wynająć GPU. vLLM, ze 92 000 gwiazdek w tym momencie, obsługuje równoległość tensorową i potokową przez Ray oraz cache prefiksów na instancję. Ollama, ze 181 000 gwiazdek, to jedna maszyna i jeden model naraz, bez historii klastrowej poza rozdzielaniem żądań na kilka adresów URL za Open WebUI.
Pieniądze leżą w sprzęcie, nie w oprogramowaniu. Rynek PV w Brazylii to nie historia o AI, ale pv magazine poinformował 26 września, że średnie ceny systemów PV w tym kraju wzrosły o 7% między styczniem a czerwcem 2026 roku dla projektów do 300 kW. Dane pochodzą z badania Distributed Energy Solutions firmy Greener. Koszty zestawów dla systemów 4 kW wzrosły o 18,3%, z 1,42 BRL/W do 1,68 BRL/W.
Inny towar, ten sam problem: liczba na pierwszym planie się rusza, bo ruszają się komponenty.
Co mówią badania po stronie wyników
Jeszcze jeden element obrazu kosztów leży po stronie popytu. Praca zgłoszona do arXiv 14 września i poprawiona 17 września, SlopShape, opisuje narzędzie o 214 cechach. Wykrywa ono generowane przez AI komercyjne treści internetowe wyłącznie po sygnaturach strukturalnych. Zastosowane przez LLM i zweryfikowane wobec adnotacji ludzkiej osiągnęło 98,0 makro-F1 na firmach z odłożonego zbioru i 98,1, gdy każdy wpis AI został przeredagowany przez własny model. Autorem jest Jochen Madler z Sitefire.
Tańsza inferencja produkuje więcej tekstu. Wykrywanie tego tekstu jest dziś mierzalnym zadaniem o publikowanej dokładności, co samo w sobie jest kosztem infrastruktury.
Żadne z tych źródeł nie zgadza się co do tego, ile inferencja powinna kosztować, bo żadne nie mierzy tego samego. Kalkulator mierzy hipotetyczny rachunek. Benchmark mierzy możliwości na godzinę wydatku na API. Przegląd orkiestratorów mierzy funkcje, nie faktury. Każdą pojedynczą liczbę traktuj jako założenie wyjściowe.
Źródła
5- 01Inference Cost CalculatorEN
- 02StarSkirmish BenchEN
- 03Self-hosted inference orchestrators compared: LocalAI, exo, GPUStack, vLLMEN
- 04PV system costs increase by 7% in Brazil in H1EN
- 05SlopShape: Identifying AI-Generated Commercial Web ContentEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.