Koszty inferencji się rozjeżdżają: plan ChatGPT za 500 dolarów, dwa razy szybsze otwarte silniki, 6 centów za miliard tokenów
OpenAI otworzyło 29 września plan ChatGPT Pro za 500 dolarów miesięcznie. To najdroższy próg w ofercie firmy, o 300 dolarów wyżej niż poprzedni najwyższy plan. W tym samym czasie tańsze otwarte stosy inferencyjne próbują zejść pod tę cenę.

Nowy plan ogłoszono we wtorek na DevDay. Daje dostęp do obliczeń „Ultrafast” dla GPT-6 Astra w ChatGPT Work i Codex. Business Insider podał, że w tym trybie Codex ma być szybszy ośmiokrotnie. Ten sam materiał mówi, że OpenAI przywraca plan Pro za 200 dolarów miesięcznie, zawieszony 10 września, ale zmniejsza limit obliczeń o połowę, do 10x wobec planu Plus za 20 dolarów zamiast 20x, i obniża liczbę wiadomości w czacie GPT-6 Pro ze 200 do 100 tygodniowo.
Thibault Sottiaux, inżynier prowadzący Codex, napisał w poniedziałkowym wpisie na X, że po zmianach wydatki na API wychodzą o połowę niższe niż w poprzednim planie. Powołał się na to Business Insider.
„Chciałem podzielić się tą zmianą z wyprzedzeniem, żebyście mogli ją zrozumieć, zanim zasypiemy was dobrymi wiadomościami” — napisał.
To szczyt rynku. Dół porusza się szybciej.
Otwarte silniki i samodostrajające się kernele
30 września wspierane przez YC Magnitude opublikowało otwartoźródłowy silnik inferencyjny. Silnik kompiluje i dostraja kernele na sprzęcie użytkownika, zanim uruchomi model. Firma twierdzi, że otwarte modele działają do 2x szybciej niż llama.cpp. W README na GitHubie podano o 92% szybsze dekodowanie na backendzie Metal w Apple Silicon i o 19% na CUDA, a do tego o 27% mniejsze zużycie pamięci na agenta i współdzielone pamięci podręczne prefiksów dla równoległych sesji.
Silnik trafia do użytkowników jako aplikacja desktopowa na licencji Apache 2.0. Obsługuje Apple Silicon, NVIDIA, AMD albo sam CPU i łączy się z Pi, OpenCode, Hermes, Codex oraz innymi agentami. Dwie godziny wcześniej Modal i Full Stack Data Lab opublikowały wspólny silnik SQL plus inferencja o nazwie Quail. We wpisie Modala czytamy, że Quail przetwarza ponad miliard tokenów na minutę na jednym GPU H100 przy zapytaniu z wieloma złączeniami. To ponad 10x szybciej niż bazowy vLLM na tym samym sprzęcie, za mniej niż 6 centów za miliard tokenów w Modal. W nowym benchmarku AI-SQL zespołu średnia geometryczna przyspieszenia wobec vLLM wynosi 1,84x. Autorzy wskazują dwa zapytania pokazujące, gdzie to podejście wciąż nie daje rady.
Autorzy mówią wprost, że ogólne silniki mają zły kształt dla tego obciążenia. We wpisie Full Stack Data Lab Shreya Shankar, Charles Frye, Fergus Finn, Arnav Dhariya, Joseph Barrow i Meryem Arik piszą, że wysyłanie milionów powiązanych wywołań modelu do silnika takiego jak vLLM jako osobnych żądań sporo kosztuje. Ich przykładowe zapytanie, BIO-4 w benchmarku QUAIL-B, filtruje 5 000 długich raportów medycznych wobec 4 144 terminów reakcji użytych dwukrotnie. Naiwne wykonanie zamienia jedno polecenie SQL w bardzo dużą liczbę wywołań modelu.
Podłoga cenowa jest publikowana i nie jest płaska
Wrześniowy indeks cenowy AICostBudget, zamrożony na 2026-09-30 UTC, obejmuje 81 publicznych rekordów od 11 dostawców. Mediana ceny wejścia wynosi 1,32 dolara za milion tokenów, a mediana ceny wyjścia 6 dolarów. Przy medianie wyjście jest 5,0x droższe od wejścia w 69 rekordach, które podają obie liczby. Zaobserwowane przedziały sięgają od 0,10 do 30 dolarów za milion tokenów wejścia i od 0,10 do 180 dolarów za milion tokenów wyjścia.
Ten sam zbiór podaje mediany dla dostawców. OpenAI 2 dolary za wejście i 11 dolarów za wyjście w 18 rekordach, Google Gemini 0,75 i 4,125 w 14, Anthropic 5 i 25 w 13, xAI 1,25 i 2,5 w dziewięciu, Mistral AI 0,20 i 0,60 w siedmiu, DeepSeek 0,30 i 1,2 w trzech, Moonshot AI 0,95 i 4 w trzech. W 58 porównywalnych rekordach z pamięcią podręczną wejścia mediana zniżki wynosi 90%, a w 44 rekordach z ceną wsadową mediana zniżki wsadowej to 50%. Porównanie, które pomija którykolwiek z tych trybów, zestawia cenniki, a nie rachunki.
Sprzęt to miejsce, gdzie spór trudniej rozstrzygnąć. EnerTune, praca Prasoona Sinhy, Dimitriosa Liakopoulosa, Nathana Lemmy i Neerai J. Yadwadkar z SOSP '26 z 28 września, przekonuje, że multipleksowanie GPU wyłącznie po to, by podnieść wykorzystanie, może zwiększyć zużycie energii. Autorzy podają, że ich system pakowania zorientowany na energię spełnia cele wydajnościowe, a jednocześnie ścina zużycie energii od 1,4 do 2,3x i pobór mocy od 1,3 do 2,6x wobec najlepszych dostępnych rozwiązań.
Nie całe cenowe newsy tego tygodnia dotyczą centrów danych. Dane Transport & Environment analizowane 29 września pokazują, że koszt przejechania kilometra samochodem elektrycznym to mniej niż połowa kosztu diesla. Wyliczenia opierają się na 6,9 litra na 100 km dla diesla i 20,2 kWh na 100 km dla auta bateryjnego przy cenie prądu 0,343 euro za kWh. Kierowcy diesli płacą za 50-litrowy bak o 32 euro więcej niż na początku roku, z czego około 16 euro to dodatkowa marża rafineryjna, według szacunków EBC cytowanych przez CleanTechnica.
Dwie lekcje z tego tygodnia nie dotyczą wcale AI. Pinecone usunęło kalkulator cen ze swojej strony cennika po teście A/B. Test wykazał, że odwiedzający, którzy go nie widzieli, 16% częściej się rejestrowali i 90% częściej kontaktowali się z firmą, bez wzrostu liczby zgłoszeń do wsparcia w sprawie cen. Podał to założyciel Greg Kogan. W telekomunikacji Light Reading podał 30 września, że singapurskie StarHub i M1 rozmawiają o fuzji, a nowozelandzkie 2degrees i OneNZ zaproponowały połączenie sieci dostępu radiowego.
Wątek przewodni: kiedy jednostka pracy staje się wystarczająco tania, kupujący przestają czytać kalkulator i zaczynają mierzyć rachunek.
Źródła
9- 01ChatGPT's new plan costs $500 a monthEN
- 02Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 05AI API pricing index - September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
- 08The pricing calculator made people more confused about pricingEN
- 09Singapore, New Zealand operators seek partnerships to cut costsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.