Subskrypcja ChatGPT za 500 dolarów miesięcznie startuje kilka dni po tym, jak mediana ceny wejścia zatrzymała się na 1,3 dolara
OpenAI ogłosiło w wtorek na DevDay subskrypcję ChatGPT za 500 dolarów miesięcznie. W tym samym tygodniu snapshot z końca miesiąca ustalił medianę ceny katalogowej za milion tokenów wejściowych na 1,32 dolara w 81 publicznych rekordach.

OpenAI ogłosiło we wtorek na DevDay nowy najwyższy plan subskrypcyjny, Pro 500, za 500 dolarów miesięcznie, podaje Business Insider. To o 300 dolarów więcej niż poprzedni najdroższy plan firmy. W przeliczeniu na rok wychodzi 6 000 dolarów za jedno stanowisko.
Plan daje dostęp do tego, co OpenAI nazywa obliczeniami "Ultrafast" dla GPT-6 Astra w ChatGPT Work i Codex. Business Insider podaje, że opcja obiecuje ośmiokrotny wzrost szybkości w Codex i obejmuje największy limit użycia, jaki firma oferuje. Ten sam materiał mówi, że OpenAI przywraca starszy plan Pro za 200 dolarów miesięcznie, zawieszony 10 września, ale obcina jego limit obliczeń o połowę: limit spada do 10x planu Plus za 20 dolarów z wcześniejszych 20x, a tygodniowa liczba wiadomości w GPT-6 Pro maleje z 200 do 100.
Thibault Sottiaux, inżynier prowadzący prace nad Codex w OpenAI, napisał w poniedziałek na X, że po zmianach wydatek na API jest o połowę mniejszy w dolarach niż w poprzednim planie. Business Insider cytuje go wprost. Żaden inny serwis w tym zestawieniu nie potwierdza szczegółów cenowych, a OpenAI nie opublikowało cennika, który dałoby się niezależnie zweryfikować na potrzeby tego tekstu.
Termin nie jest przypadkowy. Wrześniowy snapshot publikowanych cen API pokazuje, że cena katalogowa jest daleko od 500 dolarów miesięcznie dla większości zastosowań. AI API Pricing Index serwisu AICostBudget, zamrożony na 30 września 2026 roku o północy UTC, obejmuje 81 publicznych rekordów cenowych od 11 dostawców. Wśród 69 rekordów ze skalarem ceny tokenów wejściowych obserwowany zakres rozciąga się od 0,10 do 30 dolarów za milion tokenów. W tych samych 69 rekordach dla tokenów wyjściowych zakres wynosi od 0,10 do 180 dolarów za milion.
Rabaty, cache i cena katalogowa
Główne mediany indeksu to 1,32 dolara za milion tokenów wejściowych i 6 dolarów za milion tokenów wyjściowych, co daje medianę stosunku wyjścia do wejścia na poziomie 5,0x. To ceny katalogowe, a indeks wyraźnie zaznacza, że większość kupujących płaci mniej. W 58 porównywalnych rekordach obserwowany rabat na wejście z cache wynosi od 75% do 98%, mediana 90%. W 44 rekordach obsługujących tryb Batch obserwowany rabat na wejście w batchu wynosi od 20% do 50%, mediana 50%.
Ta różnica to cały argument za projektami silników inferencji i optymalizacji zapytań, które pojawiły się w ostatnim tygodniu. Jeśli obciążenie potrafi przenieść powtarzane prefiksy do cache, a masowe zadania do batcha, efektywna cena za token spada znacznie poniżej mediany. Jeśli nie potrafi, rachunkiem zostaje cena katalogowa.
Dwa projekty opublikowane 30 września atakują problem z przeciwnych końców stosu. Po stronie bazy danych praca QUAIL z Full Stack Data Lab, opublikowana 30 września, optymalizuje jednocześnie planowanie zapytań SQL i inferencję LLM. Jej zapytanie testowe BIO-4 działa na ponad 5 000 długich raportów medycznych i 4 144 terminach reakcji, przy czym lista reakcji jest użyta dwa razy w dwóch złączeniach. Autorzy przekonują, że wysyłanie milionów powiązanych wywołań modelu do ogólnego silnika, takiego jak vLLM, jako osobnych żądań jest drogie, bo każdy prompt jest renderowany i obsługiwany jako niezależne żądanie inferencji.
Opis tego samego systemu na blogu Modal, również z 30 września, podaje liczby. Quail przetwarza ponad miliard tokenów na minutę na jednym GPU H100 przy jednym zapytaniu z wieloma złączeniami, co według Modal jest ponad 10x szybsze od bazowego vLLM na tym samym sprzęcie i kosztuje poniżej 6 centów za miliard tokenów na Modal. W nowo opublikowanym benchmarku AI-SQL Modal podaje Quail jako 1,84x szybszy od vLLM, uśredniając geometrycznie po zadaniach, w tym po dwóch zapytaniach, które autorzy zaprojektowali tak, żeby pokazać, gdzie inferencja AI-SQL wciąż wymaga pracy.
Średnia geometryczna 1,84x i wynik 10x dla jednego zapytania pochodzą od tego samego zespołu i nie należy ich czytać jako tego samego pomiaru.
Lokalne jądra i opóźnienia robotów
Po stronie klienta Magnitude, firma z Y Combinator S25, uruchomiła 30 września otwarty silnik inferencji, który kompiluje i dostraja swoje jądra na urządzeniu użytkownika, zanim model wystartuje. README projektu na GitHubie twierdzi, że otwarte modele działają do 2x szybciej niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA oraz o 27% mniejszym zużyciem pamięci na agenta. Silnik obsługuje Apple Silicon, NVIDIA, AMD albo sam procesor. To liczby samego projektu i nie zostały niezależnie odtworzone w tym zestawieniu.
Inferencja w robotach goni ten sam zegar. MindOn zaprezentowało 30 września Mind-1, twierdząc, że skraca opóźnienie inferencji robota z 82 ms do 32 ms. Firma zauważa, że przy prędkości efektora 3 m/s opóźnienie 10 ms odpowiada około 3 cm przemieszczenia, co wystarczy, żeby wpłynąć na precyzyjne chwytanie, wkładanie albo manipulację wymagającą kontaktu. Obietnice dotyczące szybkości obejmują logistykę i codzienne otoczenie człowieka i pochodzą z własnych testów MindOn.
Prace akademickie wskazują na koszt, który wskaźniki wykorzystania ukrywają. Referat przedstawiony na SOSP '26 28 września przez Prasoona Sinhę, Dimitriosa Liakopoulosa, Nathana Lemmę i Neeraję J. Yadwadkar opisuje EnerTune, system serwowania, który modeluje pobór mocy pojedynczego modelu i modeli współdzielących GPU. Autorzy podają redukcję energii od 1,4x do 2,3x i redukcję poboru mocy od 1,3x do 2,6x względem najlepszych znanych rozwiązań, przy zachowaniu wymaganych poziomów wydajności. Ich argument jest taki, że optymalizacja wyłącznie pod wykorzystanie może zwiększyć zużycie energii, a profilowanie każdej konfiguracji na dużą skalę pochłania zbyt dużo energii, żeby było praktyczne.
Gdzie faktycznie trafiają pieniądze, wciąż nie jest rozstrzygnięte. Light Reading podał 30 września, że StarHub i M1 rozmawiają o fuzji w Singapurze, a 2degrees i OneNZ w Nowej Zelandii zaproponowały połączenie swoich sieci radiowych. StarHub zastrzega, że negocjacje trwają. Light Reading zauważa, że połączone StarHub i M1 miałyby mniej więcej skalę Singtela, a Singtel miał w czerwcu 43% udziału w rynku komórkowym, M1 22%, StarHub 21%, a Simba 14%.
Jedna lekcja cenowa z tego samego tygodnia nie ma nic wspólnego z GPU. Pinecone usunęło swój kalkulator cen po tym, jak okazało się, że jedno błędnie zinterpretowane pole może zawyżyć szacunek nawet 1 000 razy, wynika z relacji Gkogana z 30 września. Odwiedzający, którzy nie widzieli kalkulatora, zapisywali się o 16% chętniej i o 90% częściej kontaktowali się z firmą, a liczba zgłoszeń do wsparcia w sprawie cen nie wzrosła. Siedmiu na dziesięciu pracowników oczekiwało, że wygra wersja z kalkulatorem.
Źródła
9- 01ChatGPT's new plan costs $500 a monthEN
- 02AI API Pricing Index - September 2026EN
- 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 04Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 06Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 07Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09The pricing calculator made people more confused about pricingEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.