Quail twierdzi, że przetwarza miliard tokenów na minutę na jednym H100, a ceny wnioskowania się rozjeżdżają
Dwa nowe silniki wnioskowania obiecują nawet dziesięciokrotny wzrost wydajności na tym samym sprzęcie GPU, a jednocześnie nowa subskrypcja OpenAI za 500 dolarów i wrześniowy przegląd cen pokazują, że rynek rozliczeń za token wciąż idzie w dwóch różnych kierunkach.

30 września Full Stack Data Lab opublikowało wpis o Quailu, silniku wnioskowania zbudowanym specjalnie dla AI-SQL, czyli rozszerzeń SQL, które pozwalają zapytaniom wywoływać duże modele językowe wiersz po wierszu. Zespół twierdzi, że na pojedynczym GPU H100 przetwarza ponad miliard tokenów na minutę w ramach jednego zapytania z wieloma złączeniami. Podaje też 1,84-krotne przyspieszenie średniej geometrycznej względem vLLM na nowym zestawie testów dla obciążeń AI-SQL.
To liczba z nagłówka. Jest też wąska.
Miliard tokenów na minutę pochodzi z jednego zapytania, które zespół opisuje jako takie, w którym „planowanie jest szczególnie ważne”, a nie ze średniej. Szerszy wynik testu, 1,84x, autorzy przedstawiają jako ogólny rezultat. Tego samego dnia Magnitude, spółka z Y Combinator S25, wypuściła otwarty silnik wnioskowania, który według niej dostraja swoje jądra na sprzęcie użytkownika przed uruchomieniem modelu. W pliku README na GitHubie firma podaje do 2x szybciej niż llama.cpp, z dekodowaniem szybszym o 92% na Apple Metal i o 19% na CUDA oraz o 27% mniejszym zużyciem pamięci na agenta. Projekt jest na licencji Apache 2.0 i działa na Apple Silicon, NVIDIA, AMD albo samym CPU.
Co właściwie porównują te liczby
Żadne z tych twierdzeń nie jest ogólnym stwierdzeniem o cenie wnioskowania. Magnitude porównuje się z llama.cpp, silnikiem ogólnego przeznaczenia, a swoją przewagę przypisuje ręcznie pisanym jądrom dla popularnych rodzin otwartych modeli. Quail porównuje się z vLLM i swoją przewagę przypisuje wspólnej optymalizacji planu zapytania SQL i silnika wnioskowania. Dzięki temu miliony powiązanych wywołań modelu dzielą pamięć podręczną prefiksów, zamiast przychodzić jako osobne żądania.
Wpis Full Stack Data Lab z 24 września opisuje problem kosztów wprost. Funkcja AI w zapytaniu SQL oblicza swój prompt dla każdego wiersza, więc filtr potrzebuje jednego wywołania LLM na wiersz. Naiwne złączenie potrzebuje jednego wywołania dla każdej pary wierszy ze swoich dwóch wejść.
Zapytanie testowe zespołu, BIO-4, działa na ponad 5 000 długich raportów medycznych złączonych z 4 144 terminami reakcji. Autorzy twierdzą, że wysyłanie tych wywołań do silnika ogólnego przeznaczenia jako osobnych żądań wiąże się z dużym kosztem. Ich rozwiązaniem jest planowanie na poziomie zapytania. Blog Modala o tej samej pracy ujmuje ekonomię dosadniej: poniżej 6 centów za miliard tokenów na sprzęcie Modala dla zapytania o przepustowości miliarda tokenów na minutę. To liczba samego dostawcy dla jego własnej platformy i dotyczy jednego kształtu zapytania, a nie reprezentatywnego obciążenia.
Różne zastosowania wnioskowania tworzą różne obciążenia, a AI-SQL nie jest tu wyjątkiem. Zapytanie takie jak powyższe może wygenerować miliony sekwencji po tysiące tokenów.
Ceny subskrypcji idą w drugą stronę
Po stronie konsumenckiej OpenAI poszło w przeciwnym kierunku. Na wtorkowym DevDay firma ogłosiła plan Pro 500 za 500 dolarów miesięcznie, o 300 dolarów droższy niż jej poprzedni najwyższy plan, jak podaje Business Insider. Plan obejmuje dostęp do mocy obliczeniowej „Ultrafast” dla GPT-6 Astra w ChatGPT Work i Codex, co według OpenAI oznacza 8-krotny wzrost szybkości w Codexie, oraz najwyższy w ofercie limit zużycia.
OpenAI przywróciło też plan Pro za 200 dolarów, ale o połowę zmniejszyło limit obliczeń.
Limit wynosi teraz 10x planu Plus za 20 dolarów, wcześniej było to 20x, a liczba wiadomości w czacie GPT-6 Pro spada ze 200 do 100 na tydzień. Thibault Sottiaux, inżynier prowadzący Codex, napisał w poniedziałkowym wpisie na X, że zmiany dają w sumie połowę wydatków na API w dolarach względem poprzedniego planu. „Chciałem podzielić się tą zmianą z wyprzedzeniem, żebyście wszyscy mogli ją zrozumieć, zanim zasypiemy was dobrymi wiadomościami” — napisał, cytowany przez Business Insider. Oba ruchy wskazują w przeciwne strony: tańszy limit na poziomie 200 dolarów i znacznie droższy plan na szczycie. Obecni subskrybenci Pro dostają jednorazowy kredyt w okresie przejściowym.
Osobny przegląd opublikowany 30 września przez AICostBudget obejmuje 81 publicznych cenników od 11 dostawców i podaje medianę wejścia na 1,32 dolara oraz medianę wyjścia na 6 dolarów za milion tokenów. Zaobserwowany zakres w 69 rekordach ze skalarem wejścia to od 0,10 do 30 dolarów, a dla wyjścia od 0,10 do 180 dolarów. Wyjście jest zwykle droższym składnikiem ceny katalogowej, a mediana stosunku wyjścia do wejścia wynosi 5,0x.
Ten sam zbiór danych podaje medianę zniżki na wejście z pamięci podręcznej na poziomie 90% w 58 porównywalnych rekordach i medianę zniżki na wejście w trybie Batch na poziomie 50% w 44 rekordach. To ta część rynku, na której cena efektywna może mocno odbiegać od ceny katalogowej, i ta, którą naiwne porównanie kosztów zwykle pomija.
Sprzęt, energia i reszta stosu
Praca nad wydajnością to nie tylko tokeny na sekundę. Referat przedstawiony na SOSP '26 28 września opisuje EnerTune, system serwowania, który modeluje pobór mocy poszczególnych modeli oraz modeli współdzielących te same GPU, a potem używa algorytmu pakowania z uwzględnieniem energii, żeby je rozmieszczać i konfigurować. Autorzy podają od 1,4x do 2,3x niższe zużycie energii i od 1,3x do 2,6x niższy pobór mocy niż najlepsze znane rozwiązania, przy zachowaniu celów wydajnościowych SLO. Ich argument: optymalizacja wyłącznie pod wykorzystanie sprzętu może zwiększać zużycie energii, a to ma znaczenie, gdy rachunek nie jest tylko za tokeny.
Po stronie robotyki MindOn zaprezentowało 30 września Mind-1, model fizycznej AI, który według firmy skraca opóźnienie wnioskowania robota z 82 ms do 32 ms.
Firma zauważa, że przy prędkości efektora końcowego 3 m/s opóźnienie 10 ms odpowiada mniej więcej 3 cm ruchu, czyli dość, by wpłynąć na precyzyjne chwytanie. To inny rynek niż wnioskowanie w centrach danych, ale ograniczenie jest to samo: opóźnienie i koszt wyznacza cały potok przetwarzania, nie sam model.
Operatorzy telekomunikacyjni kierują się podobną logiką w kosztach infrastruktury. Light Reading podał 30 września, że StarHub i M1 prowadzą rozmowy o fuzji w Singapurze, gdzie już współdzielą pasmo 5G i sieć dostępu radiowego przez spółkę joint venture o nazwie Antina. W Nowej Zelandii 2degrees i OneNZ zaproponowały połączenie swoich sieci radiowych w spółkę o wspólnej własności. Artykuł przytacza podany przez Singtel udział 43% w singapurskim rynku komórkowym w czerwcu, wobec 22% dla M1, 21% dla StarHub i 14% dla Simby, i pisze, że połączone StarHub i M1 miałyby skalę zbliżoną do Singtel. Porozumienie 5G China Telecom i China Unicom jest podane jako największa tego typu umowa o współdzieleniu. Obejmuje 1 500 000 stacji bazowych, a deklarowane oszczędności to 56 000 000 000 dolarów nakładów inwestycyjnych.
Nie każda próba obniżenia kosztów przez dodanie mechanizmów się udaje. Wpis opublikowany 30 września przez Gokula Kogana opisuje, jak Pinecone usunęło kalkulator cen oparty na zużyciu po testach A/B. Odwiedzający, którzy nie widzieli kalkulatora, o 16% częściej się rejestrowali i o 90% częściej kontaktowali się z firmą, bez wzrostu liczby zgłoszeń do działu wsparcia dotyczących cen, jak podaje wpis. W wewnętrznym głosowaniu siedmiu na dziesięciu pracowników spodziewało się, że wersja z kalkulatorem wypadnie lepiej. To przestroga dla każdego, kto buduje estymator kosztów dla usługi rozliczanej za tokeny: szacunek mylący się o rząd wielkości może całkowicie odstraszyć klienta.
Złożone razem, to obraz nie tyle jednej spadającej ceny, ile zestawu inżynierskich zakładów. Quail stawia na grupowanie zapytań ze świadomością ich treści. Magnitude na kompilację jąder pod konkretne urządzenie. EnerTune na rozmieszczanie z uwzględnieniem mocy. OpenAI sprawdza, ile zapłaci niewielu ciężkich użytkowników za szybkość, a jego tańszy plan dostaje mniej mocy obliczeniowej niż wcześniej. Jedyna liczba stała w całym zestawieniu to kształt rachunku: tokeny wyjściowe kosztują więcej niż wejściowe, zniżki za pamięć podręczną i tryb Batch są duże, a liczby z nagłówków dowolnego pojedynczego testu opisują jedno zapytanie, na jednej maszynie, jednego dnia.
Źródła
10- 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04ChatGPT's new plan costs $500 a monthEN
- 05AI API pricing index - September 2026EN
- 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
- 07Mind-1: Cutting robot inference latency from 82ms to 32msEN
- 08Singapore, New Zealand operators seek partnerships to cut costsEN
- 09The pricing calculator made people more confused about pricingEN
- 10Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.