Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Quail twierdzi, że przetwarza miliard tokenów na minutę na jednym GPU. Spór o koszty wnioskowania się zaostrza

Grupa badawcza twierdzi, że jej warstwa wnioskowania świadoma zapytań przetworzyła ponad miliard tokenów na minutę na pojedynczym GPU Nvidia H100, ponad 10 razy szybciej niż bazowy vLLM. To kolejna próba obniżenia kosztów uruchamiania dużych modeli językowych na dużą skalę. Wynik opublikowano 30 września, tego samego dnia, w którym OpenAI ogłosiło plan ChatGPT za 500 dolarów miesięcznie, a silnik open source obiecał dwukrotnie szybsze wnioskowanie lokalne.

AI i modeleWyjaśnienieAnna KaczmarekOpublikowano: 30 września 20265 min czytaniaŹródła 10
Quail twierdzi, że przetwarza miliard tokenów na minutę na jednym GPU. Spór o koszty wnioskowania się zaostrza

Liczby pochodzą z Full Stack Data Lab i firmy Modal, które 30 września opublikowały osobne teksty o systemie Quail, czyli QUery-Aware Inference Layer. Blog Modala podaje, że przy jednym zapytaniu z wieloma złączeniami Quail przetworzył ponad miliard tokenów na minutę na jeden GPU H100. To ponad 10 razy szybciej niż bazowy vLLM na tym samym sprzęcie. W chmurze Modal wychodzi mniej niż 6 centów za miliard tokenów.

Oba teksty opisują ten sam projekt z różnych stron. Wpis Full Stack Data Lab, datowany na 24 września, ale opublikowany na stronie 30 września, wyjaśnia problem. AI-SQL rozszerza SQL o funkcje wywołujące modele wiersz po wierszu, więc jeden filtr może oznaczać jedno wywołanie modelu na wiersz, a złączenie jedno wywołanie dla każdej pary wierszy. Zapytanie testowe laboratorium, BIO-4 z zestawu QUAIL-B, działa na ponad 5 000 raportów medycznych i 4 144 terminach reakcji.

Małe modele, ogromne wolumeny

Modal przedstawia AI-SQL jako cichszego krewnego boomu na agentów i chatboty. Jego przykładowe zapytanie złącza klientów i produkty z promptem pytającym, czy jeden kupi drugi. Takie zapytanie, pisze Modal, może wygenerować miliony sekwencji po tysiące tokenów, a te sekwencje często nie potrzebują inteligencji na najwyższym poziomie. Poradzą sobie z nimi małe modele o otwartych wagach. Wąskim gardłem nie jest jakość modelu, twierdzi Modal. Jest nim koszt dostarczenia milionów powiązanych żądań do silnika zbudowanego pod dowolny ruch kontrolowany przez użytkownika.

Quail planuje zapytanie SQL i obciążenie wnioskowaniem razem, zamiast traktować silnik jak zwykły endpoint. Modal podaje, że średnia geometryczna przyspieszenia względem vLLM w nowym zestawie testów AI-SQL wynosi 1,84 razy. To znacznie mniejsza wartość niż nagłówkowy przypadek miliarda tokenów na minutę. Firma wyraźnie mówi, że dwa zapytania w zestawie zaprojektowano tak, by pokazać obszary do przyszłej poprawy.

"Widzę to jako punkt na krzywej optymalnej Pareto dla LLM w reżimie, w którym ujawnił się duży ukryty popyt (bez myślenia, pojedynczy token, akceptowalna inteligencja przy niskim opóźnieniu), a w który inwestowano zbyt mało z powodu wyścigu o wyższą inteligencję."

Modal przypisuje ten cytat Karpathy'emu, opisując model Jev od TypeSafe AI. Ten sam tekst zauważa, że wielu dostawców baz danych oferuje już funkcje AI. Lista obejmuje Snowflake Cortex AISQL, funkcje AI w BigQuery, Databricks AI Functions i ostatnio MotherDuck.

Systemy akademickie atakują to samo marnotrawstwo. Full Stack Data Lab wymienia DocETL z UC Berkeley, LOTUS ze Stanford, Palimpzest z MIT i ThalamusDB z Cornell. Podaje też techniki takie jak MOAR, Task Cascades, Abacus i BARGAIN, które zmniejszają liczbę wywołań albo wybierają tańsze modele. Nawet wtedy, pisze laboratorium, plan może wciąż wymagać setek tysięcy lub milionów wywołań.

Cennik kontra struktura cen

Quail atakuje koszt zapytania, a niezależny przegląd opublikowany 30 września śledzi, ile liczą sobie dostawcy. AICostBudget AI API Pricing Index obejmuje 81 zamrożonych publicznych rekordów od 11 dostawców, z datą odcięcia 2026-09-30 UTC. Wśród 69 rekordów ze skalarem tokenów wejściowych zaobserwowany zakres cen wynosi od 0,10 do 30 dolarów za milion tokenów. Ceny wyjściowe rozciągają się od 0,10 do 180 dolarów. Mediana ceny wejściowej to 1,32 dolara, a mediana ceny wyjściowej 6 dolarów, czyli stosunek 5,0 razy.

Indeks podnosi kwestię istotną dla każdego, kto modeluje wydatki na wnioskowanie: ceny pamięci podręcznej i wsadowe to nie błędy zaokrągleń. Wśród 58 porównywalnych rekordów mediana rabatu na wejście z pamięci podręcznej wynosi 90%. Wśród 44 rekordów obsługujących tryb wsadowy mediana rabatu wsadowego to 50%. Porównanie obciążeń, które pomija jedno i drugie, mówi raport, pomija publikowane tryby oszczędności dla dużej części śledzonych rekordów. Mediany na poziomie dostawców w przeglądzie obejmują OpenAI z 2 dolarami za wejście i 11 za wyjście w 18 rekordach, Google Gemini z 0,75 i 4,125 w 14 oraz Anthropic z 5 i 25 w 13. Pojawiają się też Mistral AI, DeepSeek, Cohere i Moonshot AI.

Ceny dla użytkowników końcowych poszły tego samego dnia w przeciwną stronę. Business Insider podał, że OpenAI ogłosiło na wtorkowym DevDay nowy plan Pro 500 za 500 dolarów miesięcznie, o 300 dolarów drożej niż poprzedni najwyższy plan. W zestawie jest dostęp do mocy obliczeniowej "Ultrafast" dla GPT-6 Astra w ChatGPT Work i Codex oraz obietnica 8-krotnego przyspieszenia dla Codex. OpenAI ponownie otworzyło też plan Pro za 200 dolarów, jednocześnie zmniejszając jego limit mocy obliczeniowej o połowę, do 10 razy planu Plus za 20 dolarów, z 20 razy. Liczbę wiadomości w czacie GPT-6 Pro ścięło z 200 do 100 na tydzień. Thibault Sottiaux, szef inżynierii Codex, napisał w poniedziałkowym wpisie na X, że zmiany dają o połowę mniejszy wydatek w API niż poprzedni plan.

Po stronie sprzętu obraz jest mniej uporządkowany. Wpis o premierze Magnitude, firmy z YC S25, na GitHubie twierdzi, że jej silnik open source dostraja jądra na urządzeniu użytkownika i uruchamia otwarte modele do 2 razy szybciej niż llama.cpp. Podaje 92% szybsze dekodowanie na Metal i 19% na CUDA oraz 27% mniej pamięci na agenta. To testy producenta, nie niezależne, a wpis nie podaje weryfikacji zewnętrznej.

Osobno artykuł z SOSP '26 "Beyond Utilization" autorstwa Prasoona Sinhy, Dimitriosa Liakopoulosa, Nathana Lemmy i Neerai J. Yadwadkar przekonuje, że optymalizowanie klastrów GPU wyłącznie pod wykorzystanie może podnieść zużycie energii. Przedstawia system EnerTune, który według autorów zmniejsza energię 1,4-2,3 razy, a pobór mocy 1,3-2,6 razy względem najlepszych znanych rozwiązań. Artykuł opublikowano 28 września. 30 września CleanTechnica opisała analizę Transport & Environment, z której wynika, że kierowcy aut elektrycznych w Europie płacą za kilometr mniej niż połowę tego, co kierowcy diesli, przy cenie diesla o 32 euro wyższej za bak niż na początku roku, z czego około 16 euro to dodatkowa marża rafineryjna.

Komentarze 0

Źródła

10
  1. 01Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  2. 02Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  3. 03AI API Pricing Index - September 2026EN
  4. 04ChatGPT's new plan costs $500 a monthEN
  5. 05Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08Mind-1: Cutting robot inference latency from 82ms to 32msEN
  9. 09The pricing calculator made people more confused about pricingEN
  10. 10Singapore, New Zealand operators seek partnerships to cut costsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.