Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Quail twierdzi, że wyciska miliard tokenów na minutę z jednego H100, a śledzenie cen GPU robi się ciasne

Modal i Full Stack Data Lab z Carnegie Mellon twierdzą, że ich silnik Quail przekroczył miliard tokenów na minutę przy zapytaniu AI-SQL z wieloma złączeniami na pojedynczym H100, ponad 10x powyżej bazowego vLLM. Wpis opublikowano 30 września.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 30 września 20265 min czytaniaŹródła 7
Quail twierdzi, że wyciska miliard tokenów na minutę z jednego H100, a śledzenie cen GPU robi się ciasne

Do tego twierdzenia dołączony jest rachunek: poniżej 6 centów za miliard tokenów na Modal, jak podaje blog firmy. Takie liczby decydują o tym, czy AI-SQL trafi do wdrożenia, czy po cichu wyląduje na półce, bo filtr na milionie wierszy to milion wywołań modelu.

Dwa wąskie gardła, dwie poprawki

Własny tekst Full Stack Data Lab z 24 września stawia problem w kategoriach bazy danych. Zapytanie łączące 5 000 raportów medycznych z 4 144 terminami reakcji rozrasta się do milionów osobnych żądań inferencji. Autorzy puścili je pojedynczo przez vLLM 0.26.0 z Qwen3 4B FP8 na jednym H100 i zajęło to 6,84 godziny. To 27,55x powyżej ich oszacowania roofline, które wynosi 894,37 sekundy, czyli 14,91 minuty. Autorzy wymieniają dwie przyczyny. Pierwsza to narzut hosta: CPU układa harmonogram żądań, a H100 w tym czasie stoi bezczynnie. Druga to żal po KV, gdy silnik wyrzuca stan klucz-wartość, którego później znowu potrzebuje. W tym teście przy współczynniku skali 1.0 vLLM przetworzył 174,6 miliona tokenów, których nie musiał.

Quail odpowiada, że trzeba najpierw spojrzeć na plan zapytania. Znając kształt złączeń, można ustawić żądania tak, by wspólne prefiksy zostały w pamięci podręcznej, i połączyć w partie pracę, którą silnik ogólnego przeznaczenia traktuje jako niepowiązaną. Wpis na blogu Modal opisuje to jako zmodyfikowaną wersję kaskadowej uwagi w stylu Hydragen. Oba zespoły nazywają projekt współpracą badaczy inferencji z Modal i grupy bazodanowej CMU.

W całym teście liczba jest skromniejsza: 1,84x szybciej niż vLLM, średnia geometryczna, w tym dwa zapytania zbudowane specjalnie po to, by pokazać, gdzie inferencja AI-SQL wciąż zawodzi.

Dane o cenach, które są pod spodem

Roszczenia o kosztach brzmią inaczej w zależności od tego, ile na starcie kosztuje godzina pracy GPU, a ta liczba zmienia się teraz co tydzień. GPUAdvisor śledzi 14 dostawców i podaje Hyperstack po 0,15 dolara za godzinę za A4000 16GB, Lium po 0,22 dolara za RTX 3090 i 0,38 dolara za L40S, a RunPod z RTX A5000 po 0,27 dolara na żądanie wobec 0,16 dolara w warstwie Community Cloud. Na jego stronie, ostatnio śledzonej 1 października, napisano wprost, że ceny GPU przestały być stabilną tabelą do sprawdzania.

FitMyLLM podchodzi do tego samego pytania od strony tokenów i przekonuje, że stawka godzinowa nic nie mówi bez liczby przepustowości. Jego bieżąca tabela odczytuje stawki z API dostawców co trzy minuty i szereguje je według kosztu miliona tokenów wyjściowych przy jednym strumieniu. Oferta RTX 3060 na Vast.ai wypada najtaniej, po 0,261 dolara za milion tokenów; RTX 5090 na Vast.ai daje 227 tokenów na sekundę i 0,576 dolara za milion. Serwis przyznaje otwarcie, że karty data center wypadają słabo w tym zestawieniu z założenia, bo H100 czy H200 zarabia na swoją cenę, obsługując wiele strumieni naraz, a te wiersze to szacunki, nie pomiary.

"Cena na giełdzie to oferta jednego hosta, nie publikowany cennik: może zniknąć, a host może trzymać kartę poniżej fabrycznego limitu mocy, co kosztuje szybkość, której cena nie pokazuje."

Dla kupujących API, a nie wynajmujących GPU, wrześniowy indeks AICostBudget zamraża 81 publicznych rekordów od 11 dostawców z datą odcięcia 2026-09-30. Mediana ceny wejścia to 1,32 dolara za milion tokenów, mediana wyjścia 6 dolarów, a mediana stosunku wyjścia do wejścia wynosi 5,0x. Rekordy z wejściem z pamięci podręcznej pokazują medianę 90% zniżki, a rekordy z ceną wsadową medianę 50%, odpowiednio w 58 i 44 porównywalnych wierszach. Indeks wyraźnie ostrzega, że jego mediany dostawców nie są ważonymi użyciem cenami rynkowymi i że nie twierdzi, jakoby cała branża notowała roczny spadek.

Wydajność przenosi się wyżej w stosie

Energia to następna pozycja w rachunku. Praca opublikowana na SOSP '26 28 września przez Prasoona Sinhę, Dimitriosa Liakopoulosa, Nathana Lemmę i Neeraję J. Yadwadkar przekonuje, że optymalizacja wyłącznie pod wykorzystanie GPU może podnieść zużycie energii. Ich system EnerTune korzysta z analitycznych modeli wydajności i mocy poszczególnych modeli, w tym poboru mocy modeli współlokowanych na wspólnym GPU, wewnątrz algorytmu pakowania uwzględniającego energię. Autorzy raportują, że dotrzymali SLO wydajności, obniżając energię 1,4x do 2,3x, a pobór mocy 1,3x do 2,6x wobec najlepszych znanych rozwiązań. Profilowanie każdej konfiguracji jest samo w sobie zbyt kosztowne w skali, dlatego modele są analityczne, a nie pomiarowe.

Inferencja na urządzeniu przedstawia ten sam argument z drugiej strony. Magnitude, firma z YC S25, która napisała o tym na Hacker News 30 września, udostępnia silnik open source na licencji Apache 2.0, który kompiluje i dostraja jądra na sprzęcie użytkownika, zanim model ruszy. W pliku README twierdzi, że jest do 2x szybszy niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA oraz o 27% mniejszym zużyciem pamięci na agenta. Zero kosztów tokenów, nic nie wychodzi z maszyny. Cena tego wyboru: działa na otwartych modelach na twoim GPU, nie na modelu frontier na cudzym.

Na co powinni patrzeć kupujący

Trzy liczby w tym zestawieniu wskazują w różne strony. Średnie przyspieszenie 1,84x w Quail jest prawdziwe, ale skromne przy nagłówku o miliardzie tokenów na minutę, i sami autorzy to mówią. Najtańsza zmierzona stawka FitMyLLM, 0,261 dolara za milion tokenów, dotyczy karty konsumenckiej, której większość zespołów produkcyjnych nie wdroży. Mediana ceny wyjścia 6 dolarów za milion tokenów w AICostBudget odzwierciedla cenniki katalogowe, a nie stawki z pamięci podręcznej czy wsadowe, które w rzeczywistości płaci większość dużych obciążeń.

Praktyczny wniosek: godzinowe stawki za GPU są dziś porównywaniem towaru, a różnice przeniosły się na przepustowość na dolara, zachowanie pamięci podręcznej i energię. Autorzy Quail mówią wprost, że to początek, nie koniec. Proszą o jedno, czego ich test sam nie dostarczy: realne obciążenia od zespołów uruchamiających AI-SQL na dużą skalę.

Komentarze 0

Źródła

7
  1. 01Quail: Speeding up AI-SQL by jointly optimizing query planner and inference engineEN
  2. 02Building an Ultra-High Throughput AI-SQL EngineEN
  3. 03Cloud GPU Pricing — Cost Intelligence for H100, A100 & B200EN
  4. 04Cloud GPU prices for LLM inference — cost per million tokensEN
  5. 05AI API Pricing Index — September 2026EN
  6. 06Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  7. 07Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.