Silniki wnioskowania open source obniżają koszty AI-SQL i agentów, pokazują benchmarki
Dwa projekty open source do wnioskowania opublikowały 30 września benchmarki, w których twierdzą, że mocno obniżają koszt uruchamiania obciążeń AI. Osobny indeks cenowy podał medianę ceny tokenu wyjściowego na 6 dolarów za milion.

30 września Modal i Full Stack Data Lab z Carnegie Mellon University pokazały Quail. To silnik wnioskowania, który optymalizuje razem planowanie zapytań SQL i wykonanie LLM. Według bloga Modal Quail przetwarza ponad miliard tokenów na minutę na jednym GPU H100. To ponad 10x szybciej niż bazowy vLLM na tym samym sprzęcie. Na infrastrukturze Modal daje to poniżej 6 centów za miliard tokenów.
Blog Full Stack Data Lab wyszedł 24 września i wypłynął razem z wpisem Modal. Wyjaśnia problem. AI-SQL rozszerza SQL o funkcje, które wywołują LLM dla każdego wiersza, więc jedno zapytanie filtrujące może uruchomić setki tysięcy albo miliony wywołań modelu. Lab wymienia Snowflake Cortex AISQL, BigQuery AI functions, Databricks AI Functions i ostatnio MotherDuck jako źródła wsparcia.
Quail jest najnowszym z kilku twierdzeń o wydajności w tym tygodniu. 30 września na GitHubie ruszył projekt open source Magnitude. Opisuje silnik wnioskowania dla agentów, który kompiluje i dostraja kernele na sprzęcie użytkownika. W pliku README deklaruje szybkość dekodowania do 2x wyższą niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA oraz o 27% mniejszym zużyciem pamięci na agenta. Magnitude działa na Apple Silicon, NVIDIA, AMD albo samym CPU. Łączy się z Pi, OpenCode, Hermes i Codex jednym kliknięciem.
Na jednym zapytaniu z wieloma złączeniami, gdzie planowanie ma szczególne znaczenie, Quail osiąga ponad miliard przetworzonych tokenów na minutę na GPU H100 (TPM/GPU), ponad 10x szybciej niż nasz bazowy vLLM na tym samym sprzęcie.
Oba projekty atakują różne wąskie gardła. Magnitude celuje w lokalne obciążenia agentów, gdzie ograniczeniem jest dopasowanie kerneli do układów konsumenckich albo stacji roboczych. Quail celuje w obciążenia bazodanowe, gdzie ograniczeniem jest narzut hosta i usuwanie wpisów z KV cache. Full Stack Data Lab zmierzył bazowy vLLM na BIO-4, zapytaniu do raportu medycznego, na 6,84 godziny. To 27,55x jego własnego szacunku granicy szybkości wynoszącego 14,91 minuty.
W tle zostaje ekonomia sprzętu. Praca przedstawiona na SOSP '26 i opublikowana 30 września opisuje EnerTune, system współdzielenia GPU. Autorzy twierdzą, że obniża zużycie energii od 1,4 do 2,3 razy, a pobór mocy od 1,3 do 2,6 razy względem najlepszych znanych rozwiązań, przy zachowaniu celów wydajnościowych SLO. Autorzy przekonują, że optymalizacja wyłącznie pod wykorzystanie GPU może podnieść zużycie energii. Mówią też, że profilowanie każdej konfiguracji na dużą skalę jest zbyt drogie.
Ceny katalogowe wciąż rozstrzelone
Po stronie cen AICostBudget opublikował 30 września swój wrześniowy indeks. Opiera się na 81 zamrożonych publicznych zapisach cenowych od 11 dostawców. Mediana ceny wejściowej to 1,32 dolara za milion tokenów, a mediana ceny wyjściowej 6 dolarów, czyli stosunek 5,0x. Zaobserwowany zakres sięga od 0,10 do 30 dolarów za milion na wejściu i od 0,10 do 180 dolarów na wyjściu.
Indeks podaje medianę zniżki na pamięć podręczną wejścia na poziomie 90% w 58 porównywalnych zapisach. Podaje medianę zniżki Batch na poziomie 50% w 44 zapisach. Według mediany ceny wejściowej u dostawcy najniżej jest Mistral AI z 0,20 dolara. DeepSeek ma 0,30 dolara, Google Gemini 0,75 dolara, Moonshot AI 0,95 dolara, xAI 1,25 dolara, Cohere 1,50 dolara, OpenAI 2 dolary, a Anthropic 5 dolarów.
Nie każdy zapis da się wprost porównać. AICostBudget mówi, że 17 zapisów używa cen progowych albo dla długiego kontekstu, a 13 składników innych niż tokeny, takich jak strony dokumentów czy czas trwania sesji. Te są wyłączone z median tokenowych. Zaznacza też, że jego okno obserwacji zaczyna się w lipcu 2026 i nie twierdzi, że ceny spadają w całej branży rok do roku.
Koszt inżynieryjny braku optymalizacji widać w liczbach Quail. Lab podaje, że vLLM przetworzył 174 600 000 tokenów, których nie potrzebował, na BIO-4, z powodu KV regret, a planowanie CPU zostawiło H100 bezczynne. To właśnie te luki Magnitude i Quail próbują zamknąć, z przeciwnych końców stosu.
Źródła
5- 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
- 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
- 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
- 04AI API pricing index - September 2026EN
- 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.