Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Silniki wnioskowania open source obniżają koszty AI-SQL i agentów, pokazują benchmarki

Dwa projekty open source do wnioskowania opublikowały 30 września benchmarki, w których twierdzą, że mocno obniżają koszt uruchamiania obciążeń AI. Osobny indeks cenowy podał medianę ceny tokenu wyjściowego na 6 dolarów za milion.

AI i modeleWyjaśnienieMarta ZielińskaOpublikowano: 30 września 20263 min czytaniaŹródła 5
Silniki wnioskowania open source obniżają koszty AI-SQL i agentów, pokazują benchmarki

30 września Modal i Full Stack Data Lab z Carnegie Mellon University pokazały Quail. To silnik wnioskowania, który optymalizuje razem planowanie zapytań SQL i wykonanie LLM. Według bloga Modal Quail przetwarza ponad miliard tokenów na minutę na jednym GPU H100. To ponad 10x szybciej niż bazowy vLLM na tym samym sprzęcie. Na infrastrukturze Modal daje to poniżej 6 centów za miliard tokenów.

Blog Full Stack Data Lab wyszedł 24 września i wypłynął razem z wpisem Modal. Wyjaśnia problem. AI-SQL rozszerza SQL o funkcje, które wywołują LLM dla każdego wiersza, więc jedno zapytanie filtrujące może uruchomić setki tysięcy albo miliony wywołań modelu. Lab wymienia Snowflake Cortex AISQL, BigQuery AI functions, Databricks AI Functions i ostatnio MotherDuck jako źródła wsparcia.

Quail jest najnowszym z kilku twierdzeń o wydajności w tym tygodniu. 30 września na GitHubie ruszył projekt open source Magnitude. Opisuje silnik wnioskowania dla agentów, który kompiluje i dostraja kernele na sprzęcie użytkownika. W pliku README deklaruje szybkość dekodowania do 2x wyższą niż llama.cpp, z dekodowaniem szybszym o 92% na Metal i o 19% na CUDA oraz o 27% mniejszym zużyciem pamięci na agenta. Magnitude działa na Apple Silicon, NVIDIA, AMD albo samym CPU. Łączy się z Pi, OpenCode, Hermes i Codex jednym kliknięciem.

Na jednym zapytaniu z wieloma złączeniami, gdzie planowanie ma szczególne znaczenie, Quail osiąga ponad miliard przetworzonych tokenów na minutę na GPU H100 (TPM/GPU), ponad 10x szybciej niż nasz bazowy vLLM na tym samym sprzęcie.

Oba projekty atakują różne wąskie gardła. Magnitude celuje w lokalne obciążenia agentów, gdzie ograniczeniem jest dopasowanie kerneli do układów konsumenckich albo stacji roboczych. Quail celuje w obciążenia bazodanowe, gdzie ograniczeniem jest narzut hosta i usuwanie wpisów z KV cache. Full Stack Data Lab zmierzył bazowy vLLM na BIO-4, zapytaniu do raportu medycznego, na 6,84 godziny. To 27,55x jego własnego szacunku granicy szybkości wynoszącego 14,91 minuty.

W tle zostaje ekonomia sprzętu. Praca przedstawiona na SOSP '26 i opublikowana 30 września opisuje EnerTune, system współdzielenia GPU. Autorzy twierdzą, że obniża zużycie energii od 1,4 do 2,3 razy, a pobór mocy od 1,3 do 2,6 razy względem najlepszych znanych rozwiązań, przy zachowaniu celów wydajnościowych SLO. Autorzy przekonują, że optymalizacja wyłącznie pod wykorzystanie GPU może podnieść zużycie energii. Mówią też, że profilowanie każdej konfiguracji na dużą skalę jest zbyt drogie.

Ceny katalogowe wciąż rozstrzelone

Po stronie cen AICostBudget opublikował 30 września swój wrześniowy indeks. Opiera się na 81 zamrożonych publicznych zapisach cenowych od 11 dostawców. Mediana ceny wejściowej to 1,32 dolara za milion tokenów, a mediana ceny wyjściowej 6 dolarów, czyli stosunek 5,0x. Zaobserwowany zakres sięga od 0,10 do 30 dolarów za milion na wejściu i od 0,10 do 180 dolarów na wyjściu.

Indeks podaje medianę zniżki na pamięć podręczną wejścia na poziomie 90% w 58 porównywalnych zapisach. Podaje medianę zniżki Batch na poziomie 50% w 44 zapisach. Według mediany ceny wejściowej u dostawcy najniżej jest Mistral AI z 0,20 dolara. DeepSeek ma 0,30 dolara, Google Gemini 0,75 dolara, Moonshot AI 0,95 dolara, xAI 1,25 dolara, Cohere 1,50 dolara, OpenAI 2 dolary, a Anthropic 5 dolarów.

Nie każdy zapis da się wprost porównać. AICostBudget mówi, że 17 zapisów używa cen progowych albo dla długiego kontekstu, a 13 składników innych niż tokeny, takich jak strony dokumentów czy czas trwania sesji. Te są wyłączone z median tokenowych. Zaznacza też, że jego okno obserwacji zaczyna się w lipcu 2026 i nie twierdzi, że ceny spadają w całej branży rok do roku.

Koszt inżynieryjny braku optymalizacji widać w liczbach Quail. Lab podaje, że vLLM przetworzył 174 600 000 tokenów, których nie potrzebował, na BIO-4, z powodu KV regret, a planowanie CPU zostawiło H100 bezczynne. To właśnie te luki Magnitude i Quail próbują zamknąć, z przeciwnych końców stosu.

Komentarze 0

Źródła

5
  1. 01Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Launch HN: Magnitude (YC S25) - Self-optimizing inference engine for agentsEN
  4. 04AI API pricing index - September 2026EN
  5. 05Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.