Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Koszt wnioskowania trafia do centrum stosu AI. Nowe silniki już są

Magnitude, startup z programu Y Combinator S25, opublikował 30 września w GitHubie swój otwarty silnik wnioskowania. Firma twierdzi, że modele otwarte działają na nim do 2 razy szybciej niż na llama.cpp na tym samym sprzęcie.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 30 września 20267 min czytaniaŹródła 9
Koszt wnioskowania trafia do centrum stosu AI. Nowe silniki już są

Repozytorium Magnitude pojawiło się 30 września o 17:37 UTC, wynika z wpisu na GitHubie. Propozycja jest wąska i konkretna: silnik wnioskowania dla agentów, który kompiluje i dostraja kernele na urządzeniu, na którym pracuje. Firma podaje, że daje to do 2 razy lepszą wydajność niż llama.cpp, z dekodowaniem szybszym o 92% na backendzie Metal Apple i o 19% na CUDA.

To benchmark producenta. Nikt spoza Magnitude go jeszcze nie powtórzył. Repozytorium nie podaje modeli, długości promptów ani rozmiarów batcha, na których powstały te liczby. Traktujcie 2x jako liczbę marketingową, dopóki ktoś niezależny tego nie uruchomi.

Ważniejsze jest to, w co firma celuje. Magnitude mówi, że dostarcza aplikację desktopową, która łączy się z agentami, których ludzie już używają: Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi i Cline. Wszystko inne przechodzi przez API zgodne z OpenAI. Silnik działa na Apple Silicon, układach NVIDIA lub AMD albo na samym procesorze, podaje repozytorium. Magnitude twierdzi też, że zużywa o 27% mniej pamięci na agenta, zwalnianej, gdy agenci kończą pracę, a sesje współdzielą pamięci podręczne prefiksów, żeby uniknąć spowolnień przy współbieżności.

Ten sam tydzień, inna warstwa stosu

Dwie godziny później, tego samego 30 września, pojawiło się drugie wydanie. Full Stack Data Lab opublikowało wpis o Quail, warstwie wnioskowania świadomej zapytań, zbudowanej z Modalem, a Modal wystawił swój własny tekst 17:38 UTC tego samego dnia. Quail uderza w AI-SQL, czyli praktykę wywoływania modeli językowych wiersz po wierszu z wnętrza zapytań SQL.

Liczby są duże, a diagnoza bez ogródek. Full Stack Data Lab podaje, że pojedyncze zapytanie może wygenerować setki tysięcy albo miliony wywołań modelu, bo funkcja AI ocenia jeden prompt na wiersz, a naiwne złączenie ocenia jeden prompt na parę wierszy. Na zapytaniu benchmarkowym o nazwie BIO-4, które łączy 5 000 raportów medycznych z 4 144 terminami reakcji, laboratorium rozpisuje koszt wysłania tych wywołań do silnika ogólnego przeznaczenia, takiego jak vLLM, jako osobnych żądań.

Wpis Modala podaje wynik: Quail przetwarza ponad miliard tokenów na minutę na jeden GPU H100 w ramach jednego zapytania z wieloma złączeniami, ponad 10 razy szybciej niż jego baza vLLM na tym samym sprzęcie, poniżej 6 centów za miliard tokenów na Modalu. W nowo opublikowanym benchmarku Modal podaje, że Quail działa 1,84 razy szybciej niż vLLM, licząc średnią geometryczną po zadaniach. Zaznacza, że zbiór zawiera dwa zapytania pokazujące, gdzie wnioskowanie AI-SQL wciąż wymaga pracy.

Widzę w tym punkt na krzywej optymalnej Pareto dla LLM w reżimie, w którym ujawnił się duży ukryty popyt (brak myślenia, pojedynczy token, akceptowalna inteligencja przy niskich opóźnieniach), a inwestowano w niego za mało z powodu wyścigu o wyższą inteligencję. Karpathy-san, o Jev

Ten cytat pojawia się we wpisie Modala, przypisany tam Karpathy'emu, jako komentarz do modelu Jev od TypeSafe AI. Warto przeczytać go uważnie. Argument jest taki, że spory kawał popytu na wnioskowanie leży na tanim końcu o niskich opóźnieniach i był obsługiwany słabo, bo laboratoria goniły za możliwościami frontierowymi. I Magnitude, i Quail to zakłady na tę lukę.

Żaden z tych tekstów nie przeszedł recenzji. Oba to blogi firm towarzyszące wydaniom kodu, a bazy porównawcze, jedna z llama.cpp, druga z vLLM, wybrali sami autorzy. Kierunek jest spójny, ale wielkości nie powinny być traktowane jako rozstrzygnięte.

Co mówi prąd i cennik

Praca naukowa opublikowana w tym tygodniu wskazuje na pokrewny problem, którego szybsze tokeny same nie rozwiążą. Artykuł przedstawiony na SOSP '26, datowany na 28 września i odnotowany w materiałach ACM, dowodzi, że optymalizowanie klastrów GPU wyłącznie pod wykorzystanie może zwiększyć zużycie energii. Autorzy, Prasoon Sinha, Dimitrios Liakopoulos, Nathan Lemma i Neeraja J. Yadwadkar, opisują system EnerTune, który modeluje wydajność i moc dla każdego modelu analitycznie, zamiast profilować każdą konfigurację, i odpowiednio upycha modele na współdzielonych GPU. Podają, że zmniejszyli zużycie energii od 1,4 do 2,3 razy, a pobór mocy od 1,3 do 2,6 razy względem najlepszych baz, wciąż spełniając cele wydajnościowe.

Jest jeszcze strona cennikowa. AICostBudget opublikował 30 września swój wrześniowy indeks cen, zamrożony zapis z odcięciem na 2026-09-30 UTC, obejmujący 81 publicznych rekordów cenowych od 11 dostawców. Mediana ceny wejścia w 69 rekordach to 1,32 dolara za milion tokenów, a mediana ceny wyjścia to 6 dolarów za milion, czyli stosunek 5,0x. Większym składnikiem rachunku jest zwykle cena wyjścia, nie przyjmowanie promptu.

Ten indeks podważa też częsty skrót w rozmowach o kosztach. Z 58 porównywalnych rekordów wejścia z pamięcią podręczną mediana rabatu wynosi 90%. Z 44 rekordów z ceną batchową mediana rabatu to 50%. Każde porównanie obciążeń, które pomija pamięć podręczną i ceny batchowe, opisuje rachunek, którego większość klientów nigdy nie zobaczy, i indeks mówi to wprost. Po stronie dostawców jego mediany zaczynają się od Mistral AI przy 0,20 dolara za wejście i 0,60 za wyjście za milion tokenów w 7 rekordach oraz DeepSeek przy 0,30 i 1,20 w 3 rekordach, aż po Anthropic przy 5 i 25 w 13 rekordach i OpenAI przy 2 i 11 w 18. To mediany publicznych cen katalogowych, nie cen efektywnych po rabatach, a zbiory różnią się wielkością, więc nie jest to ranking modeli jak za jak.

Szybkość to tylko jeden z kosztów

Poza centrum danych opóźnienie ma wymierny koszt fizyczny. MindOn przedstawił 30 września swój model fizyczny Mind-1, twierdząc, że skraca opóźnienie wnioskowania robota z 82ms do 32ms i sprowadza zadania manipulacji do czasów cyklu na poziomie człowieka. Najbardziej użyteczne jest wyjaśnienie samej firmy, dlaczego to ma znaczenie: przy prędkości efektora 3 metry na sekundę 10ms opóźnienia odpowiada mniej więcej 3cm ruchu, co wystarczy, żeby zaburzyć precyzyjne chwytanie albo wkładanie. MindOn wskazuje też na problem z danymi, zauważając, że dużo danych o manipulacji robotów pochodzi z teleoperacji wolniejszej niż naturalny ruch człowieka, więc modele uczą się wolniejszego tempa razem z zadaniem.

W tym samym oknie jest historia kosztów dla konsumenta. CleanTechnica podała 29 września, że analiza Transport & Environment wycenia koszty eksploatacji auta elektrycznego na mniej niż połowę kosztów diesla za kilometr w Europie, na podstawie średniego zużycia 6,9 litra na 100km dla diesla i 20,2 kWh na 100km dla bateryjnego auta elektrycznego, przy cenie prądu 0,343 euro za kWh. Antony Froggatt z T&E powiedział we wpisie, że kierowcy diesli płacą 32 euro więcej za bak niż na początku roku, i ostrzegł przed ryzykiem dostaw, jeśli USA zablokują eksport diesla. T&E zaznacza, że jego szacunek kosztu ładowania jest prawdopodobnie górną granicą.

A sama strona z cennikiem też może być kosztem. Opis z pierwszej osoby, opublikowany 30 września przez Gokhana Kogana o jego czasie w Pinecone, podaje, że kalkulator zużycia na stronie z cennikiem dawał szacunki zawyżone nawet 1 000 razy po jednym błędnie zinterpretowanym inpucie. W teście A/B, pisze, odwiedzający, którzy nie widzieli kalkulatora, zapisywali się o 16% chętniej i o 90% chętniej kontaktowali się z firmą, bez wzrostu liczby zgłoszeń do działu cen. Zaznacza też, że 7 na 10 pracowników zapytanych wewnętrznie spodziewało się lepszych wyników wersji z kalkulatorem. To doświadczenie jednej firmy, nie ogólne prawo, ale przypomnienie, że postrzegany koszt i koszt rzeczywisty łatwo się rozjeżdżają.

Ekonomika przepustowości zmienia się też w warstwie sieci. Light Reading podał 30 września, że StarHub i M1 rozmawiają o fuzji w Singapurze, gdzie już dzielą widmo 5G i sieć radiową przez wspólną spółkę Antina. Singtel miał w czerwcu 43% rynku komórkowego, M1 22%, StarHub 21%, a Simba 14%, wynika z doniesienia. W Nowej Zelandii 2degrees i OneNZ zaproponowały połączenie swoich sieci radiowych, a decyzja Komisji Handlu spodziewana jest w przyszłym roku.

Nie chodzi o to, że wnioskowanie zaraz będzie darmowe. Chodzi o to, że optymalizacje z tego tygodnia celują w konkretne wąskie gardła: szybkość dekodowania agentów na sprzęcie konsumenckim, wywołania SQL wiersz po wierszu i moc bezczynnych GPU. Każda ma własny benchmark i własnego dostawcę. Indeks cen sugeruje, że same ceny katalogowe niewiele się ruszyły. Oszczędności sprzedaje się na poziomie silnika, a kupujący będą musieli przetestować je na własnych obciążeniach.

Komentarze 0

Źródła

9
  1. 01Launch HN: Magnitude (YC S25) – Self-optimizing inference engine for agentsEN
  2. 02Jointly optimizing SQL queries and LLM inference for up to 14x speedupsEN
  3. 03Hitting 1B tokens/minute on 1 GPU combining a query planner and inference engineEN
  4. 04AI API pricing index - September 2026EN
  5. 05Mind-1: Cutting robot inference latency from 82ms to 32msEN
  6. 06The pricing calculator made people more confused about pricingEN
  7. 07Driving An EV Now Costs Half As Much As Diesel, New Analysis ShowsEN
  8. 08Beyond Utilization: Energy-Conscious GPU Sharing for Inference ServingEN
  9. 09Singapore, New Zealand operators seek partnerships to cut costsEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.