Małe modele decyzyjne wchodzą na urządzenia. Liquid AI, PostHog i Qevi pokazują klasyfikatory
Liquid AI opublikowało 29 września dokumentację d1, swojego pierwszego modelu decyzyjnego. Tego samego dnia PostHog wydał Jeevesa, klasyfikator w stylu Jev o 9B parametrów, a na Hugging Face pojawiła się karta Qevi-2B, klasyfikatora obrazów o 2B parametrów.

Trzy małe modele do konkretnych zadań pojawiły się w ciągu kilku godzin 29 września. Wszystkie trzy łączy ten sam pomysł: zamiast generować tekst, odczytują prawdopodobieństwa wprost z modelu i działają na sprzęcie, który sami kontrolujecie.
Strona dokumentacji Liquid AI opisuje d1 jako "nową klasę modeli AI stworzonych specjalnie do podejmowania ustrukturyzowanych decyzji". Model decyzyjny nie generuje tokenów jeden po drugim. "Ocenia sytuację i zwraca skalibrowane prawdopodobieństwa dla ustalonego zestawu wyników w jednym wywołaniu, bez wygenerowania choćby jednego tokenu". Przykładowa odpowiedź podana przez firmę pokazuje usage.output_tokens: 0 dla zapytania o wykrycie skargi, które zwróciło wartość noul równą 0.999.
Trzy kształty pytań, zero wygenerowanego tekstu
Liquid dzieli pytania decyzyjne na trzy typy. Noul to pytanie tak lub nie, które zwraca prawdopodobieństwo między 0 a 1, opisane w dokumentacji jako "boolean na ruchomej skali". Choice zwraca rozkład po nazwanych opcjach, na przykład {"billing": 0.65, "technical": 0.30, "account": 0.05}. Score zwraca pozycję ważoną prawdopodobieństwem na uporządkowanej skali, więc pytanie o trzy poziomy pilności może wrócić jako 1.85, między "Medium" a "High".
Dokumentacja wyraźnie mówi, że noul i score nie są wymienne. Noul równy 0.5 oznacza największą niepewność między tak i nie i "nie mówi nic o stopniu ani intensywności". Jeśli kod ma porównywać wynik z progiem na kontinuum, dokumentacja kieruje do score. Jeśli ma decydować na booleanie, do noul. API przyjmuje stan oraz jedno lub więcej nazwanych pytań i odpowiada na wszystkie w jednym wywołaniu. Biblioteki klienckie są dla Pythona (typesafe-sdk) i JavaScriptu (@typesafe-ai/sdk), a klucze mają prefiks liquid_.
Strona Liquid to dokumentacja, nie artykuł z benchmarkami, więc nie podaje żadnych liczb o dokładności d1. To ma znaczenie, bo w tym samym tygodniu powstały dwa modele, które liczby publikują, a różnica między nimi jest pouczająca.
Jeeves dodaje rozumowanie do formuły Jev
Repozytorium PostHoga na GitHubie opisuje Jeevesa jako "rozumujący klasyfikator w stylu Jev z diffusion drafterem, trenowany metodami SFT i CISPO". To model o 9B parametrów zbudowany na Qwen3.5-9B z LoRA i pointer headem, plus diffusion drafter blokowy 4 oraz pełny kod i dane treningowe. Repozytorium twierdzi, że bije Kev-9B i Jev na danych testowych, na których nigdy nie był trenowany: 0.889 przeciw 0.822 i 0.857, a na publicznych poziomach JevBench 0.935 przeciw 0.866 dla Jev.
Repozytorium publikuje pełniejszą tabelę i nie jest ona pochlebna w każdym wierszu. Jeeves dostaje 0.746 na zadaniach transferowych obejmujących MMLU-Pro i buried state, poniżej 0.800 Jev. Na MMLU spada do 0.793 przeciw 0.900 Jev, a na MMLU-Pro 10-way do 0.739 przeciw 0.840. Wygrywa na PAWS (0.875 przeciw 0.788), na odłożonych strukturach reguł (1.000 przeciw 0.885) i na politykach kontrastywnych (1.000 przeciw 0.963). Na pytania nierozstrzygalne odpowiada z p równym 0.9 lub więcej rzadziej niż Jev: 0.055 przeciw 0.090, gdzie niżej znaczy lepiej.
Repozytorium zauważa też, że bez myślenia ten sam checkpoint dostaje 0.804 na swoim podziale testowym liczącym 2 962 pozycje, przeciw 0.840 z myśleniem. Opóźnienie jest ceną: około 0.3 sekundy na żądanie bez myślenia i mediana 3.3 sekundy z nim, na jednym H100 w precyzji fp8. Na M4 Pro jedno pytanie myśli z szybkością około 20 tokenów na sekundę. Wagi zajmują 21 GB w bf16, a domyślne cache dokładają kolejne 28 GB, dlatego README zaleca mniejsze ustawienia cache na Macu z 48 GB.
Jedno zastrzeżenie jest wydrukowane w samej tabeli. Nie opublikowano żadnego wyniku Kev-9B na JevBench, a dwa wiersze oznaczone gwiazdką to Kev-8B na Qwen3, więc część tego porównania dotyczy innego modelu, niż sugeruje nagłówek kolumny.
Qevi-2B przenosi ten sam trik na obrazy
Karta modelu Qevi-2B na Hugging Face opisuje pełny fine-tuning Qwen3-VL-2B-Instruct, który odpowiada na typowane, zamknięte pytania o obrazy "czytając własne logity modelu zamiast generować tekst". Zapytaj, czy na zdjęciu jest drabina, a zwróci P(Yes) = 0.97, nie zdanie. Karta mówi wprost, że to nie jest model czatowy, i ostrzega, że wywołanie .generate() i parsowanie tekstu nie odtworzy publikowanych liczb, bo to nie jest ścieżka, na której model był dostrajany.
Odczyt to około 30 linii zwykłego kodu transformers bez trust_remote_code. Bazowy Qwen3-VL-2B-Instruct puszczony przez identyczną ścieżkę odczytu wypada gorzej. Qevi-2B idzie z 0.855 na 0.977 dokładności w domenie i z 0.745 na 0.889 na 12 odłożonych domenach. Oczekiwany błąd kalibracji na odłożonych danych spada z 0.160 na 0.054. Karta podaje, że przewaga szybkości sięga około 21 razy przy zadawaniu wielu pytań o jeden obraz, bo maska uwagi blokowo-diagonalna pozwala kilku pytaniom dzielić jedno kodowanie obrazu, co zweryfikowano bit po bicie wobec zadawania ich osobno.
Karta ostrzega przed skalowaniem temperatury, które zalecały wcześniejsze wersje: przy T = 2.45 odłożony ECE wynosi 0.160, czyli tyle co w modelu bazowym, i "cały zysk z kalibracji zostaje zniesiony".
Jest jeszcze druga uwaga o uczciwości. Korpus treningowy zawiera tylko pytania noul i choice. Silnik obsługuje score, a model bazowy radzi sobie z takimi pytaniami zero-shot, ale fine-tuning nigdy takiego nie widział, więc karta stwierdza, że dokładność i kalibracja score są niezmierzone i należy je traktować jako niesprawdzone.
Dlaczego wątek pracy na urządzeniu wraca
Tekst Sebastiana Raschki z 29 września o historii klasyfikacji tekstu jest tu przydatny, bo pokazuje, z czego te modele rezygnują. Zauważa, że najnowsze modele GPT i modele open-weight potrafią robić te same zadania klasyfikacyjne co Jev, będąc znacznie bardziej ogólnymi, ale przewagą modelu w stylu Jev jest szybkość i koszt. Na drugim końcu: "dla wąskiego, dobrze zdefiniowanego problemu Jev prawdopodobnie nie sklasyfikuje niczego lepiej, szybciej ani taniej niż klasyfikator specjalnego przeznaczenia". Zaleta leży pośrodku: bardziej ogólny niż model do jednego zadania, tańszy niż model frontierowy.
Artykuł Raschki prowadzi linię od reprezentacji worka słów zasilających naiwnego Bayesa, regresję logistyczną, SVM-y i XGBoost. Zauważa przy tym, że filtr spamu w Gmailu był podobno naiwnym modelem bayesowskim na worku słów. Różnica jest teraz taka, że klasyfikatorem jest dostrojony model językowy ze skalibrowaną głową prawdopodobieństwa. Można go dostarczyć jako wagi, a nie wywoływać jako usługę.
Tu właśnie wchodzi argument za pracą na urządzeniu. Jeeves działa na CUDA w bf16 lub fp8, a także na Apple Silicon przez MPS. Build fp8 zmniejsza wagi do 11.5 GB i podnosi przepustowość myślenia na M4 Pro z około 20 do około 31 tokenów na sekundę. Repozytorium podaje, że dokładność i NLL nie zmieniły się mierzalnie na pytaniach deweloperskich, a gotowe repozytorium PostHog/jeeves-fp8 jest opublikowane, więc pobieranie jest o połowę mniejsze.
Qevi-2B jest jeszcze mniejszy, ma 2B parametrów, czyli taki rozmiar, który mieści się na laptopie albo telefonie, a nie na szafie serwerowej. Dokumentacja Liquid opisuje model jako oceniający stan i pytania w jednym wywołaniu z zerem tokenów wyjściowych. Dzięki temu koszt pojedynczego żądania jest przewidywalny.
Pomiary wciąż są skąpe
Nic z tego nie jest wolne od problemów. Najnowsze pokrewne badania, artykuł na arXiv przesłany 28 września przez Camerona Berga i Caspara Kaisera, wykazały, że w siedmiu modelach open-weight z pięciu rodzin ukryte wzorce aktywacji związanych z walencją w przewidywalny sposób rządzą późniejszymi wyborami, nawet gdy każdy widoczny token jest identyczny. Autorzy piszą, że czy tym śladom towarzyszy jakiekolwiek subiektywne doświadczenie istotne dla dobrostanu modelu, "pozostaje niejasne". To przypomnienie, że czytanie stanu wewnętrznego modelu jest dziś wzorcem projektowym, nie tylko diagnostyką.
Praktyczny zarzut pochodzi z bloga deweloperskiego Microsoftu z 29 września. Autor wpisu twierdzi, że publiczne benchmarki mówią niewiele o własnym obciążeniu. Przywołuje prawo Goodharta i wskazuje, że zadania SWE-bench pochodzą z publicznych repozytoriów, więc nakładanie się z danymi treningowymi jest nieuniknione i rośnie z każdą generacją. Model, który dostaje 92% na SWE-bench, jest udowodnienie dobry w rozwiązywaniu dobrze udokumentowanych problemów w popularnych repozytoriach, a to nie mówi nic o waszej wewnętrznej bibliotece.
Ta sama logika dotyczy modeli decyzyjnych. Własna tabela Jeevesa pokazuje, że przegrywa z Jev na MMLU i MMLU-Pro, a wygrywa na odłożonych strukturach reguł. Odpowiedź na pytanie "który jest lepszy" zależy więc wyłącznie od tego, z jakiego rozkładu pochodzą wasze zgłoszenia, obrazy czy dokumenty. Liquid nie publikuje żadnych liczb o dokładności d1. Karta Qevi-2B wymienia score jako niesprawdzony. Liczby, które istnieją, są w większości raportowane przez same zespoły wydające modele, na podziałach, które same wybrały.
Nowością w tym tygodniu nie jest to, że małe klasyfikatory istnieją. Jest to, że trzy osobne zespoły dostarczyły je z tym samym pomysłem na interfejs: skalibrowane prawdopodobieństwa po ustalonym zbiorze odpowiedzi w jednym przebiegu w przód. Dostarczyły je też dość małe, by działały bez centrum danych. Czy to wystarczy, by wyprzeć wzorzec modelu frontierowego z fallbackiem, który opisuje README Jeevesa, na to pytanie opublikowane benchmarki jeszcze nie odpowiadają.
Źródła
6- 01d1: Liquid AI's First Decision ModelEN
- 02Jeeves. Reasoning improves Jev-like decision modelsEN
- 03Qevi-2B: A Jev-style finetuned model for image classificationEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Language Models Act on Hidden ValenceEN
- 06What AI benchmarks are not telling youEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.