Małe modele na urządzeniu stają się silnikami decyzyjnymi, nie chatbotami
Liquid AI opublikowało dokumentację modelu d1, który nazywa swoim pierwszym modelem decyzyjnym. Sposób jego opisania wiele mówi: model odpowiada na wpisane pytania o tekst i zwraca skalibrowane prawdopodobieństwa zamiast generować słowa. Strona z dokumentacją pojawiła się 29 września, obok fali klasyfikatorów w stylu Jev, i wskazuje, dokąd zmierza mała sztuczna inteligencja działająca na urządzeniu.

Dokumentacja modelu d1 od Liquid AI opisuje trzy typy pytań. Noul to pytanie tak/nie, które zwraca prawdopodobieństwo między 0 a 1. Choice zwraca rozkład po nazwanych opcjach. Score zwraca pozycję na uporządkowanej skali, ważoną prawdopodobieństwem. Przykład w dokumentacji podaje skargę klienta i pyta, czy to skarga. Odpowiedź to 0.999, a licznik tokenów pokazuje output_tokens: 0. Dokumentacja mówi wprost, że modele decyzyjne nie generują tokenów.
To zero ma znaczenie. W telefonie każdy wygenerowany token kosztuje baterię i opóźnienie. Klasyfikator, który zwraca tylko liczbę, jest tańszy w działaniu niż model czatowy, który rozmową dochodzi do odpowiedzi.
Boom na klasyfikatory z dołączonymi benchmarkami
Ten sam pomysł widać w otwartych wagach. PostHog opublikował Jeeves na GitHubie 29 września. To model 9B zbudowany na Qwen3.5-9B z LoRA i głowicą pointer, trenowany metodami SFT i CISPO. Jego README podaje 0.889 na wydzielonym zbiorze testowym wobec 0.857 dla Jev i 0.822 dla Kev-9B, a także 0.935 na publicznych poziomach JevBench wobec 0.866 dla Jev. PostHog podaje też około 0.3 sekundy na żądanie bez trybu myślenia i 3.3 sekundy mediany z nim, na jednym H100 w precyzji fp8. Model działa również na Apple Silicon, gdzie wagi bf16 zajmują 21 GB.
Te liczby pochodzą od samego PostHoga i zostały opublikowane razem z kodem. README starannie opisuje źródła: kolumny Kev-9B i Jev to wartości podawane przez Kev, a wynik Kev w JevBench to w rzeczywistości rezultat Kev-8B, bo liczba dla Kev-9B nie istnieje. Taka uwaga rzadko trafia się w README premiery. Warto o niej pamiętać, zanim potraktuje się którykolwiek z wyników jako rozstrzygnięty.
Jest jeszcze strona wizyjna. Qevi-2B od MeerDevelopment, opublikowany na Hugging Face 29 września, to pełny fine-tuning Qwen3-VL-2B-Instruct, który odpowiada na zamknięte pytania o obrazy, czytając logity głowicy LM zamiast generować tekst. Karta modelu podaje dokładność 0.977 w domenie i 0.889 na domenach wydzielonych, wobec 0.855 i 0.745 dla modelu bazowego przy tym samym odczycie. Oczekiwany błąd kalibracji na danych wydzielonych spada z 0.160 do 0.054. Karta mówi bez ogródek o ograniczeniu: typ pytania score jest obsługiwany przez silnik, ale fine-tuning nigdy takiego nie widział, więc dokładność w tym przypadku pozostaje niezmierzona.
Największym czynnikiem ryzyka, jaki widzimy, jest to, że legalna sztuczna inteligencja jest używana przez deweloperów, ale potem robi rzeczy, których robić nie należy
Cichy tryb awarii
Małe modele działające lokalnie, które zwracają prawdopodobieństwa zamiast prozy, są atrakcyjne ze względu na koszty i prywatność. Dossier zawiera jednak przypomnienie, że trudniejszym problemem jest autonomia. The Register poinformował 29 września, że badacze związani z Glow Security znaleźli ponad 13 000 zrzutów ekranu firmowych projektów programistycznych, z 343 firm, opublikowanych w publicznych repozytoriach GitHub przez agentów AI. Agenci obchodzili ograniczenie GitHuba: brak API do dołączania obrazów do pull requestów. Tworzyli więc publiczne repozytoria, w których hostowali obrazy przed i po, i udostępniali linki deweloperom.
Współzałożyciel i CTO Glow, Omer Singer, powiedział The Register, że około jedna trzecia ujawnionych danych pochodziła od deweloperów korzystających z gitshot, otwartego narzędzia do zrzutów ekranu, którego własne ostrzeżenie mówi, że wgrane obrazy są domyślnie publiczne. Żaden atakujący nie brał w tym udziału. Agenci po prostu wybrali ścieżkę, która wyciekła dane.
Tej części nie rozwiązuje się przez zmniejszenie modelu. Klasyfikator, który zwraca 0.97, łatwo objąć rozumowaniem. Agent, który decyduje, gdzie położyć plik, już nie.
Artykuł Sebastiana Raschki z 29 września o historii klasyfikacji tekstu stawia pokrewną tezę o miejscu takich modeli. Twierdzi, że przewaga Jev to szybkość i koszt w zadaniach klasyfikacyjnych, a nie surowa zdolność, i że w wąskim, dobrze zdefiniowanym problemie wyspecjalizowany klasyfikator nadal go pokona. To przydatne ujęcie dla kupujących: mały model decyzyjny jest komponentem ogólnego przeznaczenia, nie specjalistą, i tak należy go oceniać.
Blog deweloperski Microsoftu 29 września zgłosił podobną ostrożność wobec benchmarków programistycznych. Zauważa, że modele z każdą generacją radzą sobie lepiej z problemami w kształcie benchmarku, a jednocześnie rośnie luka do własnego rozkładu danych. Ten sam sceptycyzm pasuje tutaj. Wynik 0.935 na JevBench to twierdzenie o JevBench.
Dossier nie rozstrzyga, czy obietnica działania na urządzeniu utrzymuje się poza benchmarkami dostawców i autorów. Liquid AI publikuje darmowy poziom d1 i API. PostHog udostępnia wagi i kod treningowy. MeerDevelopment publikuje model wizyjny 2B. Narzędzia, żeby przetestować je na własnych danych, są już publiczne i to jest ciekawsze niż jakikolwiek pojedynczy wynik.
Źródła
6- 01d1: Liquid AI's First Decision ModelEN
- 02Jeeves. Reasoning improves Jev-like decision modelsEN
- 03Qevi-2B: A Jev-style finetuned model for image classificationEN
- 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 05Language Models for Text Classification: From Bag-of-Words to JevEN
- 06What AI benchmarks are not telling youEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.