Małe modele uczą się odpowiadać bez pisania: modele decyzyjne wchodzą na urządzenia
29 września Liquid AI opublikowało dokumentację d1, swojego pierwszego modelu decyzyjnego. Model zwraca skalibrowane prawdopodobieństwa w jednym wywołaniu i nie generuje przy tym ani jednego tokenu. To najnowszy przedstawiciel szybko rosnącej klasy małych klasyfikatorów działających lokalnie, obok Jev, Qevi-2B i Jeeves od PostHoga.

Obietnica jest wąska i konkretna: model, który nie pisze. Zgodnie z dokumentacją Liquid AI, opublikowaną 29 września, d1 ocenia fragment stanu i zwraca prawdopodobieństwa dla ustalonego zbioru wyników. Przykład podany przez samą firmę wysyła skargę klienta i dostaje z powrotem jedną liczbę, 0.999, w odpowiedzi na pytanie „Czy ta wiadomość to skarga?”.
Liquid nazywa ten format modelem decyzyjnym. Obsługiwane są trzy typy pytań, a dokumentacja opisuje je prosto: pytanie „noul” jest typu tak/nie i zwraca prawdopodobieństwo między 0 i 1; pytanie „choice” zwraca rozkład po nazwanych opcjach; pytanie „score” zwraca pozycję na uporządkowanej skali, ważoną prawdopodobieństwem. Odpowiedź API zawiera pole output_tokens, które zawsze wynosi zero.
Dlaczego małe modele nagle stały się ciekawe
Liquid nie jest w tym kącie sam. Sebastian Raschka w tekście technicznym z 29 września o historii klasyfikacji tekstu opisuje model Jev przede wszystkim jako klasyfikator, a dopiero potem jako zjawisko kulturowe. Jego argument jest taki, że Jev nie jest lepszy ani tańszy od klasyfikatora zbudowanego pod wąskie zadanie. Jest za to znacznie bardziej ogólny niż te modele zadaniowe, a przy tym dużo szybszy i tańszy niż model frontierowy.
Ta kombinacja, średni poziom ogólności przy niskim koszcie wywołania, sprawia, że historia z działaniem na urządzeniu brzmi wiarygodnie. Model 2B albo 9B, który zwraca prawdopodobieństwo zamiast akapitu, może działać na sprzęcie, do którego model frontierowy nie ma dostępu.
Qevi-2B, opublikowany na Hugging Face 29 września, to wersja od strony obrazów. To pełny fine-tuning Qwen3-VL-2B-Instruct, który odpowiada na zamknięte pytania o obrazy, czytając logity w pozycji, w której model zacząłby odpowiadać, a nie generując tekst. Karta modelu mówi wprost o kompromisie: „To nie jest model konwersacyjny. Zapytaj go »czy na tym zdjęciu jest drabina?«, a zwróci P(Tak) = 0.97, nie zdanie.”
Karta podaje dokładność 0.977 w domenie treningowej wobec 0.855 dla modelu bazowego oraz 0.889 na domenach odłożonych wobec 0.745. Oczekiwany błąd kalibracji na danych odłożonych spada z 0.160 do 0.054. Jest też ostrzeżenie dla tych, których kusi dołożenie skalowania temperatury: przy T = 2.45 ECE na danych odłożonych wraca do 0.160 i cały zysk znika.
Szybkość to druga połowa obietnicy. Qevi-2B deklaruje do około 21x większej szybkości przy zadawaniu wielu pytań o jeden obraz. Wszystkie trzy przykładowe pytania dzielą jedno kodowanie i rozdziela je maska uwagi o blokowo diagonalnej strukturze. Karta zapewnia, że odpowiedzi są identyczne jak przy osobnym zadawaniu pytań, co zweryfikowano bit po bicie.
„Największym czynnikiem ryzyka, jaki widzimy, jest to, że legalna sztuczna inteligencja jest używana przez programistów, ale potem robi się z nią rzeczy, których robić nie należy” — powiedział Omer Singer, współzałożyciel i CTO Glow Security, w wywiadzie dla The Register.
Haczyk: agenci, którzy wyciekają, pomagając
Ten cytat ma niewiele wspólnego z dokładnością klasyfikacji, a wszystko z wdrożeniem. The Register poinformował 29 września, że badacze z Glow Security znaleźli ponad 13 000 wrażliwych zrzutów ekranu firmowych projektów software'owych, pochodzących z 343 firm, opublikowanych w publicznych repozytoriach GitHub przez agentów AI. Nazywają to PixelLeak.
Mechanizm jest przyziemny. GitHub nie ma API do wgrywania obrazów do pull requestów, więc agenci poproszeni o pokazanie zrzutów interfejsu przed i po wrzucają je do publicznego repo. Około jednej trzeciej przypadków ujawnienia pochodziło od programistów używających gitshot, narzędzia open source do zrzutów ekranu, którego własna nota o prywatności ostrzega, że wgrane obrazy są domyślnie publiczne.
Nic z tego nie wynika z małych modeli. Ale to jest środowisko, w którym małe modele są sprzedawane: wystarczająco tanie, by działać bez przerwy, wbudowane w narzędzia programistyczne, działające bez człowieka w pętli. Klasyfikator działający na laptopie tę pętlę zacieśnia.
Rozumowanie, ale tylko trochę
Jeeves od PostHoga, opublikowany na GitHubie 29 września, próbuje naprawić problem dokładności w modelach w stylu Jev, nie rezygnując z formatu. To klasyfikator 9B w stylu Jev zbudowany na Qwen3.5-9B z LoRA i głowicą wskaźnikową. Trenowano go tak, by rozumował przed podjęciem decyzji, z dyfuzyjnym szkicownikiem blokowym 4.
Liczby z repo porównują go z Kev-9B i Jev na danych, na których nigdy nie był trenowany: 0.889 wobec 0.822 i 0.857. Na publicznych poziomach JevBench podaje 0.935 wobec 0.866 dla Jev. Kosztem jest opóźnienie. Bez myślenia żądanie zajmuje około 0.3 sekundy; z myśleniem mediana 3.3 sekundy na jednym H100 przy precyzji FP8. Repo zauważa, że skrócenie łańcucha ten czas zmniejsza.
Tabela Jeeves przeczy też prostej historii, że rozumowanie zawsze pomaga. Na MMLU-Pro osiąga 0.739 wobec 0.840 dla Jev, a na MMLU 0.793 wobec 0.900. Autorzy nie uśredniają tych wyników, publikują je obok siebie.
Blog dla programistów Microsoftu, w poście z 29 września o Agent Experience, przedstawia ogólną wersję tego spostrzeżenia. Wyniki benchmarków napędzają adopcję, adopcja napędza optymalizację pod benchmark, a wynik przestaje mówić cokolwiek o twoim własnym kodzie. „Model, który jest świetny w Django, może być przeciętny w twoim wewnętrznym frameworku, który powierzchownie przypomina Django, ale w kluczowych miejscach działa inaczej” — czytamy w poście. Ta sama logika dotyczy modelu decyzyjnego przetestowanego na publicznych poziomach i wrzuconego potem do twojej kolejki zgłoszeń.
Na urządzeniu te wątki się spotykają. Qevi-2B podaje 21 GB wag w bf16, a Jeeves mówi, że Mac z Apple Silicon potrzebuje 48 GB albo więcej na domyślne pamięci podręczne. FP8 ścina jednak wagi do 11.5 GB i mniejsze ustawienia pamięci mieszczą się na maszynie z 48 GB. To nie telefon. To laptop, a to wciąż inny cel wdrożenia niż centrum danych, i dlatego etykieta małego modelu naprawdę tu pracuje.
Żadne z tych wydań nie rozstrzyga, czy rama klasyfikacyjna przetrwa zderzenie z bałaganiarskimi pytaniami produkcyjnymi. Próg dla 0.97 ustawia się łatwo. Dla pytania typu „score” z niezmierzoną kalibracją, a właśnie to karta Qevi-2B mówi o własnym typie „score”, już nie.
Źródła
6- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04AI models keep posting screenshots showing sensitive data from inside tech companiesEN
- 05Language Models for Text Classification: From Bag-of-Words to JevEN
- 06What AI benchmarks are not telling youEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.