Małe modele decyzyjne wchodzą na urządzenia, przybywa klasyfikatorów w stylu Jev
Liquid AI opublikowało 29 września dokumentację d1, swojego pierwszego modelu decyzyjnego. API w jednym wywołaniu zwraca skalibrowane prawdopodobieństwa dla ustalonych wyników i nie generuje ani jednego tokenu. Tego samego dnia na Hugging Face pojawił się model wizyjny 2B, który czyta własne logity na urządzeniu.

Dokumentacja d1 od Liquid AI pojawiła się 29 września. Każde zapytanie trafia do jednej z trzech kategorii: noul (pytanie tak/nie, które zwraca prawdopodobieństwo między 0 a 1), choice (rozkład wyboru jednej opcji spośród nazwanych) i score (pozycja na uporządkowanej skali, ważona prawdopodobieństwem). W dokumentacji jest przykład, w którym skarga klienta zwraca 0,999 na bramce noul. To samo zapytanie może nieść kilka pytań ocenianych naraz. Na taki kształt czekało środowisko pracujące nad modelami na urządzeniach.
Na telefonie czy laptopie rozstrzyga arytmetyka. Model, który zwraca jedną liczbę zamiast akapitu tekstu, pomija całą pętlę dekodowania, więc opóźnienie przestaje rosnąć wraz z długością odpowiedzi. Wynik można też porównywać z progiem: prawdopodobieństwo 0,92 to warunek rozgałęzienia, a nie coś, co musi interpretować parser.
Qevi-2B, udostępniony na Hugging Face 29 września, jest najwyraźniejszym przykładem małego modelu. To pełny fine-tuning Qwen3-VL-2B-Instruct. Odpowiada na typowane, zamknięte pytania o obrazy, czytając logity głowicy LM na pozycji odpowiedzi zamiast generować tekst. Karta modelu podaje dokładność w domenie 0,977 wobec 0,855 dla bazowego Qwen3-VL-2B, dokładność na danych odłożonych 0,889 wobec 0,745 oraz oczekiwany błąd kalibracji na danych odłożonych 0,054 wobec 0,160.
Karta mówi wprost, gdzie jest haczyk: liczby odtwarza się tylko przez odczyt logitów, około 30 linii zwykłego kodu transformers, a wywołanie .generate() ich nie da, bo model nie był dostrajany na tej ścieżce. Ostrzega też, że to nie model czatowy. Zapytaj, czy na zdjęciu jest drabina, a dostaniesz P(Yes) = 0,97, nie zdanie. Obiecywana korzyść to nawet około 21x szybsze wnioskowanie przy wielu pytaniach o jeden obraz. Trzy osobne pytania mogą dzielić jedno kodowanie i być rozdzielone maską uwagi blokowo-diagonalną, co zweryfikowano bit po bicie wobec zadawania ich osobno. Trening objął 57 000 pytań noul i 28 500 pytań choice.
Rozumowanie wraca małe modele do gry
Oczywisty zarzut dotyczy dokładności. Klasyfikatory w stylu Jev są tanie i skalibrowane, ale przy niskiej dokładności wypadają słabo, dlatego potoki trzymają model rozumujący jako fallback. Repozytorium Jeeves od PostHog, wypchnięte 29 września, bierze się z tym zarzutem wprost za bary. To model 9B w stylu Jev (Qwen3.5-9B, LoRA, głowica pointer), który myśli, zanim zdecyduje, trenowany przez SFT i CISPO, plus szkicownik dyfuzyjny block-4. Opublikowana tabela daje Jeevesowi 0,889 na odłożonych danych testowych wobec 0,857 dla Jev i 0,822 dla Kev-9B oraz 0,935 wobec 0,866 dla Jev na publicznych poziomach JevBench. Podaje około 0,3 s na zapytanie bez myślenia i medianę 3,3 s z nim na jednym H100 przy fp8, a działa na Apple Silicon w bf16 lub FP8.
Opublikowany 29 września rys historyczny klasyfikacji tekstu autorstwa Sebastiana Raschki porządkuje całą falę. Prowadzi od worka słów i naiwnego Bayesa przez RNN i transformery aż do tego, co nazywa API w stylu Jev, i przekonuje, że przewaga Jev to szybkość i koszt przy klasyfikacji, a nie sama moc. Evan Schwartz tego samego dnia przekłada to na konkret wdrożeniowy: na Scour przepuszcza 54 pytania przez około 1 100 000 dokumentów miesięcznie, pytania to około 88% tokenów wejściowych, a rachunek zostaje poniżej 150 dolarów miesięcznie. Od dostawców chce buforowania promptów albo zestawów pytań wielokrotnego użytku.
Nie wszystkich przekonuje, że wyniki są godne zaufania. Casco przetestowało osiem modeli na 2 449 ustaleniach bezpieczeństwa wobec własnych opublikowanych ocen CVSS 3.1 i stwierdziło, że każdy model przeszacował wagę. Jev przypisał 550 ocen krytycznych zbiorowi, który zawiera 55 opublikowanych ustaleń krytycznych, ze średnim błędem ze znakiem +3,30 punktu. GPT-6 Astra był najdokładniejszy przy średnim błędzie bezwzględnym 1,92 punktu, a Jev siódmy z 3,40. To samo ryzyko nadrozpoznania dotyczy każdej bramki na urządzeniu, która odpala się na progu.
Infrastruktura idzie za tym. Blog deweloperski Microsoftu przekonywał 29 września, że publiczne benchmarki kodowania nie przewidują wyników na twoim własnym kodzie. To ten sam argument za ocenianiem małego modelu decyzyjnego na własnych danych wejściowych. JuliaHub podał tego samego dnia, że zamiana otoczki agenta przy stałym modelu przesunęła wyniki z 0,533 na 0,899, czyli ponad dwukrotnie więcej niż różnica, którą zmierzył między czterema modelami frontier. Tuneloop wycenił samą ewaluację: 30 odtworzonych zadań i około 55 dolarów pozwalają ustalić różnicę z dokładnością do plus lub minus 6 punktów. To wystarcza, żeby kierować rutynową pracę do tańszego modelu za 2,5% kosztu. Dla klasyfikatora na urządzeniu ten test rozstrzyga, czy mały model trafi na produkcję.
Źródła
10- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Language Models for Text Classification: From Bag-of-Words to JevEN
- 05Please add prompt caching to Jev-style modelsEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07What AI benchmarks are not telling youEN
- 08The Best AI Models Fail at Physics: Coding Harnesses are to BlameEN
- 09How many tasks does it take to trust a cheaper model?EN
- 10Tango: Simple AI's Conversational Awareness ModelEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.