Małe modele decyzyjne wchodzą na urządzenia: d1 od Liquid AI, klony Jev i 2B klasyfikator obrazu
Liquid AI opublikowało 29 września dokumentację d1, swojego pierwszego „modelu decyzyjnego”. To część szybko rosnącej rodziny małych modeli działających na urządzeniach, które zwracają skalibrowane prawdopodobieństwa zamiast generowanego tekstu.

Dokumentacja opisuje trzy typy pytań. Noul to pytanie tak/nie, które zwraca prawdopodobieństwo między 0 a 1. Choice każe wybrać jedną opcję z wielu i zwraca rozkład na nazwanych wariantach. Score to uporządkowana rubryka zwracana jako pozycja ważona prawdopodobieństwem. Przykładowe wywołanie wysyła skargę klienta do modelu „d1:free” i zwraca 0.999 na pytanie „Is this message a complaint from the customer?”.
To model o innym kształcie niż chatbot. Nic nie jest generowane. Dokumentacja Liquid podaje, że model decyzyjny „ocenia sytuację i zwraca skalibrowane prawdopodobieństwa dla ustalonego zestawu wyników w jednym wywołaniu, bez generowania tokenów”. W jednym zapytaniu można ocenić wiele pytań wobec tego samego stanu.
Dlaczego ta klasa modeli istnieje
Ten sam wzorzec pojawia się we wszystkich najnowszych źródłach w dossier. Sebastian Raschka opublikował 29 września długie techniczne wyjaśnienie. Prowadzi w nim czytelnika od klasyfikacji tekstu przez worek słów, RNN, CNN i transformery aż do tego, co nazywa „API w stylu Jev”. Twierdzi, że przyciąga tu koszt i szybkość, a nie sama dokładność. „Przewaga Jev polega na tym, że radzi sobie z takimi zadaniami klasyfikacji znacznie szybciej i taniej” – pisze. Ostrzega zarazem, że przy wąskim, dobrze zdefiniowanym problemie specjalnie zbudowany klasyfikator i tak wygra pod każdym z tych trzech względów.
Repozytorium Jeeves firmy PostHog, również opublikowane 29 września, podaje liczby tego kompromisu. Jeeves to model w stylu Jev o 9B parametrach, zbudowany na Qwen3.5-9B z LoRA i głowicą pointer, trenowany metodami SFT i CISPO tak, by najpierw rozumował, a potem decydował. Repozytorium raportuje 0.889 na własnym, wydzielonym zbiorze testowym wobec 0.857 dla Jev i 0.822 dla Kev-9B, a także 0.935 na publicznych poziomach JevBench wobec 0.866 dla Jev. Wnioskowanie zajmuje około 0,3 sekundy na zapytanie bez rozumowania i 3,3 sekundy w medianie z nim, na jednym H100 w fp8. Działa też na Apple Silicon w bf16 lub FP8 i wymaga co najmniej 48GB.
Evan Schwartz, który prowadzi spersonalizowany kanał treści Scour, opublikował 29 września prośbę o buforowanie promptów w tego typu API. Jego zestaw pytań liczy teraz 54 pytania (50 noul, 3 choice, 1 score) i około 2 150 tokenów, z czego jakieś 260 tokenów to stały narzut. Wysyłane dosłownie przy każdym zapytaniu w około 1 100 000 dokumentów miesięcznie, pytania stanowią około 88% jego tokenów wejściowych. Rachunek wynosi poniżej 150 dolarów miesięcznie, ale zdaniem Schwartza buforowanie obniżyłoby jeszcze koszty przepływów wsadowych.
Koniec na urządzeniu: 2B klasyfikator obrazu
Najwyraźniejszym wydaniem małego modelu w tej partii jest Qevi-2B, opublikowany na Hugging Face 29 września. To pełny fine-tuning Qwen3-VL-2B-Instruct, który odpowiada na zamknięte pytania o obrazy, czytając własne logity modelu, a nie generując tekst. Zapytany, czy na zdjęciu jest drabina, zwraca P(Yes) = 0.97, a nie zdanie.
Karta modelu podaje, że dokładność w domenie wzrosła z 0.855 dla modelu bazowego do 0.977, dokładność na wydzielonej domenie z 0.745 do 0.889, a oczekiwany błąd kalibracji na wydzielonych danych spadł z 0.160 do 0.054. Wnioskowanie ma być do około 21 razy szybsze, gdy zadaje się wiele pytań o jeden obraz. Karta wyraźnie zastrzega, że modelu trzeba używać przez odczyt logitów, a nie przez .generate(). Wszystkie trzy obsługiwane typy pytań mogą korzystać z jednego kodowania obrazu, rozdzielonego blokowo-diagonalną maską uwagi, a odpowiedzi weryfikowano bit po bicie z wynikami pytań zadawanych osobno.
Jedna z ewaluacji w dossier studzi entuzjazm. Firma ochroniarska Casco przepuściła 2 449 znalezisk przez osiem modeli, w tym Jev, Claude i GPT, i porównała ich oceny CVSS 3.1 z własnymi opublikowanymi ocenami. Każdy model wypadł średnio wyżej niż referencja. Jev przypisał 550 ocen krytycznych zbiorowi, który zawiera 55 opublikowanych znalezisk krytycznych, a 500 z tych 550 było poniżej progu krytycznego w referencji Casco. Pod względem średniego błędu bezwzględnego GPT-6 Astra zajął pierwsze miejsce z 1.92 punktu, a Jev siódme z 3.40. Tekst Casco jest datowany na 28 września.
W tej samej partii z 29 września wątek małych modeli pojawia się w mniej oczywistych miejscach. Darmowy model podglądowy wystawiony w OpenRouterze 24 września jako space-bunny-alpha deklaruje kontekst miliona tokenów i podaje, że zużywa około jednej trzeciej tokenów wyjściowych Qwen3.8 Flash na tych samych benchmarkach, 305 989 wobec 913 989, według własnej strony. Simple AI uruchomiło Tango, natywnie audio model do wykrywania końca wypowiedzi. Model deklaruje decyzję w medianie 300 ms przed tym, gdy konwencjonalny detektor aktywności głosowej wychwyciłby pauzę, oraz 15 przeoczonych zakończeń tur na 400 w publicznym benchmarku LiveKit wobec 54 dla Soniox i 197 dla Deepgram Flux. To porównania przeprowadzone przez dostawców na publicznym benchmarku, a nie niezależne audyty.
Dwa inne wydania w tym oknie pchają w tę samą stronę: Jeb, projekt na GitHubie, który zamienia dowolne API zgodne z OpenAI w model decyzyjny, oraz DesktopBrain, działający na urządzeniu organizer plików dla Maca. Żaden z nich nie publikuje wyników benchmarków w dostępnych materiałach.
Wzorzec jest spójny. Interesujące małe modele ostatnich 72 godzin to nie miniaturowe chatboty. Są wąskie, skalibrowane i tanie w uruchomieniu tam, gdzie model frontier byłby absurdem: telefon, laptop, 2B enkoder obrazu, klasyfikator odpowiadający na 54 pytania za mniej niż 150 dolarów miesięcznie. Czy są wystarczająco dokładne do pracy, do której się je kieruje, to osobne pytanie, a wynik Casco sugeruje, że odpowiedź nie zawsze brzmi tak.
Źródła
12- 01d1: Liquid AI's First Decision ModelEN
- 02Qevi-2B: A Jev-style finetuned model for image classificationEN
- 03Language Models for Text Classification: From Bag-of-Words to JevEN
- 04Jeeves. Reasoning improves Jev-like decision modelsEN
- 05Every model (incl. Jev) we tested inflates security finding severityEN
- 06Please add prompt caching to Jev-style modelsEN
- 07Space-bunny-alpha a reasoning model from an anonymous providerEN
- 08Tango: Simple AI's Conversational Awareness ModelEN
- 09Jeb: Turn any OpenAI API into a decision modelEN
- 10DesktopBrain - AI File Organizer for Mac and All Folders - Private On-Device AIEN
- 11Language Models Act on Hidden ValenceEN
- 12Needed 1+1, built a functional programming languageEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.