Modele decyzyjne idą w małe: Qevi-2B, Liquid d1 i Jeeves pchają klasyfikację na urządzenia
Model wizyjny o 2B parametrów, który odpowiada na pytania tak/nie, czytając własne logity, a nie generując tekst, trafił na Hugging Face 29 września. Deklaruje 0,977 dokładności w domenie i do 21 razy szybsze wnioskowanie, gdy o jeden obraz pytamy wielokrotnie.

Model nazywa się Qevi-2B. To pełny fine-tuning Qwen3-VL-2B-Instruct, a jego autorzy opisują go jako "nie model czatu": gdy pytasz, czy na zdjęciu jest drabina, zwraca P(Tak) = 0,97, a nie zdanie. Opublikowana karta podaje dokładność w domenie 0,977 wobec 0,855 dla modelu bazowego, w domenach odłożonych 0,889 wobec 0,745, a oczekiwany błąd kalibracji na danych odłożonych 0,054 wobec 0,160. Twierdzenie o szybkości opiera się na pakowaniu pytań. Wiele pytań korzysta z jednego kodowania obrazu, rozdzielonych blokowo-diagonalną maską uwagi. Autorzy zweryfikowali wynik bit po bicie wobec zadawania tych pytań osobno.
To jeden artefakt w kategorii liczącej dwa tygodnie, która ma już SDK, benchmarki, konkurencyjny zestaw testów i co najmniej jeden otwarty klon. Firma TypeSafe wypuściła Jev 15 września, jak podaje Casco, które wzrost modelu do statusu mema wyznaczyło na "w ciągu czterdziestu ośmiu godzin".
Liquid nadaje nazwy podstawowym elementom
Liquid AI opublikowała 29 września dokumentację modelu d1, który nazywa swoim pierwszym modelem decyzyjnym. Dokumentacja jest wyjątkowo konkretna co do przeznaczenia tych systemów: zamiast generować token po tokenie, model decyzyjny ocenia stan i zwraca skalibrowane prawdopodobieństwa dla ustalonego zbioru wyników "w jednym wywołaniu, bez wygenerowania choćby jednego tokenu".
Liquid definiuje trzy typy pytań, które stały się de facto interfejsem. Noul to pytanie tak/nie zwracające prawdopodobieństwo między 0 a 1; dokumentacja podaje jako przykład sprawdzenie spamu zwracające 0,92. Choice zwraca rozkład po nazwanych opcjach, na przykład {"billing": 0,65, "technical": 0,30, "account": 0,05} przy kierowaniu zgłoszeń. Score zwraca pozycję ważoną prawdopodobieństwem na uporządkowanej skali, więc pytanie "jak pilne to jest?" na trzech poziomach może wrócić jako 1,85, między Medium a High. Wskazówka Liquid brzmi: wybieraj typ według tego, co twój kod robi dalej. Rozgałęziasz się po kategorii, użyj Choice; porównujesz z progiem, użyj Score; bramkujesz po wartości logicznej, użyj Noul.
Firma ostrzega też przed częstym mieszaniem pojęć. Noul na poziomie 0,5 oznacza według dokumentacji maksymalną niepewność między tak i nie i "nie mówi nic o stopniu ani intensywności". Pomiar stopnia wymaga Score z określonymi poziomami.
Jeeves: rozumowanie na wierzchu i rachunek 3,3 sekundy
Najciekawszy sprzeciw wobec kategorii wyszedł z PostHog, które 29 września opublikowało Jeeves: model o 9B parametrów w stylu Jev, zbudowany na Qwen3.5-9B z LoRA i głowicą wskaźnikową, trenowany metodami SFT i CISPO tak, żeby najpierw rozumował, a potem decydował. Repozytorium mówi wprost, jaki kompromis koryguje. "Modele w stylu Jev dają skalibrowane prawdopodobieństwa decyzji, ale przy niskiej dokładności", czytamy w README, i dlatego wiele potoków już sięga po model rozumujący.
Jeeves raportuje 0,889 na odłożonym i pozadomenowym podziale testowym liczącym 2 962 elementy, wobec 0,857 dla Jev i 0,822 dla Kev-9B, z zastrzeżeniem, że kolumny Kev i Jev to liczby publikowane przez Kev. Na 231 publicznych elementach JevBench deklaruje 0,935 wobec 0,866 dla Jev; na trudnym poziomie liczącym 111 elementów 0,865 wobec 0,730. Jego błąd kalibracji na publicznych elementach JevBench wynosi 0,037. Ten sam checkpoint zdobywa 0,804 bez myślenia wobec 0,840 z myśleniem.
A potem koszt. PostHog mierzy około 0,3 sekundy na żądanie bez myślenia i 3,3 sekundy mediany z myśleniem, na jednym H100 przy precyzji FP8, i zauważa, że skrócenie łańcucha ten czas zmniejsza. Wnioskowanie działa też na Apple Silicon z 48GB lub więcej, co ma znaczenie, jeśli sens małego modelu decyzyjnego polega na trzymaniu pracy lokalnie.
Liczby modeli bazowych w tabeli Jeeves nie wszystkie są porównywalne: repozytorium oznacza gwiazdką swój wynik Kev-9B na JevBench, zaznaczając, że żaden wynik Kev-9B na JevBench nie został opublikowany, a pokazane liczby to Kev-8B na Qwen3.
Kto właściwie płaci za klasyfikator
Najjaśniejszy argument produkcyjny pochodzi od Evana Schwartza, który prowadzi Scour, spersonalizowany kanał treści. W wpisie z 29 września opisuje, jak zadaje 54 pytania do około 1 100 000 dokumentów miesięcznie: 50 noulów, 3 choices i 1 score, około 2 150 tokenów, w tym około 260 tokenów stałego narzutu. Jego pytania to teraz około 88% tokenów wejściowych, wysyłanych dosłownie przy każdym żądaniu. Całkowite wydatki wynoszą poniżej 150 dolarów miesięcznie, a on sam mówi, że przepuszczenie tych samych treści przez nawet najtańszy LLM byłoby nie do udźwignięcia dla projektu budowanego bez finansowania.
Jego prośba jest konkretna: buforowanie promptów albo możliwość rejestrowania zestawów pytań do wielokrotnego użytku.
Zauważa, że nie pakuje wielu wpisów do jednego żądania z powodu udokumentowanego ostrzeżenia, że dokładność spada, gdy stan rośnie o niepowiązane treści. Proponuje API przyjmujące wiele pytań i wiele wejść jako alternatywę omijającą karę za pakowanie. Inni już zapełniają luki wokół TypeSafe. Projekt na GitHubie o nazwie Jeb, aktualizowany 29 września, zamienia dowolny endpoint zgodny z OpenAI w model decyzyjny, czytając logproby tokenów i zwracając ustrukturyzowany JSON pod POST /v1/systemone, z tym samym formatem żądania przez CLI. Jego README mówi szczerze o warunku wstępnym: endpoint może być zgodny z OpenAI dla zwykłego czatu, a mimo to nie udostępniać logarytmów prawdopodobieństwa, których potrzebuje Jeb, więc sprawdź tę możliwość, zanim wybierzesz dostawcę.
Problem benchmarków pojawia się wcześnie
Casco, firma zajmująca się bezpieczeństwem, przepuściła 2 449 ustaleń przez osiem modeli, w tym Jev, Claude i GPT, porównując oceny ważności CVSS 3.1 z własnymi opublikowanymi odniesieniami. Każdy model przeszacowywał średnio. Jev przypisał 550 ocen krytycznych zbiorowi zawierającemu 55 opublikowanych ustaleń krytycznych, a 500 z tych 550 było poniżej progu krytycznego w odniesieniu Casco. GPT-6 Astra był najdokładniejszy ogólnie, ze średnim błędem bezwzględnym 1,92 punktu; Jev zajął siódme miejsce z 3,40, przed Haiku z 3,94.
Błędy ze znakiem wskazują wszystkie w tę samą stronę: Jev +3,30 punktu, Haiku +3,89, Astra +1,18, na dziesięciopunktowej skali. Casco ujmuje to tak, że ustrukturyzowane, skalibrowane wyjście nie poprawiło trafności ocen ważności wobec jego odniesienia, a powstały "security slop" kosztuje inżynierów czas. Badanie użyło tych samych dowodów dla każdego modelu, bez polityki oceniania Casco i wewnętrznego kontekstu aplikacji, więc mierzy decyzję ocenną, a nie arytmetykę.
Jest też pytanie o utrzymanie, na które nikt nie odpowiedział. Jeeves to fine-tuning Qwen3.5-9B z dyfuzyjnym szkicownikiem i API zgodnym z Jev; Qevi-2B to fine-tuning Qwen3-VL-2B. Oba zależą od modeli bazowych, które zostaną zastąpione. Kategoria reklamuje się tym, że można dodawać pytania bez ponownego trenowania, co jest prawdą dla powierzchni API, ale nie dla wag.
29 września Sebastian Raschka opublikował długą techniczną historię klasyfikacji tekstu od worka słów przez RNN, CNN i transformery aż po to, co nazywa API w stylu Jev, wyraźnie po to, żeby "odczarować hype". Jego wniosek jest najmniej ekscytujący i prawdopodobnie najbardziej użyteczny: przy wąskim, dobrze zdefiniowanym problemie model w stylu Jev nie pobije klasyfikatora specjalnego przeznaczenia ani dokładnością, ani szybkością, ani kosztem. Jego zaletą jest ogólność w slocie klasyfikacji, a to znacznie mniejsze twierdzenie niż sugeruje reakcja.
Źródła
12- 01Qevi-2B: A Jev-style finetuned model for image classificationEN
- 02d1: Liquid AI's First Decision ModelEN
- 03Jeeves. Reasoning improves Jev-like decision modelsEN
- 04Please add prompt caching to Jev-style modelsEN
- 05Jeb: Turn any OpenAI API into a decision modelEN
- 06Every model (incl. Jev) we tested inflates security finding severityEN
- 07Language Models for Text Classification: From Bag-of-Words to JevEN
- 08The System One models ecosystemEN
- 09AI models keep posting screenshots showing sensitive data from inside companiesEN
- 10AI Models Fail at Physics: Coding Harnesses Are to BlameEN
- 11How many tasks does it take to trust a cheaper model?EN
- 12Gates Foundation 5 Year Goal: Help 3B People to Use AI in Their LanguageEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.