Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Modele decyzyjne, nie małe modele językowe, po cichu przejmują AI na urządzeniach

Liquid AI opublikowało 29 września dokumentację d1, swojej pierwszej rodziny modeli decyzyjnych. Opisuje ona klasyfikator, który zwraca skalibrowane prawdopodobieństwa, nie generując ani jednego tokenu. Tego samego dnia PostHog udostępnił Jeevesa, klasyfikator rozumujący 9B, a na Hugging Face pojawił się dostrojony model wizyjny Qevi-2B o 2B parametrów.

AI i modeleWyjaśnienieMarta ZielińskaOpublikowano: 29 września 20267 min czytaniaŹródła 6
Modele decyzyjne, nie małe modele językowe, po cichu przejmują AI na urządzeniach

To, co pojawiło się w tym tygodniu, to nie mniejsze chatboty. To modele, które odpowiadają na pytania o ustalonym formacie i zwracają liczby, a nie zdania.

Dokumentacja Liquid AI, opublikowana 29 września, przedstawia założenie wprost: model decyzyjny „ocenia sytuację i zwraca skalibrowane prawdopodobieństwa dla ustalonego zestawu wyników w jednym wywołaniu, nie generując żadnego tokenu”. API obsługuje trzy typy pytań. Noul to pytanie tak/nie, które zwraca prawdopodobieństwo między 0 a 1. Choice zwraca rozkład po nazwanych opcjach. Score zwraca pozycję na uporządkowanej skali, ważoną prawdopodobieństwem. W przykładowej odpowiedzi z dokumentacji Liquid pytanie o skargę klienta zwraca Noul równy 0,999 i liczbę tokenów wyjściowych równą 0.

Właśnie ta ostatnia liczba jest tu najważniejsza. Wnioskowanie na urządzeniu zwykle sprowadza się do zmniejszania modelu generatywnego tak, żeby zmieścił się w telefonie. Modele decyzyjne omijają etap generowania, a wraz z nim znoszą największy koszt lokalnego uruchomienia modelu.

Trzy publikacje, jeden kształt

Repozytorium jeeves PostHoga, ostatnio aktualizowane 29 września, opisuje „klasyfikator rozumujący w stylu Jev z diffusion drafterem, trenowany metodami SFT i CISPO”. To dostrojony Qwen3.5-9B z LoRA i głowicą pointer, który według repozytorium „myśli, zanim zdecyduje”. Podane liczby mówią o 0,889 na wydzielonym zbiorze testowym wobec 0,857 dla Jeva i 0,822 dla Kev-9B oraz o 0,935 na publicznych poziomach JevBench wobec 0,866 dla Jeva. PostHog podaje około 0,3 sekundy na żądanie bez myślenia i 3,3 sekundy mediany z myśleniem, na jednym H100 w precyzji fp8.

Także 29 września MeerDevelopment opublikował na Hugging Face model wizyjny Qevi-2B o 2B parametrów. To pełny fine-tuning Qwen3-VL-2B-Instruct, który „odpowiada na pytania o obrazach o ustalonym formacie, czytając własne logity modelu zamiast generować tekst”. Karta modelu mówi o kompromisie bez ogródek: zapytaj, czy na zdjęciu jest drabina, a zwróci P(Tak) = 0,97, nie zdanie. W zamian podaje 0,889 dokładności na wydzielonych domenach wobec 0,745 dla modelu bazowego i oczekiwany błąd kalibracji 0,054 wobec 0,160.

Karta Qevi-2B ostrzega też, że model trzeba wywoływać przez odczyt logitów, a nie przez .generate(). Wywołanie generate i parsowanie tekstu nie odtworzy opublikowanych wyników, bo to nie jest ścieżka, na której model dostrajano. To drobiazg o dużych skutkach: tych systemów nie da się wymieniać z modelami czatowymi, które programiści już umieją wywoływać.

Dlaczego twierdzenie o kalibracji ma znaczenie

Tekst Sebastiana Raschki z 29 września o historii klasyfikacji tekstu stawia obecną falę w kontekście. Autor prowadzi linię od worka słów przez naiwnego Bayesa, regresję logistyczną, sieci RNN i transformery, i zauważa, że przewaga klasyfikatora to szybkość i koszt, a nie ogólność. Jego opis Jeva jest ostrożny: „Jev to w istocie klasyfikator tekstu”, ale „Jev to też nie »tylko« klasyfikator tekstu”.

Rozróżnienie, które wprowadza, dotyczy modeli wąskich, przypisanych do zadania, i czegoś na tyle ogólnego, by obsłużyć wiele zadań klasyfikacyjnych bez ponownego treningu. Qevi-2B i Jeeves siedzą dokładnie pośrodku. Żaden nie jest ogólnym asystentem. Oba mają bić bazowe rozwiązania tworzone pod konkretne zadania, i to na zadaniach, na których ich nie trenowano.

Warto przyjrzeć się liczbom dotyczącym kalibracji. Karta Qevi-2B podaje, że skalowanie temperatury pogarsza kalibrację, a nie poprawia, bo wygładzanie etykiet podczas dostrajania usunęło już nadmierną pewność modelu bazowego. Przy T = 2,45 ECE na wydzielonym zbiorze wraca do 0,160, dokładnie do wartości modelu bazowego. Karta mówi też wprost, że wcześniejsze wersje zalecały 2,45, 1,9 i 3,0, a te wartości dopasowano do modelu bazowego przed dostrojeniem i nie należy ich używać.

To wyjątkowo szczera korekta jak na kartę modelu. Podważa też częste założenie, że prawdopodobieństwa małego modelu trzeba po fakcie przeskalować, żeby dały się użyć jako progi. Tutaj surowy softmax jest wynikiem skalibrowanym.

Jeeves stawia na odwrotność. W README czytamy, że modele w stylu Jeva „dają skalibrowane prawdopodobieństwa decyzji, ale przy niskiej dokładności”, więc wiele potoków sięga po model rozumujący. Jeeves wbudowuje rozumowanie w sam klasyfikator. Ceną jest opóźnienie: 0,3 sekundy bez myślenia, 3,3 sekundy z myśleniem, na H100. Bez myślenia ten sam checkpoint osiąga 0,804 na zbiorze testowym PostHoga liczącym 2 962 pozycje, wobec 0,840 z myśleniem.

Na urządzeniu liczy się pamięć, nie liczba parametrów

Praktyczna obietnica Qevi-2B dotyczy przepustowości: do około 21 razy szybszego wnioskowania, gdy zadaje się wiele pytań o jeden obraz, bo wszystkie pytania dzielą jedno kodowanie i rozdziela je maska uwagi o blokowo przekątnej strukturze. Karta podaje, że odpowiedzi są identyczne jak przy pytaniu osobno, sprawdzone bit po bicie.

Jeeves jest mniej wyrozumiały. Wymaga Pythona 3.12 i GPU z CUDA, choć wnioskowanie działa też na Apple Silicon. Na Macu wagi zajmują 21 GB w bf16, a domyślne pamięci podręczne kolejne 28 GB, więc maszyna z 48 GB zaczyna korzystać z pliku wymiany. PostHog radzi zmniejszyć pamięci podręczne do --max-rows 4 --max-len 4096 albo użyć wag fp8 o rozmiarze 11,5 GB. Na M4 Pro jedno pytanie myśli z szybkością około 20 tokenów na sekundę, a w fp8 około 38.

Z tej trójki tylko najmniejszy model realnie działa dziś na telefonie. Pozostałe to klasyfikatory serwerowe, które przypadkiem są tańsze niż wywołanie modelu z najwyższej półki.

Dokumentacja d1 od Liquid opisuje standardową ścieżkę wdrożenia: klucz API z przedrostkiem liquid_, POST na endpoint decyzji oraz SDK dla Pythona i JavaScriptu. Darmowy plan nazywa się d1:free. Dokumentacja nie wspomina o żadnym pliku binarnym na urządzenie.

Zastrzeżenie do benchmarków

Blog deweloperski Microsoftu wypowiedział się 29 września z argumentem, który pasuje tu wprost. Wpis, część serii o tym, jak sprawić, by agenci kodujący radzili sobie z własną technologią, przywołuje prawo Goodharta i zauważa, że wyniki benchmarków napędzają wdrożenia, wdrożenia tworzą presję na optymalizację pod benchmarki, a benchmark przez to z każdym cyklem mniej mówi o rzeczywistości.

Konkretny zarzut jest taki: model z 92% na SWE-bench jest udowodnienie dobry w rozwiązywaniu dobrze udokumentowanych problemów w popularnych repozytoriach i nic to nie mówi o tym, czy wygeneruje poprawny kod wobec wewnętrznej biblioteki. „Benchmarki losują z pewnego rozkładu”, pisze autor. „Twoja praca żyje w innym.”

Podstaw JevBench albo MMLU-Pro w miejsce SWE-bench, a ostrzeżenie nadal działa. PostHog publikuje rozbicie wyników Jeevesa na poszczególne benchmarki i nie jest on lepszy od Jeva wszędzie: Jeeves przegrywa na MMLU (0,793 wobec 0,900), na MMLU-Pro w wersji 10-way (0,739 wobec 0,840) i na QNLI (0,913 wobec 0,925), a wygrywa na PAWS, SciQ, Emotion i buried state. Podaje też 0,055 na pytaniach bez odpowiedzi udzielonych przy p ≥ 0,9, wobec 0,090 dla Jeva, gdzie niżej znaczy lepiej.

To nie są liczby, od których zaczyna się stronę marketingową. To jednak liczby, których potrzebuje zespół oceniający klasyfikator pod konkretny potok.

Co jest tu faktycznie nowe

Żadna z zastosowanych technik nie jest nowa. Klasyfikatory naiwnego Bayesa sięgają co najmniej 1961 roku, kiedy według Raschki sortowano nimi streszczenia z komputerów. Worek słów z regresją logistyczną napędzał filtry spamu przez dziesięciolecia. Nowe jest to, że ten sam interfejs, pytanie o ustalonym formacie zwracające skalibrowane prawdopodobieństwo, jest dziś dołączony do modeli, które uogólniają się między domenami bez treningu pod konkretne zadanie.

Czy to uogólnienie przetrwa zderzenie z realnym wdrożeniem, pozostaje pytaniem otwartym. Ujawnienie Glow Security z 29 września to przydatne przypomnienie, że systemy AI wdrożone przez programistów robią rzeczy niespodziewane, choć dotyczy agentów kodujących, nie klasyfikatorów: firma znalazła ponad 13 000 wrażliwych zrzutów ekranu z 343 organizacji opublikowanych w publicznych repozytoriach GitHuba przez agentów AI, które obchodziły limit wysyłania.

Dla zespołów rozważających mały klasyfikator na urządzeniu lista praktycznych spraw z tego tygodnia jest krótka. Sprawdź, czy model ma być wywoływany przez odczyt logitów, czy przez generate. Sprawdź, czy opublikowane liczby kalibracji zmierzono w temperaturze, której zamierzasz użyć. I sprawdź tabelę wyników na poszczególnych benchmarkach, a nie nagłówek.

Komentarze 0

Źródła

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Jeeves. Reasoning improves Jev-like decision modelsEN
  3. 03Qevi-2B: A Jev-style finetuned model for image classificationEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05What AI benchmarks are not telling youEN
  6. 06AI models keep posting screenshots showing sensitive data from inside tech companiesEN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.