Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Modele decyzyjne odchodzą od generowania tekstu. Małe AI na urządzeniu stawia na odczyt logitów

Dwie premiery modeli z 29 września forsują ten sam pomysł: zamiast generować tokeny, małe modele mają zwracać skalibrowane prawdopodobieństwa. d1 od Liquid AI i dostrojony Qwen3-VL-2B o nazwie Qevi-2B działają właśnie tak.

AI i modeleAnalizaAnna KaczmarekOpublikowano: 29 września 20264 min czytaniaŹródła 6
Modele decyzyjne odchodzą od generowania tekstu. Małe AI na urządzeniu stawia na odczyt logitów

Oba pojawiły się we wtorek w odstępie sześciu minut. Liquid AI opublikowało dokumentację d1 o 20:09 UTC i nazywa go swoim pierwszym modelem decyzyjnym. MeerDevelopment wrzuciło Qevi-2B na Hugging Face o 20:16 UTC. Żaden z nich nie generuje tekstu.

Dokumentacja Liquid AI mówi o mechanizmie bez ogródek. Model decyzyjny „ocenia sytuację i zwraca skalibrowane prawdopodobieństwa dla ustalonego zestawu wyników w jednym wywołaniu, bez wygenerowania choćby jednego tokenu”. API udostępnia trzy typy pytań: noul (tak/nie, zwraca liczbę zmiennoprzecinkową), choice (wybór jednej z nazwanych opcji) i score (pozycja na uporządkowanej skali, ważona prawdopodobieństwem). W przykładzie z dokumentacji zdanie „Czekam na zamówienie ponad trzy tygodnie i nikt nie odpowiada na moje maile” zwraca noul równy 0,999 dla pytania „Czy ta wiadomość to reklamacja od klienta?”. Odpowiedź podaje też usage.output_tokens jako 0.

Odczytaj logity, pomiń zdanie

Qevi-2B idzie do tego samego celu inną drogą. To pełny fine-tuning Qwen3-VL-2B-Instruct. Model odpowiada na zamknięte pytania o obrazy, czytając logity głowy LM na pozycji, na której zacząłby odpowiadać. Bierze pod uwagę tylko dozwolone tokeny odpowiedzi. Zapytaj, czy na zdjęciu jest drabina, a zwróci P(Tak) = 0,97. Karta modelu ostrzega, że wywołanie .generate() i parsowanie tekstu nie odtworzy opublikowanych liczb, „bo to nie jest ścieżka, na której model był dostrajany”.

Deklarowane zyski są duże i konkretne. Bazowy Qwen3-VL-2B puszczony przez identyczną ścieżkę odczytu osiąga 0,855 dokładności w domenie, a Qevi-2B 0,977. Na domenach odłożonych jest to 0,745 wobec 0,889. Oczekiwany błąd kalibracji na danych odłożonych spada z 0,160 do 0,054. Karta podaje też około 21 razy szybsze wnioskowanie przy zadawaniu wielu pytań o jeden obraz, bo pakowanie pytań współdzieli jedno kodowanie obrazu.

Jest zastrzeżenie, które warto przeczytać uważnie. Korpus treningowy obejmuje tylko pytania typu noul i choice, więc typ score pozostaje nieprzetestowany. Karta wyraźnie wycofuje się też z wcześniejszych zaleceń dotyczących temperatury: przy T = 2,45 oczekiwany błąd kalibracji na danych odłożonych wraca do 0,160 i cały zysk z kalibracji znika.

Małe, szybkie i wycelowane w klasyfikację

Tak wygląda dziś argument za przetwarzaniem na urządzeniu. Przewodnik Ailoitte po rozwoju małych modeli, opublikowany w ciągu ostatnich 12 godzin, ujmuje to w kategoriach kosztu. Obsługa modelu 7B może być „10 do 30 razy tańsza pod względem opóźnienia, energii i obliczeń” niż modelu 70B do 175B, powołując się na stanowisko NVIDIA z 2025 roku. Zaznacza też, że małe modele działają lokalnie, co ma znaczenie dla danych z ochrony zdrowia i finansów.

Esej Sebastiana Raschki z 29 września o klasyfikacji tekstu mówi to samo z drugiej strony. Opisuje Jev, model, który wywołał „niemałe zjawisko kulturowe w społecznościach technicznych w ciągu ostatnich 2 tygodni”. Jev to w gruncie rzeczy klasyfikator tekstu. Jest szybszy i tańszy w klasyfikacji niż ogólne LLM, a przy tym bardziej ogólny niż modele do konkretnych zadań. Raschka zastrzega, że nie jest związany z Jev i nie ma do niego darmowego dostępu.

Repozytorium jeeves od PostHog, zaktualizowane 29 września, dokłada do tego wzorca rozumowanie. Jeeves to model 9B w stylu Jev zbudowany na Qwen3.5-9B z LoRA i głową pointer, trenowany metodami SFT i CISPO. Na odłożonym zbiorze testowym raportuje 0,889 ogólnie wobec 0,857 dla Jev i 0,822 dla Kev-9B, a na publicznych poziomach JevBench 0,935 wobec 0,866 dla Jev. Myślenie kosztuje czas: około 3,3 sekundy mediany na żądanie na jednym H100 w fp8, wobec 0,3 sekundy bez niego.

Liczby nie wskazują jednego kierunku. Jeeves bije Jev ogólnie, ale przegrywa na Transfer (0,746 wobec 0,800) i na MMLU-Pro 10-way (0,739 wobec 0,840). Odpowiada też na 5,5% pytań bez odpowiedzi przy p ≥ 0,9, lepiej niż Jev z 9,0%, ale gorzej niż Kev-9B z 0,0%.

Prognozy rynkowe dla tej kategorii mocno się rozjeżdżają i lepiej to odnotować, niż uśredniać. MarketsandMarkets wycenia rynek SLM na 930 000 000 USD w 2025 roku, rosnąco do 5 450 000 000 USD w 2032 przy CAGR 28,7%, a wizr.ai podaje 7 760 000 000 USD w 2023 roku i wzrost 15,6% od 2024 do 2030. Te dwa szacunki opisują rynki o różnej wielkości.

To, co sugeruje para premier z 29 września, jest węższe i bardziej konkretne: przy pracy w kształcie klasyfikacji sam format wyjścia przeprojektowuje się wokół prawdopodobieństw, nie prozy.

Komentarze 0

Źródła

6
  1. 01d1: Liquid AI's First Decision ModelEN
  2. 02Qevi-2B: A Jev-style finetuned model for image classificationEN
  3. 03Jeeves. Reasoning improves Jev-like decision modelsEN
  4. 04Language Models for Text Classification: From Bag-of-Words to JevEN
  5. 05Small Language Model Development: Lower Cost, More PrivacyEN
  6. 06The Rise of Small Language Models in Enterprise AI Adoption [2026]EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Anna Kaczmarek

Anna Kaczmarek

AI, modele i technologie

Anna Kaczmarek pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, repozytoriach i danych źródłowych, a nie na komunikatach prasowych. Przy testach modeli sprawdza karty techniczne, parametry wejściowe i liczy wyniki na tych samych zbiorach, zamiast powtarzać liczby od producentów. Czeka na premiery API i aktualizacje wag, rozmawia z inżynierami oraz porównuje wersje modeli pod kątem kosztów i opóźnień. Prywatnie self-hostuje usługi i konfiguruje sieci domowe, więc do redakcji wnosi praktykę z własnego serwera. Nie publikuje zapowiedzi ani parametrów, których nie może odtworzyć na własnym środowisku.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.