Małe modele na urządzeniu: 91% sygnałów z entropii tokenów bezużytecznych, twierdzi preprint
W małych modelach językowych poniżej 3 mld parametrów sygnały pewności na poziomie pojedynczych tokenów są praktycznie ślepe. Preprint na arXiv z 21 lipca wykazał średnią entropię tokenów bliską zeru w 91% kombinacji zbiorów danych i modeli, niezależnie od tego, czy odpowiedź była poprawna.

Pracę napisał Prashant Mudgal. Przetestował siedem metod na 7 parach modeli i 5 standardowych testach NLU, wszystko na sprzęcie konsumenckim. Wniosek jest ostry: wczesne zatrzymywanie na podstawie entropii tokenów nie działa w tej skali. Entropia semantyczna, liczona przez generowanie wielu próbek i grupowanie odpowiedzi według znaczenia, daje użyteczny sygnał. Gdy niepewne zapytania trafiały do większego modelu eksperckiego, dokładność rosła nawet o 50 punktów procentowych.
Routing między rodzinami modeli dał średnio +22,0% wobec +6,8% dla par z tej samej rodziny. Podany przykład to SmolLM 360M przekazujący zadanie do Phi-3.5-mini. Zdaniem autora w małych modelach nie chodzi o zaoszczędzoną moc obliczeniową, ale o tę, którą się przydziela.
Dlaczego praca na urządzeniu wciąż rośnie
Wybór momentu ma znaczenie. 27 września Nvidia udostępniła Nemotron 3 Diarization, model o około 100 mln parametrów, który rozpoznaje, kto mówi w rozmowie. Wagi można pobrać za darmo, informuje The Decoder. Model rozdziela do ośmiu mówców i oznacza nakładającą się mowę. W Diarization-Bench od VoiceArena zajmuje obecnie pierwsze miejsce z błędem 14,72 procent, przed następnym najlepszym systemem z 19,3 procent. W połączeniu z systemem rozpoznawania mowy, na przykład Parakeet, tworzy transkrypcje z anonimowymi etykietami mówców. Wskaźniki błędów rosną przy większej liczbie uczestników, szumie w tle lub pogłosie.
Opóźnienie to kompromis projektowy, nie darmowa wygrana. Bufor audio można ustawić na czterech poziomach od 30,4 sekundy do 0,32 sekundy, a krótsze bufory zwykle obniżają dokładność. Nvidia podaje, że model zmniejsza wskaźnik błędów średnio o 41 procent w ośmiu scenariuszach testowych wobec poprzednika Streaming Sortformer przy buforze 1,04 sekundy. Takie liczby mają znaczenie, gdy model musi działać lokalnie, a nie w centrum danych.
W tym samym tygodniu pojawił się znacznie większy projekt z dużo węższą tezą o automatyzacji. Zespół z udziałem badaczy z chińskiego Uniwersytetu Fudan opisał własną pracę nad Atria Dawn Preview, agentowym modelem językowym na architekturze mieszanki ekspertów o 744 mld parametrów, podaje The Decoder. Analiza objęła ponad 700 dzienników zadań od 56 uczestników. AI wykorzystano w 96,5 procenta sprawdzonych zadań, a mediana stosunku działań agenta do wkładu człowieka wzrosła z 11 do 28,5 w ciągu czterech tygodni. Autorzy ostrzegają przed czytaniem tego jako autonomii: każda decyzja człowieka uruchamiała po prostu więcej kroków agenta.
Uczestników zapytano, czy daliby radę wykonać swoją część zadania bez AI, w tym samym zakresie i z tą samą jakością. Spośród 455 ukończonych zadań wspieranych przez AI 151 oceniono jako niewykonalne bez AI, mniej więcej jedna trzecia, u 27 z 56 uczestników.
Ludzie nadal podjęli 85,5 procenta decyzji o metodach i parametrach, AI 9,2 procenta, a w 93,4 procenta przypadków człowiek decydował ostatecznie o celach i zakresie. Gdy coś szło nie tak, w 588 zadaniach z zapisaną trudnością 76 procent ruszyło dalej dzięki interwencji człowieka, a 23 procent agent rozwiązał sam. Praca ostrzega, że gdy każda decyzja opiera się na dłuższym łańcuchu działań agenta, niż człowiek jest w stanie przejrzeć, nadzór zamienia się w odbijanie pieczątek.
Tanie modele, drogie pytania
Koszt zmienia to, które modele w ogóle się używa. CNBC podało 26 września, że chińskie modele odpowiadały za 57% do 67% tokenów zużytych na OpenRouter w tygodniu 14 września, wobec 6% do 13% w lutym, a w sierpniu sięgnęły 55% tokenów na Vercel, z 11% w styczniu. Peter Walker, szef działu analiz w OpenRouter, powiedział CNBC, że chińskie modele open source wydane w tym roku radzą sobie z zaawansowanymi zadaniami agentowymi, zwłaszcza z kodowaniem, w sposób niemożliwy jeszcze pod koniec 2025 roku, i są tanie na tle większości modeli z amerykańskich laboratoriów. Harpreet Arora, szef infrastruktury agentowej w Vercel, stwierdził, że cena zaczyna przekonywać, gdy model spełnia próg jakości wymagany do danego zadania.
Waszyngton przygląda się temu uważnie. Dwie komisje Izby Reprezentantów badają ten trend, a CNBC zauważa, że amerykańskie modele frontier wciąż przyciągają więcej wydatków ogółem. Daniel Remler z Center for a New American Security powiedział stacji, że obawa dotyczy tego, iż integracja wciąga kraje w chińską sferę technologiczną. Dane cytowane przez CNBC są nierówne: około połowa tokenów na OpenRouter pochodzi od amerykańskich firm, podczas gdy przedsiębiorstwa z 82 krajów, które OpenRouter grupuje jako Globalne Południe, wysyłają 67% swoich tokenów do chińskich modeli.
Małe modele niezręcznie wpisują się w ten spór. Działają na urządzeniu, co omija część argumentów o kontroli eksportu, ale ich niezawodność jest dokładnie tym, co podważa praca z arXiv. Wynik dotyczący routingu sugeruje, że praktyczna odpowiedź to nie lepszy mały model sam w sobie, ale mały model, który wie, kiedy poprosić o pomoc.
Źródła
6- 01Do small language models know what they don't know?EN
- 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
- 03AI agents do more of the work in model development, but humans still make the decisionsEN
- 04Chinese AI models surge in global popularity — and Washington is worriedEN
- 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
- 06OpenAI pauses training of its 'most capable models'EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.