Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Małe modele na urządzeniu: 91% sygnałów z entropii tokenów bezużytecznych, twierdzi preprint

W małych modelach językowych poniżej 3 mld parametrów sygnały pewności na poziomie pojedynczych tokenów są praktycznie ślepe. Preprint na arXiv z 21 lipca wykazał średnią entropię tokenów bliską zeru w 91% kombinacji zbiorów danych i modeli, niezależnie od tego, czy odpowiedź była poprawna.

AI i modeleAnalizaMarta ZielińskaOpublikowano: 28 września 20264 min czytaniaŹródła 6
Małe modele na urządzeniu: 91% sygnałów z entropii tokenów bezużytecznych, twierdzi preprint

Pracę napisał Prashant Mudgal. Przetestował siedem metod na 7 parach modeli i 5 standardowych testach NLU, wszystko na sprzęcie konsumenckim. Wniosek jest ostry: wczesne zatrzymywanie na podstawie entropii tokenów nie działa w tej skali. Entropia semantyczna, liczona przez generowanie wielu próbek i grupowanie odpowiedzi według znaczenia, daje użyteczny sygnał. Gdy niepewne zapytania trafiały do większego modelu eksperckiego, dokładność rosła nawet o 50 punktów procentowych.

Routing między rodzinami modeli dał średnio +22,0% wobec +6,8% dla par z tej samej rodziny. Podany przykład to SmolLM 360M przekazujący zadanie do Phi-3.5-mini. Zdaniem autora w małych modelach nie chodzi o zaoszczędzoną moc obliczeniową, ale o tę, którą się przydziela.

Dlaczego praca na urządzeniu wciąż rośnie

Wybór momentu ma znaczenie. 27 września Nvidia udostępniła Nemotron 3 Diarization, model o około 100 mln parametrów, który rozpoznaje, kto mówi w rozmowie. Wagi można pobrać za darmo, informuje The Decoder. Model rozdziela do ośmiu mówców i oznacza nakładającą się mowę. W Diarization-Bench od VoiceArena zajmuje obecnie pierwsze miejsce z błędem 14,72 procent, przed następnym najlepszym systemem z 19,3 procent. W połączeniu z systemem rozpoznawania mowy, na przykład Parakeet, tworzy transkrypcje z anonimowymi etykietami mówców. Wskaźniki błędów rosną przy większej liczbie uczestników, szumie w tle lub pogłosie.

Opóźnienie to kompromis projektowy, nie darmowa wygrana. Bufor audio można ustawić na czterech poziomach od 30,4 sekundy do 0,32 sekundy, a krótsze bufory zwykle obniżają dokładność. Nvidia podaje, że model zmniejsza wskaźnik błędów średnio o 41 procent w ośmiu scenariuszach testowych wobec poprzednika Streaming Sortformer przy buforze 1,04 sekundy. Takie liczby mają znaczenie, gdy model musi działać lokalnie, a nie w centrum danych.

W tym samym tygodniu pojawił się znacznie większy projekt z dużo węższą tezą o automatyzacji. Zespół z udziałem badaczy z chińskiego Uniwersytetu Fudan opisał własną pracę nad Atria Dawn Preview, agentowym modelem językowym na architekturze mieszanki ekspertów o 744 mld parametrów, podaje The Decoder. Analiza objęła ponad 700 dzienników zadań od 56 uczestników. AI wykorzystano w 96,5 procenta sprawdzonych zadań, a mediana stosunku działań agenta do wkładu człowieka wzrosła z 11 do 28,5 w ciągu czterech tygodni. Autorzy ostrzegają przed czytaniem tego jako autonomii: każda decyzja człowieka uruchamiała po prostu więcej kroków agenta.

Uczestników zapytano, czy daliby radę wykonać swoją część zadania bez AI, w tym samym zakresie i z tą samą jakością. Spośród 455 ukończonych zadań wspieranych przez AI 151 oceniono jako niewykonalne bez AI, mniej więcej jedna trzecia, u 27 z 56 uczestników.

Ludzie nadal podjęli 85,5 procenta decyzji o metodach i parametrach, AI 9,2 procenta, a w 93,4 procenta przypadków człowiek decydował ostatecznie o celach i zakresie. Gdy coś szło nie tak, w 588 zadaniach z zapisaną trudnością 76 procent ruszyło dalej dzięki interwencji człowieka, a 23 procent agent rozwiązał sam. Praca ostrzega, że gdy każda decyzja opiera się na dłuższym łańcuchu działań agenta, niż człowiek jest w stanie przejrzeć, nadzór zamienia się w odbijanie pieczątek.

Tanie modele, drogie pytania

Koszt zmienia to, które modele w ogóle się używa. CNBC podało 26 września, że chińskie modele odpowiadały za 57% do 67% tokenów zużytych na OpenRouter w tygodniu 14 września, wobec 6% do 13% w lutym, a w sierpniu sięgnęły 55% tokenów na Vercel, z 11% w styczniu. Peter Walker, szef działu analiz w OpenRouter, powiedział CNBC, że chińskie modele open source wydane w tym roku radzą sobie z zaawansowanymi zadaniami agentowymi, zwłaszcza z kodowaniem, w sposób niemożliwy jeszcze pod koniec 2025 roku, i są tanie na tle większości modeli z amerykańskich laboratoriów. Harpreet Arora, szef infrastruktury agentowej w Vercel, stwierdził, że cena zaczyna przekonywać, gdy model spełnia próg jakości wymagany do danego zadania.

Waszyngton przygląda się temu uważnie. Dwie komisje Izby Reprezentantów badają ten trend, a CNBC zauważa, że amerykańskie modele frontier wciąż przyciągają więcej wydatków ogółem. Daniel Remler z Center for a New American Security powiedział stacji, że obawa dotyczy tego, iż integracja wciąga kraje w chińską sferę technologiczną. Dane cytowane przez CNBC są nierówne: około połowa tokenów na OpenRouter pochodzi od amerykańskich firm, podczas gdy przedsiębiorstwa z 82 krajów, które OpenRouter grupuje jako Globalne Południe, wysyłają 67% swoich tokenów do chińskich modeli.

Małe modele niezręcznie wpisują się w ten spór. Działają na urządzeniu, co omija część argumentów o kontroli eksportu, ale ich niezawodność jest dokładnie tym, co podważa praca z arXiv. Wynik dotyczący routingu sugeruje, że praktyczna odpowiedź to nie lepszy mały model sam w sobie, ale mały model, który wie, kiedy poprosić o pomoc.

Komentarze 0

Źródła

6
  1. 01Do small language models know what they don't know?EN
  2. 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
  3. 03AI agents do more of the work in model development, but humans still make the decisionsEN
  4. 04Chinese AI models surge in global popularity — and Washington is worriedEN
  5. 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
  6. 06OpenAI pauses training of its 'most capable models'EN

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Marta Zielińska

Marta Zielińska

AI, modele i technologie

Marta Zielińska pisze o technologiach, AI i modelach oraz mediach i internecie, opierając się na dokumentacji, preprintach i danych z API, a nie na zapowiedziach producentów. Przy każdej publikacji sprawdza karty modeli, parametry treningowe i benchmarki, a liczby porównuje z niezależnymi testami i wynikami z repozytoriów. Rozmawia z badaczami i inżynierami, czeka na kolejne wydania modeli i zestawia ich działanie z wcześniejszymi wersjami. Prywatnie drukuje w 3D, naprawia stare komputery i sprawdza, jak modele uczą się na śmieciach z internetu. Nie publikuje wyników, których nie może odtworzyć na własnym sprzęcie.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.