Małe modele językowe wchodzą na urządzenia, ale sygnały pewności zostają w tyle
Rodzina OpenELM od Apple obejmuje od 270 mln do 3 mld parametrów, a Google dostarcza teraz Gemma 3n z wejściami tekstowymi, obrazowymi, wideo i audio. Praca na arXiv z 2026 roku podaje jednak, że entropia na poziomie tokenów jest praktycznie ślepa w modelach poniżej 3 mld parametrów.

Małe modele językowe działające na urządzeniach przestały być ciekawostką badawczą. W ciągu dwóch lat przeszły od wag na Hugging Face do gotowych bibliotek z wyszukiwaniem informacji, wywoływaniem funkcji i wejściami multimodalnymi. Obietnica jest spójna: trzymać wnioskowanie na telefonie lub laptopie, ciąć koszty serwerów i zostawić dane użytkownika lokalnie.
Nie nadążyły za tym narzędzia, które mówią tym modelom, kiedy się mylą.
Od ośmiu małych modeli do biblioteki
Apple otworzył tę fazę 24 kwietnia 2024 roku. Udostępnił wtedy osiem modeli językowych z dostępnym kodem źródłowym pod nazwą OpenELM, skrótem od Open-source Efficient Language Models, jak podaje Ars Technica. Modele miały od 270 mln do 3 mld parametrów i dzieliły się na cztery warianty wstępnie wytrenowane oraz cztery dostrojone instrukcjami. Dla skali Ars Technica zauważyła, że rodzina Llama 3 od Meta sięgała wtedy 70 mld parametrów, a wersja 400 mld była w przygotowaniu. GPT-3 od OpenAI z 2020 roku miał 175 mld.
Apple nie mówił tylko o rozmiarze. Firma twierdziła, że jej strategia skalowania warstwa po warstwie rozdzielała parametry efektywniej między warstwy. Biała księga podawała poprawę dokładności o 2,36 procent względem OLMo 1B od Allen AI przy połowie tokenów wstępnego treningu. Apple opublikował też bibliotekę treningową CoreNet i powtarzalne przepisy treningowe, co Ars Technica nazwała nietypowym dla dużej firmy technologicznej. Modele miały okno kontekstu 2 048 tokenów i trenowały na RefinedWeb, zdeduplikowanym PILE, podzbiorze RedPajama i podzbiorze Dolma v1.6, co daje około 1,8 bln tokenów.
Istnieje możliwość, że modele te będą generować wyniki niedokładne, szkodliwe, stronnicze lub nieodpowiednie w reakcji na prompty użytkowników, ostrzegł Apple w swojej pracy, cytowany przez Ars Technica.
To zastrzeżenie ma większe znaczenie, gdy modele wychodzą z laboratorium.
Google zamienia SLM w platformę
W maju 2025 roku narracja zmieniła się z udostępniania modeli na wspieranie ekosystemu. Zespół AI Edge od Google podał, że rozszerzył wsparcie na urządzeniach z czterech początkowych modeli do ponad tuzina. Nowe modele trafiły do społeczności LiteRT na Hugging Face, w tym Gemma 3 i Gemma 3n.
Gemma 3n pojawiła się jako wczesny podgląd. Google opisał ją jako pierwszy multimodalny mały model językowy Gemmy na urządzenia, z wariantami 2B i 4B obsługującymi tekst, obraz, wideo i audio. Modalności tekstowa i obrazowa były dostępne na Hugging Face, a audio miało dołączyć później. Firma wskazała też Gemma 3 1B o rozmiarze 529 megabajtów. Według Google model ten mógł działać do 2 585 tokenów na sekundę w trybie pre-fill na mobilnym GPU, co wystarcza na przetworzenie strony treści w mniej niż sekundę.
Ważniejsza część ogłoszenia dotyczyła infrastruktury. Google dostarczył bibliotekę wyszukiwania rozszerzonego o generowanie (RAG) działającą na urządzeniu, dostępną na Androidzie od premiery, oraz bibliotekę wywoływania funkcji na urządzeniu, również najpierw na Androida. Biblioteka RAG pozwala modelowi korzystać z danych konkretnej aplikacji bez dostrajania. Google twierdził, że potrafi wydobyć najistotniejsze fragmenty z 1 000 stron informacji lub 1 000 zdjęć. Biblioteka wywoływania funkcji pozwala modelowi decydować, kiedy wywołać zdefiniowane funkcje lub API. Przykładowa aplikacja Google pokazuje wypełnianie formularza z dyktowanej mowy, zamianę głosu na tekst, wyodrębnianie pól i wywoływanie funkcji aplikacji.
Google opisał też nowe schematy kwantyzacji po treningu int4. Według firmy mogą one zmniejszyć rozmiar modelu od 2,5 do 4 razy w porównaniu z bf16, obniżając przy tym opóźnienie i szczytowe zużycie pamięci. To właśnie takie szczegóły inżynieryjne decydują, czy model trafi na rynek, czy zostanie demem.
SlimLM i test na Samsungu
Prace akademickie biegły równolegle. Praca przesłana na arXiv 15 listopada 2024 roku, poprawiana do 25 listopada, przedstawiła SlimLM, serię małych modeli językowych zoptymalizowanych do pomocy przy dokumentach na urządzeniach mobilnych. Autorzy, Thang M. Pham, Phat T. Nguyen, Seunghyun Yoon, Viet Dac Lai, Franck Dernoncourt i Trung Bui, przeprowadzili eksperymenty na Samsungu Galaxy S24. Sprawdzili, jak wypadają kompromisy między rozmiarem modelu, od 125M do 7B parametrów, długością kontekstu i czasem wnioskowania.
SlimLM był wstępnie trenowany na SlimPajama-627B i dostrojony na DocAssist, zbiorze danych, który autorzy zbudowali do streszczania, odpowiadania na pytania i zadań sugerowania. Streszczenie mówi, że najmniejszy model działał wydajnie na S24, a większe warianty oferowały więcej możliwości w granicach mobilnych. Praca wypadła też korzystnie na tle istniejących małych modeli językowych. Autorzy udostępnili aplikację na Androida. Korzyść opisali jako niższe koszty serwerów i lepszą prywatność dzięki przetwarzaniu na urządzeniu.
Problem z pewnością
Pozostaje pytanie, czy te modele wiedzą, czego nie wiedzą. Prashant Mudgal przesłał na arXiv 21 lipca 2026 roku pracę o sygnałach pewności opartych na entropii w małych modelach językowych poniżej 3 mld parametrów, działających w całości na sprzęcie konsumenckim. Ocenił siedem podejść na 7 parach modeli i 5 standardowych testach NLU.
Główny wniosek jest niewygodny. Entropia na poziomie tokenów była praktycznie ślepa: w 91 procent kombinacji zbioru danych i modelu średnia entropia tokenów była bliska zeru niezależnie od tego, czy odpowiedź była poprawna. Według pracy czyni to sygnały pewności oparte na tokenach bezużytecznymi w tej skali.
Entropia semantyczna wypadła lepiej. Metoda generuje wiele próbek, grupuje odpowiedzi według znaczenia i mierzy niepewność rozkładu, dzięki czemu odzyskała użyteczny sygnał pewności. Użycie go do kierowania niepewnych zapytań do większego modelu eksperckiego dało poprawę dokładności do 50 punktów procentowych. Kierowanie między rodzinami, praca podaje przykład SmolLM 360M do Phi-3.5-mini, dało średnio poprawę 22,0 procent wobec 6,8 procent dla kierowania w obrębie rodziny. Wniosek autora jest taki, że wartością metod entropijnych w małych modelach nie są oszczędności obliczeniowe, lecz inteligentne rozdzielanie mocy obliczeniowej. Więcej tokenów trafia tam, gdzie mają największe znaczenie.
Rozumowanie bez słów
Osobny nurt prac pyta, czy małe modele muszą w ogóle zapisywać swoje rozumowanie. Science News podało 22 września 2026 roku, że mały system eksperymentalny o nazwie BDH-CQ, gdzie DH oznacza Dragon Hatchling, potrafi rozwiązać niektóre łamigłówki rozumowania bez rozpisywania kroków pośrednich. Praca została przesłana na arXiv 10 sierpnia i nie przeszła recenzji naukowej.
Zamiast trzymać przykłady w kontekście, BDH-CQ używa każdego przykładu do aktualizacji pamięci o stałym rozmiarze. Zuzanna Stamirowska, badaczka złożoności i dyrektor generalna firmy AI Pathway, powiedziała Science News, że gdy zapytanie nadchodzi, model w ogóle nie zapisuje swojego myślenia słowami. „Nic pośredniego nigdy nie zamienia się w język”, stwierdziła.
Stamirowska i współpracownicy podali, że model rozwiązał prawie trzy na dziesięć łamigłówek w publicznym zestawie ewaluacyjnym ARC-AGI-1, gdy dano mu dwie próby. Poradził sobie z niektórymi zadaniami obracania i przesuwania kształtów, ale miał trudności ze zmianami kolorów i niektórymi kombinacjami reguł. Lepiej wypadł na trudniejszych łamigłówkach porządkowania i zagnieżdżania po zobaczeniu przykładu o podobnym poziomie trudności.
Twierdzenie o koszcie jest uderzające. Badacze szacują, że każde zapytanie do łamigłówki kosztuje około 0,00070 dolara, mniej więcej jedną jedenastą tego co GPT-5.6 Luna na tym samym benchmarku. Science News zauważa jednak, że oba koszty liczono inaczej. Reakcja zewnętrznych badaczy była powściągliwa. Yuntian Deng z University of Waterloo nazwał to ciekawym wynikiem wydajnościowym, ale powiedział, że nie pokazuje, iż sama architektura jest lepsza od innych podejść. Zauważył też, że bez rozpisania rozumowania model trudniej zbadać. Jonas Geiping z ELLIS Institute Tübingen i Max Planck Institute for Intelligent Systems powiedział, że model zbudowano specjalnie pod zadania w stylu ARC, co utrudnia bezpośrednie porównanie z systemami ogólnego przeznaczenia. Nazwał jednak podejście zgrabnym i zauważył, że potrafi ono mierzyć się z zadaniami testowymi bez ponownego treningu.
Wdrożenia wyprzedzają rozumienie
Bouncer od Imbue, filtr kanału na Twitterze opublikowany 8 kwietnia 2026 roku, pokazuje, jak wdrożenie wygląda w praktyce. Narzędzie klasyfikuje posty za pomocą modelu open source, który wpis na blogu nazywa Gemma 4 26B-A4B. Według wpisu jest dość duży, by rozumieć kontekst, a zarazem dość mały, by nadążyć za tempem przewijania. Imbue podaje, że obecnie serwuje model z własnego centrum danych, pracując nad uruchomieniem go bezpośrednio na laptopach i telefonach. Bouncer jest dostępny jako rozszerzenie do Chrome, dodatek do Firefoksa i aplikacja na iPhone'a, z obiecanym wsparciem Reddita, LinkedIn i Safari.
Wzorzec w tych projektach jest spójny. Możliwości i dystrybucja posuwają się szybciej niż ewaluacja. Apple dostarczył wagi ze szczerym zastrzeżeniem o niedokładnych lub stronniczych wynikach. Google dostarczył wyszukiwanie i wywoływanie funkcji, żeby modele mogły działać na danych aplikacji. SlimLM przetestował zadania dokumentowe na prawdziwym sprzęcie. Praca Mudgala wykazała, że najtańszy sygnał pewności nie działa poniżej 3 mld parametrów, a droższy tak. BDH-CQ sugeruje, że część rozumowania może zachodzić bez języka, choć badacze ostrzegają, że niewypowiedziane rozumowanie trudniej kontrolować.
Źródła
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Can AI reason without words? A small model puts the idea to the testEN
- 06Show HN: Control your X/Twitter feed using a small on-device LLMEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.