Małe modele językowe wchodzą na urządzenia, a badania wciąż za nimi nie nadążają
Rodzina OpenELM od Apple obejmuje od 270 mln do 3 mld parametrów, a Gemma 3 1B od Google działa przy 529MB. Praca z 2026 roku pokazuje jednak, że sygnały pewności na poziomie tokenów są bliskie zeru w 91% kombinacji zbioru danych i modelu.

Małe modele językowe, te poniżej 3 mld parametrów, które mogą działać na telefonie, a nie w centrum danych, w ciągu mniej więcej dwóch lat przeszły od ciekawostki badawczej do gotowego produktu. Obietnica jest prosta: model zostaje lokalnie, koszty serwera spadają, a dane użytkownika nie trafiają na cudzy sprzęt. Dowody są bardziej mieszane, niż sugeruje marketing.
Najczystszym punktem wyjścia jest wkład Apple. 24 kwietnia 2024 roku Ars Technica poinformowała, że firma udostępniła osiem modeli pod nazwą OpenELM, czyli Open-source Efficient Language Models, na Hugging Face na licencji Apple Sample Code License. Ars Technica zauważyła, że licencja zawiera ograniczenia, które mogą nie pasować do powszechnie przyjmowanej definicji open source, choć kod źródłowy jest dostępny. Modele mają od 270 mln do 3 mld parametrów, w czterech wariantach pretrenowanych i czterech dostrojonych instrukcjami, z oknem kontekstu do 2048 tokenów. Biała księga Apple podaje, że „layer-wise scaling strategy” dała poprawę dokładności o 2,36 proc. względem OLMo 1B od Allen AI przy połowie tokenów pretreningowych.
Ars Technica osadziła to w kontekście: rodzina Llama 3 od Meta kończyła się wtedy na 70 mld parametrów, a wersja 400 mld była w przygotowaniu. GPT-3 od OpenAI z 2020 roku miał 175 mld. Liczba parametrów to zgrubna miara, nie wyrok.
Co właściwie mierzą prace benchmarkowe
SlimLM, opublikowany na arXiv 15 listopada 2024 roku, poszedł węższą drogą: pomocy przy dokumentach. Autorzy, Thang M. Pham i czterech współautorów, przetestowali modele od 125M do 7B parametrów na Samsungu Galaxy S24. Najpierw uczyli je na SlimPajama-627B, a potem dostrajali na własnym zbiorze DocAssist do streszczania, odpowiadania na pytania i zadań sugerowania. W streszczeniu twierdzą, że wyniki są porównywalne lub lepsze od istniejących małych modeli, i opisują aplikację na Androida jako wzorzec wdrożenia. To przydatny punkt odniesienia, bo łączy nazwę sprzętu, zadanie i rozmiary modeli, czego większość deklaracji o działaniu na urządzeniu nie robi.
Zespół AI Edge od Google poszedł szerzej. We wpisie na blogu dla deweloperów z 20 maja 2025 roku Mark Sherwood, Matthew Chan, Marissa Ikonomidis i Milen Ferev ogłosili wsparcie dla ponad tuzina modeli, w tym Gemma 3 i Gemma 3n, hostowanych w nowej społeczności LiteRT na Hugging Face. Gemma 3 1B waży 529MB i może osiągnąć do 2585 tokenów na sekundę przy pre-fill na mobilnym GPU, co według Google pozwala przetworzyć do strony treści w mniej niż sekundę. Gemma 3n, w wariantach 2B i 4B, jest opisana jako pierwszy multimodalny mały model językowy Gemmy działający na urządzeniu. Obsługuje tekst, obraz, wideo i dźwięk, przy czym tekst i obraz są dostępne najpierw. Wpis wprowadza też biblioteki RAG i wywoływania funkcji na urządzeniu, obie dostępne na Androidzie od startu.
Jest jeszcze warstwa sceptyczna. Praca zatytułowana „Do small language models know what they don't know?” została zgłoszona na arXiv 21 lipca 2026 roku przez Prashanta Mudgala. Ocenia siedem podejść do pewności opartej na entropii w 7 parach modeli i 5 benchmarkach NLU. Główny wniosek jest dosadny: entropia na poziomie tokenów jest w małych modelach praktycznie ślepa i utrzymuje się blisko zera niezależnie od tego, czy odpowiedź jest poprawna, w 91% kombinacji zbioru danych i modelu. Entropia semantyczna, liczona przez próbkowanie i grupowanie odpowiedzi według znaczenia, odzyskuje użyteczny sygnał. Kierowanie niepewnych zapytań do większego modelu eksperckiego poprawiło dokładność o nawet 50 punktów procentowych. Kierowanie między rodzinami dawało średnio +22,0% wobec +6,8% w obrębie tej samej rodziny.
Rozumowanie bez komentarza na bieżąco
Science News napisało 22 września 2026 roku o BDH-CQ, małym systemie eksperymentalnym zgłoszonym na arXiv 10 sierpnia, który rozwiązuje część zagadek rozumowania bez wypisywania pośrednich kroków. Zuzanna Stamirowska, badaczka złożoności i prezeska firmy AI Pathway, powiedziała Science News: „Gdy zapytanie przychodzi, model w ogóle nie zapisuje swojego myślenia słowami”. Model rozwiązał blisko trzy na 10 zagadek w publicznym zestawie ewaluacyjnym ARC-AGI-1 przy dwóch próbach. Stamirowska i współpracownicy szacują, że jedno zapytanie kosztuje około 0,00070 dolara, czyli mniej więcej jedną jedenastą kosztu GPT-5.6 Luna na tym samym benchmarku. Science News zaznacza jednak, że oba koszty liczono inaczej, a praca nie przeszła recenzji naukowej.
Nie wszystkich to przekonuje. Informatyk Yuntian Deng z Uniwersytetu Waterloo powiedział Science News, że wynik jest „ciekawym rezultatem wydajnościowym”, ale nie dowodzi, że architektura jest lepsza od innych podejść, a bez zapisanego rozumowania model trudniej sprawdzić. Jonas Geiping z Instytutu ELLIS w Tybindze i Instytutu Maxa Plancka ds. Inteligentnych Systemów nazwał podejście „zgrabnym”, ale stwierdził, że BDH-CQ powstał specjalnie do zadań w stylu ARC, co utrudnia bezpośrednie porównanie z systemami ogólnego przeznaczenia.
Wdrożenia już wyprzedzają prace naukowe. Bouncer od Imbue, filtr kanału na Twitterze opublikowany 8 kwietnia 2026 roku, używa modelu open source, który firma nazywa Gemma 4 26B-A4B, do klasyfikacji. Na razie serwuje go z własnego centrum danych Imbue. Inżynier Millan Philipose pisze, że zespół pracuje nad uruchomieniem go bezpośrednio na laptopach i telefonach. Luka między tą ambicją a modelem o rozmiarze 529MB na telefonie to miejsce, w którym sprawdzi się większość kolejnej rundy deklaracji.
Źródła
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Can AI reason without words? A small model puts the idea to the testEN
- 06Show HN: Control your X/Twitter feed using a small on-device LLMEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.