Małe modele językowe przenoszą się na urządzenia: Apple, Google, Imbue i Cactus stawiają na lokalną AI
Apple, Google i grupa mniejszych dostawców pchają małe modele językowe na telefony, laptopy i urządzenia noszone. Zakładają, że wnioskowanie może działać lokalnie, a nie w centrum danych.

W kwietniu 2024 roku Apple wydało osiem małych modeli językowych z dostępnym kodem źródłowym pod nazwą OpenELM. Mają od 270 mln do 3 mld parametrów, podaje Ars Technica. Modele opublikowano na Hugging Face na licencji Apple Sample Code License. Ars Technica zauważyła, że licencja może nie spełniać powszechnie przyjętej definicji open source z powodu ograniczeń, choć kod źródłowy jest dostępny.
Cztery z ośmiu modeli są wstępnie wytrenowane, cztery dostrojone do instrukcji. Wszystkie mają okno kontekstu o maksymalnej długości 2 048 tokenów. Dane treningowe to RefinedWeb, odduplikowana wersja PILE, podzbiór RedPajama i podzbiór Dolma v1.6. Apple twierdzi, że daje to w sumie około 1,8 bln tokenów.
Biała księga Apple'a utrzymuje, że strategia skalowania warstwowego dała OpenELM poprawę dokładności o 2,36 procent względem OLMo 1B od Allen AI, przy połowie tokenów wstępnego treningu. Firma wydała też CoreNet, bibliotekę treningową, oraz powtarzalne przepisy treningowe, dzięki którym wagi można odtworzyć. Ars Technica opisała to jako nietypowe jak na dużą firmę technologiczną w tamtym czasie.
Liczba parametrów to zgrubna miara możliwości, a modele Apple'a plasują się znacznie poniżej największych systemów. Rodzina Llama 3 od Meta osiągnęła 70 mld parametrów, a w przygotowaniu była wersja z 400 mld. GPT-3 od OpenAI trafił na rynek w 2020 roku ze 175 mld. Założenie badawcze jest takie, że małe modele potrafią dziś dorównać temu, co kilka lat temu robiły znacznie większe.
Google dodaje modalności, RAG i wywoływanie funkcji
Zespół AI Edge w Google poinformował 20 maja 2025 roku, że rozszerzył wsparcie dla małych modeli językowych działających na urządzeniach z czterech początkowych modeli do ponad dwunastu. Wśród nich są Gemma 3 i Gemma 3n, hostowane w nowej społeczności LiteRT na Hugging Face. Gemma 3n pojawiła się jako wczesny podgląd. Opisano ją jako pierwszy multimodalny mały model językowy Gemmy działający na urządzeniu, w wariantach z 2B i 4B parametrów obsługujących tekst, obraz, wideo i dźwięk. Tekst i obraz były dostępne na Hugging Face najpierw, dźwięk miał dołączyć później.
Google podało też liczby dotyczące kompresji. Firma twierdzi, że kwantyzacja int4 po treningu może zmniejszyć modele językowe od 2,5 do 4 razy względem bf16, skracając jednocześnie opóźnienie i szczytowe zużycie pamięci. Gemma 3 1B, ważąca 529MB, osiąga do 2 585 tokenów na sekundę przy pre-fill na mobilnym GPU. Google twierdzi, że to wystarczy, by przetworzyć stronę treści w mniej niż sekundę.
Wraz z modelami wydano dwie biblioteki. Biblioteka AI Edge RAG, dostępna na Androidzie od premiery, pozwala modelowi korzystać z danych specyficznych dla aplikacji bez dostrajania. Google twierdzi, że potrafi wybrać najistotniejsze fragmenty z 1 000 stron lub 1 000 zdjęć. Biblioteka Function Calling, również najpierw na Androida, pozwala modelowi zdecydować, kiedy wywołać zdefiniowane funkcje, a przykładowa aplikacja wypełnia formularz medyczny z dyktowanej mowy.
Powtarzalność i przejrzystość dużych modeli językowych są kluczowe dla rozwoju otwartych badań, zapewnienia wiarygodności wyników oraz umożliwienia dociekań w sprawie uprzedzeń danych i modeli, a także potencjalnych zagrożeń.
Ten fragment pochodzi ze streszczenia pracy o OpenELM firmy Apple, cytowanego przez Ars Technica. Apple ostrzegło też, że ponieważ modele trenowano na publicznie dostępnych zbiorach danych, mogą generować wyniki niedokładne, szkodliwe, stronnicze lub nieodpowiednie. Ars Technica podała, że iOS 18, którego premiery oczekiwano w czerwcu na WWDC, miał według plotek zawierać funkcje AI działające na urządzeniu. Możliwe też, że Apple zleciłby Google lub OpenAI cięższe przetwarzanie poza urządzeniem.
Benchmarki na telefonie i filtr do twojego feedu
Praca na arXiv z listopada 2024 roku, której autorami są między innymi Thang M. Pham, przedstawiła SlimLM, serię modeli dostrojonych do pomocy przy dokumentach na urządzeniach mobilnych. Autorzy przeprowadzili eksperymenty na Samsungu Galaxy S24, żeby znaleźć kompromisy między rozmiarem modelu, od 125M do 7B parametrów, długością kontekstu a czasem wnioskowania. SlimLM wstępnie wytrenowano na SlimPajama-627B i dostrojono na DocAssist, zbiorze danych zbudowanym przez autorów do streszczania, odpowiadania na pytania i zadań sugerowania. Wydali też aplikację na Androida.
Bouncer od Imbue podchodzi do tego inaczej. Opublikowany 8 kwietnia 2026 roku i zaktualizowany 25 września 2026 roku, filtruje feed X/Twitter na podstawie opisu w prostym języku, używając otwartego modelu, który firma nazywa Gemma 4 26B-A4B. Imbue twierdzi, że na razie serwuje ten model z własnego centrum danych, pracując nad uruchomieniem go bezpośrednio na laptopie lub telefonie. Bouncer jest dostępny jako rozszerzenie do Chrome, dodatek do Firefoksa i aplikacja na iPhone'a. Wsparcie dla Reddita, LinkedIna i Safari wymieniono jako planowane.
Needle 3 od Cactus Compute, opublikowany 18 września 2026 roku, schodzi jeszcze niżej. Firma opisuje modele o 29-121M parametrów ułożonych progami, produkujące binaria CQ2 o rozmiarze od 9 do 29 MB, z szybkością od 400 do 4 000 tokenów na sekundę przy dekodowaniu i od 1 do 10 000 tokenów na sekundę przy prefill na Raspberry Pi 5. Cactus twierdzi, że czterowarstwowa podsieć potrafi dorównać DeepSeek V4 Flash, gdy dostroi się ją do zadań końcowych przez jedną epokę.
Needle 3 celuje w wywołania narzędzi, ekstrakcję strukturalną i osadzanie tekstu, z cytowanymi zastosowaniami w inteligentnych domach, robotach, telefonach, urządzeniach noszonych, okularach AR, samochodach i komputerach. Każda odpowiedź niesie wynik pewności z kalibrowanej głowy. Silnik stosuje próg 0,1, poniżej którego wywołania trafiają do pola suppressed_calls.
Jeden wynik badań idzie pod prąd entuzjazmowi. Praca złożona 21 lipca 2026 roku przez Prashanta Mudgala wykazała, że entropia na poziomie tokenów jest praktycznie ślepa w modelach poniżej 3 mld parametrów: w 91 procent kombinacji zbioru danych i modelu średnia entropia tokenów była bliska zeru niezależnie od tego, czy odpowiedź była poprawna. Entropia semantyczna, liczona przez próbkowanie wielu odpowiedzi i grupowanie ich według znaczenia, odzyskała użyteczny sygnał. Kierowanie niepewnych zapytań do większego modelu eksperckiego poprawiło dokładność nawet o 50 punktów procentowych, a kierowanie między rodzinami modeli dało średnio +22,0 procent wobec +6,8 procent przy kierowaniu w obrębie tej samej rodziny.
Autorzy pracy mówią wprost, co to oznacza dla lokalnego wnioskowania. Wartość metod entropii w małych modelach nie polega na oszczędności obliczeń, argumentują, ale na inteligentnym przydziale mocy obliczeniowej: wydawaniu więcej tokenów tam, gdzie mają największe znaczenie. Na razie oferta AI na urządzeniach opiera się więc na prywatności, opóźnieniu i koszcie, a trudniejsze pytanie o niezawodność pozostaje otwarte.
Źródła
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
- 06Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 FlashEN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.