I piccoli modelli linguistici arrivano sui dispositivi: Apple, Google, Imbue e Cactus spingono l'AI locale
Apple, Google e diversi fornitori più piccoli stanno portando piccoli modelli linguistici su telefoni, laptop e dispositivi indossabili. La scommessa è che l'inferenza possa girare in locale invece che in un data center.

Ad aprile 2024 Apple ha rilasciato otto piccoli modelli linguistici con codice sorgente disponibile, sotto il nome OpenELM. Vanno da 270 milioni a 3 miliardi di parametri, secondo Ars Technica. I modelli sono stati pubblicati su Hugging Face con la licenza Apple Sample Code License. Ars Technica ha osservato che la licenza potrebbe non rispettare la definizione comunemente accettata di open source, per via di alcune restrizioni, anche se il codice sorgente è disponibile.
Quattro degli otto sono preaddestrati e quattro sono ottimizzati per le istruzioni. Condividono una finestra di contesto massima di 2.048 token. I dati di addestramento: RefinedWeb, una versione deduplicata di PILE, un sottoinsieme di RedPajama e un sottoinsieme di Dolma v1.6. Apple afferma che il totale è di circa 1,8 trilioni di token.
Il white paper di Apple sostiene che una strategia di scaling layer-wise ha dato a OpenELM un miglioramento di accuratezza del 2,36 per cento rispetto a OLMo 1B di Allen AI, usando la metà dei token di preaddestramento. L'azienda ha anche rilasciato CoreNet, la libreria di addestramento, più ricette di addestramento riproducibili, così che i pesi possano essere replicati. Ars Technica ha descritto la cosa come insolita, all'epoca, per una grande azienda tecnologica.
I conteggi dei parametri sono una misura approssimativa delle capacità, e i modelli di Apple restano ben sotto i sistemi più grandi. La famiglia Llama 3 di Meta aveva raggiunto 70 miliardi di parametri, con una versione da 400 miliardi in preparazione. GPT-3 di OpenAI è arrivato con 175 miliardi nel 2020. La scommessa della ricerca è che i modelli piccoli possano ora eguagliare ciò che modelli molto più grandi facevano pochi anni fa.
Google aggiunge modalità, RAG e function calling
Il team AI Edge di Google ha dichiarato il 20 maggio 2025 di aver ampliato il supporto ai piccoli modelli linguistici su dispositivo: dai quattro modelli iniziali a più di una dozzina, tra cui Gemma 3 e Gemma 3n, ospitati su una nuova community LiteRT su Hugging Face. Gemma 3n è arrivato come anteprima. Google lo ha descritto come il primo piccolo modello linguistico multimodale su dispositivo della famiglia Gemma, con varianti da 2B e 4B parametri che supportano input testuali, immagini, video e audio. Testo e immagini erano disponibili su Hugging Face per primi, con l'audio in arrivo.
Google ha anche quantificato il lavoro di compressione. Ha affermato che la quantizzazione post-addestramento int4 può ridurre i modelli linguistici di un fattore da 2,5 a 4 volte rispetto a bf16, tagliando al contempo latenza e memoria di picco. Gemma 3 1B, a 529MB, può girare fino a 2.585 token al secondo in pre-fill su una GPU mobile. Google afferma che è sufficiente per elaborare una pagina di contenuti in meno di un secondo.
Insieme ai modelli sono state rilasciate due librerie. La libreria AI Edge RAG, disponibile su Android al lancio, permette a un modello di attingere a dati specifici dell'applicazione senza fine-tuning. Google afferma che può scegliere i pezzi più rilevanti da 1.000 pagine o 1.000 foto. La libreria Function Calling, anch'essa disponibile prima su Android, permette a un modello di decidere quando chiamare funzioni predefinite, con un'app di esempio che compila un modulo medico da dettatura vocale.
La riproducibilità e la trasparenza dei grandi modelli linguistici sono cruciali per far avanzare la ricerca aperta, garantire l'affidabilità dei risultati e consentire indagini su dati e bias dei modelli, oltre che sui rischi potenziali.
Quella frase viene dall'abstract del paper OpenELM di Apple, come citato da Ars Technica. Apple ha anche avvertito che, poiché i modelli sono stati addestrati su dataset di origine pubblica, possono produrre output inaccurati, dannosi, distorti o discutibili. Ars Technica ha riferito che iOS 18, la cui presentazione era attesa a giugno alla WWDC, secondo indiscrezioni avrebbe incluso funzionalità AI su dispositivo, con la possibilità che Apple assumesse Google o OpenAI per l'elaborazione più pesante fuori dal dispositivo.
Benchmark su un telefono e un filtro per il feed
Un paper arXiv del novembre 2024, firmato da ricercatori tra cui Thang M. Pham, ha presentato SlimLM, una serie di modelli ottimizzati per l'assistenza documentale su mobile. Gli autori hanno eseguito esperimenti su un Samsung Galaxy S24 per trovare i compromessi tra dimensione del modello, da 125M a 7B parametri, lunghezza del contesto e tempo di inferenza. SlimLM è stato preaddestrato su SlimPajama-627B e ottimizzato su DocAssist, un dataset costruito dagli autori per attività di riassunto, risposta a domande e suggerimento. Hanno anche rilasciato un'applicazione Android.
Bouncer di Imbue prende un'altra direzione. Pubblicato l'8 aprile 2026 e aggiornato il 25 settembre 2026, filtra un feed X/Twitter a partire da una descrizione in linguaggio naturale, usando un modello open source che l'azienda chiama Gemma 4 26B-A4B. Imbue afferma di servire quel modello dal proprio data center per ora, mentre lavora per farlo girare direttamente su un laptop o un telefono. Bouncer è disponibile come estensione per Chrome, componente aggiuntivo per Firefox e app per iPhone. Il supporto per Reddit, LinkedIn e Safari è elencato come in arrivo.
Needle 3 di Cactus Compute, pubblicato il 18 settembre 2026, va ancora più in piccolo. L'azienda descrive modelli a scala da 29 a 121M di parametri che producono binari CQ2-bit da 9 a 29 MB, con velocità da 400 a 4.000 token al secondo in decode e da 1 a 10.000 token al secondo in prefill su un Raspberry Pi 5. Cactus afferma che la sotto-rete a 4 strati può eguagliare DeepSeek V4 Flash quando viene ottimizzata su attività downstream per un'epoca.
Needle 3 è pensato per chiamate a strumenti, estrazione strutturata ed embedding di testo, con casi d'uso citati in case intelligenti, robot, telefoni, dispositivi indossabili, occhiali AR, auto e PC. Ogni risposta porta un punteggio di confidenza da una testa calibrata. Il motore applica una soglia minima di 0,1, sotto la quale le chiamate vengono trattenute in un campo suppressed_calls.
Un risultato di ricerca va contro l'entusiasmo. Un paper inviato il 21 luglio 2026 da Prashant Mudgal ha scoperto che l'entropia a livello di token è di fatto cieca nei modelli sotto i 3 miliardi di parametri: nel 91 per cento delle combinazioni dataset-modello, l'entropia media dei token era vicina a zero indipendentemente dalla correttezza della risposta. L'entropia semantica, calcolata campionando più risposte e raggruppandole per significato, recuperava un segnale utilizzabile. Instradare le query incerte verso un modello esperto più grande ha migliorato l'accuratezza fino a 50 punti percentuali, con l'instradamento tra famiglie diverse che ha fatto in media +22,0 per cento contro +6,8 per cento per l'instradamento nella stessa famiglia.
L'inquadramento del paper è diretto su cosa significhi per l'inferenza locale. Il valore dei metodi di entropia nei modelli piccoli non sono i risparmi computazionali, sostiene, ma l'allocazione intelligente della potenza di calcolo: spendere più token dove contano di più. Per ora, questo lascia la proposta dell'AI su dispositivo basata su privacy, latenza e costo, con la domanda più difficile dell'affidabilità ancora aperta.
Fonti
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Show HN: Control your X/Twitter feed using a small on-device LLMEN
- 06Show HN: Cactus Needle 3: 8-29MB automation models can match DeepSeek V4 FlashEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.