I piccoli modelli linguistici passano sui dispositivi, la ricerca insegue
La famiglia OpenELM di Apple va da 270 milioni a 3 miliardi di parametri e Gemma 3 1B di Google gira a 529MB, ma un articolo del 2026 rileva che i segnali di confidenza a livello di token sono quasi nulli nel 91% delle combinazioni dataset-modello.

I piccoli modelli linguistici, quelli sotto i 3 miliardi di parametri che girano su un telefono invece che in un data centre, in circa due anni sono passati da curiosità di ricerca a prodotto in commercio. La promessa è semplice: tenere il modello in locale, tagliare i costi dei server, non far finire i dati degli utenti sull'hardware di qualcun altro. Le prove sono più contrastanti di quanto suggerisca il marketing.
Il contributo di Apple è il punto di partenza più chiaro. Il 24 aprile 2024 Ars Technica ha riferito che l'azienda ha pubblicato otto modelli con il nome OpenELM, sigla di Open-source Efficient Language Models, su Hugging Face con licenza Apple Sample Code. Ars Technica ha osservato che la licenza contiene restrizioni che potrebbero non rientrare nella definizione comunemente accettata di open source, anche se il codice sorgente è disponibile. I modelli vanno da 270 milioni a 3 miliardi di parametri, in quattro varianti pre-addestrate e quattro instruction-tuned, con una finestra di contesto massima di 2.048 token. Il white paper di Apple afferma che una "layer-wise scaling strategy" ha prodotto un miglioramento di accuratezza del 2,36 per cento rispetto a OLMo 1B di Allen AI, usando metà dei token di pre-addestramento.
Ars Technica lo ha inserito nel contesto: la famiglia Llama 3 di Meta arrivava allora a 70 miliardi di parametri, con una versione da 400 miliardi in sviluppo, e GPT-3 di OpenAI del 2020 usciva con 175 miliardi. Il numero di parametri è una misura approssimativa, non un verdetto.
Cosa misurano davvero gli articoli sui benchmark
SlimLM, pubblicato su arXiv il 15 novembre 2024, ha seguito una strada più stretta: l'assistenza ai documenti. Gli autori, Thang M. Pham e quattro coautori, hanno testato modelli da 125M a 7B parametri su un Samsung Galaxy S24. Il pre-addestramento è su SlimPajama-627B, il fine-tuning su un dataset che hanno costruito e chiamato DocAssist, per attività di riassunto, risposta a domande e suggerimento. L'abstract rivendica prestazioni comparabili o superiori rispetto ai piccoli modelli esistenti e descrive un'applicazione Android come riferimento di deployment. È un dato utile perché indica insieme l'hardware, il compito e le dimensioni del modello, cosa che la maggior parte delle affermazioni sull'on-device non fa.
Il team AI Edge di Google è andato più largo. In un post sul blog per sviluppatori del 20 maggio 2025, Mark Sherwood, Matthew Chan, Marissa Ikonomidis e Milen Ferev hanno annunciato il supporto a più di una dozzina di modelli, tra cui Gemma 3 e Gemma 3n, ospitati su una nuova community LiteRT su Hugging Face. Gemma 3 1B pesa 529MB e può girare fino a 2.585 token al secondo in pre-fill sulla GPU mobile: secondo Google basta per elaborare fino a una pagina di contenuti in meno di un secondo. Gemma 3n, nelle varianti 2B e 4B, è descritto come il primo piccolo modello linguistico on-device multimodale di Gemma, con supporto per testo, immagini, video e audio, di cui testo e immagini disponibili per primi. Il post introduce anche librerie on-device per RAG e function calling, entrambe disponibili su Android al lancio.
Poi c'è il livello scettico. Un articolo intitolato "Do small language models know what they don't know?" è stato inviato ad arXiv il 21 luglio 2026 da Prashant Mudgal. Valuta sette approcci alla confidenza basata sull'entropia su 7 coppie di modelli e 5 benchmark NLU. Il risultato principale è netto: nei piccoli modelli l'entropia a livello di token è di fatto cieca. Resta vicina allo zero indipendentemente dalla correttezza della risposta nel 91% delle combinazioni dataset-modello. L'entropia semantica, calcolata campionando e raggruppando le risposte per significato, recupera un segnale utilizzabile. Instradare le query incerte verso un modello esperto più grande ha migliorato l'accuratezza fino a 50 punti percentuali: l'instradamento tra famiglie diverse ha una media di +22,0%, contro +6,8% per quello all'interno della stessa famiglia.
Ragionare senza il commento passo passo
Science News ha riferito il 22 settembre 2026 di BDH-CQ, un piccolo sistema sperimentale inviato ad arXiv il 10 agosto che risolve alcuni puzzle di ragionamento senza scrivere i passaggi intermedi. La scienziata della complessità Zuzanna Stamirowska, amministratrice delegata dell'azienda di AI Pathway, ha detto a Science News: "Una volta arrivata la query, il modello non scrive affatto il suo ragionamento a parole." Il modello ha risolto quasi tre puzzle su 10 nel set di valutazione pubblico ARC-AGI-1 con due tentativi. Stamirowska e colleghi stimano che ogni query di un puzzle costi circa 0,00070 dollari, all'incirca un undicesimo di GPT-5.6 Luna sullo stesso benchmark. Science News nota però che i due costi sono stati calcolati in modo diverso e che lo studio non è stato sottoposto a peer review.
Non tutti sono convinti. L'informatico Yuntian Deng dell'Università di Waterloo ha detto a Science News che il risultato è "un interessante risultato di efficienza" ma non dimostra che l'architettura sia migliore di altri approcci, e che senza ragionamento scritto il modello è più difficile da ispezionare. Jonas Geiping dell'Istituto ELLIS di Tubinga e dell'Istituto Max Planck per i Sistemi Intelligenti ha definito l'approccio "elegante", ma ha aggiunto che BDH-CQ è stato costruito appositamente per problemi in stile ARC, il che rende difficile il confronto diretto con sistemi generalisti.
Il deployment sta già correndo più veloce degli articoli. Bouncer di Imbue, un filtro per i feed di Twitter pubblicato l'8 aprile 2026, usa un modello open source che l'azienda chiama Gemma 4 26B-A4B per la classificazione, servito per ora dal data centre di Imbue. L'ingegnere Millan Philipose scrive che il team sta lavorando per farlo girare direttamente su laptop e telefoni. Il divario tra quell'ambizione e un modello da 529MB su un cellulare è il punto in cui sarà messa alla prova gran parte della prossima ondata di affermazioni.
Fonti
6- 01Apple releases eight small AI language models aimed at on-device useEN
- 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
- 03On-device small language models with multimodality, RAG, and Function CallingEN
- 04Do small language models know what they don't know?EN
- 05Can AI reason without words? A small model puts the idea to the testEN
- 06Show HN: Control your X/Twitter feed using a small on-device LLMEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.