Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I piccoli modelli linguistici arrivano on-device, ma i segnali di affidabilità restano indietro

La famiglia OpenELM di Apple va da 270 milioni a 3 miliardi di parametri, e Google distribuisce ora Gemma 3n con input testuali, immagini, video e audio. Un articolo su arXiv del 2026 riporta però che l'entropia a livello di token è di fatto cieca nei modelli sotto i 3 miliardi di parametri.

IA e modelliAnalisiChiara RomanoPubblicato: 27 settembre 20267 min di letturaFonti 6
I piccoli modelli linguistici arrivano on-device, ma i segnali di affidabilità restano indietro

I piccoli modelli linguistici on-device non sono più una curiosità da laboratorio. In due anni sono passati da pesi dimostrativi su Hugging Face a librerie distribuite con retrieval, function calling e input multimodali. La promessa è sempre la stessa: tenere l'inferenza sul telefono o sul portatile, tagliare i costi dei server, mantenere i dati dell'utente in locale.

Non è rimasto al passo, invece, il tooling che dice a questi modelli quando sbagliano.

Da otto modelli minuscoli a una libreria

Apple ha aperto questa fase il 24 aprile 2024, rilasciando otto modelli linguistici a codice sorgente disponibile con il nome OpenELM, abbreviazione di Open-source Efficient Language Models. Lo riferisce Ars Technica. I modelli andavano da 270 milioni a 3 miliardi di parametri, divisi in quattro varianti pre-addestrate e quattro ottimizzate con istruzioni. Per dare la scala, Ars Technica osservava che la famiglia Llama 3 di Meta arrivava allora a 70 miliardi di parametri, con una versione da 400 miliardi in preparazione, mentre il GPT-3 di OpenAI del 2020 arrivava con 175 miliardi.

La rivendicazione di Apple non riguardava solo la dimensione. L'azienda sosteneva che la sua strategia di scaling layer-wise allocasse i parametri in modo più efficiente tra i livelli. Il white paper riportava un miglioramento di accuratezza del 2,36 per cento rispetto a OLMo 1B di Allen AI, usando metà dei token di pre-addestramento. Apple ha pubblicato anche la libreria di training CoreNet e ricette di addestramento riproducibili, cosa che Ars Technica definiva insolita per una grande azienda tecnologica. I modelli avevano una finestra di contesto di 2048 token ed erano addestrati su RefinedWeb, un PILE deduplicato, un sottoinsieme di RedPajama e un sottoinsieme di Dolma v1.6, per un totale di circa 1,8 trilioni di token.

Esiste la possibilità che questi modelli producano output inaccurati, dannosi, distorti o discutibili in risposta ai prompt degli utenti, avvertiva Apple nel suo paper, come riportato da Ars Technica.

Quella avvertenza conta di più man mano che questi modelli escono dal laboratorio.

Google trasforma gli SLM in una piattaforma

Nel maggio 2025 l'inquadramento era cambiato: non più rilasciare modelli, ma sostenere un ecosistema. Il team AI Edge di Google ha detto di aver ampliato il supporto on-device da quattro modelli iniziali a più di una dozzina, ospitati su una nuova community LiteRT su Hugging Face, tra cui Gemma 3 e Gemma 3n.

Gemma 3n è arrivato come anteprima e veniva descritto come il primo piccolo modello linguistico multimodale on-device di Gemma, con varianti da 2B e 4B parametri che supportano testo, immagini, video e audio. Google ha detto che le modalità testo e immagine erano disponibili su Hugging Face, con l'audio in arrivo. L'azienda ha indicato anche Gemma 3 1B, a 529MB, che secondo Google poteva girare fino a 2585 token al secondo in pre-fill su una GPU mobile, abbastanza per elaborare una pagina di contenuto in meno di un secondo.

La parte più rilevante dell'annuncio era l'infrastruttura. Google ha distribuito una libreria di Retrieval Augmented Generation on-device, disponibile su Android al lancio, e una libreria di function calling on-device, anch'essa prima su Android. La libreria RAG permette a un modello di attingere a dati specifici dell'applicazione senza fine-tuning, e Google ha detto che poteva far emergere i pezzi più rilevanti da 1000 pagine di informazioni o 1000 foto. La libreria di function calling permette a un modello di decidere quando invocare funzioni o API predefinite. L'app di esempio di Google mostra la compilazione di un modulo da dettatura vocale, la conversione da voce a testo, l'estrazione dei campi e la chiamata di funzioni dell'applicazione.

Google ha descritto anche nuovi schemi di quantizzazione post-training int4 che, secondo l'azienda, possono ridurre la dimensione del modello di un fattore da 2,5 a 4 volte rispetto a bf16, diminuendo latenza e consumo di memoria di picco. È il tipo di dettaglio ingegneristico che decide se un modello viene distribuito o resta una demo.

SlimLM e il benchmark su Samsung

Il lavoro accademico è andato in parallelo. Un paper inviato ad arXiv il 15 novembre 2024, rivisto fino al 25 novembre, presentava SlimLM, una serie di piccoli modelli linguistici ottimizzati per l'assistenza documentale su dispositivi mobili. Gli autori, Thang M. Pham, Phat T. Nguyen, Seunghyun Yoon, Viet Dac Lai, Franck Dernoncourt e Trung Bui, hanno condotto esperimenti su un Samsung Galaxy S24 e mappato i compromessi tra dimensione del modello, da 125M a 7B parametri, lunghezza del contesto e tempo di inferenza.

SlimLM è stato pre-addestrato su SlimPajama-627B e ottimizzato su DocAssist, un dataset che gli autori hanno costruito per attività di riassunto, risposta a domande e suggerimento. L'abstract dice che il modello più piccolo si comportava in modo efficiente sull'S24, mentre le varianti più grandi offrivano più capacità entro i vincoli mobili, e che il lavoro si confrontava favorevolmente con i piccoli modelli linguistici esistenti. Gli autori hanno rilasciato anche un'applicazione Android, e hanno inquadrato il vantaggio come riduzione dei costi dei server e migliore privacy grazie all'elaborazione on-device.

Il problema dell'affidabilità

Poi c'è la questione se questi modelli sappiano quello che non sanno. Un paper inviato ad arXiv il 21 luglio 2026 da Prashant Mudgal ha esaminato i segnali di affidabilità basati sull'entropia nei piccoli modelli linguistici con meno di 3 miliardi di parametri, girando interamente su hardware di consumo. Ha valutato sette approcci su 7 coppie di modelli e 5 benchmark NLU standard.

Il risultato principale è scomodo. L'entropia a livello di token era di fatto cieca: nel 91 per cento delle combinazioni dataset-modello, l'entropia media dei token era vicina a zero indipendentemente dalla correttezza della risposta. Secondo il paper, questo rende inutilizzabili i segnali di affidabilità basati sui token a questa scala.

L'entropia semantica è andata meglio. Generando più campioni, raggruppando le risposte per significato e misurando l'incertezza distribuzionale, il metodo recuperava un segnale di affidabilità utilizzabile. Usarlo per indirizzare le query incerte a un modello esperto più grande produceva miglioramenti di accuratezza fino a 50 punti percentuali. Il routing cross-family, il paper fa l'esempio da SmolLM 360M a Phi-3.5-mini, ha fatto registrare in media un miglioramento del 22,0 per cento contro il 6,8 per cento del routing same-family. La conclusione dell'autore è che il valore dei metodi di entropia nei piccoli modelli non sta nei risparmi computazionali ma nell'allocazione intelligente del calcolo, spendendo più token dove contano di più.

Ragionare senza parole

Un'altra linea di lavoro chiede se i piccoli modelli debbano affatto scrivere il loro ragionamento. Science News ha riportato il 22 settembre 2026 che un piccolo sistema sperimentale chiamato BDH-CQ, dove DH sta per Dragon Hatchling, riesce a risolvere alcuni enigmi di ragionamento senza esplicitare i passaggi intermedi. Il paper è stato inviato ad arXiv il 10 agosto e non è stato sottoposto a peer review.

Invece di tenere gli esempi nel contesto, BDH-CQ usa ogni esempio per aggiornare una memoria di dimensione fissa. Zuzanna Stamirowska, scienziata della complessità e CEO dell'azienda di AI Pathway, ha detto a Science News che una volta arrivata la query il modello non scrive affatto il suo pensiero a parole. "Niente in mezzo si converte mai in linguaggio", ha detto.

Stamirowska e colleghi hanno riportato che il modello ha risolto quasi tre enigmi su 10 sul set di valutazione pubblico ARC-AGI-1 quando gli sono stati dati due tentativi. Ha gestito alcuni compiti di rotazione e spostamento di forme ma ha faticato con i cambi di colore e alcune combinazioni di regole, e ha fatto meglio sugli enigmi più difficili di ordinamento e annidamento dopo aver visto un esempio di difficoltà simile.

La rivendicazione sui costi è notevole. I ricercatori stimano che ogni query di enigma costi circa 0,00070 dollari per essere eseguita, più o meno un undicesimo rispetto a GPT-5.6 Luna sullo stesso benchmark, anche se Science News nota che i due costi sono stati calcolati in modo diverso. La reazione dei ricercatori esterni è stata misurata. Yuntian Deng dell'Università di Waterloo lo ha definito un risultato di efficienza interessante ma ha detto che non dimostra che l'architettura sottostante sia migliore di altri approcci, e ha osservato che senza ragionamento scritto il modello è più difficile da ispezionare. Jonas Geiping dell'ELLIS Institute Tübingen e del Max Planck Institute for Intelligent Systems ha detto che il modello è stato costruito specificamente per problemi in stile ARC, il che rende difficile il confronto diretto con sistemi general-purpose, anche se ha definito l'approccio ingegnoso e ha notato che può affrontare problemi di test senza riaddestramento.

Distribuire prima di capire

Bouncer di Imbue, un filtro per il feed di Twitter pubblicato l'8 aprile 2026, mostra come appare il deployment in pratica. Lo strumento classifica i post usando un modello open source che il post del blog chiama Gemma 4 26B-A4B, che secondo quanto scritto è abbastanza grande da capire il contesto ma abbastanza piccolo da tenere il passo con la velocità dello scrolling. Imbue dice di servire attualmente il modello dal proprio data center mentre lavora per eseguirlo direttamente su portatili e telefoni, e che Bouncer è disponibile come estensione per Chrome, add-on per Firefox e app per iPhone, con il supporto a Reddit, LinkedIn e Safari promesso.

Il modello che attraversa questi progetti è coerente. Capacità e distribuzione si muovono più veloci della valutazione. Apple ha distribuito pesi con una nota schietta su output inaccurati o distorti. Google ha distribuito retrieval e function calling perché i modelli possano agire sui dati delle applicazioni. SlimLM ha misurato compiti documentali su hardware reale. Il paper di Mudgal ha scoperto che il segnale di affidabilità più economico non funziona sotto i 3 miliardi di parametri, e che uno più costoso sì. BDH-CQ suggerisce che un po' di ragionamento può avvenire senza linguaggio, mentre i ricercatori avvertono che il ragionamento non detto è più difficile da verificare.

Commenti 0

Fonti

6
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Do small language models know what they don't know?EN
  5. 05Can AI reason without words? A small model puts the idea to the testEN
  6. 06Show HN: Control your X/Twitter feed using a small on-device LLMEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.