Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I piccoli modelli linguistici passano sui dispositivi: cosa dicono davvero i numeri

I piccoli modelli linguistici stanno uscendo dai data centre per arrivare sui telefoni, ma i risultati pubblicati raccontano un progresso disomogeneo. La linea OpenELM di Apple va da 270 milioni a 3 miliardi di parametri. Un modello di Google è un download da 529 MB e gira fino a 2.585 token al secondo su una GPU mobile.

IA e modelliAnalisiGiulia FerrariPubblicato: 27 settembre 20264 min di letturaFonti 5
I piccoli modelli linguistici passano sui dispositivi: cosa dicono davvero i numeri

Apple ha rilasciato otto piccoli modelli linguistici il 24 aprile 2024 con il nome collettivo OpenELM, sigla di Open-source Efficient Language Models, secondo Ars Technica. Vanno da 270 milioni a 3 miliardi di parametri e si trovano su Hugging Face con licenza Apple Sample Code. Ars Technica ha osservato che la licenza prevede restrizioni: il rilascio potrebbe non corrispondere alla definizione abituale di open source, anche se il codice sorgente è disponibile.

Gli otto modelli esistono in due versioni: quattro pre-addestrati e quattro ottimizzati per le istruzioni. La finestra di contesto massima è di 2.048 token. Apple afferma che i dati di addestramento provengono da RefinedWeb, una versione di PILE con le duplicazioni rimosse, da un sottoinsieme di RedPajama e da un sottoinsieme di Dolma v1.6, per un totale di circa 1,8 trilioni di token. Il white paper dell'azienda sostiene che la strategia di scaling layer-wise ha prodotto un miglioramento di accuratezza del 2,36 per cento rispetto a OLMo 1B di Allen AI, usando la metà dei token di pre-addestramento. Apple ha pubblicato anche CoreNet, la libreria di addestramento, e ricette di addestramento riproducibili. L'abstract del paper afferma che riproducibilità e trasparenza dei grandi modelli linguistici sono essenziali per far avanzare la ricerca aperta.

La scala è il contrasto più evidente. Ars Technica colloca il rilascio più grande di Meta Llama 3 a 70 miliardi di parametri, con una versione da 400 miliardi in arrivo, e GPT-3 di OpenAI del 2020 a 175 miliardi. Il numero di parametri è una misura approssimativa della capacità, non un verdetto.

Cosa mostrano i benchmark sui telefoni

SlimLM, inviato ad arXiv il 15 novembre 2024 e rivisto il 25 novembre, è una serie di piccoli modelli linguistici per l'assistenza sui documenti. Gli autori hanno condotto esperimenti su un Samsung Galaxy S24 e hanno esaminato i compromessi tra dimensione del modello (da 125M a 7B parametri), lunghezza del contesto e tempo di inferenza. SlimLM è stato pre-addestrato su SlimPajama-627B e ottimizzato su DocAssist, un dataset che gli autori hanno costruito per attività di riassunto, risposta a domande e suggerimento. Un'applicazione Android accompagna il paper. Le motivazioni dichiarate sono costi server più bassi e maggiore privacy grazie all'elaborazione sul dispositivo.

Il contributo di Google, descritto sul suo Developers Blog il 20 maggio 2025, ha una forma più vicina al prodotto. Google AI Edge è passato da quattro modelli iniziali a oltre una dozzina, tra cui Gemma 3 e Gemma 3n, ospitati su una community LiteRT su Hugging Face. Gemma 3 1B pesa 529 MB e può girare fino a 2.585 token al secondo in pre-fill su una GPU mobile. Secondo Google basta a elaborare una pagina di contenuti in meno di un secondo. Gemma 3n, in anteprima iniziale, è il primo piccolo modello linguistico multimodale on-device di Gemma, con varianti da 2B e 4B parametri che supportano input testuali, immagini, video e audio. Testo e immagini sono su Hugging Face, l'audio seguirà.

Google ha inoltre distribuito una libreria RAG on-device, disponibile su Android, e una libreria per il function calling on-device, anch'essa prima su Android. L'azienda sostiene che la quantizzazione post-addestramento int4 può ridurre i modelli linguistici di un fattore da 2,5 a 4X rispetto a bf16, tagliando al tempo stesso latenza e memoria di picco.

"Una volta arrivata la query, il modello non scrive il proprio ragionamento a parole. Niente in mezzo viene mai convertito in linguaggio", ha detto a Science News la scienziata della complessità Zuzanna Stamirowska, CEO dell'azienda di AI Pathway.

Quella citazione riguarda BDH-CQ, un sistema sperimentale descritto in un paper inviato il 10 agosto ad arXiv e riportato da Science News il 22 settembre. Il modello aggiorna una memoria di dimensione fissa con ogni esempio invece di tenere gli esempi nel contesto. Stamirowska e colleghi affermano che ha risolto quasi tre puzzle su dieci nel set di valutazione pubblico ARC-AGI-1 con due tentativi. Stimano che ogni query costi circa 0,00070 dollari, all'incirca un undicesimo di GPT-5.6 Luna sullo stesso benchmark. Science News nota però che i due costi sono stati calcolati in modo diverso e che lo studio non è stato sottoposto a peer review.

Fuori dai laboratori di ricerca, le affermazioni diventano più difficili da verificare. Bouncer, un filtro per il feed di Twitter pubblicato da Imbue l'8 aprile 2026, usa un modello open source che il blog chiama Gemma 4 26B-A4B per la classificazione. Il post dice che il modello è attualmente servito dal data centre di Imbue, con lavori in corso per farlo girare su laptop e telefoni.

Lo scetticismo è giustificato, e in parte viene dai ricercatori stessi. Yuntian Deng dell'Università di Waterloo ha detto a Science News che BDH-CQ è "un risultato di efficienza interessante" ma non dimostra che la sua architettura sia migliore di altri approcci. Ha detto che servono più test per separare il design dal metodo di addestramento, e che un modello che non scrive il proprio ragionamento è più difficile da ispezionare. Jonas Geiping dell'ELLIS Institute Tübingen e del Max Planck Institute for Intelligent Systems ha detto che BDH-CQ è costruito specificamente per problemi in stile ARC, il che rende difficile il confronto diretto con sistemi general-purpose. Ha comunque definito l'approccio "elegante".

La domanda irrisolta è quanto di tutto questo sopravviva al contatto con un prodotto in commercio. Apple, per come si presenta nel paper su OpenELM, tratta i modelli come rilasci di ricerca. La cautela di Google è che Gemma 3n è un'anteprima iniziale. Il divario tra una tabella di benchmark e un telefono in tasca resta la parte per cui nessuno ha pubblicato numeri.

Commenti 0

Fonti

5
  1. 01Apple releases eight small AI language models aimed at on-device useEN
  2. 02SlimLM: An Efficient Small Language Model for On-Device Document AssistanceEN
  3. 03On-device small language models with multimodality, RAG, and Function CallingEN
  4. 04Can AI reason without words? A small model puts the idea to the testEN
  5. 05Show HN: Control your X/Twitter feed using a small on-device LLMEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.