Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Modelli piccoli su dispositivo: per il paper il 91% dei segnali di entropia dei token è inutilizzabile

Nei modelli linguistici piccoli, sotto i 3 miliardi di parametri, i segnali di confidenza a livello di token non dicono nulla. Lo sostiene un preprint arXiv inviato il 21 luglio: l'entropia media dei token resta vicina allo zero nel 91% delle combinazioni dataset-modello, sia quando la risposta è giusta sia quando è sbagliata.

IA e modelliAnalisiChiara RomanoPubblicato: 28 settembre 20264 min di letturaFonti 6
Modelli piccoli su dispositivo: per il paper il 91% dei segnali di entropia dei token è inutilizzabile

Il paper è di Prashant Mudgal. Mudgal ha testato sette approcci su 7 coppie di modelli e 5 benchmark NLU standard, tutti eseguiti su hardware di consumo. La conclusione è netta: a questa scala l'arresto anticipato basato sull'entropia a livello di token non funziona. L'entropia semantica, che si calcola generando più campioni e raggruppando le risposte per significato, restituisce invece un segnale utilizzabile. Instradare le query incerte verso un modello esperto più grande ha alzato l'accuratezza fino a 50 punti percentuali.

Il routing tra famiglie diverse ha reso in media +22,0%, contro +6,8% per le coppie della stessa famiglia. L'esempio citato è SmolLM 360M che passa il testimone a Phi-3.5-mini. Per il paper il valore dei metodi di entropia nei modelli piccoli non sta nel calcolo risparmiato, ma in quello allocato.

Perché il lavoro su dispositivo continua a crescere

Il momento conta. Il 27 settembre Nvidia ha rilasciato Nemotron 3 Diarization, un modello da circa 100 milioni di parametri che identifica chi parla in una conversazione, con i pesi scaricabili gratuitamente, come riporta The Decoder. Separa fino a otto parlanti e segnala il parlato sovrapposto. Sul Diarization-Bench di VoiceArena è primo con un tasso di errore del 14,72%, davanti al secondo sistema migliore al 19,3%. Abbinato a un sistema di riconoscimento vocale come Parakeet, produce trascrizioni con etichette anonime dei parlanti. I tassi di errore salgono con più partecipanti, rumore di fondo o riverbero.

La latenza è un compromesso di progetto, non un guadagno gratuito. Il buffer audio si può impostare su quattro livelli, da 30,4 secondi fino a 0,32 secondi, e i buffer più brevi riducono in genere l'accuratezza. Nvidia dice che il modello taglia il tasso di errore in media del 41% su otto scenari di test rispetto al predecessore Streaming Sortformer con un buffer di 1,04 secondi. È il tipo di numero che pesa quando il modello deve girare in locale e non in un data centre.

La stessa settimana ha portato un progetto molto più grande, con una tesi sull'automazione molto più cauta. Un team con ricercatori della Fudan University, in Cina, ha studiato il proprio lavoro su Atria Dawn Preview, un modello linguistico agentico su architettura mixture-of-experts con 744 miliardi di parametri, secondo The Decoder. L'analisi ha coperto più di 700 log di attività di 56 partecipanti. L'IA è stata usata nel 96,5% delle attività esaminate e il rapporto mediano tra azioni dell'agente e input umani è salito da 11 a 28,5 in quattro settimane. Gli autori invitano a non leggerlo come autonomia: ogni decisione umana faceva scattare semplicemente più passi dell'agente.

Ai partecipanti è stato chiesto se avrebbero potuto completare la loro parte di un'attività senza IA con la stessa portata e la stessa qualità. Delle 455 attività completate con assistenza IA, 151 sono state giudicate irrealizzabili senza IA, circa un terzo, distribuite su 27 dei 56 partecipanti.

Gli umani hanno comunque preso l'85,5% delle decisioni su metodi e parametri, l'IA il 9,2%, e sugli obiettivi e sulla portata l'ultima parola è stata umana nel 93,4% dei casi. Quando qualcosa è andato storto, su 588 attività con una difficoltà registrata, il 76% è andato avanti grazie all'intervento umano e il 23% è stato risolto dall'agente da solo. Il paper avverte che, quando ogni decisione poggia su una catena di lavoro dell'agente più lunga di quanto un umano possa esaminare, la supervisione degenera in un timbro automatico.

Modelli economici, domande costose

Il costo sta ridisegnando quali modelli vengono usati. Il 26 settembre CNBC ha riferito che i modelli cinesi hanno rappresentato dal 57% al 67% dei token usati su OpenRouter nella settimana del 14 settembre, in aumento dal 6% al 13% di febbraio, e ad agosto hanno toccato il 55% dei token su Vercel, dall'11% di gennaio. Peter Walker, head of insights di OpenRouter, ha detto a CNBC che i modelli open source cinesi rilasciati quest'anno gestiscono in modo credibile compiti agentici avanzati, soprattutto la programmazione, cosa che non era vera alla fine del 2025, e costano poco rispetto alla maggior parte dei modelli dei laboratori statunitensi. Harpreet Arora, head of agentic infrastructure di Vercel, ha detto che il prezzo diventa convincente quando un modello supera la soglia di qualità per un lavoro.

Washington osserva. Due commissioni della Camera degli Stati Uniti stanno indagando sul trend di adozione, e CNBC nota che i modelli di frontiera statunitensi attirano ancora più spesa complessiva. Daniel Remler del Center for a New American Security ha detto all'emittente che la preoccupazione è che l'integrazione trascini i paesi in una sfera tecnologica cinese. I dati citati da CNBC sono disomogenei: circa la metà dei token su OpenRouter arriva da aziende statunitensi, mentre le imprese negli 82 paesi che OpenRouter raggruppa come Global South inviano il 67% dei loro token a modelli cinesi.

I modelli piccoli stanno scomodi in questa partita. Girano sul dispositivo, il che aggira alcuni argomenti sul controllo delle esportazioni, ma la loro affidabilità è proprio ciò che il paper arXiv mette in dubbio. Il risultato sul routing suggerisce che la risposta pratica non è un modello piccolo migliore da solo, ma un modello piccolo che sa quando chiedere aiuto.

Commenti 0

Fonti

6
  1. 01Do small language models know what they don't know?EN
  2. 02Nvidia drops a free 100M-parameter model that identifies up to eight speakers in real timeEN
  3. 03AI agents do more of the work in model development, but humans still make the decisionsEN
  4. 04Chinese AI models surge in global popularity — and Washington is worriedEN
  5. 05OpenAI halts training of latest models as reports mount of AI agents going rogueEN
  6. 06OpenAI pauses training of its 'most capable models'EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.