Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Xiaomi ha addestrato il modello in diretta e in sei giorni ha speso 3,5 milioni di dollari

MiMo-V2.6-Pro ha 1,02 trilioni di parametri, 42 miliardi dei quali attivi. Nell'addestramento aperto in diretta ha totalizzato 46 punti nell'indice Artificial Analysis ed è primo tra i modelli aperti.

IA e modelliNotiziaGiulia FerrariPubblicato: 23 settembre 20265 min di letturaFonti 2
Xiaomi ha addestrato il modello in diretta e in sei giorni ha speso 3,5 milioni di dollari

Xiaomi ha trasformato l'addestramento di un modello in uno spettacolo pubblico. Per sei giorni ha trasmesso in diretta l'apprendimento per rinforzo, con il contatore delle spese che saliva in tempo reale. Il portale cinese QbitAI racconta che entrambi i modelli, MiMo-V2.6-Pro e MiMo-V2.6-Flash, hanno completato 30 passi di addestramento a testa. Il conto finale si è fermato a 3,5 milioni di dollari, circa 23,44 milioni di yuan.

La ripartizione dei costi dice quanto sia caro, oggi, l'apprendimento per rinforzo su larga scala. Il solo Pro ha richiesto 5 giorni e 3 ore, per circa 2,6 milioni di dollari. Flash ha impiegato 3 giorni e 10 ore, per circa 0,9 milioni. Ogni passo conteneva 1568 prompt e su ogni compito il modello provava 16 percorsi diversi: oltre 25 mila esecuzioni per passo. Con 2,7-3,7 miliardi di token di addestramento per passo, il solo Pro ha elaborato in tutto il ciclo circa 81-111 miliardi di token. Secondo il calcolo del portale, è una mole superiore a 80 mila finestre di contesto da un milione di token.

Il risultato e il confronto con la frontiera

MiMo-V2.6-Pro ha 1,02 trilioni di parametri, 42 miliardi dei quali attivi, e ha ottenuto 46 punti nell'indice di intelligenza Artificial Analysis. È primo tra i modelli aperti. Nella maggior parte dei test agentici il risultato di Pro si avvicina a Claude Opus 5 e GPT-5.6 Sol. La responsabile del progetto MiMo, Luo Fuli, che in passato ha lavorato a DeepSeek-R1, lo ha definito uno dei maggiori addestramenti per rinforzo mai condotti da un team su un modello aperto. Ha aggiunto che la sfida ingegneristica ha superato quella che ricorda da DeepSeek-R1.

L'apertura come strategia, non come gesto

In parallelo Xiaomi pubblica i dettagli dell'architettura. MiMo-V3 si basa sulla soluzione HySparse2, ottimizzata per compiti agentici lunghi e a più fasi: condivisione KV a due livelli, selezione sparsa dei token e uscita anticipata dalla fase preliminare. Il carico computazionale di quella fase scende a un quinto del valore della soluzione HySparse con finestra di attenzione ibrida, e la KV cache passa da 12 GB a 2,7 GB con un contesto da un milione di token. Secondo Xiaomi la capacità di ricerca nei testi lunghi non cala, anzi cresce.

È la stessa direzione che si vede nella famiglia DeepSeek: i modelli cinesi oggi competono non sul picco dei parametri, ma sul costo di mantenere un contesto lungo. Per l'utente finale conta anche un'altra cosa: i pesi vengono aperti, quindi i risultati non vanno presi sulla fiducia.

Commenti 0

Fonti

2
  1. 016 天烧光 2000 多万,拿下开源第一!小米史无前例「炼丹直播」收官 (量子位)ZH
  2. 02小米公开 MiMo-V3 核心架构 HySparse2 (IT之家, tag AI)ZH

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.