Xiaomi ha addestrato il modello in diretta e in sei giorni ha speso 3,5 milioni di dollari
MiMo-V2.6-Pro ha 1,02 trilioni di parametri, 42 miliardi dei quali attivi. Nell'addestramento aperto in diretta ha totalizzato 46 punti nell'indice Artificial Analysis ed è primo tra i modelli aperti.

Xiaomi ha trasformato l'addestramento di un modello in uno spettacolo pubblico. Per sei giorni ha trasmesso in diretta l'apprendimento per rinforzo, con il contatore delle spese che saliva in tempo reale. Il portale cinese QbitAI racconta che entrambi i modelli, MiMo-V2.6-Pro e MiMo-V2.6-Flash, hanno completato 30 passi di addestramento a testa. Il conto finale si è fermato a 3,5 milioni di dollari, circa 23,44 milioni di yuan.
La ripartizione dei costi dice quanto sia caro, oggi, l'apprendimento per rinforzo su larga scala. Il solo Pro ha richiesto 5 giorni e 3 ore, per circa 2,6 milioni di dollari. Flash ha impiegato 3 giorni e 10 ore, per circa 0,9 milioni. Ogni passo conteneva 1568 prompt e su ogni compito il modello provava 16 percorsi diversi: oltre 25 mila esecuzioni per passo. Con 2,7-3,7 miliardi di token di addestramento per passo, il solo Pro ha elaborato in tutto il ciclo circa 81-111 miliardi di token. Secondo il calcolo del portale, è una mole superiore a 80 mila finestre di contesto da un milione di token.
Il risultato e il confronto con la frontiera
MiMo-V2.6-Pro ha 1,02 trilioni di parametri, 42 miliardi dei quali attivi, e ha ottenuto 46 punti nell'indice di intelligenza Artificial Analysis. È primo tra i modelli aperti. Nella maggior parte dei test agentici il risultato di Pro si avvicina a Claude Opus 5 e GPT-5.6 Sol. La responsabile del progetto MiMo, Luo Fuli, che in passato ha lavorato a DeepSeek-R1, lo ha definito uno dei maggiori addestramenti per rinforzo mai condotti da un team su un modello aperto. Ha aggiunto che la sfida ingegneristica ha superato quella che ricorda da DeepSeek-R1.
L'apertura come strategia, non come gesto
In parallelo Xiaomi pubblica i dettagli dell'architettura. MiMo-V3 si basa sulla soluzione HySparse2, ottimizzata per compiti agentici lunghi e a più fasi: condivisione KV a due livelli, selezione sparsa dei token e uscita anticipata dalla fase preliminare. Il carico computazionale di quella fase scende a un quinto del valore della soluzione HySparse con finestra di attenzione ibrida, e la KV cache passa da 12 GB a 2,7 GB con un contesto da un milione di token. Secondo Xiaomi la capacità di ricerca nei testi lunghi non cala, anzi cresce.
È la stessa direzione che si vede nella famiglia DeepSeek: i modelli cinesi oggi competono non sul picco dei parametri, ma sul costo di mantenere un contesto lungo. Per l'utente finale conta anche un'altra cosa: i pesi vengono aperti, quindi i risultati non vanno presi sulla fiducia.
Fonti
2Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.