Xiaomi a entraîné son modèle en direct et dépensé 3,5 millions de dollars en six jours
MiMo-V2.6-Pro compte 1,02 billion de paramètres, dont 42 milliards actifs. Cet entraînement public en direct lui a valu 46 points à l'indice Artificial Analysis et la première place parmi les modèles ouverts.

Xiaomi a fait de l'entraînement d'un modèle un spectacle public. Pendant six jours, l'entreprise a diffusé en direct un apprentissage par renforcement, avec un compteur de dépenses qui grimpait en temps réel. Comme le rapporte le portail chinois Liangziwei, les deux modèles, MiMo-V2.6-Pro et MiMo-V2.6-Flash, ont chacun terminé 30 étapes d'entraînement. La facture finale s'est arrêtée à 3,5 millions de dollars, soit environ 23,44 millions de yuans.
Le détail des coûts montre à quel point l'apprentissage par renforcement à grande échelle est cher aujourd'hui. Le Pro seul a demandé 5 jours et 3 heures, pour environ 2,6 millions de dollars. Le Flash, lui, a tourné 3 jours et 10 heures pour environ 0,9 million de dollars. Chaque étape contenait 1568 prompts, et pour chaque tâche le modèle essayait 16 trajectoires différentes, ce qui donnait plus de 25 000 exécutions par étape. Avec 2,7 à 3,7 milliards de tokens d'entraînement par étape, le Pro a traité au total environ 81 à 111 milliards de tokens sur l'ensemble de son entraînement. Selon le calcul du portail, cela représente le volume de plus de 80 000 fenêtres de contexte d'un million de tokens.
Résultat et comparaison avec le frontier
MiMo-V2.6-Pro compte 1,02 billion de paramètres, dont 42 milliards actifs, et a obtenu 46 points à l'indice d'intelligence Artificial Analysis, ce qui le place premier parmi les modèles ouverts. Dans la plupart des tests agentiques, le score du Pro s'approche de Claude Opus 5 et de GPT-5.6 Sol. La responsable du projet MiMo, Luo Fuli, avait auparavant travaillé sur DeepSeek-R1. Elle a qualifié l'opération de l'un des plus grands entraînements par renforcement jamais menés par l'équipe d'un modèle ouvert. Le défi d'ingénierie, a-t-elle ajouté, dépassait celui dont elle se souvient pour DeepSeek-R1.
L'ouverture comme stratégie, pas comme geste
En parallèle, Xiaomi publie les détails de l'architecture. MiMo-V3 repose sur la solution HySparse2, optimisée pour les tâches agentiques longues et à plusieurs étapes : partage KV à deux niveaux, sélection clairsemée des tokens et sortie anticipée de la phase préliminaire. La charge de calcul de la phase préliminaire tombe ainsi à un cinquième de la valeur de la solution HySparse avec fenêtre d'attention hybride, et le KV cache passe de 12 GB à 2,7 GB pour un contexte d'un million de tokens. Selon Xiaomi, la capacité de recherche dans de longs textes ne baisse pas, elle augmente.
C'est exactement la même direction que celle visible dans la famille DeepSeek : les modèles chinois rivalisent aujourd'hui non pas sur le sommet des paramètres, mais sur le coût de maintien d'un long contexte. Pour l'utilisateur final, un autre point compte : les poids sont ouverts, donc les résultats n'ont pas à être pris sur parole.
Sources
2Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.