Des modèles ouverts à 3,5 millions de dollars : Xiaomi et DeepSeek changent le calcul des coûts
MiMo-V2.6-Pro a enchaîné 30 étapes d'apprentissage par renforcement pour environ 2,6 millions de dollars. Il devance des modèles fermés sur une partie des tâches agentiques.

Pendant des années, la règle était simple : le meilleur modèle reste fermé et coûte ce que son opérateur décide de facturer. Le portail chinois qbitai (量子位) a raconté l'expérience de Xiaomi, qui remet en cause au moins la seconde partie de cette règle.
Lors d'une diffusion en direct, l'équipe MiMo, dirigée par Luo Fuli, qui avait auparavant travaillé sur DeepSeek-R1, a présenté la facture de l'entraînement. MiMo-V2.6-Pro a effectué 30 étapes d'apprentissage par renforcement en 5 jours et 3 heures, pour environ 2,6 millions de dollars. Le plus léger, MiMo-V2.6-Flash, a fait de même en 3 jours et 10 heures pour environ 0,9 million de dollars. La note totale s'élève à environ 3,5 millions de dollars.
L'échelle d'une seule étape explique pourquoi ces chiffres ne sont pas extravagants. Chaque étape comprend 1 568 requêtes, et le modèle essaie 16 trajectoires différentes pour chacune. Une seule manche produit donc plus de 25 000 essais. Avec 2,7 à 3,7 milliards de tokens d'entraînement par étape, le modèle Pro a traité au total environ 81 à 111 milliards de tokens. Soit l'équivalent de plus de 80 000 fenêtres de contexte d'un million de tokens.
Des résultats vérifiables
Xiaomi met en avant deux séries de chiffres. Le taux de réussite moyen a progressé après 30 étapes de 25 pour cent pour la version Flash et de 12 pour cent pour Pro. Plus important, le test hors du jeu d'entraînement : sur DeepSWE v1.1, qui évalue le travail d'un agent dans de vrais dépôts de code, Pro est passé de 58,4 à 72,57 points, et Flash de 48,7 à 65,68. Le modèle n'a donc pas seulement mémorisé les tâches : il a transféré ses compétences à des problèmes d'ingénierie entièrement nouveaux.
Dans le classement Artificial Analysis Intelligence Index, MiMo-V2.6-Pro a obtenu 46 points et s'est hissé au premier rang des modèles ouverts. Sur la tâche AutomationBench, il a marqué 53,1 points, devant Claude Opus 5 (50,3) et GPT-5.6 Sol (45,8). Le prix n'a pas bougé par rapport à la génération précédente : environ 3 yuans par million de tokens en entrée et 6 en sortie pour Pro, 1 et 2 pour Flash. Selon les estimations d'Artificial Analysis, le coût moyen d'exécution d'une tâche de l'indice s'élève pour Pro à 0,13 dollar. À titre de comparaison, Grok 4.7, qui a obtenu le même jour les mêmes 46 points, doit coûter environ 3,74 dollars dans sa variante xHigh, soit près de 29 fois plus.
Pas seulement du code
L'usage scientifique est plus intéressant. Xiaomi a soumis le modèle à la conception de matériaux MOF, censés capturer les PFAS, des polluants persistants qui ne se décomposent pas. Après avoir passé en revue la littérature et les brevets et vérifié lui-même la nouveauté de l'idée, le modèle a construit un environnement de simulation et calculé l'énergie de liaison. Il a proposé deux structures, A50 et B50, fondées sur des charpentes de zirconium de type UiO-67, dont l'adsorption des PFAS doit être un million à dix millions de fois meilleure que celle du matériau de référence. Le professeur Dou Jinhu, de l'université de Pékin, cité dans le compte rendu, a jugé le résultat proche du travail d'un doctorant expérimenté, et le cycle de recherche en entreprise est passé d'un mois à deux ou trois jours.
L'ouverture n'est plus un slogan marketing, mais un moyen de faire baisser le coût d'une tâche de plusieurs dollars à quelques dizaines de centimes.
Le même mécanisme est à l'œuvre qu'avec DeepSeek-V4.1-Flash, qui, avec 552 milliards de paramètres et une licence MIT, a réduit les besoins en mémoire à l'inférence. Xiaomi a publié non seulement les poids et le rapport technique, mais aussi plus de 7 000 environnements de tâches pour l'apprentissage par renforcement, la chaîne d'entraînement complète et un petit modèle distillé sur la base de Qwen3.5-9B. C'est un changement de nature dans le débat sur l'ouverture : il ne s'agit plus de mettre en ligne un fichier de poids, mais de livrer tout le processus de production.
Sources
3- 01量子位 (qbitai): 小米 MiMo-V2.6 强化学习直播 — 350万美元的训练ZH
- 02DeepSeek-V4.1-Flash ReleaseEN
- 03DeepSeek-V4.1-Flash – model cardEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.