Mêmes scores, deux factures : comment lire les benchmarks des modèles ouverts
Sur l'indice Artificial Analysis, le modèle ouvert Xiaomi MiMo-V2.6-Pro et le modèle fermé Grok 4.7 affichent tous deux 46 points. Mais le coût moyen d'une tâche varie d'environ 29 fois entre les deux. Ce coût, absent des scores, devient une dimension d'évaluation à part entière.

Dans les annonces de modèles ouverts, ce qui échappe le plus souvent, ce sont les conditions derrière le score. Xiaomi MiMo-V2.6-Pro obtient 46 points sur l'Artificial Analysis Intelligence Index et se classe premier parmi les modèles ouverts. Le même jour, le modèle fermé Grok 4.7 sortait avec 46 points sur le même indice. À lire cette seule ligne, les deux modèles semblent à égalité.
Sur un autre axe, la conclusion change. D'après les mesures d'Artificial Analysis, la version haut de gamme de Grok 4.7 dépense en moyenne 3,74 dollars par tâche. MiMo-V2.6-Pro en coûte 0,13, soit un écart d'environ 29 fois. Un même score peut donc correspondre à des coûts d'usage entièrement différents.
Deuxième point facile à manquer : le réglage exact du test. Les résultats de MiMo-V2.6 viennent d'un entraînement par renforcement de 30 steps seulement. Chaque step contient 1568 prompts, et chaque question laisse le modèle essayer 16 trajectoires différentes. Sur DeepSWE v1.1, qui évalue les agents de codage, la version Pro passe de 58,4 à 72,57 points et la version Flash de 48,7 à 65,68 points. Ces chiffres n'ont de sens que si la généralisation hors échantillon tient. Le score obtenu sur le jeu d'entraînement n'y change rien.
Troisième variable : le choix du benchmark lui-même. La note officielle sur V4.1 Flash souligne que, après des tests internes et externes, le modèle dépasse le V4 Pro sur la performance, le coût, la vitesse et le temps total. Mais « dépasse partout » reste une formulation officielle. Ce sont la méthode de test, le nombre d'échantillons et l'outil d'évaluation qui déterminent jusqu'où ces conclusions se transposent.
Lire un benchmark correctement revient donc à tenir trois choses ensemble : dans quelles conditions le modèle a tourné, combien coûte une tâche, et ce que donne la performance hors échantillon. Citer seulement le score le plus élevé, c'est remplacer une surface par un point.
Pour un choix en entreprise, la méthode utile consiste à monter sa propre comparaison à petite échelle : cadre d'évaluation fixe, coût par tâche et taux de réussite mesurés, puis décision sur le modèle à mettre en production. Le score est l'entrée, la facture est la conclusion.
Sources
3Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.