Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Mêmes scores, deux factures : comment lire les benchmarks des modèles ouverts

Sur l'indice Artificial Analysis, le modèle ouvert Xiaomi MiMo-V2.6-Pro et le modèle fermé Grok 4.7 affichent tous deux 46 points. Mais le coût moyen d'une tâche varie d'environ 29 fois entre les deux. Ce coût, absent des scores, devient une dimension d'évaluation à part entière.

IA & modèlesOpinionCamille RousseauPublié le: 18 septembre 20265 min de lectureSources 3
Mêmes scores, deux factures : comment lire les benchmarks des modèles ouverts

Dans les annonces de modèles ouverts, ce qui échappe le plus souvent, ce sont les conditions derrière le score. Xiaomi MiMo-V2.6-Pro obtient 46 points sur l'Artificial Analysis Intelligence Index et se classe premier parmi les modèles ouverts. Le même jour, le modèle fermé Grok 4.7 sortait avec 46 points sur le même indice. À lire cette seule ligne, les deux modèles semblent à égalité.

Sur un autre axe, la conclusion change. D'après les mesures d'Artificial Analysis, la version haut de gamme de Grok 4.7 dépense en moyenne 3,74 dollars par tâche. MiMo-V2.6-Pro en coûte 0,13, soit un écart d'environ 29 fois. Un même score peut donc correspondre à des coûts d'usage entièrement différents.

Deuxième point facile à manquer : le réglage exact du test. Les résultats de MiMo-V2.6 viennent d'un entraînement par renforcement de 30 steps seulement. Chaque step contient 1568 prompts, et chaque question laisse le modèle essayer 16 trajectoires différentes. Sur DeepSWE v1.1, qui évalue les agents de codage, la version Pro passe de 58,4 à 72,57 points et la version Flash de 48,7 à 65,68 points. Ces chiffres n'ont de sens que si la généralisation hors échantillon tient. Le score obtenu sur le jeu d'entraînement n'y change rien.

Troisième variable : le choix du benchmark lui-même. La note officielle sur V4.1 Flash souligne que, après des tests internes et externes, le modèle dépasse le V4 Pro sur la performance, le coût, la vitesse et le temps total. Mais « dépasse partout » reste une formulation officielle. Ce sont la méthode de test, le nombre d'échantillons et l'outil d'évaluation qui déterminent jusqu'où ces conclusions se transposent.

Lire un benchmark correctement revient donc à tenir trois choses ensemble : dans quelles conditions le modèle a tourné, combien coûte une tâche, et ce que donne la performance hors échantillon. Citer seulement le score le plus élevé, c'est remplacer une surface par un point.

Pour un choix en entreprise, la méthode utile consiste à monter sa propre comparaison à petite échelle : cadre d'évaluation fixe, coût par tâche et taux de réussite mesurés, puis décision sur le modèle à mettre en production. Le score est l'entrée, la facture est la conclusion.

Commentaires 0

Sources

3
  1. 01DeepSeek V4.1 Flash – Artificial AnalysisEN
  2. 026 天烧光 2000 多万,拿下开源第一ZH
  3. 03DeepSeek-V4.1-Flash 模型卡EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.