Les classements de modèles qui manquent de preuves
Quatre travaux indépendants publiés ces dernières semaines montrent que les tableaux de résultats des modèles de langue paraissent plus tranchants que les données ne le permettent. Le problème touche aussi la science menée avec l'aide de l'IA.

Le tableau de classement reste le moyen le plus courant de rendre compte des progrès en apprentissage automatique : des lignes de modèles, des colonnes de tests, une position plus haute vaut mieux. Plusieurs travaux vérifient pourtant ce qu'on sait vraiment d'un tel tableau dès qu'on interroge la stabilité de la mesure. La réponse est gênante.
La même réponse, une autre structure
L'auteur de l'un des audits a examiné la façon dont un modèle infère la structure d'un prompt. Il a répété la mesure sur huit variantes ouvertes issues de cinq familles, de 8 à 675 milliards de paramètres, avec le cache désactivé et 293 représentations intermédiaires conservées. Le phénomène mesuré s'est révélé instable. Des appels identiques ne reproduisaient pas une structure identique : la concordance moyenne de l'ensemble des nœuds variait de 0,39 à 0,96, et dans 72 % des cas un couple prompt-modèle n'était jamais concordant sur tout l'ensemble. Après un bootstrap par grappes, seul le bas du classement tenait bon. Les deux modèles les moins reproductibles gardaient leur position dans 99 et 86 % des répétitions, les quatre du milieu dans 27 à 48 %, les deux meilleurs dans 68 %. Le tableau désigne donc de façon fiable le pire modèle, pas le meilleur. Deux règles de fusion des campagnes répétées, tout aussi raisonnables l'une que l'autre, modifient quatre des huit lignes et déplacent le résultat principal de l'étude de 7 points de pourcentage. Quatre des huit critères d'évaluation ont par ailleurs été retirés dans les dix semaines suivant la mesure.
Sélection et statistique
Le deuxième travail demande combien de variantes cachées d'un modèle peuvent expliquer l'avantage publié. Pour une famille de modèles donnée, les auteurs dérivent une courbe de sensibilité qui décrit le nombre maximal de ces variantes en fonction d'une borne inférieure de corrélation à l'intérieur de la famille. L'audit de 394 affirmations portant sur des positions voisines dans l'Open LLM Leaderboard montre que 391 d'entre elles n'ont aucun fondement statistique, avant même de tenir compte de la sélection.
Le troisième travail examine les indicateurs de fiabilité des juges-modèles empruntés à la théorie classique des tests. Pour un taux d'erreur mesuré du juge fixé à 4,72 %, le coefficient KR-20 varie de 0,01 à 0,68 selon la refonte de la banque de tâches. L'indice de dépendance, lui, est parfois confondu avec la probabilité de classification, dont il diffère de 0,25 à 0,43 point. Les auteurs ne recensent pas des publications précises : ils lancent un avertissement, car ces chiffres circulent plus loin, jusqu'aux décisions de déploiement et aux documents de divulgation.
Les données, pas les algorithmes
Le quatrième audit porte sur sept jeux de données publics destinés à prédire des résultats éducatifs. Trois ont passé les quatre contrôles préalables à la modélisation. Les quatre autres échouaient aux tests de généralisation entre groupes, ou ne disposaient pas des métadonnées nécessaires pour les mener. L'exemple le plus net : sur le jeu UCI Student, le R² est passé de 0,242 avec une répartition aléatoire à -0,097 avec une répartition par groupes ; sur Higher Ed, de 0,041 à -8,79. Augmenter la complexité du modèle n'y changeait rien : sur des données fragiles, les ensembles de modèles renforçaient l'instabilité.
S'y ajoute un volet éthique et éditorial. Dans un texte du « Guangming Daily » publié par ScienceNet, cinq chercheurs décrivent comment l'IA entre dans tout le processus de recherche : de la génération d'idées au traitement des données, jusqu'à la rédaction de l'article. Des questions se posent sur la paternité de l'idée, sur le lissage des résultats et sur une responsabilité qu'on ne peut pas transférer à un outil. Le dénominateur commun est ici le même que dans les classements : un chiffre ou un tableau ne remplace pas une procédure de vérification.
Sources
5- 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
- 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
- 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
- 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
- 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.