Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les classements de modèles qui manquent de preuves

Quatre travaux indépendants publiés ces dernières semaines montrent que les tableaux de résultats des modèles de langue paraissent plus tranchants que les données ne le permettent. Le problème touche aussi la science menée avec l'aide de l'IA.

SciencesAnalyseAmélie BernardPublié le: 25 septembre 20268 min de lectureSources 5
Les classements de modèles qui manquent de preuves

Le tableau de classement reste le moyen le plus courant de rendre compte des progrès en apprentissage automatique : des lignes de modèles, des colonnes de tests, une position plus haute vaut mieux. Plusieurs travaux vérifient pourtant ce qu'on sait vraiment d'un tel tableau dès qu'on interroge la stabilité de la mesure. La réponse est gênante.

La même réponse, une autre structure

L'auteur de l'un des audits a examiné la façon dont un modèle infère la structure d'un prompt. Il a répété la mesure sur huit variantes ouvertes issues de cinq familles, de 8 à 675 milliards de paramètres, avec le cache désactivé et 293 représentations intermédiaires conservées. Le phénomène mesuré s'est révélé instable. Des appels identiques ne reproduisaient pas une structure identique : la concordance moyenne de l'ensemble des nœuds variait de 0,39 à 0,96, et dans 72 % des cas un couple prompt-modèle n'était jamais concordant sur tout l'ensemble. Après un bootstrap par grappes, seul le bas du classement tenait bon. Les deux modèles les moins reproductibles gardaient leur position dans 99 et 86 % des répétitions, les quatre du milieu dans 27 à 48 %, les deux meilleurs dans 68 %. Le tableau désigne donc de façon fiable le pire modèle, pas le meilleur. Deux règles de fusion des campagnes répétées, tout aussi raisonnables l'une que l'autre, modifient quatre des huit lignes et déplacent le résultat principal de l'étude de 7 points de pourcentage. Quatre des huit critères d'évaluation ont par ailleurs été retirés dans les dix semaines suivant la mesure.

Sélection et statistique

Le deuxième travail demande combien de variantes cachées d'un modèle peuvent expliquer l'avantage publié. Pour une famille de modèles donnée, les auteurs dérivent une courbe de sensibilité qui décrit le nombre maximal de ces variantes en fonction d'une borne inférieure de corrélation à l'intérieur de la famille. L'audit de 394 affirmations portant sur des positions voisines dans l'Open LLM Leaderboard montre que 391 d'entre elles n'ont aucun fondement statistique, avant même de tenir compte de la sélection.

Le troisième travail examine les indicateurs de fiabilité des juges-modèles empruntés à la théorie classique des tests. Pour un taux d'erreur mesuré du juge fixé à 4,72 %, le coefficient KR-20 varie de 0,01 à 0,68 selon la refonte de la banque de tâches. L'indice de dépendance, lui, est parfois confondu avec la probabilité de classification, dont il diffère de 0,25 à 0,43 point. Les auteurs ne recensent pas des publications précises : ils lancent un avertissement, car ces chiffres circulent plus loin, jusqu'aux décisions de déploiement et aux documents de divulgation.

Les données, pas les algorithmes

Le quatrième audit porte sur sept jeux de données publics destinés à prédire des résultats éducatifs. Trois ont passé les quatre contrôles préalables à la modélisation. Les quatre autres échouaient aux tests de généralisation entre groupes, ou ne disposaient pas des métadonnées nécessaires pour les mener. L'exemple le plus net : sur le jeu UCI Student, le R² est passé de 0,242 avec une répartition aléatoire à -0,097 avec une répartition par groupes ; sur Higher Ed, de 0,041 à -8,79. Augmenter la complexité du modèle n'y changeait rien : sur des données fragiles, les ensembles de modèles renforçaient l'instabilité.

S'y ajoute un volet éthique et éditorial. Dans un texte du « Guangming Daily » publié par ScienceNet, cinq chercheurs décrivent comment l'IA entre dans tout le processus de recherche : de la génération d'idées au traitement des données, jusqu'à la rédaction de l'article. Des questions se posent sur la paternité de l'idée, sur le lissage des résultats et sur une responsabilité qu'on ne peut pas transférer à un outil. Le dénominateur commun est ici le même que dans les classements : un chiffre ou un tableau ne remplace pas une procédure de vérification.

Commentaires 0

Sources

5
  1. 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
  2. 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
  3. 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
  4. 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
  5. 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Amélie Bernard

Amélie Bernard

Science et santé

Amélie Bernard couvre les sciences et la santé pour FLASH24, en s'appuyant sur les publications évaluées par les pairs, les communiqués des agences et les données brutes des études, sans reprendre les reprises de presse. Elle vérifie chaque chiffre en remontant à la source, compare les méthodologies et signale les tailles d'échantillon douteuses. Elle interroge régulièrement des chercheurs et des soignants, et attend les mises à jour des revues à comité de lecture avant de publier. Sa formation en physique des matériaux lui sert à décrypter les résultats techniques, et elle observe le ciel avec son propre télescope. Elle ne publie pas une donnée qu'elle n'a pas pu reproduire.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.