Le classifiche dei modelli a cui le prove non bastano
Quattro lavori indipendenti delle ultime settimane mostrano che le tabelle con i risultati dei modelli linguistici sembrano più risolutive di quanto i dati consentano. Il problema riguarda anche la ricerca condotta con l'aiuto dell'IA.

La tabella di classifica è il modo più comune di comunicare i progressi nell'apprendimento automatico: righe di modelli, colonne di test, posizione più alta significa risultato migliore. I lavori più recenti verificano però quanto si sappia davvero da una tabella simile, quando si chiede della stabilità della misura. La risposta è scomoda.
La stessa risposta, una struttura diversa
L'autore di uno degli audit ha esaminato l'inferenza sulla struttura del prompt da parte del modello. Ha ripetuto la misura su otto varianti aperte di cinque famiglie, da 8 a 675 miliardi di parametri, con il caching disattivato e 293 rappresentazioni intermedie conservate. Già il fenomeno misurato si è rivelato instabile: chiamate identiche non riproducevano una struttura identica, la concordanza media dell'insieme dei nodi oscillava tra 0,39 e 0,96, e nel 72 per cento dei casi la coppia prompt-modello non era mai concorde sull'intero insieme. Dopo aver applicato un bootstrap a cluster, solo il fondo della classifica si è dimostrato solido: i due modelli meno ripetibili mantenevano la posizione nel 99 e nell'86 per cento delle ripetizioni, i quattro centrali nel 27-48 per cento, i due migliori nel 68 per cento. La tabella indica quindi in modo affidabile il modello peggiore, non quello migliore. Due regole ugualmente sensate di aggregazione delle campagne ripetute cambiano quattro righe su otto e spostano l'intestazione dello studio di 7 punti percentuali. Quattro degli otto endpoint sono stati ritirati entro dieci settimane dalla misura.
Selezione e statistica
Il secondo lavoro chiede quanti modelli nascosti possano stare dietro un vantaggio pubblicato. Per una famiglia di modelli fissata, gli autori ricavano una curva di sensibilità che descrive il numero massimo di tali varianti in funzione del limite inferiore di correlazione all'interno della famiglia. L'audit di 394 affermazioni su posizioni adiacenti nella Open LLM Leaderboard ha mostrato che 391 di esse non hanno base statistica già prima di considerare la selezione.
Il terzo lavoro prende in esame gli indicatori di affidabilità dei giudici-modello presi in prestito dalla teoria classica dei test. Con un tasso di errore misurato del giudice fissato al 4,72 per cento, il coefficiente KR-20 varia da 0,01 a 0,68 a seconda della riprogettazione della banca di compiti. L'indice di dipendenza viene talvolta confuso con la probabilità di classificazione, da cui differisce di 0,25-0,43 punti. La conclusione degli autori è rivolta alla comunità: non è una recensione di singole pubblicazioni, ma un avvertimento, perché i numeri finiscono più avanti, nelle decisioni di implementazione e nei documenti di divulgazione.
Dati, non algoritmi
Il quarto audit riguarda sette insiemi pubblici per la previsione dei risultati educativi. Tre hanno superato tutti e quattro i controlli precedenti alla modellazione; gli altri quattro o fallivano i test di generalizzazione tra gruppi, o non avevano i metadati necessari per eseguirli. L'esempio più netto: sull'insieme UCI Student il valore di R² è sceso da 0,242 con divisione casuale a -0,097 con divisione per gruppi, e nell'insieme Higher Ed da 0,041 a -8,79. Aumentare la complessità del modello non eliminava il problema: su dati fragili gli insiemi di modelli rafforzavano l'instabilità.
A questo si aggiunge il filo etico e redazionale. In un testo del «Guangming Daily» pubblicato da ScienceNet, cinque ricercatori descrivono come l'IA entri nell'intero processo di ricerca: dalla generazione delle idee, attraverso l'elaborazione dei dati, fino alla scrittura del lavoro. Emergono domande sulla paternità dell'idea, sulla levigatura dei risultati e su una responsabilità che non si può trasferire allo strumento. Il denominatore comune è lo stesso delle classifiche: un numero o una tabella non sostituiscono la procedura di verifica.
Fonti
5- 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
- 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
- 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
- 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
- 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.