Rankingi modeli, którym nie wystarcza dowodów
Cztery niezależne prace z ostatnich tygodni pokazują, że tabele z wynikami modeli językowych wyglądają na bardziej rozstrzygające, niż pozwalają na to dane. Problem dotyczy też nauki uprawianej z pomocą AI.

Tabela rankingowa to najczęstszy sposób komunikowania postępu w uczeniu maszynowym: rzędy modeli, kolumny testów, wyższa pozycja znaczy lepszy. Kolejne prace sprawdzają, ile właściwie wiadomo z takiej tabeli, gdy zapytać o stabilność pomiaru. Odpowiedź jest niewygodna.
Ta sama odpowiedź, inna struktura
Autor jednego z audytów wziął pod lupę wnioskowanie o strukturze promptu przez model. Pomiar powtórzył na ośmiu otwartych wariantach z pięciu rodzin, od 8 do 675 mld parametrów, z wyłączonym cache’owaniem i 293 zachowanymi pośrednimi reprezentacjami. Już sam mierzony fenomen okazał się niestabilny: identyczne wywołania nie odtwarzały identycznej struktury, średnia zgodność zbioru węzłów wahała się od 0,39 do 0,96, a w 72 proc. przypadków para prompt–model nigdy nie była zgodna w całym zbiorze. Po nałożeniu klastrowego bootstrapu solidny okazał się tylko dół rankingu. Dwa najmniej powtarzalne modele utrzymywały pozycję w 99 i 86 proc. powtórzeń, cztery środkowe w 27–48 proc., a dwa najlepsze w 68 proc. Tabela wiarygodnie wskazuje więc najgorszy model, ale nie najlepszy. Dwie równie sensowne reguły łączenia powtórzonych kampanii zmieniają cztery z ośmiu wierszy i przesuwają nagłówek badania o 7 punktów procentowych. Cztery z ośmiu punktów końcowych wycofano w ciągu dziesięciu tygodni od pomiaru.
Selekcja i statystyka
Druga praca pyta, ile ukrytych wariantów modelu może stać za publikowaną przewagą. Dla ustalonej rodziny modeli autorzy wyprowadzają krzywą wrażliwości, która opisuje maksymalną liczbę takich wariantów w funkcji dolnego ograniczenia korelacji wewnątrz rodziny. Audyt 394 twierdzeń o sąsiednich pozycjach na Open LLM Leaderboard wykazał, że 391 z nich nie ma oparcia statystycznego jeszcze przed uwzględnieniem selekcji.
Trzecia praca bierze na warsztat wskaźniki niezawodności sędziów-modeli zapożyczone z klasycznej teorii testu. Przy ustalonej mierzonej stopie błędu sędziego na poziomie 4,72 proc. współczynnik KR-20 waha się od 0,01 do 0,68 w zależności od przeprojektowania banku zadań. Indeks zależności bywa natomiast mylony z prawdopodobieństwem klasyfikacji i różni się od niego o 0,25 do 0,43 punktu. Wniosek autorów jest prospołeczny: to nie recenzja konkretnych publikacji, lecz ostrzeżenie, bo liczby trafiają dalej, do decyzji wdrożeniowych i dokumentów ujawniających.
Dane, nie algorytmy
Czwarty audyt dotyczy siedmiu publicznych zbiorów do przewidywania wyników edukacyjnych. Trzy przeszły wszystkie cztery kontrole przed modelowaniem. Pozostałe cztery albo oblewały testy uogólniania między grupami, albo nie miały metadanych potrzebnych do ich przeprowadzenia. Najostrzejszy przykład: na zbiorze UCI Student wynik R² spadł z 0,242 przy losowym podziale do -0,097 przy podziale grupowym, a w zbiorze Higher Ed z 0,041 do -8,79. Zwiększanie złożoności modelu tego nie usuwało. Na kruchych danych zespoły modeli wzmacniały niestabilność.
Do tego dochodzi wątek etyczny i redakcyjny. W materiale „Guangming Daily” opublikowanym przez ScienceNet pięciu badaczy opisuje, jak AI wchodzi w cały proces badawczy: od generowania pomysłów, przez obróbkę danych, po pisanie pracy. Pojawiają się pytania o autorstwo pomysłu, o wygładzanie wyników i o odpowiedzialność, której nie da się przenieść na narzędzie. Wspólny mianownik jest tu ten sam co w rankingach: liczba albo tabela nie zastępuje procedury sprawdzenia.
Źródła
5- 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
- 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
- 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
- 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
- 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.