Przejdź do treści
Czas na świecieEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal o AI i technologiiwydarzenia · analizy · wywiady · tło techniczne

Szukaj
NA ŻYWO
›

Rankingi modeli, którym nie wystarcza dowodów

Cztery niezależne prace z ostatnich tygodni pokazują, że tabele z wynikami modeli językowych wyglądają na bardziej rozstrzygające, niż pozwalają na to dane. Problem dotyczy też nauki uprawianej z pomocą AI.

NaukaAnalizaRenata PawlakOpublikowano: 25 września 20268 min czytaniaŹródła 5
Rankingi modeli, którym nie wystarcza dowodów

Tabela rankingowa to najczęstszy sposób komunikowania postępu w uczeniu maszynowym: rzędy modeli, kolumny testów, wyższa pozycja znaczy lepszy. Kolejne prace sprawdzają, ile właściwie wiadomo z takiej tabeli, gdy zapytać o stabilność pomiaru. Odpowiedź jest niewygodna.

Ta sama odpowiedź, inna struktura

Autor jednego z audytów wziął pod lupę wnioskowanie o strukturze promptu przez model. Pomiar powtórzył na ośmiu otwartych wariantach z pięciu rodzin, od 8 do 675 mld parametrów, z wyłączonym cache’owaniem i 293 zachowanymi pośrednimi reprezentacjami. Już sam mierzony fenomen okazał się niestabilny: identyczne wywołania nie odtwarzały identycznej struktury, średnia zgodność zbioru węzłów wahała się od 0,39 do 0,96, a w 72 proc. przypadków para prompt–model nigdy nie była zgodna w całym zbiorze. Po nałożeniu klastrowego bootstrapu solidny okazał się tylko dół rankingu. Dwa najmniej powtarzalne modele utrzymywały pozycję w 99 i 86 proc. powtórzeń, cztery środkowe w 27–48 proc., a dwa najlepsze w 68 proc. Tabela wiarygodnie wskazuje więc najgorszy model, ale nie najlepszy. Dwie równie sensowne reguły łączenia powtórzonych kampanii zmieniają cztery z ośmiu wierszy i przesuwają nagłówek badania o 7 punktów procentowych. Cztery z ośmiu punktów końcowych wycofano w ciągu dziesięciu tygodni od pomiaru.

Selekcja i statystyka

Druga praca pyta, ile ukrytych wariantów modelu może stać za publikowaną przewagą. Dla ustalonej rodziny modeli autorzy wyprowadzają krzywą wrażliwości, która opisuje maksymalną liczbę takich wariantów w funkcji dolnego ograniczenia korelacji wewnątrz rodziny. Audyt 394 twierdzeń o sąsiednich pozycjach na Open LLM Leaderboard wykazał, że 391 z nich nie ma oparcia statystycznego jeszcze przed uwzględnieniem selekcji.

Trzecia praca bierze na warsztat wskaźniki niezawodności sędziów-modeli zapożyczone z klasycznej teorii testu. Przy ustalonej mierzonej stopie błędu sędziego na poziomie 4,72 proc. współczynnik KR-20 waha się od 0,01 do 0,68 w zależności od przeprojektowania banku zadań. Indeks zależności bywa natomiast mylony z prawdopodobieństwem klasyfikacji i różni się od niego o 0,25 do 0,43 punktu. Wniosek autorów jest prospołeczny: to nie recenzja konkretnych publikacji, lecz ostrzeżenie, bo liczby trafiają dalej, do decyzji wdrożeniowych i dokumentów ujawniających.

Dane, nie algorytmy

Czwarty audyt dotyczy siedmiu publicznych zbiorów do przewidywania wyników edukacyjnych. Trzy przeszły wszystkie cztery kontrole przed modelowaniem. Pozostałe cztery albo oblewały testy uogólniania między grupami, albo nie miały metadanych potrzebnych do ich przeprowadzenia. Najostrzejszy przykład: na zbiorze UCI Student wynik R² spadł z 0,242 przy losowym podziale do -0,097 przy podziale grupowym, a w zbiorze Higher Ed z 0,041 do -8,79. Zwiększanie złożoności modelu tego nie usuwało. Na kruchych danych zespoły modeli wzmacniały niestabilność.

Do tego dochodzi wątek etyczny i redakcyjny. W materiale „Guangming Daily” opublikowanym przez ScienceNet pięciu badaczy opisuje, jak AI wchodzi w cały proces badawczy: od generowania pomysłów, przez obróbkę danych, po pisanie pracy. Pojawiają się pytania o autorstwo pomysłu, o wygładzanie wyników i o odpowiedzialność, której nie da się przenieść na narzędzie. Wspólny mianownik jest tu ten sam co w rankingach: liczba albo tabela nie zastępuje procedury sprawdzenia.

Komentarze 0

Źródła

5
  1. 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
  2. 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
  3. 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
  4. 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
  5. 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH

Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.

Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.

Renata Pawlak

Renata Pawlak

Nauka i zdrowie

Renata Pawlak zajmuje się w FLASH24 nauką i zdrowiem, opierając teksty na publikacjach recenzowanych, komunikatach instytucji i danych źródłowych, a nie na doniesieniach bez pokrycia. Przy każdej liczbie sprawdza metodologię badania, wielkość próby i jednostki, a wyniki porównuje z wcześniejszymi pracami na ten sam temat. Czeka na comiesięczne raporty GUS i NFZ, rozmawia z lekarzami oraz fizykami, a przed publikacją pyta autorów o ograniczenia ich wniosków. Prywatnie interesuje się fizyką materiałów i obserwuje niebo przez własny teleskop, co pomaga jej czytać prace z dziedzin ścisłych. Nie publikuje niczego, czego nie może potwierdzić w co najmniej dwóch niezależnych źródłach.

Redakcja →

Komentarze

0
  1. Brak komentarzy — bądź pierwszy.

Dodaj komentarz

Komentarze są widoczne publicznie. Nie publikujemy wulgaryzmów, spamu i treści reklamowych.