Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Ranglisten von Modellen, für die die Belege nicht reichen

Vier unabhängige Arbeiten der letzten Wochen zeigen: Tabellen mit Ergebnissen von Sprachmodellen wirken entschiedener, als es die Daten zulassen. Das Problem betrifft auch die Forschung, die mit KI betrieben wird.

WissenschaftAnalyseHanna VogtVeröffentlicht: 25. September 20268 Min. LesezeitQuellen 5
Ranglisten von Modellen, für die die Belege nicht reichen

Die Rangliste ist die gebräuchlichste Form, Fortschritt im maschinellen Lernen mitzuteilen: Zeilen für die Modelle, Spalten für die Tests, eine höhere Position bedeutet besser. Neuere Arbeiten prüfen jedoch, wie viel eine solche Tabelle tatsächlich hergibt, wenn man nach der Stabilität der Messung fragt. Die Antwort ist unangenehm.

Dieselbe Antwort, andere Struktur

Für eines der Audits nahm sich ein Autor die Schlussfolgerung über die Prompt-Struktur eines Modells vor. Er wiederholte die Messung an acht offenen Varianten aus fünf Familien, von 8 bis 675 Milliarden Parametern, mit abgeschaltetem Caching und 293 erhaltenen Zwischenrepräsentationen. Schon das gemessene Phänomen erwies sich als instabil. Identische Aufrufe reproduzierten nicht die identische Struktur, die mittlere Übereinstimmung der Knotenmenge schwankte zwischen 0,39 und 0,96, und in 72 Prozent der Fälle stimmte ein Paar aus Prompt und Modell nie über die gesamte Menge überein. Nach einem geclusterten Bootstrap hielt nur das untere Ende der Rangliste stand. Die zwei am wenigsten reproduzierbaren Modelle behielten ihre Position in 99 und 86 Prozent der Wiederholungen, die vier mittleren in 27 bis 48 Prozent, die zwei besten in 68 Prozent. Die Tabelle zeigt also verlässlich das schlechteste Modell, aber nicht das beste. Zwei ebenso sinnvolle Regeln zur Zusammenführung wiederholter Kampagnen verändern vier von acht Zeilen und verschieben den Spitzenwert der Studie um 7 Prozentpunkte. Vier der acht Endpunkte wurden innerhalb von zehn Wochen nach der Messung zurückgezogen.

Selektion und Statistik

Die zweite Arbeit fragt, wie viele verborgene Varianten eines Modells hinter einem veröffentlichten Vorsprung stehen können. Für eine feste Modellfamilie leiten die Autoren eine Sensitivitätskurve ab. Sie beschreibt die maximale Zahl solcher Varianten in Abhängigkeit von einer unteren Schranke der Korrelation innerhalb der Familie. Das Audit von 394 Aussagen über benachbarte Positionen auf dem Open LLM Leaderboard ergab, dass 391 davon schon vor Berücksichtigung der Selektion keine statistische Grundlage haben.

Die dritte Arbeit nimmt Zuverlässigkeitsmaße von Modell-Juroren vor, die aus der klassischen Testtheorie stammen. Bei einer festen gemessenen Fehlerrate des Juroren von 4,72 Prozent schwankt der KR-20-Koeffizient je nach Neuzuschnitt der Aufgabenbank zwischen 0,01 und 0,68. Der Abhängigkeitsindex wird mitunter mit der Klassifikationswahrscheinlichkeit verwechselt und weicht um 0,25 bis 0,43 Punkte von ihr ab. Das Fazit der Autoren richtet sich an die Gemeinschaft: Es ist keine Rezension einzelner Publikationen, sondern eine Warnung, denn die Zahlen wandern weiter, in Einführungsentscheidungen und Offenlegungsdokumente.

Daten, nicht Algorithmen

Das vierte Audit betrifft sieben öffentliche Datensätze zur Vorhersage von Bildungsergebnissen. Drei bestanden alle vier Kontrollen vor der Modellierung. Die übrigen vier fielen entweder bei Tests zur Generalisierung zwischen Gruppen durch oder hatten keine Metadaten, mit denen sich diese Tests durchführen ließen. Das deutlichste Beispiel: Im Datensatz UCI Student sank das R² von 0,242 bei zufälliger Aufteilung auf -0,097 bei gruppierter Aufteilung, im Datensatz Higher Ed von 0,041 auf -8,79. Eine höhere Modellkomplexität beseitigte das nicht. Auf brüchigen Daten verstärkten Ensembles die Instabilität.

Hinzu kommt der ethische und redaktionelle Aspekt. In einem von ScienceNet veröffentlichten Beitrag der „Guangming Daily“ beschreiben fünf Forscher, wie KI in den gesamten Forschungsprozess eindringt: vom Entwickeln von Ideen über die Aufbereitung der Daten bis zum Schreiben der Arbeit. Es tauchen Fragen nach der Urheberschaft einer Idee auf, nach dem Glätten von Ergebnissen und nach der Verantwortung, die sich nicht auf ein Werkzeug übertragen lässt. Der gemeinsame Nenner ist derselbe wie bei den Ranglisten: Eine Zahl oder eine Tabelle ersetzt kein Prüfverfahren.

Kommentare 0

Quellen

5
  1. 01How Reproducible Are Evaluation Conclusions? A Self-Audit of LLM-Inferred Prompt StructureEN
  2. 02How Sensitive Are LLM Leaderboard Claims to Hidden Model Selection?EN
  3. 03Three Ways Classical Test Theory Misleads for LLM JudgesEN
  4. 04Limited Structural Reliability in Public Educational Prediction BenchmarksEN
  5. 05科学网/光明日报: AI时代,我们需要什么样的学术规范ZH

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Hanna Vogt

Hanna Vogt

Wissenschaft und Gesundheit

Hanna Vogt schreibt für FLASH24 über Wissenschaft und Gesundheit und stützt sich dabei auf Primärstudien, Behördenberichte und Rohdaten statt auf Pressemitteilungen. Bei Zahlen prüft sie Stichprobengrößen, Konfidenzintervalle und ob die zitierte Quelle die Aussage tatsächlich deckt. Für ihre Texte spricht sie mit Studienautorinnen, wartet auf Peer-Review-Fassungen und vergleicht Vorabdrucke mit der finalen Publikation. Dass sie privat Materialphysik verfolgt und mit eigenem Teleskop den Himmel beobachtet, erklärt, warum sie bei Messmethoden und Instrumenten genau nachfragt. Sie publiziert keine Ergebnisse, deren Datengrundlage sie nicht selbst eingesehen hat.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.