Soofi S: GPQA fliegt aus dem Benchmark, weil Testfragen im Trainingsdatensatz steckten
Ein deutsches Forschungskonsortium hat den Wissenschaftsbenchmark GPQA aus der Bewertung von Soofi S gestrichen, einem offenen 30B-Modell. Umformulierte Testfragen waren in die offengelegten Trainingsdaten geraten. Das steht im Pretraining-Bericht des Konsortiums.

Koordiniert wird das Konsortium vom KI Bundesverband. Es hat Version 3.0 des Pretraining-Berichts veröffentlicht und die Kontamination selbst dokumentiert. Betroffen war der Datensatz QA-base. Er sollte nur umformulierte Trainings-Splits aus 25 Standard-Benchmarks enthalten, also Übungsfragen, die einem Modell Testformate beibringen, nicht die echten Testaufgaben. Er enthielt aber auch umformulierte Fragen aus dem GPQA-Testsatz, darunter die schwierigere Variante GPQA Diamond, auf Englisch und in maschinell übersetztem Deutsch.
Die Ursache war eine Eigenheit der Beschriftung, keine bewusste Abkürzung.
Auf Hugging Face wird GPQA ohne einen separaten Trainings-Split ausgeliefert. Das gesamte Testmaterial liegt unter dem Standardlabel "train". Die Datenpipeline des Konsortiums wählte Inhalte nach dem Split-Namen aus. So landeten Testfragen zusammen mit den Übungsaufgaben im Datensatz. Ein Audit, das dieser Fund auslöste, förderte drei weitere Benchmarks mit demselben Muster zutage: TruthfulQA, BLiMP und Inverse Scaling. Keine dieser drei wird in der Bewertung von Soofi S verwendet.
Ein Zuwachs, der normal aussah
Auffällig am Bericht ist, dass niemand das Problem während des Trainings bemerkte. Das Modell verbesserte sich auf den kontaminierten GPQA-Aufgaben stetig und stieg von 32,3 auf 43,4 Punkte. Die Autoren schreiben, dieser Zuwachs habe im normalen Bereich gelegen und sich nicht von den Fortschritten bei anderen Tests unterschieden. Es gab keinen Ausschlag, der als Warnsignal hätte dienen können.
Die Behebung ist verfahrenstechnisch. Das Team gleicht seine Trainingsdaten nun automatisch mit allen Testfragen ab, statt sich auf Split-Labels zu verlassen. Der Bericht beschreibt diese Labels als oft irreführend.
Als Reaktion auf das Leck strich das Konsortium GPQA vollständig aus seiner Bewertung und berechnete die Gesamtergebnisse für alle 16 verglichenen Modelle neu, damit das Feld auf derselben Grundlage bewertet wird. Den Autoren zufolge änderte sich die Rangfolge nicht.
Projektbeteiligter Nicolas Flores Herr vom Fraunhofer IAIS verweist auf den Vorfall als Beleg dafür, dass der offene Ansatz funktioniert. Die Community habe das Problem nur finden können, weil die Daten öffentlich waren. Das Team gibt an, rund 152.000 Einzelergebnisse zur Überprüfung bereitgestellt zu haben. Eine separate Bewertung durch den Konsortialpartner Ellamind bestätigte die Ergebnisse. Sie nutzte absichtlich zurückgehaltene Testdaten, die das Modell garantiert nicht im Training gesehen hat. Das Konsortium erklärt, der betroffene Anteil sei ein winziger Bruchteil des Gesamtkorpus.
Der Zeitpunkt ist unangenehm für benchmarkbasierte Aussagen allgemein. Separate Berichte der vergangenen Tage, darunter Arbeiten von Stanford HAI, haben infrage gestellt, wie gut aktuelle KI-Tests die Systeme bewerten, auf die sie zielen.
Was Soofi S tatsächlich ist
Soofi S 30B-A3B ist ein Mixture-of-Experts-Modell. Es trägt insgesamt 31,6 Milliarden Parameter, aktiviert aber pro generiertem Token etwa 3,2 Milliarden. Damit liegen seine Rechenkosten näher an einem 3B-Modell als an einem konventionellen 30B-Modell. Das Konsortium übernahm die Architektur von Nvidias Nemotron 3 Nano ohne Änderung: ein hybrides Design, das Mamba-2-Schichten mit Standard-Attention-Schichten kombiniert.
Der praktische Unterschied liegt im Speicherverhalten. In einem konventionellen Transformer wächst der KV-Cache, der frühere Token hält, linear mit der Kontextlänge. Bei langen Eingaben und vielen parallelen Anfragen wird das Nachladen zum Engpass. Nur 6 von Soofi S' 52 Schichten halten überhaupt einen solchen Cache. Bei einer Kontextlänge von 40.000 Token und 32 parallelen Anfragen meldet das Konsortium für Soofi S rund achtmal mehr Token pro Sekunde pro GPU als für dichte Modelle im Bereich von 14 bis 24 Milliarden Parametern. Der Durchsatz bleibt von 4.000 bis 256.000 Token nahezu konstant, während konventionelle Modelle abfallen. Das einzige Modell mit ähnlichem Verhalten in den Messungen ist laut Bericht Alibabas Qwen3.5 35B-A3B, das ebenfalls eine hybride Architektur nutzt.
Das Training lief vollständig auf der Industrial AI Cloud der Deutschen Telekom in München. Soofi S gehört damit zu den ersten großen Sprachmodellen auf dieser Infrastruktur. Die Trainingsmischung ist bewusst auf Deutsch ausgerichtet.
In den eigenen Benchmarks des Konsortiums schlägt das Modell andere vollständig offene Systeme, darunter OLMo 3 32B und Apertus 70B, bei deutschen, englischen und Programmieraufgaben. Die feinabgestimmten Instruct- und Reasoning-Varianten befinden sich im Beta-Test und sollen in den kommenden Wochen unter einer permissiven Lizenz erscheinen. Das größere Modell Soofi L wird bereits trainiert.
Das Argument der Übertrainierung
Nach dem Start argumentierten Kritiker, Soofi S sei nach den Maßstäben der Chinchilla-Scaling-Gesetze stark übertrainiert. Google DeepMind veröffentlichte diese Gesetze 2022, um zu beschreiben, wie man Modellgröße und Trainingsdaten bei festem Rechenbudget ausbalanciert. Der von ihnen identifizierte Optimalpunkt lag bei rund 20 Token pro Parameter. Soofi S geht weit darüber hinaus. Mit etwa 27 Billionen Token und 30 Milliarden Parametern landet es bei mehreren Hundert zu eins. Zählt man nur die 3,2 Milliarden pro Token aktiven Parameter, erreicht das Verhältnis mehrere Tausend zu eins.
Michael Fromm aus der technischen Leitung des Projekts weist diese Lesart zurück. Er argumentiert, die alten Regeln ließen sich nicht auf Mixture-of-Experts-Architekturen übertragen. "Es gibt neue Forschung, die zeigt, dass die alten Scaling-Gesetze von dichten Modellen für MoE-Architekturen nicht mehr gelten", sagte Fromm. Der Grund liege im Aufbau: Einzelne Experten profitierten davon, dieselben Dokumente zu sehen. Wiederholte Daten in einem großen, hochwertigen Satz seien deshalb weniger problematisch als bei einem dichten Modell. Als Vergleichspunkt nennt er Nvidia, das seine eigenen Modelle mit bis zu 25 Billionen Token trainierte.
Die kontaminierten Daten waren Testmaterial, kein Übungsmaterial, und die Pipeline konnte den Unterschied nicht erkennen, weil ein Label ihn verdeckte.
Das ist der unangenehme Teil des Vorfalls. Das Leck war kein Fall, in dem ein Labor still auf einem Testsatz trainierte. Es war eine Namenskonvention auf einem öffentlichen Datensatz, angewandt im großen Maßstab von einer automatisierten Pipeline. Sie entging allen, bis die Daten offenlagen und jemand nachsah. Die Antwort des Konsortiums, jeden Trainingsposten gegen jede Testfrage abzugleichen, ist die Art von Kontrolle, die Rechenzeit und Zeit kostet und die nur wenige Teams öffentlich beschreiben.
Der weitere Kontext dieser Veröffentlichung ist eine Benchmark-Kultur unter Druck. Ein im September auf stale.jock.pl veröffentlichter Tracker listet Veröffentlichungsdaten und Trainings-Cutoffs für 20 aktuelle Modelle aus 8 Labors. Er merkt an, dass nur 10 der 20 einen Cutoff tragen, den das Labor tatsächlich veröffentlicht. Seine Autoren argumentieren, ein Modell könne im September erscheinen und trotzdem im April aufgehört haben zu lesen. Suchwerkzeuge überdeckten die Lücke, statt sie zu schließen. Gemessen über 2.000 Aufrufe bei 16 Modellen, jedes mit einem Websuche-Werkzeug ausgestattet, berichten sie, dass Frontier-Modelle fast immer richtig entschieden. Schwächere beantworteten abgeschlossene Fragen aus dem Gedächtnis, nachdem sich die Antwort geändert hatte.
Benchmarks und Modellkarten sind das gemeinsame Vokabular der Branche dafür, was ein System leisten kann. Soofi S zeigt beide Hälften davon: ein dokumentiertes Leck, öffentlich behandelt, und eine Reihe von Durchsatz- und Benchmarkzahlen, die nun von einer korrigierten Bewertung abhängen. Die Instruct- und Reasoning-Varianten und die neu berechnete Vergleichstabelle sind die nächsten Dinge, die zu prüfen sind.
Quellen
2- 01German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and GermanEN
- 02How stale is your AI? Release age and training cutoff for 20 modelsEN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.