Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Il consorzio tedesco toglie GPQA dalla valutazione di Soofi S: le domande del test erano nei dati di addestramento

Un consorzio di ricerca tedesco ha rimosso il benchmark scientifico GPQA dalla valutazione di Soofi S, modello aperto da 30B, dopo aver scoperto che domande del test riformulate erano finite nei dati di addestramento resi pubblici. A documentarlo è il consorzio stesso, nel rapporto di pretraining.

IA e modelliNotiziaGiulia FerrariPubblicato: 27 settembre 20266 min di letturaFonti 2
Il consorzio tedesco toglie GPQA dalla valutazione di Soofi S: le domande del test erano nei dati di addestramento

Il consorzio, coordinato dalla KI Bundesverband, ha pubblicato la versione 3.0 del rapporto di pretraining e ha documentato la contaminazione da solo. Il dataset coinvolto è QA-base. Doveva contenere solo split di addestramento riformulati da 25 benchmark standard, cioè domande di esercizio che insegnano a un modello i formati dei test, non gli elementi reali delle prove. Conteneva invece anche domande riformulate del set di test GPQA, compresa la variante più difficile GPQA Diamond, in inglese e in tedesco tradotto automaticamente.

La causa è un'etichetta fuorviante, non una scorciatoia deliberata.

Su Hugging Face, GPQA viene distribuito senza uno split di addestramento separato. Tutto il suo materiale di test sta sotto l'etichetta predefinita "train". La pipeline dati del consorzio selezionava i contenuti per nome dello split, così le domande del test sono finite insieme agli elementi di esercizio. Un audit avviato dopo la scoperta ha fatto emergere altri tre benchmark con lo stesso schema: TruthfulQA, BLiMP e Inverse Scaling. Nessuno di questi tre viene usato nella valutazione di Soofi S.

Un guadagno che sembrava normale

Dal rapporto emerge soprattutto che nessuno ha notato il problema durante l'addestramento. Il modello migliorava costantemente sui compiti GPQA contaminati, salendo da 32,3 a 43,4 punti. Gli autori però dicono che quel guadagno rientrava nell'intervallo normale e non sembrava diverso dai progressi su altri test. Non c'è stato alcun picco che potesse servire da avvertimento.

La correzione è procedurale. Il team ora confronta automaticamente i dati di addestramento con tutte le domande dei test, invece di affidarsi alle etichette degli split, che il rapporto descrive come spesso fuorvianti.

In risposta alla fuga di dati, il consorzio ha eliminato del tutto GPQA dalla sua valutazione e ha ricalcolato i risultati complessivi per tutti i 16 modelli confrontati, così che il campo fosse valutato sulla stessa base. Secondo gli autori, l'ordine della classifica non è cambiato.

Nicolas Flores Herr, che partecipa al progetto per il Fraunhofer IAIS, indica l'incidente come prova che l'approccio aperto funziona: la comunità ha potuto individuare il problema solo perché i dati erano pubblici. Il team afferma di aver reso disponibili circa 152.000 risultati individuali per la verifica. Una valutazione separata del partner del consorzio Ellamind, con dati di test deliberatamente tenuti nascosti che il modello non poteva aver visto in addestramento, ha confermato i risultati. Il consorzio dice che la porzione coinvolta è una frazione minuscola del corpus totale.

I tempi sono scomodi per le affermazioni basate sui benchmark in generale. Approfondimenti separati nei giorni scorsi, tra cui un lavoro di Stanford HAI, hanno messo in dubbio quanto bene i test attuali sull'IA valutino i sistemi a cui sono destinati.

Che cosa è davvero Soofi S

Soofi S 30B-A3B è un modello mixture-of-experts. Ha 31,6 miliardi di parametri in totale ma ne attiva circa 3,2 miliardi per token generato, il che avvicina il suo costo computazionale a un modello da 3B più che a uno convenzionale da 30B. Il consorzio ha adottato senza modifiche l'architettura del Nemotron 3 Nano di Nvidia: un progetto ibrido che combina layer Mamba-2 con layer di attenzione standard.

La differenza pratica è nel comportamento della memoria. In un transformer convenzionale, la KV cache che conserva i token precedenti cresce linearmente con la lunghezza del contesto, e ricaricarla diventa un collo di bottiglia con input lunghi e molte richieste parallele. Solo 6 dei 52 layer di Soofi S mantengono una cache di questo tipo. Con una lunghezza di contesto di 40.000 token e 32 richieste parallele, il consorzio riporta che Soofi S genera circa otto volte più token al secondo per GPU rispetto ai modelli densi nella fascia da 14 a 24 miliardi di parametri. Il throughput resta quasi piatto da 4.000 a 256.000 token, mentre i modelli convenzionali calano. L'unico modello che mostra un comportamento simile nelle misurazioni, secondo il rapporto, è il Qwen3.5 35B-A3B di Alibaba, che usa anch'esso un'architettura ibrida.

L'addestramento si è svolto interamente sull'Industrial AI Cloud di Deutsche Telekom a Monaco, rendendo Soofi S uno dei primi grandi modelli linguistici costruiti su quell'infrastruttura. La miscela di addestramento è volutamente sbilanciata verso il tedesco.

Sui benchmark del consorzio, il modello batte altri sistemi completamente aperti, tra cui OLMo 3 32B e Apertus 70B, su compiti in tedesco, inglese e programmazione. Le varianti instruct e reasoning ottimizzate sono in beta testing e dovrebbero uscire con una licenza permissiva nelle prossime settimane. Il modello più grande Soofi L è già in addestramento.

L'argomento dell'addestramento eccessivo

Dopo il lancio, i critici hanno sostenuto che Soofi S era stato addestrato in modo eccessivo secondo gli standard delle leggi di scala di Chinchilla, che Google DeepMind ha pubblicato nel 2022 per descrivere come bilanciare la dimensione del modello rispetto ai dati di addestramento a parità di budget computazionale. Il punto ottimale che avevano individuato era di circa 20 token per parametro. Soofi S va molto oltre. Con circa 27.000 miliardi di token e 30 miliardi di parametri, arriva a diverse centinaia a uno. Contando solo i 3,2 miliardi di parametri attivi per token, il rapporto raggiunge diverse migliaia a uno.

Michael Fromm, parte della leadership tecnica del progetto, respinge questa lettura. Sostiene che le vecchie regole non valgono per le architetture mixture-of-experts. "Nuove ricerche mostrano che le vecchie leggi di scala dei modelli densi non si applicano più alle architetture MoE", ha detto Fromm. Il motivo, dice, sta nella costruzione: i singoli esperti traggono vantaggio dal vedere gli stessi documenti, quindi i dati ripetuti in un insieme ampio e di alta qualità sono meno problematici di quanto lo sarebbero per un modello denso. Come termine di paragone cita Nvidia, che ha addestrato i propri modelli su fino a 25.000 miliardi di token.

I dati contaminati erano materiale di test, non materiale di esercizio, e la pipeline non riusciva a distinguerli a causa di un'etichetta.

Questa è la parte scomoda dell'episodio. La fuga non è stata il caso di un laboratorio che addestrava in silenzio su un set di test. È stata una convenzione di denominazione su un dataset pubblico, applicata su larga scala da una pipeline automatica, che è sfuggita a tutti finché i dati non sono stati allo scoperto e qualcuno non è andato a cercare. La risposta del consorzio, confrontare ogni elemento di addestramento con ogni domanda di test, è il tipo di controllo che costa calcolo e tempo e che pochi team descrivono pubblicamente.

Il contesto più ampio di questa uscita è una cultura dei benchmark sotto tensione. Un tracker pubblicato su stale.jock.pl a settembre elenca date di rilascio e cutoff di addestramento per 20 modelli attuali di 8 laboratori, e nota che solo 10 dei 20 portano un cutoff che il laboratorio pubblica davvero. I suoi autori sostengono che un modello può uscire a settembre e aver comunque smesso di leggere ad aprile, e che gli strumenti di ricerca coprono il divario invece di colmarlo. Misurato su 2.000 chiamate attraverso 16 modelli, a ciascuno dei quali è stato dato uno strumento di ricerca web, riportano che i modelli di frontiera hanno deciso correttamente quasi ogni volta, mentre quelli più deboli hanno risposto a domande già risolte basandosi sulla memoria dopo che la risposta era cambiata.

I benchmark e le model card sono il vocabolario condiviso del settore su ciò che un sistema sa fare. Soofi S mostra entrambe le metà di questo: una fuga documentata e gestita in pubblico, e una serie di numeri di throughput e di benchmark che ora dipendono da una valutazione corretta. Le varianti instruct e reasoning, e la tabella di confronto ricalcolata, saranno le prossime cose da controllare.

Commenti 0

Fonti

2
  1. 01German AI consortium releases Soofi S, an open 30B model that tops benchmarks in both English and GermanEN
  2. 02How stale is your AI? Release age and training cutoff for 20 modelsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.