Decisioni fragili: quanto è facile ribaltare una scelta corretta del modello
Quattro lavori di settembre mostrano i punti deboli dei modelli linguistici: un contesto breve e dall'aspetto naturale riesce a ribaltare una decisione corretta, e la distanza tra ciò che il modello codifica e ciò che usa per decidere può essere molto ampia.

I modelli decisionali mappano il testo su una distribuzione di probabilità entro un insieme finito di scelte. Guidano sempre più spesso azioni reali: smistano segnalazioni, scelgono strumenti, avviano operazioni. Il lavoro "JevOut" parte da una domanda: che cosa succede a una decisione del genere quando all'input si aggiunge un breve testo che si adatta naturalmente al contesto e non cambia la risposta corretta.
Contesto contro risposta
Gli autori hanno scelto una strategia sperimentale semplice. Per ogni compito inizialmente corretto hanno fissato una sola opzione sbagliata come bersaglio. Poi hanno ottimizzato le aggiunte al contesto: dovevano restare fluide e insieme spostare la scelta verso quell'opzione. Fonte, domanda, insieme delle risposte e risposta corretta restavano intatti. Delle 508 decisioni inizialmente corrette del modello Jev, 312 sono state dirottate, il 61,4 per cento. In 229 casi il modello ha assegnato all'opzione sbagliata fissata una probabilità di almeno 0,7. I test su altri tre sistemi decisionali hanno dato una percentuale di dirottamenti riusciti tra il 64,9 e il 73,2 per cento. La conclusione degli autori è netta: se questi modelli trasformano il linguaggio direttamente in decisioni, le loro probabilità non vanno trattate come un'interfaccia decisionale affidabile.
Se la motivazione serve a qualcosa
Il secondo progetto esamina una situazione ancora più elementare. Il modello scarta un candidato citando un fatto che nel profilo non c'era, per esempio l'assenza di un regista o di una data di morte. Quella frase è verificabile senza alcun giudice: basta inserire nel profilo una frase del corpus che riporta quel fatto e chiedere di nuovo. Nel più grande dei tre cicli, con sei modelli aperti sul set 2WikiMultihopQA, la fornitura del fatto indicato ha spostato la scelta più di un'aggiunta irrilevante pareggiata per lunghezza. Il rapporto di probabilità è di 3,57, nell'intervallo da 1,54 a 8,26, con la correzione di Holm a un livello di 0,0210. Il risultato ha tenuto dopo la rimozione di qualsiasi singolo modello.
Ma l'effetto più interessante non riguarda il contenuto. La stessa aggiunta irrilevante spostava la scelta più quando era collocata accanto al rivale indicato che accanto alla terza opzione, quella che il modello non aveva menzionato. Qui la correzione di Holm si ferma a un livello di 0,0008. In altre parole, una parte dell'effetto la produce la sola collocazione della frase, non il suo contenuto. L'autore riferisce anche che la validazione delle regole di misurazione ha individuato otto difetti. Il più grave, una regola di parsing della scelta che restituiva proprio l'opzione scartata nel 17,1 per cento delle risposte decidibili, avrebbe gonfiato il numero di contrasti sopravvissuti da quattro a sei.
Linearità e ripetitività
Gli altri due lavori riguardano proprietà dei modelli stessi. Il gruppo di Pavel Tikhonov mostra che i transformer, pur essendo fatti di elementi fortemente non lineari, presentano una linearità di fondo. Quando gli input di flussi di testo diversi vengono sommati linearmente, la distribuzione del token successivo diventa la sovrapposizione delle distribuzioni dei singoli flussi. Gli autori la chiamano ipotesi di linearità della sovrapposizione e sostengono che sia una proprietà dell'architettura, non un effetto dell'addestramento. Con il pre-addestramento il fenomeno si indebolisce, e un fine-tuning leggero riesce a ripristinare la linearità. Da qui un'applicazione curiosa: il decoding guidato permette di districare la sovrapposizione e generare due continuazioni coerenti da un solo passaggio in avanti.
L'ultimo lavoro riguarda la degenerazione del testo, cioè la ripetitività del modello. L'autore non risolve la disputa tra la spiegazione dei dati e quella della rete. Conduce invece una misura di altro tipo: la struttura dei punti fissi della mappa di massima probabilità in una finestra breve, su 96 avvii casuali da due token e diciassette modelli già pronti. La classe di comportamento è risultata stabile in diciassette casi su diciassette, ma a corpus e scala fissati non è decisa: alcune famiglie formano imbuti, altre no. Otto modelli su diciassette e sette famiglie su cinque corpus mostrano un imbuto. La conclusione è metodologica: parlare di ripetitività come caratteristica di un singolo modello è prematuro.
Fonti
4- 01JevOut: Natural Context Can Flip Decision ModelsEN
- 02Does a model's stated reason for rejecting a candidate do any work?EN
- 03Superposition Linearity HypothesisEN
- 04What a Cross-Model Fixed-Point Census Can and Cannot Arbitrate About RepetitionEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.