Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Studio sulla memorizzazione: la maggior parte degli LLM non riproduce i libri

Un articolo accettato a COLM 2026 riporta che su 200 libri e 14 modelli a pesi aperti la maggior parte dei modelli non memorizza la maggior parte dei libri. Llama 3.1 70B, però, riesce a riprodurne almeno uno per intero.

IA e modelliNotiziaGiulia FerrariPubblicato: 27 settembre 20268 min di letturaFonti 3
Studio sulla memorizzazione: la maggior parte degli LLM non riproduce i libri

La maggior parte dei grandi modelli linguistici non memorizza la maggior parte dei libri su cui è stata addestrata. Lo sostiene un articolo accettato a COLM 2026, basato su uno studio che ha eseguito più di 3.000 esperimenti di estrazione su 200 libri e 14 modelli a pesi aperti. La conclusione va contro le asserzioni categoriche che entrambe le parti hanno fatto nel contenzioso sul copyright legato all'IA generativa.

Il lavoro si intitola "Extracting memorized pieces of (copyrighted) books from open-weight language models", pubblicato per la prima volta su arXiv a maggio 2025 e revisionato fino a luglio 2026. Tra gli autori figurano A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho e Percy Liang. L'abstract afferma chiaramente che le posizioni polarizzate di attori e convenuti "drammatically oversimplify the relationship between memorization and copyright".

Cosa ha effettivamente rilevato il metodo di estrazione

Il risultato principale è negativo, ed è più limitato di quanto sembri. Rispetto alla specifica metodologia di estrazione degli autori, la maggior parte degli LLM non memorizza la maggior parte dei libri, né integralmente né in parte. Quel qualificatore conta. La conclusione riguarda ciò che questa particolare tecnica è riuscita a estrarre. Non è una prova generale che i dati di addestramento non lascino traccia.

Le eccezioni sono il punto in cui l'articolo diventa scomodo per gli sviluppatori dei modelli. Llama 3.1 70B memorizza interamente alcuni libri, scrivono gli autori, citando Harry Potter e la pietra filosofale. La memorizzazione è abbastanza estesa da permettere di estrarre l'intero libro quasi alla lettera, in modo deterministico, usando le prime parole del libro come prompt iniziale. Nessun trucco di campionamento, nessun jailbreak: basta la frase di apertura.

La memorizzazione variava sia per modello sia per libro tra i 14 sistemi a pesi aperti testati. L'abstract non nomina gli altri modelli e non fornisce una ripartizione per libro. Quali titoli siano più esposti, al di fuori dell'esempio di Harry Potter, resta una questione aperta nel riassunto pubblicato.

Gli autori sono prudenti su cosa significhino i loro risultati per i tribunali. Concludono che le conclusioni hanno implicazioni significative per i casi di copyright, "though not ones that unambiguously favor either side". Quella frase è il vero contributo dell'articolo al dibattito, ed è probabile che venga citata fuori contesto da entrambe le parti in causa.

L'argomento sulle licenze che accompagna la ricerca

Mentre i ricercatori misurano cosa trattengono i modelli, è in corso un'altra battaglia su cosa significhi la parola "aperto" quando è applicata a essi. The Register ha pubblicato il 15 settembre una rubrica di Steven J. Vaughan-Nichols, secondo cui il settore descrive abitualmente le pubblicazioni come "modelli open source" quando sono solo a pesi aperti.

La distinzione, come la inquadra la rubrica, determina se si può semplicemente distribuire una rete neurale già pronta oppure se si può ispezionare, riprodurre, modificare e ridistribuire il sistema che l'ha prodotta. I pesi sono i parametri numerici appresi creati dall'addestramento. Insieme all'architettura e al codice di inferenza, fanno funzionare un modello. Non dicono cosa ci sia stato messo dentro.

La Open Source Initiative traccia la linea direttamente. La sua posizione, citata nella rubrica, è che i pesi aperti si riferiscono ai pesi e ai bias finali di una rete neurale addestrata, e che pubblicarli espone solo "a fraction of the information required for full accountability".

"Open weights are progress. You can download the model, run it on your own machine, keep it out of someone else's data pipeline. But you still can't see how the thing was built, what it was trained on, or why it behaves the way it does. That's not an open model. That's open distribution."

È James Landay, direttore dello Stanford Institute for Human-Centered AI, parlando con The Register. Ha aggiunto che c'è "a wide gap between open-weight AI and open source AI", e ha sostenuto che senza dati di addestramento divulgati o un resoconto documentato e verificabile degli stessi, chi è fuori non può testare o riprodurre il lavoro nel senso più pieno.

Senza i dati di addestramento, osserva la rubrica, chi è fuori non può determinare quali fonti siano state usate, quale materiale protetto da copyright o privato possa essere stato incluso, come i dati siano stati selezionati o rimossi, quali lingue e comunità siano state sottorappresentate, se i dati di benchmark siano trapelati nell'addestramento, o quali metodi di allineamento abbiano plasmato il modello dopo il pre-addestramento. Quell'elenco è esattamente l'insieme di domande a cui l'articolo sulla memorizzazione cerca di rispondere empiricamente, dall'esterno, con l'estrazione invece che con la divulgazione.

La Open Source AI Definition della stessa OSI, OSAID 1.0, pubblicata a ottobre 2024, richiede che i parametri del modello, compresi i pesi, siano disponibili secondo termini approvati dall'OSI, ma non prescrive un meccanismo legale specifico. Ha attirato critiche da figure tra cui Bruce Perens, autore della Open Source Definition originale, che ha dichiarato: "It's not Open Source! ... It's unfortunate that the Open Source Initiative itself is now involved in Openwashing." Bradley Kuhn della Software Freedom Conservancy e Richard Fontana di Red Hat hanno chiesto l'abrogazione di OSAID, sostenendo che l'OSI "acted too quickly to impose an overly ambitious policy compromise on the community".

Uno sforzo concorrente, la licenza Open Model, Data, and Weights della Linux Foundation, o OpenMDW, è stato sottoposto all'OSI. Esiste dal 2025, elenca contributori di Amazon, Meta, IBM, Microsoft e Nvidia, e definisce termini separati per l'architettura, i dati di addestramento e i pesi di un modello. The Register riferisce che la presentazione ha incontrato obiezioni sulla mailing list di revisione delle licenze dell'OSI. Stefano Maffulli, ex direttore esecutivo dell'OSI, ha detto di avere la continua impressione che la revisione sia "tainted by an ideological bias".

Più economici, più vicini, e comunque non riproducibili

Mozilla ha pubblicato la versione 1.1 del suo rapporto State of Open Source AI il 15 settembre, con dati aggiornati al 1 settembre. Tom's Hardware lo ha trattato il giorno seguente. Il rapporto colloca il miglior modello aperto a tre punti dal leader chiuso sull'Artificial Analysis Intelligence Index, al 60% del prezzo, e a due punti da Claude Fable 5 al 30%. La stima di Mozilla sui dati METR relativi all'orizzonte dei compiti colloca il divario aperto-chiuso a circa 4,4 mesi, in linea con la stima di quattro mesi di Epoch AI.

La metodologia merita attenzione. METR valuta i modelli in base alla lunghezza del compito, in tempo di lavoro umano, che completano la metà delle volte. Secondo la stima adattata di Mozilla, i modelli chiusi gestiscono compiti che richiedono a esperti umani da 8 a 12 ore; i modelli aperti raggiungono quel livello circa quattro mesi dopo, con la capacità aperta che raddoppia ogni 3,9 mesi contro 5,5 per quella chiusa. Il rapporto si basa su un sondaggio Mozilla/SlashData di circa 1.400 sviluppatori, sui dati di traffico di OpenRouter e su indici di benchmark di terze parti. Mozilla sostiene i modelli aperti, e TIME ha riferito il 14 luglio che il direttore tecnico di Mozilla, Raffi Krikorian, ha descritto il rapporto come in parte advocacy.

Su Terminal-Bench 2.1 di vals.ai, che esegue ogni modello attraverso lo stesso harness, GLM-5.2 di Z.ai ha ottenuto un punteggio entro un punto da Claude Opus 4.7 e circa quattro punti dietro Opus 4.8, a meno di un quinto del costo per test. Su OpenRouter, Mozilla ha contato otto dei primi dieci modelli per volume di token di agosto come a pesi aperti, sette dei quali costruiti in Cina. I fornitori chiusi hanno comunque preso il 96% dei ricavi a livello di modello su OpenRouter da maggio a settembre 2025, secondo la Linux Foundation. "We see the decision to pay for closed [models] as workload-specific rather than organization-specific", ha detto Krikorian ad Ars Technica in un'email.

Il rapporto conta 16 pubblicazioni aperte degne di nota, e Tom's Hardware osserva che nessuna fornisce la ricetta dei dati richiesta dalla definizione OSI. Il divario di quattro mesi e il dato del 30% sul prezzo dei token sono misurati da API ad API su endpoint ospitati e a prezzo di listino. Il grafico hardware del rapporto stesso colloca il miglior modello aperto che entra in un server a 52,6 e il migliore su una singola GPU a 40, cali di 10 e 23 punti dal vertice: un divario più ampio di quanto suggerisca il dato di quattro mesi. Il checkpoint nativo MXFP4 di Kimi K3 occupa circa 1,56TB su 96 shard, con la configurazione di servizio di Mozilla che elenca 64 o più acceleratori, e vLLM che richiede almeno otto GPU GB300 con più nodi per il traffico di produzione. Il rapporto lo descrive come aperto ma non eseguibile dalla maggior parte di chi lo possiede. Inkling-Small di Thinking Machines, sotto Apache 2.0, è un'eccezione, con una versione NVFP4 che entra in una singola B300 con un minimo di 180GB.

I dati si fermano al 1 settembre, e i benchmark si sono mossi da allora. Artificial Analysis è ora all'indice v4.3 con un insieme di valutazione diverso, e la sua board live ha Claude Fable 5.1 a 53 sulla sua impostazione di sforzo massimo con Kimi K3 a 44, numeri non comparabili con i valori v4.1.1 che Mozilla ha tracciato. La didascalia del grafico di Mozilla recita: "the gap resets every release cycle".

Un ulteriore elemento del rapporto è enunciato come accusa anziché come risultato. Un avviso congiunto dell'8 settembre di NSA, CISA e FBI (AA26-251A) afferma che Moonshot ha estratto dati di Claude Fable 5 per addestrare K3 attraverso la distillazione, la pratica di addestrare un modello sugli output di un altro. Il rapporto di Mozilla descrive l'affermazione come "asserted, and unshown".

Mettendo insieme i due filoni, il quadro è scomodo per chiunque voglia una risposta netta. Un modello può essere scaricabile, economico, a pochi mesi dalla frontiera, e comunque opaco sui suoi dati di addestramento. E quando i ricercatori vanno a cercare cosa ha trattenuto, come ha fatto l'articolo COLM con 200 libri e più di 3.000 esperimenti, scoprono che la risposta dipende da quale modello e quale libro si chieda. Il riassunto di Landay sul divario, come citato da The Register: "Open weights answer 'Can I run this?' Open source answers 'Can I trust this, improve it, and build the next thing on top of it?'"

Commenti 0

Fonti

3
  1. 01Extracting memorized pieces of books from open-weight language modelsEN
  2. 02Open weights are not open source: Why AI's favorite label is under disputeEN
  3. 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.