Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Pesi aperti, ricette chiuse: cosa dicono davvero il paper sulla memorizzazione e la disputa sulle licenze

Un paper accettato a COLM 2026 ha misurato quanto 14 modelli linguistici a pesi aperti abbiano memorizzato 200 libri. La maggior parte dei modelli non riproduce la maggior parte dei libri. Llama 3.1 70B però, se lo si avvia con le prime parole di un libro, arriva a un output quasi letterale di alcuni titoli. Il risultato cade in mezzo alla discussione su cosa debba significare "aperto".

IA e modelliAnalisiGiulia FerrariPubblicato: 27 settembre 20265 min di letturaFonti 3
Pesi aperti, ricette chiuse: cosa dicono davvero il paper sulla memorizzazione e la disputa sulle licenze

Il paper è Extracting memorized pieces of (copyrighted) books from open-weight language models, arXiv:2505.12546, inviato per la prima volta il 18 maggio 2025 e rivisto fino al 20 luglio 2026. Gli autori sono A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho e Percy Liang. È accettato a COLM 2026.

L'obiettivo dichiarato è lo stile argomentativo delle cause legali. Nei casi sul copyright nell'IA generativa, si legge nell'abstract, attori e convenuti "spesso avanzano affermazioni radicali e contrapposte sulla misura in cui i grandi modelli linguistici (LLM) memorizzano espressione protetta dai libri nei loro dati di addestramento". Secondo gli autori, entrambe le parti "semplificano in modo estremo il rapporto tra memorizzazione e copyright".

Hanno quindi costruito una tecnica di misurazione e l'hanno applicata su larga scala: 200 libri, 14 modelli a pesi aperti, più di 3000 esperimenti. Il risultato principale va contro le tesi più forti. "Rispetto alla nostra specifica metodologia di estrazione, troviamo che la maggior parte degli LLM non memorizza la maggior parte dei libri, né integralmente né in parte."

Poi le eccezioni. Llama 3.1 70B "memorizza interamente alcuni libri, come Harry Potter e la pietra filosofale". La memorizzazione è abbastanza estesa che, secondo l'abstract, "si può estrarre in modo deterministico l'intero libro quasi alla lettera usando le prime parole del libro come prompt iniziale". Il risultato dipende dal modello e dal libro, ed è proprio questo il punto: la memorizzazione non è una proprietà degli LLM in generale.

Se questo aiuti qualcuno in tribunale resta aperto. L'abstract dice che i risultati "hanno implicazioni significative per i casi sul copyright, anche se non tali da favorire in modo inequivocabile una delle due parti".

Il problema dell'etichetta, sotto

I modelli di quello studio sono a pesi aperti. Si possono scaricare. Non è la stessa cosa di open source, e The Register lo ha sostenuto il 15 settembre 2026 in una rubrica di Steven J. Vaughan-Nichols. La Open Source Initiative, custode della Open Source Definition, definisce i pesi aperti come "i pesi e i bias finali di una rete neurale addestrata", e aggiunge che i soli pesi espongono appena "una frazione delle informazioni necessarie per una piena responsabilità".

James Landay, direttore dello Stanford Institute for Human-Centered AI, ha dato a The Register la versione pratica: "I pesi aperti sono un progresso. Puoi scaricare il modello, eseguirlo sulla tua macchina, tenerlo fuori dalla pipeline dati di qualcun altro. Ma non puoi ancora vedere come è stato costruito, su cosa è stato addestrato, né perché si comporta come si comporta. Quello non è un modello aperto. È distribuzione aperta."

"I pesi aperti rispondono a 'Posso eseguirlo?'. L'open source risponde a 'Posso fidarmi, migliorarlo e costruirci sopra la cosa successiva?'"

Anche la seconda citazione è di Landay, dalla stessa rubrica del Register, che riporta le critiche alla Open Source AI Definition 1.0 dell'OSI da parte di Bruce Perens, Bradley Kuhn e Richard Fontana. L'OSI ha riconosciuto al rilascio della OSAID 1.0, in ottobre 2024, che la definizione avrebbe continuato a evolvere. Mike Dolan della Linux Foundation ha presentato la licenza Open Model, Data, and Weights, in circolazione dal 2025 con contributori indicati da Amazon, Meta, IBM, Microsoft e Nvidia, e quella presentazione ha attirato obiezioni sulla mailing list di revisione delle licenze dell'OSI.

La cosa conta per il risultato sulla memorizzazione. Se non puoi vedere i dati di addestramento, non puoi verificare in modo indipendente quali libri siano entrati. Il testo estratto resta la tua unica prova su ciò che è uscito.

Economico, vicino e difficile da eseguire

Mozilla ha pubblicato la versione 1.1 del suo rapporto State of Open Source AI il 15 settembre 2026, con dati aggiornati al 1 settembre, secondo Tom's Hardware. Mozilla è l'organizzazione non profit dietro Firefox e sostiene i modelli aperti. Il rapporto si basa su un sondaggio Mozilla/SlashData su circa 1.400 sviluppatori, sui dati di traffico di OpenRouter e su indici di benchmark di terze parti. Conta 16 rilasci aperti degni di nota, e Tom's Hardware osserva che nessuno fornisce la ricetta dei dati richiesta dalla definizione dell'OSI.

I numeri di capacità: il miglior modello aperto era dietro il leader chiuso sull'Artificial Analysis Intelligence Index di tre punti, al 60% del prezzo, e a due punti da Claude Fable 5, al 30%. L'adattamento di Mozilla sui dati METR task-horizon colloca il divario aperto-chiuso a circa 4,4 mesi, vicino alla stima di quattro mesi di Epoch AI. La capacità aperta raddoppia ogni 3,9 mesi secondo il calcolo di Mozilla, contro 5,5 per quella chiusa.

Le avvertenze valgono quanto il titolo. Il divario di quattro mesi e il dato del 30% sono misurati da API ad API su endpoint ospitati a prezzo di listino. Il grafico hardware di Mozilla colloca il miglior modello aperto che sta su un server a 52,6 e il migliore su una sola GPU a 40, cali di 10 e 23 punti dal vertice. È una forbice più ampia di quanto suggeriscano quattro mesi. Il checkpoint nativo MXFP4 di Kimi K3 occupa circa 1,56TB su 96 shard; la configurazione di serving di Mozilla elenca 64 o più acceleratori, e vLLM ne richiede almeno otto GPU GB300. Il rapporto lo definisce aperto ma non eseguibile dalla maggior parte di chi lo possiede.

Sul versante della domanda, Mozilla ha contato otto dei primi dieci modelli per volume di token di agosto su OpenRouter come a pesi aperti, sette dei quali costruiti in Cina. I fornitori chiusi hanno comunque preso il 96% dei ricavi a livello di modello su OpenRouter da maggio a settembre 2025, secondo la Linux Foundation. Il CTO di Mozilla Raffi Krikorian ha detto ad Ars Technica via email che la scelta di pagare per modelli chiusi sembra dipendere dal carico di lavoro più che dall'organizzazione.

Un altro filo. Il rapporto riporta, come "asserito e non dimostrato", un'accusa contenuta nell'avviso congiunto NSA/CISA/FBI AA26-251A dell'8 settembre secondo cui Moonshot avrebbe estratto dati da Claude Fable 5 per addestrare Kimi K3 tramite distillazione. Non provata, e irrisolta.

Messi insieme, i due documenti descrivono lo stesso oggetto da estremità opposte. Un modello si può scaricare, mettere a punto e, in almeno un caso documentato, usare come prompt per riprodurre un romanzo quasi alla lettera. I dati di addestramento che gli stanno dietro restano però non documentati, non concessi in licenza open source e, per i checkpoint più grandi, fuori portata per l'hardware che la maggior parte delle persone ha.

Commenti 0

Fonti

3
  1. 01Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
  2. 02Open weights are not open source: Why AI's favorite label is under disputeEN
  3. 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.