Pesi aperti non sono open source: la disputa su un'etichetta
I modelli linguistici a pesi aperti escono più in fretta delle regole che li descrivono. L'Open Source Initiative sostiene che i soli pesi espongono "una frazione delle informazioni necessarie per una piena responsabilità", e i critici dicono che l'etichetta viene allungata oltre misura.

Scaricare un file di modello da Hugging Face richiede secondi. Sapere cosa c'è dentro richiede un mandato di comparizione. In questo scarto sta tutta la questione.
Steven J. Vaughan-Nichols, su The Register, ha posto la distinzione senza giri di parole il 15 settembre: un rilascio può essere a pesi aperti senza essere open source. La differenza decide se puoi soltanto eseguire una rete neurale già finita oppure ispezionare, riprodurre, modificare e ridistribuire davvero il sistema che l'ha prodotta. I pesi sono i parametri numerici appresi durante l'addestramento. Insieme all'architettura e al codice di inferenza fanno funzionare un modello linguistico di grandi dimensioni. Un modello a pesi aperti puoi ospitarlo su macchine tue, metterlo a punto su documenti interni e tenere i prompt fuori da un'API proprietaria. Quello che non puoi fare, nella maggior parte dei rilasci, è vedere la ricetta dei dati che gli sta dietro.
Per chi scrive licenze non è un cavillo tecnico.
L'OSI traccia una linea, poi viene criticata per questo
L'Open Source Initiative, che custodisce la Open Source Definition, afferma chiaramente che "Open Weights si riferisce ai pesi finali e ai bias di una rete neurale addestrata", e che rilasciarli espone solo "una frazione delle informazioni necessarie per una piena responsabilità". La sua Open Source AI Definition, OSAID 1.0, doveva colmare quello scarto. Richiede che i parametri del modello, compresi i pesi, siano disponibili con termini approvati dall'OSI, ma non prescrive un meccanismo legale specifico. Rilasciata in ottobre 2024, fu presentata allora come un documento destinato a evolvere.
I critici dicono che la lacuna centrale non è mai stata chiusa. Luca Antiga, CTO di Lightning AI e noto contributore di PyTorch, ha sostenuto che il modo in cui OSAID tratta i pesi lascia "un buco enorme che renderà le licenze meno efficaci nel determinare se i sistemi di IA con licenza OSI possano essere adottati in contesti reali". Bruce Perens, autore della Open Source Definition originale, ha denunciato OSAID nel 2024 e in seguito ha dichiarato: "Non è Open Source! ... È un peccato che la stessa Open Source Initiative sia ora coinvolta nell'Openwashing". Bradley Kuhn della Software Freedom Conservancy e Richard Fontana, Senior Commercial Counsel di Red Hat, hanno chiesto l'abrogazione di OSAID. Secondo loro l'OSI "ha agito troppo in fretta imponendo alla comunità un compromesso politico troppo ambizioso", e la frattura "ha danneggiato seriamente la reputazione, l'autorità e l'influenza dell'OSI".
James Landay, direttore dello Stanford Institute for Human-Centered AI, ha dato a The Register la versione pratica della critica: "I pesi aperti sono un progresso. Puoi scaricare il modello, eseguirlo sulla tua macchina, tenerlo fuori dalla pipeline dati di qualcun altro. Ma non puoi ancora vedere come è stato costruito, su cosa è stato addestrato, né perché si comporta in un certo modo. Quello non è un modello aperto. È distribuzione aperta".
"I pesi aperti rispondono a 'Posso eseguirlo?'. L'open source risponde a 'Posso fidarmi, migliorarlo e costruirci sopra la prossima cosa?'", ha detto Landay.
Senza i dati di addestramento né una documentazione dettagliata, chi sta fuori non può stabilire quali fonti siano state usate, quale materiale protetto da copyright o privato possa essere stato incluso, come i dati siano stati scelti o rimossi, quali lingue e comunità siano state sottorappresentate, se i dati di benchmark siano finiti nell'addestramento, o quali metodi di allineamento e sicurezza abbiano plasmato il modello dopo il pre-addestramento.
Una licenza che prova a spaccare la differenza
In quel vuoto è arrivata la licenza Open Model, Data, and Weights della Linux Foundation, presentata all'OSI da Mike Dolan. OpenMDW esiste dal 2025 e annovera contributori di Amazon, Meta, IBM, Microsoft e Nvidia, il che le dà peso industriale. Il suo approccio è definire termini separati per l'architettura, i dati di addestramento e i pesi di un modello, portando tutto ciò che un licenziante fornisce sotto un unico accordo. L'open source convenzionale ruota attorno al codice sorgente; i modelli linguistici combinano codice, architettura e pesi numerici derivati da dataset che possono essere proprietari, protetti da copyright o semplicemente non divulgati.
La proposta ha incontrato obiezioni sulla mailing list di revisione delle licenze dell'OSI. Stefano Maffulli, ex direttore esecutivo dell'OSI, che guidava l'organizzazione mentre OSAID veniva formulata, ha detto: "Continuo ad avere l'impressione che la revisione di OpenMDW sia contaminata da un pregiudizio ideologico: siccome non ci piace la grande tecnologia e oggi l'IA è la grande tecnologia, allora non ci piace l'IA; quindi faremo di tutto per bloccarla".
Intanto i modelli continuano a uscire. Il rapporto State of Open Source AI di Mozilla, versione 1.1, pubblicato il 15 settembre con dati aggiornati al 1 settembre, ha contato 16 rilasci aperti degni di nota. Nessuno fornisce la ricetta dei dati richiesta da OSAID. Mozilla è una sostenitrice dei modelli aperti, e il suo CTO, Raffi Krikorian, ha detto a TIME il 14 luglio che il rapporto è in parte opera di advocacy, secondo Tom's Hardware.
Il divario di capacità si chiude, quello di costo no
I numeri di Mozilla sono la misura più concreta di dove stiano ora i pesi aperti. Il miglior modello aperto era dietro al leader chiuso sull'Artificial Analysis Intelligence Index di tre punti, al 60% del prezzo, e a due punti da Claude Fable 5, al 30% del prezzo. L'adattamento di Mozilla sui dati METR task-horizon, che valutano i modelli in base alla durata in tempo di lavoro umano di un compito che completano la metà delle volte, colloca il divario aperto-chiuso attorno a 4,4 mesi, in linea con la stima di quattro mesi di Epoch AI. La capacità aperta raddoppia ogni 3,9 mesi, secondo il calcolo di Mozilla, contro 5,5 mesi per i modelli chiusi.
Sulla classifica Terminal-Bench 2.1 di vals.ai, che fa passare ogni modello attraverso lo stesso banco di prova, GLM-5.2 di Z.ai ha ottenuto un punteggio entro un punto da Claude Opus 4.7 e circa quattro punti dietro Opus 4.8, a meno di un quinto del costo per test. Su OpenRouter, Mozilla ha contato otto dei dieci migliori modelli per volume di token ad agosto come a pesi aperti, sette dei quali costruiti in Cina. I fornitori chiusi hanno comunque preso il 96% dei ricavi a livello di modello su OpenRouter da maggio a settembre 2025, secondo la Linux Foundation. Krikorian ha detto ad Ars Technica via email: "Vediamo la decisione di pagare per i modelli chiusi come specifica del carico di lavoro, non dell'organizzazione".
Quei numeri hanno avvertenze che il rapporto stesso dichiara. Il divario di quattro mesi e il prezzo per token del 30% sono misurati da API ad API su endpoint ospitati e a listino. La stessa tabella hardware di Mozilla mette il miglior modello aperto che sta su un server a 52,6 e il migliore che sta su una GPU a 40, cali di 10 e 23 punti dal vertice, un divario più ampio di quattro mesi. Il checkpoint nativo MXFP4 di Kimi K3 occupa circa 1,56TB su 96 shard; la configurazione di servizio di Mozilla elenca 64 o più acceleratori, mentre vLLM ne richiede almeno otto GPU GB300, con più nodi per il traffico di produzione. Il rapporto lo descrive come aperto ma non eseguibile dalla maggior parte di chi lo possiede. Inkling-Small di Thinking Machines, sotto Apache 2.0, è una delle eccezioni: la sua versione NVFP4 sta su una singola B300 con un minimo di 180GB.
I dati si fermano al 1 settembre, e da allora le classifiche si sono mosse. Artificial Analysis ora usa l'indice v4.3 con un insieme di valutazione diverso; la sua classifica live ha Claude Fable 5.1 a 53 con l'impostazione di sforzo massimo e Kimi K3 a 44, numeri non comparabili a quelli v4.1.1 che Mozilla ha tracciato. La didascalia della tabella di Mozilla recita: "il divario si azzera a ogni ciclo di rilascio".
C'è anche un'accusa irrisolta legata a K3. Un avviso congiunto dell'8 settembre di NSA, CISA e FBI (AA26-251A) sostiene che Moonshot abbia estratto dati di Claude Fable 5 per addestrare K3 tramite distillazione, la pratica di addestrare un modello sugli output di un altro. Il rapporto di Mozilla enuncia la tesi come "affermata, e non dimostrata". Il 17 luglio, Artificial Analysis dava K3 a 57 contro 60 di Fable 5; al 1 settembre, Mozilla lo dava a due punti di distanza.
A cosa serve davvero l'etichetta
Nulla di tutto ciò chiude le dispute sul copyright. Un articolo di A. Feder Cooper, Mark A. Lemley e coautori, inviato per la prima volta ad arXiv in maggio 2025 e rivisto fino a luglio 2026, ha testato 200 libri contro 14 modelli a pesi aperti in più di 3000 esperimenti. La maggior parte dei modelli linguistici non memorizza la maggior parte dei libri, in tutto o in parte, hanno rilevato gli autori. Ma Llama 3.1 70B memorizza interamente alcuni titoli, tra cui Harry Potter e la pietra filosofale, al punto che l'intero libro può essere estratto quasi alla lettera dalle sue prime parole. La conclusione dell'articolo è che la memorizzazione varia da modello a modello e da libro a libro, e che i risultati hanno implicazioni significative per i casi di copyright, "anche se non tali da favorire in modo inequivocabile l'una o l'altra parte".
È la scomoda via di mezzo in cui sta l'etichetta. I pesi aperti ti dicono che un modello può essere eseguito e messo a punto. Non ti dicono cosa ha ingerito. La formulazione di Landay, citata da The Register, è la versione più limpida: i pesi aperti rispondono se puoi eseguire la cosa, l'open source risponde se puoi fidartene, migliorarla e costruirci sopra. Al momento, per quasi ogni rilascio sull'Hub, la prima risposta è sì e la seconda è ancora una domanda.
Fonti
3- 01Open weights are not open source: Why AI's favorite label is under disputeEN
- 02China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 03Extracting memorized pieces of books from open-weight language modelsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.