Cosa significano davvero i pesi aperti e cosa i modelli nascondono ancora
Le release a pesi aperti permettono a chiunque di scaricare i parametri di un modello, ma un report di Mozilla pubblicato il 15 settembre sostiene che il miglior modello aperto resta indietro di circa quattro mesi rispetto al leader chiuso. L'Open Source Initiative ribatte che l'etichetta copre molto meno delle quattro libertà del software.

"Pesi aperti" oggi è una formula di marketing oltre che un termine tecnico. La versione semplice: i parametri addestrati di un modello vengono pubblicati come file che puoi scaricare, eseguire e mettere a punto. Tutto qui. Non dice nulla sui dati da cui il modello ha imparato, sul codice che lo ha addestrato né sulla licenza che lo accompagna.
La distinzione conta perché il termine viene usato in scontri politici, decisioni di acquisto e, sempre più spesso, in argomenti di sicurezza nazionale. Vale quindi la pena separare ciò che una release a pesi aperti ti dà da ciò che trattiene.
Il test delle quattro libertà
L'Open Source Initiative, che mantiene la definizione usata da gran parte dell'industria del software, ha esposto la sua posizione in un post sul blog il 19 settembre. I modelli di AI, osserva, hanno tre componenti principali: i dati di addestramento, i pesi o parametri, e il codice per la preparazione dei dati e l'addestramento. Da quale di questi puoi accedere dipende se un modello è chiuso, a pesi aperti o Open Source AI.
I pesi aperti ti danno una delle tre componenti. Puoi eseguire il modello in locale e pagare solo elettricità e hardware, oppure affidarlo a un host di terze parti. Puoi metterlo a punto sui tuoi dati. È più libertà di quanta ne offra un sistema completamente chiuso, dove usi l'infrastruttura del fornitore e paghi le sue tariffe.
I modelli a pesi aperti limitano la tua capacità di modificare il modello, e non puoi studiarlo fino in fondo.
L'argomento dell'OSI è che questo non basta a soddisfare le quattro libertà del software: usare, studiare, modificare e condividere senza chiedere permesso al titolare dei diritti. Senza il codice di addestramento e senza il dataset o un resoconto dettagliato di come è stato costruito, non puoi verificare perché un modello produce un certo output. L'organizzazione indica Olmo di Ai2 come controesempio, un grande modello linguistico rilasciato con l'intero dataset di addestramento e i checkpoint. I ricercatori hanno così potuto inserire nuove informazioni nei dati di addestramento e osservare come il modello le memorizzasse o le dimenticasse.
Quel tipo di esperimento è la differenza pratica tra le due etichette. È anche, nella lettura dell'OSI, la differenza tra poter verificare un modello e dover credere sulla parola a qualcuno.
Il divario, e come si misura
Mozilla ha pubblicato la versione 1.1 del suo report State of Open Source AI il 15 settembre, con dati aggiornati al 1 settembre, secondo Tom's Hardware. Il risultato principale: il miglior modello aperto era indietro di tre punti rispetto al leader chiuso sull'Artificial Analysis Intelligence Index, al 60% del prezzo, e si trovava due punti dietro Claude Fable 5 al 30% del costo.
La stima di Mozilla sui dati METR relativi all'orizzonte dei task colloca il divario aperto-chiuso a circa 4,4 mesi, in linea con la stima di quattro mesi di Epoch AI. METR, un'organizzazione di ricerca senza scopo di lucro, valuta i modelli in base alla durata del task, misurata in tempo di lavoro umano, che completano nella metà dei casi. Secondo la stima di Mozilla, i modelli chiusi gestiscono task che richiedono a esperti umani da 8 a 12 ore; i modelli aperti ci arrivano circa quattro mesi dopo. Mozilla calcola che la capacità aperta raddoppia ogni 3,9 mesi contro 5,5 mesi per quella chiusa.
Il report non è un documento neutrale, e Tom's Hardware lo dice. Mozilla è l'organizzazione senza scopo di lucro dietro Firefox e sostiene i modelli aperti. TIME ha riferito il 14 luglio che il chief technology officer di Mozilla, Raffi Krikorian, ha descritto il report come in parte opera di advocacy. Si basa su un sondaggio Mozilla/SlashData su circa 1.400 sviluppatori, più i dati di traffico di OpenRouter e indici di benchmark di terze parti, e conta 16 release aperte degne di nota, nessuna delle quali fornisce la ricetta dei dati richiesta dalla definizione dell'OSI.
Ci sono altre avvertenze da tenere presenti. La cifra dei quattro mesi e il confronto sul prezzo dei token al 30% sono misurati da API ad API su endpoint ospitati, al prezzo di listino. La tabella hardware di Mozilla racconta una storia più netta: il miglior modello aperto che entra in un server segna 52,6, e il migliore che entra in una singola GPU segna 40, cali di 10 e 23 punti dal vertice. Il checkpoint nativo MXFP4 di Kimi K3 occupa circa 1,56TB su 96 shard, e la configurazione di serving di Mozilla elenca 64 o più acceleratori, mentre vLLM richiede almeno otto GPU GB300 con più nodi per il traffico di produzione. Il report lo descrive come aperto ma non eseguibile dalla maggior parte di chi lo possiede.
Cosa fa davvero il mercato
Adozione e ricavi puntano in direzioni diverse. Su OpenRouter, un marketplace che instrada il traffico degli sviluppatori verso centinaia di modelli, Mozilla ha contato otto dei primi dieci modelli per volume di token ad agosto come a pesi aperti, sette dei quali costruiti in Cina. Eppure i fornitori chiusi hanno preso il 96% dei ricavi a livello di modello su OpenRouter tra maggio e settembre 2025, secondo la Linux Foundation.
"Vediamo la decisione di pagare per i modelli chiusi come legata al singolo carico di lavoro più che all'organizzazione", ha detto Krikorian ad Ars Technica in una email.
Il quadro dei benchmark si muove abbastanza in fretta da complicare qualsiasi confronto statico. I dati di Mozilla si fermano al 1 settembre. Da allora Artificial Analysis ha portato il suo indice alla v4.3 con un set di valutazione diverso; la classifica live mostra Claude Fable 5.1 a 53 con l'impostazione di sforzo più alta e Kimi K3 a 44, numeri che Tom's Hardware osserva non essere comparabili con le cifre v4.1.1 tracciate da Mozilla. La classifica Terminal-Bench 2.1 di vals.ai, aggiornata l'11 settembre, è guidata da GPT-6 Astra all'87,27% con Fable 5.1 all'85,02%. La didascalia della tabella di Mozilla recita: "il divario si azzera a ogni ciclo di release".
Un altro filo attraversa la discussione su Kimi K3. Il modello porta con sé un'accusa dettagliata nell'avviso congiunto NSA/CISA/FBI AA26-251A dell'8 settembre, che il report di Mozilla riporta come "asserita e non dimostrata": che Moonshot abbia estratto dati di Claude Fable 5 per addestrare K3 tramite distillazione, la pratica di addestrare un modello sugli output di un altro. Il 17 luglio Artificial Analysis aveva K3 a 57 contro il 60 di Fable 5; al 1 settembre Mozilla lo dava due punti indietro.
Perché ci si batte sull'etichetta
Sia l'OSI sia Mozilla sostengono maggiore apertura, da angolazioni diverse. L'OSI vuole riservare il termine "open source" alle release che portano tutte e tre le componenti, perché le questioni di fiducia e verifica diventano più difficili man mano che l'AI si diffonde nella vita quotidiana. Mozilla vuole che le capacità misurate dei modelli aperti siano prese sul serio, pur ammettendo che i principali non sono eseguibili dalla maggior parte delle persone che possono scaricarli.
Per chiunque legga una model card, la conseguenza pratica è stretta e verificabile. Controlla se i pesi sono scaricabili, quale licenza li governa, se sono inclusi il codice di addestramento o la documentazione dei dati, e quale hardware serve davvero. La formula in cima alla pagina non risponderà a nessuna di queste domande.
Fonti
2- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.