Per Mozilla i migliori modelli open-weight cinesi sono a 4,4 mesi dalla frontiera statunitense
I migliori modelli open-weight cinesi sono indietro di circa 4,4 mesi rispetto alle offerte di frontiera statunitensi. Lo dice la versione 1.1 del report State of Open Source AI di Mozilla, pubblicato il 15 settembre con dati aggiornati al 1° settembre.

Mozilla ha riadattato i dati METR sull'orizzonte dei compiti e stima il divario tra open e closed a circa 4,4 mesi, in linea con la stima di quattro mesi di Epoch AI. Lo ha riferito Tom's Hardware il 16 settembre. METR è un'organizzazione di ricerca senza scopo di lucro: valuta i modelli in base alla durata del compito, misurata in tempo di lavoro umano, che riescono a completare la metà delle volte.
Secondo la stima di Mozilla, i modelli closed gestiscono compiti che richiedono a esperti umani da 8 a 12 ore. I modelli open arrivano a quel livello circa quattro mesi dopo. La capacità open raddoppia ogni 3,9 mesi, contro 5,5 per i closed, secondo il calcolo di Mozilla.
Il report è una valutazione ricorrente, uscita per la prima volta il 14 luglio sul blog di Mozilla. Si basa su un sondaggio Mozilla/SlashData su circa 1.400 sviluppatori, insieme ai dati di traffico di OpenRouter e a indici di benchmark di terze parti. Mozilla sostiene i modelli open e TIME ha riferito il 14 luglio che Raffi Krikorian, chief technology officer di Mozilla, ha descritto il report come in parte un'attività di advocacy.
In questo contesto "open weights" significa pesi scaricabili, non dati di addestramento o codice. Il report conta 16 rilasci open degni di nota, ma nessuno fornisce la ricetta dei dati richiesta dalla definizione della Open Source Initiative.
Benchmark e prezzi raccontano storie diverse
Il miglior modello open era indietro di tre punti rispetto al leader closed sull'Artificial Analysis Intelligence Index, al 60% del prezzo, e di due punti dietro Claude Fable 5 al 30%. È quanto si legge nella lettura del report fatta da Tom's Hardware.
Mozilla ha inoltre tracciato i risultati di Terminal-Bench 2.1 di vals.ai, che sottopongono ogni modello allo stesso harness, lo strato software che fornisce a un modello i suoi strumenti. Su quella classifica GLM-5.2 di Z.ai ha ottenuto un punteggio entro un punto da Claude Opus 4.7 e circa quattro punti dietro Opus 4.8, a meno di un quinto del costo per test.
Su OpenRouter, un marketplace che indirizza il traffico degli sviluppatori verso centinaia di modelli, Mozilla ha contato otto dei dieci modelli migliori per volume di token ad agosto come open weights, sette dei quali costruiti in Cina. I fornitori closed hanno comunque incassato il 96% dei ricavi a livello di modello su OpenRouter da maggio a settembre 2025, ha riferito la Linux Foundation.
"Vediamo la decisione di pagare per i modelli closed come specifica del carico di lavoro, non dell'organizzazione", ha detto Krikorian ad Ars Technica in un'email.
La didascalia di un grafico di Mozilla è esplicita sulla durata del suo numero principale: "il divario si azzera a ogni ciclo di rilascio".
La cifra dei quattro mesi ha delle riserve
Una riserva è che il divario di quattro mesi e la cifra del 30% sul prezzo dei token sono misurati da API ad API su endpoint ospitati e a prezzo di listino. Il grafico hardware dello stesso report colloca il miglior modello open che sta su un server a 52,6 e il migliore su una sola GPU a 40. Il calo dalla vetta è di 10 e 23 punti, rispettivamente, un divario più ampio dei quattro mesi riportati.
I requisiti di servizio sono l'altro intoppo. Il checkpoint nativo MXFP4 di Kimi K3 occupa circa 1,56TB su 96 shard, e la configurazione di servizio di Mozilla elenca 64 o più acceleratori, mentre vLLM richiede almeno otto GPU GB300, con più nodi per il traffico di produzione.
Il report lo descrive come open ma non eseguibile dalla maggior parte di chi lo possiede, e Tom's Hardware a luglio ha stimato il fabbisogno di memoria vicino a 1,5TB.
Un esempio di eccezione è il modello Inkling-Small di Thinking Machines, con licenza Apache 2.0, la cui versione NVFP4 sta su una B300 con un minimo di 180GB.
C'è anche una disputa sulla provenienza legata a uno dei modelli. K3 porta un'allegazione dettagliata nell'avviso congiunto NSA/CISA/FBI dell'8 settembre (AA26-251A). L'affermazione, che il report di Mozilla riporta come "asserita e non dimostrata", è che Moonshot abbia estratto dati di Claude Fable 5 per addestrare K3 tramite distillazione, la pratica di addestrare un modello sugli output di un altro modello.
I dati di Mozilla si fermano al 1° settembre. Da allora Artificial Analysis ha portato il suo indice alla v4.3 con un set di valutazione diverso. La classifica live ha Claude Fable 5.1 a 53 sulla sua impostazione di sforzo più alta, con Kimi K3 a 44: numeri non confrontabili con quelli v4.1.1 tracciati da Mozilla. La classifica Terminal-Bench 2.1 di vals.ai, aggiornata l'11 settembre, è ora guidata da GPT-6 Astra all'87,27%, con Fable 5.1 all'85,02%.
Per dare un'idea di quanto rapidamente si muovano quelle posizioni: il 17 luglio Artificial Analysis aveva K3 a 57 contro il 60 di Fable 5, mentre il 1° settembre Mozilla lo aveva due punti indietro.
La lotta sulle definizioni sotto i numeri
Mozilla misura un divario di capacità, ma la Open Source Initiative sostiene che il settore stia misurando la cosa sbagliata. In un post sul blog del 19 settembre, il presidente di OSI (non accreditato nel post) ha scritto che i pesi aperti consentono agli utenti di esercitare alcune delle quattro libertà del software, la libertà di usare, studiare, modificare e condividere senza chiedere il permesso al titolare dei diritti, ma non tutte, e solo fino a un certo grado.
I modelli di AI sono composti da tre componenti principali, secondo OSI: dati di addestramento, pesi e parametri, e codice per la preparazione dei dati e l'addestramento. La capacità di un utente di accedere a tali componenti determina se un modello è closed, open-weight o Open Source. I rilasci open-weight condividono i pesi, il che permette agli utenti di eseguire un modello in locale, pagare una terza parte per ospitarlo o fare fine-tuning sui propri dati. Non condividono il codice né i dati di addestramento.
OSI ammette che i pesi aperti offrono più scelta rispetto a sistemi completamente chiusi come ChatGPT, Claude e molti sistemi di guida autonoma. La sua obiezione riguarda la verifica. Senza il codice e i dati di addestramento, sostiene OSI, non si può ispezionare del tutto un modello per spiegare un output o confermare che ci si può fidare.
Il post cita Olmo di Ai2 come esempio della categoria più rigorosa. I ricercatori hanno usato l'intero dataset di addestramento e i checkpoint del modello per iniettare nuove informazioni nei dati di addestramento e poi osservare come il modello le memorizzasse o le dimenticasse, ha scritto OSI. Quel tipo di studio, sostiene l'organizzazione, è possibile solo con un rilascio Open Source AI.
La distinzione non è accademica. Il report di Mozilla conta 16 rilasci open degni di nota e non ne trova nessuno che fornisca la ricetta dei dati richiesta dalla Open Source Initiative.
Modelli piccoli, compiti ristretti
Lontano dalla discussione sulla frontiera, alcuni rilasci open-weight sono deliberatamente piccoli e monofunzione. Superwhisper ha pubblicato S1-mini, un normalizzatore di testo da 0,6B parametri per l'output speech-to-text, secondo la sua model card su Hugging Face.
Prende una trascrizione ASR grezza e la riscrive come testo scritto pulito: riempitivi rimossi, falsi avvii risolti al valore su cui l'oratore è atterrato, punteggiatura e maiuscole applicate, e numeri, date, orari, valute e indirizzi email pronunciati resi in forma scritta.
Su un set di 7.519 casi inglesi tenuti da parte raggiunge il 94,8% di accuratezza sui token, e la build quantizzata è un file da 462 MiB che gira sulla CPU di un laptop. È fine-tuned da Qwen/Qwen3-0.6B e porta licenza Apache 2.0 più una clausola sul nome. La model card è esplicita: non è un modello di chat e non seguirà istruzioni generiche.
Uno schema simile emerge in un resoconto di deployment del 22 settembre di James Cruce su ASTGL. Ha sostituito un router deterministico con Laya, un modello open-weight a decisione tipizzata con circa 421 milioni di parametri, costruito su un encoder ModernBERT-large e un limite di 1.024 token. Laya è servito tramite un'API solo su loopback su un Mac Studio con M3 Ultra e 256 GB di memoria unificata.
L'ha scelto al posto di Jev di TypeSafe, un servizio ospitato in accesso anticipato che indica 0,042 dollari per milione di token in input senza costo per i token in output e supporta scelte fino a 255 opzioni, perché voleva che le decisioni di routine restassero sulla sua macchina. Cruce è prudente su ciò che il risultato dimostra: il modello ha battuto il suo router deterministico su un replay congelato, ma non ha testato se Laya batta Jev in generale.
Segnala anche un limite che vale per ogni numero nel report di Mozilla. La model card avverte che Laya è troppo sicuro di sé e necessita di calibrazione specifica per il dominio. Una risposta tipizzata, scrive, può essere strutturalmente perfetta e factualmente sbagliata.
Fonti
4- 01China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN
- 02Open Weights Are Good. Open Source Is Better.EN
- 03S1-mini, Superwhisper's first open-weights language modelEN
- 04Local Laya vs Hosted Jev: Why My Agents Make Typed Decisions on My MacEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.