La data di rilascio non è la notizia: cutoff di addestramento e dati di adozione cambiano i benchmark dei modelli AI
Dieci dei 20 modelli AI elencati su stale.jock.pl hanno un cutoff di addestramento che il laboratorio stesso pubblica. Su OpenRouter i modelli cinesi sono passati dal 6%-13% dei token a febbraio 2026 al 57%-67% nella settimana del 14 settembre. Nessuno dei due numeri compare in una tabella di benchmark standard.

Una tabella di benchmark dice quanto ha segnato un modello. Non dice quando quel modello ha smesso di leggere. Tra la data di rilascio su un post di lancio e il cutoff di addestramento sepolto in una model card c'è un vuoto. È uno dei numeri più utili che un acquirente può cercare, ed è la premessa di un piccolo strumento pubblicato il 16 settembre su stale.jock.pl con il titolo "How stale is your AI?"
La pagina elenca 20 modelli attuali di 8 laboratori. A ogni data di rilascio abbina un cutoff di addestramento, contando in avanti da entrambi. Dieci dei 20 hanno un cutoff che il laboratorio pubblica davvero. Cinque degli otto laboratori, Anthropic, Google DeepMind, Meta, OpenAI e xAI, hanno un cutoff pubblicato per almeno un modello della lista. Gli altri sono segnati "Not established". La pagina precisa che non è la prova che il laboratorio non ne abbia mai pubblicato uno: le fonti dei fornitori controllate non ne hanno trovato nessuno.
Alcuni divari sono ampi.
GPT-6 Astra, rilasciato da OpenAI il 3 settembre 2026, ha un cutoff di addestramento al 30 aprile 2026. Era già indietro di quattro mesi il giorno in cui è uscito. Gemini 3.1 Pro, rilasciato il 19 febbraio 2026, si ferma a gennaio 2025: più di un anno di divario. Claude Sonnet 5, uscito il 30 giugno 2026, ha un cutoff a gennaio 2026. Claude Opus 5.5, uscito il 22 settembre 2026, ha giugno 2026. Llama 4 di Meta, rilasciato il 5 aprile 2025, porta un cutoff ad agosto 2024.
Secondo la pagina, uno strumento di ricerca non risolve il problema. Quando un modello cerca sul web legge qualche pagina, le usa per quella singola risposta e dimentica. La ricerca deve anche essere attivata dal modello stesso, con gli stessi pesi che contengono il fatto obsoleto. Gli errori si concentrano dove il modello è più sicuro. L'autore riferisce di aver fatto girare 16 modelli attraverso uno strumento di ricerca web per oltre 2.000 chiamate: i modelli di frontiera decidevano di cercare correttamente quasi ogni volta, mentre quelli più deboli rispondevano a domande già risolte dalla memoria dopo che la risposta era cambiata, e cercavano sul web cose come il punto di ebollizione dell'acqua. In un esempio, cinque dei 16 hanno indicato un uomo morto come re di Norvegia.
Niente di tutto questo è peer reviewed. La pagina è un progetto Show HN, i numeri vengono dal banco di prova dell'autore, la lista di modelli è un'istantanea e non un censimento. Il punto di fondo però non dipende dalla tenuta dell'esperimento. Un modello lanciato a settembre con un cutoff ad aprile sbaglia su settembre in un modo che un punteggio di benchmark non mostra.
Nella stessa settimana c'è un secondo segnale, più difficile da ignorare, e riguarda quali modelli la gente usa davvero. CNBC ha riportato il 26 settembre che i modelli cinesi sono passati da una piccola quota di utilizzo a una maggioranza su due gateway per sviluppatori. Su OpenRouter hanno rappresentato il 57%-67% dei token nella settimana del 14 settembre, in aumento dal 6%-13% di febbraio. Su Vercel la loro quota è salita al 55% ad agosto dall'11% di gennaio.
I dati di OpenRouter coprono aziende negli Stati Uniti, in Europa e in quello che definisce il "Global South": 82 paesi tra America Centrale e Meridionale, Africa e Asia. Vercel non ha fornito una ripartizione geografica. Lo stesso rapporto nota che i modelli di frontiera statunitensi attirano ancora più spesa complessiva, quindi la quota di token e la quota di ricavi puntano in direzioni diverse.
Peter Walker, head of insights di OpenRouter, ha detto a CNBC che i modelli open source cinesi rilasciati quest'anno "possono credibilmente operare in casi d'uso agentici avanzati, soprattutto per quanto riguarda il coding, in un modo che semplicemente non era vero alla fine del 2025", e che sono "incredibilmente convenienti rispetto alla maggior parte dei modelli dei laboratori americani". Harpreet Arora, head of agentic infrastructure di Vercel, ha spiegato il meccanismo: una volta che un modello raggiunge la soglia di qualità per un lavoro, la differenza di prezzo diventa decisiva.
Washington sta prestando attenzione. Due commissioni della Camera degli Stati Uniti stanno indagando sulla crescente adozione dei modelli cinesi. CNBC riporta preoccupazione per l'accesso remoto ai chip Nvidia attraverso data center esteri e per la distillazione, dove i modelli più nuovi imitano quelli più vecchi. Daniel Remler del Center for a New American Security ha detto a CNBC che la "preoccupazione ultima è che l'integrazione dei modelli AI cinesi trascini i paesi in una sfera di influenza tecnologica cinese che si indurisce in un allineamento geopolitico".
Mettiamo le due storie una accanto all'altra e la domanda sui benchmark cambia forma.
Una classifica misura un modello su un insieme fisso di compiti il giorno in cui viene testato. Non misura quanto la conoscenza del modello si sia allontanata dal presente, e non misura se qualcuno possa permettersi di farlo girare su larga scala. La pagina di stale.jock.pl sostiene che i modelli sono fonti scarse su se stessi e suggerisce di puntare un agente su un file models.json leggibile dalla macchina prima che indichi un modello, una versione o una data come attuali. È una correzione piccola. Il problema più grande è che la prova predefinita del settore, la tabella di benchmark, tace sia sull'aggiornamento sia sul prezzo.
Secondo Rest of World, Nvidia sta facendo una scommessa collegata. Il mese scorso l'azienda ha speso 7 miliardi di dollari per una quota nella startup americana di coding Poolside e per una licenza sui suoi strumenti di costruzione di modelli, e ha accettato di pagare quasi 13 miliardi di dollari per Hugging Face. Il suo modello gratuito, che dovrebbe chiamarsi Nemotron 4, è atteso entro la fine dell'anno. Il rapporto dice che i precedenti modelli aperti statunitensi sono rimasti indietro rispetto ai modelli gratuiti cinesi, scaricati circa 2 miliardi di volte quest'anno secondo un rapporto di Hugging Face di agosto, e che la spesa di Nvidia serve a rendere Nemotron la base che i governi scelgono al posto di quella di Meta o di Alibaba.
Gli Emirati Arabi Uniti sono il caso di prova. Il loro data center di punta funzionerà con 400.000 chip Nvidia, e G42, l'azienda AI sostenuta dallo stato, è entrata nell'alleanza per i modelli aperti di Nvidia a luglio. Il Technology Innovation Institute, che ha costruito Falcon, prende l'altra posizione. "Come laboratorio che costruisce modelli, crediamo che mantenere la diversità nelle prospettive sull'AI, e preservare la piena sovranità tecnologica, richieda una base solida e propria", ha detto a Rest of World il capo ricercatore del TII Hakim Hacid.
Nessuna delle due posizioni si risolve con un benchmark. Un paese o un'azienda che sceglie un modello di base sceglie una catena di fornitura, una curva di costo e una cadenza di aggiornamento. Il cutoff pubblicato è uno dei pochi numeri duri disponibili su quest'ultima parte.
Fonti
3- 01Show HN: How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Chinese AI models surge in global popularity — and Washington is worriedEN
- 03Nvidia's free AI model could push the UAE closer to the U.S.EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.