I nuovi modelli AI corrono più veloci dei loro dati di addestramento
Dieci dei 20 modelli AI elencati dal tracker stale.jock.pl hanno una data di taglio dell'addestramento che il laboratorio pubblica davvero. Diversi sono usciti mesi dopo la data del proprio annuncio di lancio.

Il sito, segnalato su Hacker News il 16 settembre, tiene traccia di due date per ogni modello: il giorno in cui il laboratorio lo ha rilasciato e il giorno in cui ha smesso di leggere. Elenca 20 modelli di 8 laboratori e, nel browser, aggiorna il conteggio in tempo reale a partire da ciascuna data.
Il divario è la notizia. GPT-6 Astra, rilasciato da OpenAI il 3 settembre 2026, ha un taglio dell'addestramento al 30 aprile 2026. Il gemello GPT-6 Sol è uscito il 22 settembre con un taglio al 20 aprile, e GPT-6 Luna lo stesso giorno con un taglio al 18 maggio. Claude Opus 5.5 di Anthropic, uscito il 22 settembre, si ferma a giugno 2026. Claude Sonnet 5, uscito il 30 giugno, ha smesso di leggere a gennaio.
Per metà della lista la risposta è semplicemente sconosciuta. Large 3, Small 4 e Medium 3.5 di Mistral AI, Qwen3.8-Max e Qwen3.8-Flash di Alibaba, Muse Glimmer e Muse Spark 1.3 di Meta, V4-Pro e V4.1-Flash di DeepSeek, Gemini 3.8 Flash di Google DeepMind: nessuno di questi mostra un taglio stabilito. La pagina è cauta sul significato: uno spazio vuoto indica ciò che le fonti dei fornitori controllate non sono riuscite a stabilire, non la prova che il laboratorio non ne abbia mai pubblicato uno.
Perché la data conta più del numero di versione
La premessa del sito è netta. Un modello può uscire a settembre e aver comunque smesso di leggere ad aprile: il giorno del lancio è già cinque mesi indietro, prima ancora che qualcuno gli scriva un prompt.
Gli strumenti di ricerca non risolvono il problema, secondo la pagina. Quando un modello cerca, legge qualche pagina, le usa in una risposta e poi dimentica. Apri una nuova chat e il taglio è di nuovo lì. Anche la decisione di attivare la ricerca gira sugli stessi pesi che contengono il fatto obsoleto, quindi gli errori cadono dove il modello è più sicuro. La pagina dice di averlo misurato su 2.000 chiamate attraverso 16 modelli, a ciascuno dei quali è stato dato uno strumento di ricerca web. I modelli di frontiera decidevano correttamente quasi ogni volta. Quelli più deboli affermavano fatti consolidati che erano cambiati e cercavano sul web il punto di ebollizione dell'acqua.
Ho dato a 16 modelli AI un pulsante di ricerca e ho chiesto chi è il re di Norvegia. Cinque hanno nominato un morto.
È una frase del sito stesso, e l'illustrazione più chiara del problema. Un modello che non sa che un monarca è morto non deciderà in modo affidabile di controllare.
La soluzione è pensata per gli agenti, non per le persone
La pagina pubblica gli stessi dati come models.json, con data di rilascio, taglio pubblicato e un link alla fonte per ogni modello. Suggerisce poi di incollare un breve blocco di istruzioni in un file AGENTS.md o CLAUDE.md, così che un agente lo recuperi prima di indicare qualsiasi modello come attuale.
Sul fronte dei laboratori i tagli pubblicati sono disomogenei. Cinque degli otto laboratori, Anthropic, Google DeepMind, Meta, OpenAI e xAI, hanno un taglio pubblicato per almeno un modello della lista. Dieci dei 20 modelli ne hanno uno. Gli altri no.
La pagina offre anche un autotest grezzo: chiedi al modello la sua data di taglio dell'addestramento. Uno che risponde, o che ammette incertezza, si comporta bene. Uno che inventa una data sicura ti ha detto qualcosa. L'avvertimento del sito è che un modello è una fonte scarsa sui modelli: verifica la risposta con la tabella invece di fidarti.
Fonti
1Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.