Una data di rilascio non è un cutoff di addestramento: quanto sono già vecchi 20 modelli AI
Dieci dei 20 modelli AI attuali hanno un cutoff di addestramento che il laboratorio pubblica davvero, secondo un tracker pubblicato il 16 settembre. La distanza tra data di uscita e cutoff è il numero che quasi nessuna copertura di lancio menziona.

La pagina su stale.jock.pl riporta due date per ogni modello: il giorno in cui il laboratorio lo ha rilasciato e il giorno in cui ha smesso di leggere. Entrambi i contatori salgono in tempo reale. La seconda data decide ciò che il modello sa davvero.
Prendiamo GPT-6 Astra, rilasciato da OpenAI il 3 settembre 2026. I suoi dati di addestramento si fermano al 30 aprile 2026. Il giorno del lancio il modello era già quattro mesi indietro su tutto ciò che è accaduto dopo quella data. Resterà indietro sempre di più, perché nulla nei pesi cambia quando cambia il mondo. Il tracker elenca lo stesso schema su tutta la linea: Llama 4 di Meta è uscito il 5 aprile 2025 con un cutoff di agosto 2024, Claude Sonnet 5 di Anthropic è uscito il 30 giugno 2026 con un cutoff di gennaio 2026, GPT-6 Sol è uscito il 22 settembre 2026 con un cutoff del 20 aprile 2026. Ogni nome sulla pagina rimanda al documento del laboratorio da cui proviene la data, secondo il sito.
Metà della lista è vuota.
Dieci dei 20 modelli riportano un cutoff pubblicato. Gli altri dieci, tra cui Mistral Large 3, Qwen3.8-Max, DeepSeek V4-Pro e Muse Glimmer, non mostrano alcun cutoff perché le fonti dei fornitori controllate non ne stabiliscono uno, dice la pagina. Non è la prova che un laboratorio non ne abbia mai pubblicato uno. È la prova che il tracker non è riuscito a trovarlo. Per chi prova a confrontare i modelli sulla freschezza, è un fatto diverso e più scomodo.
La ricerca non colma il divario
L'obiezione ovvia è che oggi i modelli cercano sul web, quindi il cutoff conta meno. L'autore del tracker la respinge. La ricerca legge qualche pagina per una risposta e poi le dimentica, sostiene la pagina, quindi una nuova chat riparte da aprile. Peggio ancora, la ricerca deve essere attivata dal modello stesso, usando gli stessi pesi che contengono il fatto obsoleto. Gli errori cadono così proprio dove il modello suona più sicuro. La pagina cita un test di oltre 2.000 chiamate su 16 modelli, a ciascuno dei quali è stato dato uno strumento di ricerca web. I modelli di frontiera hanno deciso correttamente quasi ogni volta. Quelli più deboli hanno affermato fatti cambiati senza verificare, e hanno cercato sul web cose come il punto di ebollizione dell'acqua. In un esempio, cinque modelli hanno indicato un uomo morto come re di Norvegia.
C'è un punto metodologico scomodo sepolto qui. Un modello a cui si chiede il proprio cutoff di addestramento è un testimone scarso, dice la pagina, perché uno che inventa una data sicura ha detto qualcosa di utile su se stesso. Il controllo consigliato è esterno.
Il tracker distribuisce gli stessi dati come models.json, con data di rilascio, cutoff pubblicato e un link alla fonte per ogni modello. Suggerisce di incollare qualche riga nell'AGENTS.md o nel CLAUDE.md di un agente, così che l'agente recuperi il file prima di indicare qualsiasi modello o versione come attuale. Il file viene rigenerato insieme alla pagina, quindi l'agente legge le date di oggi e non quelle incorporate nei suoi pesi. La lista di 20 modelli copre 8 laboratori, e 5 di questi laboratori hanno un cutoff pubblicato per almeno un modello sulla pagina: Anthropic, Google DeepMind, Meta, OpenAI e xAI.
Per chi osserva i benchmark, la conseguenza pratica è semplice. Una classifica che confronta modelli usciti a settimane di distanza confronta anche modelli addestrati a mesi di distanza, e il delta non è nel punteggio.
Fonti
1Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.