I tracker dei modelli si moltiplicano: date di rilascio e training cutoff non coincidono
Un tracker pubblicato il 16 settembre elenca 20 modelli AI attuali di 8 laboratori e mostra la distanza tra il giorno in cui un modello esce e il giorno in cui ha smesso di leggere. Solo 10 dei 20 hanno un training cutoff che il loro laboratorio pubblica davvero.

La pagina, stale.jock.pl, tiene due date per ogni modello: la data di rilascio, quando il laboratorio lo ha distribuito, e il training cutoff, quando ha smesso di leggere. I contatori salgono in tempo reale da entrambe. L'autore non usa mezzi termini: un modello può uscire a settembre e aver comunque smesso di leggere ad aprile, cioè arrivare al giorno del lancio con cinque mesi di ritardo.
La lista è concreta. Llama 4 è uscito il 5 aprile 2025 con un cutoff di agosto 2024. Claude Haiku 4.5 è uscito il 15 ottobre 2025 e si ferma a luglio 2025. Gemini 3.1 Pro è uscito il 19 febbraio 2026 con un cutoff di gennaio 2025, tredici mesi indietro. GPT-6 Astra è uscito il 3 settembre 2026 e si ferma al 30 aprile 2026. GPT-6 Sol, dal 22 settembre 2026, si ferma al 20 aprile 2026; GPT-6 Luna, stesso giorno, si ferma al 18 maggio 2026. Claude Opus 5.5, anche lui il 22 settembre, si ferma a giugno 2026.
Metà dello scaffale non ha un cutoff pubblicato
Dieci modelli hanno uno spazio vuoto. Cinque degli otto laboratori, Anthropic, Google DeepMind, Meta, OpenAI e xAI, hanno un cutoff pubblicato per almeno un modello sulla pagina. Tra i vuoti ci sono tutta la linea Mistral mostrata (Large 3, Small 4, Medium 3.5), Qwen3.8-Max e Qwen3.8-Flash di Alibaba, Muse Glimmer e Muse Spark 1.3 di Meta, DeepSeek V4-Pro e V4.1-Flash, e Gemini 3.8 Flash. La pagina è attenta a cosa significa un vuoto: le fonti dei fornitori controllate non hanno stabilito un cutoff, il che non è prova che il laboratorio non ne abbia mai pubblicato uno.
L'autore ha anche eseguito un test di ricerca: oltre 2.000 chiamate su 16 modelli, ciascuno con uno strumento di ricerca web. I modelli di frontiera hanno deciso correttamente quasi ogni volta, dice la pagina. Quelli più deboli, invece, hanno enunciato fatti consolidati che erano cambiati senza verificare, e hanno cercato sul web cose come il punto di ebollizione dell'acqua. Nello stesso test, cinque modelli hanno indicato un uomo morto come re di Norvegia.
La ricerca deve anche essere attivata dal modello, usando gli stessi pesi che contengono il fatto obsoleto, quindi gli errori cadono esattamente dove il modello si sente più sicuro.
Questo è l'argomento per l'export. La pagina offre models.json con data di rilascio, cutoff pubblicato e un link alla fonte per ogni modello, e suggerisce di incollare qualche riga nell'AGENTS.md o CLAUDE.md che un agente già legge. L'istruzione è di recuperare il file prima di indicare qualsiasi modello, versione o data come attuale, e di trattare tutto ciò che ha una data allegata come non verificato finché non è controllato. Il file viene rigenerato quando lo è la pagina.
I benchmark si muovono, le date no
Non è il solo tentativo di sorvegliare i fatti sui modelli. Un altro progetto su Show HN, Cactus Needle 3, pubblicato il 18 settembre, propone modelli di automazione da 8 a 29 MB per dispositivi minuscoli e sostiene che una sottorete a 4 strati può eguagliare DeepSeek V4 Flash quando viene messa a punto per una sola epoca. CUA-S1, pubblicato il 19 settembre, è un rilascio di ricerca iniziale solo sorgente di piccoli modelli decisionali per l'uso del computer, con i pesi ospitati separatamente su Hugging Face e sorgente con licenza MIT.
Nessuno di questi progetti risolve la questione dei benchmark. Un tracker ti dice quando un modello ha smesso di leggere. Non ti dice se il modello è buono. La distinzione conta perché gli annunci di rilascio e le affermazioni sui benchmark arrivano su orologi diversi, e la data di cutoff è l'unico pezzo di metadato che un laboratorio può pubblicare senza discutere di metodologia.
Il consiglio della pagina stessa è circolare, e lo ammette: chiedi direttamente al modello il suo training cutoff. Un modello ben educato risponde o dice che non è sicuro. Uno che inventa una data sicura ti ha detto qualcosa di utile su se stesso. Poi controlla la risposta, perché un modello è una scarsa fonte sui modelli.
Fonti
3- 01How stale is your AI? Release age and training cutoff for 20 modelsEN
- 02Needle 3 - 8-29 MB foundation model for tiny devicesEN
- 03trycua/cua: Scale computer-use 2.0EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.