Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I rilasci dei modelli AI accelerano, ma i benchmark non stanno al passo

Dieci dei 20 modelli attuali seguiti da stale.jock.pl arrivano senza una data di training cutoff pubblicata, mentre i modelli cinesi hanno preso dal 57% al 67% dei token su OpenRouter nella settimana del 14 settembre.

IA e modelliAnalisiGiulia FerrariPubblicato: 28 settembre 20267 min di letturaFonti 3
I rilasci dei modelli AI accelerano, ma i benchmark non stanno al passo

Sei lanci di modelli sono arrivati tra il 1° e il 22 settembre 2026, secondo il tracker di modelli su stale.jock.pl, che elenca date di rilascio e training cutoff per 20 modelli attuali di otto laboratori. Il 22 settembre OpenAI ne ha pubblicati tre, GPT-6 Sol, GPT-6 Luna e Claude Opus 5.5 di Anthropic, secondo la tabella del tracker e i titoli recenti. Il calendario dei rilasci per i modelli di frontiera ora si misura in giorni, non in trimestri.

Ma lo strumento con cui quei modelli vengono giudicati non tiene lo stesso passo. I training cutoff, le date in cui un modello ha smesso di leggere, sono pubblicati solo per metà dei modelli di quella lista. Cinque degli otto laboratori, Anthropic, Google DeepMind, Meta, OpenAI e xAI, pubblicano un cutoff per almeno un modello, dice il tracker. Una voce vuota significa che le fonti dei fornitori controllate non hanno stabilito un cutoff, non che non esista.

Il divario tra pubblicare e sapere

La presentazione del tracker è diretta: due date decidono quanto un modello sia davvero aggiornato. La data di rilascio è quando il laboratorio lo ha pubblicato; il training cutoff è quando ha smesso di leggere. GPT-6 Astra, rilasciato il 3 settembre 2026, ha un cutoff del 30 aprile 2026, secondo la pagina, cioè era indietro di circa quattro mesi il giorno del lancio. Claude Fable 5.1, rilasciato il 1° settembre 2026, porta un cutoff di giugno 2026. Gemini 3.1 Pro, rilasciato il 19 febbraio 2026, ha smesso di leggere a gennaio 2025, più di un anno prima di arrivare sul mercato.

Un modello può uscire a settembre e aver comunque smesso di leggere ad aprile, il che significa che è cinque mesi indietro il giorno del lancio.

Quel divario conta di più man mano che i cicli di rilascio si comprimono. Mistral AI ha pubblicato Mistral Large 3 il 2 dicembre 2025, Mistral Small 4 il 16 marzo 2026 e Mistral Medium 3.5 il 28 aprile 2026, nessuno con un cutoff pubblicato, secondo il tracker. Anche Qwen3.8-Max di Alibaba (3 agosto 2026), Qwen3.8-Flash (26 agosto 2026) e V4-Pro (13 agosto 2026) e V4.1-Flash (10 settembre 2026) di DeepSeek sono elencati senza cutoff pubblicati. Lo stesso vale per Muse Glimmer e Muse Spark 1.3 di Meta e per Gemini 3.8 Flash di Google DeepMind.

Gli strumenti di ricerca non colmano il divario, sostiene la pagina. Un modello che cerca sul web legge qualche pagina, le usa in una risposta e dimentica; apri una nuova chat ed è di nuovo al suo cutoff. Peggio ancora, la ricerca deve essere attivata dal modello stesso, con gli stessi pesi che contengono il fatto obsoleto, quindi gli errori cadono dove il modello si sente più sicuro. La pagina cita una misurazione di oltre 2.000 chiamate su 16 modelli, a ciascuno dei quali è stato dato uno strumento di ricerca web: i modelli di frontiera hanno deciso correttamente quasi ogni volta, mentre quelli più deboli affermavano fatti consolidati che erano cambiati e cercavano sul web cose come il punto di ebollizione dell'acqua.

L'uso cambia più in fretta dei benchmark

Mentre i laboratori corrono a pubblicare, i dati d'uso raccontano un'altra storia su quali modelli gli sviluppatori scelgano davvero. I modelli AI cinesi sono passati da una quota ridotta dell'uso alla maggioranza su due grandi piattaforme per sviluppatori nel 2026, secondo CNBC, che ha citato dati d'uso condivisi con la rete. Su OpenRouter, i modelli cinesi hanno rappresentato dal 57% al 67% dei token usati nella settimana del 14 settembre, in crescita dal 6% al 13% di febbraio. Su Vercel, la loro quota è salita al 55% in agosto dall'11% di gennaio.

L'adozione è concentrata in quello che OpenRouter definisce Sud globale, 82 paesi tra America centrale e meridionale, Africa e Asia. Più di due terzi dei token usati da quelle aziende vanno a modelli cinesi, ha riportato CNBC. Circa metà dei token su OpenRouter è usata da aziende negli Stati Uniti.

Il prezzo è il motore, secondo le persone con cui CNBC ha parlato. Peter Walker, responsabile degli insights di OpenRouter, ha detto alla rete che i modelli open source cinesi rilasciati quest'anno "possono performare in modo credibile in casi d'uso agentici avanzati, soprattutto per quanto riguarda il coding, in un modo che semplicemente non era vero alla fine del 2025". Sono anche "incredibilmente convenienti rispetto alla maggior parte dei modelli dei laboratori americani", ha detto. Harpreet Arora, responsabile dell'infrastruttura agentica di Vercel, ha detto a CNBC che una volta che un modello raggiunge la soglia di qualità per un lavoro, la differenza di prezzo diventa decisiva, anche se le aziende vogliono ancora modelli di frontiera statunitensi per compiti più complicati.

All'inizio di questa settimana, OpenAI e Anthropic hanno entrambe annunciato modelli nuovi e più economici, ha riportato CNBC. Dianne Penn, responsabile della product management, ricerca e laboratori di Anthropic, ha detto alla rete che l'azienda cercava di rendere le risposte dei suoi modelli "più efficienti, così usano meno token a seconda dell'impostazione di impegno".

Washington guarda i conteggi dei token

Lo spostamento sta attirando attenzione a Washington, dove due commissioni della Camera degli Stati Uniti stanno indagando sull'impatto della crescente adozione dei modelli cinesi, secondo CNBC. Gli Stati Uniti hanno limitato le aziende AI cinesi dall'acquisto dei chip più avanzati tramite controlli sulle esportazioni; Washington è preoccupata che accedano ai chip Nvidia da remoto attraverso data center esteri e per la "distillazione", in cui nuovi modelli imitano quelli più vecchi e affermati.

L'AI cinese rappresenta "rischi economici e di sicurezza reali per gli Stati Uniti", ha detto a CNBC Daniel Remler, senior fellow nel programma di tecnologia e sicurezza nazionale al CNAS. "La preoccupazione ultima è che l'integrazione dei modelli AI cinesi trascini i paesi in una sfera d'influenza tecnologica cinese che si irrigidisce in un allineamento geopolitico", ha detto. Remler ha aggiunto che il Sud-est asiatico in particolare potrebbe vedere un'adozione significativa, e che "ovunque da Lagos a São Paulo a Jakarta, dove imprenditori e governi cercano modelli economici e aperti, guarderanno prima all'AI cinese".

Nvidia sta cercando di cambiare quel calcolo con il software invece che con i chip. L'azienda sta preparando un modello gratuito, che dovrebbe chiamarsi Nemotron 4, previsto entro la fine dell'anno, destinato agli acquirenti che già usano hardware Nvidia, ha detto a Rest of World Marc Einstein, analista di Counterpoint Research. Pochi paesi corrispondono a quella descrizione meglio degli Emirati Arabi Uniti, il cui data center di punta funzionerà con 400.000 chip Nvidia, ha riportato la pubblicazione. Nvidia ha anche accettato di pagare quasi 13 miliardi di dollari per comprare Hugging Face, la piattaforma dove gli sviluppatori condividono e scaricano modelli, secondo Rest of World.

Il contesto di quella spesa: le versioni precedenti dei modelli AI statunitensi sono rimaste molto indietro rispetto ai modelli gratuiti cinesi, scaricati circa 2 miliardi di volte quest'anno, ben davanti a qualsiasi rivale occidentale, secondo un rapporto di agosto di Hugging Face citato da Rest of World. I governi che costruiscono i propri modelli partono per lo più da uno gratuito fatto da Meta o Alibaba, e Einstein ha detto che la spesa di Nvidia serve a rendere Nemotron la base che scelgono al loro posto.

Cosa sfugge ai benchmark

Niente di tutto questo risolve il problema di misurazione di fondo. I punteggi di un modello sui benchmark non dicono nulla sul fatto che sappia cosa è successo dopo il suo cutoff. La pagina stale.jock.pl suggerisce un controllo a bassa tecnologia: chiedere direttamente a un modello la sua data di training cutoff. Un modello ben educato risponde o dice di non essere sicuro; uno che inventa una data con sicurezza ha detto qualcosa di utile su di sé, sostiene la pagina, aggiungendo che la risposta va verificata contro il tracker perché un modello è una fonte scarsa sui modelli.

La pagina offre anche un export leggibile dalle macchine, models.json, con data di rilascio, cutoff pubblicato e un link alla fonte per tutti i 20 modelli, e suggerisce di puntare un agente ad esso tramite il file di istruzioni AGENTS.md o CLAUDE.md che l'agente già legge. L'export viene rigenerato quando lo è la pagina, così un agente legge le date di oggi invece di quelle incorporate nei suoi pesi.

È un tampone, non una soluzione. I laboratori controllano ciò che divulgano, e metà dei modelli attuali sul tracker non ha ancora un cutoff pubblicato. Finché non cambia, chi confronta i modelli solo sui benchmark sta valutando un'istantanea che era già obsoleta quando è stata pubblicata.

Commenti 0

Fonti

3
  1. 01Show HN: How Stale Is Your AI? Release age and training cutoff for 20 modelsEN
  2. 02Chinese AI models surge in global popularity — and Washington is worriedEN
  3. 03Nvidia's free AI model could push the UAE closer to the U.S.EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.