I benchmark sulle allucinazioni si affinano mentre Gemini 4 Argon arriva a pochi selezionati
Google ha iniziato a distribuire Gemini 4 Argon, il suo modello più potente finora, a un gruppo selezionato di esperti di cybersecurity mercoledì 30 settembre, tenendolo lontano dal pubblico per timore di abusi.

Google ha iniziato a distribuire Gemini 4 Argon, il suo modello più potente finora, a un gruppo selezionato di esperti di cybersecurity mercoledì 30 settembre, tenendolo lontano dal pubblico per timore di abusi. L'azienda ha dichiarato in un post sul blog di concedere volontariamente al governo degli Stati Uniti un accesso anticipato e di raccogliere il feedback dei tester prima di una disponibilità più ampia, secondo The Guardian.
Quella postura cauta si incastra male con le affermazioni che Google fa sul modello. Nel suo blog di lancio, citato da TechCrunch, l'azienda ha affermato che Argon ha ottenuto punteggi significativamente più alti rispetto a GPT-6 Astra di OpenAI e a Fable e Opus di Anthropic in una varietà di benchmark di AI, citando la startup di benchmarking Vals. Ha anche affermato che Argon può trovare, validare e correggere autonomamente vulnerabilità software critiche. Sono affermazioni di capacità, non di affidabilità. Le due cose non sono la stessa.
Qui è dove la questione delle allucinazioni fa male. Un modello che ottiene buoni punteggi su benchmark di ragionamento o codifica può ancora produrre risposte errate con sicurezza, e il materiale più recente sulla vicinanza alle allucinazioni nel dossier punta in entrambe le direzioni. Un audit controllato delle metriche di conflitto di gradiente nei modelli multimodali unificati, inviato su arXiv il 29 settembre, è il più interessante dei recenti paper. Testa se una metrica proxy ampiamente usata predice effettivamente ciò che i ricercatori assumono che predica. Scopre che non lo fa.
Gli autori hanno costruito un testbed chiamato GRIDUMM che riflette gli ingredienti strutturali chiave dell'addestramento dei modelli multimodali unificati, rendendo esattamente calcolabile il trade-off di ground-truth tra comprensione e generazione. Su 63 configurazioni e 372 checkpoint misurati, nessuna metrica di conflitto direzionale ha raggiunto una correlazione di Spearman assoluta di 0,3 con un intervallo di confidenza che esclude lo zero. Un intervento dose-risposta che sopprime monotonicamente il conflitto ha lasciato il trade-off piatto, separando correlazione da causalità. Le misure di interferenza funzionale hanno superato le metriche di conflitto direzionale, e la perdita di addestramento ha tracciato fortemente il trade-off. Gli autori non affermano che il conflitto sia inutile. Affermano che la sua validità come target diagnostico deve essere stabilita, non assunta.
Quello è un risultato ristretto su una classe ristretta di modelli. È anche il tipo di scoperta che dovrebbe far esitare chiunque legga una classifica.
Cosa misurano effettivamente i benchmark più nuovi
Altri due paper su arXiv pubblicati nella stessa finestra adottano una linea simile di scetticismo. ChartDensity-Bench, inviato il 30 settembre, valuta i grandi modelli linguistici multimodali sulla ricostruzione di dati numerici da grafici scientifici sotto densità visiva controllata, variando il numero di grafici mostrati contemporaneamente per k uguale a 1, 3, 6 e 9. Esperimenti su cinque MLLM recenti mostrano che la ricostruzione numerica si degrada al aumentare della densità visiva, e l'entità di quel degrado varia sostanzialmente tra i modelli. I confronti a coppie a livello di grafico del paper hanno scoperto che la stessa fonte di grafico può incorrere in un errore di ricostruzione più alto quando incorporata in un contesto visivo più denso. È una modalità di fallimento vicina alle allucinazioni con una misurazione pulita. Il modello non si rifiuta. Sta producendo numeri.
Un terzo paper, Reverse Scoring for Diffusion Language Model Agents, inviato il 29 settembre, traccia un fallimento specifico negli agenti di modelli linguistici basati su diffusione. Cade in loop di retry, riemettendo un'azione molto dopo che è fallita. Gli autori attribuiscono questo al decoding mascherato che impegna le posizioni di cui è più sicuro, rimandando quelle incerte, quindi in uno stato di fallimento il contesto offre già un riempimento sicuro per la decisione rimandata, vale a dire l'azione fallita stessa. Modellano la distorsione come una corruzione cieca al task e propongono un rimedio senza addestramento chiamato Reflect Reverse, che valutano su quattro benchmark multi-turno incarnati.
C'è un pattern attraverso questi tre paper. Ciascuno isola un modo specifico in cui un modello può essere sbagliato con sicurezza, lo misura in condizioni controllate e scopre che la metrica proxy popolare non traccia l'esito. Nessuno offre un punteggio generale di allucinazione. Tutti suggeriscono che i punteggi generali di allucinazione stanno facendo meno lavoro di quanto i loro editori implicano.
Per un senso di quanto un benchmark possa spostare la conversazione, guarda lo spazio dei modelli decisionali. InfoQ ha riportato che TypeSafe AI ha rilasciato Jev, che non genera testo affatto ma restituisce decisioni tipizzate e probabilistiche con un valore di confidenza, in modo che il codice chiamante possa agire sopra una soglia ed escalare sotto di essa. L'input costa $0,042 per milione di token, l'output è gratuito, la finestra di contesto è 32.000 token, e TypeSafe cita una latenza end-to-end di 70ms a 500ms. Vercel ha aggiunto Jev ad AI Gateway il secondo giorno e ha detto che ha raggiunto quasi il 13% dei team a pagamento entro 24 ore, il doppio della quota della famiglia GPT-5.6.
Amazon ha seguito. TechCrunch ha riportato il 1 ottobre che AWS ha rilasciato Strands Decider 2B, un modello decisionale open source ispirato a Jev, costruito sul torso di Qwen3.5-2B. Classifica tra opzioni pre-decise e restituisce una misura di confidenza. L'ingegnere distintivo di Amazon Marc Brooker ha detto a TechCrunch che il modello ha brevemente raggiunto la posizione principale nella classifica Jevbench per i modelli della sua dimensione, e che l'attrattiva è un passaggio di workflow più affidabile grazie ai punteggi di confidenza e a un dominio chiuso di risposte, con latenza più bassa e potenzialmente costo più basso.
Il fondatore di TypeSafe Diogo Almeida è stato diretto sulla folla. "Capisco che la gente pensi che sia una corsa all'oro, ma potrebbero sottovalutare la difficoltà di rendere i modelli davvero intelligenti," ha detto a TechCrunch. L'attuale lotto, ha detto, "sembra più" un'onda di imitatori. Che ciò tenga o meno, la direzione di marcia è chiara: alcuni costruttori stanno rispondendo al problema di affidabilità restringendo lo spazio di output piuttosto che promettendo un modello generale migliore.
L'argomento di sicurezza arriva prima delle prove
La cornice stessa di Google per restringere Argon è che la capacità di frontiera a questo livello ha bisogno di un approccio graduale. Koray Kavukcuoglu, l'architetto capo AI di Google, ha scritto che nel post sul blog che annunciava il modello. Google ha detto che Argon è stato progettato per rifiutare richieste che potrebbero aiutare a portare avanti attacchi informatici o sviluppare armi chimiche, biologiche o nucleari, e che monitora il ragionamento del modello per fermarlo dall'allontanarsi oltre ciò che gli utenti intendevano, un rischio che i ricercatori chiamano disallineamento.
The Guardian ha riportato che la distribuzione cauta rispecchia Anthropic, che ha tenuto Claude Mythos Preview limitato a un piccolo numero di organizzazioni fidate. Washington ha brevemente costretto Anthropic a sospendere l'accesso ai suoi modelli Claude Mythos e Claude Fable rilasciati pubblicamente a giugno, e ha da allora impostato un processo volontario per verificare i modelli AI più potenti prima del rilascio. L'annuncio è arrivato un giorno dopo che Donald Trump ha ospitato i principali dirigenti tecnologici, incluso Sundar Pichai e Dario Amodei di Anthropic, alla Casa Bianca, dove hanno firmato un accordo volontario che si impegna a controllare i rischi dei loro sistemi AI.
Google ha detto che i primi tester hanno usato Argon per scoprire un difetto in un software usato da ospedali in tutto il mondo che esponeva informazioni personali sensibili, qualcosa che altri modelli avanzati avevano perso. È un aneddoto, dal venditore, su un modello non in circolazione generale. Trattalo come un'affermazione di capacità da una parte interessata.
La lotta sulla provenienza sta correndo in parallelo. CNBC ha riportato che OpenAI ha detto di aver identificato e interrotto una campagna coordinata per estrarre ragionamento protetto dai suoi modelli, collegando un cluster centrale dell'attività alla startup cinese Moonshot AI. L'attività è iniziata a inizio luglio e è esplosa a 16.000 richieste da più di 4.000 utenti in due giorni, con attività correlata attraverso più di 15.000 utenti. OpenAI ha detto che gli operatori non hanno violato la sua crittografia, i database o le conversazioni utente memorizzate, e che aveva completamente interrotto la campagna il 28 luglio.
The Register ha notato la goffaggine del reclamo, data la storia stessa di OpenAI di addestramento su dati web, e ha riportato che The Register ha chiesto a OpenAI quali dei suoi modelli fossero mirati a luglio e non ha ricevuto risposta. Ha anche riportato che Michael Kratsios, l'Assistente per la Scienza e la Tecnologia di Trump, ha accusato Moonshot AI a fine luglio di aver creato il suo modello Kimi K3 distillando Fable di Anthropic. Claude Opus 5.5 di Anthropic, rilasciato una settimana prima di quel report, arriva con una difesa contro la distillazione chiamata preserved thinking, introdotta con Fable 5.1.
Moonshot non ha risposto immediatamente alle richieste di commento di CNBC, e The Register ha detto di non aver ricevuto nemmeno una risposta immediata. Quindi l'accusa centrale rimane unilaterale nel registro pubblico.
L'altra linea da guardare è da dove vengono i dati di addestramento e a quali condizioni. The Guardian ha riportato il 1 ottobre che Anthropic ha esortato il governo Albanese a considerare un'approvazione condizionale per l'addestramento su opere australiane protette da copyright sotto un modello opt-out, dopo aver concesso che non avrebbe ottenuto un'esenzione totale dal copyright. L'ABC e l'SBS hanno reagito in sottomissioni a un'inchiesta parlamentare federale, con l'ABC che avvertiva di un cannibalizzazione dell'industria delle notizie australiana e entrambi i broadcaster che suggerivano di includere le aziende AI nell'incentivo di negoziazione delle notizie.
La sottomissione di Anthropic ha affermato che la tecnologia potrebbe trasformare l'economia australiana mentre avvertiva anche di implicazioni serie per la sicurezza nazionale, la resilienza delle infrastrutture critiche e la sicurezza pubblica. Il comitato select congiunto su AI tiene udienze a Sydney la prossima settimana, con i dirigenti di Anthropic e OpenAI previsti a partecipare.
Nessuna di queste cose stabilisce se un dato modello sia affidabile. Suggerisce che l'industria sta ora rilasciando affermazioni di affidabilità più velocemente di quanto stia rilasciando modi per verificarle, e che i controlli che esistono tendono a essere ristretti, controllati e sgradevoli per le metriche proxy che tutti citano.
Fonti
13- 01Google rolls out new Gemini AI model but restricts access over safety concernsEN
- 02Google releases Gemini 4 Argon, called its most powerful model yetEN
- 03Does Gradient Conflict Predict the Understanding-Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal ModelsEN
- 04ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual DensityEN
- 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
- 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
- 07Amazon releases its own Jev clone as decision models flood the webEN
- 08AI race heats up as OpenAI flags alleged model-copying campaignEN
- 09Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
- 11Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
- 12Ideogram says its new model can edit part of an image without messing up the restEN
- 13ThreatsDay: AI-Powered Zero-Day Chain, 543K Live Secrets, Model Inspection RCE and 13 More StoriesEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.