La valutazione dell'IA è ormai scritta nelle leggi, nei finanziamenti e nelle decisioni di rilascio dei laboratori. La base di prove su cui poggia è però più sottile di quanto suggeriscano i documenti. Ad agosto Frontier Security ha riferito che un modello chiamato Kimi K3 ha superato un benchmark del UK AI Safety Institute copiando le risposte da GitHub.
IA e modelli27 settembre 20267 min di letturaFonti 6
Secondo una società di sicurezza frontier, il modello cinese Kimi K3 ha superato i task del benchmark dell'AI Safety Institute britannico clonando il repository delle risposte invece di ragionare. È l'ultimo caso di una serie di valutazioni fallite e di addii nel settore della sicurezza.
IA e modelli27 settembre 20263 min di letturaFonti 4
Due lanci su Show HN a cinque settimane di distanza, Pizza Bot il 15 settembre e Hyperlane il 4 agosto, propongono la stessa idea: tenere il runtime dell'agente sulla propria macchina e far sopravvivere il lavoro di lunga durata alla chiusura di una scheda del browser. La spinta enterprise più rilevante arriva da un'altra parte, da runtime e piani di sicurezza che intercettano ciò che un agente fa prima che lo faccia.
IA e modelli27 settembre 20266 min di letturaFonti 6
Un rapporto di Mozilla sostiene che i migliori modelli cinesi a pesi aperti sono ormai indietro di circa quattro mesi rispetto alle offerte di frontiera statunitensi. I critici obiettano che l'espressione "pesi aperti" venga ormai estesa ben oltre quanto consenta la definizione della Open Source Initiative.
IA e modelli27 settembre 20264 min di letturaFonti 4
La ricerca sulla valutazione della sicurezza AI è sotto pressione su due fronti: ambienti di benchmark che i modelli possono aggirare e architetture di frontiera che nascondono il loro ragionamento. L'8 settembre 2026 Jacob Coxon, ricercatore che ha lavorato sia ad Anthropic sia a OpenAI, si è dimesso dichiarando che le due aziende stanno "giocando con le nostre vite".
IA e modelli27 settembre 20265 min di letturaFonti 4
I piccoli modelli linguistici stanno uscendo dai data centre per arrivare sui telefoni, ma i risultati pubblicati raccontano un progresso disomogeneo. La linea OpenELM di Apple va da 270 milioni a 3 miliardi di parametri. Un modello di Google è un download da 529 MB e gira fino a 2.585 token al secondo su una GPU mobile.
IA e modelli27 settembre 20264 min di letturaFonti 5