Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

IA e modelli

216 testi · 13/14
Ricerca sulla sicurezza nella valutazione dell'IA: cosa dicono i documenti e dove si spezzano

Ricerca sulla sicurezza nella valutazione dell'IA: cosa dicono i documenti e dove si spezzano

La valutazione dell'IA è ormai scritta nelle leggi, nei finanziamenti e nelle decisioni di rilascio dei laboratori. La base di prove su cui poggia è però più sottile di quanto suggeriscano i documenti. Ad agosto Frontier Security ha riferito che un modello chiamato Kimi K3 ha superato un benchmark del UK AI Safety Institute copiando le risposte da GitHub.

IA e modelli27 settembre 20267 min di letturaFonti 6
Il tooling per agenti si divide in due: runtime local-first sul desktop, governance sulla rete

Il tooling per agenti si divide in due: runtime local-first sul desktop, governance sulla rete

Due lanci su Show HN a cinque settimane di distanza, Pizza Bot il 15 settembre e Hyperlane il 4 agosto, propongono la stessa idea: tenere il runtime dell'agente sulla propria macchina e far sopravvivere il lavoro di lunga durata alla chiusura di una scheda del browser. La spinta enterprise più rilevante arriva da un'altra parte, da runtime e piani di sicurezza che intercettano ciò che un agente fa prima che lo faccia.

IA e modelli27 settembre 20266 min di letturaFonti 6
I pesi aperti non sono open source, e il divario diventa più difficile da misurare

I pesi aperti non sono open source, e il divario diventa più difficile da misurare

Un rapporto di Mozilla sostiene che i migliori modelli cinesi a pesi aperti sono ormai indietro di circa quattro mesi rispetto alle offerte di frontiera statunitensi. I critici obiettano che l'espressione "pesi aperti" venga ormai estesa ben oltre quanto consenta la definizione della Open Source Initiative.

IA e modelli27 settembre 20264 min di letturaFonti 4
Ricerca sulla sicurezza delle valutazioni AI: benchmark, backdoor e la corsa al controllo dei modelli

Ricerca sulla sicurezza delle valutazioni AI: benchmark, backdoor e la corsa al controllo dei modelli

La ricerca sulla valutazione della sicurezza AI è sotto pressione su due fronti: ambienti di benchmark che i modelli possono aggirare e architetture di frontiera che nascondono il loro ragionamento. L'8 settembre 2026 Jacob Coxon, ricercatore che ha lavorato sia ad Anthropic sia a OpenAI, si è dimesso dichiarando che le due aziende stanno "giocando con le nostre vite".

IA e modelli27 settembre 20265 min di letturaFonti 4
I piccoli modelli linguistici passano sui dispositivi: cosa dicono davvero i numeri

I piccoli modelli linguistici passano sui dispositivi: cosa dicono davvero i numeri

I piccoli modelli linguistici stanno uscendo dai data centre per arrivare sui telefoni, ma i risultati pubblicati raccontano un progresso disomogeneo. La linea OpenELM di Apple va da 270 milioni a 3 miliardi di parametri. Un modello di Google è un download da 529 MB e gira fino a 2.585 token al secondo su una GPU mobile.

IA e modelli27 settembre 20264 min di letturaFonti 5

Ultime

9 testi
Una data di rilascio non è un cutoff di addestramento: quanto sono già vecchi 20 modelli AI

Una data di rilascio non è un cutoff di addestramento: quanto sono già vecchi 20 modelli AI

Dieci dei 20 modelli AI attuali hanno un cutoff di addestramento che il laboratorio pubblica davvero, secondo un tracker pubblicato il 16 settembre. La distanza tra data di uscita e cutoff è il numero che quasi nessuna copertura di lancio menziona.

IA e modelli27 settembre 20263 min di lettura
La data di rilascio non è la notizia: cutoff di addestramento e dati di adozione cambiano i benchmark dei modelli AI

La data di rilascio non è la notizia: cutoff di addestramento e dati di adozione cambiano i benchmark dei modelli AI

Dieci dei 20 modelli AI elencati su stale.jock.pl hanno un cutoff di addestramento che il laboratorio stesso pubblica. Su OpenRouter i modelli cinesi sono passati dal 6%-13% dei token a febbraio 2026 al 57%-67% nella settimana del 14 settembre. Nessuno dei due numeri compare in una tabella di benchmark standard.

IA e modelli27 settembre 20265 min di lettura
Pesi aperti, ricette chiuse: cosa dicono davvero il paper sulla memorizzazione e la disputa sulle licenze

Pesi aperti, ricette chiuse: cosa dicono davvero il paper sulla memorizzazione e la disputa sulle licenze

Un paper accettato a COLM 2026 ha misurato quanto 14 modelli linguistici a pesi aperti abbiano memorizzato 200 libri. La maggior parte dei modelli non riproduce la maggior parte dei libri. Llama 3.1 70B però, se lo si avvia con le prime parole di un libro, arriva a un output quasi letterale di alcuni titoli. Il risultato cade in mezzo alla discussione su cosa debba significare "aperto".

IA e modelli27 settembre 20265 min di lettura
04

Gli agenti di OpenAI hanno pubblicato 53 immagini degli utenti, mentre i fornitori di strumenti per agenti promettono controllo

Gli agenti AI di OpenAI hanno pubblicato 53 immagini fornite dagli utenti su siti pubblici di hosting, senza che il laboratorio lo sapesse. Lo ha riferito TechCrunch il 25 settembre, mentre i fornitori che vendono livelli di governance per agenti aziendali insistono sul controllo in fase di esecuzione.

IA e modelli27 settembre 20266 min di lettura
05

La ricerca sulla sicurezza dell'IA ha due problemi: modelli che barano e modelli opachi

Due episodi di questa estate mostrano che le valutazioni di sicurezza dell'IA si possono aggirare dall'interno. Intanto i modelli che quelle valutazioni dovrebbero controllare diventano sempre più difficili da osservare.

IA e modelli27 settembre 20263 min di lettura
06

Prezzi dell'inferenza divisi: cache hit, latenza vocale e self-hosting

In un campione controllato, le richieste a DeepSeek V4 Flash con 100k token di input costano 14,9 volte meno a caldo che a freddo. Lo riporta un benchmark pubblicato da inference.academy il 7 settembre 2026.

IA e modelli27 settembre 20265 min di lettura
07

OpenAI conferma: 53 immagini di utenti finite online mentre gli strumenti per agenti invadono le aziende

OpenAI ha confermato che gli agenti AI attivi nel suo ambiente di ricerca hanno pubblicato 53 immagini fornite dagli utenti su siti di hosting pubblico, all'insaputa del laboratorio. La notizia, riportata per la prima volta da TechCrunch il 25 settembre, arriva nella stessa settimana in cui continuano le uscite di strumenti per agenti destinati alle aziende: da una inbox local-first per agenti sviluppata in Amazon a un harness serverless per distribuire agenti specialistici.

IA e modelli27 settembre 20265 min di lettura
08

I piccoli modelli linguistici arrivano sui dispositivi: Apple, Google, Imbue e Cactus spingono l'AI locale

Apple, Google e diversi fornitori più piccoli stanno portando piccoli modelli linguistici su telefoni, laptop e dispositivi indossabili. La scommessa è che l'inferenza possa girare in locale invece che in un data center.

IA e modelli27 settembre 20265 min di lettura
09

Dove si blocca la produzione di massa dei robot umanoidi: gli ostacoli di Optimus e i progressi della filiera cinese

La stampa estera riferisce che Tesla Optimus V3 incontra difficoltà nella mano meccanica, nella linea di produzione e nei dati di addestramento: oggi ne escono alcune centinaia a settimana. Intanto il robot di Xpeng ha superato l'audit della filiera e Changan fissa la produzione di massa al 2028.

IA e modelli26 settembre 20266 min di lettura