L'FTC indaga sui laboratori di IA, OpenAI denuncia una campagna di distillazione
La Federal Trade Commission americana ha avviato un'indagine di settore su Anthropic, OpenAI e altri laboratori di IA. È il primo intervento esecutivo ufficiale degli Stati Uniti sugli agenti di IA fuori controllo, secondo quanto riporta il Guardian il 30 settembre.

L'indagine dell'FTC è arrivata lo stesso giorno in cui OpenAI ha pubblicato un post sul blog. L'azienda accusa persone legate a Moonshot AI, società cinese, di aver condotto una campagna di distillazione contro i suoi modelli. The Register ha riferito il 30 settembre che, secondo OpenAI, l'attività è iniziata il 1 luglio ed è stata interrotta il 28 luglio.
Entrambe le storie contano per chi distribuisce pesi aperti. Fissano i termini della discussione: che cosa un modello può imparare da un altro modello e chi è responsabile quando un agente sbaglia. Le risposte non sono stabilite. L'FTC non ha indicato un bersaglio. Anthropic, OpenAI e il gruppo di ricerca Metr non hanno risposto subito alle richieste di commento, secondo il Guardian. Il New York Post ha dato per primo la notizia.
Che cosa dice OpenAI e che cosa non dice
Il resoconto di OpenAI, come riportato da The Register, è preciso sui volumi e vago sulle attribuzioni. Le richieste sono partite lentamente, poi hanno prodotto "picchi ad alto volume il 24 e 25 luglio, con 16.000 richieste basate su un pattern di estrazione riconducibile a oltre 4.000 utenti", ha detto l'azienda. Approfondendo, OpenAI ha individuato attività legate a schemi di prompt su più di 15.000 utenti. Afferma di aver interrotto completamente la campagna il 28 luglio.
"Gli operatori non hanno violato la nostra crittografia, compromesso un database né ottenuto accesso diretto alle conversazioni salvate degli utenti", ha detto OpenAI nel blog. "Hanno invece manipolato le interazioni con il modello in modo che il ragionamento protetto potesse essere riprodotto in forme visibili a chi faceva la richiesta, in maniera coordinata e su larga scala, violando i nostri termini di servizio."
OpenAI afferma che non è chiaro se ogni operatore di luglio fosse legato a un unico rivale, ma definisce Moonshot AI il nucleo principale. Questa è un'accusa, non una conclusione. The Register ha chiesto un commento a Moonshot senza ricevere risposta immediata. Ha chiesto anche a OpenAI quali modelli fossero presi di mira, senza ottenere risposta.
Il contesto è scomodo. OpenAI ha costruito i suoi modelli su enormi quantità di contenuti web raschiati, in mezzo a battaglie sul copyright, come nota The Register. Ora definisce l'estrazione del suo ragionamento un rischio per la sicurezza nazionale. Anthropic, Google e funzionari americani hanno mosso accuse simili contro Moonshot. A fine luglio Michael Kratsios, assistente di Trump per la scienza e la tecnologia, ha accusato Moonshot di aver costruito il modello Kimi K3 distillando Fable di Anthropic, riferisce The Register.
La risposta di Anthropic è stata tecnica. Il suo modello Claude Opus 5.5, uscito una settimana prima dell'articolo di The Register, porta una difesa contro la distillazione chiamata "preserved thinking", introdotta con Fable 5.1. OpenAI, da parte sua, dice di aver bandito gli account che copiavano i modelli, rafforzato i controlli su registrazione e infrastruttura, ampliato il monitoraggio, chiuso un percorso che permetteva di riprodurre il ragionamento cifrato di un altro utente e condiviso i dettagli attraverso il Frontier Model Forum.
L'avvertimento di Anthropic su GLM-5.3
Anthropic porta avanti da più tempo un ragionamento parallelo sui pesi aperti. Il 30 settembre The Decoder ha riferito di un'analisi del Frontier Red Team di Anthropic su GLM-5.3 di Zhipu. Secondo Anthropic, questo modello a pesi aperti è in grado di costruire exploit informatici completi da solo, come il suo Claude Mythos Preview, ma è stato distribuito senza salvaguardie efficaci.
I numeri pubblicati da Anthropic vanno letti con attenzione. Su ExploitBench, che misura lo sfruttamento di bug noti nel motore V8 di Chrome, GLM-5.3 ha costruito un exploit funzionante in 50 tentativi su 410; Mythos Preview ne ha totalizzati 56. Su un benchmark interno di exploitation binaria ricavato da OSS-Fuzz di Google, GLM-5.3 ha preso il controllo completo del bersaglio nel 4 per cento dei compiti, contro il 6 per cento di Mythos Preview. Modelli più vecchi, tra cui GLM-5.2 e Claude Opus 4.6, hanno fallito entrambi. Kimi K3 e DeepSeek V4.1-Flash hanno ottenuto punteggi minimi, riferisce The Decoder.
I dati sui rifiuti sono la parte più netta. In una simulazione di Anthropic, GLM-5.3 ha rifiutato comandi apertamente malevoli. Quando la stessa richiesta è stata presentata come esercizio di red team, ha tentato di connettersi al sistema bersaglio nel 64 per cento delle esecuzioni. Con passaggi di ragionamento precompilati, la quota è salita al 92 per cento. Dopo l'abliterazione, una tecnica che rimuove il comportamento di rifiuto dai pesi aperti, ha toccato il 100 per cento. I modelli Claude protetti sono rimasti a zero. Anthropic dice di aver usato l'abliterazione per la prima volta, spendendo circa 2.200 ore GPU e all'incirca 4.400 dollari. Stima che una squadra esperta potrebbe farlo con circa 1.200 dollari.
L'analisi non è disinteressata, e The Decoder lo dice. Anthropic non rilascia i suoi pesi e presenta questo come un vantaggio di sicurezza. Un modello cinese a pesi aperti, economico e vicino alla frontiera, è un concorrente diretto. Il CAISI, l'agenzia americana che ha valutato GLM-5.3 separatamente, lo ha definito il modello a pesi aperti con le maggiori capacità informatiche fino ad oggi. Lo ha collocato circa quattro mesi dietro i migliori modelli americani, con la precisazione che i modelli statunitensi sono stati testati con le salvaguardie informatiche disattivate.
Intanto i piccoli rilasci a pesi aperti non si fermano
Niente di tutto questo ha rallentato il ritmo delle uscite. Fermion Research ha pubblicato Phonon-2 il 30 settembre, un modello di riconoscimento vocale per l'inglese. Registra in media il 5,21 per cento di word error sui sette set inglesi della Open ASR Leaderboard con un download da 164 MB. Mantiene l'accuratezza del suo teacher a piena precisione da 2,5 GB e lo supera su riunioni e discorsi parlamentari.
La compressione è la parte interessante. Ogni peso dell'encoder è uno di cinque livelli appresi a circa 2,1 bit, impacchettati come cifre in base 3, cinque per byte. Lo stesso file gira su Mac, Linux, Windows e GPU NVIDIA. Su un MacBook Air un'ora di audio diventa testo in circa 20 secondi; su otto core CPU l'ora richiede 25 secondi; su una H100 una giornata intera di audio richiede 13 secondi in batch da 128. I pesi sono CC-BY-4.0, la licenza di Parakeet TDT 0.6B v3 di NVIDIA, da cui derivano.
NVIDIA, intanto, ha puntato sui dati tabellari. Il suo modello Kumo Tabular, annunciato su Hugging Face il 29 settembre, è un modello di base aperto per classificazione e regressione tabellare. Predice le etichette in un singolo passaggio in avanti, senza addestramento, senza tuning e senza feature engineering. Esiste in tre dimensioni, da 28M a 215M parametri, è stato preaddestrato solo su dati artificiali ed è rilasciato con licenza OpenMDW-1.1 per uso commerciale. NVIDIA dice che è primo su TabArena, BeyondArena, TALENT e ScoringBench.
L'affermazione che spicca è quella sull'apprendimento in contesto per le tabelle. Un modello preaddestrato su milioni di tabelle legge una tabella etichettata come contesto e predice direttamente le nuove righe, lo stesso trucco che gli LLM usano sul testo. Per due decenni quel lavoro è appartenuto agli alberi potenziati dal gradiente, costruiti da zero per ogni compito. Se un transformer da 215M di parametri li scalzerà nella pratica è una domanda che i benchmark non hanno risolto.
Pesi aperti, domande chiuse
Altrove nel dossier l'ecosistema aperto sperimenta strutture più strane. Coop, un progetto di commonsense-ai, esegue un preaddestramento da circa 145M di parametri su hardware di consumo donato e sui livelli gratuiti di Hugging Face e GitHub Actions. Gli pseudo-gradienti vengono inviati come pull request e aggregati da un cron job senza stato. La fase 1, un modello da 15M addestrato su TinyStories da volontari in sei giorni, si è conclusa oltre il budget ottimale di Chinchilla con la validation loss scesa da 9,01 a 2,8.
PSSA, di Sparticle62ops, è un modello linguistico non transformer scritto in Rust senza alcun framework di ML sotto. Usa una ricorrenza selettiva a spazio di stato, più una banca di memoria iperbolica e aggiornamenti dei pesi per token. A parità di parametri sullo stesso corpus, il suo autore sostiene che impari più velocemente di un transformer e generi circa dodici volte più rapidamente sulla stessa CPU. Il framework Inspect dell'AI Security Institute britannico, aggiornato il 30 settembre, ora include oltre 200 valutazioni predefinite e supporta l'esecuzione di agenti esterni come Claude Code e Codex CLI in sandbox.
Messi insieme, il quadro non è quello semplice di aperti contro chiusi. L'FTC indaga sul comportamento degli agenti presso i laboratori più grandi, che per la maggior parte non rilasciano i pesi. La battaglia sulla distillazione riguarda modelli che non rilasciano i pesi neanche loro. I modelli che vengono davvero scaricati sono piccoli, economici e spesso addestrati fuori dai laboratori: 164 MB di parlato, 215M di parametri per la previsione tabellare, un preaddestramento volontario che si può avviare da un terminale.
Nessuno di loro risponde alla domanda su cui girano sia l'indagine dell'FTC sia il rapporto di Anthropic. Se un modello scaricato può essere privato dei suoi rifiuti in un giorno per circa 1.200 dollari, e se il divario di capacità rispetto alla frontiera si misura in mesi, allora i termini di licenza e le salvaguardie in fase di addestramento fanno meno di quanto lascino intendere le persone che li scrivono. L'azione esecutiva è il primo tentativo di un regolatore americano di verificarlo. Non è ancora una risposta.
Fonti
8- 01US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 02Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 03Anthropic says Zhipu's open-weight GLM-5.3 nearly matches Claude Mythos Preview at building exploitsEN
- 04Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 05NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
- 06Coop: A small language model pretrained by volunteersEN
- 07PSSA: A non-transformer language model written from scratch in RustEN
- 08Inspect: An open-source framework for large language model evaluationsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.