Pesi aperti, argomenti chiusi: la corsa ai modelli aperti si consolida mentre i regolatori si muovono
La FTC ha aperto un'indagine su tutto il settore che coinvolge OpenAI, Anthropic e altri laboratori di IA per i rischi che i loro prodotti comportano per i consumatori. Lo ha confermato per primo CNBC il 30 settembre, la stessa settimana in cui i modelli a pesi aperti continuavano a segnare nuovi record nelle classifiche pubbliche e OpenAI accusava Moonshot AI di un attacco di distillazione.

La Federal Trade Commission ha aperto un'indagine su OpenAI, Anthropic e altre aziende di IA per i potenziali pericoli che i loro prodotti comportano. Lo ha confermato a CNBC un portavoce dell'agenzia il 30 settembre. Il New York Post ha riportato per primo la notizia dell'indagine.
Secondo The Guardian è la prima azione ufficiale di applicazione della legge negli Stati Uniti che guarda direttamente agli agenti di IA fuori controllo, dopo una serie di incidenti segnalati per la prima volta a luglio. La FTC intende emettere richieste formali di informazioni e obbligare i dirigenti a testimoniare, anche presso il gruppo di ricerca Metr. Anthropic e OpenAI si sono rivolte a Metr per indagini indipendenti sugli incidenti.
I pesi aperti continuano a salire
Mentre i regolatori si muovono, le classifiche dei pesi aperti continuano a rimescolarsi. La tabella open-weights di BenchLeader, aggiornata nell'ultimo giorno, mette Kimi K3 di Moonshot AI in testa con 66,2, davanti a GLM 5.3 di Zhipu AI a 64,7 e a MiMo-V2.6-Pro di Xiaomi a 64,5.
BenchLM.ai ordina lo stesso campo in modo diverso e colloca MiMo-V2.6-Pro al primo posto con 75,5 nel suo punteggio BenchAlign v5.8, con Qwen3.8 Max e MiMo-V2.6-Flash dietro. I due siti usano contratti di punteggio diversi ed etichette di evidenza diverse, quindi il disaccordo riguarda la metodologia oltre che i modelli. La directory di LMC Marketcap con 175 modelli aperti assegna a Qwen3.8 27B il punteggio più alto, 71. The Open Weights, citando i dati di Artificial Analysis aggiornati al 1 ottobre, dà invece a GLM-5.3 il punteggio di intelligenza più alto, 44,8, davanti a Kimi K3 a 43,6.
Letti insieme, i quattro ranking concordano su una cosa: i laboratori cinesi occupano la maggior parte delle posizioni di vertice.
Nvidia si è spinta in un angolo diverso del catalogo aperto il 29 settembre. Il suo modello di base Kumo Tabular per le tabelle, rilasciato con licenza OpenMDW-1.1, è disponibile in tre dimensioni da 28M a 215M parametri. È stato preaddestrato solo su dati artificiali e predice le etichette in un singolo passaggio in avanti senza addestramento, messa a punto o ingegneria delle feature, secondo il post dell'azienda su Hugging Face. Nvidia afferma di essere prima su TabArena, BeyondArena, TALENT e ScoringBench.
Modelli piccoli, compiti ristretti
I rilasci aperti più interessanti della settimana sono piccoli e specifici. Fermion Research ha pubblicato Phonon-2 il 30 settembre, un modello di riconoscimento vocale in inglese in un download da 164 MB. Registra in media il 5,21 % di word error sui sette set inglesi della Open ASR Leaderboard, dentro il margine di rumore rispetto al suo insegnante da 2,5 GB, e fa meglio su riunioni e discorsi parlamentari. I pesi sono CC-BY-4.0, derivati da Parakeet TDT 0.6B v3 di Nvidia.
La famiglia Holo4 di H Company, trattata da MarkTechPost, mette i pesi per l'uso del computer in due dimensioni: un modello denso da 27B e un mixture of experts 35B-A3B. Il più grande esce con licenza Apache 2.0 per l'auto-hosting commerciale. Il 27B, che secondo i dati di H segna l'85,2 % su OSWorld a 0,08 dollari per attività, è CC BY-NC 4.0, quindi l'uso commerciale passa attraverso l'API del fornitore. MarkTechPost osserva che i confronti con i modelli di frontiera hanno usato harness diversi e che 480 delle 600 attività pubbliche di AutomationBench si trovano nello split di addestramento di H.
"Veloce ed economico è molto facile, sai," ha detto a TechCrunch Diogo Almeida, CEO di TypeSafe. "Se lo vuoi davvero veloce ed economico, usa i dadi, no? L'intelligenza è la parte difficile."
Quella citazione indica la storia silenziosa sotto le classifiche: il formato di modello decisionale in stile Jev, che restituisce scelte e probabilità invece di prosa, si sta diffondendo rapidamente. La Decisions API di OpenAI, annunciata al DevDay, applica la stessa idea al suo modello Luna, ha riportato TechCrunch il 30 settembre. Nimble di Bespoke Labs, un modello da 9B costruito su Qwen3.5-9B, pubblica la sua ricetta di addestramento completa e 2.676 esempi di addestramento; il repository dichiara chiaramente che non ha distillato da Jev. Ollama ha aggiunto il supporto locale per Nimble nella versione 0.35. Jevstiller, uno strumento aperto trattato da The Register il 29 settembre, dichiara il 98 % di concordanza con Jev mentre risponde a richieste familiari sul dispositivo in appena 15 ms.
L'accusa e l'alzata di spalle
La temperatura politica è salita il 30 settembre, quando OpenAI ha dichiarato di aver interrotto una campagna di distillazione avversaria condotta dal 1 luglio al 28 luglio, con un picco il 24 e 25 luglio con 16.000 richieste da oltre 4.000 utenti. Il blog di OpenAI ha affermato che il cluster principale proveniva da Moonshot AI. The Register ha notato l'ironia in un titolo e ha fatto notare che Moonshot non ha risposto a una richiesta di commento.
Kimi K3 di Moonshot si trova vicino alla cima di diverse classifiche aperte questa settimana. Se le accuse di distillazione cambino il modo in cui le imprese scelgono i pesi è una questione separata, e l'argomento del conto dei token sta facendo più lavoro di qualsiasi accusa.
Fonti
14- 01FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 02US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 03Best open weights AI models ranked (2026)EN
- 04Open-Source LLM Leaderboard 2026: 94 Models RankedEN
- 05Best Open Source AI Models & LLM Leaderboard (2026)EN
- 06LLM Intelligence leaderboardEN
- 07NVIDIA Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 08Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 09H Company Releases Holo4: Open-Weight Computer-Use ModelsEN
- 10OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 11Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
- 12Ollama now supports Jev-like decision models all locally in 0.35EN
- 13Open source tool distills Jev so you can run it locallyEN
- 14Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.