Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I modelli open weight guidano le valutazioni, OpenAI resta chiusa

Il 30 settembre il UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework open source per le valutazioni con oltre 200 benchmark predefiniti. Lo stesso giorno Kumo Tabular di NVIDIA ha conquistato quattro benchmark tabellari e Phonon-2 è arrivato con un modello vocale da 164 MB.

IA e modelliNotiziaGiulia FerrariPubblicato: 30 settembre 20266 min di letturaFonti 18
I modelli open weight guidano le valutazioni, OpenAI resta chiusa

Il 30 settembre il UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework open source per la valutazione dei modelli di frontiera. Contiene oltre 200 benchmark predefiniti e una sandbox che esegue codice non attendibile dei modelli in Docker, Kubernetes, Modal, Proxmox e Vagrant. Lo stesso giorno NVIDIA ha rilasciato Kumo Tabular, un modello di base aperto per la previsione su dati tabellari, e Fermion Research ha distribuito Phonon-2, un modello di riconoscimento vocale che sta in un download da 164 MB.

Le tre uscite puntano nella stessa direzione: lo stack open weight continua a riempire gli spazi che prima appartenevano ai laboratori di frontiera.

Inspect gestisce coding, attività agentiche, ragionamento, conoscenza, comportamento e comprensione multimodale. Supporta più di 20 fornitori di modelli, oltre all'inferenza locale tramite HuggingFace, vLLM e SGLang. La sua API di estensione per il sandboxing permette ai team di eseguire codice non attendibile in Docker, Kubernetes, Modal, Proxmox o Vagrant. Una valutazione Inspect è un Task che combina un Dataset di campioni etichettati, un Solver che produce una risposta per ogni campione e uno Scorer che valuta l'output. Il framework include uno strumento web, Inspect View, per monitorare le esecuzioni, e un'estensione per VS Code per scriverle e metterle a punto. Questa combinazione conta perché permette a un laboratorio o a un'autorità di regolamentazione di rieseguire la valutazione di qualcun altro senza chiedere permesso.

Kumo Tabular di NVIDIA, annunciato su Hugging Face il 29 settembre, è un modello di base per classificazione e regressione su dati tabellari. Predice le etichette in un solo passaggio in avanti, senza addestramento, messa a punto o ingegneria delle feature. Esiste in tre dimensioni, da 28M a 215M parametri, è stato preaddestrato solo su dati artificiali ed è rilasciato con licenza OpenMDW-1.1 per uso commerciale. NVIDIA afferma che è primo in quattro benchmark: TabArena, BeyondArena, TALENT e ScoringBench. Il modello usa attenzione su colonne, righe e in contesto, con embedding delle celle costruiti da feature di Fourier e valori mancanti gestiti senza imputazione.

Phonon-2 di Fermion Research, pubblicato il 30 settembre, si presenta come il modello aperto di riconoscimento vocale più accurato sotto i 900 MB. Ha una media del 5,21 per cento di word error rate sui sette set inglesi della Open ASR Leaderboard. Batte il proprio insegnante a piena precisione da 2,5 GB su riunioni e discorsi parlamentari e trasforma un'ora di audio in testo in circa 20 secondi su un MacBook Air. L'encoder memorizza ogni peso a circa 2,1 bit, impacchettati come cifre in base 3, cinque per byte. I pesi sono CC-BY-4.0, ereditati da Parakeet TDT 0.6B v3 di NVIDIA, da cui derivano.

Modelli piccoli, budget piccoli

Il 30 settembre sono arrivati anche due progetti di volontari e su scala studentesca. Un repository GitHub chiamato Coop descrive un modello linguistico da circa 145M di parametri preaddestrato da zero su FineWeb-Edu da volontari. Gli pseudo-gradienti vengono inviati come pull request su Hugging Face e aggregati da un cron job stateless di GitHub Actions, tramite DiLoCo. La fase 1, un modello da 15M su TinyStories, ha superato il proprio budget ottimale secondo Chinchilla. Il README dice che più volontari, su Apple Silicon e su CPU normale, hanno addestrato lo stesso passo esterno e che questo è stato mediato in un unico aggiornamento.

Su un altro fronte, un repository chiamato PSSA descrive un modello linguistico non transformer scritto in Rust, senza PyTorch o TensorFlow sotto. A parità di parametri e sullo stesso corpus, il suo autore sostiene che impara più in fretta di un transformer e genera testo circa dodici volte più velocemente sulla stessa CPU.

Intanto la frontiera chiusa continua a discutere di sicurezza. Il 30 settembre OpenAI ha dichiarato che non diventerà pubblica finché non potrà «prendere decisioni di sicurezza con fiducia», secondo Ars Technica. L'azienda deve affrontare una causa depositata in California da Legal Advocates for Safe Science & Technology per l'hack di luglio dei suoi agenti ai danni di Hugging Face. LASST sostiene che il Comprehensive Computer Data Access and Fraud Act della California non ammette come difesa «che l'intelligenza artificiale abbia causato il danno autonomamente». OpenAI ha detto ad Ars che la causa è «completamente priva di fondamento».

La FTC ha aperto un'indagine su tutto il settore che coinvolge OpenAI, Anthropic e altri laboratori di IA, come confermato da CNBC il 30 settembre. Il New York Post ha riportato per primo l'esistenza dell'indagine. Anthropic, OpenAI e il gruppo di ricerca Metr non hanno risposto immediatamente alle richieste di commento, secondo The Guardian. Su un altro piano, il chief research officer di OpenAI Mark Chen ha detto a MIT Technology Review che l'incidente di Hugging Face e le altre rivelazioni erano «tutte parte dello stesso grappolo di attività di maggio e giugno» e che «non ci spareremo in un piede» per le conseguenze.

Distribuzione e livello decisionale

Sul fronte commerciale, il 30 settembre OpenAI e Synopsys hanno firmato una partnership pluriennale per costruire GPT-Synopsys, un modello per la progettazione di chip che girerà sull'infrastruttura di OpenAI. Synopsys produce strumenti di electronic design automation; OpenAI li concede in licenza per il progetto. I dati dei clienti non saranno usati per l'addestramento e saranno conservati cifrati, secondo entrambe le aziende, e i primi test con clienti dei semiconduttori sono già in corso.

OpenAI ha anche presentato Decisions API al DevDay. TechCrunch lo ha descritto il 30 settembre come un prodotto simile a Jev, che dà a un modello un insieme predefinito di opzioni tra cui scegliere. Jev di TypeSafe è l'implementazione di riferimento di quel formato. Un progetto open source chiamato Jevstiller, documentato da The Register il 29 settembre, distilla gli output di Jev in un modello locale che risponde alle richieste abituali sulla CPU di un dispositivo in appena 15 ms, inoltrando il resto a monte. Gli autori di Jevstiller sostengono una concordanza complessiva del 98 per cento con Jev.

Google, intanto, sostituisce Gems con Skills in Gemini, il formato nato con Anthropic e disponibile come standard aperto. Gems chiuderà a novembre per gli account personali, a marzo 2027 per i clienti enterprise e nonprofit di Workspace e a giugno 2027 per i clienti education, secondo The Decoder.

Sul fronte hardware e dati, il 30 settembre Innodata ha aperto un laboratorio di motion capture per generare dati 3D di addestramento per robot umanoidi, con sensori progettati per registrare il più piccolo movimento di ogni giunto. Franklin Tanner, vicepresidente della divisione robotica e physical AI dell'azienda, ha detto a The Robot Report che «non c'è sostituto alla motion capture 3D diretta».

Le classifiche open weight raccontano la stessa storia dall'altro lato. La graduatoria di BenchLeader mette Kimi K3 di Moonshot AI in testa con un punteggio di 66,2, seguito da GLM 5.3 di Zhipu AI a 64,7 e da MiMo-V2.6-Pro di Xiaomi a 64,5. La classifica separata di BenchLM.ai colloca MiMo-V2.6-Pro al primo posto con 75,5 sulla sua scala BenchAlign v5.8, con Qwen3.8 Max e MiMo-V2.6-Flash dietro. La classifica Open Weights, che si basa su Artificial Analysis ed è stata aggiornata il 1 ottobre, mette GLM-5.3 a 44,8 sull'intelligenza e a 74,8 sul coding. Le classifiche non concordano su chi sia primo, in parte perché usano benchmark diversi e in parte perché le loro etichette di evidenza sono diverse.

Ciò che le tre nuove uscite hanno in comune è più stretto di una filosofia. Sono infrastruttura: un sistema di valutazione, un predittore tabellare, un riconoscitore vocale. Nessuno di loro ha bisogno del permesso di un laboratorio di frontiera per funzionare, e tutti sono arrivati questa settimana.

Commenti 0

Fonti

18
  1. 01Inspect: An open-source framework for large language model evaluationsEN
  2. 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  3. 03Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06OpenAI delays IPO over AI safety concernsEN
  7. 07"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
  8. 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  9. 09US trade regulator opens investigation into AI giantsEN
  10. 10"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
  11. 11OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  12. 12OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
  13. 13Jevstiller: Open-source tool distills Jev so you can run it locallyEN
  14. 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
  15. 15Innodata opens motion-capture lab to help humanoids move more like peopleEN
  16. 16Best open weights AI models ranked (2026)EN
  17. 17Open-Source LLM Leaderboard 2026: 94 Models RankedEN
  18. 18LLM Intelligence leaderboardEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.