Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

I pesi aperti riducono il divario: nuove classifiche, nuovo hardware e un accordo sui chip

Il 1° ottobre l'Artificial Analysis Intelligence Index, ripubblicato da The Open Weights, ha messo GLM-5.3 di Zhipu AI in cima alla sua tabella di 20 modelli a pesi aperti con 44.8 punti, davanti a Kimi K3 di Moonshot AI a 43.6. Intanto continuano ad arrivare nuove uscite.

IA e modelliAnalisiChiara RomanoPubblicato: 30 settembre 20264 min di letturaFonti 14
I pesi aperti riducono il divario: nuove classifiche, nuovo hardware e un accordo sui chip

Il 1° ottobre l'Artificial Analysis Intelligence Index, ripubblicato da The Open Weights, ha messo GLM-5.3 di Zhipu AI in cima alla sua tabella di 20 modelli a pesi aperti con 44.8 punti, davanti a Kimi K3 di Moonshot AI a 43.6. Intanto continuano ad arrivare nuove uscite.

Le classifiche non concordano tra loro, e vale la pena dirlo chiaramente. La board open-weights di BenchLeader, aggiornata 12 ore prima della pubblicazione, mette al primo posto Kimi K3 di Moonshot AI con 66.2, seguito da GLM 5.3 max di Zhipu con 64.7 e da MiMo-V2.6-Pro di Xiaomi con 64.5. La board da 94 modelli di BenchLM.ai elenca invece MiMo-V2.6-Pro al primo posto con un punteggio BenchAlign v5.8 di 75.5, con Qwen3.8 Max e MiMo-V2.6-Flash dietro. LMMarketCap, che ha pubblicato un aggiornamento alle 06:00 del 1° ottobre, classifica Qwen3.8 27B di Alibaba al primo posto tra 175 modelli aperti. Gemma 4 26B A4B e Gemma 4 31B di Google sono appaiati al secondo.

Pannelli diversi, vincitori diversi. L'unica cosa che le quattro board hanno in comune è che le prime posizioni sono occupate da laboratori cinesi e da Google, con Nvidia, Meta e Mistral più in basso.

Le ultime 72 ore hanno prodotto anche diversi nuovi modelli aperti che non compaiono ancora su quelle board. Nvidia ha pubblicato Kumo Tabular il 29 settembre, un modello di base per classificazione e regressione su dati tabellari. Esiste in tre dimensioni da 28M a 215M parametri, è stato preaddestrato solo su dati artificiali ed è rilasciato con licenza OpenMDW-1.1 per uso commerciale. L'azienda afferma che è primo su TabArena, BeyondArena, TALENT e ScoringBench e che non richiede addestramento né feature engineering per singolo compito.

Fermion Research ha rilasciato Phonon-2 il 30 settembre, un modello di riconoscimento vocale per l'inglese in un download da 164 MB il cui encoder memorizza ogni peso in circa 2.1 bit. L'azienda afferma che totalizza in media il 5.21 percento di word error sui sette set inglesi della Open ASR Leaderboard, che ogni modello aperto con un punteggio migliore è almeno 5.8 volte più grande e che un'ora di audio viene trascritta in circa 20 secondi su un MacBook Air. I pesi sono CC-BY-4.0, derivati da Parakeet TDT 0.6B v3 di Nvidia. Bespoke Labs ha pubblicato Nimble il 30 settembre, un modello da 9B costruito su Qwen3.5-9B che restituisce decisioni tipizzate con probabilità invece di testo libero. Il suo README dice che gli esempi di addestramento e di validazione sono stati pubblicati il 20 settembre, dopo essere stati esclusi dalla prima release.

Due progetti aperti stanno verificando se il ciclo di addestramento stesso possa essere distribuito. Il repository coop di Commonsense AI, aggiornato il 30 settembre, descrive un modello da circa 145M parametri preaddestrato da zero su FineWeb-Edu. I volontari eseguono passi AdamW in locale su hardware donato, inviano pseudo-gradienti come pull request su Hugging Face e un cron stateless di GitHub Actions ogni cinque minuti li aggrega con una media trimmata o una mediana geometrica. La fase 1, un modello da 15M su TinyStories, ha superato il suo budget ottimale secondo Chinchilla. Separatamente, PSSA, un modello linguistico non transformer scritto in Rust senza alcun framework di ML sotto, sostiene di imparare più velocemente di un transformer a parità di parametri e di generare circa dodici volte più rapidamente sulla stessa CPU.

Anche il fronte commerciale si è mosso. OpenAI e Synopsys hanno dichiarato il 30 settembre di aver firmato una partnership pluriennale per costruire GPT-Synopsys, un modello per la progettazione e la verifica di chip che opererebbe direttamente sugli strumenti EDA di Synopsys, girando sull'infrastruttura di OpenAI, con i dati dei clienti non usati per l'addestramento e i ricavi condivisi tra i due. The Register ha riferito il 30 settembre che OpenAI ha accusato individui legati a Moonshot AI di una campagna di distillazione iniziata il 1° luglio, con picchi il 24 e 25 luglio di 16.000 richieste da oltre 4.000 utenti e attività correlate su più di 15.000 account, interrotta il 28 luglio. Moonshot non ha risposto alla richiesta di commento di The Register.

I regolatori stanno circondando gli stessi laboratori. La FTC ha aperto un'indagine su tutto il settore che coinvolge OpenAI, Anthropic e altri, come confermato da CNBC il 30 settembre. The Guardian ha riferito lo stesso giorno che l'agenzia prevede richieste formali di informazioni e testimonianze, anche dal gruppo di ricerca Metr. Né OpenAI né Anthropic hanno commentato con CNBC; il New York Post ha riportato per primo l'indagine. Il 29 settembre un'organizzazione no profit, Legal Advocates for Safe Science & Technology, ha citato OpenAI in giudizio presso la Superior Court della contea di San Francisco per l'hack di Hugging Face di luglio, chiedendo un'ingiunzione anziché un risarcimento. Lo riferisce Ars Technica, che ha citato OpenAI definire la causa "completamente priva di fondamento".

Per chi oggi deve scegliere un modello aperto, la lezione pratica di questa settimana è che nessuna singola classifica risolve la questione: le board ordinano insiemi diversi di modelli. Un modello vocale da 164 MB o un modello tabellare da 215M possono contare più, per un deployment, di chiunque stia al primo posto.

Commenti 0

Fonti

14
  1. 01LLM Intelligence leaderboard - The Open WeightsEN
  2. 02Best open weights AI models ranked (2026) - BenchLeaderEN
  3. 03Open-Source LLM Leaderboard 2026: 94 Models Ranked - BenchLM.aiEN
  4. 04Best Open Source AI Models & LLM Leaderboard (2026) - LMMarketCapEN
  5. 05Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  6. 06Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  7. 07Nimble: Data, Model, Recipe for an Open Jev (From Bespoke Labs)EN
  8. 08Coop: A small language model pretrained by volunteersEN
  9. 09PSSA: A non-transformer language model written from scratch in RustEN
  10. 10OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  11. 11Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  12. 12FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  13. 13US trade regulator opens investigation into AI giantsEN
  14. 14"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Chiara Romano

Chiara Romano

IA, modelli e tecnologie

Chiara Romano scrive di tecnologia, IA e modelli, media e internet per FLASH24, partendo da documentazione tecnica, repository e specifiche invece che da comunicati stampa. Per ogni modello o piattaforma che segue controlla versioni, licenze, parametri e benchmark, e verifica i numeri confrontandoli con i dati originali o con test indipendenti. Confronta le schede tecniche tra fornitori, parla con sviluppatori e amministratori di sistema, e tiene d'occhio le finestre di rilascio e le modifiche ai termini d'uso. Fuori dalla redazione gestisce self-hosting e reti domestiche, esperienza che le serve per capire come funzionano davvero i servizi che racconta. Non pubblica una notizia se la fonte primaria non è verificabile.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.