I pesi aperti salgono di livello: chip design, voce e modelli tabellari nella stessa settimana
OpenAI e Synopsys hanno firmato il 30 settembre un accordo pluriennale per costruire GPT-Synopsys, un modello specializzato per il chip design. È uno dei almeno cinque rilasci o accordi su modelli aperti o descritti apertamente arrivati negli ultimi giorni di settembre.

La novità più recente nel lavoro sui modelli aperti non è un punteggio su un benchmark. È un contratto. Il 30 settembre OpenAI e Synopsys hanno annunciato una partnership strategica pluriennale per costruire un modello AI specializzato nel chip design, chiamato GPT-Synopsys, secondo The Decoder. Synopsys vende strumenti di electronic design automation, il software che gli ingegneri usano per progettare la disposizione dei chip. OpenAI concede in licenza quegli strumenti per il progetto.
L'obiettivo dichiarato è un modello in grado di "ragionare sul chip design e sulla verifica e di operare direttamente sugli strumenti di Synopsys". Le due aziende dicono che i primi test con clienti del settore dei semiconduttori sono in corso, che i dati dei clienti non saranno usati per l'addestramento e saranno conservati cifrati, e che commercializzeranno il prodotto insieme condividendo i ricavi. Il CEO di Synopsys Sassine Ghazi afferma che l'AI potrebbe accelerare in modo significativo il processo di progettazione. Il co-fondatore di OpenAI Greg Brockman presenta l'accordo come una via verso chip migliori e un'AI migliore.
Questo è un modello chiuso dentro una filiera commerciale. La stessa settimana ha prodotto un tipo di rilascio molto diverso.
Modelli piccoli, file piccoli, dichiarazioni roboanti
Fermion Research ha rilasciato Phonon-2 il 30 settembre e lo descrive come il modello aperto di riconoscimento vocale più accurato sotto i 900 MB. In un download da 164 MB, secondo l'azienda, eguaglia l'accuratezza del suo insegnante a piena precisione da 2,5 GB prova per prova, lo batte su riunioni e discorsi parlamentari, e trasforma un'ora di audio in testo in circa 20 secondi su un MacBook Air. I pesi sono su Hugging Face con licenza CC-BY-4.0, la stessa di Parakeet TDT 0.6B v3 di NVIDIA, da cui derivano.
Il numero interessante è 5,21. Sui sette set in inglese della Open ASR Leaderboard, Phonon-2 fa una media del 5,21 per cento di word error. Ogni modello aperto che ottiene un punteggio migliore è almeno 5,8 volte più grande, secondo il comunicato dell'azienda. Ogni peso dell'encoder è memorizzato come uno di cinque livelli appresi, impacchettati come cifre in base 3, cinque per byte, con un ulteriore bit per ogni peso diverso da zero che seleziona la magnitudine. Si arriva a circa 2,1 bit per peso memorizzato. L'azienda dice che il vantaggio tiene sotto rumore, da una stanza silenziosa a un rumore di fondo forte quanto chi parla, dove resta davanti a Parakeet Redux.
La verifica indipendente non è nel dossier. Trattate la posizione in classifica e l'affermazione sul rumore come numeri del fornitore finché qualcuno non li riproduce.
Lo stesso giorno, altrove, NVIDIA ha messo il suo modello di base tabellare su Hugging Face. NVIDIA Kumo Tabular è un modello di base aperto per dati tabellari: predice le etichette di nuove righe in un singolo forward pass, senza addestramento, senza tuning e senza feature engineering, sia per la classificazione sia per la regressione. È stato preaddestrato solo su dati artificiali, arriva in tre dimensioni da 28M a 215M parametri, gira attraverso la libreria open source structured-data-models di NVIDIA, ed è rilasciato con licenza OpenMDW-1.1 per uso commerciale. NVIDIA dice che è primo su quattro benchmark: TabArena, BeyondArena, TALENT e ScoringBench.
I dettagli dell'architettura contano meno dell'inquadramento. Il lavoro sui dati tabellari è dominato da vent'anni dagli alberi potenziati a gradiente. La proposta di NVIDIA è che un transformer preaddestrato possa leggere una tabella etichettata nel contesto e saltare il ciclo di vita per attività fatto di raccolta di etichette, ingegnerizzazione delle feature e tuning degli iperparametri. Il modello usa attenzione per colonne, righe e contesto sulla linea di TabICL e TabPFN, con una temperatura di attenzione consapevole della lunghezza, così che l'attenzione softmax non si dissolva quando una tabella di inferenza è molto più grande di una tabella di addestramento. I valori mancanti non richiedono imputazione.
Pesi aperti da volontari e da un istituto statale
Due rilasci del 30 settembre sono arrivati senza nessuna azienda dietro, o con una statale. Coop è un piccolo modello linguistico preaddestrato da volontari, senza server, senza finanziamenti e senza daemon. Il ciclo di addestramento gira su hardware di consumo donato più i piani gratuiti di Hugging Face e GitHub Actions, secondo il suo repository GitHub. La fase 2 è attiva: un transformer decoder-only da circa 145M di parametri preaddestrato da zero su FineWeb-Edu, con 12 layer, 14 head, d=896, un contesto di 1024 token e un vocabolario BPE byte-level da 32k. La fase 1, un modello da 15M su TinyStories, si è conclusa oltre il suo budget ottimale di Chinchilla, con la validation loss scesa da 9,01 a 2,8 in sei giorni.
Il meccanismo è la storia. I worker scaricano il checkpoint corrente, eseguono passi AdamW locali su una shard di dati personale, calcolano uno pseudo-gradiente e lo inviano come pull request contro un repository pubblico di dataset su Hugging Face. Un cron job stateless di GitHub Actions, programmato ogni cinque minuti ma in pratica attivato a intervalli che vanno da pochi minuti a qualche ora, legge il checkpoint e le pull request aperte in inbox, scarta le sottomissioni troppo vecchie, taglia e applica un gate coseno alle restanti, le aggrega con media trimmata o mediana geometrica, fa un passo esterno di Nesterov, carica il nuovo checkpoint, accredita i contributori nel ledger e chiude le pull request processate.
Il repository è schietto sulla valutazione. Una singola validation loss non dice nulla, perché i passi esterni la spostano in su tanto quanto in giù. Per questo la leaderboard adatta una pendenza sulla serie rispetto ai token invece che ai passi esterni e la riporta con un errore standard. "Scendere" significa che la pendenza supera due errori standard. È una regola di rendicontazione più onesta di quanto riescano a fare la maggior parte dei laboratori finanziati.
Lo stesso giorno, l'UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework open source per le valutazioni di frontiera dell'AI. Inspect copre coding, attività agentiche, ragionamento, conoscenza, comportamento e comprensione multi-modale, e arriva con oltre 200 valutazioni predefinite. I suoi blocchi costitutivi sono dataset, solver e scorer. Supporta il tool calling, inclusi gli strumenti MCP e quelli integrati bash, python, web search e computer, esegue agenti esterni arbitrari come Claude Code, Codex CLI e Gemini CLI, e mette in sandbox il codice non fidato dei modelli in Docker, Kubernetes, Modal, Proxmox e Vagrant tramite un'API di estensione. Il tempismo è mirato. Gli strumenti di valutazione di un istituto governativo per la sicurezza arrivano nella stessa settimana in cui un regolatore degli Stati Uniti ha aperto un'indagine su tutto il settore per agenti AI che si comportano male.
I pesi aperti entrano nello stack dei chip cinese
Deepseek sta rilasciando strumenti di programmazione open source per i chip AI di Huawei, secondo un post sul canale WeChat ufficiale di Deepseek, con Reuters che riporta l'open sourcing. Il pezzo centrale è TileLang, un linguaggio di programmazione open source per chip AI sviluppato originariamente da ricercatori della Peking University. Deepseek lo ha usato per circa un anno e ora lo descrive come il suo strumento principale per il lavoro sull'intelligenza artificiale generale, secondo The New York Times.
Il software include librerie per il calcolo e per spostare dati tra i chip. Secondo Deepseek, Huawei ha "pienamente supportato" il lavoro, e le due aziende hanno ottimizzato un supernode, un cluster di 128 chip Ascend 950. Deepseek sostiene che chiunque provi a costruire un ecosistema software indipendente per chip AI ha prima bisogno di un linguaggio universale facile da programmare ma capace di spremere comunque tutte le prestazioni dall'hardware, e dice che TileLang offre un modello di programmazione più semplice di CUDA.
Questo si collega a un argomento più ampio su dove risieda il vantaggio di Nvidia. La società di ricerca SemiAnalysis, dopo aver testato il chip di inferenza Jalapeno di OpenAI, ha definito il fossato CUDA "potenzialmente morto", perché OpenAI mette in funzione nuovi modelli sul proprio hardware così rapidamente, e ha detto che Jalapeno ha battuto Blackwell di Nvidia sulle prestazioni per watt nella maggior parte degli scenari testati. SemiAnalysis ha aggiunto le proprie avvertenze: i test coprivano scenari relativamente facili da ottimizzare, con circa 8.000 token di input e 1.000 token di output, e non ha ancora eseguito AgentX, il benchmark per attività agentiche a più passi. Ad agosto, SemiAnalysis aveva trovato Nvidia ben avanti su quel benchmark, e aveva detto che Nvidia sarebbe rimasta più economica per token di AMD anche se AMD avesse regalato il proprio hardware, perché il vantaggio sta nel software che collega molti chip in un unico sistema. I chip di Huawei non facevano parte del confronto AgentX.
C'è anche un punto di pressione interno. Huawei ammette di non riuscire a stare dietro alla domanda in patria, quindi prevede di vendere meno chip all'estero. Riferendosi ai controlli sulle esportazioni statunitensi, l'attuale presidente a rotazione di Huawei Eric Xu ha detto che l'azienda non può accettare un futuro che dipenda dalla volontà di altri di vendere chip alla Cina.
Cosa tenere d'occhio
Lo schema che attraversa questi rilasci è che i pesi aperti non sono più confinati ai checkpoint dei chatbot. Arrivano come encoder vocali abbastanza piccoli per un laptop, predittori tabellari pensati per le tabelle aziendali, harness di valutazione da un ente statale per la sicurezza, cicli di addestramento volontari che girano su piani gratuiti e ora strumenti di programmazione per uno stack di acceleratori non Nvidia.
Due cose restano irrisolte. Primo, le affermazioni sui benchmark per Phonon-2 e Kumo Tabular sono dichiarazioni del fornitore o dei manutentori in questo dossier, e nessuno dei tre rilasci di modelli ha una riproduzione indipendente allegata. Secondo, il quadro regolatorio si muove nella direzione opposta ai rilasci: l'indagine della FTC su Anthropic, OpenAI e Metr è la prima azione ufficiale di enforcement statunitense che tocca agenti AI fuori controllo, come ha riportato The Guardian il 30 settembre.
I pesi aperti non risolvono nulla di tutto questo. Spostano solo la discussione su hardware che più persone possono far girare.
Fonti
7- 01OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
- 04Coop: A small language model pretrained by volunteersEN
- 05Inspect: An open-source framework for large language model evaluationsEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.