I pesi aperti continuano ad arrivare: un modello vocale da 164 MB, una run da 145M volontari e l'alternativa cinese a CUDA
Nvidia ha pubblicato Kumo Tabular, un modello fondativo aperto per la previsione su dati tabellari, in un post su Hugging Face datato 29 settembre. Il giorno dopo Fermion Research ha rilasciato Phonon-2, un modello vocale da 164 MB. Le due uscite arrivano mentre la FTC apre un'indagine su tutto il settore dei laboratori di intelligenza artificiale e OpenAI rinvia la propria IPO.

Nvidia ha messo Kumo Tabular su Hugging Face il 29 settembre. Il post, datato 29 settembre e pubblicato sul blog il 30 settembre, spiega che il modello prevede le etichette per nuove righe in un solo passaggio in avanti, senza addestramento, senza messa a punto e senza ingegneria delle feature. Esiste in tre dimensioni, da 28M a 215M parametri, è stato preaddestrato solo su dati artificiali e arriva con licenza OpenMDW-1.1 per uso commerciale. L'azienda sostiene che sia primo su TabArena, BeyondArena, TALENT e ScoringBench.
La rivendicazione è circoscritta, e Nvidia la inquadra allo stesso modo: classificazione e regressione su dati tabellari, le tabelle che contengono anagrafiche dei clienti, transazioni e registri dei sensori. L'idea è applicare l'apprendimento in contesto alle righe invece che al testo. Un modello preaddestrato su milioni di tabelle legge una tabella etichettata come contesto e restituisce probabilità di classe oppure 999 quantili per la regressione. Da lì si ricavano una previsione puntuale e una stima dell'incertezza.
Fermion Research ha rilasciato Phonon-2 il 30 settembre, definendolo il modello aperto di riconoscimento vocale più accurato sotto i 900 MB.
Il download è di 164 MB, l'encoder memorizza ogni peso in circa 2,1 bit e i pesi sono sotto CC-BY-4.0, la licenza di Parakeet TDT 0.6B v3 di Nvidia, da cui derivano. Fermion dichiara un tasso medio di errore sulle parole del 5,21 % sui sette insiemi inglesi della Open ASR Leaderboard, e afferma che ogni modello aperto con un punteggio migliore è almeno 5,8 volte più grande. Su un MacBook Air trasforma un'ora di audio in testo in circa 20 secondi. Sono numeri dichiarati dall'azienda su una pagina aziendale, quindi la posizione in classifica va presa come annunciata, non confermata in modo indipendente.
Volontari e un cron job senza stato
Sempre il 30 settembre, un progetto su GitHub chiamato Coop è partito con una run di fase 2: un transformer di circa 145M di parametri, solo decoder, preaddestrato da zero su FineWeb-Edu, eseguito interamente su hardware di consumo donato più i piani gratuiti di Hugging Face e GitHub Actions. Non c'è nessun server e nessun demone. I worker scaricano un checkpoint, eseguono passi AdamW in locale su una porzione personale di dati e inviano uno pseudo-gradiente come pull request su un repository pubblico di dataset.
Un cron job senza stato di GitHub Actions aggrega a ogni tick: scarta le sottomissioni troppo vecchie, taglia e applica un gate coseno alle restanti, le aggrega, compie un passo esterno di Nesterov e carica un nuovo checkpoint. Il repository sostiene che un modello di fase 1 da 15M di parametri è stato preaddestrato oltre il suo budget ottimale secondo Chinchilla su TinyStories in sei giorni, con la loss di validazione scesa da 9,01 a 2,8. È una prova di funzionamento, non un modello competitivo.
La spinta della Cina è la storia strategica più grande. Deepseek ha rilasciato strumenti di programmazione open source per i chip Ascend di Huawei, secondo un post sul suo canale WeChat ripreso da The Decoder il 30 settembre e da Reuters. Il pezzo centrale è TileLang, un linguaggio open source sviluppato originariamente all'Università di Pechino, che secondo Deepseek offre un modello di programmazione più semplice di CUDA. Huawei ha "pienamente sostenuto" il lavoro, ha detto Deepseek, e i due hanno ottimizzato un supernodo di 128 chip Ascend 950.
Il contesto è il fossato di Nvidia sugli sviluppatori: circa quattro milioni di sviluppatori CUDA. The Decoder cita anche SemiAnalysis, che ha testato il chip di inferenza Jalapeno di OpenAI e ha definito il fossato CUDA "potenzialmente morto". SemiAnalysis avverte però che ha testato solo scenari relativamente facili, con circa 8.000 token in ingresso e 1.000 in uscita. I chip di Huawei non facevano parte di quel confronto.
I regolatori si muovono mentre i pesi vengono distribuiti
Niente di tutto questo accade nel vuoto. Il Guardian ha riferito il 30 settembre che la FTC sta conducendo un'indagine su tutto il settore che riguarda Anthropic, OpenAI e altri laboratori, con l'intenzione di obbligare a testimoniare dirigenti, anche di Metr. Il New York Post l'aveva riportato per primo. OpenAI, intanto, rinvia la propria quotazione: Ars Technica ha riferito il 30 settembre che Sam Altman non arriverà in borsa finché l'azienda non sarà in grado di "prendere decisioni di sicurezza con fiducia", e che lo stesso giorno LASST ha presentato una causa in California.
I rilasci a pesi aperti descritti sopra sono piccoli, economici e specifici. È questo lo schema da tenere d'occhio, non le tabelle dei benchmark.
Fonti
6- 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Coop: A small language model pretrained by volunteersEN
- 04China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 05US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 06OpenAI delays IPO over AI safety concernsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.