Phonon-2, Coop e Kumo Tabular: la settimana dei modelli piccoli e aperti
Fermion Research ha pubblicato Phonon-2 il 30 settembre: un modello aperto di riconoscimento vocale in inglese che sta in un download da 164 MB e segna in media il 5,21 per cento di word error sui sette set inglesi della Open ASR Leaderboard. È arrivato in una settimana in cui a farla da padrone sono stati i rilasci di pesi aperti, non i lanci di frontiera.

Il punto è la dimensione. Fermion Research dice che l'encoder del modello memorizza ogni peso come uno di cinque livelli appresi a circa 2,1 bit, che i pesi escono con licenza CC-BY-4.0 e che lo stesso file gira su Mac, Linux, Windows e GPU NVIDIA. Su un MacBook Air, secondo l'azienda, un'ora di audio diventa testo in circa 20 secondi.
Altri due rilasci aperti sono arrivati lo stesso giorno. NVIDIA ha pubblicato Kumo Tabular su Hugging Face, un modello di base aperto per la previsione su dati tabellari. Un progetto di volontari chiamato Coop ha invece pubblicato un repository che descrive un piccolo modello linguistico preaddestrato senza server, senza finanziamenti e senza daemon.
Cosa dicono davvero i numeri
La rivendicazione principale di Phonon-2 è l'accuratezza per byte. Fermion dice che sui sette set inglesi della Open ASR Leaderboard il modello segna in media il 5,21 per cento di word error, e che ogni modello aperto con un punteggio migliore è almeno 5,8 volte più grande. Sul parlato parlamentare raggiunge il 100,8 per cento dell'accuratezza in parole del suo insegnante; sulle riunioni lo batte, da un download 15 volte più piccolo. Il termine di paragone è Parakeet TDT 0.6B v3 di NVIDIA, che Fermion indica come fonte della licenza per i propri pesi. L'azienda dice anche che Phonon-2 resta davanti a Parakeet Redux, descritto come l'altro modello a basso numero di bit della sua taglia, a ogni livello di rumore testato. Sono cifre del fornitore, pubblicate insieme al modello. Secondo il testo di Fermion, i percorsi veloci escono solo quando il word error resta entro il rumore del percorso esatto.
Il modello tabellare di NVIDIA fa un compromesso diverso. Kumo Tabular predice le etichette per nuove righe in un solo passaggio in avanti, senza addestramento, senza messa a punto e senza feature engineering, per classificazione e regressione. È stato preaddestrato solo su dati artificiali, esce in tre taglie da 28M a 215M parametri ed è rilasciato con licenza OpenMDW-1.1 per uso commerciale, dice l'azienda. NVIDIA rivendica il primo posto su quattro benchmark: TabArena, BeyondArena, TALENT e ScoringBench.
Un ciclo di addestramento senza proprietario
Coop è il più strano dei tre. La sua pagina GitHub descrive pseudo-gradienti che arrivano come pull request su Hugging Face, aggregati da un cron job stateless di GitHub Actions che usa DiLoCo. Pesi e stato dell'ottimizzatore vivono solo su Hugging Face. Il lavoro lo fanno hardware di consumo donato e piani gratuiti. La fase 2 è un modello da circa 145M parametri preaddestrato da zero su FineWeb-Edu; la fase 1, un modello da 15M su TinyStories, ha finito oltre il suo budget ottimale secondo Chinchilla, dice il repository.
Il progetto sostiene che più volontari su macchine diverse, Apple Silicon e CPU normali, hanno addestrato lo stesso passo esterno e sono stati mediati in un unico aggiornamento. Documenta anche la gestione dei guasti: una sottomissione che ha corso contro un tick è stata accettata un passo dopo con peso di staleness ridotto, i round ripetuti di un utente sono stati uniti in un solo voto, e un round a metà è stato svuotato invece che scartato. Niente di tutto questo è lavoro di frontiera. È proprio il punto. Lo stesso giorno, il UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework aperto per le valutazioni di frontiera con più di 200 valutazioni predefinite e il supporto a oltre 20 fornitori di modelli, più il sandboxing in Docker, Kubernetes e Modal.
Altrove la linea tra aperto e chiuso si discute in pubblico. Il 30 settembre The Register ha riferito che OpenAI ha accusato individui legati a Moonshot AI, in Cina, di un attacco di distillazione iniziato il 1 luglio, con picchi di alto volume il 24 e 25 luglio composti da 16.000 richieste da oltre 4.000 utenti. OpenAI ha detto di aver interrotto la campagna il 28 luglio. Moonshot non ha risposto subito alla richiesta di commento di The Register. Lo stesso giorno, The Decoder ha riferito che DeepSeek ha rilasciato strumenti di programmazione open source per i chip Ascend di Huawei, incentrati su TileLang, un linguaggio open source sviluppato originariamente da ricercatori della Peking University. Reuters, citata in quel resoconto, ha messo il rilascio accanto a librerie per il calcolo e il movimento dei dati tra chip. DeepSeek ha detto che Huawei ha sostenuto pienamente il lavoro, e i due hanno ottimizzato un supernodo di 128 chip Ascend 950. Le autorità si muovono nello stesso momento. Il 30 settembre The Guardian ha riferito che la FTC ha aperto un'indagine su tutto il settore su Anthropic e OpenAI, con richieste formali di informazioni e testimonianze. È la prima azione ufficiale di enforcement negli Stati Uniti che tocca agenti AI fuori controllo. CNBC ha confermato l'indagine e ha detto che la FTC ha rifiutato di indicare altre aziende sotto indagine.
I rilasci aperti di cui sopra non hanno a che fare con quel caso. Condividono però una premessa: che la capacità, o almeno la capacità utile, si stia spostando verso pesi che chiunque può scaricare. Le prove di questa settimana sono modelli piccoli con compiti ristretti, un ciclo di addestramento volontario e una tabella di benchmark di un fornitore. Se tutto questo faccia una svolta è una domanda a cui risponderanno i prossimi cicli di rilascio.
Fonti
14- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giantsEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09OpenAI delays IPO over AI safety concernsEN
- 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
- 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.