I pesi aperti diventano compatti: arrivano Phonon-2, Kumo Tabular e un modello addestrato da volontari
Fermion Research ha pubblicato Phonon-2 il 30 settembre, un modello aperto di riconoscimento vocale che sta in un download da 164 MB e registra in media il 5,21% di word error su sette set inglesi nella Open ASR Leaderboard. Nel giro di poche ore sono arrivati insieme Kumo Tabular di Nvidia e un modello linguistico da 145M parametri addestrato da volontari.

Tre rilasci a pesi aperti sono arrivati nello stesso giorno, e nessuno inseguiva la scala. Fermion Research ha pubblicato Phonon-2 il 30 settembre: un modello di riconoscimento vocale per l'inglese che memorizza ogni peso dell'encoder come uno di cinque livelli appresi a circa 2,1 bit, dentro un file da 164 MB. L'azienda sostiene che eguaglia set per set il suo insegnante a piena precisione da 2,5 GB e che lo batte su riunioni e discorsi parlamentari. Su un MacBook Air trascrive un'ora di audio in circa 20 secondi. I pesi sono su Hugging Face con licenza CC-BY-4.0, la stessa del Parakeet TDT 0.6B v3 di Nvidia, da cui derivano.
Quest'ultimo dettaglio conta. La corsa ai piccoli modelli aperti è in gran parte una corsa tra insegnanti e licenze.
Fermion afferma che ogni modello aperto con punteggi migliori sui sette set inglesi della Open ASR Leaderboard ha almeno 5,8 volte le sue dimensioni. Il vantaggio regge anche in presenza di rumore, restando davanti a Parakeet Redux, l'altro modello a basso numero di bit della sua taglia. I dati sulla velocità hanno condizioni precise: una clip alla volta, log-mel incluso, caricamento del modello escluso. Ogni percorso veloce viene distribuito solo se il suo word error resta entro il rumore del percorso esatto, in un bootstrap appaiato sui clip con 4.000 ricampionamenti.
Kumo Tabular attacca il ciclo di vita dei modelli ad albero
Nvidia ha pubblicato Kumo Tabular il 29 settembre, un modello fondazionale aperto per la classificazione e la regressione su dati tabellari. Predice nuove righe in un singolo passaggio in avanti, senza addestramento, messa a punto o ingegneria delle feature. Esiste in tre dimensioni da 28M a 215M parametri ed è distribuito con licenza OpenMDW-1.1 per uso commerciale. Secondo il post su Hugging Face è primo su quattro benchmark: TabArena, BeyondArena, TALENT e ScoringBench.
L'architettura riprende da TabICL e TabPFN, con attenzione per colonne, righe e contesto. L'azienda afferma che è stato preaddestrato solo su dati artificiali, il che aggira il problema della privacy legato all'addestramento su tabelle dei clienti. Se poi scalzerà gli alberi potenziati dal gradiente in produzione è una domanda separata dalla posizione nei benchmark, e il post di Nvidia non risponde.
Un modello linguistico addestrato su GitHub Actions e hardware donato
Il progetto Coop, un repository GitHub aperto il 30 settembre, tenta qualcosa di più strano: preaddestrare un piccolo modello linguistico senza server e senza finanziamenti. La fase 2 è un transformer decoder-only da circa 145M parametri addestrato da zero su FineWeb-Edu. I worker scaricano un checkpoint da Hugging Face, eseguono passi AdamW locali su una shard di dati personale, e inviano uno pseudo-gradiente come pull request su un repository pubblico di dataset. Un cron job stateless di GitHub Actions, pianificato ogni cinque minuti, aggrega le sottomissioni con una media trimmed o una mediana geometrica e compie un passo esterno di Nesterov.
La fase 1 è la prova: un modello da 15M parametri addestrato oltre il suo budget ottimale di Chinchilla da volontari in sei giorni, con la loss di validazione scesa da 9,01 a 2,8. I pesi restano disponibili. La documentazione del progetto è insolitamente schietta sulla valutazione: osserva che un singolo valore di loss di validazione non dice nulla, perché i passi esterni lo spostano verso l'alto tanto spesso quanto verso il basso, e che la direzione è una proprietà della serie, non di un punto.
Altri due rilasci aperti hanno completato la finestra. Il UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework di valutazione con oltre 200 valutazioni predefinite e sandboxing per codice di modello non fidato in Docker, Kubernetes e Modal. E Sparticle62ops ha pubblicato PSSA, un modello linguistico non transformer scritto in Rust senza alcun framework di ML sotto. Secondo l'azienda impara più velocemente di un transformer a parità di parametri e genera testo circa dodici volte più rapidamente sulla stessa CPU.
I pesi aperti non sono tutta la storia. Sempre il 30 settembre, la FTC ha aperto un'indagine su tutto il settore che coinvolge Anthropic, OpenAI e il gruppo di ricerca Metr, la prima azione ufficiale di enforcement negli Stati Uniti sugli agenti IA fuori controllo, come ha riportato The Guardian. OpenAI, intanto, rinvia la sua IPO e trattiene il rilascio di un modello per preoccupazioni sulla sicurezza, secondo Ars Technica. Il contrasto è difficile da non notare: i modelli che arrivano senza attriti sono quelli piccoli, e le aziende sotto esame sono quelle con le valutazioni più alte.
Fonti
7- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.