I pesi aperti continuano ad arrivare: Inspect, Phonon-2, Kumo Tabular e un modello da 145M firmato dai volontari
Il 30 settembre lo UK AI Security Institute e Meridian Labs hanno pubblicato Inspect, un framework open source con oltre 200 valutazioni già pronte. È l'ultimo di una serie di rilasci aperti che comprende anche Phonon-2 di Fermion Research e Kumo Tabular di Nvidia.

Il rilascio è arrivato alle 15:20 UTC del 30 settembre, stando al sito del progetto. Inspect è un framework per le valutazioni di frontiera sull'IA, costruito dallo UK AI Security Institute e da Meridian Labs. Il punto di forza è l'ampiezza: coding, compiti agentici, ragionamento, conoscenza, comportamento e comprensione multi-modale, tutto in un unico strumento.
Il framework mette insieme dataset, agenti, strumenti e scorer componibili, più una libreria di oltre 200 valutazioni già pronte. C'è Inspect View, uno strumento web, e un'estensione per VS Code. Il sandboxing esegue il codice dei modelli non attendibili in Docker, Kubernetes, Modal, Proxmox o Vagrant tramite un'API di estensione. Il progetto dichiara il supporto a più di 20 fornitori di modelli, inclusa l'inferenza locale con HuggingFace, vLLM e SGLang.
Gli strumenti di valutazione sono la metà meno appariscente dei pesi aperti. I pesi senza un modo per misurarli restano solo file.
Un modello vocale da 164 MB e un modello tabellare che non richiede addestramento
Fermion Research ha rilasciato Phonon-2 il 30 settembre e lo ha definito il modello di riconoscimento vocale aperto più accurato sotto i 900 MB. Il download pesa 164 MB. L'azienda dichiara una media del 5,21 per cento di word error sui sette set inglesi della Open ASR Leaderboard. Ogni modello aperto con un punteggio migliore, sostiene, ha una dimensione almeno 5,8 volte superiore.
L'encoder memorizza ogni peso come uno di cinque livelli appresi, circa 2,1 bit, impacchettati come cifre in base 3, cinque per byte. I pesi sono sotto CC-BY-4.0, la licenza di Parakeet TDT 0.6B v3 di Nvidia, da cui derivano. Fermion sostiene che un'ora di audio diventa testo in circa 20 secondi su un MacBook Air. Su una H100, in batch da 128, servono 13 secondi per ogni giorno di audio.
Il contributo di Nvidia è un altro tipo di compressione. Kumo Tabular, pubblicato su Hugging Face il 29 settembre, predice le etichette da una tabella etichettata in un singolo forward pass, senza addestramento, senza messa a punto e senza feature engineering, per classificazione e regressione. Esiste in tre dimensioni, da 28M a 215M parametri, è stato preaddestrato solo su dati artificiali ed è rilasciato sotto licenza OpenMDW-1.1 per uso commerciale. Nvidia dichiara che è primo su TabArena, BeyondArena, TALENT e ScoringBench.
Volontari, Rust e un modello da 145M addestrato sui cron job
Anche le iniziative più piccole vanno avanti. Coop, un progetto su GitHub aggiornato il 30 settembre, sta preaddestrando un transformer decoder-only da circa 145M parametri su FineWeb-Edu, usando hardware di consumo donato e i piani gratuiti di Hugging Face e GitHub Actions. Gli pseudo-gradienti arrivano come pull request su un repo pubblico di dataset. Un cron stateless di GitHub Actions li aggrega con uno step esterno in stile DiLoCo ogni cinque minuti, in teoria. Il progetto però nota che lo scheduler di GitHub scatta da qualche minuto a qualche ora di distanza. Lo stage 1, un modello da 15M su TinyStories, ha superato il suo budget ottimale secondo Chinchilla in sei giorni e ha portato la validation loss da 9,01 a 2,8.
Sempre il 30 settembre è stato aggiornato un progetto Rust chiamato PSSA. Descrive un'architettura non transformer con una ricorrenza a spazio di stato selettiva, una banca di memoria episodica e aggiornamenti dei pesi per token. L'autore sostiene che impara più velocemente di un transformer a parità di parametri e che genera circa dodici volte più rapidamente sulla stessa CPU. Nel repository non c'è alcun benchmark indipendente.
I rilasci aperti della settimana si collocano in uno scenario normativo più duro. Il Guardian ha riferito il 30 settembre che la FTC ha aperto un'indagine su tutto il settore che coinvolge Anthropic, OpenAI e altri. È la prima azione ufficiale di enforcement negli Stati Uniti che tocca agenti IA fuori controllo. Ars Technica ha riferito lo stesso giorno che OpenAI sta rinviando la sua IPO per preoccupazioni sulla sicurezza. I pesi aperti non sono oggetto di nessuna delle due azioni, ma il controllo dà il tono a tutto ciò che viene rilasciato insieme a loro.
Fonti
7- 01Inspect: An open-source framework for large language model evaluationsEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 04Coop: A small language model pretrained by volunteersEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.