Des poids ouverts et compacts : Phonon-2, Kumo Tabular et un modèle entraîné par des bénévoles
Fermion Research a publié Phonon-2 le 30 septembre, un modèle ouvert de reconnaissance vocale qui tient dans un téléchargement de 164 Mo et affiche 5,21 % d'erreur de mot en moyenne sur sept ensembles anglais du Open ASR Leaderboard. Quelques heures plus tard, Kumo Tabular de Nvidia et un modèle de langue de 145M de paramètres entraîné par des bénévoles sont arrivés à leur tour.

Trois sorties de poids ouverts sont arrivées en une seule journée, et aucune n'a couru après l'échelle. Fermion Research a publié Phonon-2 le 30 septembre, un modèle de reconnaissance vocale anglaise qui stocke chaque poids d'encodeur sur l'un de cinq niveaux appris, à environ 2,1 bits, dans un fichier de 164 Mo. L'entreprise affirme qu'il égale son modèle enseignant en pleine précision de 2,5 Go, ensemble par ensemble, qu'il le dépasse sur les réunions et les discours parlementaires, et qu'il transcrit une heure d'audio en environ 20 secondes sur un MacBook Air. Les poids sont sur Hugging Face sous licence CC-BY-4.0, celle du Parakeet TDT 0.6B v3 de Nvidia, dont ils dérivent.
Ce dernier détail compte. La course aux petits modèles ouverts est en grande partie une course d'enseignants et de licences.
Fermion affirme que tout modèle ouvert qui obtient un meilleur score sur les sept ensembles anglais du Open ASR Leaderboard fait au moins 5,8 fois sa taille, et que cet avantage tient dans le bruit, devant Parakeet Redux, l'autre modèle de faible précision de sa taille. Les chiffres de vitesse viennent avec des conditions : un extrait à la fois, log-mel inclus, chargement du modèle exclu. Et chaque voie rapide n'est livrée que si son taux d'erreur de mot reste dans le bruit de la voie exacte, selon un bootstrap apparié sur les extraits avec 4 000 rééchantillonnages.
Kumo Tabular s'attaque au cycle de vie des modèles d'arbres
Nvidia a publié Kumo Tabular le 29 septembre, un modèle de fondation ouvert pour la classification et la régression tabulaires qui prédit de nouvelles lignes en une seule passe avant, sans entraînement, réglage ni ingénierie de variables. Il existe en trois tailles, de 28M à 215M de paramètres, est publié sous licence OpenMDW-1.1 pour un usage commercial, et se classe premier sur quatre benchmarks : TabArena, BeyondArena, TALENT et ScoringBench, selon le billet Hugging Face.
L'architecture emprunte à TabICL et TabPFN, avec de l'attention sur les colonnes, les lignes et le contexte. L'entreprise indique qu'il a été pré-entraîné uniquement sur des données artificielles, ce qui contourne le problème de confidentialité lié à l'entraînement sur des tables clients. Savoir s'il détrône les arbres à gradient boosting en production est une autre question que son classement dans les benchmarks, et le billet de Nvidia n'y répond pas.
Un modèle de langue entraîné sur GitHub Actions et du matériel donné
Le projet Coop, un dépôt GitHub mis en ligne le 30 septembre, tente quelque chose de plus étrange : pré-entraîner un petit modèle de langue sans serveurs et sans financement. L'étape 2 est un transformeur décodeur seul d'environ 145M de paramètres, entraîné de zéro sur FineWeb-Edu. Les participants téléchargent un point de contrôle depuis Hugging Face, exécutent des pas AdamW locaux sur un fragment personnel de données, et soumettent un pseudo-gradient sous forme de pull request contre un dépôt de jeu de données public. Une tâche cron GitHub Actions sans état, planifiée toutes les cinq minutes, agrège les soumissions par moyenne tronquée ou médiane géométrique et effectue un pas externe de Nesterov.
L'étape 1 en est la preuve : un modèle de 15M de paramètres entraîné au-delà de son budget optimal selon Chinchilla par des bénévoles en six jours, avec une perte de validation passée de 9,01 à 2,8. Les poids restent disponibles. La documentation du projet est d'une franchise rare sur l'évaluation : elle note qu'un chiffre unique de perte de validation ne dit rien, car les pas externes le font monter aussi souvent que descendre, et que la direction est une propriété de la série, pas d'un point.
Deux autres sorties ouvertes complètent la fenêtre. L'UK AI Security Institute et Meridian Labs ont publié Inspect, un cadre d'évaluation avec plus de 200 évaluations prêtes à l'emploi et un bac à sable pour le code de modèle non fiable dans Docker, Kubernetes et Modal. Et Sparticle62ops a publié PSSA, un modèle de langue non transformeur écrit en Rust sans framework de ML en dessous, qui apprendrait plus vite qu'un transformeur à paramètres égaux et générerait du texte environ douze fois plus rapidement sur le même CPU.
Les poids ouverts ne racontent pas tout. Le 30 septembre également, la FTC a ouvert une enquête à l'échelle du secteur sur Anthropic, OpenAI et le groupe de recherche Metr, la première action d'application officielle aux États-Unis sur des agents d'IA incontrôlés, comme l'a rapporté The Guardian. OpenAI, de son côté, repousse son IPO et retient la sortie d'un modèle pour des raisons de sécurité, selon Ars Technica. Le contraste saute aux yeux : les modèles qui sortent sans friction sont les petits, et les entreprises sous examen sont celles aux plus grosses valorisations.
Sources
7- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05PSSA: A non-transformer language model written from scratch in RustEN
- 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 07OpenAI delays IPO over AI safety concernsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.