Phonon-2, Coop et Kumo Tabular : la semaine des petits modèles ouverts
Fermion Research a publié Phonon-2 le 30 septembre. Ce modèle ouvert de reconnaissance de la parole en anglais tient dans un téléchargement de 164 Mo et affiche 5,21 % d'erreur de mot en moyenne sur les sept ensembles anglais du Open ASR Leaderboard. Il sort une semaine où ce sont les publications de poids ouverts, et non les lancements de pointe, qui ont fait parler.

L'argument, c'est la taille. Fermion Research indique que l'encodeur stocke chaque poids sur l'un de cinq niveaux appris, à environ 2,1 bits. Les poids sont diffusés sous licence CC-BY-4.0 et le même fichier tourne sur Mac, Linux, Windows et GPU NVIDIA. Sur un MacBook Air, affirme l'entreprise, une heure d'audio devient du texte en une vingtaine de secondes.
Deux autres publications ouvertes sont arrivées le même jour. NVIDIA a mis en ligne Kumo Tabular, un modèle de fondation ouvert pour la prédiction tabulaire, sur Hugging Face. Un projet bénévole baptisé Coop a publié de son côté un dépôt décrivant un petit modèle de langue préentraîné sans serveur, sans financement et sans démon.
Ce que disent vraiment les chiffres
L'argument principal de Phonon-2, c'est la précision par octet. Fermion affirme que sur les sept ensembles anglais du Open ASR Leaderboard, le modèle atteint en moyenne 5,21 % d'erreur de mot, et que tout modèle ouvert faisant mieux est au moins 5,8 fois plus gros. Sur la parole parlementaire, il atteint 100,8 % de la précision en mots de son enseignant et il dépasse cet enseignant sur les réunions, à partir d'un téléchargement 15 fois plus petit, selon l'entreprise. Le point de comparaison est Parakeet TDT 0.6B v3 de NVIDIA, que Fermion désigne comme la source de licence de ses propres poids. L'entreprise indique aussi que Phonon-2 reste devant Parakeet Redux, présenté comme l'autre modèle à faible nombre de bits de sa taille, à chaque niveau de bruit testé. Ce sont des chiffres de fournisseur, publiés avec le modèle. Selon la note de Fermion, les chemins rapides ne sont livrés que lorsque l'erreur de mot reste dans le bruit du chemin exact.
Le modèle tabulaire de NVIDIA fait un autre compromis. Kumo Tabular prédit les étiquettes de nouvelles lignes en une seule passe avant, sans entraînement, sans réglage et sans ingénierie des variables, pour la classification et la régression. Il a été préentraîné uniquement sur des données artificielles et existe en trois tailles, de 28M à 215M de paramètres. Il sort sous licence OpenMDW-1.1 pour un usage commercial, selon l'entreprise. NVIDIA revendique la première place sur quatre références : TabArena, BeyondArena, TALENT et ScoringBench.
Une boucle d'entraînement sans propriétaire
Coop est le plus étrange des trois. Sa page GitHub décrit des pseudo-gradients qui arrivent sous forme de pull requests Hugging Face, agrégés par une tâche cron GitHub Actions sans état via DiLoCo. Les poids et l'état de l'optimiseur ne vivent que sur Hugging Face. Du matériel grand public donné et des offres gratuites font le travail. L'étape 2 est un modèle d'environ 145M de paramètres préentraîné de zéro sur FineWeb-Edu. L'étape 1, un modèle de 15M sur TinyStories, s'est terminée au-delà de son budget optimal de Chinchilla, indique le dépôt.
Le projet affirme que plusieurs bénévoles, sur des machines différentes, Apple Silicon et simple CPU, ont entraîné la même étape externe et que le résultat a été moyenné en une seule mise à jour. Il documente aussi la gestion des échecs : une soumission qui a couru contre un tick a été acceptée une étape plus tard avec un poids d'obsolescence réduit, les tours répétés d'un même utilisateur ont fusionné en un seul vote, et un tour à moitié terminé a été vidé plutôt que jeté. Rien de tout cela n'est du travail de pointe. C'est justement l'idée. Le même jour, le UK AI Security Institute et Meridian Labs ont publié Inspect, un cadre ouvert pour les évaluations de pointe avec plus de 200 évaluations prêtes à l'emploi et la prise en charge de plus de 20 fournisseurs de modèles, plus un bac à sable dans Docker, Kubernetes et Modal.
Ailleurs, la ligne entre ouvert et fermé se discute en public. The Register a rapporté le 30 septembre qu'OpenAI accusait des individus liés à Moonshot AI, en Chine, d'une attaque par distillation commencée le 1er juillet. Les pics de volume des 24 et 25 juillet représentaient 16 000 requêtes provenant de plus de 4 000 utilisateurs. OpenAI dit avoir interrompu la campagne le 28 juillet. Moonshot n'a pas répondu immédiatement à la demande de commentaire de The Register. Le même jour, The Decoder a rapporté que DeepSeek avait publié des outils de programmation open source pour les puces Ascend de Huawei, autour de TileLang, un langage open source développé à l'origine par des chercheurs de l'université de Pékin. Reuters, cité dans ce rapport, situe cette publication aux côtés de bibliothèques de calcul et de mouvement de données entre puces. DeepSeek a déclaré que Huawei soutenait pleinement le travail, et les deux ont optimisé un supernœud de 128 puces Ascend 950. Les régulateurs avancent en même temps. The Guardian a rapporté le 30 septembre que la FTC a ouvert une enquête à l'échelle du secteur sur Anthropic et OpenAI, avec des demandes formelles d'information et de témoignage. C'est la première action d'application officielle aux États-Unis touchant des agents d'IA incontrôlés. CNBC a confirmé l'enquête et indiqué que la FTC refusait de nommer les autres entreprises visées.
Les publications ouvertes ci-dessus n'ont aucun lien avec cette affaire. Mais elles partagent une prémisse : la capacité, ou du moins la capacité utile, glisse vers des poids que tout le monde peut télécharger. Les preuves de cette semaine, ce sont de petits modèles aux tâches étroites, une boucle d'entraînement bénévole et un tableau de références de fournisseur. Reste à savoir si tout cela fait un basculement : les prochains cycles de publication répondront à la question.
Sources
14- 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 03Coop: A small language model pretrained by volunteersEN
- 04Inspect: An open-source framework for large language model evaluationsEN
- 05Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giantsEN
- 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
- 09OpenAI delays IPO over AI safety concernsEN
- 10OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN
- 11"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
- 12"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
- 13OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
- 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.