Poids ouverts : un modèle vocal de 164 Mo, un entraînement bénévole de 145M de paramètres et l'alternative chinoise à CUDA
Nvidia a mis en ligne Kumo Tabular, un modèle de fondation ouvert pour la prédiction tabulaire, dans un billet Hugging Face daté du 29 septembre. Le lendemain, Fermion Research a publié Phonon-2, un modèle vocal de 164 Mo. Ces sorties tombent au moment où la FTC ouvre une enquête sur l'ensemble du secteur des laboratoires d'IA et où OpenAI retient son introduction en bourse.

Nvidia a déposé Kumo Tabular sur Hugging Face le 29 septembre. Le billet, daté du 29 septembre et publié sur le blog le 30 septembre, indique que le modèle prédit les étiquettes de nouvelles lignes en une seule passe avant, sans entraînement, sans réglage et sans ingénierie des variables. Il existe en trois tailles, de 28M à 215M de paramètres, a été préentraîné uniquement sur des données artificielles et sort sous licence OpenMDW-1.1 pour un usage commercial. L'entreprise affirme qu'il occupe la première place sur TabArena, BeyondArena, TALENT et ScoringBench.
La revendication est étroite, et Nvidia la présente comme telle : classification et régression tabulaires, ces tableaux qui contiennent des fiches clients, des transactions et des relevés de capteurs. Le principe est l'apprentissage en contexte appliqué à des lignes plutôt qu'à du texte. Un modèle préentraîné sur des millions de tableaux lit un tableau étiqueté comme contexte et renvoie des probabilités de classe, ou 999 quantiles en régression. On en tire une prédiction ponctuelle et une estimation d'incertitude.
Fermion Research a publié Phonon-2 le 30 septembre, en le présentant comme le modèle ouvert de reconnaissance vocale le plus précis en dessous de 900 Mo.
Le téléchargement pèse 164 Mo, l'encodeur stocke chaque poids sur environ 2,1 bits, et les poids sont sous CC-BY-4.0, la licence de Parakeet TDT 0.6B v3 de Nvidia, dont ils dérivent. Fermion annonce 5,21 % de taux d'erreur moyen sur les mots pour les sept ensembles anglais du Open ASR Leaderboard, et affirme que tout modèle ouvert mieux classé est au moins 5,8 fois plus gros. Sur un MacBook Air, il transforme une heure d'audio en texte en une vingtaine de secondes. Ce sont des chiffres fournis par un vendeur sur sa propre page : la position au classement doit donc être prise comme une affirmation, pas comme un résultat confirmé par un tiers.
Des bénévoles et une tâche cron sans état
Toujours le 30 septembre, un projet GitHub nommé Coop a démarré une phase 2 : un transformeur décodeur seul d'environ 145M de paramètres, préentraîné de zéro sur FineWeb-Edu. Tout tourne sur du matériel grand public donné, complété par les offres gratuites de Hugging Face et de GitHub Actions. Pas de serveur, pas de démon. Les participants téléchargent un point de contrôle, exécutent localement des étapes AdamW sur un fragment de données personnel, puis soumettent un pseudo-gradient sous forme de pull request vers un dépôt de jeu de données public.
Une tâche cron GitHub Actions sans état agrège à chaque cycle. Elle écarte les soumissions trop anciennes, écrête et pondère les autres par un cosinus, les agrège, effectue une étape externe de Nesterov et téléverse un nouveau point de contrôle. Le dépôt affirme qu'un modèle de phase 1 de 15M de paramètres a été préentraîné au-delà de son budget optimal selon Chinchilla sur TinyStories en six jours, la perte de validation passant de 9,01 à 2,8. C'est une preuve de mécanisme, pas un modèle compétitif.
L'effort chinois constitue l'enjeu stratégique plus large. Deepseek a publié des outils de programmation open source pour les puces Ascend de Huawei, selon un billet sur son canal WeChat rapporté par The Decoder le 30 septembre et par Reuters. La pièce maîtresse est TileLang, un langage open source développé à l'origine à l'Université de Pékin, qui selon Deepseek offre un modèle de programmation plus simple que CUDA. Huawei a « pleinement soutenu » ce travail, a déclaré Deepseek, et les deux ont optimisé un supernœud de 128 puces Ascend 950.
Le contexte, c'est la forteresse des développeurs de Nvidia : environ quatre millions de développeurs CUDA. The Decoder cite aussi SemiAnalysis, qui a testé la puce d'inférence Jalapeno d'OpenAI et a qualifié la forteresse CUDA de « potentiellement morte ». SemiAnalysis précise toutefois que les tests ne portaient que sur des scénarios relativement simples, d'environ 8 000 jetons en entrée et 1 000 en sortie. Les puces de Huawei ne faisaient pas partie de cette comparaison.
Les régulateurs bougent pendant que les poids circulent
Rien de tout cela ne se passe dans le vide. The Guardian a rapporté le 30 septembre que la FTC mène une enquête sur l'ensemble du secteur visant Anthropic, OpenAI et d'autres laboratoires, avec l'intention de contraindre des dirigeants à témoigner, notamment chez Metr. Le New York Post a révélé l'affaire en premier. OpenAI, de son côté, retient sa propre cotation : Ars Technica a rapporté le 30 septembre que Sam Altman n'entrera en bourse que lorsque l'entreprise pourra « prendre des décisions de sécurité en confiance », et que LASST a déposé une plainte en Californie le jour même.
Les publications de poids ouverts évoquées plus haut sont petites, bon marché et précises. C'est cette tendance qu'il faut suivre, pas les tableaux de benchmarks.
Sources
6- 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03Coop: A small language model pretrained by volunteersEN
- 04China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 05US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 06OpenAI delays IPO over AI safety concernsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.