Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Des poids ouverts et compacts : Phonon-2, Kumo Tabular et un modèle entraîné par des bénévoles

Fermion Research a publié Phonon-2 le 30 septembre, un modèle ouvert de reconnaissance vocale qui tient dans un téléchargement de 164 Mo et affiche 5,21 % d'erreur de mot en moyenne sur sept ensembles anglais du Open ASR Leaderboard. Quelques heures plus tard, Kumo Tabular de Nvidia et un modèle de langue de 145M de paramètres entraîné par des bénévoles sont arrivés à leur tour.

IA & modèlesActualitéSophie LeclercPublié le: 30 septembre 20263 min de lectureSources 7
Des poids ouverts et compacts : Phonon-2, Kumo Tabular et un modèle entraîné par des bénévoles

Trois sorties de poids ouverts sont arrivées en une seule journée, et aucune n'a couru après l'échelle. Fermion Research a publié Phonon-2 le 30 septembre, un modèle de reconnaissance vocale anglaise qui stocke chaque poids d'encodeur sur l'un de cinq niveaux appris, à environ 2,1 bits, dans un fichier de 164 Mo. L'entreprise affirme qu'il égale son modèle enseignant en pleine précision de 2,5 Go, ensemble par ensemble, qu'il le dépasse sur les réunions et les discours parlementaires, et qu'il transcrit une heure d'audio en environ 20 secondes sur un MacBook Air. Les poids sont sur Hugging Face sous licence CC-BY-4.0, celle du Parakeet TDT 0.6B v3 de Nvidia, dont ils dérivent.

Ce dernier détail compte. La course aux petits modèles ouverts est en grande partie une course d'enseignants et de licences.

Fermion affirme que tout modèle ouvert qui obtient un meilleur score sur les sept ensembles anglais du Open ASR Leaderboard fait au moins 5,8 fois sa taille, et que cet avantage tient dans le bruit, devant Parakeet Redux, l'autre modèle de faible précision de sa taille. Les chiffres de vitesse viennent avec des conditions : un extrait à la fois, log-mel inclus, chargement du modèle exclu. Et chaque voie rapide n'est livrée que si son taux d'erreur de mot reste dans le bruit de la voie exacte, selon un bootstrap apparié sur les extraits avec 4 000 rééchantillonnages.

Kumo Tabular s'attaque au cycle de vie des modèles d'arbres

Nvidia a publié Kumo Tabular le 29 septembre, un modèle de fondation ouvert pour la classification et la régression tabulaires qui prédit de nouvelles lignes en une seule passe avant, sans entraînement, réglage ni ingénierie de variables. Il existe en trois tailles, de 28M à 215M de paramètres, est publié sous licence OpenMDW-1.1 pour un usage commercial, et se classe premier sur quatre benchmarks : TabArena, BeyondArena, TALENT et ScoringBench, selon le billet Hugging Face.

L'architecture emprunte à TabICL et TabPFN, avec de l'attention sur les colonnes, les lignes et le contexte. L'entreprise indique qu'il a été pré-entraîné uniquement sur des données artificielles, ce qui contourne le problème de confidentialité lié à l'entraînement sur des tables clients. Savoir s'il détrône les arbres à gradient boosting en production est une autre question que son classement dans les benchmarks, et le billet de Nvidia n'y répond pas.

Un modèle de langue entraîné sur GitHub Actions et du matériel donné

Le projet Coop, un dépôt GitHub mis en ligne le 30 septembre, tente quelque chose de plus étrange : pré-entraîner un petit modèle de langue sans serveurs et sans financement. L'étape 2 est un transformeur décodeur seul d'environ 145M de paramètres, entraîné de zéro sur FineWeb-Edu. Les participants téléchargent un point de contrôle depuis Hugging Face, exécutent des pas AdamW locaux sur un fragment personnel de données, et soumettent un pseudo-gradient sous forme de pull request contre un dépôt de jeu de données public. Une tâche cron GitHub Actions sans état, planifiée toutes les cinq minutes, agrège les soumissions par moyenne tronquée ou médiane géométrique et effectue un pas externe de Nesterov.

L'étape 1 en est la preuve : un modèle de 15M de paramètres entraîné au-delà de son budget optimal selon Chinchilla par des bénévoles en six jours, avec une perte de validation passée de 9,01 à 2,8. Les poids restent disponibles. La documentation du projet est d'une franchise rare sur l'évaluation : elle note qu'un chiffre unique de perte de validation ne dit rien, car les pas externes le font monter aussi souvent que descendre, et que la direction est une propriété de la série, pas d'un point.

Deux autres sorties ouvertes complètent la fenêtre. L'UK AI Security Institute et Meridian Labs ont publié Inspect, un cadre d'évaluation avec plus de 200 évaluations prêtes à l'emploi et un bac à sable pour le code de modèle non fiable dans Docker, Kubernetes et Modal. Et Sparticle62ops a publié PSSA, un modèle de langue non transformeur écrit en Rust sans framework de ML en dessous, qui apprendrait plus vite qu'un transformeur à paramètres égaux et générerait du texte environ douze fois plus rapidement sur le même CPU.

Les poids ouverts ne racontent pas tout. Le 30 septembre également, la FTC a ouvert une enquête à l'échelle du secteur sur Anthropic, OpenAI et le groupe de recherche Metr, la première action d'application officielle aux États-Unis sur des agents d'IA incontrôlés, comme l'a rapporté The Guardian. OpenAI, de son côté, repousse son IPO et retient la sortie d'un modèle pour des raisons de sécurité, selon Ars Technica. Le contraste saute aux yeux : les modèles qui sortent sans friction sont les petits, et les entreprises sous examen sont celles aux plus grosses valorisations.

Commentaires 0

Sources

7
  1. 01Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  2. 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04Inspect: An open-source framework for large language model evaluationsEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  7. 07OpenAI delays IPO over AI safety concernsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.