Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Poids ouverts : Nvidia Kumo Tabular mène une semaine de petites sorties

Nvidia a publié Kumo Tabular le 30 septembre, un modèle de fondation ouvert pour la prédiction tabulaire. L'entreprise affirme qu'il n'a besoin ni d'entraînement, ni de réglage, ni d'ingénierie des variables, et qu'il arrive en tête sur quatre benchmarks. Il tombe dans une semaine chargée en sorties à poids ouverts, d'un modèle vocal de 164 Mo à un modèle de langue de 145M de paramètres préentraîné par des bénévoles.

IA & modèlesAnalyseCamille RousseauPublié le: 30 septembre 20265 min de lectureSources 9
Poids ouverts : Nvidia Kumo Tabular mène une semaine de petites sorties

Kumo Tabular est le nom le plus connu du lot, mais ce n'est pas un modèle de langue. Devant un tableau dont les lignes sont étiquetées, il prédit les étiquettes des nouvelles lignes en une seule passe avant. L'entreprise annonce trois tailles, de 28M à 215M de paramètres, et un préentraînement sur des données artificielles uniquement. Le modèle sort sous licence OpenMDW-1.1 pour un usage commercial. Nvidia revendique la première place sur TabArena, BeyondArena, TALENT et ScoringBench.

Petits modèles, petits téléchargements

L'objet le plus frappant de la semaine n'est pas le plus capable. Fermion Research a publié Phonon-2 le 30 septembre, un modèle ouvert de reconnaissance vocale en anglais qui tient dans un téléchargement de 164 Mo. L'entreprise annonce une moyenne de 5,21 pour cent d'erreur sur les mots pour les sept ensembles anglais du Open ASR Leaderboard. Elle affirme aussi que tout modèle ouvert mieux noté est au moins 5,8 fois plus gros. Ses poids sont en CC-BY-4.0, dérivés de Parakeet TDT 0.6B v3 de Nvidia.

Les arguments techniques sont précis. Chaque poids d'encodeur est stocké sur l'un de cinq niveaux appris, soit environ 2,1 bits par poids, empaquetés en chiffres de base 3 à raison de cinq par octet. Sur un MacBook Air, selon Fermion, une heure d'audio devient du texte en environ 20 secondes. En bas de l'échelle des poids ouverts, tout l'argument tient dans ce compromis entre taille et précision.

De son côté, un projet bénévole baptisé Coop a publié un transformeur décodeur seul de 145M de paramètres, préentraîné sans serveurs ni financement, d'après son dépôt GitHub. Le dispositif est inhabituel. Les participants téléchargent un point de contrôle depuis Hugging Face, exécutent localement des pas d'AdamW sur un fragment de données personnel, puis soumettent un pseudo-gradient sous forme de pull request contre un dépôt de jeu de données public sur Hugging Face. Une tâche planifiée GitHub Actions agrège les soumissions toutes les cinq minutes. Le README signale toutefois que le planificateur partagé de GitHub se déclenche de quelques minutes à quelques heures plus tard.

L'étape précédente de Coop, un modèle de 15M de paramètres entraîné sur TinyStories par des bénévoles en six jours, a fait chuter la perte de validation de 9,01 à 2,8. La documentation du projet reste prudente sur ce que cela prouve. Une seule perte de validation ne dit rien. Le classement ajuste donc une pente sur la série, en fonction des tokens plutôt que des étapes externes, et la publie avec une erreur standard.

Outils et puces

La couche d'infrastructure a bougé elle aussi. Le UK AI Security Institute et Meridian Labs ont publié Inspect le 30 septembre, un cadre open source pour les évaluations d'IA de frontière. Il embarque plus de 200 évaluations prêtes à l'emploi, un outil web Inspect View, une extension VS Code et un système de bac à sable qui exécute du code de modèle non fiable dans Docker, Kubernetes, Modal, Proxmox ou Vagrant. Il prend en charge plus de 20 fournisseurs de modèles, plus l'inférence locale avec HuggingFace, vLLM et SGLang.

Le calendrier compte, car l'évaluation est devenue un sujet politique. Le 30 septembre, The Guardian a rapporté que la Federal Trade Commission américaine a ouvert une enquête à l'échelle du secteur sur Anthropic, OpenAI et d'autres laboratoires d'IA. Il s'agit de sa première action coercitive officielle touchant des agents d'IA incontrôlés. La FTC prévoit de contraindre des dirigeants d'Anthropic, d'OpenAI et du groupe de recherche Metr à témoigner, selon plusieurs informations citées par le journal. Les trois ont refusé de commenter auprès du Guardian. Le New York Post a été le premier à rapporter l'information.

Vient ensuite la couche des puces. Deepseek publie des outils de programmation open source pour les puces Ascend de Huawei, selon un message sur le canal WeChat officiel de l'entreprise, rapporté par The Decoder le 30 septembre. La pièce maîtresse est TileLang, un langage de programmation développé à l'origine par des chercheurs de l'université de Pékin. Deepseek affirme qu'il propose un modèle plus simple que CUDA de Nvidia. Reuters a rapporté que le logiciel comprend des bibliothèques de calcul et de déplacement de données, et que Deepseek rend l'ensemble open source. Deepseek affirme que Huawei a pleinement soutenu le travail, et les deux ont optimisé un supernœud de 128 puces Ascend 950.

Tout le monde n'adhère pas à cette présentation. Le cabinet d'études SemiAnalysis a testé la puce d'inférence Jalapeno d'OpenAI et qualifié le rempart de CUDA de « potentiellement mort ». Il précise toutefois n'avoir testé que des scénarios d'environ 8 000 tokens d'entrée et 1 000 tokens de sortie, et ne pas encore avoir lancé son benchmark AgentX. En août, le même cabinet jugeait Nvidia largement en tête sur les charges de travail d'agents.

Ce que les sorties ne tranchent pas

Des poids ouverts ne signifient pas un processus ouvert. L'agrégateur de Coop écarte les soumissions trop anciennes et écrête le reste avec une moyenne tronquée ou une médiane géométrique avant un unique pas de Nesterov. Le bac à sable d'Inspect existe précisément parce que le code de modèle n'est pas fiable. La licence de Phonon-2 hérite de celle du modèle d'une autre entreprise.

Et la concordance n'est pas la précision. Jevstiller, un outil open source couvert par The Register le 29 septembre, distille les sorties de Jev dans un modèle local. Il annonce 98 pour cent de concordance avec le service amont, tout en répondant à des requêtes familières en 15 ms seulement. Ses développeurs sont explicites dans leur propre documentation : « La concordance n'est pas la précision. » Cette phrase pourrait figurer sous la plupart des sorties de la semaine.

Le contexte politique est encore moins tranché. Le patron d'OpenAI, Sam Altman, a déclaré mardi aux journalistes lors de la journée développeurs de l'entreprise qu'elle n'entrerait pas en bourse tant qu'elle ne pourrait pas « prendre des décisions de sûreté en confiance », selon Ars Technica. L'entreprise discute d'une levée de 30 milliards de dollars ou plus sur une valorisation d'environ 1 400 milliards de dollars, rapporte Ars Technica citant des personnes proches du dossier. L'objectif de 30 milliards a été rapporté pour la première fois par Bloomberg. BBC News a couvert le même événement, notant qu'Altman a qualifié les nouveaux agents appelés dots d'« agents remarquablement capables, toujours actifs, qui peuvent gérer à peu près tout ce que vous imaginez ».

Il existe une lecture de cette semaine où les poids ouverts ne sont qu'une distribution moins chère. Nvidia veut Kumo Tabular dans les pipelines des entreprises. Fermion veut Phonon-2 sur les ordinateurs portables. Deepseek veut que le silicium de Huawei ait des logiciels. Coop veut montrer que la boucle d'entraînement peut tourner sur du matériel donné. Le fil commun n'est pas idéologique mais arithmétique : des artefacts plus petits, moins de tokens dépensés, moins d'infrastructure à louer.

Que cette arithmétique améliore la sûreté est une autre question, et cette semaine n'a apporté aucune réponse nette.

Commentaires 0

Sources

9
  1. 01Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Coop: A small language model pretrained by volunteersEN
  4. 04Inspect: An open-source framework for large language model evaluationsEN
  5. 05US trade regulator opens investigation into AI giantsEN
  6. 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
  7. 07Jevstiller: Open-source tool distills Jev so you can run it locallyEN
  8. 08OpenAI delays IPO over AI safety concernsEN
  9. 09OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.