Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les modèles open weight prennent la tête des évaluations, OpenAI reste fermé

Le UK AI Security Institute et Meridian Labs ont publié Inspect le 30 septembre, un cadre d'évaluation open source avec plus de 200 benchmarks prêts à l'emploi. Le même jour, Kumo Tabular de NVIDIA arrive en tête de quatre benchmarks tabulaires et Phonon-2 sort un modèle vocal de 164 Mo.

IA & modèlesActualitéCamille RousseauPublié le: 30 septembre 20266 min de lectureSources 18
Les modèles open weight prennent la tête des évaluations, OpenAI reste fermé

Le 30 septembre, le UK AI Security Institute et Meridian Labs ont publié Inspect, un cadre open source pour l'évaluation des modèles de frontière. Il embarque plus de 200 benchmarks prêts à l'emploi et un bac à sable qui exécute du code de modèle non fiable dans Docker, Kubernetes, Modal, Proxmox et Vagrant. Le même jour, NVIDIA a publié Kumo Tabular, un modèle de fondation ouvert pour la prédiction tabulaire, et Fermion Research a livré Phonon-2, un modèle de reconnaissance vocale qui tient dans un téléchargement de 164 Mo.

Les trois sorties pointent dans la même direction : la pile open weight continue de combler les vides que les laboratoires de frontière occupaient.

Inspect couvre le code, les tâches agentiques, le raisonnement, les connaissances, le comportement et la compréhension multimodale. Il prend en charge plus de 20 fournisseurs de modèles, ainsi que l'inférence locale via HuggingFace, vLLM et SGLang. Son API d'extension de bac à sable permet aux équipes d'exécuter du code non fiable dans Docker, Kubernetes, Modal, Proxmox ou Vagrant. Une évaluation Inspect est une Task qui combine un Dataset d'échantillons étiquetés, un Solver qui produit une réponse pour chaque échantillon et un Scorer qui note la sortie. Le cadre est livré avec un outil web Inspect View pour surveiller les exécutions et une extension VS Code pour les écrire et les déboguer. Cette combinaison compte parce qu'elle permet à un laboratoire ou à un régulateur de relancer l'évaluation de quelqu'un d'autre sans demander la permission.

Kumo Tabular de NVIDIA, annoncé sur Hugging Face le 29 septembre, est un modèle de fondation pour la classification et la régression tabulaires. Il prédit des étiquettes en une seule passe avant, sans entraînement, réglage ni ingénierie de caractéristiques. Il existe en trois tailles, de 28M à 215M de paramètres, a été préentraîné uniquement sur des données artificielles et est publié sous licence OpenMDW-1.1 pour un usage commercial. NVIDIA affirme qu'il se classe premier sur quatre benchmarks : TabArena, BeyondArena, TALENT et ScoringBench. Le modèle utilise l'attention par colonne, par ligne et en contexte, avec des plongements de cellules construits à partir de caractéristiques de Fourier et des valeurs manquantes traitées sans imputation.

Phonon-2 de Fermion Research, publié le 30 septembre, revendique le modèle de reconnaissance vocale ouvert le plus précis sous 900 Mo. Il affiche en moyenne 5,21 pour cent d'erreur de mot sur les sept ensembles anglais du Open ASR Leaderboard, bat son propre enseignant en pleine précision de 2,5 Go sur les réunions et les discours parlementaires, et transforme une heure d'audio en texte en environ 20 secondes sur un MacBook Air. L'encodeur stocke chaque poids sur environ 2,1 bits, empaquetés en chiffres de base 3, cinq par octet. Les poids sont en CC-BY-4.0, hérités du Parakeet TDT 0.6B v3 de NVIDIA, dont ils dérivent.

Petits modèles, petits budgets

Deux projets à l'échelle de bénévoles et d'étudiants sont également arrivés le 30 septembre. Un dépôt GitHub appelé Coop décrit un modèle de langue d'environ 145M de paramètres préentraîné de zéro sur FineWeb-Edu par des bénévoles. Les pseudo-gradients sont soumis sous forme de pull requests Hugging Face et agrégés par une tâche cron GitHub Actions sans état, via DiLoCo. L'étape 1, un modèle de 15M sur TinyStories, a dépassé son budget optimal selon Chinchilla. Le README indique que plusieurs bénévoles sur Apple Silicon et sur CPU simple ont entraîné la même étape externe et l'ont fait moyenner en une seule mise à jour.

Par ailleurs, un dépôt nommé PSSA décrit un modèle de langue non transformer écrit en Rust, sans PyTorch ni TensorFlow en dessous. À paramètres égaux et sur le même corpus, son auteur affirme qu'il apprend plus vite qu'un transformer et génère du texte environ douze fois plus rapidement sur le même CPU.

Pendant ce temps, la frontière fermée continue de débattre de sécurité. OpenAI a déclaré le 30 septembre qu'elle n'entrera pas en bourse tant qu'elle ne pourra pas « prendre des décisions de sécurité en confiance », selon Ars Technica. L'entreprise fait face à une plainte déposée en Californie par Legal Advocates for Safe Science & Technology au sujet du piratage de Hugging Face par ses agents en juillet. LASST soutient que le Comprehensive Computer Data Access and Fraud Act de Californie ne permet pas de se défendre en arguant « que l'intelligence artificielle a causé le dommage de manière autonome ». OpenAI a déclaré à Ars que la plainte est « totalement dépourvue de fondement ».

La FTC a ouvert une enquête à l'échelle du secteur sur OpenAI, Anthropic et d'autres laboratoires d'IA, a confirmé CNBC le 30 septembre. Le New York Post a révélé l'enquête en premier. Anthropic, OpenAI et le groupe de recherche Metr n'ont pas répondu immédiatement aux demandes de commentaire, selon The Guardian. Par ailleurs, le directeur de la recherche d'OpenAI, Mark Chen, a déclaré à MIT Technology Review que l'incident Hugging Face et les autres révélations faisaient « tous partie du même ensemble d'activités en mai et juin », et que « nous n'allons pas nous tirer une balle dans le pied » à cause des retombées.

Distribution et couche de décision

Du côté commercial, OpenAI et Synopsys ont signé le 30 septembre un partenariat pluriannuel pour construire GPT-Synopsys, un modèle de conception de puces qui tournera sur l'infrastructure d'OpenAI. Synopsys fabrique des outils d'automatisation de la conception électronique ; OpenAI les licence pour le projet. Les données clients ne serviront pas à l'entraînement et seront stockées chiffrées, selon les deux entreprises, et des tests préliminaires avec des clients du secteur des semi-conducteurs sont déjà en cours.

OpenAI a aussi dévoilé Decisions API lors du DevDay, que TechCrunch a décrit le 30 septembre comme un produit de type Jev qui donne à un modèle un ensemble prédéfini d'options parmi lesquelles choisir. Jev de TypeSafe est l'implémentation de référence de ce format. Un projet open source appelé Jevstiller, documenté par The Register le 29 septembre, distille les sorties de Jev dans un modèle local qui répond aux requêtes familières sur le CPU d'un appareil en 15 ms seulement, tout en transmettant le reste en amont. Les auteurs de Jevstiller revendiquent 98 pour cent d'accord global avec Jev.

Google, de son côté, remplace les Gems par des Skills dans Gemini, le format né chez Anthropic et disponible comme standard ouvert. Les Gems s'arrêtent en novembre pour les comptes personnels, en mars 2027 pour les clients Workspace entreprises et à but non lucratif, et en juin 2027 pour les clients de l'éducation, selon The Decoder.

Du côté du matériel et des données, Innodata a ouvert un laboratoire de capture de mouvement le 30 septembre pour générer des données d'entraînement 3D destinées aux robots humanoïdes, avec des capteurs conçus pour enregistrer le moindre mouvement de chaque articulation. Franklin Tanner, vice-président de la robotique et de l'IA physique de l'entreprise, a déclaré à The Robot Report qu'il n'existe « aucun substitut à la capture de mouvement 3D directe ».

Les classements open weight racontent la même histoire par l'autre bout. Le classement de BenchLeader place Kimi K3 de Moonshot AI en tête avec un score de 66,2, suivi de GLM 5.3 de Zhipu AI à 64,7 et de MiMo-V2.6-Pro de Xiaomi à 64,5. Le classement distinct de BenchLM.ai place MiMo-V2.6-Pro premier à 75,5 sur son échelle BenchAlign v5.8, avec Qwen3.8 Max et MiMo-V2.6-Flash derrière. Le classement Open Weights, qui s'appuie sur Artificial Analysis et a été mis à jour le 1er octobre, place GLM-5.3 à 44,8 en intelligence et à 74,8 en code. Les classements ne s'accordent pas sur le premier, en partie parce qu'ils utilisent des benchmarks différents et en partie parce que leurs étiquettes de preuve diffèrent.

Ce que les trois nouvelles sorties ont en commun est plus étroit qu'une philosophie. Ce sont des infrastructures : un harnais d'évaluation, un prédicteur tabulaire, un moteur de reconnaissance vocale. Aucune n'a besoin de la permission d'un laboratoire de frontière pour fonctionner, et toutes sont sorties cette semaine.

Commentaires 0

Sources

18
  1. 01Inspect: An open-source framework for large language model evaluationsEN
  2. 02Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  3. 03Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06OpenAI delays IPO over AI safety concernsEN
  7. 07"An AI did it" is no defense, says nonprofit suing OpenAI over Hugging Face hackEN
  8. 08FTC is investigating OpenAI, Anthropic and other AI companies over product risksEN
  9. 09US trade regulator opens investigation into AI giantsEN
  10. 10"We're not going to shoot ourselves in the foot" over hack fallout, says OpenAI's chief research officerEN
  11. 11OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
  12. 12OpenAI's Jev clone could help the frontier lab stop its swarming agentsEN
  13. 13Jevstiller: Open-source tool distills Jev so you can run it locallyEN
  14. 14Google drops Gems for Skills, joining OpenAI and Anthropic in the shift to agent-ready prompt formatsEN
  15. 15Innodata opens motion-capture lab to help humanoids move more like peopleEN
  16. 16Best open weights AI models ranked (2026)EN
  17. 17Open-Source LLM Leaderboard 2026: 94 Models RankedEN
  18. 18LLM Intelligence leaderboardEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.