Les poids ouverts montent en gamme : puces, parole et modèles tabulaires livrés en une semaine
OpenAI et Synopsys ont signé le 30 septembre un accord pluriannuel pour bâtir GPT-Synopsys, un modèle spécialisé dans la conception de puces. C'est l'une des cinq sorties ou partenariats de modèles ouverts, ou décrits ouvertement, tombés dans les derniers jours de septembre.

La vraie nouveauté du travail sur les modèles ouverts n'est pas un score de benchmark. C'est un contrat. Le 30 septembre, OpenAI et Synopsys ont annoncé un partenariat stratégique pluriannuel pour bâtir un modèle d'IA spécialisé dans la conception de puces, baptisé GPT-Synopsys, rapporte The Decoder. Synopsys vend des outils d'automatisation de la conception électronique, ces logiciels que les ingénieurs utilisent pour disposer les puces. OpenAI en licence l'usage pour le projet.
L'objectif affiché : un modèle capable de « raisonner sur la conception et la vérification des puces, et d'utiliser directement les outils de Synopsys ». Les deux entreprises disent que des tests préliminaires sont en cours chez des clients du secteur, que les données clients ne serviront pas à l'entraînement et seront stockées chiffrées, et qu'elles commercialiseront le produit ensemble en partageant les revenus. Sassine Ghazi, PDG de Synopsys, estime que l'IA pourrait accélérer sensiblement la conception. Greg Brockman, cofondateur d'OpenAI, présente l'accord comme un chemin vers de meilleures puces et une meilleure IA.
Voilà un modèle fermé, à l'intérieur d'une chaîne commerciale. La même semaine a produit un tout autre type de sortie.
Petits modèles, petits fichiers, grandes promesses
Fermion Research a publié Phonon-2 le 30 septembre. L'entreprise le présente comme le modèle de reconnaissance vocale ouvert le plus précis sous 900 Mo. Dans un téléchargement de 164 Mo, il égalerait la précision de son modèle enseignant en pleine précision de 2,5 Go, jeu de données par jeu de données, le dépasserait sur les réunions et les discours parlementaires, et transformerait une heure d'audio en texte en une vingtaine de secondes sur un MacBook Air. Les poids sont sur Hugging Face sous licence CC-BY-4.0, celle de Parakeet TDT 0.6B v3 de NVIDIA, dont ils dérivent.
Le chiffre intéressant est 5,21. Sur les sept ensembles anglais du Open ASR Leaderboard, Phonon-2 affiche en moyenne 5,21 % d'erreur de mot, et tous les modèles ouverts qui font mieux sont au moins 5,8 fois plus gros, selon la note de l'entreprise. Chaque poids d'encodeur est stocké comme l'un de cinq niveaux appris, empaquetés en chiffres base 3 à cinq par octet, avec un bit de plus par poids non nul pour choisir la magnitude. Soit environ 2,1 bits par poids stocké. L'entreprise affirme que son avance tient sous le bruit, d'une pièce silencieuse à un bruit de fond aussi fort que la personne qui parle, où le modèle reste devant Parakeet Redux.
La vérification indépendante ne figure pas au dossier. Prenez la position au classement et l'affirmation sur le bruit pour des chiffres de fournisseur, jusqu'à ce que quelqu'un les reproduise.
Le même jour, ailleurs, NVIDIA a mis son modèle de fondation tabulaire sur Hugging Face. NVIDIA Kumo Tabular est un modèle de fondation ouvert pour les données tabulaires : il prédit les étiquettes de nouvelles lignes en une seule passe avant, sans entraînement, sans réglage et sans ingénierie des caractéristiques, en classification comme en régression. Il a été pré-entraîné uniquement sur des données artificielles, existe en trois tailles de 28M à 215M de paramètres, tourne via la bibliothèque open source structured-data-models de NVIDIA, et sort sous licence OpenMDW-1.1 pour un usage commercial. NVIDIA affirme qu'il se classe premier sur quatre benchmarks : TabArena, BeyondArena, TALENT et ScoringBench.
Les détails d'architecture comptent moins que le cadrage. Le travail tabulaire est dominé depuis vingt ans par les arbres à gradient boosting. L'argument de NVIDIA est qu'un transformer pré-entraîné peut lire un tableau étiqueté en contexte et éviter le cycle par tâche : collecter des étiquettes, concevoir des caractéristiques, régler des hyperparamètres. Le modèle utilise l'attention par colonne, par ligne et en contexte, dans la lignée de TabICL et TabPFN, avec une température d'attention sensible à la longueur pour que l'attention softmax ne se dissolve pas quand une table d'inférence est bien plus grande qu'une table d'entraînement. Les valeurs manquantes n'ont pas besoin d'imputation.
Des poids ouverts venus de bénévoles et d'un institut d'État
Deux sorties du 30 septembre n'avaient aucune entreprise derrière elles, ou une entreprise d'État. Coop est un petit modèle de langue pré-entraîné par des bénévoles, sans serveur, sans financement et sans démon. La boucle d'entraînement tourne sur du matériel grand public donné, plus les offres gratuites de Hugging Face et GitHub Actions, selon son dépôt GitHub. L'étape 2 est en cours : un transformer décodeur seul d'environ 145M de paramètres, pré-entraîné de zéro sur FineWeb-Edu, avec 12 couches, 14 têtes, d=896, un contexte de 1 024 tokens et un vocabulaire BPE au niveau octet de 32 000. L'étape 1, un modèle de 15M sur TinyStories, s'est achevée au-delà de son budget optimal de Chinchilla, avec une perte de validation passée de 9,01 à 2,8 en six jours.
Le mécanisme est l'histoire. Les workers téléchargent le point de contrôle courant, exécutent des pas AdamW locaux sur une partition personnelle de données, calculent un pseudo-gradient et le soumettent comme pull request contre un dépôt public de jeux de données Hugging Face. Une tâche cron GitHub Actions sans état, prévue toutes les cinq minutes mais qui se déclenche en pratique de quelques minutes à quelques heures d'intervalle, lit le point de contrôle et les pull requests de la boîte de réception ouverte, écarte les soumissions trop anciennes, écrête et applique un portail cosinus au reste, les agrège par moyenne tronquée ou médiane géométrique, effectue un pas externe de Nesterov, téléverse le nouveau point de contrôle, crédite les contributeurs dans le registre et ferme les pull requests traitées.
Le dépôt est franc sur l'évaluation. Une seule perte de validation ne dit rien, parce que les pas externes la font monter aussi souvent que descendre. Le classement ajuste donc une pente sur la série contre les tokens plutôt que contre les pas externes, et la rapporte avec une erreur standard. « Descendre » signifie que la pente dépasse deux erreurs standard. C'est une règle de reporting plus honnête que ce que la plupart des laboratoires financés arrivent à faire.
Le même jour, le UK AI Security Institute et Meridian Labs ont publié Inspect, un cadre open source pour les évaluations d'IA de frontière. Inspect couvre le code, les tâches agentiques, le raisonnement, les connaissances, le comportement et la compréhension multimodale, et arrive avec plus de 200 évaluations prêtes à l'emploi. Ses briques : les jeux de données, les solveurs et les scoreurs. Il prend en charge l'appel d'outils, y compris les outils MCP et les outils bash, python, recherche web et ordinateur intégrés, exécute des agents externes arbitraires comme Claude Code, Codex CLI et Gemini CLI, et isole le code de modèle non fiable dans Docker, Kubernetes, Modal, Proxmox et Vagrant via une API d'extension. Le timing est révélateur. L'outillage d'évaluation d'un institut gouvernemental de sécurité arrive la même semaine où un régulateur américain a ouvert une enquête à l'échelle du secteur sur des agents d'IA qui se comportent mal.
Les poids ouverts entrent dans la pile de puces chinoise
Deepseek publie des outils de programmation open source pour les puces d'IA de Huawei, selon un message sur le canal WeChat officiel de Deepseek, Reuters rapportant cette ouverture. La pièce maîtresse est TileLang, un langage de programmation open source pour puces d'IA développé à l'origine par des chercheurs de l'Université de Pékin. Deepseek l'utilise depuis environ un an et le décrit désormais comme son outil principal pour le travail sur l'intelligence artificielle générale, selon The New York Times.
Le logiciel comprend des bibliothèques pour le calcul et pour le déplacement de données entre puces. Selon Deepseek, Huawei a « pleinement soutenu » ce travail, et les deux entreprises ont optimisé un supernœud, un cluster de 128 puces Ascend 950. Deepseek soutient que quiconque veut bâtir un écosystème logiciel indépendant pour puces d'IA a d'abord besoin d'un langage universel, facile à programmer mais qui tire quand même toute la performance du matériel. TileLang, dit-il, offre un modèle de programmation plus simple que CUDA.
Cela rejoint un débat plus large sur l'endroit où se situe l'avantage de Nvidia. Le cabinet d'études SemiAnalysis, après avoir testé la puce d'inférence Jalapeno d'OpenAI, a qualifié la douve CUDA de « potentiellement morte », parce qu'OpenAI fait tourner de nouveaux modèles sur son propre matériel si vite. Il ajoute que Jalapeno bat le Blackwell de Nvidia en performance par watt dans la plupart des scénarios testés. SemiAnalysis y met ses propres réserves : les tests couvraient des scénarios relativement faciles à optimiser, d'environ 8 000 tokens d'entrée et 1 000 tokens de sortie, et le cabinet n'a pas encore exécuté AgentX, le benchmark des tâches d'agents à plusieurs étapes. En août, SemiAnalysis avait trouvé Nvidia largement en tête sur ce benchmark. Il disait aussi que Nvidia resterait moins cher par token qu'AMD même si AMD donnait son matériel, parce que l'avantage réside dans le logiciel qui relie plusieurs puces en un seul système. Les puces de Huawei ne faisaient pas partie de la comparaison AgentX.
Il y a aussi une pression intérieure. Huawei reconnaît ne pas pouvoir suivre la demande chez lui, et prévoit donc de vendre moins de puces à l'étranger. À propos des contrôles américains à l'exportation, Eric Xu, président tournant actuel de Huawei, a déclaré que l'entreprise ne peut pas accepter un avenir qui dépende de la volonté d'autres de vendre des puces à la Chine.
Ce qu'il faut surveiller
Le schéma qui traverse ces sorties : les poids ouverts ne se limitent plus à des points de contrôle de chatbot. Ils arrivent sous forme d'encodeurs vocaux assez petits pour un ordinateur portable, de prédicteurs tabulaires visant les tables d'entreprise, de harnais d'évaluation d'un organisme de sécurité étatique, de boucles d'entraînement bénévoles qui tournent sur des offres gratuites, et maintenant d'outils de programmation pour une pile d'accélérateurs non Nvidia.
Deux choses restent en suspens. D'abord, les affirmations de benchmark pour Phonon-2 et Kumo Tabular sont des affirmations de fournisseur ou de mainteneur dans ce dossier, et aucune des trois sorties de modèles n'a de reproduction indépendante attachée. Ensuite, le tableau réglementaire va dans la direction opposée aux sorties : l'enquête de la FTC sur Anthropic, OpenAI et Metr est la première action d'application officielle américaine touchant des agents d'IA dévoyés, comme l'a rapporté The Guardian le 30 septembre.
Les poids ouverts ne tranchent rien de tout cela. Ils déplacent seulement le débat vers du matériel que plus de gens peuvent faire tourner.
Sources
7- 01OpenAI and Synopsys team up to build an AI model that designs chips like a seasoned engineerEN
- 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 03NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
- 04Coop: A small language model pretrained by volunteersEN
- 05Inspect: An open-source framework for large language model evaluationsEN
- 06China's AI industry closes ranks as Deepseek ships open-source software for Huawei's Ascend chipsEN
- 07US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.