Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les poids ouverts continuent d'arriver : Inspect, Phonon-2, Kumo Tabular et un modèle de 145M entraîné par des bénévoles

Le UK AI Security Institute et Meridian Labs ont publié Inspect le 30 septembre, un cadre open source avec plus de 200 évaluations prêtes à l'emploi. C'est la dernière d'une série de sorties ouvertes qui comprend aussi Phonon-2 de Fermion Research et Kumo Tabular de Nvidia.

IA & modèlesAnalyseSophie LeclercPublié le: 30 septembre 20263 min de lectureSources 7
Les poids ouverts continuent d'arriver : Inspect, Phonon-2, Kumo Tabular et un modèle de 145M entraîné par des bénévoles

La publication a eu lieu le 30 septembre à 15h20 UTC, selon le site du projet. Inspect est un cadre d'évaluation des modèles d'IA de frontière, construit par le UK AI Security Institute et Meridian Labs. L'argument mis en avant est l'étendue : codage, tâches agentiques, raisonnement, connaissances, comportement et compréhension multimodale, tout dans un seul outil.

Le cadre fournit des jeux de données, des agents, des outils et des évaluateurs composables, plus une bibliothèque de plus de 200 évaluations prêtes à l'emploi. Il propose un outil web Inspect View et une extension VS Code. Le bac à sable exécute du code de modèle non fiable dans Docker, Kubernetes, Modal, Proxmox ou Vagrant via une API d'extension. Le projet affirme prendre en charge plus de 20 fournisseurs de modèles, y compris l'inférence locale avec HuggingFace, vLLM et SGLang.

L'outillage d'évaluation, c'est la moitié ingrate des poids ouverts. Des poids sans moyen de les mesurer ne sont que des fichiers.

Un modèle vocal de 164 Mo et un modèle tabulaire qui n'a pas besoin d'entraînement

Fermion Research a publié Phonon-2 le 30 septembre, le présentant comme le modèle de reconnaissance vocale ouvert le plus précis en dessous de 900 Mo. Le téléchargement fait 164 Mo. L'entreprise indique une moyenne de 5,21 % d'erreur de mot sur les sept ensembles anglais du Open ASR Leaderboard, et affirme que tout modèle ouvert faisant mieux est au moins 5,8 fois plus gros.

L'encodeur stocke chaque poids sous l'une de cinq valeurs apprises, soit environ 2,1 bits, empaquetées en chiffres base 3 à raison de cinq par octet. Les poids sont sous CC-BY-4.0, la licence de Nvidia Parakeet TDT 0.6B v3, dont ils dérivent. Fermion affirme qu'une heure d'audio devient du texte en environ 20 secondes sur un MacBook Air, et 13 secondes par jour d'audio sur un H100 par lots de 128.

La contribution de Nvidia relève d'un autre type de compression. Kumo Tabular, publié sur Hugging Face le 29 septembre, prédit des étiquettes à partir d'une table annotée en une seule passe avant, sans entraînement, sans réglage et sans ingénierie de caractéristiques, pour la classification et la régression. Il existe en trois tailles de 28M à 215M de paramètres, a été préentraîné uniquement sur des données artificielles et sort sous licence OpenMDW-1.1 pour un usage commercial. Nvidia affirme qu'il occupe la première place sur TabArena, BeyondArena, TALENT et ScoringBench.

Des bénévoles, du Rust et un modèle de 145M entraîné sur des tâches cron

Des efforts plus modestes avancent aussi. Coop, un projet GitHub mis à jour le 30 septembre, préentraîne un transformeur décodeur d'environ 145M de paramètres sur FineWeb-Edu, à partir de matériel grand public donné et des offres gratuites de Hugging Face et GitHub Actions. Les pseudo-gradients arrivent sous forme de pull requests sur un dépôt de données public. Une tâche cron sans état de GitHub Actions les agrège avec une étape externe de type DiLoCo toutes les cinq minutes en théorie, même si le projet note que l'ordonnanceur de GitHub se déclenche de quelques minutes à quelques heures plus tard. L'étape 1, un modèle de 15M sur TinyStories, a dépassé son budget optimal selon Chinchilla en six jours et a fait passer la perte de validation de 9,01 à 2,8.

Par ailleurs, un projet Rust appelé PSSA, également mis à jour le 30 septembre, décrit une architecture non transformeur avec une récurrence sélective d'espace d'états, une banque de mémoire épisodique et des mises à jour de poids par token. L'auteur affirme qu'il apprend plus vite qu'un transformeur à paramètres égaux et génère environ douze fois plus rapidement sur le même CPU. Le dépôt ne contient aucun banc d'essai indépendant.

Les sorties ouvertes de la semaine se heurtent à un contexte réglementaire plus dur. Le Guardian a rapporté le 30 septembre que la FTC a ouvert une enquête à l'échelle du secteur sur Anthropic, OpenAI et d'autres, la première action d'application officielle américaine touchant des agents d'IA incontrôlés. Ars Technica a rapporté le même jour qu'OpenAI reporte son introduction en bourse pour des raisons de sécurité. Les poids ouverts ne sont l'objet d'aucune des deux actions, mais cet examen donne le ton de tout ce qui sort à côté.

Commentaires 0

Sources

7
  1. 01Inspect: An open-source framework for large language model evaluationsEN
  2. 02Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
  3. 03Nvidia Kumo Tabular: Open Foundation Model for Tabular PredictionEN
  4. 04Coop: A small language model pretrained by volunteersEN
  5. 05PSSA: A non-transformer language model written from scratch in RustEN
  6. 06US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
  7. 07OpenAI delays IPO over AI safety concernsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.