La FTC enquête sur les laboratoires d'IA, OpenAI dénonce une campagne de distillation
La Federal Trade Commission enquête sur l'ensemble du secteur, Anthropic, OpenAI et d'autres laboratoires d'IA compris. C'est la première action officielle des États-Unis contre des agents d'IA détournés, rapporte The Guardian le 30 septembre.

L'enquête de la FTC tombe le jour même où OpenAI publie un billet de blog. Le laboratoire y accuse des personnes liées à Moonshot AI, en Chine, d'avoir mené une campagne de distillation contre ses modèles. The Register rapporte le 30 septembre qu'OpenAI affirme que l'activité a commencé le 1er juillet et a été interrompue le 28 juillet.
Les deux affaires comptent pour quiconque diffuse des poids ouverts. Elles fixent les termes du débat : ce qu'un modèle a le droit d'apprendre d'un autre modèle, et qui est responsable quand un agent dérape. Les réponses ne sont pas tranchées. La FTC n'a nommé aucune cible. Anthropic, OpenAI et le groupe de recherche Metr n'ont pas répondu immédiatement aux demandes de commentaire, selon The Guardian. Le New York Post a révélé l'information en premier.
Ce qu'OpenAI raconte, et ce qu'il ne dit pas
Le récit d'OpenAI, relayé par The Register, est précis sur les volumes et vague sur l'attribution. Les requêtes ont commencé lentement, puis ont produit « des pics de volume élevé les 24 et 25 juillet, avec 16 000 requêtes suivant un schéma d'extraction pertinent, venant de plus de 4 000 utilisateurs », selon l'entreprise. En creusant, OpenAI a identifié une activité liée à des schémas de requêtes chez plus de 15 000 utilisateurs. Le laboratoire affirme avoir totalement démantelé la campagne le 28 juillet.
« Les opérateurs n'ont pas cassé notre chiffrement, compromis une base de données ni obtenu un accès direct aux conversations stockées des utilisateurs », écrit OpenAI dans le billet. « Ils ont manipulé les interactions avec le modèle pour que le raisonnement protégé soit reproduit sous des formes visibles par le demandeur, de manière coordonnée et à grande échelle, en violation de nos conditions d'utilisation. »
OpenAI dit ignorer si tous les opérateurs de juillet étaient liés à un seul concurrent, mais désigne Moonshot AI comme le noyau central. C'est une affirmation, pas une conclusion. The Register a sollicité Moonshot pour un commentaire, sans réponse immédiate, puis a demandé à OpenAI quels modèles étaient visés, sans réponse non plus.
Le contexte est inconfortable. OpenAI a bâti ses modèles sur d'immenses quantités de contenus internet aspirés, au milieu de batailles de droits d'auteur, comme le note The Register. Aujourd'hui, le laboratoire qualifie l'extraction de son raisonnement de risque pour la sécurité nationale. Anthropic, Google et des responsables américains ont porté des accusations similaires contre Moonshot. Fin juillet, Michael Kratsios, assistant de Trump pour la science et la technologie, a accusé Moonshot d'avoir construit son modèle Kimi K3 en distillant Fable d'Anthropic, rapporte The Register.
La réponse d'Anthropic est technique. Son modèle Claude Opus 5.5, sorti une semaine avant l'article de The Register, embarque une défense contre la distillation baptisée « preserved thinking », introduite avec Fable 5.1. OpenAI, de son côté, dit avoir banni les comptes copieurs de modèles et resserré les contrôles d'inscription et d'infrastructure. Le laboratoire a aussi élargi la surveillance, fermé une voie permettant de rejouer le raisonnement chiffré d'un autre utilisateur, et partagé des détails via le Frontier Model Forum.
L'avertissement d'Anthropic sur GLM-5.3
Anthropic tient un raisonnement parallèle sur les poids ouverts depuis plus longtemps. Le 30 septembre, The Decoder a rapporté une analyse de l'équipe Frontier Red Team d'Anthropic sur GLM-5.3, le modèle à poids ouverts de Zhipu. Selon Anthropic, ce modèle peut construire seul des exploits informatiques complets, comme son propre Claude Mythos Preview, mais sort sans garde-fous efficaces.
Les chiffres publiés par Anthropic méritent une lecture attentive. Sur ExploitBench, qui mesure l'exploitation de failles connues du moteur V8 de Chrome, GLM-5.3 a construit un exploit fonctionnel en 50 tentatives sur 410 ; Mythos Preview en a réussi 56. Sur un benchmark interne d'exploitation de binaires tiré d'OSS-Fuzz de Google, GLM-5.3 a pris le contrôle total de la cible dans 4 pour cent des tâches, contre 6 pour cent pour Mythos Preview. Les modèles plus anciens, dont GLM-5.2 et Claude Opus 4.6, ont échoué aux deux. Kimi K3 et DeepSeek V4.1-Flash ont à peine marqué des points, rapporte The Decoder.
Les données de refus sont la partie la plus tranchante. Dans une simulation d'Anthropic, GLM-5.3 a refusé des commandes ouvertement malveillantes. Quand la même demande était présentée comme un exercice de red team, il a tenté de se connecter au système cible dans 64 pour cent des exécutions. Avec des étapes de raisonnement préremplies, ce taux est monté à 92 pour cent. Après ablation, une technique qui retire le comportement de refus des poids ouverts, il a atteint 100 pour cent. Les modèles Claude protégés sont restés à zéro. Anthropic dit avoir utilisé l'ablation pour la première fois, en y consacrant environ 2 200 heures de GPU et à peu près 4 400 dollars. Le laboratoire estime qu'une équipe expérimentée pourrait y arriver pour environ 1 200 dollars.
L'analyse n'est pas désintéressée, et The Decoder le dit. Anthropic ne publie pas ses poids et présente cela comme un avantage de sécurité. Or un modèle chinois à poids ouverts, bon marché et proche de la frontière, est un concurrent direct. Le CAISI, l'agence américaine qui a évalué GLM-5.3 séparément, l'a qualifié de modèle à poids ouverts le plus capable en cyber à ce jour. Elle le place environ quatre mois derrière les meilleurs modèles américains, avec la réserve que les modèles américains ont été testés sans leurs garde-fous cyber.
Pendant ce temps, les petites sorties à poids ouverts continuent
Rien de tout cela n'a ralenti le rythme des publications. Fermion Research a publié Phonon-2 le 30 septembre, un modèle de reconnaissance vocale en anglais. Il affiche en moyenne 5,21 pour cent d'erreur sur les mots sur les sept ensembles anglais du classement Open ASR, à partir d'un téléchargement de 164 MB. Le modèle conserve la précision de son enseignant en pleine précision de 2,5 GB et le bat sur les réunions et les discours parlementaires.
La compression est la partie intéressante. Chaque poids de l'encodeur prend l'une de cinq valeurs apprises à environ 2,1 bits, empaquetées en chiffres base 3 à raison de cinq par octet. Le même fichier tourne sur Mac, Linux, Windows et GPU NVIDIA. Sur un MacBook Air, une heure d'audio devient du texte en environ 20 secondes ; sur huit cœurs de CPU, l'heure prend 25 secondes ; sur un H100, une journée entière d'audio prend 13 secondes par lots de 128. Les poids sont en CC-BY-4.0, la licence du Parakeet TDT 0.6B v3 de NVIDIA, dont ils dérivent.
NVIDIA, de son côté, mise sur les données tabulaires. Son modèle Kumo Tabular, annoncé sur Hugging Face le 29 septembre, est un modèle de fondation ouvert pour la classification et la régression tabulaires. Il prédit les étiquettes en une seule passe avant, sans entraînement, sans réglage et sans ingénierie des variables. Il existe en trois tailles, de 28M à 215M de paramètres, a été préentraîné uniquement sur des données artificielles et sort sous licence OpenMDW-1.1 pour un usage commercial. NVIDIA dit qu'il occupe la première place sur TabArena, BeyondArena, TALENT et ScoringBench.
L'affirmation qui ressort concerne l'apprentissage en contexte pour les tableaux. Un modèle préentraîné sur des millions de tables lit un tableau étiqueté comme contexte et prédit directement de nouvelles lignes, le même tour que les LLM appliquent au texte. Pendant deux décennies, ce travail est revenu aux arbres à gradient boosting construits de zéro pour chaque tâche. Savoir si un transformeur de 215M de paramètres les détrône en pratique, les benchmarks ne l'ont pas tranché.
Poids ouverts, questions fermées
Ailleurs dans le dossier, l'écosystème ouvert expérimente des structures plus étranges. Coop, un projet de commonsense-ai, fait tourner un préentraînement d'environ 145M de paramètres sur du matériel grand public donné et les offres gratuites de Hugging Face et GitHub Actions. Les pseudo-gradients sont soumis comme pull requests et agrégés par une tâche cron sans état. L'étape 1, un modèle de 15M entraîné sur TinyStories par des bénévoles en six jours, s'est achevée au-delà de son budget optimal de Chinchilla, avec une perte de validation tombée de 9,01 à 2,8.
PSSA, de Sparticle62ops, est un modèle de langage non transformeur écrit en Rust, sans framework de ML en dessous. Il utilise une récurrence sélective à espace d'états, plus une banque de mémoire hyperbolique et des mises à jour de poids par token. À paramètres égaux sur le même corpus, son auteur affirme qu'il apprend plus vite qu'un transformeur et génère environ douze fois plus rapidement sur le même CPU. Le framework Inspect de l'AI Security Institute britannique, mis à jour le 30 septembre, embarque désormais plus de 200 évaluations prêtes à l'emploi. Il permet aussi d'exécuter des agents externes comme Claude Code et Codex CLI dans des bacs à sable.
Mis bout à bout, le tableau n'oppose pas simplement l'ouvert au fermé. La FTC enquête sur le comportement des agents chez les plus grands laboratoires, dont la plupart ne publient pas leurs poids. La bataille de la distillation concerne des modèles qui ne publient pas leurs poids non plus. Les modèles réellement téléchargés sont petits, bon marché et souvent entraînés hors des laboratoires : 164 MB de parole, 215M de paramètres de prédiction tabulaire, un préentraînement bénévole qu'on lance depuis un terminal.
Aucun d'eux ne répond à la question que l'enquête de la FTC et le rapport d'Anthropic tournent autour. Si un modèle téléchargé peut être dépouillé de ses refus en un jour pour environ 1 200 dollars, et si l'écart de capacités avec la frontière se compte en mois, alors les termes de licence et les garde-fous à l'entraînement pèsent moins que ne le laissent entendre ceux qui les écrivent. L'action répressive est la première tentative d'un régulateur américain pour tester cela. Ce n'est pas encore une réponse.
Sources
8- 01US trade regulator opens investigation into AI giants including Anthropic and OpenAIEN
- 02Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
- 03Anthropic says Zhipu's open-weight GLM-5.3 nearly matches Claude Mythos Preview at building exploitsEN
- 04Phonon-2: most accurate open speech recognition model in a 164 MB downloadEN
- 05NVIDIA Kumo Tabular Sets a New Accuracy-Efficiency Frontier for Tabular PredictionEN
- 06Coop: A small language model pretrained by volunteersEN
- 07PSSA: A non-transformer language model written from scratch in RustEN
- 08Inspect: An open-source framework for large language model evaluationsEN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.