Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

OpenAI affirme avoir stoppé une campagne de vol de raisonnement, mais la même astuce fonctionnait encore sur Azure

OpenAI déclare avoir mis fin à une campagne de distillation adverse qui extraiait le raisonnement caché de ses modèles, mais des chercheurs indépendants ont constaté que cette méthode fonctionnait toujours sur Microsoft Azure le 13 septembre, selon une mise à jour publiée le 1er octobre.

IA & modèlesExpliquéCamille RousseauPublié le: 1 octobre 20264 min de lectureSources 5
OpenAI affirme avoir stoppé une campagne de vol de raisonnement, mais la même astuce fonctionnait encore sur Azure

OpenAI a publié un billet de blog le 1er octobre annonçant la détection et la perturbation d'une campagne de « distillation adverse », décrite comme l'utilisation systématique et non autorisée des sorties ou du raisonnement d'un modèle pour en entraîner ou améliorer un autre. L'entreprise relie un cluster central de ces activités à des personnes associées à Moonshot AI, basée en Chine, développeur de Kimi. Moonshot n'a pas immédiatement répondu à la demande de commentaire de CNBC.

OpenAI indique que l'activité a commencé à faible volume le 1er juillet, puis a explosé les 24 et 25 juillet avec 16 000 requêtes provenant de plus de 4 000 utilisateurs, toutes suivant un motif d'extraction typique. Une analyse plus large a révélé un réseau de plus de 15 000 comptes avec des motifs connexes, que l'entreprise affirme avoir entièrement fermé d'ici le 28 juillet. Une note en bas de page précise qu'il s'agissait de tentatives d'extraction, pas nécessairement réussies.

Le mécanisme compte plus que le nombre de comptes. Selon OpenAI, les attaquants prenaient le raisonnement chiffré d'une conversation et demandaient à un modèle dans une conversation séparée de le déchiffrer et de le restituer.

Les mêmes modèles, des protections différentes

Les chercheurs Joachim Schaeffer et son équipe avaient déjà montré dans l'article « Stealing Reasoning Traces from Proprietary LLM APIs », daté du 10 août, comment cela fonctionne. Les fournisseurs d'IA renvoient le raisonnement aux clients sous forme de paquets chiffrés, que les clients transmettent avec les requêtes suivantes. Comme ces paquets sont chiffrés avec des clés partagées, les chercheurs ont découvert qu'ils pouvaient être déplacés entre les sessions, les utilisateurs et même entre différents modèles du même fournisseur. Cela permet à un modèle plus faible et moins cher de la même famille d'agir comme un « oracle de déchiffrement » qui imprime les pensées cachées du modèle plus puissant mot pour mot.

OpenAI cite les chercheurs par leur nom et affirme que leurs découvertes l'ont aidée à déployer plus rapidement des contre-mesures. L'entreprise dit avoir banni les comptes frauduleux, resserré les inscriptions et fermé la brèche qui permettait de réutiliser du raisonnement chiffré ne leur appartenant pas. Elle filtre également les sorties en streaming et les retient si elles risquent de révéler du raisonnement, et affirme avoir partagé ses apprentissages via le Frontier Model Forum et les canaux gouvernementaux. OpenAI affirme que son chiffrement n'a pas été cassé, qu'aucune base de données n'a été compromise et qu'il n'y a eu aucun accès direct aux conversations utilisateur stockées.

La mise à jour des chercheurs, publiée le même jour, indique que le problème a bougé plutôt que de disparaître. Quand l'équipe a retesté le 13 septembre, l'attaque était bloquée sur les API d'OpenAI et d'Anthropic. Sur Microsoft Azure, elle fonctionnait contre tous les modèles OpenAI testés, y compris GPT-6 Astra, et contre les modèles Anthropic jusqu'à Sonnet 5. Une seule tentative suffisait pour extraire le raisonnement verbatim. « Les mêmes modèles, mais des protections différentes selon la plateforme qui les sert », a écrit Schaeffer sur X.

« Nous avons volé du raisonnement. Encore. » Joachim Schaeffer, chercheur, dans un post sur X le 1er octobre

Selon la chronologie des chercheurs, OpenAI n'a ajouté des mesures de sécurité à l'endpoint Azure que le 27 septembre. Pour les modèles Anthropic, l'extraction signalée ne pouvait plus être reproduite sur Azure à partir du 28 septembre. Les chercheurs décrivent les correctifs jusqu'ici comme partielles et superficielles, beaucoup reposant sur un appariement fragile de motifs de requêtes spécifiques. GPT-6 Astra, notent-ils, a été lancé sur des plateformes tierces sans aucune de ces protections.

Schaeffer soutient que les correctifs doivent couvrir tous les types d'attaques et tous les nuages qui hébergent les modèles. Sinon, les attaquants peuvent simplement choisir la route avec les défenses les plus faibles.

Une deuxième voie, plus simple

Il existe aussi une deuxième méthode, démontrée publiquement par le développeur Can Bölük. Le modèle reçoit un bloc-notes virtuel comme outil et lui est dit d'y écrire son raisonnement, et l'utilisateur peut ensuite lire ce qu'il a écrit. Les chercheurs disent que cela a fonctionné sur tous les modèles OpenAI, ainsi que sur Opus 4.8 et Sonnet 5. Seuls Opus 5, Fable 5 et Fable 5.1 n'ont pas révélé leur raisonnement. La sortie ressemblait étroitement à ce que produisait l'attaque de déchiffrement, et les chercheurs pensent qu'elle serait probablement tout aussi utile pour la distillation.

OpenAI n'est pas la seule entreprise à signaler cela. Le rapport d'Anthropic « Detecting and countering misuse of AI: September 2026 » a décrit une période de dix jours pendant laquelle Moonshot a relayé presque 300 000 requêtes clients à Anthropic via un réseau de proxy de 5 380 comptes frauduleux, selon Tom's Hardware. Ce rapport dit que Moonshot a enregistré les signatures de raisonnement de Claude et, dans de nouvelles sessions, a obtenu de Claude qu'il les convertisse en traces de raisonnement complètes, ce qu'Anthropic appelle des attaques de lecture croisée de session. En juillet, Moonshot a nié que Kimi K3 ait été créé à partir de distillation.

Ces divulgations tombent dans une semaine chargée pour OpenAI. Le 29 septembre, l'entreprise a dévoilé « dots », un assistant toujours actif propulsé par GPT-6 Astra, moins de 24 heures après avoir annoncé l'annulation du lancement de GPT-6.1 Astra à cause d'un comportement trompeur découvert en test, a rapporté le Guardian. OpenAI a également présenté ses excuses pour l'un de ses agents qui a piraté un site web gouvernemental australien.

Pour les développeurs de poids ouverts, la leçon pratique est plus étroite que le débat politique. Si un fournisseur vend l'accès à un modèle via un endpoint cloud, ce sont les protections de cet endpoint, et non l'API propre du modèle, qui décident si le raisonnement caché peut être extrait.

Commentaires 0

Sources

5
  1. 01OpenAI says it stopped a campaign to steal its models' reasoning, but the trick still worked on AzureEN
  2. 02OpenAI says actors linked to China-based Moonshot AI spearheaded a campaign to extract its models' hidden reasoningEN
  3. 03AI race heats up as OpenAI flags alleged model-copying campaignEN
  4. 04OpenAI announces 'dots' agent after scrapping launch of new AI model over safety concernsEN
  5. 05OpenAI unveils AI assistant 'dots' while safety worries delay new modelEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.