Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Poids ouverts, recettes fermées : ce que montrent l'article sur la mémorisation et la bataille des licences

Un article accepté à COLM 2026 a mesuré ce que 14 modèles à poids ouverts avaient retenu de 200 livres. La plupart ne reproduisent pas la plupart des ouvrages. Mais Llama 3.1 70B, à partir des premiers mots d'un livre, en restitue certains presque mot pour mot. Le résultat tombe au milieu d'un conflit sur ce que « ouvert » veut dire.

IA & modèlesAnalyseSophie LeclercPublié le: 27 septembre 20265 min de lectureSources 3
Poids ouverts, recettes fermées : ce que montrent l'article sur la mémorisation et la bataille des licences

L'article s'intitule Extracting memorized pieces of (copyrighted) books from open-weight language models, arXiv:2505.12546. Il a été soumis une première fois le 18 mai 2025, puis révisé jusqu'au 20 juillet 2026. Les auteurs sont A. Feder Cooper, Mark A. Lemley, Allison Casasola, Ahmed Ahmed, Aaron Gokaslan, Amy B. Cyphert, Christopher De Sa, Daniel E. Ho et Percy Liang. Il est accepté à COLM 2026.

Leur cible annoncée, c'est le style d'argumentation des procès. Dans les affaires de droit d'auteur sur l'IA générative, plaignants et défendeurs, indique le résumé, « avancent souvent des affirmations catégoriques et opposées sur la mesure dans laquelle les grands modèles de langue (LLM) mémorisent l'expression protégée des livres présents dans leurs données d'entraînement ». Selon les auteurs, les deux camps « simplifient à l'extrême la relation entre mémorisation et droit d'auteur ».

Ils ont donc mis au point une technique de mesure et l'ont appliquée à grande échelle : 200 livres, 14 modèles à poids ouverts, plus de 3 000 expériences. Le résultat principal contredit les affirmations les plus fortes. « En ce qui concerne notre méthodologie d'extraction spécifique, nous constatons que la plupart des LLM ne mémorisent pas la plupart des livres, ni en entier ni en partie. »

Puis viennent les exceptions. Llama 3.1 70B « mémorise entièrement certains livres, comme Harry Potter and the Sorcerer's Stone ». La mémorisation y est assez étendue pour que, selon le résumé, « l'on puisse extraire de façon déterministe le livre entier presque mot pour mot en utilisant ses premiers mots comme invite initiale ». Le constat dépend du modèle et du livre, et c'est là tout l'intérêt : la mémorisation n'est pas une propriété des LLM en général.

Reste à savoir si cela aide qui que ce soit devant un tribunal. Le résumé indique que les résultats « ont des implications importantes pour les affaires de droit d'auteur, sans pour autant favoriser clairement l'un ou l'autre camp ».

Le problème de l'étiquette, en dessous

Les modèles de cette étude sont à poids ouverts. Ils se téléchargent. Ce n'est pas la même chose que l'open source, et The Register l'a défendu le 15 septembre 2026 dans une chronique de Steven J. Vaughan-Nichols. L'Open Source Initiative, gardienne de la définition de l'open source, définit les poids ouverts comme « les poids et biais finaux d'un réseau de neurones entraîné ». Elle ajoute que les poids seuls n'exposent qu'« une fraction de l'information nécessaire à une redevabilité complète ».

James Landay, directeur du Stanford Institute for Human-Centered AI, en a donné la version pratique à The Register : « Les poids ouverts sont un progrès. On peut télécharger le modèle, l'exécuter sur sa propre machine, le tenir à l'écart du pipeline de données de quelqu'un d'autre. Mais on ne voit toujours pas comment la chose a été construite, sur quoi elle a été entraînée, ni pourquoi elle se comporte comme elle le fait. Ce n'est pas un modèle ouvert. C'est une distribution ouverte. »

« Les poids ouverts répondent à “Puis-je exécuter ceci ?” L'open source répond à “Puis-je faire confiance à ceci, l'améliorer et construire la suite dessus ?” »

Cette seconde citation est aussi de Landay, dans la même chronique du Register. Celle-ci rapporte les critiques de la Open Source AI Definition 1.0 de l'OSI formulées par Bruce Perens, Bradley Kuhn et Richard Fontana. L'OSI a reconnu, lors de la publication de l'OSAID 1.0 en octobre 2024, que la définition continuerait d'évoluer. Mike Dolan, de la Linux Foundation, a soumis la licence Open Model, Data, and Weights, en circulation depuis 2025 avec des contributeurs listés chez Amazon, Meta, IBM, Microsoft et Nvidia. Cette soumission a suscité des objections sur la liste de diffusion de l'OSI consacrée à la revue des licences.

Cela compte pour le résultat sur la mémorisation. Si l'on ne peut pas voir les données d'entraînement, on ne peut pas vérifier indépendamment quels livres y sont entrés. Le texte extrait reste la seule preuve de ce qui en est sorti.

Bon marché, proche, et difficile à exécuter

Mozilla a publié la version 1.1 de son rapport State of Open Source AI le 15 septembre 2026, avec des données arrêtées au 1er septembre, selon Tom's Hardware. Mozilla est l'association à but non lucratif derrière Firefox et défend les modèles ouverts. Le rapport s'appuie sur une enquête Mozilla/SlashData auprès d'environ 1 400 développeurs, sur les données de trafic d'OpenRouter et sur des indices de référence tiers. Il recense 16 publications notables, et Tom's Hardware note qu'aucune ne fournit la recette de données exigée par la définition de l'OSI.

Les chiffres de capacité : le meilleur modèle ouvert accusait trois points de retard sur le leader fermé à l'Artificial Analysis Intelligence Index, pour 60 % du prix, et se tenait à deux points derrière Claude Fable 5 à 30 %. L'ajustement de Mozilla sur les données de METR concernant l'horizon des tâches situe l'écart ouvert-fermé à environ 4,4 mois, proche de l'estimation de quatre mois d'Epoch AI. La capacité ouverte double tous les 3,9 mois selon le calcul de Mozilla, contre 5,5 pour la fermée.

Les réserves valent autant que le titre. L'écart de quatre mois et le chiffre de 30 % sont mesurés d'API à API sur des points de terminaison hébergés, au prix catalogue. Le propre graphique matériel de Mozilla place le meilleur modèle ouvert tenant sur un serveur à 52,6 et le meilleur sur un seul GPU à 40, soit des chutes de 10 et 23 points depuis le sommet. L'écart est donc plus large que ne le suggèrent quatre mois. Le point de contrôle natif MXFP4 de Kimi K3 occupe environ 1,56 To répartis sur 96 fragments. La configuration de service de Mozilla liste 64 accélérateurs ou plus, et vLLM en demande au moins huit GPU GB300. Le rapport qualifie cela d'ouvert mais non exécutable par la plupart de ceux qui le détiennent.

Du côté de la demande, Mozilla a compté huit des dix principaux modèles en volume de tokens sur OpenRouter en août comme étant à poids ouverts, dont sept construits en Chine. Les fournisseurs fermés ont tout de même capté 96 % des revenus de la couche modèle sur OpenRouter de mai à septembre 2025, selon la Linux Foundation. Le directeur technique de Mozilla, Raffi Krikorian, a déclaré à Ars Technica par courriel que le choix de payer pour des modèles fermés semble lié à la charge de travail plutôt qu'à l'organisation.

Un dernier fil. Le rapport présente, comme « affirmé, et non démontré », une allégation de l'avis conjoint NSA/CISA/FBI AA26-251A du 8 septembre selon laquelle Moonshot aurait extrait des données de Claude Fable 5 pour entraîner Kimi K3 par distillation. Non prouvé, et non résolu.

Pris ensemble, les deux documents décrivent le même objet par des bouts différents. Un modèle peut être téléchargé, affiné et, dans au moins un cas documenté, amené par invite à reproduire un roman presque mot pour mot. Les données d'entraînement qui le sous-tendent restent pourtant non documentées, non licenciées comme open source et, pour les plus gros points de contrôle, hors de portée du matériel dont dispose la plupart des gens.

Commentaires 0

Sources

3
  1. 01Extracting memorized pieces of (copyrighted) books from open-weight language modelsEN
  2. 02Open weights are not open source: Why AI's favorite label is under disputeEN
  3. 03China's open-weight AI models are now just 4 months behind frontier US offerings, Mozilla report claimsEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.