Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Les benchmarks d'hallucination s'affinent alors que Gemini 4 Argon est livré à une poignée d'experts

Google a commencé à déployer Gemini 4 Argon, son modèle le plus puissant à ce jour, auprès d'un groupe restreint d'experts en cybersécurité le mercredi 30 septembre, en le tenant à l'écart du public par crainte d'un usage malveillant.

IA & modèlesAnalyseSophie LeclercPublié le: 2 octobre 20268 min de lectureSources 13
Les benchmarks d'hallucination s'affinent alors que Gemini 4 Argon est livré à une poignée d'experts

Google a commencé à déployer Gemini 4 Argon, son modèle le plus puissant à ce jour, auprès d'un groupe restreint d'experts en cybersécurité le mercredi 30 septembre, en le tenant à l'écart du public par crainte d'un usage malveillant. L'entreprise a indiqué dans un billet de blog qu'elle accordait volontairement un accès anticipé au gouvernement des États-Unis et recueillerait les retours des testeurs avant une disponibilité élargie, selon The Guardian.

Cette posture prudente contraste mal avec les affirmations de Google sur le modèle. Dans son billet de lancement, cité par TechCrunch, l'entreprise a déclaré qu'Argon a obtenu des scores nettement supérieurs à ceux de GPT-6 Astra d'OpenAI et de Fable et Opus d'Anthropic sur une variété de benchmarks IA, en s'appuyant sur l'entreprise de benchmarking Vals. Elle a également affirmé qu'Argon peut trouver, valider et corriger de manière autonome des vulnérabilités logicielles critiques. Ce sont des affirmations de capacité, pas de fiabilité. Ce ne sont pas la même chose.

C'est là que la question de l'hallucination se pose. Un modèle qui obtient de bons scores sur les benchmarks de raisonnement ou de codage peut tout de même produire des réponses fausses avec assurance, et les documents les plus récents sur l'hallucination pointent dans les deux sens. Une audit contrôlé des métriques de conflit de gradient dans les modèles multimodaux unifiés, soumis à arXiv le 29 septembre, est le plus intéressant des récents articles. Il teste si une métrie proxy largement utilisée prédit réellement ce que les chercheurs supposent qu'elle prédit. Il trouve qu'elle ne le fait pas.

Les auteurs ont construit un banc d'essai appelé GRIDUMM qui reproduit les ingrédients structurels clés de l'entraînement des modèles multimodaux unifiés tout en rendant exactement calculable le compromis fondamental entre compréhension et génération. Sur 63 configurations et 372 points de contrôle mesurés, aucune métrique de conflit directionnel n'a atteint une corrélation de Spearman absolue de 0,3 avec un intervalle de confiance excluant zéro. Une intervention de dose-réponse qui supprime monotonement le conflit a laissé le compromis plat, séparant corrélation et causalité. Les mesures d'interférence fonctionnelle ont surpassé les métriques de conflit directionnel, et la perte d'entraînement a suivi fortement le compromis. Les auteurs n'affirment pas que le conflit est inutile. Ils affirment que sa validité en tant que cible diagnostique doit être établie, non supposée.

C'est un résultat étroit sur une classe étroite de modèles. C'est aussi le type de découverte qui devrait faire hésiter quiconque lit un classement.

Ce que mesurent réellement les nouveaux benchmarks

Deux autres articles arXiv publiés dans la même fenêtre adoptent une ligne similaire de scepticisme. ChartDensity-Bench, soumis le 30 septembre, évalue les grands modèles de langage multimodaux sur la reconstruction de données numériques à partir de graphiques scientifiques sous une densité visuelle contrôlée, en faisant varier le nombre de graphiques affichés simultanément pour k égal à 1, 3, 6 et 9. Les expériences sur cinq MLLMs récents montrent que la reconstruction numérique se dégrade lorsque la densité visuelle augmente, et que l'ampleur de cette dégradation varie considérablement d'un modèle à l'autre. Les comparaisons appariées au niveau des graphiques de l'article ont révélé qu'un même graphique source peut entraîner une erreur de reconstruction plus élevée lorsqu'il est intégré dans un contexte visuel plus dense. C'est un mode d'échec proche de l'hallucination avec une mesure propre. Le modèle ne refuse pas. Il produit des nombres.

Un troisième article, Reverse Scoring for Diffusion Language Model Agents, soumis le 29 septembre, trace une défaillance spécifique dans les agents de modèles de langage basés sur la diffusion. Ils tombent dans des boucles de réessai, réémettant une action longtemps après qu'elle a échoué. Les auteurs attribuent cela au décodage masqué qui engage les positions dont il est le plus confiant tout en différant les incertaines, de sorte qu'à l'état d'échec, le contexte offre déjà un remplissage confiant pour la décision différée, à savoir l'action échouée elle-même. Ils modélisent la distorsion comme une corruption aveugle à la tâche et proposent un remède sans entraînement appelé Reflect Reverse, qu'ils évaluent sur quatre benchmarks incarnés multi-tours.

Il y a un motif à travers ces trois articles. Chacun isole une manière spécifique dont un modèle peut se tromper avec assurance, la mesure dans des conditions contrôlées, et trouve que la métrique proxy populaire ne suit pas le résultat. Aucun ne propose un score d'hallucination général. Tous suggèrent que les scores d'hallucination généraux font moins de travail que leurs éditeurs ne l'impliquent.

Pour avoir une idée de l'ampleur à laquelle un benchmark peut déplacer la conversation, regardez l'espace des modèles de décision. InfoQ a rapporté que TypeSafe AI a lancé Jev, qui ne génère pas du texte du tout mais renvoie des décisions typées et probabilistes avec une valeur de confiance, de sorte que le code appelant peut agir au-dessus d'un seuil et escalader en dessous. Les coûts d'entrée sont de 0,042 $ par million de tokens, la sortie est gratuite, la fenêtre de contexte est de 32 000 tokens, et TypeSafe cite une latence bout en bout de 70ms à 500ms. Vercel a ajouté Jev à AI Gateway le deuxième jour et a déclaré qu'il a atteint près de 13 % des équipes payantes en 24 heures, le double de la part de la famille GPT-5.6.

Amazon a suivi. TechCrunch a rapporté le 1er octobre qu'AWS a lancé Strands Decider 2B, un modèle de décision open source inspiré de Jev, construit sur le tronc de Qwen3.5-2B. Il trie entre des options pré-décidées et renvoie une mesure de confiance. L'ingénieur distingué d'Amazon Marc Brooker a déclaré à TechCrunch que le modèle a brièvement atteint la première place du classement Jevbench pour les modèles de sa taille, et que l'attrait est une étape de workflow plus fiable grâce aux scores de confiance et à un domaine fermé de réponses, avec une latence et potentiellement un coût plus faibles.

Le fondateur de TypeSafe Diogo Almeida a été franc sur l'affluence. « Je comprends que les gens pensent que c'est une ruée vers l'or, mais ils sous-estiment peut-être la difficulté de rendre les modèles réellement intelligents », a-t-il déclaré à TechCrunch. Le lot actuel, a-t-il dit, « semble plus » une vague d'imitateurs. Qu'il tienne ou non, la direction est claire : certains constructeurs répondent au problème de fiabilité en restreignant l'espace de sortie plutôt qu'en promettant un meilleur modèle général.

L'argument de sécurité arrive avant les preuves

Le propre cadrage de Google pour restreindre Argon est que la capacité frontalière à ce niveau nécessite une approche progressive. Koray Kavukcuoglu, architecte en chef IA de Google, l'a écrit dans le billet de blog annonçant le modèle. Google a déclaré qu'Argon était conçu pour refuser les demandes qui pourraient aider à mener des cyberattaques ou à développer des armes chimiques, biologiques ou nucléaires, et qu'il surveille le raisonnement du modèle pour l'empêcher de s'éloigner de l'intention des utilisateurs, un risque que les chercheurs appellent le décalage (misalignment).

The Guardian a rapporté que le déploiement prudent imite Anthropic, qui a maintenu Claude Mythos Preview restreint à un petit nombre d'organisations de confiance. Washington a brièvement forcé Anthropic à suspendre l'accès à ses modèles Claude Mythos et Claude Fable publiés publiquement en juin, et a depuis mis en place un processus volontaire pour examiner les modèles d'IA les plus puissants avant leur sortie. L'annonce est intervenue un jour après que Donald Trump a accueilli de hauts dirigeants technologiques, dont Sundar Pichai et Dario Amodei d'Anthropic, à la Maison Blanche, où ils ont signé un accord volontaire s'engageant à contrôler les risques de leurs propres systèmes d'IA.

Google a déclaré que les premiers testeurs ont utilisé Argon pour découvrir un défaut dans un logiciel utilisé par des hôpitaux du monde entier qui exposait des informations personnelles sensibles, quelque chose que d'autres modèles avancés avaient manqué. C'est une anecdote, du fournisseur, sur un modèle non en circulation générale. Traitez-la comme une affirmation de capacité d'une partie intéressée.

La lutte sur la provenance se déroule en parallèle. CNBC a rapporté qu'OpenAI a déclaré avoir identifié et perturbé une campagne coordonnée pour extraire le raisonnement protégé de ses modèles, reliant un cluster central de l'activité au startup chinois Moonshot AI. L'activité a commencé début juillet et a explosé à 16 000 demandes de plus de 4 000 utilisateurs sur deux jours, avec une activité connexe chez plus de 15 000 utilisateurs. OpenAI a déclaré que les opérateurs n'ont pas violé son chiffrement, ses bases de données ou ses conversations utilisateurs stockées, et qu'il avait pleinement perturbé la campagne le 28 juillet.

The Register a noté la maladresse de la plainte, compte tenu de l'histoire d'OpenAI d'entraînement sur des données web, et a rapporté que The Register a demandé à OpenAI quels étaient les modèles ciblés en juillet et n'a pas eu de réponse. Il a également rapporté que Michael Kratsios, assistant de Trump pour la science et la technologie, a accusé Moonshot AI fin juillet d'avoir créé son modèle Kimi K3 en distillant Fable d'Anthropic. Claude Opus 5.5 d'Anthropic, sorti une semaine avant ce rapport, est livré avec une défense contre la distillation appelée preserved thinking, introduite avec Fable 5.1.

Moonshot n'a pas immédiatement répondu aux demandes de commentaire de CNBC, et The Register a déclaré n'avoir pas non plus reçu de réponse immédiate. L'accusation centrale reste donc à sens unique dans le registre public.

L'autre fil à surveiller est l'origine des données d'entraînement et dans quelles conditions. The Guardian a rapporté le 1er octobre qu'Anthropic a exhorté le gouvernement Albanese à envisager une approbation conditionnelle pour l'entraînement sur des œuvres australiennes protégées par le droit d'auteur selon un modèle opt-out, après avoir concédé qu'il ne sécuriserait pas une exemption générale du droit d'auteur. L'ABC et SBS ont répliqué dans des soumissions à une enquête parlementaire fédérale, l'ABC avertissant d'une cannibalisation de l'industrie des nouvelles australiennes et les deux diffuseurs suggérant que les entreprises d'IA soient incluses dans l'incitatif de négociation des nouvelles.

La soumission d'Anthropic affirmait que la technologie pourrait transformer l'économie australienne tout en avertissant de graves implications pour la sécurité nationale, la résilience des infrastructures critiques et la sécurité publique. Le comité spécial conjoint sur l'IA tient des audiences à Sydney la semaine prochaine, avec la participation prévue de dirigeants d'Anthropic et d'OpenAI.

Aucun de cela ne tranche la question de savoir si un modèle donné est fiable. Cela suggère que l'industrie livre maintenant des affirmations de fiabilité plus vite qu'elle ne livre de moyens de les vérifier, et que les vérifications qui existent tendent à être étroites, contrôlées et peu flatteuses pour les métriques proxy que tout le monde cite.

Commentaires 0

Sources

13
  1. 01Google rolls out new Gemini AI model but restricts access over safety concernsEN
  2. 02Google releases Gemini 4 Argon, called its most powerful model yetEN
  3. 03Does Gradient Conflict Predict the Understanding-Generation Trade-off? A Controlled Audit of Conflict-Metric Validity in Unified Multimodal ModelsEN
  4. 04ChartDensity-Bench: Benchmarking MLLMs for Numerical Data Reconstruction under Visual DensityEN
  5. 05Does This Action Still Explain the Task? Reverse Scoring for Diffusion Language Model AgentsEN
  6. 06TypeSafe AI Releases Jev: A Decision-Only Model That Returns Typed Probabilities Instead of TextEN
  7. 07Amazon releases its own Jev clone as decision models flood the webEN
  8. 08AI race heats up as OpenAI flags alleged model-copying campaignEN
  9. 09Irony alert: OpenAI whines that Chinese model stole its special IP that it stole from everybody elseEN
  10. 10Anthropic pushes for opt-out model for Australian content as ABC warns of 'cannibalisation' of newsEN
  11. 11Microsoft AI releases new transcription and text-to-speech models for voice agentsEN
  12. 12Ideogram says its new model can edit part of an image without messing up the restEN
  13. 13ThreatsDay: AI-Powered Zero-Day Chain, 543K Live Secrets, Model Inspection RCE and 13 More StoriesEN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Sophie Leclerc

Sophie Leclerc

IA, modèles et technologies

Sophie Leclerc couvre les technologies, l'IA et les modèles ainsi que les médias et l'internet pour FLASH24, en travaillant à partir des dépôts de code, des articles scientifiques et des documents techniques plutôt que des annonces. Elle vérifie chaque chiffre en remontant aux jeux de données d'origine et en comparant les versions successives des modèles. Elle interroge régulièrement des ingénieurs et des chercheurs, et suit les calendriers de publication des principales conférences du secteur. Son intérêt personnel pour l'auto-hébergement et les réseaux domestiques nourrit directement sa couverture des infrastructures et des modèles ouverts. Elle ne publie pas de performance annoncée sans méthode de mesure vérifiable.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.