Aller au contenu
Heure mondialeEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portail sur l'IA et la technologieactualités · analyses · entretiens · fond technique

Rechercher
EN DIRECT
›

Terminal-Bench et DeepSWE : V4.1 Flash devance les modèles frontière sur les tâches agentiques

Dans le tableau de sa fiche modèle, V4.1-Flash atteint 90,6 points sur Terminal-Bench 2.1 et 74,2 sur DeepSWE v1.1, un résultat au niveau ou au-dessus d'Opus-5.0, GPT-5.6 Sol, K3 et GLM-5.3.

IA & modèlesAnalyseCamille RousseauPublié le: 25 septembre 20267 min de lectureSources 2
Terminal-Bench et DeepSWE : V4.1 Flash devance les modèles frontière sur les tâches agentiques

La fiche du modèle DeepSeek-V4.1-Flash contient un tableau comparatif. On y trouve les modèles frontière Opus-5.0, GPT-5.6 Sol, K3 et GLM-5.3, mais aussi deux prédécesseurs de la famille, DeepSeek-V4-Pro et DeepSeek-V4-Flash. Toutes les mesures ont été prises au niveau d'effort de raisonnement maximal.

En raisonnement, V4.1-Flash obtient 90,9 points sur GPQA Diamond. Ses concurrents font un peu mieux : GPT-5.6 Sol 94,1, Opus-5.0 93,4, K3 92,9, tandis que GLM-5.3 descend à 88,1. Sur Codeforces, le modèle enregistre un rating de 3471, nettement au-dessus de DeepSeek-V4-Pro (3348) et de DeepSeek-V4-Flash (3289).

Là où les agents comptent

Dans les tâches agentiques, le tableau s'inverse. Sur Terminal-Bench 2.1, V4.1-Flash prend 90,6 points, le meilleur score de tout le tableau, devant Opus-5.0 (89,1), GPT-5.6 Sol (88,8), K3 (88,3) et GLM-5.3 (88,2). Sur DeepSWE v1.1, qui mesure la résolution de tâches de programmation réelles, le modèle atteint 74,2 contre 74,0 pour Opus-5.0, 73,0 pour GPT-5.6 Sol, 67,5 pour K3 et 66,9 pour GLM-5.3.

Les versions plus récentes du test donnent une image plus dure. Sur Terminal-Bench 3.0, le modèle est à 30,0 points contre 43,3 pour Opus-5.0 et 34,4 pour GPT-5.6 Sol. Sur Terminal-Bench 4.0, il est à 31,2 contre 51,8 pour Opus-5.0 et 39,9 pour GPT-5.6 Sol. Dans ces deux ensembles plus difficiles, l'avance des modèles américains est nette : elle se compte en dizaines de points.

Le harness déplace le résultat de 8 points

DeepSeek publie aussi les résultats de V4.1-Flash dans différents « harness », autrement dit des scaffolds d'agents. Sur DeepSWE v1.1, le même modèle prend 74,2 dans le harness mini-SWE, 72,6 dans DSH Minimal, 70,5 dans DSH Standard et 67,6 dans DSH PTC. Dans des harness externes, il obtient 69,8 dans Claude Code, 66,2 dans Pi, 65,6 dans Codex et 65,5 dans OpenCode. Un écart de presque 9 points à poids identiques montre qu'aujourd'hui le résultat d'un agent ne dépend pas seulement du modèle, mais aussi de la couche qui l'enveloppe.

Dans d'autres catégories, V4.1-Flash atteint 88,1 points sur CyberGym et 54,8 sur AutomationBench, et avec des outils 63,9 sur HLE. Le même tableau montre un net saut générationnel à l'intérieur de la famille : sur Terminal-Bench 4.0, DeepSeek-V4-Pro était à 12,4 et V4-Flash à 7,0 points. V4.1-Flash a porté ce résultat à 31,2, soit plus du double, et cela avec 8 milliards de paramètres actifs en entrée.

Le service indépendant Artificial Analysis rapporte pour ce même modèle deux modes : raisonnement maximal avec un indice d'intelligence de 39, et mode sans raisonnement avec un indice de 25. La confrontation de deux méthodologies entièrement différentes montre avec quelle prudence il faut lire les classements pris isolément.

Commentaires 0

Sources

2
  1. 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
  2. 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN

Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.

Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.

Camille Rousseau

Camille Rousseau

IA, modèles et technologies

Camille Rousseau suit les technologies, l’IA et les modèles ainsi que les médias et l’internet pour FLASH24, en partant des dépôts de modèles, des publications techniques et des données publiques, sans reprendre les annonces sans vérification. Elle contrôle les chiffres d’entraînement et de coût en remontant aux jeux de données, aux versions de modèles et aux méthodes de mesure. Elle interroge des chercheurs et des équipes produit, compare les résultats entre modèles et attend les mises à jour de calendrier des principaux fournisseurs. Son intérêt pour l’impression 3D, les vieux ordinateurs et la façon dont les modèles apprennent rejoint directement son travail sur l’IA et les technologies. Elle ne publie pas de chiffres sans source ni de comparaison sans protocole reproductible.

Rédaction →

Commentaires

0
  1. Aucun commentaire — soyez le premier.

Écrire un commentaire

Les commentaires sont publics. Nous ne publions ni insultes, ni spam, ni publicité.