Terminal-Bench 与 DeepSWE:V4.1 Flash 在代理任务上反超前沿模型
模型卡的对比表显示,V4.1-Flash 在 Terminal-Bench 2.1 上拿到 90.6 分,在 DeepSWE v1.1 上拿到 74.2 分,与 Opus-5.0、GPT-5.6 Sol、K3 和 GLM-5.3 持平,甚至更高。

DeepSeek-V4.1-Flash 的模型卡里有一张对比表。表里列着前沿模型 Opus-5.0、GPT-5.6 Sol、K3 和 GLM-5.3,旁边是同系列的两个前代 DeepSeek-V4-Pro 和 DeepSeek-V4-Flash。所有测量都在最大推理强度下完成。
推理方面,V4.1-Flash 在 GPQA Diamond 上得 90.9 分。对手略高一些:GPT-5.6 Sol 94.1,Opus-5.0 93.4,K3 92.9,GLM-5.3 只有 88.1。在 Codeforces 评测中,该模型评分为 3471,明显高于 DeepSeek-V4-Pro(3348)和 DeepSeek-V4-Flash(3289)。
到了代理任务,局面翻转
代理任务里形势反过来。在 Terminal-Bench 2.1 上,V4.1-Flash 拿到 90.6 分,是整张表里最高的,排在 Opus-5.0(89.1)、GPT-5.6 Sol(88.8)、K3(88.3)和 GLM-5.3(88.2)之前。DeepSWE v1.1 衡量的是真实编程任务的求解能力,该模型得 74.2,Opus-5.0 为 74.0,GPT-5.6 Sol 为 73.0,K3 为 67.5,GLM-5.3 为 66.9。
更新的测试版本给出更严峻的画面。在 Terminal-Bench 3.0 上,该模型为 30.0 分,Opus-5.0 为 43.3,GPT-5.6 Sol 为 34.4。在 Terminal-Bench 4.0 上,该模型为 31.2,Opus-5.0 为 51.8,GPT-5.6 Sol 为 39.9。这两个测试集更难,美国模型的领先很明显,达到十几分。
运行框架能让成绩差出 8 分
DeepSeek 还公布了 V4.1-Flash 在不同代理脚手架下的结果。在 DeepSWE v1.1 上,同一个模型在 mini-SWE 框架下得 74.2,DSH Minimal 下 72.6,DSH Standard 下 70.5,DSH PTC 下 67.6。外部框架下,Claude Code 为 69.8,Pi 为 66.2,Codex 为 65.6,OpenCode 为 65.5。权重完全相同,差距却接近 9 分。今天决定代理成绩的不只是模型,还有包裹它的那一层。
其他类别中,V4.1-Flash 在 CyberGym 上得 88.1 分,在 AutomationBench 上得 54.8 分,带工具时在 HLE 上得 63.9 分。同一张表还显示家族内部存在明显的代际跃升。在 Terminal-Bench 4.0 上,DeepSeek-V4-Pro 为 12.4 分,V4-Flash 为 7.0 分。V4.1-Flash 把这一成绩提到 31.2,超过两倍,而输入侧只有 80 亿活跃参数。
独立机构 Artificial Analysis 对同一模型报告了两种模式:最大推理模式下智能指数为 39,无推理模式下指数为 25。两套方法完全不同,并列在一起说明单个排行榜需要谨慎阅读。
资料来源
2- 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
- 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。