Terminal-Bench und DeepSWE: V4.1 Flash schlägt die Frontier-Modelle bei Agentenaufgaben
In der Tabelle der Modellkarte erreicht V4.1-Flash 90,6 Punkte bei Terminal-Bench 2.1 und 74,2 bei DeepSWE v1.1. Damit liegt das Modell auf dem Niveau von Opus-5.0, GPT-5.6 Sol, K3 und GLM-5.3 oder darüber.

Die Modellkarte von DeepSeek-V4.1-Flash enthält eine Vergleichstabelle. Darin stehen die Frontier-Modelle Opus-5.0, GPT-5.6 Sol, K3 und GLM-5.3 sowie zwei Vorgänger aus der eigenen Familie, DeepSeek-V4-Pro und DeepSeek-V4-Flash. Alle Messungen liefen mit maximalem Denkaufwand.
Bei GPQA Diamond erreicht V4.1-Flash 90,9 Punkte. Die Konkurrenten liegen etwas höher: GPT-5.6 Sol kommt auf 94,1, Opus-5.0 auf 93,4, K3 auf 92,9, GLM-5.3 auf 88,1. In der Codeforces-Bewertung erzielt das Modell ein Rating von 3471. Das liegt deutlich über DeepSeek-V4-Pro (3348) und DeepSeek-V4-Flash (3289).
Dort, wo Agenten zählen
Erst bei den Agentenaufgaben dreht sich das Bild. In Terminal-Bench 2.1 holt V4.1-Flash 90,6 Punkte, der höchste Wert der ganzen Tabelle. Es folgen Opus-5.0 (89,1), GPT-5.6 Sol (88,8), K3 (88,3) und GLM-5.3 (88,2). In DeepSWE v1.1, das die Lösung realer Programmieraufgaben misst, erreicht das Modell 74,2. Opus-5.0 kommt auf 74,0, GPT-5.6 Sol auf 73,0, K3 auf 67,5 und GLM-5.3 auf 66,9.
Ein schärferes Bild liefern die neueren Versionen des Tests. In Terminal-Bench 3.0 hat das Modell 30,0 Punkte, Opus-5.0 dagegen 43,3 und GPT-5.6 Sol 34,4. In Terminal-Bench 4.0 sind es 31,2 für V4.1-Flash, 51,8 für Opus-5.0 und 39,9 für GPT-5.6 Sol. In diesen beiden schwereren Sets ist der Vorsprung der amerikanischen Modelle deutlich. Er beträgt mehr als zehn Punkte.
Das Harness verschiebt das Ergebnis um 8 Punkte
DeepSeek veröffentlicht außerdem Ergebnisse von V4.1-Flash in verschiedenen Harnesses, also Agenten-Scaffolds. In DeepSWE v1.1 erzielt dasselbe Modell 74,2 im Harness mini-SWE, 72,6 in DSH Minimal, 70,5 in DSH Standard und 67,6 in DSH PTC. Bei externen Harnesses sind es 69,8 in Claude Code, 66,2 in Pi, 65,6 in Codex und 65,5 in OpenCode. Die Spanne von fast 9 Punkten bei identischen Gewichten zeigt: Über das Ergebnis eines Agenten entscheidet heute nicht nur das Modell, sondern auch die Schicht, die es umhüllt.
In anderen Kategorien erreicht V4.1-Flash 88,1 Punkte in CyberGym und 54,8 in AutomationBench, mit Werkzeugen 63,9 in HLE. Dieselbe Tabelle zeigt einen deutlichen Generationssprung innerhalb der Familie. In Terminal-Bench 4.0 hatte DeepSeek-V4-Pro 12,4 Punkte, V4-Flash 7,0. V4.1-Flash hob dieses Ergebnis auf 31,2, also mehr als das Doppelte, und das bei 8 Milliarden aktiven Parametern am Eingang.
Der unabhängige Dienst Artificial Analysis meldet für dasselbe Modell zwei Modi: maximales Schlussfolgern mit einem Intelligenzindex von 39 und einen Modus ohne Schlussfolgern mit einem Index von 25. Die Gegenüberstellung zweier völlig unterschiedlicher Methodiken zeigt, wie vorsichtig einzelne Ranglisten zu lesen sind.
Quellen
2- 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
- 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN
Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.
Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.
Kommentare
0- Noch keine Kommentare — seien Sie der Erste.