Zum Inhalt
WeltzeitEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portal über KI und Technologieereignisse · analysen · interviews · technischer hintergrund

Suche
LIVE
›

Terminal-Bench und DeepSWE: V4.1 Flash schlägt die Frontier-Modelle bei Agentenaufgaben

In der Tabelle der Modellkarte erreicht V4.1-Flash 90,6 Punkte bei Terminal-Bench 2.1 und 74,2 bei DeepSWE v1.1. Damit liegt das Modell auf dem Niveau von Opus-5.0, GPT-5.6 Sol, K3 und GLM-5.3 oder darüber.

KI & ModelleAnalyseKatrin HoffmannVeröffentlicht: 25. September 20267 Min. LesezeitQuellen 2
Terminal-Bench und DeepSWE: V4.1 Flash schlägt die Frontier-Modelle bei Agentenaufgaben

Die Modellkarte von DeepSeek-V4.1-Flash enthält eine Vergleichstabelle. Darin stehen die Frontier-Modelle Opus-5.0, GPT-5.6 Sol, K3 und GLM-5.3 sowie zwei Vorgänger aus der eigenen Familie, DeepSeek-V4-Pro und DeepSeek-V4-Flash. Alle Messungen liefen mit maximalem Denkaufwand.

Bei GPQA Diamond erreicht V4.1-Flash 90,9 Punkte. Die Konkurrenten liegen etwas höher: GPT-5.6 Sol kommt auf 94,1, Opus-5.0 auf 93,4, K3 auf 92,9, GLM-5.3 auf 88,1. In der Codeforces-Bewertung erzielt das Modell ein Rating von 3471. Das liegt deutlich über DeepSeek-V4-Pro (3348) und DeepSeek-V4-Flash (3289).

Dort, wo Agenten zählen

Erst bei den Agentenaufgaben dreht sich das Bild. In Terminal-Bench 2.1 holt V4.1-Flash 90,6 Punkte, der höchste Wert der ganzen Tabelle. Es folgen Opus-5.0 (89,1), GPT-5.6 Sol (88,8), K3 (88,3) und GLM-5.3 (88,2). In DeepSWE v1.1, das die Lösung realer Programmieraufgaben misst, erreicht das Modell 74,2. Opus-5.0 kommt auf 74,0, GPT-5.6 Sol auf 73,0, K3 auf 67,5 und GLM-5.3 auf 66,9.

Ein schärferes Bild liefern die neueren Versionen des Tests. In Terminal-Bench 3.0 hat das Modell 30,0 Punkte, Opus-5.0 dagegen 43,3 und GPT-5.6 Sol 34,4. In Terminal-Bench 4.0 sind es 31,2 für V4.1-Flash, 51,8 für Opus-5.0 und 39,9 für GPT-5.6 Sol. In diesen beiden schwereren Sets ist der Vorsprung der amerikanischen Modelle deutlich. Er beträgt mehr als zehn Punkte.

Das Harness verschiebt das Ergebnis um 8 Punkte

DeepSeek veröffentlicht außerdem Ergebnisse von V4.1-Flash in verschiedenen Harnesses, also Agenten-Scaffolds. In DeepSWE v1.1 erzielt dasselbe Modell 74,2 im Harness mini-SWE, 72,6 in DSH Minimal, 70,5 in DSH Standard und 67,6 in DSH PTC. Bei externen Harnesses sind es 69,8 in Claude Code, 66,2 in Pi, 65,6 in Codex und 65,5 in OpenCode. Die Spanne von fast 9 Punkten bei identischen Gewichten zeigt: Über das Ergebnis eines Agenten entscheidet heute nicht nur das Modell, sondern auch die Schicht, die es umhüllt.

In anderen Kategorien erreicht V4.1-Flash 88,1 Punkte in CyberGym und 54,8 in AutomationBench, mit Werkzeugen 63,9 in HLE. Dieselbe Tabelle zeigt einen deutlichen Generationssprung innerhalb der Familie. In Terminal-Bench 4.0 hatte DeepSeek-V4-Pro 12,4 Punkte, V4-Flash 7,0. V4.1-Flash hob dieses Ergebnis auf 31,2, also mehr als das Doppelte, und das bei 8 Milliarden aktiven Parametern am Eingang.

Der unabhängige Dienst Artificial Analysis meldet für dasselbe Modell zwei Modi: maximales Schlussfolgern mit einem Intelligenzindex von 39 und einen Modus ohne Schlussfolgern mit einem Index von 25. Die Gegenüberstellung zweier völlig unterschiedlicher Methodiken zeigt, wie vorsichtig einzelne Ranglisten zu lesen sind.

Kommentare 0

Quellen

2
  1. 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
  2. 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN

Alle Zahlen und Zitate in diesem Text stammen aus den unten genannten Quellen.

Die Materialien wurden vom Redaktionsteam mit Unterstützung von KI erstellt.

Katrin Hoffmann

Katrin Hoffmann

KI, Modelle und Technik

Katrin Hoffmann schreibt für FLASH24 über Technik, KI und Modelle sowie Medien und Internet und stützt sich dabei auf Primärquellen wie Herstellerangaben, Studien und Protokolle statt auf Pressemitteilungen. Bei Benchmarks prüft sie Messmethoden, Testumgebungen und Reproduzierbarkeit, bevor sie Zahlen übernimmt. Für ihre Artikel spricht sie mit Entwicklern und Forschern, wartet auf Konferenzankündigungen und vergleicht Versionsstände von Modellen und Standards. Privat betreibt sie Selfhosting und Heimnetze und dokumentiert ihre eigene Infrastruktur, was ihrer Redaktionsarbeit zugutekommt. Sie veröffentlicht keine Zahlen ohne nachvollziehbare Quelle.

Redaktion →

Kommentare

0
  1. Noch keine Kommentare — seien Sie der Erste.

Kommentar schreiben

Kommentare sind öffentlich sichtbar. Wir veröffentlichen keine Beleidigungen, Werbung oder Spam.