Terminal-Bench i DeepSWE: V4.1 Flash wygrywa z frontierem w zadaniach agentowych
W tabeli karty modelu V4.1-Flash ma 90,6 punktu w Terminal-Bench 2.1 i 74,2 w DeepSWE v1.1. To wynik na poziomie lub powyżej Opus-5.0, GPT-5.6 Sol, K3 i GLM-5.3.

Karta modelu DeepSeek-V4.1-Flash zawiera tabelę porównawczą z modelami frontierowymi: Opus-5.0, GPT-5.6 Sol, K3 oraz GLM-5.3. Obok nich stoją dwa poprzedniki rodziny, DeepSeek-V4-Pro i DeepSeek-V4-Flash. Wszystkie pomiary wykonano przy maksymalnym wysiłku rozumowania.
W rozumowaniu V4.1-Flash uzyskuje 90,9 punktu w GPQA Diamond. Konkurenci są nieco wyżej: GPT-5.6 Sol 94,1, Opus-5.0 93,4, K3 92,9. GLM-5.3 wypada na 88,1. W ocenie Codeforces model notuje rating 3471, wyraźnie ponad DeepSeek-V4-Pro (3348) i DeepSeek-V4-Flash (3289).
Tam, gdzie liczą się agenci
Dopiero w zadaniach agentowych obraz się odwraca. W Terminal-Bench 2.1 V4.1-Flash zdobywa 90,6 punktu, najwięcej w całej tabeli. Za nim są Opus-5.0 (89,1), GPT-5.6 Sol (88,8), K3 (88,3) i GLM-5.3 (88,2). W DeepSWE v1.1, który mierzy rozwiązywanie realnych zadań programistycznych, model osiąga 74,2 przy 74,0 dla Opus-5.0, 73,0 dla GPT-5.6 Sol, 67,5 dla K3 i 66,9 dla GLM-5.3.
Ostrzejszy obraz dają nowsze wersje testu. W Terminal-Bench 3.0 model ma 30,0 punktu przy 43,3 dla Opus-5.0 i 34,4 dla GPT-5.6 Sol. W Terminal-Bench 4.0 ma 31,2 przy 51,8 dla Opus-5.0 i 39,9 dla GPT-5.6 Sol. W tych dwóch trudniejszych zestawach przewaga amerykańskich modeli jest wyraźna i wynosi kilkanaście punktów.
Harness zmienia wynik o 8 punktów
DeepSeek publikuje też wyniki V4.1-Flash w różnych uprzężach, czyli scaffoldach agentowych. W DeepSWE v1.1 ten sam model zdobywa 74,2 w harnessie mini-SWE, 72,6 w DSH Minimal, 70,5 w DSH Standard i 67,6 w DSH PTC. W zewnętrznych uprzężach wypada słabiej: 69,8 w Claude Code, 66,2 w Pi, 65,6 w Codex i 65,5 w OpenCode. Rozpiętość niemal 9 punktów przy identycznych wagach pokazuje, że o wyniku agenta decyduje nie tylko model, ale i warstwa, która go opakowuje.
W innych kategoriach V4.1-Flash osiąga 88,1 punktu w CyberGym i 54,8 w AutomationBench, a z narzędziami 63,9 w HLE. Ta sama tabela pokazuje wyraźny skok pokoleniowy wewnątrz rodziny. W Terminal-Bench 4.0 DeepSeek-V4-Pro miał 12,4, a V4-Flash 7,0 punktu. V4.1-Flash podniósł ten wynik do 31,2, czyli ponad dwukrotnie, i to przy 8 mld aktywnych parametrów na wejściu.
Niezależny serwis Artificial Analysis raportuje dla tego samego modelu dwa tryby: maksymalne rozumowanie z indeksem inteligencji 39 i tryb bez rozumowania z indeksem 25. Zestawienie dwóch zupełnie różnych metodologii pokazuje, jak ostrożnie trzeba czytać pojedyncze rankingi.
Źródła
2- 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
- 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN
Wszystkie liczby i cytaty w tym tekście pochodzą z poniższych źródeł. Nie dopisujemy danych, których w źródłach nie ma.
Materiały zostały przygotowane przez zespół redakcyjny wspierane przez AI.
Komentarze
0- Brak komentarzy — bądź pierwszy.