Vai al contenuto
Ora nel mondoEU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

portale su IA e tecnologiaeventi · analisi · interviste · approfondimenti tecnici

Cerca
LIVE
›

Terminal-Bench e DeepSWE: V4.1 Flash batte i modelli frontier nei compiti agentici

Nella tabella della scheda del modello V4.1-Flash arriva a 90,6 punti su Terminal-Bench 2.1 e 74,2 su DeepSWE v1.1, un risultato in linea o sopra Opus-5.0, GPT-5.6 Sol, K3 e GLM-5.3.

IA e modelliAnalisiGiulia FerrariPubblicato: 25 settembre 20267 min di letturaFonti 2
Terminal-Bench e DeepSWE: V4.1 Flash batte i modelli frontier nei compiti agentici

La scheda del modello DeepSeek-V4.1-Flash mette a confronto i modelli frontier, Opus-5.0, GPT-5.6 Sol, K3 e GLM-5.3, e due predecessori della famiglia, DeepSeek-V4-Pro e DeepSeek-V4-Flash. Tutte le misurazioni sono state fatte con il massimo sforzo di ragionamento.

Nel ragionamento V4.1-Flash ottiene 90,9 punti su GPQA Diamond. I concorrenti stanno poco più in alto: GPT-5.6 Sol 94,1, Opus-5.0 93,4, K3 92,9, mentre GLM-5.3 si ferma a 88,1. Nella valutazione Codeforces il modello registra un rating di 3471, nettamente sopra DeepSeek-V4-Pro (3348) e DeepSeek-V4-Flash (3289).

Dove contano gli agenti

Sui compiti agentici il quadro si capovolge. Su Terminal-Bench 2.1 V4.1-Flash totalizza 90,6 punti, il valore più alto dell'intera tabella, davanti a Opus-5.0 (89,1), GPT-5.6 Sol (88,8), K3 (88,3) e GLM-5.3 (88,2). Su DeepSWE v1.1, che misura la risoluzione di compiti di programmazione reali, il modello raggiunge 74,2 contro 74,0 di Opus-5.0, 73,0 di GPT-5.6 Sol, 67,5 di K3 e 66,9 di GLM-5.3.

Le versioni più recenti del test danno un quadro più severo. Su Terminal-Bench 3.0 il modello ha 30,0 punti contro 43,3 di Opus-5.0 e 34,4 di GPT-5.6 Sol, e su Terminal-Bench 4.0 arriva a 31,2 contro 51,8 di Opus-5.0 e 39,9 di GPT-5.6 Sol. In questi due set più difficili il vantaggio dei modelli americani è netto e vale una dozzina di punti.

L'harness sposta il risultato di 8 punti

DeepSeek pubblica anche i risultati di V4.1-Flash con diversi scaffold agentici. Su DeepSWE v1.1 lo stesso modello ottiene 74,2 con l'harness mini-SWE, 72,6 con DSH Minimal, 70,5 con DSH Standard e 67,6 con DSH PTC. Negli scaffold esterni segna invece 69,8 con Claude Code, 66,2 con Pi, 65,6 con Codex e 65,5 con OpenCode. Una forbice di quasi 9 punti a parità di pesi mostra che oggi il risultato di un agente dipende non solo dal modello, ma anche dallo strato che lo avvolge.

In altre categorie V4.1-Flash raggiunge 88,1 punti su CyberGym e 54,8 su AutomationBench, e con gli strumenti 63,9 su HLE. La stessa tabella mostra un salto generazionale netto dentro la famiglia: su Terminal-Bench 4.0 DeepSeek-V4-Pro aveva 12,4 e V4-Flash 7,0 punti. V4.1-Flash ha portato quel risultato a 31,2, cioè più del doppio, e con 8 miliardi di parametri attivi in ingresso.

Il servizio indipendente Artificial Analysis riporta per lo stesso modello due modalità: ragionamento massimo con indice di intelligenza 39 e modalità senza ragionamento con indice 25. Il confronto tra due metodologie del tutto diverse mostra con quanta cautela vanno letti i singoli ranking.

Commenti 0

Fonti

2
  1. 01DeepSeek-V4.1-Flash — wyniki oceny i tabele porównawczeEN
  2. 02DeepSeek V4.1 Flash — indeks inteligencji i prędkość (Artificial Analysis)EN

Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.

I contenuti sono stati preparati dalla redazione con il supporto dell'IA.

Giulia Ferrari

Giulia Ferrari

IA, modelli e tecnologie

Giulia Ferrari scrive di tecnologia, IA e modelli e media e internet per FLASH24, partendo da dataset pubblici, preprint e registri di versioni dei modelli. Controlla ogni numero confrontando benchmark dichiarati e risultati riproducibili, e scarta le stime senza fonte. Segue le audizioni in calendario, parla con ricercatori e ingegneri, e mette a confronto release e changelog prima di pubblicare. Fuori dalla redazione smonta stampanti 3D, recupera vecchi computer e studia come i modelli imparano dai rifiuti del web. Non pubblica un dato se non può ricostruirne il percorso.

Redazione →

Commenti

0
  1. Nessun commento — sii il primo.

Scrivi un commento

I commenti sono pubblici. Non pubblichiamo insulti, spam né pubblicità.