5000 sandbox al secondo: DeepSeek presenta DSec, l'infrastruttura per addestrare gli agenti
Un nuovo paper di DeepSeek firmato da Liang Wenfeng presenta DSec, il sistema che genera oltre 5000 sandbox al secondo, fino a 3 milioni al giorno, con un picco di 380.000 in esecuzione simultanea.

Nell'addestramento dei grandi modelli si compete sul calcolo. In quello degli agenti si compete sull'ambiente. Il nuovo paper di DeepSeek, firmato da Liang Wenfeng, presenta un sistema chiamato DSec (DeepSeek Elastic Compute), nato per creare sandbox in serie da destinare all'addestramento degli agenti. Secondo i dettagli tecnici resi pubblici, DSec produce oltre 5000 sandbox al secondo, arriva a 3 milioni in un giorno e tocca un picco di 380.000 sandbox in esecuzione contemporanea.
Il singolo cluster che regge questa scala è imponente: circa 160 nodi, 30.000 core CPU e 250TB di memoria. I numeri dicono che il collo di bottiglia nell'addestramento degli agenti non è più solo la GPU. Ora pesano anche la pianificazione e la fornitura degli ambienti.
Perché addestrare un agente costa tanta fatica? L'ambiente del pre-addestramento è il cluster di GPU, dove si somministrano dati e si calcolano i gradienti. Un agente è tutt'altra cosa. Dentro una sandbox scrive codice, avvia compilazioni, apre un browser, persino installa un sistema operativo. Ogni passo eseguito cambia lo stato dell'ambiente e può mandarlo in pezzi in qualsiasi momento. A ogni ciclo di addestramento serve quindi una sandbox nuova e pulita, usa e getta, da buttare a fine corsa.
Il problema, girando e rigirando, riporta sempre all'infrastruttura. A una velocità di 5000 sandbox al secondo, ognuna deve avere installato un sistema operativo completo e la sua catena di strumenti. E centinaia di migliaia di sandbox concorrenti non devono far esplodere memoria e CPU del cluster.
Il paper rileva anche che tipi diversi di task per agenti richiedono ambienti molto diversi. Un agente che risolve esercizi di programmazione ha bisogno solo di un ambiente di chiamate a funzione senza stato. Un agente per SWE-bench richiede un user space Linux completo. Negli scenari di attacco e difesa informatica e di computer-use l'isolamento a livello di container non basta e serve una macchina virtuale. Per addestrare agenti che usano software commerciale occorre addirittura un Windows o un macOS completo, con interfaccia grafica e driver.
Questo spiega anche perché il miglioramento delle capacità degli agenti dipenda sempre di più dall'ingegneria dell'infrastruttura. Come si costruisce un ambiente, come si pianificano le sandbox, come si isolano le risorse: le risposte a queste domande decidono se un agente può lavorare in modo stabile nel mondo reale.
Per l'ecosistema cinese del calcolo, DSec segnala una tendenza: man mano che le capacità dei modelli si avvicinano, l'infrastruttura ingegneristica di addestramento e inferenza sta diventando il fattore che crea il divario.
Fonti
2Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.