DSec: DeepSeek mostra come produce 3 milioni di ambienti al giorno per gli agenti
In un lavoro firmato da Liang Wenfeng, DeepSeek descrive il sistema DSec: 5000 nuovi sandbox al secondo, 3 milioni al giorno e 380 mila in funzione nello stesso momento.

Addestrare un agente non significa dare dati in pasto alla rete. L'agente deve scrivere codice dentro un ambiente, compilarlo, aprire un browser e a volte installare un sistema. Ogni passo cambia lo stato di quell'ambiente, che può rompersi in qualsiasi momento. Per questo ogni ciclo di addestramento ha bisogno di un sandbox nuovo e pulito, da buttare via dopo l'uso. Il portale cinese IT之家 racconta il lavoro di DeepSeek chiamato DSec (DeepSeek Elastic Compute), firmato dal cofondatore dell'azienda, Liang Wenfeng.
La scala è il cuore del problema. DSec produce più di 5000 sandbox al secondo, cioè 3 milioni al giorno, e il picco di lavoro simultaneo arriva a 380 mila ambienti. Il singolo cluster che li gestisce conta circa 160 nodi, 30 mila core di processore e 250 TB di memoria RAM. La sovrassegnazione delle risorse e un impacchettamento denso permettono a un nodo di ospitare contemporaneamente 3200 container oppure 800 micro-macchine virtuali.
Il problema: un sistema per ciascuno dei 3 milioni di sandbox
Il collo di bottiglia non è la schedulazione, ma la costruzione dell'ambiente. L'approccio classico di Docker impacchetta immagine di base, directory di lavoro e set di strumenti in un'unica immagine completa, e su piccola scala funziona. In DSec il backend dei container ha consumato in totale 11 266 immagini di base e 102 171 directory di lavoro. Il 67,8 per cento dei sandbox richiede di aggiungere all'immagine di base almeno uno strato con la directory di lavoro o il pacchetto di strumenti. Con una varietà del genere, aggiornare un solo pacchetto obbligherebbe a ricostruire tutte le immagini che lo contengono.
La soluzione è spezzare l'ambiente in tre strati indipendenti, con versioni separate e in sola lettura, nel formato EROFS: immagine di base, directory di lavoro e pacchetto di strumenti. All'avvio del sandbox overlayfs li unisce. L'aggiornamento di un pacchetto tocca allora solo il suo strato. Il secondo elemento è il componente Chronus, che fa da intermediario nella comunicazione dall'interno del sandbox verso il framework di addestramento. Così il framework sa a che punto è l'agente e quale segnale di ritorno deve inviare.
Perché riguarda ogni modello agentico
La scheda del modello V4.1-Flash conferma che nell'addestramento è andata proprio così: la ricetta di post-addestramento è rimasta standard, e tutte le modifiche rilevanti hanno riguardato la pipeline dei dati, cioè la sintesi automatica e massiva di task e ambienti agentici. In altre parole, la qualità di un agente oggi dipende dalla fabbrica di ambienti che sta dietro, non dall'ennesimo trucco nell'algoritmo di apprendimento. DSec è la risposta di DeepSeek alla domanda su dove prendere 3 milioni di ambienti al giorno senza costruire un data center che si soffochi da solo.
Fonti
2- 01DeepSeek 新论文公开 Agent 训练,梁文锋署名 (IT之家)ZH
- 02DeepSeek-V4.1-Flash — sekcja Post-training (data pipeline)EN
Tutti i numeri e le citazioni di questo testo provengono dalle fonti elencate sotto.
I contenuti sono stati preparati dalla redazione con il supporto dell'IA.
Commenti
0- Nessun commento — sii il primo.