DSec : comment DeepSeek fabrique 3 millions d'environnements par jour pour ses agents
Dans un texte signé Liang Wenfeng, DeepSeek décrit DSec : 5 000 nouveaux sandboxs par seconde, 3 millions par jour, et jusqu'à 380 000 qui tournent en même temps.

Entraîner un agent ne se résume pas à nourrir un réseau de données. L'agent écrit du code dans un environnement, le compile, ouvre un navigateur, installe parfois un système. Chaque étape modifie l'état de cet environnement, qui peut casser à tout moment. Il faut donc un sandbox neuf et propre à chaque cycle d'entraînement, jeté après usage. Le portail chinois IT之家 décrit le travail de DeepSeek baptisé DSec (DeepSeek Elastic Compute), signé par le cofondateur de l'entreprise, Liang Wenfeng.
L'échelle est ici le cœur du problème. DSec produit plus de 5 000 sandboxs par seconde, soit 3 millions par jour, et le pic de travail simultané atteint 380 000 environnements. Le cluster qui fait tourner tout cela compte environ 160 nœuds, 30 000 cœurs de processeur et 250 To de mémoire RAM. La sursouscription des ressources et un empilement dense permettent à un seul nœud de loger 3 200 conteneurs ou 800 micro-machines virtuelles.
Le problème : un système pour chacun des 3 millions de sandboxs
Le goulot d'étranglement n'est pas l'ordonnancement, mais la construction de l'environnement. L'approche classique de Docker emballe une image de base, un répertoire de travail et un jeu d'outils dans une image complète, et elle tient la route à petite échelle. Dans DSec, le backend conteneur a consommé au total 11 266 images de base et 102 171 répertoires de travail. Et 67,8 % des sandboxs exigent d'ajouter à l'image de base au moins une couche, répertoire de travail ou paquet d'outils. Avec une telle diversité, la mise à jour d'un seul paquet forcerait à reconstruire toutes les images qui le contiennent.
La solution consiste à découper l'environnement en trois couches en lecture seule, versionnées indépendamment, au format EROFS : image de base, répertoire de travail et paquet d'outils. Elles sont assemblées au démarrage du sandbox par overlayfs. La mise à jour d'un paquet ne touche alors que sa couche. Le second élément est le composant Chronus, qui fait l'intermédiaire entre l'intérieur du sandbox et le framework d'entraînement. Le framework sait ainsi où en est l'agent et quel signal de retour lui transmettre.
Pourquoi cela concerne tout modèle agentique
La fiche du modèle V4.1-Flash confirme que l'entraînement a porté précisément sur ce point : la recette de post-entraînement est restée standard, et tous les changements importants ont concerné le pipeline de données, à savoir la synthèse massive et automatique de tâches et d'environnements agentiques. Autrement dit, la qualité d'un agent dépend aujourd'hui de l'usine d'environnements qui tourne en arrière-plan, et non d'une nouvelle astuce dans l'algorithme d'apprentissage. DSec est la réponse de DeepSeek à la question de savoir où trouver 3 millions de tels environnements par jour sans construire un centre de données qui s'étouffe lui-même.
Sources
2- 01DeepSeek 新论文公开 Agent 训练,梁文锋署名 (IT之家)ZH
- 02DeepSeek-V4.1-Flash — sekcja Post-training (data pipeline)EN
Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.