5 000 bacs à sable par seconde : DeepSeek dévoile DSec, son infrastructure d'entraînement d'agents
Un nouvel article signé Liang Wenfeng détaille DSec, le système d'entraînement d'agents de DeepSeek : plus de 5 000 bacs à sable générés par seconde, 3 millions par jour et jusqu'à 380 000 exécutés simultanément au pic.

Entraîner un grand modèle demande de la puissance de calcul. Entraîner un agent demande un environnement. Le dernier article signé Liang Wenfeng dévoile DSec (DeepSeek Elastic Compute), un système qui fabrique des bacs à sable en masse pour l'entraînement d'agents. D'après les détails techniques publiés, DSec en produit plus de 5 000 par seconde, jusqu'à 3 millions par jour, et en fait tourner 380 000 en même temps au pic.
Le cluster qui porte cette charge est lui aussi imposant : environ 160 nœuds, 30 000 cœurs de CPU et 250 To de mémoire. Ces chiffres montrent que le goulot d'étranglement de l'entraînement d'agents n'est plus seulement du côté des GPU. Il se situe dans l'ordonnancement et la fourniture des environnements.
Pourquoi entraîner un agent coûte-t-il autant d'efforts ? L'environnement du pré-entraînement, c'est le cluster de GPU : on fournit des données, on calcule des gradients. Un agent fonctionne autrement. Il écrit du code dans un bac à sable, lance des compilations, ouvre un navigateur, installe parfois un système d'exploitation. Chaque étape modifie l'état de l'environnement et peut le faire planter à tout moment. Chaque cycle d'entraînement doit donc repartir d'un bac à sable neuf et propre, utilisé puis jeté, détruit une fois l'entraînement terminé.
Le problème revient toujours à l'infrastructure. Celle-ci doit, à la cadence de 5 000 bacs à sable par seconde, installer pour chacun un système d'exploitation complet et une chaîne d'outils. Le tout sans que plusieurs centaines de milliers de bacs à sable concurrents fassent exploser la mémoire et le CPU du cluster.
L'article souligne aussi que les exigences d'environnement varient énormément d'une tâche d'agent à l'autre. Un agent qui résout des exercices de programmation n'a besoin que d'un environnement d'appel de fonctions sans état. Un agent évalué sur SWE-bench a besoin d'un espace utilisateur Linux complet. Dans les scénarios d'attaque et de défense en sécurité ou de computer-use, l'isolation par conteneur ne suffit pas : il faut passer à la machine virtuelle. Entraîner un agent à manipuler des logiciels commerciaux exige même un Windows ou un macOS complet, avec interface graphique et pilotes.
Cela explique aussi pourquoi l'amélioration des capacités des agents dépend de plus en plus de l'ingénierie d'infrastructure. La manière de construire les environnements, d'orchestrer les bacs à sable et d'isoler les ressources détermine si un agent peut travailler de façon stable dans le monde réel.
Pour l'écosystème chinois du calcul, DSec révèle également une tendance : à mesure que les capacités des modèles se rapprochent, l'infrastructure d'ingénierie de l'entraînement et de l'inférence devient le facteur qui creuse les écarts.
Sources
2Tous les chiffres et citations de ce texte proviennent des sources citées ci-dessous.
Les contenus ont été préparés par l'équipe de rédaction, assistée par l'IA.
Commentaires
0- Aucun commentaire — soyez le premier.