每秒 5000 个沙盒:DeepSeek 公开 Agent 训练基础设施 DSec
梁文锋署名的 DeepSeek 新论文公开了 Agent 训练系统 DSec,它每秒能生成 5000 个以上沙盒、单日达到 300 万个,峰值同时运行 38 万个。

大模型训练拼的是算力,Agent 训练拼的是环境。梁文锋署名的 DeepSeek 最新论文公开了一个叫 DSec(DeepSeek Elastic Compute)的系统,专门给 Agent 训练批量造沙盒。论文里的技术细节写着,DSec 每秒能产生 5000 个以上沙盒,一天能到 300 万个,峰值同时运行 38 万个。
撑起这个规模的单集群也不小:大约 160 个节点、3 万核 CPU 和 250TB 内存。这些数字说明,Agent 训练的瓶颈已经不只是 GPU,还有调度和环境供给。
训一个 Agent 为什么这么费劲?预训练的环境就是 GPU 集群,喂数据算梯度。Agent 不一样,它得在沙盒里写代码、跑编译、开浏览器,甚至装操作系统。每执行一步都会改变环境状态,随时可能把环境搞崩。所以每一轮训练都得给它一个全新的、干净的沙盒,用完就扔。
问题绕回来,还是基础设施。这些设施要在每秒 5000 个的速度下,给每个沙盒装好一整套操作系统与工具链,同时不能让几十万个并发沙盒把集群的内存和 CPU 挤爆。
论文还指出,不同类型的 Agent 任务对环境的要求差别很大。刷编程题的 Agent 只需要无状态的函数调用环境;做 SWE-bench 的 Agent 需要完整的 Linux 用户态;安全攻防与 computer-use 场景里容器级隔离不够,必须上虚拟机;训练操作商业软件的 Agent,甚至需要一个带图形界面与驱动的完整 Windows 或 macOS。
这也解释了 Agent 能力的提升为什么越来越依赖基础设施的工程能力。环境怎么造、沙盒怎么调、资源怎么隔离,这些问题的答案决定了智能体能不能在真实世界里稳定干活。
对国产算力生态来说,DSec 还说明了一个趋势:当模型能力越来越接近,训练与推理的工程基础设施正在成为拉开差距的地方。
资料来源
2本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。