DSec:DeepSeek 披露每天为智能体生产 300 万个环境的方法
在梁文锋署名的一篇论文中,DeepSeek 介绍了 DSec 系统:每秒新建 5000 个沙箱,每天 300 万个,同时运行的峰值达 38 万个。

训练智能体,不是把数据喂给网络就行。智能体要在环境里写代码、编译代码、打开浏览器,有时还得装系统。每一步都会改变环境状态,而环境随时可能坏掉。所以每一轮训练都要用一个全新的干净沙箱,用完就丢。中国门户网站 IT之家 介绍了 DeepSeek 的一项工作,名为 DSec(DeepSeek Elastic Compute),公司联合创始人梁文锋在论文上署名。
规模正是难点所在。DSec 每秒生成 5000 多个沙箱,一天下来就是 300 万个,同时运行的峰值达到 38 万个环境。支撑这一切的单个集群约有 160 个节点、3 万颗处理器核心和 250 TB 内存。靠资源超售和密集打包,一个节点能同时装下 3200 个容器,或者 800 台微型虚拟机。
问题:为 300 万个沙箱各自准备一套系统
瓶颈不在调度本身,而在环境构建。Docker 的经典做法是把基础镜像、工作目录和工具集打成一个完整镜像,小规模下很好用。在 DSec 里,容器后端一共用掉了 11 266 个基础镜像和 102 171 个工作目录,而 67.8% 的沙箱需要在基础镜像之上再叠至少一层工作目录或工具包。面对这样的多样性,更新一个包就得重建所有包含它的镜像。
解决办法是把环境拆成三个独立版本化、只读的 EROFS 层:基础镜像、工作目录和工具包。沙箱启动时,再由 overlayfs 把它们拼起来。这样更新一个包,只动它自己那一层。第二个组件是 Chronus,它在沙箱内部与训练框架之间转发通信。框架因此知道智能体处在哪个阶段、该回传什么信号。
为什么这关系到每一个智能体模型
V4.1-Flash 的模型卡证实,训练的关键就在这里:后训练配方保持标准,所有重要改动都在数据管道上,也就是大规模自动合成任务和智能体环境。换句话说,智能体的质量如今取决于背后的环境工厂,而不是学习算法里又一个技巧。每天 300 万个这样的环境从哪里来,又不至于建一个把自己压垮的数据中心?DSec 就是 DeepSeek 给出的答案。
资料来源
2- 01DeepSeek 新论文公开 Agent 训练,梁文锋署名 (IT之家)ZH
- 02DeepSeek-V4.1-Flash — sekcja Post-training (data pipeline)EN
本文所有数字与引语均来自下列来源,未添加来源之外的内容。
本内容由编辑部在人工智能辅助下制作完成。
评论
0- 还没有评论——来说两句吧。