跳到正文
世界时间EU--:--UK--:--USA--:--CN--:--PLDEFRIT中文EN

关于人工智能与技术的门户事件 · 分析 · 访谈 · 技术背景

搜索
直播
›

DSec:DeepSeek 披露每天为智能体生产 300 万个环境的方法

在梁文锋署名的一篇论文中,DeepSeek 介绍了 DSec 系统:每秒新建 5000 个沙箱,每天 300 万个,同时运行的峰值达 38 万个。

科学解释郑雪莉发布: 2026年9月23日6 分钟阅读资料来源 2
DSec:DeepSeek 披露每天为智能体生产 300 万个环境的方法

训练智能体,不是把数据喂给网络就行。智能体要在环境里写代码、编译代码、打开浏览器,有时还得装系统。每一步都会改变环境状态,而环境随时可能坏掉。所以每一轮训练都要用一个全新的干净沙箱,用完就丢。中国门户网站 IT之家 介绍了 DeepSeek 的一项工作,名为 DSec(DeepSeek Elastic Compute),公司联合创始人梁文锋在论文上署名。

规模正是难点所在。DSec 每秒生成 5000 多个沙箱,一天下来就是 300 万个,同时运行的峰值达到 38 万个环境。支撑这一切的单个集群约有 160 个节点、3 万颗处理器核心和 250 TB 内存。靠资源超售和密集打包,一个节点能同时装下 3200 个容器,或者 800 台微型虚拟机。

问题:为 300 万个沙箱各自准备一套系统

瓶颈不在调度本身,而在环境构建。Docker 的经典做法是把基础镜像、工作目录和工具集打成一个完整镜像,小规模下很好用。在 DSec 里,容器后端一共用掉了 11 266 个基础镜像和 102 171 个工作目录,而 67.8% 的沙箱需要在基础镜像之上再叠至少一层工作目录或工具包。面对这样的多样性,更新一个包就得重建所有包含它的镜像。

解决办法是把环境拆成三个独立版本化、只读的 EROFS 层:基础镜像、工作目录和工具包。沙箱启动时,再由 overlayfs 把它们拼起来。这样更新一个包,只动它自己那一层。第二个组件是 Chronus,它在沙箱内部与训练框架之间转发通信。框架因此知道智能体处在哪个阶段、该回传什么信号。

为什么这关系到每一个智能体模型

V4.1-Flash 的模型卡证实,训练的关键就在这里:后训练配方保持标准,所有重要改动都在数据管道上,也就是大规模自动合成任务和智能体环境。换句话说,智能体的质量如今取决于背后的环境工厂,而不是学习算法里又一个技巧。每天 300 万个这样的环境从哪里来,又不至于建一个把自己压垮的数据中心?DSec 就是 DeepSeek 给出的答案。

评论 0

资料来源

2
  1. 01DeepSeek 新论文公开 Agent 训练,梁文锋署名 (IT之家)ZH
  2. 02DeepSeek-V4.1-Flash — sekcja Post-training (data pipeline)EN

本文所有数字与引语均来自下列来源,未添加来源之外的内容。

本内容由编辑部在人工智能辅助下制作完成。

郑雪莉

郑雪莉

科学与健康

郑雪莉负责FLASH24科学与健康版块,日常从论文预印本、期刊官网和机构通报中抓取信息,只盯数据来源和实验设计是否站得住。她习惯把每项统计数字与原始数据集交叉比对,遇到百分比先算清分母再决定是否采用。她常联系一线研究人员核实细节,也会在日历上标记大型队列研究的发布节点,提前比对不同团队的结果。私下她学材料物理,还自己架望远镜观测,这让她对测量误差和观测条件格外敏感。她有一条硬规矩:样本量、利益冲突或方法说明缺一项,稿子就不发。

编辑部 →

评论

0
  1. 还没有评论——来说两句吧。

写评论

评论公开展示。我们不发布辱骂、垃圾信息和广告内容。