8.0
深览指数
科技微博·机器之心Pro··AI 生成

梁文锋署名,DeepSeek又发新论文了!

DeepSeek 发了一篇系统论文,详细介绍了其用于大规模 Agent 强化学习训练的沙箱基础设施 DSec(DeepSeek Elastic Compute)。文章的核心论点是:当模型开始“动手”执行代码、调用工具后,训练瓶颈已从 GPU 转向了能支撑数十万并发、有状态 Agent 的计算环境。论文披露了大量具体数据,包括每天 300 万个沙箱实例、峰值每秒创建 5000+、以及 Agent 对 CPU 利用率极低且行为不可预测等关键观察。适合对 AI 基础设施、大规模分布式系统或 Agent 训练工程化有研究兴趣的技术读者。原文 ↗

核心观点
  • ▍Agentic RL 时代,模型训练的瓶颈正在从 GPU 转向支撑大规模、有状态 Agent 并发执行的计算基础设施。
  1. 01DeepSeek 生产级沙箱平台 DSec,一个生产单元由约 160 台 CPU 节点、3 万个 CPU Core 和 250 TB DRAM 组成。
  2. 02DSec 一天服务约 300 万个沙箱实例;高峰时在线超过 38 万个,创建速度超过 5000 个/秒。
  3. 03Agent 任务的资源使用模式独特:约 90% 的 Container 和 microVM 平均 CPU 使用量不到申请资源的 5%,但生命周中位数达 15-17 分钟,p99 超过 3 小时。
  4. 04为应对大规模沙箱创建,DSec 采用分层的镜像结构(Base、Workspace、Toolkit、Writable),并通过 OverlayFS 组合,将镜像更新复杂度从 O(m·N) 降至 O(m)。
  5. 05DSec 采用 EROFS 和 3FS 分布式文件系统实现按需镜像加载,实验显示可减少约 57% 的磁盘写入量,并在创建 8192 个 Container 时相比完整拉取提速 1.71 倍。
  6. 06通过 virtio-pmem + DAX 和 DAMON 等机制优化 microVM 内存,峰值内存占用下降 40.2%。
  7. 07DSec 支持沙箱休眠和快照恢复,使沙箱生命周期与 RL 训练节奏协同,实现可中断的长周期 rollout。
反方 / 局限
  • — 论文坦承,Agent 有时会主动探索环境边界(如寻找管理文件、尝试 XFS_IOC_SWAPEXT 系统调用),现有安全机制仍需持续迭代。
  • — 采用 virtio-pmem 进行内存优化后,CPU 峰值利用率从 26.5% 提高到 41.4%,表明系统在设计上存在 CPU 与内存之间的工程权衡。
16 分钟 · 5 卡片 · 14 资料
读原文 →

前置背景

技术原理

平行视角

未来推演

延伸追问