DeepSeek 9 月 19 日挂出一篇 31 页的论文,DeepSeek Elastic Compute(DSec)。不是模型论文,是一篇彻头彻尾的基建报告:给 agent 训练造沙箱。
要解决的问题很直白——大模型做 agentic RL,得同时给几十万个 agent 各配一台「电脑」,让它们翻仓库、跑命令、调工具。这些电脑绝大多数时间在待机,但又必须是真的、有状态的、彼此隔离的,一台台配硬件显然不现实。
> 单个生产单元约 160 个节点,一天跑约 300 万个沙箱;生产环境同时承载 38 万以上并发沙箱,每秒可新建 5000 个。>> 底座是一套统一 SDK,下面挂四种后端:FnCall、容器、microVM、全 VM。镜像从集群级分布式文件系统 3FS 按需加载,不再整批分发。*最要紧的改动不在沙箱本身,而在它和 RL 框架的耦合方式*——把有状态的 rollout 执行与随时可被抢占的 GPU 训练解耦,训练和沙箱生命周期联动:训练时保住 rollout 状态,同时把空闲资源收回来。>> 论文里还专门写了一节,对付 agent 的 reward hacking。
数字之外,两点我觉得更值得记:
一、agentic RL 的真实瓶颈,多半不在卡,在环境。每跑一次 rollout 就要一台干净机器、跑完就要回收,几十万个 agent 意味着几十万台临时电脑。谁把这层的每秒建量和成本打下去,谁的 agent 训练就便宜——这比刷榜硬。
二、论文的前身是两页扩展摘要,已过 ACM SIGOPS ATC 2026 第一轮评审,这版是扩写。也就是说,它是写给操作系统与分布式系统社区的,不是给模型圈看的。
一个连沙箱调度都单独立项、按 31 页篇幅写清楚的团队,下一步要训的东西大概很吃 agent 环境。开源模型的下半场,比的可能不只是权重,还有谁一秒能开出更多台「电脑」。
原文 arxiv.org/abs/2609.22978DeepSeek大模型
