DeepSeek公开Agent训练基础设施DSec
「DeepSeek发布新论文,详细披露其Agent训练系统DSec的技术架构。该系统每秒可创建5000多个沙盒环境,日均支持300万次训练任务,通过四类后端统一调度、按需加载镜像和资源优化策略,高效支撑多样化Agent训练需求。」
在大模型训练逐渐走向成熟之际,AI Agent的训练正成为新的技术高地。近日,DeepSeek团队发表了一篇由创始人梁文锋署名的新论文,首次公开其专为Agent训练打造的大规模基础设施系统——DSec(DeepSeek Elastic Compute)。
与传统大模型训练依赖GPU集群不同,Agent训练的核心挑战在于“环境”。每个Agent在执行任务时,可能需要写代码、编译程序、操作浏览器,甚至安装操作系统,每一步都可能改变环境状态,因此必须为每次训练提供一个干净、隔离且可丢弃的沙盒环境。DSec正是为解决这一问题而生。
该系统每秒能生成超过5000个沙盒,单日处理量高达300万个,峰值时可同时运行38万个沙盒。支撑这一规模的是一个包含160个节点、3万核CPU和250TB内存的庞大集群。为应对不同任务对环境的差异化需求,DSec设计了四种后端:FnCall用于无状态函数调用,Container基于Docker容器,MicroVM采用Firecracker轻量虚拟机,Full VM则通过QEMU运行完整操作系统(包括Windows或macOS)。尽管底层隔离强度和资源开销各异,但上层训练框架通过统一的Python SDK libdsec调用,接口完全一致。
在调度层面,DSec将整个链路拆分为六层:从训练框架发起请求,经IAM认证、API Server接收,由Placement Engine调度至目标节点,再由Edge组件拉起沙盒。网络出口、包管理由Aether代理,命令执行与输出则通过Chronus组件回传,确保训练框架实时掌握Agent状态。
面对海量沙盒的环境构建难题,DSec创新性地将操作系统镜像拆分为基础镜像、工作区和工具包三层独立的EROFS只读镜像,通过overlayfs按需组合,大幅降低更新成本。同时,基于真实访问数据发现Agent仅使用镜像中不到10%的内容,系统转而采用按需加载策略,将镜像存储于自研的3FS分布式文件系统,元数据预取、数据块按需拉取。实测显示,8192个容器突发部署时间从Docker冷拉的60分钟以上缩短至35分钟,磁盘写入量减少超50%。
在资源争抢方面,DSec通过virtio-pmem与DAX技术实现虚拟机内存共享,峰值内存占用降低40.2%;结合DAMON冷页回收与virtio-balloon机制,进一步削减21.2%内存需求。CPU调度上区分延迟敏感型与尽力而为型任务,配合core scheduling避免干扰,使高负载下延迟膨胀从45.2%降至17.3%。此外,Agent推理循环已从GPU训练Pod中解耦,即使GPU被抢占,沙盒状态也可挂起恢复,无需训练框架自行实现断点续训。
当本地集群接近满载,DSec还能自动触发cloud bursting,将溢出任务调度至云端虚拟机。实测表明,在集群利用率超80%时,200台云VM可吸收约30%的峰值负载,确保训练任务稳定运行。
来源:Heooo AI工具导航