小米公开MiMo-V2.6强化学习训练全过程
「小米MiMo团队负责人罗福莉公开MiMo-V2.6强化学习训练进展,并开启训练页面直播。训练实现单步约20亿Token的完全异步并行,Pro版本耗资89万美元,Flash版本耗资39.7万美元,累计突破128万美元,技术细节计划数周内开源。」
9月17日凌晨,小米MiMo大模型团队负责人罗福莉在X平台发文,首次公开旗下最新大模型MiMo-V2.6的强化学习训练进展,并同步上线实时训练页面,对大模型RL阶段进行全程公开直播。按照团队规划,相关技术细节将在未来数周内逐步开源。
根据公开信息,MiMo-V2.6正在开展大规模多任务智能体(Agent)强化学习实验,团队围绕三大维度进行了全面扩展。算力层面,实现单步约20亿Token的完全异步并行,具体为1568个Prompt乘16次rollout;环境层面,搭建了支持单次运行混合多框架的代理式强化学习环境;评估层面,则采用带测试用例与量规奖励的组内信用分配机制。这三点分别对应吞吐效率、环境多样性与奖励信号可靠性,也是当前智能体RL训练中最难兼顾的环节。
直播页面实时呈现训练进度、Token消耗与成本指标。其中MiMo-V2.6-Pro版本训练约1天19小时,耗资89万美元;MiMo-V2.6-Flash版本训练时长1天14小时,耗资39.7万美元。双版本累计训练成本已突破128万美元。把训练时长与资金消耗直接摆在公屏上,在头部大模型团队中并不多见,这意味着训练过程的每一步扩展都处在可被外部观察与复核的状态。
罗福莉是雷军此前从DeepSeek引进的95后AI科学家,曾主导达摩院多语言预训练以及DeepSeek-V2的研发,于去年11月正式加盟小米并执掌MiMo大模型团队。今年3月,上一代万亿参数模型Mimo-V2-Pro已登顶Artificial Analysis全球大模型综合智能榜第八位、品牌榜第五位。从时间线看,小米在大模型上的投入节奏相当紧凑,从万亿参数基座到智能体RL实验,迭代间隔不足半年。
从工程视角看,完全异步并行意味着不同rollout之间不再互相等待,长尾样本不会拖慢整体吞吐,但代价是策略版本不一致带来的数据陈旧问题,需要靠更精细的组内信用分配来修正。带测试用例与量规奖励的评估机制,则把可验证的任务结果直接转化为奖励信号,减少了对人工偏好标注的依赖,这也是智能体RL能否在真实任务上稳定收敛的关键。
本次MiMo-V2.6通过透明化直播与工程细节开源,展示了小米在RL Scaling Law(强化学习扩展定律)上的深度积累,也将推动前沿大模型训练从黑盒试错向极客级过程开源的范式演进。对开发者生态而言,训练过程可观测、成本可核算、细节可复用,比单纯公布一个跑分更有参考价值。
来源:Heooo AI工具导航