小米直播训练MiMo-V2.6,罗福莉详解强化学习扩展
「小米MiMo大模型负责人罗福莉透露,自开源MiMo-v2.5后团队沉寂近半年,专注研究强化学习能扩展到多远。MiMo-V2.6处于强化学习中间阶段,扩展计算、环境与工具、Grader Compute三项能力,训练直播总花费已超125万美元,模型即将推出。」
小米MiMo大模型负责人罗福莉近日发文,回顾了团队自今年4月开源MiMo-v2.5之后的进展。她坦言,小米在这近半年时间里相对沉寂,并把这段时间集中投入到一个核心问题上:强化学习究竟能扩展到多远。这一表述也点明了MiMo-V2.6的研发主线。
据罗福莉介绍,MiMo-V2.6目前正处于强化学习的中间阶段,团队围绕扩展性为其构建了三项关键能力。
第一项是计算层面的扩展。团队在每一步训练中投入约20亿个Token,采用1,568个Prompt乘以16条Rollout的采样规模,并且整个过程完全异步。这样的配置意味着模型在一次训练迭代中就能获得极其庞大的交互样本,为强化学习的规模化提供了算力基础。
第二项是环境和工具的扩展。MiMo团队采用多任务智能体强化学习的方式,在一次运行中混合多个框架。这种设计让模型不再局限于单一任务或单一工具环境,而是能够在更复杂、更贴近真实使用的场景中接受训练,从而提升智能体的泛化能力。
第三项是Grader Compute,也就是给打分与评分过程本身增加算力。团队引入了Agentic In-group Credit Assignment机制,并把测试案例与评分标准奖励纳入其中。这一思路的核心在于,强化学习的质量很大程度上取决于奖励信号是否准确,而对评分环节加码,正是为了让模型在训练中获得更精细、更可靠的反馈。
罗福莉同时透露,小米MiMo团队将在接下来的几周内逐步开源这些细节。对于关注大模型强化学习方向的开发者而言,这无疑是一个值得期待的开放动作,也延续了MiMo系列此前开源的做法。
值得关注的是,罗福莉还直接晒出了MiMo-V2.6模型的训练直播链接。直播页面显示,该模型的训练总花费已超过125万美元,按现汇率约合840.3万元人民币,同时页面信息显示MiMo-V2.6模型即将推出。把训练过程以直播形式公开,在大模型研发中并不常见,这也让外界能够更直观地看到强化学习大规模训练的真实成本与推进节奏。
从MiMo-v2.5开源到MiMo-V2.6进入强化学习中间阶段,小米在大模型上的投入方向逐渐清晰:以强化学习为主线,在计算规模、工具环境和评分机制三个维度同时做扩展。随着后续细节的逐步开源,这套方法能否为强化学习的可扩展性提供有价值的实践样本,将成为业内持续观察的焦点。
来源:Heooo AI工具导航