技术进展

小米MiMo-V2.6强化学习实验直播,每小时烧钱超3万美元

Heooo 09月17日21时00分 34 阅读

「小米MiMo大模型团队负责人罗福莉公开直播MiMo-V2.6训练过程,该模型正进行大规模Agent强化学习实验,推进计算资源、环境框架和评估计算三大扩展。Pro版累计耗资约89万美元,Flash版约39.7万美元,整体每小时成本超3万美元。团队计划未来几周开源技术细节。」

沉寂半年之后,小米MiMo大模型团队负责人、前DeepSeek研究员罗福莉在X平台发文,首次对外公开并直播了小米最新一代大模型的训练过程。这一动作让外界得以一窥小米当前大模型的内部训练状态。

根据罗福莉分享的实时训练页面,小米最新大模型MiMo-V2.6正在进行大规模的Agent(智能体)强化学习实验,团队重点推进了三个维度的技术扩展。

首先是计算资源扩展。每步计算资源大约消耗20亿token,包含1568个提示乘以16次rollout,采取完全异步的运行模式。其次是环境和测试框架扩展,团队构建了多任务代理式强化学习,在单次运行中同步混合多个测试框架。第三是评估计算扩展,引入代理式组内信用分配机制,并配备了实际测试用例与基于量规的奖励机制。


从公开的实时训练数据来看,此次训练展现出极高的资金与算力消耗。训练页面主要包含两个并行版本:MiMo-V2.6-Pro累计训练时长达到1天19小时,累计耗资约89万美元,平均每小时训练成本超过2万美元;MiMo-V2.6-Flash累计训练时长为1天14小时,累计耗资约39.7万美元,平均每小时训练成本超过1万美元。两个版本的累计训练成本已经突破128万美元,折算下来整体每小时耗费超过3万美元。

这一数字直观地反映出当前头部大模型在强化学习阶段对海量算力的极致诉求。强化学习依赖大量环境交互与反复采样,随着智能体任务复杂度提升,单步token消耗与rollout规模同步放大,成本曲线也随之陡峭上升。


罗福莉同时透露,团队将在未来几周内逐步向外界开源相关技术细节,这意味着上述多任务代理式强化学习框架、组内信用分配与规约奖励机制等设计,有望进入开发者视野。

在团队与业务背景方面,小米高层此前曾多次公开披露AI领域的阶段性成果。今年3月份,小米创始人雷军曾在微博发文透露,万亿参数大模型MiMo-V2-Pro曾跻身全球大模型综合智能排行榜Artificial Analysis的全球第八位,在品牌排名中位列全球第五,整体表现超越了xAI的Grok模型,并计划在后续保持快速迭代与增强。

作为核心领军人物,罗福莉是备受瞩目的95后AI青年科学家。公开资料显示,她本科毕业于北京师范大学计算机专业,随后在北京大学攻读计算语言学硕士学位。毕业后,她曾加入阿里巴巴达摩院机器智能实验室担任研究员,负责多语言预训练模型VECO的开发,并推动了AliceMind项目的开源。2022年,罗福莉加入DeepSeek母公司幻方量化从事深度学习相关工作,此后担任DeepSeek深度学习研究员,参与了DeepSeek-V2等核心模型的研发工作。直到去年11月12日,罗福莉在朋友圈发文确认加入小米,投身Xiaomi MiMo团队,并致力于构建从语言迈向物理世界的AGI未来。

此次直播训练过程,既是罗福莉加盟小米后的首度公开技术动作,也折射出小米在大模型竞赛中持续加码的姿态。随着技术细节陆续开源,MiMo-V2.6在多任务智能体强化学习上的工程实践,或将成为开发者社区关注的重点。

# 小米MiMo # 强化学习 # 大模型训练 # 罗福莉 # 开源

来源:Heooo AI工具导航