腾讯混元重构大模型强化学习批大小策略
「腾讯混元团队将经典临界批大小理论推广到在线大模型强化学习场景,提出在扩大批大小时同步重调学习率,避免每条响应的学习信号被稀释。固定硬件下PPO生成吞吐最高提升2.29倍,最佳GRPO配置以少29%的时间达到同一验证目标。」
大模型强化学习正奔向更大的GPU集群与更厚的训练数据,训练效率已从一个配角升格为头等大事。腾讯混元团队的最新研究把目光投向一个被忽视已久的老问题:当模型自己生成训练数据、且rollout生成与训练本身以不同节奏缩放时,批大小这门手艺该如何重做。
研究的起点是经典的临界批大小理论。团队把它重新推演到在线大语言模型强化学习这一新场景,得出的结论相当务实:在GRPO和PPO这两类主流算法里,只要在扩大批大小的有界范围内重新调一调学习率,就能保住每条响应该学到的东西不被稀释。也就是说,批大小并非越大越好,也不是一成不变,而是存在一个能被调教清楚的甜蜜区间。
落到实打实的硬件账单上,收益相当醒目。在固定硬件配置下,把批大小往上扩,PPO生成阶段的吞吐量最高提升2.29倍;而测量到的最佳GRPO配置,用比此前少29%的时间就跑到了同一个验证目标。对天天烧卡的训练团队来说,这意味着同样一张集群、同一个目标,要么更快地交卷,要么在单位时间里吞吐更多。强化学习里最贵的那部分生成开销,就这样被悄悄挤出了水分。
这项研究的意义在于,它给在线强化学习的规模化提供了一把可操作的旋钮。
在强化学习里,模型既是学生也是出题人,生成与训练两条流水线的缩放失配,正是效率黑洞的源头;而临界批大小加学习率重调这一组合,恰好补上了这道缝隙。批大小与学习率之间原本被认为只是经验性的搭配关系,如今在更靠近真实的在线生成场景里被重新推导,让调参有了可依据的坐标,而不是纯粹靠反复试错。
更值得关注的是研究视角的转换。当行业还在比谁的模型更大时,腾讯混元先把刀磨向了怎么让已有的卡跑得更划算。对于每天要为大模型强化学习付出高昂生成成本的技术团队而言,这条从经典理论里翻出来的经验,或许比多加几百张卡更直接地决定了训练能不能持续跑下去。当生成与训练这两条流水线同步放大成为常态,谁能先把效率账算清楚,谁就更有可能在同样的算力预算下多跑几轮迭代。
来源:Heooo AI工具导航