腾讯混元把经典临界批大小理论搬进大模型强化学习,PPO 生成吞吐最高拉到 2.29 倍、GRPO 省下 29% 训练时间

腾讯混元团队最新研究把目光投向了一个被忽视已久的老问题:当模型自己生成训练数据、且 rollout 生成与训练本身以不同节奏缩放时,批大小这门手艺该怎么重做。研究从经典的临界批大小理论出发,把它重新推演到在线大语言模型强化学习这个新场景。这项研究的意义在于,它给在线 RL 的规模化提供了一把可操作的旋钮:模型在强化学习里既是学生也是出题人,生成与训练两条流水线的缩放失配正是效率黑洞的源头,而临界批大小加学习率重调的组合,恰好补上了这道缝隙。

原文连接