当大型语言模型的强化学习扩展到更大的GPU集群和更多训练数据时,训练效率成为首要问题。我们的新研究重新审视了经典的临界批大小理论,并将其扩展到在线LLM RL中,其中模型生成自己的训练数据,而回滚生成和训练的扩展方式不同。在GRPO和PPO中,我们发现学习率调优可以在一定批大小范围内保持每次响应的学习效果。在固定硬件上,将批大小扩大可将PPO生成阶段吞吐量提高2.29倍,而我们测得的GRPO最佳效果...
—— 腾讯混元 (@TencentHunyuan) X帖子|2026-09-24T03:15:39+00:00
原帖:https://x.com/TencentHunyuan/status/2102960123379675423
腾讯混元:当大型语言模型的强化学习扩展到更大的GPU集群和更多训练数据…
当大型语言模型的强化学习扩展到更大的GPU集群和更多训练数据时,训练效率成为首要问题。我们的新研究重新审视了经典的临界批大小理论,并将其扩展到在线LLM RL中,其中模型生成自己的训练数据,而回滚生成和训练的扩展方式不同。在GRPO和PPO
扫描二维码,在手机上阅读
