现在的训练后管道大多采用策略性蒸馏(OPD),让学生在访问每个前缀时都能获得老师的完整下一个标记分布:学生自己进行采样,Qwen3、MiMo、GLM-5、DeepSeek-V4 和 Kimi K3 都是用强化学习(RL)和监督 fine-tuning(SFT)与之配对的。然而,关于OPD的研究大多集中在算法层面,假定训练集是固定的——那么数据本身对OPD的提升贡献有多少呢?来自清华大学NLP团队(OpenBMB成员)、中国科学院大学、东北ern大学、UIUC和约翰霍普金斯大学的研究人员引入了一种新的方法——One-Shot OPD。它简化了训练过程。
—— OpenBMB (@OpenBMB) X帖子|2026-09-29T13:00:02+00:00
原帖:https://x.com/OpenBMB/status/2104919127056101611
OpenBMB:现在的训练后管道大多采用策略性蒸馏(OPD),让学生在访问每…
现在的训练后管道大多采用策略性蒸馏(OPD),让学生在访问每个前缀时都能获得老师的完整下一个标记分布:学生自己进行采样,Qwen3、MiMo、GLM-5、DeepSeek-V4 和 Kimi K3 都是用强化学习(RL)和监督 fine-t
扫描二维码,在手机上阅读
