OpenBMB:“3”的奖励可能完全代表两种不同的意思。大家普遍认为一个回复…


“3”的奖励可能完全代表两种不同的意思。大家普遍认为一个回复平庸无奇,或者一半人喜欢另一半人讨厌。大多数奖励模型无法区分这种差异。现在介绍一种新的扩散奖励模型(DRM):它不会将人类偏好简单地压缩成一个分数,而是学习完整的奖励分布,保留分歧

“3”的奖励可能完全代表两种不同的意思。大家普遍认为一个回复平庸无奇,或者一半人喜欢另一半人讨厌。大多数奖励模型无法区分这种差异。现在介绍一种新的扩散奖励模型(DRM):它不会将人类偏好简单地压缩成一个分数,而是学习完整的奖励分布,保留分歧、不确定性以及多种可能的判断。✨ 论文:🤗 源码:💻 GitHub 为什么重要:人类的分歧是有结构的,而不仅仅是噪音。在重复标注的数据集上,判断往往形成分离或极化的模式。

—— OpenBMB (@OpenBMB) X帖子|2026-09-30T13:00:01+00:00
原帖:https://x.com/OpenBMB/status/2105281510928458150



扫描二维码,在手机上阅读

X榜单(2026年09月30日 21:21 北京时间)

DeepSeek开源工具助力国产算力生态

评 论
评论已关闭