RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一致的答案。但这篇谷歌论文发现,一致反而可能隐藏共同错误,而分歧反而常指向正确答案。VeriHarness让同一模型同时担任两个角色:一是当轨迹意见不一时,通过核查工作区证据来判断对错;二是当所有轨迹都一致时,主动挑战这些结论,找出它们都忽略的需求。在五个长程任务基准测试中,它的选优表现优于所有基线方法。
—— DAIR.AI (@dair_ai) X帖子|2026-10-04T11:00:11+00:00
原帖:https://x.com/dair_ai/status/2106737303725002966
DAIR.AI:RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一…
RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一致的答案。但这篇谷歌论文发现,一致反而可能隐藏共同错误,而分歧反而常指向正确答案。VeriHarness让同一模型同时担任两个角色:一是当轨迹意见不一时,通过核查工作区证据来判断对
扫描二维码,在手机上阅读
