DAIR.AI:RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一…


RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一致的答案。但这篇谷歌论文发现,一致反而可能隐藏共同错误,而分歧反而常指向正确答案。VeriHarness让同一模型同时担任两个角色:一是当轨迹意见不一时,通过核查工作区证据来判断对

RT 一篇谷歌的论文。通常做法是跑多个智能体轨迹,相信它们一致的答案。但这篇谷歌论文发现,一致反而可能隐藏共同错误,而分歧反而常指向正确答案。VeriHarness让同一模型同时担任两个角色:一是当轨迹意见不一时,通过核查工作区证据来判断对错;二是当所有轨迹都一致时,主动挑战这些结论,找出它们都忽略的需求。在五个长程任务基准测试中,它的选优表现优于所有基线方法。

—— DAIR.AI (@dair_ai) X帖子|2026-10-04T11:00:11+00:00
原帖:https://x.com/dair_ai/status/2106737303725002966



扫描二维码,在手机上阅读

DAIR.AI:NVIDIA 的一篇关于终端代理测试时计算的论文真的很棒。研…

Trump Truth:真遗憾,Fox & Friends(周日节目)没有报道我们在…

评 论
评论已关闭