一篇有用的论文,讲当模型不变时,代理的 harness(执行框架)会发生什么变化。一个要点:保持你的 harness 提示和工具精简。在这个研究中,这样做能在不降低准确率的情况下将成本削减3倍。作者在 SWE-bench Verified 上用同一模型测试了 Claude Code、mini-SWE-agent 和 OpenCode。Claude Code 和 mini-SWE-agent 在447个任务上的得分相差不到5分。换 harness 对结果的影响,和重新运行差不多。在45个困难任务中,两者都翻转了约13%的结果。成本差异主要来自系统提示和工具模式,每个 harness 都要发送这些内容。
—— DAIR.AI (@dair_ai) X帖子|2026-10-07T19:47:02+00:00
原帖:https://x.com/dair_ai/status/2107920656788767098
DAIR.AI:一篇有用的论文,讲当模型不变时,代理的 harness(执行…
一篇有用的论文,讲当模型不变时,代理的 harness(执行框架)会发生什么变化。一个要点:保持你的 harness 提示和工具精简。在这个研究中,这样做能在不降低准确率的情况下将成本削减3倍。作者在 SWE-bench Verified
扫描二维码,在手机上阅读
