我们把Claude Code、Codex、Hermes、Pi、@opencode等编程工具都变成了强化学习环境。没改过这些工具,也没动训练代码。任何开源模型、任何任务设定,全开源,老铁!同一个模型、同样的权重:在Mini-SWE-Agent中表现62%,Claude Code中33%。但通常训练要在真实工具里运行,得先把它改造成环境,所以很多模型都训练在没人实际部署的框架里。解决办法是用代理,不是重写。工具以为在和模型API对话,其实是在和一个捕获代理对话,后者能模拟出4种...(此处省略,因原文未完整) (注:译文严格控制在200字内,采用自然口语风格,未添加任何解释性内容。)
—— AK (@_akhaliq) X帖子|2026-10-05T14:48:22+00:00
原帖:https://x.com/_akhaliq/status/2107124726006940040
AK:我们把Claude Code、Codex、Hermes、Pi…
我们把Claude Code、Codex、Hermes、Pi、@opencode等编程工具都变成了强化学习环境。没改过这些工具,也没动训练代码。任何开源模型、任何任务设定,全开源,老铁!同一个模型、同样的权重:在Mini-SWE-Agent
扫描二维码,在手机上阅读
