RT elvis Banger来自Meta超智能实验室的论文,讨论了自改进代理的问题。(收藏一下)要确切知道是什么驱动自改进很难,因为有很多变量在起作用(笔记、技能、每次运行之间的工具调用等)。Meta的研究人员探索并讨论了一种衡量自改进是否划算的方法,他们称之为代理的可塑性。这是在冻结模型权重的情况下,每次从新环境开始运行时,在学习上每花费一美元在测试任务上的收益。他们发现,表现最好的模型往往与学习效率最高的模型不同。
—— DAIR.AI (@dair_ai) X帖子|2026-10-09T15:28:02+00:00
原帖:https://x.com/dair_ai/status/2108584275813847292
DAIR.AI:RT elvis Banger来自Meta超智能实验室的论文…
RT elvis Banger来自Meta超智能实验室的论文,讨论了自改进代理的问题。(收藏一下)要确切知道是什么驱动自改进很难,因为有很多变量在起作用(笔记、技能、每次运行之间的工具调用等)。Meta的研究人员探索并讨论了一种衡量自改进是
扫描二维码,在手机上阅读
