DAIR.AI:RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一…


RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。

RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。在代理强化学习中,回放使用了大量的令牌。每次回合都要重新读取整个不断增长的上下文,包括工具输出、文件和之前的回合。蒂纳克刚刚降低了这些令牌的价格。现在,长上下文的预填充和采样成本与短上下文相同。这意味着评估

—— DAIR.AI (@dair_ai) X帖子|2026-10-09T23:31:51+00:00
原帖:https://x.com/dair_ai/status/2108702134481068186



扫描二维码,在手机上阅读

HN榜单(2026年10月10日 07:45 北京时间)

热榜(2026年10月10日 07:45 北京时间)

评 论
评论已关闭