RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。在代理强化学习中,回放使用了大量的令牌。每次回合都要重新读取整个不断增长的上下文,包括工具输出、文件和之前的回合。蒂纳克刚刚降低了这些令牌的价格。现在,长上下文的预填充和采样成本与短上下文相同。这意味着评估
—— DAIR.AI (@dair_ai) X帖子|2026-10-09T23:31:51+00:00
原帖:https://x.com/dair_ai/status/2108702134481068186
DAIR.AI:RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一…
RT 埃尔维斯对这种提高后续训练可访问性的趋势持乐观态度。一个新的后续训练时代已经到来。如果你在做代理强化学习,处理长上下文任务(这是当前的一大重点)是非常昂贵、低效且难以扩展的。我在深入研究长上下文任务的强化学习环境和评估,发现这很有用。
扫描二维码,在手机上阅读
