RT DailyPapers:NVIDIA刚发布了Long-WAM——一个能扩展视觉上下文的全球动作模型,用于实时机器人控制。记住过去不等于用好过去:只有当视频基础模型经过自回归预训练时,更长的历史信息才能真正发挥大作用。
—— AK (@_akhaliq) X帖子|2026-10-08T12:16:12+00:00
原帖:https://x.com/_akhaliq/status/2108212339824832572
AK:RT DailyPapers:NVIDIA刚发布了Long-…
RT DailyPapers:NVIDIA刚发布了Long-WAM——一个能扩展视觉上下文的全球动作模型,用于实时机器人控制。记住过去不等于用好过去:只有当视频基础模型经过自回归预训练时,更长的历史信息才能真正发挥大作用。
扫描二维码,在手机上阅读
