DAIR.AI:又一篇NVIDIA的好论文。他们发现,在所测量的6个模型中,…


又一篇NVIDIA的好论文。他们发现,在所测量的6个模型中,每次强化学习步骤后只有0.6%到1.2%的模型权重发生变化。但标准的重新拟合会在每次更新后将整个检查点复制到回滚集群。对于一个跨两个AWS区域的1T模型,这个复制过程需要87.5分

又一篇NVIDIA的好论文。他们发现,在所测量的6个模型中,每次强化学习步骤后只有0.6%到1.2%的模型权重发生变化。但标准的重新拟合会在每次更新后将整个检查点复制到回滚集群。对于一个跨两个AWS区域的1T模型,这个复制过程需要87.5分钟。NVIDIA的NeMo-DCR只发送变化的值,却仍能让回滚集群获得与完整复制完全相同的比特。它将训练分片中的变化直接映射到检查点布局中,以XOR掩码或覆盖的方式编码,并通过中继树!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!

—— DAIR.AI (@dair_ai) X帖子|2026-10-08T16:15:02+00:00
原帖:https://x.com/dair_ai/status/2108229693061357652



扫描二维码,在手机上阅读

HN榜单(2026年10月09日 00:15 北京时间)

huggingface:真酷,今天在Windows活动上看到llama.cpp登上了…

评 论
评论已关闭