张大妈

具身的未来会回归到学习的本质

源自小红薯:Kivy

02-28 11:00

NVIDIA联合高校提出EgoScale项目,通过大规模第一视角人类视频数据验证了向真实机器人迁移的可行性。该研究不仅揭示了数据规模与任务成功率间的线性关系,更深入探讨了具身智能从轨迹拟合回归到持续学习与元学习的发展必然。

具身的未来会回归到学习的本质智能速览

  • 采用星海图R1 Pro与Sharpa灵巧手完成高精细度操作任务

  • 利用20,854小时第一视角视频预训练,规模超以往20倍

  • 人类动作预测Loss与机器人任务成功率呈强对数线性关系

  • 仅需少量机器人示范即可通过微调适配新任务

  • 实现从22自由度灵巧手到7自由度三指手的跨本体迁移

具身的未来会回归到学习的本质精华内容

EgoScale项目的核心在于探索大规模第一视角人类数据如何系统性迁移至真实机器人,这不仅验证了数据规模的重要性,更揭示了具身智能未来的发展路径。

大规模数据验证

NVIDIA与高校合作提出的EgoScale项目,利用星海图R1 Pro本体搭载Sharpa灵巧手作为验证平台。该项目使用20,854小时的第一视角人类操作视频进行预训练,数据规模是以往工作的20倍以上。

实验中,机器人成功完成了组装模型汽车、操作注射器、整理扑克牌及折叠衬衫等一系列高自由度精细操作任务,充分证明了数据规模对于提升机器人操作能力的关键作用。

数据规模定律

研究发现,人类动作预测Loss与数据规模呈现对数线性关系,相关系数高达0.9983。更重要的是,这个Loss值与真实机器人的任务成功率表现出强相关性。

这意味着在人类数据上学习得越好,机器人在实际任务中的表现就越佳。这一发现为具身智能领域的研究提供了明确的量化指标,证明了扩大数据规模是提升模型性能的有效途径。

两阶段迁移策略

项目采用了大规模人类预训练结合小规模人机对齐微调的策略。这种两阶段迁移方法允许系统仅用少量的机器人示范数据即可适配新任务。

此外,预训练策略展示了强大的泛化能力,能够成功将知识从22自由度的Sharpa手迁移到7自由度的三指手上。这种跨本体的泛化能力对于降低机器人部署成本具有重要意义。

回归学习本质

具身操作的硬件形态未来很可能会收拢到egocentric-based本体结构。这是因为第一视角数据天然规模大、采集成本低且建模更稳定。

相比遥操数据,人类自然操作数据包含了从感知、意图到执行的闭环结构。目前的末端轨迹拟合仅是阶段性妥协,真正的通用具身智能需要强自我感知能力和意图建模能力,通过内部模型与元学习找到隐式表征与显式控制的平衡点。

随着算法进化到能自我学习的阶段,Scale的真正魅力将得以展现。无论是从数据采集还是硬件形态来看,具身智能终将从简单的轨迹拟合回归到持续学习与元学习,让真正的智慧在调整行为实现目的的过程中成长。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐