想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

源自今日头条:机器之心Pro

02-13 12:27

机器人能跳舞却难包饺子,核心在于缺乏理解物理世界的“大脑”。阿里达摩院推出的 RynnBrain 模型,直面这一难题,通过内置时空记忆与物理空间推理能力,让机器人不再是“纸上谈兵”,真正拥有在复杂环境中连续思考和行动的潜能。

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下智能速览

  • 机器人处理复杂家务和被打断的任务时表现不佳。

  • 阿里达摩院发布具身基础模型 RynnBrain,并开源全部资源。

  • 模型构建三维认知,拥有超越即时视野的时空记忆能力。

  • 采用“文本与空间定位交错”策略,消除机器人物理规划中的幻觉。

  • 在16项具身任务评测上达到SOTA,小参数量MoE版本超越更大模型。

  • 其下游任务微调效果显著,导航与规划能力快速提升。

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下精华内容

将大模型塞进机器人并非易事,RynnBrain 的核心思路是赋予其“物理直觉”。它如何让机器人真正理解并操作三维世界,而非仅仅看懂二维图像?

机器人的物理困境

当前机器人面临的主要挑战,是无法适应真实、动态且充满干扰的物理世界。例如,一个顶尖的视觉语言模型(VLM)能看懂包饺子的静态流程,但一旦置身于厨房,就可能因碰倒调料瓶或缺少挖馅勺这类突发状况而“卡住”。

这暴露了通用大模型的局限:它们虽见多识广,却缺乏连续的三维空间感和真实的物理交互逻辑,其规划往往是脱离物理约束的“纸上谈兵”。这种与物理世界脱节的认知模式,正是机器人走出实验室的最大障碍。

时空记忆的突破

为解决机器人“过目就忘”的问题,RynnBrain 引入了时空记忆能力。传统方法是将历史图像重新过一遍,这割裂了时空连续性。RynnBrain 则利用历史记忆构建一个完整的三维世界模型,让机器人的决策不受限于眼前瞬间。

这意味着,即使目标物体(如抹布)已不在视野内,机器人也能回想起来。在测试中,模型能持续追踪动态场景中的物体,并在物体被移动后,凭借稳定的空间记忆将其准确放回原处,展现了类人的全局时空回溯能力。

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

空间推理的革新

RynnBrain 的另一大创新是“物理空间推理”能力,它旨在消除“语义与空间解耦”导致的“物理幻觉”。传统模型可能规划出“拿起挖馅勺”的指令,却完全无视眼前并无此物。

RynnBrain 采用“文本与空间定位交错”的推理策略,要求模型在生成涉及物理对象的文本时,必须同步预测其空间坐标或区域。这种强制约束将抽象语言与具象环境强力锁定,确保每一个决策都有据可依,极大降低了任务执行的不确定性。

想让机器人春晚包饺子?阿里达摩院:别急,先把「大脑」优化一下

全面的性能验证

在达摩院推出的新评测基准 RynnBrain Bench 上,RynnBrain 展现了全面的能力。其 8B 版本在 16 项具身任务上实现了 SOTA,相比业内先进模型,在多项细分能力上实现了超过 30% 的性能飞跃。

更值得一提的是其 MoE 版本 RynnBrain-30B-A3B,仅需 3B 的推理激活参数,就全面超越了当前规模最大的具身基础模型 Pelican-VL-72B,实现了以小博大。作为基座模型,它在下游导航和规划任务微调后,能力也显著超越现有 SOTA 模型。

开源与行业展望

面对具身智能的技术路线分歧,达摩院选择先打好地基。从奠定物理世界感知的 RynnEC,到融合时空记忆与推理的 RynnBrain,其核心是为行业补齐基础能力。全套模型、代码及基准的开源,意在推动社区在统一底座上协作,避免重复造轮子。

达摩院也在并行推进以视觉为主导的 VLA 路线,并探索更平台化的基础设施方案。这表明,解决具身智能的世纪难题,需要的不是孤军奋战,而是整个开源生态的共同进化。

RynnBrain 的出现,为具身智能领域补上了关键一环,它证明了让模型扎根物理世界的重要性。开源的不仅是模型,更是一套解决问题的思路和方法。未来,机器人能否真正走进千家万户,或许正取决于这些基础能力的持续演进与社区共创。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐