机器人能跳舞却难包饺子,核心在于缺乏理解物理世界的“大脑”。阿里达摩院推出的 RynnBrain 模型,直面这一难题,通过内置时空记忆与物理空间推理能力,让机器人不再是“纸上谈兵”,真正拥有在复杂环境中连续思考和行动的潜能。

智能速览
机器人处理复杂家务和被打断的任务时表现不佳。
阿里达摩院发布具身基础模型 RynnBrain,并开源全部资源。
模型构建三维认知,拥有超越即时视野的时空记忆能力。
采用“文本与空间定位交错”策略,消除机器人物理规划中的幻觉。
在16项具身任务评测上达到SOTA,小参数量MoE版本超越更大模型。
其下游任务微调效果显著,导航与规划能力快速提升。
精华内容
将大模型塞进机器人并非易事,RynnBrain 的核心思路是赋予其“物理直觉”。它如何让机器人真正理解并操作三维世界,而非仅仅看懂二维图像?
机器人的物理困境
当前机器人面临的主要挑战,是无法适应真实、动态且充满干扰的物理世界。例如,一个顶尖的视觉语言模型(VLM)能看懂包饺子的静态流程,但一旦置身于厨房,就可能因碰倒调料瓶或缺少挖馅勺这类突发状况而“卡住”。
这暴露了通用大模型的局限:它们虽见多识广,却缺乏连续的三维空间感和真实的物理交互逻辑,其规划往往是脱离物理约束的“纸上谈兵”。这种与物理世界脱节的认知模式,正是机器人走出实验室的最大障碍。
时空记忆的突破
为解决机器人“过目就忘”的问题,RynnBrain 引入了时空记忆能力。传统方法是将历史图像重新过一遍,这割裂了时空连续性。RynnBrain 则利用历史记忆构建一个完整的三维世界模型,让机器人的决策不受限于眼前瞬间。
这意味着,即使目标物体(如抹布)已不在视野内,机器人也能回想起来。在测试中,模型能持续追踪动态场景中的物体,并在物体被移动后,凭借稳定的空间记忆将其准确放回原处,展现了类人的全局时空回溯能力。

空间推理的革新
RynnBrain 的另一大创新是“物理空间推理”能力,它旨在消除“语义与空间解耦”导致的“物理幻觉”。传统模型可能规划出“拿起挖馅勺”的指令,却完全无视眼前并无此物。
RynnBrain 采用“文本与空间定位交错”的推理策略,要求模型在生成涉及物理对象的文本时,必须同步预测其空间坐标或区域。这种强制约束将抽象语言与具象环境强力锁定,确保每一个决策都有据可依,极大降低了任务执行的不确定性。

全面的性能验证
在达摩院推出的新评测基准 RynnBrain Bench 上,RynnBrain 展现了全面的能力。其 8B 版本在 16 项具身任务上实现了 SOTA,相比业内先进模型,在多项细分能力上实现了超过 30% 的性能飞跃。
更值得一提的是其 MoE 版本 RynnBrain-30B-A3B,仅需 3B 的推理激活参数,就全面超越了当前规模最大的具身基础模型 Pelican-VL-72B,实现了以小博大。作为基座模型,它在下游导航和规划任务微调后,能力也显著超越现有 SOTA 模型。
开源与行业展望
面对具身智能的技术路线分歧,达摩院选择先打好地基。从奠定物理世界感知的 RynnEC,到融合时空记忆与推理的 RynnBrain,其核心是为行业补齐基础能力。全套模型、代码及基准的开源,意在推动社区在统一底座上协作,避免重复造轮子。
达摩院也在并行推进以视觉为主导的 VLA 路线,并探索更平台化的基础设施方案。这表明,解决具身智能的世纪难题,需要的不是孤军奋战,而是整个开源生态的共同进化。
RynnBrain 的出现,为具身智能领域补上了关键一环,它证明了让模型扎根物理世界的重要性。开源的不仅是模型,更是一套解决问题的思路和方法。未来,机器人能否真正走进千家万户,或许正取决于这些基础能力的持续演进与社区共创。