当前具身智能模型普遍存在空间感知模糊与长时任务执行不稳的局限。智源研究院发布的RoboBrain 2.5模型,通过引入精确3D空间推理与稠密时序价值预测两大技术,让机器人不仅能精准理解物理世界的度量信息,还能在操作中获得实时反馈,显著提升了在复杂环境下的任务成功率与稳定性。
智能速览
智源发布RoboBrain 2.5,具身智能大脑实现两大核心升级。
精确3D空间推理让机器人理解绝对距离,规划完整操作路径。
稠密时序价值预测提供实时反馈,提升任务执行稳定性。
多项基准测试表现优于Gemini-3-Pro、GPT-5.2等先进模型。
模型已适配英伟达与摩尔线程GPU,实现跨平台训练。
精华内容
如何让机器人精准理解三维世界并稳定执行长时任务?RoboBrain 2.5通过两项关键技术升级,为具身智能带来了更接近物理世界的感知与操作能力。
空间定位升级
传统模型在空间感知上存在“度量盲区”,能理解2D图像中的目标,却难以转化为真实3D空间的可执行轨迹。RoboBrain 2.5的精确3D空间推理能力解决了这一问题,将感知从预测2D坐标点升级为预测带有深度信息的3D坐标点。
这意味着模型能够理解并执行“在物体上方1~5厘米处悬停”这类精确的物理约束指令。更进一步,模型从预测单个拾取点升级为预测描述完整操作过程的一系列关键点,赋予了机器人带有3D绝对度量的空间规划能力。
实时反馈机制
为解决长时任务中因打滑、偏移等动态变化导致的执行失败,RoboBrain 2.5引入了稠密时序价值预测功能。它能够对任务执行过程进行步进式的进度评估,实时判断当前状态是成功、失败还是发生偏离。
该技术通过融合增量式、前向锚定和后向锚定三种互补的进度估计信号,生成了抗漂移能力更强的价值信号,为强化学习提供了实时、密集的反馈。得益于此,仅通过一次演示,机器人在复杂、细粒度操作中的任务成功率即可达到95%以上。
跨平台SOTA表现
在多项空间推理与时序价值估计的基准测试中,RoboBrain 2.5取得了新的SOTA(State-of-the-art)表现。在评估杂乱3D场景中基于度量的多步空间追踪测试集TraceSpatial上,其表现超越了Gemini-3-Pro-Preview与GPT-5.2等模型。
工程实现上,基于FlagOS-Robo多芯片框架,RoboBrain 2.5已在NVIDIA和摩尔线程GPU集群上完成了完整的端到端训练与对齐验证,最终训练loss差异仅为0.62%,证明了其优秀的跨平台可扩展性与一致性。
千万样本与训练策略
RoboBrain 2.5的强大能力源于高质量的数据与高效的训练策略。研究人员构建了包含约1240万个高质量样本的统一语料库,覆盖通用感知、空间推理与时间预测三大领域。
模型采用渐进式双阶段训练策略:第一阶段通过大规模通用时空学习搭建“通用大脑”,建立广泛的视觉语义与规划能力;第二阶段进行特定时空增强,在定量3D空间推理和密集时间值估计上对模型进行微调,确保了精确的、度量感知的物理交互能力。
RoboBrain 2.5的技术突破,标志着具身智能在与现实世界精准对齐上迈出了关键一步。未来,通过统一生成与理解范式、在人形机器人上部署以及构建自演化数据引擎,具身智能的闭环优化能力将持续增强,通用机器人的落地应用正加速到来。