具身智能领域长期受困于数据碎片化与表征不一致,难以实现“一脑多形”的通用操控。ABot-MO技术报告提出了一套系统性方案,其核心创新的“动作流形假设”,通过将学习目标从拟合噪声转向投影到可行流形,为构建稳定、高效的通用机器人基础模型开辟了新路径。
智能速览
提出“动作流形假设”,将机器人动作预测范式从去噪转为流形投影。
构建了包含600万条轨迹、覆盖20多种机器人形态的UniACT-dataset。
采用模块化双流感知架构,大幅增强了模型的3D几何推理能力。
在多项国际权威基准测试中性能全面领先,超越π₀.₅等强基线模型。
精华内容
传统方法试图在噪声中寻找动作,而ABot-MO则另辟蹊径,认为所有有效动作都遵循着物理定律,构成一个平滑的低维流形。
范式之变:动作流形
ABot-MO的核心是“动作流形假设”,它认为有效的机器人动作并非随机分布,而是位于一个受物理与任务约束的低维平滑流形上。这与传统扩散模型预测噪声的思路截然不同。基于此,团队设计了动作流形学习(AML)机制,利用DiT骨干网络直接预测干净、连续的动作序列。这种从“拟合噪声”到“投影到可行流形”的转变,显著提升了机器人的决策效率与策略稳定性。
数据基石:海量对齐
为支撑模型的通用性,团队构建了目前非私有领域规模最大的UniACT-dataset。该数据集规模庞大,包含超过600万条轨迹,涵盖9,500多小时的数据。其多样性体现在整合了OXE、AgiBot等6个主流开源数据集,覆盖了单臂、双臂、半人形等20多种独特的机器人形态。更重要的是,通过建立统一的末端执行器坐标系与双臂填充策略,成功解决了异构数据难以对齐的关键难题。
感知增强:双流架构
为了弥补标准视觉语言模型(VLM)在3D几何推理上的短板,ABot-MO采用了模块化的双流感知机制。其中,语义流基于Qwen3-VL,提供强大的视觉-语言理解能力;而几何流则插件式引入VGGT和Qwen-Image-Edit等模型,为系统注入场景级的3D结构信息与多视角特征。这种设计无需修改VLM主干,即可显著提升模型的空间理解能力。
性能实测:全面领先
在实际性能表现上,ABot-MO在多个国际权威基准测试中均取得了SOTA(State-of-the-Art)的成绩。报告显示,其性能大幅超越了π₀.₅等业界公认的强基线模型。这一结果不仅验证了“动作流形假设”的有效性,也展示了ABot-MO作为通用具身操控基座的强大潜力,为后续研究与应用设立了新的标杆。
ABot-MO通过其独特的流形学习视角,为解决具身智能的泛化难题提供了强有力的技术框架。它不仅在数据、感知和决策层面实现了系统性的整合,其卓越的性能也预示着通用机器人操控正加速到来。未来,这样的基础模型将如何赋能更多元化的机器人形态?