面对具身智能领域数据碎片化与模型训练效率低的难题,ABot-M0提出了系统性的解决方案。通过构建大规模统一数据集UniACT,并创新性地引入动作流形学习,它为通用机器人的操控能力树立了新的技术基座,展现出超越传统方法的巨大潜力。
智能速览
整合六大开源数据集,构建了超600万轨迹的UniACT统一数据集。
提出“动作流形假设”,将学习目标从高维去噪转为低维投影。
AML方法在高动作维度下鲁棒性远超传统噪声预测模型。
采用双流感知架构,消融实验发现额外action query会破坏表征。
两阶段训练策略兼顾了通用性与任务精度,实现SOTA性能。
精华内容
ABot-M0的核心突破,源于对数据、模型架构和训练策略的全面革新。
数据统一革命
为解决具身智能数据碎片化问题,团队整合了六个主流开源数据集,构建了当前非私有领域最大的UniACT数据集,包含超过600万条轨迹。通过标准化的清洗流程,有效处理了异构数据质量参差不齐的挑战。
其中,“Pad-to-Dual”策略是一大亮点,它巧妙地将单臂操作视为双臂操控的特例,从而实现了不同任务间的参数共享与表示统一,为模型的通用性学习奠定了坚实基础。
动作流形之思
传统扩散模型预测高维无结构的噪声或速度,如同“大海捞针”。ABot-M0基于“动作流形假设”,认为物理合理的动作实际上集中在低维光滑流形上。
基于此,AML方法改用DiT直接预测干净的动作序列,将学习目标从“去噪”转变为“投影到可行流形”。这种范式转变带来了显著优势:当动作维度从8维增至30维时,模型的鲁棒性远优于传统方法,为未来复杂任务铺平了道路。
双流感知架构
在感知层面,ABot-M0采用双流架构。Qwen3-VL负责提供高层语义理解,而VGGT和Qwen-Image-Edit作为即插即用的3D专家模块,负责注入几何先验信息。
消融实验揭示了一个反直觉的发现:经过VLA预训练后,VLM的最后一层特征已与动作空间充分对齐,额外引入action query反而会破坏已有的表征结构。3D模块则通过cross-attention与VLM特征融合,在相机视角扰动下带来了14%的性能提升。
训练与SOTA表现
训练策略上,Task-Uniform采样被证明能在机器人的本体多样性与技能覆盖之间取得最佳平衡。同时,两阶段训练流程——先进行大规模预训练,再进行空间感知的指令微调(SFT)——有效协调了模型的通用性与具体任务的精度。
最终,这套完全基于开源资源构建的系统,在四个主流基准测试上均取得了SOTA表现,证明了其方案的先进性与可行性。
ABot-M0的实践证明,通过系统化的工程与理论创新,开源社区同样能打造出顶尖的具身智能基座。这项工作为未来更复杂的全身控制和长程任务奠定了坚实基础,也预示着通用机器人研发新范式的到来。