近期,小米正式发布并开源了其首代机器人视觉-语言-动作(VLA)大模型——Xiaomi-Robotics-0,引发了业界的广泛关注。这款拥有47亿参数的模型,旨在将视觉语言的理解能力与高性能的实时执行能力相结合,以解决当前具身智能领域普遍存在的“动作卡顿、反应迟缓”等行业痛点。
该模型在技术架构上的一大创新是采用了“大脑+小脑”的混合架构(MoT)。其中,“大脑”部分由一个多模态视觉语言大模型(VLM)担当,负责理解人类下达的自然语言指令,并从高清视觉输入中捕捉复杂的空间关系。而“小脑”部分则嵌入了扩散模型(DiT),专门用于生成平滑、连贯的动作序列。这种分工协作的设计,旨在让机器人既能“听懂人话”,又能“手脚麻利”。

为了让模型在学习动作技能后,不丧失原有的多模态理解与常识推理能力,小米团队设计了一套两阶段训练体系。第一阶段进行跨模态预训练,将视觉语言特征与动作空间对齐;第二阶段则冻结“大脑”VLM,专注于训练“小脑”DiT,精细化动作生成能力。这种“先对齐再精修”的策略,有效避免了模型“学会干活就忘了思考”的问题。

针对真实物理世界中机器人常因计算延迟而产生的“动作断层”问题,Xiaomi-Robotics-0引入了异步推理模式。该模式将模型推理与机器人执行解耦,从机制上保证了动作的流畅性。同时,结合特殊的Λ形注意力掩码(Λ-shape Attention Mask)技术,模型在执行长周期任务时,既能确保动作轨迹的连续,又能强制关注实时的视觉反馈,从而提升对环境变化的响应能力。
在性能表现上,Xiaomi-Robotics-0在LIBERO、CALVIN和SimplerEnv等多个主流仿真测试基准中,其表现超越了包括Meta的OpenVLA和Google DeepMind的Pi在内的多种模型,刷新了多项行业纪录(SOTA)。在真实机器人平台的测试中,该模型也成功驱动双臂机器人完成了拆解积木、叠毛巾等长周期、高难度的精细操作任务,展现出对刚性物体和柔性织物良好的处理能力和手眼协调性。尤为关键的是,该模型能够在消费级显卡(如RTX 4090)上实现低至80ms的实时推理,大大降低了部署门槛。

小米此次不仅发布了模型,还将其技术主页、代码及模型权重全部开源。这一举动被外界视为小米在推动具身智能行业发展、构建开放生态方面的务实举措。通过提供一个可用的“技术底座”,中小企业和开发者可以不必从零开始,从而加速机器人应用的开发和落地。
综合来看,Xiaomi-Robotics-0的发布,不仅是小米在AI和机器人领域技术实力的展现,也反映了其清晰的战略布局。该模型务实地瞄准了机器人“进厂干活”等实际应用场景,结合小米已有的触觉感知等技术,构建了“手脑协同”的完整技术栈。这种技术突破与小米庞大的智能硬件生态、智能制造及智能驾驶业务相结合,形成了跨业务、跨场景的技术复用潜力,为其在未来具身智能的竞争中构筑了独特的生态壁垒。