小米开源的具身智能模型Xiaomi-Robotics-0,正试图打破机器人“反应迟钝、成本高昂”的僵局。它不仅以47亿参数在多项测试中取得领先,更关键的是,它能流畅执行复杂指令,并且只需消费级显卡即可实时运行,极大地降低了前沿技术的应用门槛。
智能速览
小米发布47亿参数开源具身智能模型Xiaomi-Robotics-0。
模型解决了传统机器人动作延迟高、不连贯的核心痛点。
最具突破性的是,它能在普通消费级显卡上实现实时推理。
在三大主流仿真测试中,该模型对标超过30款模型,均取得SOTA成绩。
小米选择将核心技术全量开源,推动整个行业技术迭代。
精华内容
当前机器人模型普遍面临动作卡顿与硬件成本高昂的双重困境。小米是如何通过技术架构创新,让机器人既聪明又能干,还能飞入寻常百姓家的?
行业两大痛点
具身智能领域长期存在两个核心难题。首先是推理延迟高导致动作不连贯,传统VLA模型在现实世界中表现如同“延迟卡顿的木偶”,无法自然操作。其次是硬件门槛极高,高性能模型必须依赖昂贵专业显卡,将先进技术锁在实验室,无法普及。此外,许多模型还存在仿真与实际表现脱节的问题,难以完成叠毛巾、拆积木等真实物理任务。
双脑协同系统
小米通过自研的Mixture-of-Transformers(MoT)混合架构解决难题。该架构包含一个视觉语言大脑(VLM),负责理解指令和环境,保留多模态理解能力;以及一个动作执行小脑(DiT),专门生成连续流畅的“动作块”。通过流匹配技术,它从根源上解决了动作断层的痛点,让机器人动作更接近人类。
两阶段训练法
为确保机器人既聪明又能干,团队设计了精巧的训练方案。第一阶段通过跨模态预训练,让模型在学动作时不丢失物体识别等基础能力。第二阶段通过后训练优化,用异步推理模式解决真机“动作断层”问题,并采用Clean Action Prefix和Λ-shape Attention Mask等技术,保证动作轨迹连续,提升环境适配能力。
真机实测表现
在曝光的真机视频中,该模型展现了出色的泛化能力。处理毛巾时,它能自主完成铺平、对折、整理,并将多余毛巾放回原位。面对积木,它能稳妥拆解,手眼协调稳定,无卡顿失误。在Libero、Calvin、SimplerEnv三大全球主流测试集上,它对标超30款模型,包揽所有基准测试的SOTA成绩。
Xiaomi-Robotics-0的开源,不仅是技术的胜利,更是理念的胜利。它打破了大厂技术垄断,让具身智能的未来图景变得更加清晰。当机器人不再遥不可及,那个充满智能设备的生活,或许真的近在眼前了。