DM0是全球首个具身原生大模型,专为物理世界设计,解决了AI从“认识”到“做到”的根本难题。它通过独特的训练架构,让机器人能精准执行复杂任务,为具身智能的实际应用开启了新起点。
智能速览
传统大语言模型与机械臂的结合,无法实现精准的物理操作。
DM0通过多源、多任务、多机型训练,打通了具身智能全链路。
其核心是构建空间推理思维链,让模型理解任务本质而非死记参数。
在RoboChallenge评测中,DM0的单任务与多任务成功率均排名全球第一。
仅用2.4B参数就能实时处理三路高清画面,推理延迟仅60毫秒。
DM0已在GitHub和Hugging Face全面开源,加速技术落地。
精华内容
要理解DM0如何实现从0到1的突破,需要深入其训练架构与技术内核。
为何需要DM0
AI识别出冰箱里有牛奶,和能精准地取出一盒牛奶是两回事。一个通用大语言模型加上一双机械手,远不足以完成这种精细操作。这中间缺少了从理解物理环境到规划并执行具体动作的核心能力,而DM0正是为弥补这一鸿沟而生,它被设计为全球首个真正面向物理世界原生设计的具身大模型。
三阶训练法
DM0的训练分为三个关键阶段。第一阶段是VLM预训练,将互联网、自动驾驶及具身多传感数据融合,构建扎实的基础感知能力。第二阶段是VLA预训练,这是能力涌现的核心,包含两条主线:一是通过覆盖3类核心任务和8款主流机型的多任务训练,让模型学会操作本质;二是构建空间推理思维链,打通从理解到操作的完整链路。最后是VLA后训练,保留针对特定机型的适配能力。
实测表现卓越
在RoboChallenge大规模真机评测中,DM0的单任务和多任务成功率双双取得全球第一。它不仅能应对毫米级的工业精密操作,如精准识别与摆放,还能处理自动结账等复杂全流程场景。这些实测成绩证明了其在真实世界中的稳定性和有效性,远超简单参数堆叠的模型。
高效且开源
DM0的智能密度极高,仅用2.4B参数就能实时处理三视角高清画面,推理延迟低至60毫秒。这使得它能够在消费级显卡上进行训练和推理,极大地降低了开发门槛。目前,DM0的模型与代码已在GitHub和Hugging Face全面开源,为社区发展和应用落地提供了坚实基础。
DM0为具身智能领域树立了新的技术标杆,其原生设计和高效表现展现了巨大潜力。随着开源生态的发展,未来AI将在更多真实场景中完成复杂任务。