张大妈

Xiaomi-Robotics-0,米子的开源vla模型

源自小红薯:从不毒舌可达鸭

02-14 11:09

小米发布首个开源具身VLA模型,4.7B参数量适配消费级显卡。通过VLM+DiT架构及海量数据训练,该模型有效解决了空间认知难题,在多项基准测试中达到SOTA水平,为具身智能领域带来新的技术突破。

Xiaomi-Robotics-0,米子的开源vla模型智能速览

  • 小米发布首个开源具身VLA模型,4.7B参数适配消费级显卡。

  • 采用VLM+DiT架构,强迫预测未来动作以修正空间认知缺陷。

  • 使用2亿+动作轨迹和8000万+视觉语言数据进行训练。

  • 在多个benchmark上取得SOTA级别效果,技术表现亮眼。

Xiaomi-Robotics-0,米子的开源vla模型精华内容

该模型不仅在架构上融合了视频生成思路,更在训练数据上实现了规模化突破,具身智能领域迎来强力竞争者。

架构创新

模型采用了VLM(视觉语言模型)与DiT(扩散Transformer)相结合的架构。这种设计与当前流行的视频生成和状态预测模型思路一致。为了解决传统VLM更偏向图片和文本认知、缺乏空间认知能力的问题,训练过程中强迫模型预测未来的动作状态。这种机制有效增强了模型对空间和动作的理解能力,使其在具身任务中表现更加精准。

数据规模

训练数据的规模是该模型取得SOTA效果的关键。模型使用了超过2亿条跨本体的动作轨迹数据,以及超过8000万的视觉-语言数据。这种大规模的数据投喂,让模型在处理复杂环境和多样化任务时具备了更强的泛化能力,确保了其在不同场景下的鲁棒性。

行业影响

虽然这是小米在具身智能领域的第一步,但其潜力不容小觑。小米拥有充足的资源、资金以及强大的供应链能力,加之在智能家居和机器人领域丰富的落地场景,使其成为具身智能赛道中不可忽视的玩家。此次开源将推动社区共同进步,加速技术迭代。

小米开源VLA模型为具身智能社区注入了新活力,展示了其技术储备与野心。随着更多企业入局,具身智能的竞争将愈发激烈,未来的机器人会有怎样的进化?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐