张大妈

宣传下在字节seed robotics的第一篇工作!!

源自小红薯:m0Mo

02-14 11:43

字节跳动Seed Robotics首度公开BagelVLA研究成果,该模型利用交错推理能力拆解并执行具身长流程任务。通过引入3M数据训练及动作微调,BagelVLA在方块堆叠和数字拼图等真机实验中表现出色,为具身智能应用提供了新的技术路径。

宣传下在字节seed robotics的第一篇工作!!智能速览

  • BagelVLA利用交错推理能力拆解子任务并生成动作

  • 模型采用3M通用及具身数据进行Post-training和动作微调

  • 仿真环境选择Calvin和Robotwin进行验证

  • 真机实现任意顺序方块堆叠及十位数加减法拼图

  • 采用单步去噪处理方法有效缩短推理时间

宣传下在字节seed robotics的第一篇工作!!精华内容

BagelVLA的核心在于通过视觉与语言模型的协同,解决具身智能中的长流程任务难题,以下是该模型的技术架构与实测表现。

交错推理机制

BagelVLA借鉴了Bagel的交错推理能力,构建了一套从指令到动作的完整闭环。模型首先从全局指令中拆解出当前的子任务,随后预测视觉结果,最后生成具体的动作序列。这种机制使得机器人在处理复杂任务时能够保持逻辑连贯性,有效解决了具身智能中常见的任务理解偏差问题。

数据训练策略

为了提升模型的泛化能力,研究团队采用了分阶段的训练策略。第一阶段利用3M通用及具身场景数据对原始Bagel模型进行Post-training;第二阶段专门使用动作数据进行微调。这种针对性的数据投喂,使得模型在面对不同场景时能够更快地适应并做出准确反应。

仿真与真机实测

在仿真环境中,BagelVLA选择了Calvin和Robotwin作为测试平台,验证了基础操作的可行性。真机测试环节则展示了更强的泛化能力,除了基础的抓取放置任务外,模型还能实现任意顺序和颜色的方块堆叠。更为亮眼的是,它甚至能通过操作方块完成十位数的加减法拼数字任务。

推理效率优化

针对具身智能模型普遍存在的推理时间过长问题,团队提出了创新的解决方案。通过采样与VPP(Video Prediction and Planning)类似的单步去噪处理方法,BagelVLA在保持性能的同时显著降低了推理耗时。这一优化对于机器人在实际应用中的实时响应至关重要,同时也为World Model结合VLA的研究方向提供了参考。

BagelVLA的推出展示了字节跳动在具身智能领域的技术积累,其长流程任务处理能力和高效的推理机制值得行业关注。随着技术的不断迭代,未来机器人或许能在更多复杂场景中替代人工。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐