当世界模型开始“指挥双手”,蚂蚁灵波的具身路线更清晰了

源自公众号:硅星人Pro

02-01 18:14

蚂蚁灵波科技近期集中发布LingBot系列模型,通过开源方式探索具身智能新路径。其核心发布的两款世界模型LingBot-World与LingBot-VA,分别致力于构建高保真物理模拟环境与实现视频-动作闭环预测,为解决当前机器人技术中的环境感知与自主学习难题提供了新思路,展现了清晰的技术路线图。

当世界模型开始“指挥双手”,蚂蚁灵波的具身路线更清晰了智能速览

  • LingBot-World是开源版Genie3,旨在创造可交互的物理世界模拟器。

  • LingBot-VA是自回归视频-动作模型,实现大脑与真实世界的交互进化。

  • LingBot-VA在LIBERO和RoboTwin基准测试中成功率分别高达98.5%和92%。

  • LingBot-World通过分层训练和架构优化,将系统延迟降至1秒以下。

  • LingBot-VA仅需30-50条演示数据即可完成新场景适配。

当世界模型开始“指挥双手”,蚂蚁灵波的具身路线更清晰了精华内容

从理解物理世界到精准控制行动,蚂蚁灵波的世界模型正尝试将机器人的“大脑”与“双手”更紧密地连接起来,推动具身智能迈向新阶段。

构建物理模拟器

LingBot-World的目标是让AI从“做梦者”转变为“模拟器”,即从生成像素幻觉转变为理解物理规律。为此,它解决了三大瓶颈:通过分层语义的数据引擎处理多源数据;通过“通用视频训练-MoE注入知识-实时推理架构”三步训练法,保证了高保真度、可控性与低延迟,最终实现了低于1秒的系统响应速度。

作为开源模型,它为开发者提供了一个低成本的虚拟训练场,可用于三维重建、智能体模拟等多种场景。

视频动作的闭环

LingBot-VA探索了“自回归视频-动作世界模型”这一新范式。其核心是通过MoT架构,将视频流与动作流交错排列并映射到统一潜空间,建立起明确的因果关系。模型通过预测下一视频状态,反解码出具体执行动作,形成了一个从感知到行动的闭环。

这一设计有效解决了传统方案中实时反馈差、缺乏因果关联的问题,在LIBERO和RoboTwin等基准测试中,分别以98.5%和92%+的成功率大幅领先。

低成本快速学习

闭环机制赋予了LingBot-VA强大的自我进化能力。由于能与真实世界持续交互并修正“幻觉”,模型在运行中会不断变强。其自回归架构天然具备记忆功能,在计数与寻物任务中均取得满分。

更突出的是,得益于大规模多源数据预训练,模型对新场景的学习效率极高。实测数据显示,一个全新任务场景仅需30~50条演示数据即可完成适配,极大降低了机器人部署和调优的成本。

开源具身生态

从空间感知的LingBot-Depth,到具身操作的LingBot-VLA,再到两款世界模型,蚂蚁灵波正构建一个完整的开源工具矩阵。所有模型均坚持开源,旨在降低行业准入门槛,赋能更多开发者。

这种策略不仅丰富了开源生态的工具库,也体现了其平衡理想主义与现实主义的路径选择。当更多玩家参与开源共建,具身智能的基础设施将更加完善,通往通用机器人的道路也会更加宽阔。

蚂蚁灵波通过一整套开源模型,展示了其构建具身智能基础设施的决心。这种从模拟到执行的闭环路径,不仅降低了技术研发的门槛,也为机器人实现更高级的自主学习和推理能力铺平了道路。当开源生态日益繁荣,通用具身智能的未来或许比想象中来得更快。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐