蚂蚁灵波一次性开源四个核心模型,构建了从感知、决策到执行的完整技术栈。这套全家桶为具身智能领域提供了可规模化复用的开源基座,有望加速通用机器人的发展进程。
智能速览
LingBot-Depth解决了透明物体感知难题,抓取成功率从0升至50%。
LingBot-VLA以2万小时数据训练出强大的机器人“大脑”,超越此前最强基座。
LingBot-World构建了可实时交互的物理仿真环境,提供零成本试错空间。
LingBot-VA实现“边推演边行动”,打通了机器人执行的最后一环。
整套技术栈开源发布,显著降低了行业研发与适配成本。
精华内容
四个开源模型并非孤立存在,而是构成了一套环环相扣的组合拳,打通了机器人从“看见”到“做到”的完整链路。
看清透明物体
传统深度相机无法识别透明与反光物体,是机器人视觉的顽疾。LingBot-Depth通过创新的掩码深度建模算法,在不升级硬件的情况下,赋予传感器“看透”透明物体的能力。
基于包含300万组数据的训练集,该模型在稀疏深度补全任务中误差降低约47%。在真实抓取测试中,机器人对完全透明塑料杯的抓取成功率从0跃升至50%。
训练通用大脑
机器人“大脑”的泛化能力是关键。LingBot-VLA采用“暴力美学”,用20000小时覆盖9种构型机器人的真实操作数据,喂出了强大的常识与泛化能力,创下开源领域新纪录。
在上海交大的GM-100真实评测基准中,其平均成功率达17.3%,超越了此前公认的SOTA模型Pi0.5。这验证了“一个大脑,适配多个身体”的可行性。
构建虚拟世界
真实世界训练成本高昂且风险大。LingBot-World构建了一个高保真、可交互的仿真环境,让机器人可以在虚拟空间里低成本、高效率地学习和试错。
它不仅能生成十分钟超长稳定视频,还支持用键盘或自然语言实时交互,并严格遵守物理规律。物体不会穿模,状态保持逻辑一致,为机器人提供了理想的“人生模拟器”。
实现推演行动
如何将模拟世界的推演变为现实?LingBot-VA是全球首个自回归视频-动作一体化模型,它实现了“边推演、边行动”,打通了执行闭环。
模型在每一步都会同步生成下一帧画面和对应的机器人动作,并纳入实时反馈进行修正。在真实评测中,其平均成功率较顶级基线提升20%,在仿真中将双臂协同操作成功率推至90%以上。
蚂蚁灵波通过体系化开源,为具身智能行业提供了一套强大的标准基座。这种“基座+适配”的新范式,有望降低研发成本,加速通用机器人时代的到来。开源协作将如何重塑产业格局?