张大妈

重新思考具身世界的视频生成模型

源自知乎:黄浴

02-10 12:06

视频生成模型在模拟真实机器人交互时面临物理真实性挑战。一项新研究为此提出了评估基准RBench和大规模数据集RoVid-X,旨在系统性解决模型在机器人动作、物理合理性及任务执行上的缺陷,为具身智能的加速发展铺平道路。

重新思考具身世界的视频生成模型智能速览

  • 现有视频生成模型在模拟机器人物理交互时存在显著缺陷。

  • 研究推出首个面向机器人任务的全面评估基准RBench。

  • 通过自动化评估指标精确衡量生成视频的物理合理性与任务一致性。

  • 构建了包含400万片段的大规模开源机器人视频数据集RoVid-X。

  • RoVid-X数据集采用四阶段流程,并富含全面的物理属性标注。

重新思考具身世界的视频生成模型精华内容

要解决视频生成在物理世界的失真问题,首先需要一套科学的评估体系,并辅以高质量的训练数据。这项研究正是从这两方面入手,构建了一个从评估到训练的完整闭环。

评估基准的缺失

通用视频生成基准测试主要关注美学和运动流畅度,无法有效衡量模型在具身场景下的表现。现有模型生成的机器人视频常出现形状畸变、物体属性漂移、非接触式附着等物理错误。

为填补这一空白,研究团队推出了RBench,一个专为机器人视频生成设计的评估基准。它包含了650个评估案例,覆盖了通用操作、长时域规划、多实体协作等五大任务领域,以及双臂、人形、单臂和四足四种主流机器人类型。这确保了评估的全面性和多样性,能够真实反映机器人的动作语义。

多维度评估体系

RBench的核心创新在于其多维度自动化评估指标,旨在超越传统的感知质量评估。它使用多模态大模型(MLLM)作为评估器,通过问答式协议深入检查视频内容。

评估维度包括:物理-语义合理性,检测物体漂浮、穿透、抓取错误等物理常识性错误;任务遵循一致性,验证动作是否完整、顺序是否正确、语义是否与提示一致;运动幅度,衡量机器人主体的有效运动;以及机器人-目标稳定性,评估机器人形态和物体属性是否随时间发生畸变。这套体系能精准定位模型在物理层面的具体缺陷。

数据瓶颈的突破

通过RBench对25个顶尖模型的评估,研究证实了现有模型在生成物理上逼真的机器人行为方面存在普遍缺陷。问题的根源指向了高质量训练数据的严重短缺。

为此,研究团队构建了RoVid-X,一个专为训练机器人视频生成模型设计的开源大规模数据集。该数据集包含400万个带标注的机器人视频片段,是目前该领域规模最大的数据集。它旨在弥合传统视频生成与具身机器人学习之间的鸿沟,为模型提供学习物理交互、空间关系和真实世界动态所需的高质量素材。

精细化数据管道

RoVid-X的构建采用了一个精细化的四阶段数据处理流程,确保了数据的质量和多样性。

第一阶段是机器人视频采集,从互联网平台和超过20个开源数据集中收集约300万原始片段,并用GPT-5进行内容过滤。第二阶段是视频质量过滤,通过场景分割和多维度质量评分系统筛除低质量视频。第三阶段是任务分割和字幕生成,利用视频理解模型将视频切分为任务片段,并为每个动作生成包含主体、对象和细节的标准化描述。第四阶段是物理属性标注,通过超分辨率、光流和深度图等技术增强数据的物理属性,为模型训练提供更丰富的参考信息。

模型能力的实测

基于RBench基准,研究对25个代表性的视频生成模型进行了全面评估,包括Sora、Kling等闭源模型,HunyuanVideo、CogVideoX等开源模型,以及DreamGen、Vidar等专业机器人模型。

评估结果表明,尽管这些模型在通用视频生成任务中表现优异,但在机器人视频生成上均暴露出明显短板。无论是通用模型还是专用模型,都难以稳定生成符合物理规律、准确执行任务的机器人行为,凸显了该领域的技术挑战与改进空间。

RBench与RoVid-X的协同,为具身世界的视频生成构建了从评估到训练的闭环生态。这不仅为研究者提供了有力工具,也揭示了通往通用人工智能道路上的关键挑战,即如何让机器真正理解和模拟物理世界。下一个突破会出现在哪里?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐