当前具身智能评测依赖高层指令,容易高估模型在真实世界的表现。中科大提出的NativeEmbodied框架,通过原生低层动作空间与高低层解耦评测,能够更精准地揭示视觉语言模型在机器人控制上的真实能力与核心瓶颈。
智能速览
当前评测体系因依赖高层指令而高估VLM能力。
NativeEmbodied构建了逼近真实控制的原生低层动作空间。
新评测体系实现了高层任务与低层技能的解耦诊断。
研究覆盖15个主流VLM,揭示了模型间的真实能力差距。
通过消融实验精确定位了限制VLM具身表现的关键因子。
引入多维指标,从效率和策略风格等维度全面评估模型。
精华内容
要真正理解VLM的具身能力,必须深入其底层控制逻辑。NativeEmbodied正是为此设计的评测体系,它如何揭示模型的真实水平?
评测新范式
现有评测方法过度依赖高层抽象指令,使得模型在底层运动与空间控制上的真实表现被掩盖。NativeEmbodied框架基于AI2-THOR环境,提出一种原生低层动作空间,只允许Move、Rotate、Look等基础动作及参数化控制,禁止高阶函数调用,从而更贴近真实机器人的控制语义,让评测回归本源。
高低层解耦
为系统诊断模型能力,该评测体系构建了任务与技能的解耦结构。它设定了探索、搜索、交互三类高层任务,用于评估综合性表现;同时划分出感知、对齐、导航、规划四类低层技能,用于对模型的专项能力进行精细测试,定位具体短板。
多维指标体系
评测不再局限于单一的成功率。NativeEmbodied引入了WAS(加权成功率)、ACD(平均完成距离)、ACPD(平均完成路径差异)、F1分数等一系列指标。这些新指标能够有效区分任务完成的效率、路径选择的优劣以及策略风格的差异,提供了更全面的模型画像。
横测与瓶颈
研究对15个主流开源及闭源VLM进行了大规模横向评测,清晰展示了不同模型在原生环境下的能力差距。通过感知补强、导航传送、子任务拆解等一系列消融干预实验,精确定位出感知精度、长时程规划等是当前限制VLM具身表现的关键瓶颈。
NativeEmbodied为具身智能的评估提供了更科学、更贴近现实的基准。它不仅帮助研究者看清了VLM的真实能力边界,也为未来的模型优化指明了方向。在通往通用机器人的道路上,我们还需克服哪些核心挑战?