张大妈

港科:不训练也能做可供性推理?

源自小红薯:每日ComputerScience

01-27 18:02

传统端到端模型在可供性推理任务中常因泛化能力不足而受限。A4-Agent框架另辟蹊径,无需任何训练即可完成推理。它通过巧妙解耦高层语义与底层定位,协调多个基础模型协同工作,在多个基准测试中表现甚至超越了需要大量数据训练的监督方法,为开放世界的机器人感知提供了新思路。

港科:不训练也能做可供性推理?智能速览

  • 无需训练,A4-Agent通过协调基础模型实现零样本可供性推理。

  • 创新性地解耦“做什么”与“在哪里”的决策过程,避免能力权衡。

  • 引入“视觉想象”机制,生成交互图像以辅助VLM理解抽象指令。

  • 框架设计模块化,各组件可独立替换,降低了维护与升级成本。

  • 在多个公开基准上,其gIoU指标显著优于此前的监督与零样本最佳方法。

港科:不训练也能做可供性推理?精华内容

那么,A4-Agent究竟是如何在完全免训的情况下,实现超越监督模型的性能的呢?其核心在于将复杂的推理任务拆解为三个独立的、由专业模型执行的阶段。

解耦推理与定位

现有方法将高层推理与低层定位强行耦合,导致模型难以兼顾两方面能力,泛化性差。A4-Agent的核心变革在于将可供性预测问题形式化为:Aff = Ground(Reason(I, T))。其中,Reason负责理解指令并决定要操作什么,Ground负责在图像中精确定位操作区域。这种解耦设计,使得每个环节都能由最擅长的模型独立完成,避免了能力上的相互妥协。

三阶段分工协作

A4-Agent由三个模块化的Agent构成:Dreamer(想象者)、Thinker(思考者)和Spotter(定位者)。

Dreamer根据原始图像和语言指令,利用图像生成模型创造一幅包含人/物交互的“想象图”。

Thinker则联合原图与想象图,调用GPT-4o等大模型进行语义推理,输出结构化的文本指令,明确操作对象及部位。

最后,Spotter基于文本指令,使用开放词汇检测器(如Rex-Omni)生成初步定位框,再交由SAM(Segment Anything Model)进行精细像素级分割。

显式视觉想象

“视觉想象”是该框架的一大亮点。面对“握住杯子把手”这类抽象指令,仅凭静态图像,模型难以理解“握”这个动作。Dreamer通过生成人手握住把手的想象图,将抽象的动态交互“可视化”,为后续的Thinker和Spotter提供了至关重要的上下文信息。实验证明,加入这一机制后,所有骨干模型的性能均获得稳定提升,甚至使一些开源模型的表现超越了依赖闭源大模型进行文本推理的方法。

实测性能超越

A4-Agent的性能在多个主流基准上得到了验证。在ReasonAff数据集上,其gIoU达到70.52,超越了监督方法Affordance-R1的67.41。在RAGNet-3DOI基准上,gIoU为63.9,显著领先所有零样本与监督基线。在最具挑战性的UMD数据集上,其gIoU达到65.38,相比此前最佳方法提升了超过15个百分点,充分证明了该免训框架的强大泛化能力和实用性。

A4-Agent通过解耦设计、多模型协作与视觉想象机制,证明了免训方案在复杂推理任务中的巨大潜力。其模块化和强泛化特性,为构建更灵活、更通用的具身智能系统开辟了新道路。未来,这种多智能体协同的框架能否成为解决其他AI难题的通用范式,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐