张大妈

港中文&亚马逊:用RL解决文字操控物体位置

源自小红薯:每日ComputerScience

01-16 16:01

想让AI按文字指令移动图片里的物体为何如此困难?主流图像编辑模型在几何级操作上表现不佳,无法精确移动物体。TALK2MOVE框架另辟蹊径,首次将这一问题系统性地建模为强化学习任务,成功绕过了对成对标注数据的依赖,为实现高精度、可解释的图像空间编辑提供了全新思路。

港中文&亚马逊:用RL解决文字操控物体位置智能速览

  • 主流图像编辑模型难以执行精确的几何操作,如移动物体。

  • TALK2MOVE利用强化学习(GRPO)建模文本到物体变换的过程。

  • 该方法无需成对的before-after标注数据,显著降低训练门槛。

  • 通过空间感知奖励函数,直接在几何空间计算奖励,提升精度。

  • 在平移任务上准确率最高达76.67%,人类偏好胜率领先竞品。

  • 训练效率最高可提升2倍,且数据效率高,1/10数据量仍优于SFT。

港中文&亚马逊:用RL解决文字操控物体位置精华内容

TALK2MOVE 的突破在于它没有走传统像素回归的老路,而是将编辑过程视为一个智能体学习任务,这从根本上改变了游戏规则,让AI学会了“理解”空间指令。

RL重塑编辑范式

传统图像编辑依赖像素回归或启发式规则,难以精确控制物体几何关系。TALK2MOVE首次将“文本指令到物体几何变换”这一过程,建模为强化学习中的组相对策略优化(GRPO)任务。这种方法让模型通过与环境(图像)交互来学习,而非简单模仿像素变化,从而获得了更强的空间推理和精确控制能力,统一支持平移、旋转和缩放三类操作。

破解数据瓶颈

高质量成对数据是几何编辑的巨大瓶颈。TALK2MOVE通过GRPO的多轨迹采样和文本轻扰动技术,自行生成训练所需的rollouts,从而摆脱了对繁琐的before-after标注数据的依赖。此外,其提出的Step-wise Active Sampling策略能评估扩散步骤的信息量,提前退出无效步骤,最高可将训练效率提升2倍,实现了在仅使用1/10数据量时,效果依然优于纯监督微调(SFT)模型。

空间感知的奖励

如何让AI理解“移动得准不准”?TALK2MOVE设计了空间感知奖励函数,直接在物体级别的几何空间中计算奖励,例如具体的位移向量、旋转角度和缩放比例,而不是依赖模糊的图像相似度。同时,通过文本驱动分割和深度估计,框架将前景物体与背景解耦,确保编辑操作只作用于目标物体,避免了整个画面被意外修改的问题。

全面领先的性能

在合成与真实数据集的测试中,TALK2MOVE展现了全面领先的优势。在物体平移任务上,其编辑准确率最高达到76.67%。在人类主观评测中,相比于GPT-Image-1、Flux-Kontext、Bagel等先进模型,TALK2MOVE的胜率稳定在57.5%至68.75%之间,证明了其生成结果更符合人类直觉和指令意图。

TALK2MOVE为AI图像编辑领域引入了强化学习的新视角,有效解决了几何操作这一长期存在的痛点。它不仅在技术上实现了突破,更预示着未来我们与视觉内容交互方式的变革。当AI能精确理解并执行空间指令时,从创意设计到自动化内容生成,将迎来怎样的新可能?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章