张大妈

腾讯:Agent视觉隐喻迁移

源自小红薯:大模型任我行

03-02 15:32

针对AI如何从图像中提取抽象隐喻逻辑并迁移至新对象的问题,这项研究提出了视觉隐喻迁移新任务。通过构建具备闭环反思能力的多智能体框架,实现了从像素风格替换到认知逻辑跨越的突破。

腾讯:Agent视觉隐喻迁移智能速览

  • 提出视觉隐喻迁移任务,突破像素级风格替换限制

  • 引入Schema Grammar结构化表示,形式化建模隐喻逻辑

  • 设计感知、迁移、生成、诊断四阶段协同智能体

  • 引入层级反馈机制,模拟专业批评者进行定性评估

  • 核心指标类比恰当性提升达16.8%,全面超越SOTA基线

  • 人类评估显示其在创意性与视觉整合上表现优异

腾讯:Agent视觉隐喻迁移精华内容

传统AI图像生成多停留于风格模仿,如何让模型真正理解并迁移深层的隐喻逻辑?这一多智能体框架给出了具体方案。

核心解构方法

提出Schema Grammar(SG)结构化表示,将隐喻解耦为实体、关系核心、冲突点和涌现意义四部分。这种形式化建模有效捕捉了跨域逻辑的不变性,为AI理解复杂隐喻提供了可计算的基础。

四阶段智能体

框架设计了四个阶段的协同智能体。感知智能体提取SG,迁移智能体在保持核心不变前提下匹配新主体与违和点,生成智能体将SG转译为提示词,诊断智能体负责回溯修正。

诊断反馈机制

引入层级反馈机制,诊断智能体模拟专业批评者进行评估。它从主体显著性、违和实现、关系连贯性等维度定性分析,分层回溯定位逻辑偏差,驱动迭代优化,确保生成结果兼具逻辑深度与视觉合理性。

数据实测表现

在126个真实隐喻图像数据集上,该方法在隐喻一致性、类比恰当性等指标上全面超越SOTA基线,类比恰当性提升16.8%。人类评估显示,其隐喻创意性评分达4.57,整体质量为4.77,证明逻辑推理未牺牲美学表现。

该研究将认知语言学中的概念整合理论成功工程化,为AI理解深层语义提供了新路径。随着多智能体技术的成熟,未来AI或许能更精准地捕捉人类独有的隐喻思维,为创意设计带来更多可能。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章