当前文生图模型虽能生成精美图像,但在空间感知和逻辑推理上存在明显短板。阿里高德提出的全新评估基准 SpatialGenEval,通过设计高信息密度的提示词,首次系统性地检测了模型在复杂空间任务中的能力边界,揭示了行业普遍存在的“逻辑盲区”,为下一代模型发展指明了方向。
智能速览
现有文生图模型在空间逻辑推理上能力不足。
阿里高德推出全新评估基准 SpatialGenEval。
该基准从4大维度、10个子维度评估空间智能。
评估显示,空间推理是当前模型最大的瓶颈。
研究提出SpatialT2I数据集,可微调提升模型空间智能。
精华内容
文生图模型的空间智能究竟如何被定义和评估?SpatialGenEval基准通过对23款主流模型的系统性测试,为我们揭示了一个不容乐观的现状。
空间认知挑战
当前T2I模型在空间认知上面临从基础感知到高阶推理的全方位挑战。首先是空间基础的“属性漂移”,模型在信息密集的提示词下,常出现物体漏画或属性绑定错误。其次是空间感知的“几何偏见”,模型难以精准定位物体,倾向于生成默认姿态。最严重的是空间推理的“逻辑盲区”,在处理“红椅比蓝椅大两倍”这类相对数值比较和3D遮挡关系时,模型表现接近随机猜测。最后是空间交互的“动态失真”,模型难以捕捉物体间的动态瞬间或物理因果逻辑。
空间智能“全科扫描”
为系统性评估空间智能,研究团队构建了SpatialGenEval基准,将能力解构为4大领域和10个关键子维度:空间基础(多目标物体类别、属性绑定)、空间感知(位置、朝向、布局)、空间推理(大小比较、邻近性、遮挡)和空间交互(运动、因果)。该基准覆盖25个现实世界场景,包含1230条精心构建的长文本、信息密集型提示词,每个提示词约60词,兼顾了高信息量和模型兼容性。
核心发现与瓶颈
对23款前沿T2I模型的详尽评估结果揭示了行业的核心短板。数据显示,尽管模型在基础语义对齐上表现尚可,但在空间推理维度上得分极低,特别是在涉及物理世界的层级、深度和距离关系时,错误率居高不下。这表明当前模型的空间智能能力仍处于浅表阶段,缺乏对真实物理世界逻辑的深层理解,空间推理已成为制约其发展的主要瓶颈。
改进路径探索
除了评估,研究还探索了提升模型空间智能的有效路径。团队通过多模态大模型重写提示词以构建图文一致性,生成了包含15400对图文数据的SpatialT2I数据集。利用该数据集对主流的扩散模型、自回归模型和统一模型进行监督微调后,模型在空间评估指标上获得了显著增益,生成的图像在物理逻辑和空间布局上的真实感大幅提升。
SpatialGenEval 的出现,为文生图模型从“美学生成”迈向“逻辑感知”建立了新的评估标准。当模型真正理解“万物各得其所”,生成式AI才能在机器人、自动驾驶等严苛领域释放生产力,这或许是通往通用人工智能的关键一步。