张大妈

清华大学首次揭示:当前最强AI视觉模型竟然

源自今日头条:至顶AI实验室

01-23 19:41

当人们惊叹于AI识别图片中万物的能力时,清华大学的一项研究却带来了颠覆性的结论。研究表明,当前最顶尖的视觉语言模型在理解图像全局结构方面,表现几乎等同于随机猜测。这项研究通过创新的测试方法,绕开了AI强大的语言推理能力,直击其视觉感知的根本弱点,为我们揭示了AI光鲜外表下的隐秘盲区,迫使我们重新思考何为真正的“看见”。

清华大学首次揭示:当前最强AI视觉模型竟然智能速览

  • 清华大学研究发现顶尖AI模型在全局视觉感知上表现极差。

  • 研究设计的TopoPerception测试,无法通过局部特征或语言知识“作弊”。

  • GPT-4o、Claude等主流模型在测试中表现几乎等同于随机猜测。

  • 一个反直觉的发现是,推理能力更强的模型,视觉感知表现反而更差。

  • 问题根源在于视觉编码器的信息损失和架构缺陷。

清华大学首次揭示:当前最强AI视觉模型竟然精华内容

为了精准地探测AI的视觉能力,研究团队设计了一套巧妙的“视力表”,其结果彻底颠覆了人们对现有AI技术水平的认知。

拓扑感知测试

研究团队引入了拓扑学概念,设计出名为TopoPerception的基准测试。拓扑特征如连通性、孔洞数量等,完全依赖于图像的全局结构,无法通过识别局部细节来“作弊”。

测试采用固定的文本问题和选项,仅改变输入图像,确保AI必须依靠纯粹的视觉信息作答。问题聚焦于图像中白色区域的拓扑结构,选项从无闭合环路到多个闭合环路不等。

为排除语义干扰,测试使用合成数据集生成图像,这些图像不含任何现实世界物体,只包含明确的拓扑属性,为AI视觉感知提供了一场“纯净”的考试。

视觉能力真相

测试结果令人震惊。在对GPT-4o、Claude、Gemini等七个顶尖模型的测试中,所有模型的表现都接近随机猜测水平。

在29×29像素的最低难度下,表现最好的Gemini-2.5-flash准确率仅为33.33%,这仅相当于在三个有效选项中随机蒙对的期望值。GPT-4o的准确率为22.00%,而推理能力更强的o3模型更是低至12.00%。

要知道,在五个选项中完全随机选择的期望准确率是20%。这些数据表明,顶尖AI模型在理解图像整体结构上,几乎完全失灵。

推理与感知冲突

研究最反直觉的发现是:推理能力更强的模型,视觉感知表现反而更差。在OpenAI系列中,性能排序为GPT-4o > o4-mini > o3;在Anthropic系列中,Claude-sonnet-4-0优于Claude-opus-4-0。

一种可能的解释是,强推理模型试图通过自然语言推理来“思考”问题,而不是直接依赖视觉信息。由于拓扑特征是抽象且难以言喻的,这种语言化的思考过程反而会误导模型,使其偏离正确的感知路径,就像想得太多反而干扰了直觉判断。

架构性缺陷

问题的根源在于当前AI视觉系统的架构设计。视觉编码器在将图像转换为文本标记时,会进行有损压缩。为了与语言模型对齐,编码器更倾向于保留容易用语言描述的语义特征,而忽略了全局结构等难以言喻的视觉信息。

此外,图像预处理过程中的缩放、填充或分块操作,也可能破坏图像原有的空间布局关系。这就好比把一张完整的地图撕成碎片再拼接,虽然每个碎片都清晰,但整体地理关系已然混乱。

这项研究不仅为AI视觉领域敲响了警钟,更指明了超越单纯规模化的技术革新方向。它提醒我们,构建真正“看得懂”的AI,需要从架构和训练范式上进行根本性思考。未来的AI视觉智能标准,或许将因此被重新定义。我们离实现真正的机器视觉还有多远?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章