当多模态大模型在复杂任务上所向披靡时,一个看似简单的图片旋转识别问题却让它们集体翻车。这篇文章通过详尽的测试,揭示了模型的这一短板,并分享了巧妙的解决方案,让我们对 AI 的能力边界有了更清醒的认知。
智能速览
作者构建了 ROTBENCH 数据集来测试模型对旋转图片的识别能力。
主流多模态模型在识别 90° 和 270° 旋转时表现极差。
商业模型在 180° 旋转识别上优于开源模型。
增加思维链、坐标框等辅助信息对提升效果有限。
一种名为 Normalized Rotation Voting 的方法显著提升了识别准确率。
精华内容
当 OCR 遇到旋转图片,多模态模型能成为救星吗?一次精心设计的测试,揭开了顶尖 AI 模型不为人知的“路盲”症结,也催生了一个巧妙的解决思路。
测试背景与设定
为了探究多模态模型处理旋转图片的能力,研究者构建了一个名为 ROTBENCH 的专用数据集。该数据集包含了人像、生活场景和自然风景等多种内容,但所有图片均被旋转了 0°、90°、180° 或 270°。测试方法非常直接:向模型展示一张旋转后的图片,并让其从这四个角度中选择一个正确答案,以此统计识别准确率。
模型集体翻车
测试结果令人意外,几乎所有主流多模态模型都表现不佳。一个显著的发现是,所有模型在识别 0°(正置)图片时表现与人类相当。但在识别 180°(倒置)图片时,商业模型的准确率明显优于开源模型。最大的挑战来自 90° 和 270° 的图片,模型的识别准确率极低,几乎等同于随机猜测,与人类识别水平相去甚远。
优化尝试失败
面对不佳的表现,研究者尝试了多种优化方法。例如,在提示中加入思维链(COT)、物体的坐标框或场景图描述等辅助信息,希望能引导模型更好地理解。然而,这些“黑魔法”收效甚微,识别率提升有限。甚至对模型进行微调后,它在 90° 和 270° 上的表现依然不理想,似乎陷入了只能识别 0° 和 180° 的怪圈。
新方法诞生
经过多次尝试,研究者终于找到了突破口,并提出了一种名为“归一化旋转投票”的方法。其核心思想是:既然模型擅长识别 0° 和 180°,那就将所有可能的角度都“正则化”到这两个方向。具体操作是,将同一张原图分别旋转 0°、90°、180°、270° 后输入模型,再将模型识别出的角度减去该次旋转的角度,最后通过投票机制确定原图的真实旋转角度。
效果显著
这个新方法带来了奇迹般的效果。应用后,模型在 90° 和 270° 旋转图片上的识别准确率均超过了 50%,实现了大幅提升,尤其在 270° 的识别上表现更为突出。这一成果证明,通过巧妙的算法设计,可以有效弥补模型在特定任务上的先天性缺陷。
这次探索有趣地揭示了,即使是强大的多模态模型也存在认知盲点。而创新的工程方法有时能带来奇效。这是否意味着,在追求通用智能的道路上,结合精巧的提示工程和算法设计同样至关重要?