一个名为BabyVision的新型评测集,专门剥离语言提示来检验大模型的纯视觉能力,结果令人意外。顶尖模型如GPT-5.2的准确率仅为34.8%,远低于人类94.1%的水平。这揭示了当前多模态大模型在处理“只可意会”的视觉细节时存在根本性短板,为技术发展提供了新的诊断方向。
智能速览
BabyVision评测集专注检验大模型剥离语言后的纯视觉能力。
顶尖模型表现不佳,GPT-5.2准确率仅34.8%,远低于人类94.1%。
核心瓶颈在于“只可意会”的视觉细节在转为文本时丢失。
新探索的生成式推理方法展现出更接近人类的解题行为。
该评测集已开源,旨在为多模态与具身智能提供评估路线图。
精华内容
具体的评测数据如何揭示了模型的深层缺陷?新的技术探索又指向了怎样的未来?下面将深入剖析。
评测结果悬殊
在包含388道题目的BabyVision-Full评测集上,人类基线准确率高达94.1%,而主流大模型的表现却与之差距显著。闭源模型中,Gemini3-Pro-Preview以49.7%的准确率位居榜首,GPT-5.2为34.8%,Doubao-1.8为30.2%。开源模型阵营表现更弱,最佳模型Qwen3VL-235B-Thinking的准确率仅为22.2%,多数模型得分集中在12%至19%的区间,凸显了当前技术的普遍短板。
能力瓶颈何在
研究指出,模型表现不佳的核心原因在于视觉任务中存在大量难以被语言完整描述的“unspeakable”细节。当模型试图将这些视觉信息压缩成文本token进行推理时,关键信息便容易丢失。例如,在一道垃圾分类连线题中,模型能生成看似严谨的“逐段追踪”推理文本,却在最基础的视觉追踪环节出错,将两条路径接反,导致最终答案错误。
生成式新探索
为探索新的技术路径,团队从基准中筛选出280道适合生成式作答的题目,构建了BabyVision-Gen。该子评测要求模型不再通过文本,而是以生成图像或视频的形式来输出其完整的解题过程。初步观察发现,这种生成式推理在视觉追踪、精细辨别等任务上,表现出更接近人类操作的行为模式,但其整体稳定到达正确解的能力仍需大幅提升。
开源评估意义
BabyVision评测集已通过GitHub等平台开源,其定位是xbench双轨评估体系中AGI Tracking系列的一部分。此举的意义在于,它为多模态与具身智能领域的发展提供了一个可测量、可诊断的视觉能力评估路线图,帮助研究者们更清晰地识别模型弱点,从而进行针对性优化,推动技术向着更接近人类智能的方向演进。
BabyVision评测集不仅揭示了当前多模态模型的“阿喀琉斯之踵”,更通过开源和新的评估方法,为具身智能和AGI的发展铺平了道路。当AI能真正“看见”而非“读图”,其能力边界将拓展至何方?