一项名为BabyVision的测试揭示了顶级大模型在视觉理解上的惊人短板。尽管这些模型能解决奥赛难题,却在面对3岁儿童轻松通过的视觉题时纷纷落败。这指出了当前多模型依赖文本逻辑的局限性,为AI真正“看懂”世界提供了新的审视方向和改进路径。
智能速览
全新测试集BabyVision显示,顶尖大模型视觉能力普遍不敌3岁儿童。
Gemini 3 Pro是唯一超越3岁基线的模型,但距6岁水平仍有差距。
问题核心在于视觉任务“不可言说”,难以用文字精确描述细节。
四大挑战考验AI:精细辨别、视觉追踪、空间感知和模式归纳。
视频模型因其时间维度,在解决视觉追踪类问题上展现出潜在优势。
精华内容
为何能解奥赛难题的AI,却在幼儿视觉题上栽了跟头?这背后揭示了当前多模态模型的根本性缺陷。
测试结果揭秘
UniPat AI联合多家机构推出的BabyVision测试集,对顶尖大模型进行了一次视觉“摸底考”。结果令人意外:大部分模型的得分集中在显著低于3岁儿童的区间。闭源模型中,Google的Gemini 3 Pro Preview表现最佳,成为唯一稳定超过3岁儿童基线的模型,但其49.7%的得分与6岁儿童仍有近20个百分点的差距。开源模型中,成绩最好的Qwen-VL得分仅为22.2%,而人类本科生在该测试上的平均成绩高达94.1%,对比悬殊。
“不可言说”的难题
这些看似简单的问题为何会成为AI的“滑铁卢”?研究人员指出,核心在于这些任务是“Unspeakable”(不可言说)的。人类的视觉直觉能够轻松捕捉微妙的细节,例如拼图的微小边界或线条的连贯走向,但这些信息很难被精确地转化为语言描述。当前大多数多模态大模型的处理逻辑是将视觉信息转换为文本,再进行推理,这个过程不可避免地会丢失大量关键的视觉原子信息,导致理解偏差。
四大视觉挑战
BabyVision测试将人类的基础视觉能力量化为四大模块。一是精细辨别,要求识别极其微小的非语言细节。二是视觉追踪,即在复杂的交叉线中锁定并跟随单一路径,AI常在分叉点迷失。三是空间感知,要求从2D图像理解3D空间结构及其投影,这是当前纯视觉模型的薄弱环节。四是视觉模式归纳,需要根据已有图形规律预测下一项,AI在图像领域的归纳能力远逊于人类。
未来的破局方向
BabyVision不仅发现了问题,也指明了解决方向。研究团队尝试让模型跳出纯文本逻辑,像孩子一样用画圈、连线等直观方式回答问题。例如,在一个追踪任务中,具备时间维度的视频模型Sora成功描绘出完整路径,而静态图像模型则在交叉点出错。这表明,结合多模态交互,尤其是利用视频的时序信息,可能是提升AI视觉理解能力的关键路径,为AI真正看懂世界带来了新的可能。
BabyVision测试如同一面镜子,清晰地照出大模型在基础视觉能力上的不足。它迫使我们重新思考“智能”的构成,超越了单纯的语言和计算。未来的AI,能否在保留强大逻辑推理的同时,补齐视觉直觉这块短板,真正像人一样理解这个三维世界?