顶尖AI视觉能力不敌三岁宝宝

源自公众号:机器之心

01-14 17:36

多模态大模型在语言推理上表现卓越,但纯视觉能力却停留在幼儿水平。BabyVision评测集通过388道精心设计的视觉题目,揭示了当前AI模型在基础视觉能力上的系统性缺陷,为具身智能发展指明方向。

顶尖AI视觉能力不敌三岁宝宝智能速览

  • BabyVision测试显示大多数AI模型得分低于3岁儿童

  • 最强模型Gemini3-Pro-Preview仅49.7%准确率,远低于人类94.1%

  • 视觉能力被拆解为4大类22个子任务进行评测

  • 模型在视觉追踪、空间感知等基础能力上普遍翻车

  • 生成式作答可能是补齐视觉短板的新方向

顶尖AI视觉能力不敌三岁宝宝精华内容

当问题无法用语言完整描述时,AI的视觉推理能力便暴露无遗。BabyVision评测集通过严格控制语言依赖,让模型直面最基础的视觉挑战。

测试结果惊人

BabyVision-Mini测试中,20道视觉题目交给不同年龄段儿童和顶尖AI模型。结果显示大多数模型得分聚集在明显低于3岁儿童的区间。Gemini3-Pro-Preview是唯一稳定超过3岁基线的模型,但距离6岁儿童仍有约20个百分点的差距。在一道连线垃圾分类题目中,孩子本能地沿线追踪,而模型即便写出大量推理文字,仍会把路径接反。

能力全面落后

BabyVision-Full包含388道题目,涵盖精细辨别、视觉追踪、空间感知和视觉模式识别4大类22个子任务。人类基线准确率达94.1%,而闭源最强的Gemini3-Pro-Preview仅49.7%,GPT-5.2为34.8%,开源最强模型Qwen3VL-235B-Thinking仅22.2%。差距是系统性的,四大类能力都在下滑,Count 3D Blocks等子任务甚至出现全员翻车。

四大核心挑战

模型面临的第一挑战是看不见非语言细节,如拼图中微小边界差异;第二是追线追丢,遇到交叉点容易换轨;第三是缺乏真正的空间想象,漏掉隐藏块或搞错投影关系;第四是图形规律归纳难,常把结构规则误读为外观统计。这些题目对人类来说不难,但模型一旦用文字复述视觉,信息就丢失了。

生成式作答探索

BabyVision-Gen让模型用画、圈、连线等方式作答,包含280道适合生成式作答的题目。测试显示,生成式推理在视觉追踪等任务上出现更像人类的行为,会真的画轨迹、做标注,但整体仍缺乏稳定到达正确解的能力。这为补齐视觉短板提供了新思路。

BabyVision的价值在于把看懂世界拆解成可测量的22个原子能力,清晰指出了差距所在。一个视觉能力低于3岁孩子的机器人难以在物理世界可靠工作。多模态模型要走向通用智能,必须补齐视觉地基:看得准、追得住、想得出、归纳得了。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章