张大妈

多模态大模型输给三岁宝宝?BabyVision首发

源自小红薯:xbench

01-29 20:30

一项覆盖388道题目的系统性评测揭示:当前顶尖多模态大模型在基础视觉理解任务上的平均准确率仅49.7%,显著低于3岁儿童的平均水平(约65%)和成人基线(94.1%)。该发现直指AI感知层的根本性短板,为AGI发展提供关键反思坐标。

多模态大模型输给三岁宝宝?BabyVision首发智能速览

  • BabyVision评测集首次以儿童发展心理学为标尺,构建388道视觉‘原子能力’测试题

  • Gemini 3-Pro-Preview得分最高达49.7%,仍比3岁儿童低约15个百分点,距6岁儿童差20个百分点

  • 模型在视觉追踪、空间关系判断等基础任务上系统性失效,非单点错误而是能力缺失

  • 人类受试者(本科以上学历)在完整评测中准确率达94.1%,凸显人机视觉鸿沟

  • 评测识别出四类‘不可言说’挑战:空间连续性、局部-整体绑定、动态轨迹推断、跨模态对齐

  • BabyVision-Gen提出新范式:要求模型通过绘图、连线、描迹等具身化方式作答,而非纯文本推理

多模态大模型输给三岁宝宝?BabyVision首发精华内容

当AI能解微分方程却认不出哪条线连向哪个图形时,问题已不在语言或逻辑层——它根本没真正‘看见’世界。BabyVision用发展心理学的标尺,第一次把多模态模型的视觉盲区清晰量化。

评测设计

BabyVision由红杉中国Xbench与UniPat AI联合发布,依据儿童视觉认知发展规律,将视觉智能拆解为形状识别、空间关系、运动推理、场景理解四大类,共22项原子能力。全部388道题目均经3-12岁儿童实测校准,确保难度梯度真实反映人类视觉发育进程。

题目全部采用无文字干扰的纯视觉形式,规避语言先验影响。例如‘连线追踪’题仅含两条弯曲路径与两个端点,要求判断对应关系,不依赖任何文本描述或常识推理。

所有题目经16名本科及以上学历成人重复测试,平均准确率94.1%,标准差仅2.3%,验证了评测本身的信效度。

性能落差

在BabyVision-Full完整评测中,表现最佳的Gemini 3-Pro-Preview得分为49.7%,Qwen-VL-Plus为45.2%,GPT-4V为42.8%。而3岁儿童组平均得分为64.3%,6岁儿童组达84.1%。

四大能力类别中,模型在‘运动轨迹推断’(平均31.6%)和‘局部-整体空间绑定’(平均38.9%)两项上失分最严重,较3岁儿童分别低32.7和25.4个百分点。

值得注意的是,所有模型在超过17类子任务中准确率低于50%,无一类别达到儿童组最低年龄组(3岁)的平均水平,证实缺陷具有系统性而非偶发性。

失败归因

分析显示,模型失败主因并非计算误差,而是底层表征缺陷:在需维持空间连续性的任务中,模型常将断裂路径误判为连通(错误率68.4%);在双对象遮挡判断中,对‘谁在前、谁在后’的识别准确率仅29.1%。

更关键的是,这些错误无法通过增加参数量或训练数据缓解。对比同系列模型,参数规模提升3倍后,空间关系类得分仅提高4.2个百分点,远低于人类儿童同龄段年均提升12.6个百分点的速度。

研究指出,当前架构过度依赖CLIP式图文对齐,缺乏对像素级空间拓扑结构的显式建模能力。

新解法

BabyVision-Gen引入输出范式变革:禁止纯文本回答,强制模型生成可执行的视觉操作指令,如‘从红点开始,沿路径A画至终点’或‘用绿色圆圈标记被遮挡的三角形’。

初步实验表明,该方式使Gemini 3-Pro-Preview在轨迹类任务得分提升至61.3%,接近4岁儿童水平,但生成轨迹的几何保真度仍仅达人类手绘的73.5%(以Hausdorff距离衡量)。

这提示:让AI‘动手画’不是权宜之计,而是重建视觉表征的必要路径——就像儿童通过涂鸦建立空间概念,机器也需要具身化反馈闭环。

BabyVision不是一次普通评测,它划出了一条新的能力分界线:当AGI目标指向真实世界交互,视觉理解不能再是语言模型的附属功能。这条‘三岁基准线’提醒所有人,真正的智能必须从像素中生长出来,而非从文本中蒸馏出来。下一步,是追问:我们该重构视觉编码器,还是重新定义多模态学习的起点?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章