先别焦虑了,AGI遭遇“降维打击”:最新测试人类满分,AI惨败于不会“举一反三”
最近,一项名为ARC-AGI-3的全新人工智能基准测试结果引发了广泛关注。在这场被誉为“全球最难”的智能体测试中,人类参与者轻松获得了100%的满分,而全球顶尖的人工智能模型得分普遍低于1%,其中一款在其他榜单上表现优异的模型得分甚至仅有0.2%。这一悬殊的差距,为当前围绕通用人工智能(AGI)的热烈讨论提供了一个冷静的注脚。
ARC-AGI测试,全称为“抽象与推理语料库”,由AI研究员弗朗索瓦·肖莱设计。它与其他主流AI基准测试有根本性的不同。它不考察模型储备了多少知识,而是专注于测试其在面对完全陌生的新问题时,能否像人一样,通过观察少量示例来抽象出规律,并举一反三。这种能力被认为是衡量“通用智能”的关键,因为它无法通过海量数据训练来“刷分”,更能反映模型底层的推理架构。

此前的ARC-AGI测试主要以静态的视觉推理题为主,类似于人类智商测试中的图形规律题。尽管已经让许多AI模型备受挑战,但最新的ARC-AGI-3版本将难度提升到了一个全新维度。它不再是“静态答题”,而是转变为一系列交互式的“游戏”。AI智能体被置于一个没有任何文字说明或提示的游戏环境中,只能通过观察屏幕、选择动作、观察结果,像“盲人摸象”一样,一步步试探并自行构建对这个陌生世界运行规则的理解。测试旨在评估AI探索环境、建立世界模型、自主发现目标以及规划执行的能力。

让AI得分如此之惨的,除了任务本身的难度,还有其严苛的评分标准。ARC-AGI-3不再仅仅看是否“通关”,而是引入了与人类对比的“效率”指标。其评分公式为(人类所需步数 / AI所需步数)的平方。这意味着,如果人类用10步完成任务,而AI用了100步,AI的得分不是10%,而是骤降至1%。这种机制旨在惩罚AI常用的“暴力穷举”策略,奖励高效的、类似人类的思考方式。正是在这种评分体系下,即使是顶尖模型,其解决问题的步数也远超人类,导致得分被压缩到几乎可以忽略不计。

分析AI惨败的原因可以发现,当前AI模型存在一个核心缺陷:缺乏“元认知”,即“不知道自己不知道”。当被放入一个新环境时,AI倾向于根据初始的视觉信息,迅速将其“脑补”成一个自己知识库中见过的、熟悉的游戏框架,然后沿着这个错误的假设执行计划,即使得不到正反馈也不会停下来反思自己的前提是否出错。有趣的是,参数量越大、预训练知识越丰富的模型,反而越容易陷入这种“先入为主”的陷阱。相比之下,一些结构更简单的非大语言模型方案,因为没有知识包袱,能更“老实”地从环境反馈中学习,反而在测试中取得了相对更好的成绩。
与之形成鲜明对比的是人类的解题方式。人类玩家在面对新游戏时,会本能地采用一种“探索-建模-验证-修正”的循环。他们会先观察,构建一个关于游戏规则的初步心智模型,然后通过少量操作来检验自己的假设。如果结果不符,他们会立刻修正模型,而不是固执地错下去。这种在线、交互、由假设驱动的学习方式,是人类智能的核心特征,也正是当前以离线、数据驱动、模式匹配为基础的AI所欠缺的。ARC-AGI-3的核心并非考察“你知道什么”,而是“你如何学习”,这恰恰触及了当前AI范式的短板。
当然,这并不意味着AI的发展停滞不前。在ARC-AGI-3之外的其他基准测试中,AI模型仍在飞速进步。例如,在ARC-AGI的早期版本以及其他考验数学、编程和代理能力的测试中,新一代模型(如谷歌的Gemini系列)相较于前代已经实现了巨大飞跃,在部分推理任务上的得分提升了数倍,显示出其在特定领域的思考能力正在从“记忆知识”向“运用知识”转变。同时,不同AI公司在技术路线上也表现出不同侧重,一些模型在成本和商业落地效率上表现突出,但在抽象推理这类前沿探索上则暂时落后。
ARC-AGI-3的测试结果如同一面镜子,清晰地照出了当前AI技术与真正通用智能之间的深刻裂痕。它提醒人们,尽管AI在处理已有知识和特定任务上已极为强大,但在面对真正未知的环境时,其学习和适应能力与人类相比仍有本质差距。通往AGI的道路或许比预想的更长,需要的可能不仅是更多的算力和数据,更是智能形态本身的范式转移。
