当各大模型在标准测试中屡屡超越人类,我们是否高估了它们的真实能力?一项新的基准测试 CL-Bench 揭示了一个残酷现实:所有顶尖模型的平均分仅为 17.2%。这项研究直指 AI 从上下文中学习新知识并加以应用的核心短板,为评估真实世界效用提供了全新视角。
智能速览
CL-Bench 是一项新的基准测试,旨在评估模型从复杂上下文中学习并应用知识的能力。
测试结果显示,所有前沿模型集体表现不佳,平均分仅 17.2%,最强的 GPT-5.1 也只有 23.7%。
研究区分了深度的“上下文学习”与浅层的“上下文中学习”,前者是成为真正 Agent 的关键。
模型在归纳发现等高阶任务上表现最差,成功率普遍低于 10%,暴露了其创造能力的缺失。
这项研究的价值不在于刷榜,而在于标记了真实能力短板,可能将未来竞争焦点从“模型层”引向“上下文层”。
精华内容
姚顺雨提出的“AI下半场”理念,正从概念走向落地。CL-Bench 不只是一个新榜单,更是对现有模型能力的一次深刻拷问,它试图回答:我们究竟该如何衡量 AI 的真实进展?
AI的下半场
过去数十年,AI 发展的“上半场”聚焦于“如何训练出更好的模型”。如今,这套配方已趋于标准化。研究认为,“下半场”的核心转向“定义问题”,即如何设计评估方式以衡量模型在真实世界的效用。现有基准常假设任务是“自动运行”和“独立同分布”的,这与现实中需要持续与人类互动、任务连续进行的场景存在根本差异,导致了“高分低能”的现象。
何为上下文学习
CL-Bench 评估的是“上下文学习”能力,这不同于我们熟知的“In-Context Learning”。后者是给几个例子让模型模仿,是浅层模式匹配。而上下文学习则要求模型能从一份复杂的材料(如法律条文、产品手册)中内化知识体系,并在新场景中精确应用。这好比“看完整本教材去考试”,而非“看几道例题做作业”,考验的是深度理解和应用能力。
模型的集体不及格
CL-Bench 的测试结果十分残酷:在包含 500 个复杂上下文、1899 个任务的测试中,所有前沿模型的平均分仅为 17.2%。GPT-5.1 最高,也只有 23.7%。模型的错误高度集中在“漏用上下文”(55.3%)和“误用上下文”(61.5%)上。最致命的发现是在“经验发现”(归纳规律)任务上,模型成功率普遍低于 10%,表明模型擅长复述,却不擅长从已有信息中创造新规律。
竞争焦点转移
CL-Bench 的意义并非创造一个新榜单,而是精准指出了当前 AI 的核心短板。一旦上下文学习能力得到可靠解决,竞争的焦点可能从“谁能训练出更好的模型”转向“谁能为任务提供最丰富、最相关的上下文”。届时,拥有高质量专业知识库并能将其有效组织成 AI 可学习形式的一方,将掌握主动权。这预示着 AI 竞争将从模型层深入到上下文层。
CL-Bench 的意义不在于分数,而在于标记了通往真正推理 Agent 的能力缺口。它提醒我们,当模型能从上下文中可靠学习时,竞争的核心将从模型层转向上下文层。谁能提出更好的问题,谁将掌握未来的主动权。