前沿大模型虽能解答复杂问题,但面临真实场景任务时仍显乏力。一项新研究指出,关键瓶颈在于模型普遍缺乏从上下文中学习新知的能力。即使提供全部信息,模型也常常无法正确解决问题,这一发现揭示了当前 AI 发展中被忽视的关键短板。
智能速览
模型能否用好上下文是迈向高价值应用的核心瓶颈。
CL-bench基准要求模型必须从上下文中学习预训练外的新知识。
实验表明,顶尖模型平均任务解决率仅为17.2%。
模型失败主因是忽略或误用上下文,而非信息缺失。
从数据中归纳规律比应用明确规则更具挑战性。
未来AI竞争或将从提供数据转向提供高质量上下文。
精华内容
为何给了标准答案,大模型依然不会做题?这背后是模型在上下文学习能力上的根本性缺陷,一项新基准正试图量化这一差距。
上下文学习的困境
当前大语言模型依赖的是预训练阶段注入的“参数化知识”,在推理时更多是调用静态记忆,而非实时从新信息中学习。这与人类面对新工具文档、游戏规则或实验数据时边看边学的方式截然不同。我们制造出了依赖“过去”的参数推理者,但真实世界需要的是能吸收“当下”环境的上下文学习者。这种训练范式与应用场景的不匹配,导致了模型在解决依赖动态上下文的任务时表现不佳。
问题的关键在于,上下文“给到位了”并不等同于任务就能“做对”。这中间考验的是模型从上下文中学习新知识、掌握新技能的能力。如果模型缺乏这种学习能力,哪怕解决任务所需的逻辑和范例都近在咫尺,它也依然无从下手。
CL-bench基准的诞生
为精确衡量模型的上下文学习能力,研究团队构建了CL-bench评测基准。该基准包含500个复杂上下文和1899个任务,其核心设计原则是:解决任务必须从上下文中学习到模型预训练中不存在的新知识。
CL-bench采用无污染设计,通过虚构创作、修改现实内容、整合小众新兴内容等方式,确保模型无法依靠记忆来解题。在不提供任何上下文的情况下,最先进的模型解决率低于1%,证明了数据的有效性。该基准覆盖了四大现实场景:领域知识推理、规则系统应用、程序性任务执行,以及最具挑战性的经验发现与模拟,全面评估模型的演绎与归纳推理能力。
实验结果:表现惨淡
在CL-bench上的测试结果揭示了当前模型与理想“上下文学习者”之间的巨大鸿沟。十个最先进的语言模型平均仅解决了17.2%的任务。即便是表现最好的模型GPT-5.1 (High),其任务解决率也仅为23.7%。
这意味着,尽管上下文中已包含解决每个任务所需的全部信息,模型在绝大多数情况下依然失败了。这一数据有力地证明了,当今的前沿语言模型还远未掌握从上下文中学习的能力,也解释了为何在许多实际应用中,即便进行了精心的上下文工程,模型依然会出错。
失败原因深度剖析
错误分析显示,模型失败的主要原因是忽略或误用上下文中的关键信息,而非信息缺失。在很多情况下,模型会固执地调用预训练知识,即使上下文明确定义了新规则。
此外,研究发现,长上下文推理和指令遵循能力是必要的,但并不充分。即使擅长处理长上下文的模型,也无法保证能正确学习。其中,从实验数据中进行归纳推理的任务难度远高于应用规则的演绎任务,前者解决率普遍低于10%。这表明,发现潜在规律比遵循既有指令对模型来说是更严峻的挑战。
这一发现为AI发展指明了新方向:竞争的核心正从把模型训练得更好,转向为任务提供最丰富、最相关的上下文。若模型能巩固临时学到的知识,实现自主学习将不再是空谈,这或许是通往更强智能的关键一步。