腾讯混元团队与复旦联合发布的研究揭示了语言模型在上下文学习上的显著短板。即使提供完整信息,模型仍无法有效学习应用,这项研究为AI发展提供了新的评估视角。
智能速览
模型在上下文学习上存在根本性能力缺陷
CL-bench包含500个复杂上下文和1899个任务
最先进模型GPT-5.1任务解决率仅23.7%
归纳推理比演绎应用更具挑战性
上下文学习能力将成为未来竞争焦点
精华内容
语言模型在上下文学习上的困境远超预期,即使信息完整呈现,模型仍难以有效吸收和应用,这揭示了当前AI发展的核心瓶颈。
上下文学习困境
研究发现,即便抹平了上下文带来的信息差,模型也未必能解决问题。这就像两个学习天赋不同的人读同一本武功秘籍,有人能瞬息领悟招式精髓,有人却始终不得要领。模型缺乏从上下文中学习新知识、掌握新技能的能力,即使解决任务所需的逻辑和范例近在咫尺,也依然无从下手。当前语言模型主要依赖预训练阶段的参数化知识,在推理时更多是调用封存的内部知识,而非从当前输入中汲取营养。这种训练范式与现实应用之间存在根本性不匹配。
CL-bench设计
CL-bench是专门评测语言模型上下文学习能力的基准,包含500个复杂上下文、1899个任务和31607个验证标准。其核心设计原则是每个任务都必须要求从上下文中学习新知识。为确保无污染,CL-bench采用虚构创作、现有内容修改和小众内容整合三种方式。在不提供上下文情况下,GPT-5.1仅能解决不到1%的任务,有力证明了数据无污染性。51.1%的任务需要序列依赖,平均每个上下文专家花费约20小时标注。
实验发现
十个前沿模型在CL-bench上表现令人担忧,平均仅解决17.2%的任务,表现最好的GPT-5.1也仅达23.7%。忽略或误用上下文是失败主因,许多错误源于模型忽视关键细节或错误应用。长上下文推理和指令遵循是必要但不充分条件。从实验数据和环境模拟中进行归纳推理比演绎应用更困难,任务解决率通常低于10%。更高的推理强度能提升部分模型表现,GPT-5.1在管理类和实验数据类任务上提升约6%。
四类场景挑战
CL-bench涵盖四种现实世界上下文学习场景:领域知识推理要求模型利用特定领域知识解决问题;规则系统应用需要理解并应用新定义的正式系统;程序性任务执行涉及理解复杂过程系统;经验发现与模拟专注于从数据中发现潜在定律,最具挑战性。这些类别包含大部分现实工作中的演绎和归纳推理任务,能充分衡量模型能力。
未来展望
如果上下文学习显著提升,人类在AI系统中的角色将从数据提供者转变为上下文提供者,竞争焦点将从模型训练转向上下文质量。但挑战在于上下文学习的临时性,模型窗口清空后知识随之消失。记忆巩固可能成为2026年核心主题,需要新架构和优化方式决定保留内容。一旦上下文学习与记忆可靠,模型或许能实现自主学习,自主准备上下文、学习并自我巩固。
CL-bench基准测试揭示了语言模型发展的关键短板,为未来研究指明方向。上下文学习能力的提升将重塑AI应用范式,但如何让学习持久化仍是待解难题。这一发现为2026年的AI发展埋下了重要伏笔。