腾讯混元团队发布全新评测基准CL-bench,揭示了大语言模型一个被忽视的核心瓶颈:几乎无法从上下文中学习新知识。研究发现,即便是最顶尖的模型,在必须依赖即时信息解决问题的任务中,成功率也仅有23.7%。这一发现挑战了当前对模型能力的认知,为推动AI走向更实用的阶段指明了关键方向。
智能速览
腾讯发布CL-bench新基准,专测大模型上下文学习能力。
当前顶尖大模型平均成功率仅17.2%,GPT-5.1最高仅23.7%。
模型失败主因是忽略或误用上下文,而非信息缺失。
归纳推理(发现规律)比演绎推理(应用规则)难度高得多。
未来AI竞争焦点或从“模型训练”转向“提供优质上下文”。
精华内容
大模型与人类的关键区别在于能否实时学习。腾讯混元团队通过构建CL-bench基准,首次系统性揭示了当前模型在这方面的严重不足,并指出了未来技术突破的关键路径。
上下文学习瓶颈
大语言模型与人类解决问题的方式存在根本差异。人类能实时根据现场环境学习并完成任务,而大模型主要依赖预训练阶段的静态记忆(参数化知识)。这导致模型在处理需要动态、真实世界信息的任务时表现不佳。
为量化这一差距,腾讯混元团队构建了CL-bench基准,其核心目标是强制模型必须从提供的上下文中学习新知识并应用。实测数据显示,十个主流模型平均任务解决率仅为17.2%,表现最好的GPT-5.1(high)也仅有23.7%。这表明当前SOTA模型几乎都未掌握真正的上下文学习能力。
四大挑战场景
CL-bench包含500个由专家构建的复杂上下文,涵盖四种现实世界场景,以全面评估模型能力。这四大类包括:
领域知识推理:模型需利用虚构的法律体系、创新金融工具等新知识进行推理。
规则系统应用:模型需理解并应用新的游戏机制、数学形式体系等规则。
程序性任务执行:模型需根据复杂的工作流、产品手册等程序性信息完成任务。
经验发现与模拟:模型需从实验数据或模拟环境中归纳出规律,这是最具挑战性的归纳推理任务。
所有任务的知识都是全新构建的,确保模型无法通过回忆预训练知识来解答。
五大关键发现
研究团队通过详尽的实验分析,得出了五个关键结论。首先,忽略或误用上下文是导致失败的绝对主因。模型倾向于调用旧有知识,而非学习新信息。
其次,长上下文处理和指令遵循是必要但不充分条件。即使擅长这两点的模型,在CL-bench上表现依然不佳。第三,从数据中进行归纳推理远比应用已知规则(演绎)更困难,模型在此类任务上的成功率通常低于10%。
第四,提高推理强度对部分模型有助益,如GPT-5.1在部分任务上提升约6%,但并非普适解法。最后,上下文学习的难度与长度正相关,但信息密集的短上下文同样具有挑战性。
无污染测试设计
为确保测试的公正性,CL-bench采用了严格的“无污染”设计。所有上下文都是自包含的,解决任务所需信息全部显式提供。
其内容来源包括专家完全虚构的体系(如虚构国家法律)、对现实内容的修改以及整合小众新兴内容。这一设计的有效性得到了验证:在不提供任何上下文的情况下,GPT-5.1(high)的解决率低于1%,证明了模型无法依靠记忆作答。此外,任务设计具有高复杂性和序列依赖性,平均每个上下文需专家花费约20小时构建,确保了测试的深度与质量。
此项研究不仅是对现有大模型的深度“体检”,更是对未来发展方向的预判。如果模型的上下文学习能力取得突破,人类在AI系统中的角色将从数据提供者转变为上下文提供者。大模型如何有效记忆和持久化新知,或将成为2026年的核心议题,引领AI迈向更高级的自主学习阶段。
关键评论
有用户观察到大模型在实际交互中无法利用近期上下文,只会调用静态知识,印证了文中的研究结论。
另一位观点认为,解决方向在于实现“训练推理一体化”,这与研究中强调的上下文学习能力方向一致。