顶尖AI模型虽能解奥数难题,却连从上下文中学习新知都做不好。腾讯与复旦的最新研究揭示了这一核心短板,并提出了衡量和改进此能力的新基准,为AI的未来发展指明方向。
智能速览
当前最强的大语言模型,上下文学习能力的平均解决率仅为17.2%。
腾讯混元与复旦大学联合推出了评测基准CL-bench,用于精准衡量模型上下文学习能力。
未来人类的角色可能从数据提供者转变为任务上下文提供者。
模型记忆将成为2026年大模型发展的核心主题之一。
精华内容
为何顶尖模型在真实任务中表现不佳?关键在于它们尚未掌握从上下文中学习的能力。
核心困境
人类能迅速阅读新文档或规则书并立即应用新知识,这是一种强大的从上下文中学习能力。然而,即使是当前最先进的语言模型,在这方面也表现不佳,它们更像依赖预训练知识的“做题家”,而非实时学习者。
评测基准
为量化这一短板,研究团队构建了CL-bench评测基准。该基准包含500个复杂上下文和1899个任务,要求模型必须学习并应用其预训练数据中不存在的新知识。这套体系旨在精准评估模型距离真正的“上下文学习者”还有多远。
惊人数据
实验结果揭示了问题的严重性。全球排名前十的语言模型在CL-bench上的任务解决率平均仅为17.2%。这个数据清晰地表明,现有模型在利用全新上下文信息解决实际问题上,存在巨大的能力鸿沟。
未来方向
研究指出,提升上下文学习能力是下一步关键。一旦突破,人类在AI系统中的角色将从数据提供者转变为上下文提供者。竞争焦点也将变为“谁能为任务提供最优质上下文”。此外,模型记忆能力或成为2026年的核心发展主题。
这项研究不仅指出了大模型的“阿喀琉斯之踵”,也为未来发展指明了道路。当AI能自主学习,世界将如何改变?