AI大模型的下半场:上下文学习,腾讯首席科学家姚顺雨加入后首篇论文CL-bench发布

源自公众号:歪斯Wise

02-20 08:27

腾讯与复旦联合发布的CL-bench基准测试,揭示了当前顶尖AI模型的普遍短板:真正的上下文学习能力。面对包含新规则和新知识的任务,GPT、Claude等模型平均仅能解决17.2%,远低于预期。这标志着AI竞争的核心正从模型规模转向如何有效利用上下文信息,为理解AI的下一步发展提供了关键视角。

AI大模型的下半场:上下文学习,腾讯首席科学家姚顺雨加入后首篇论文CL-bench发布

AI大模型的下半场:上下文学习,腾讯首席科学家姚顺雨加入后首篇论文CL-bench发布智能速览

  • 新基准CL-bench发布,专门评测AI上下文学习能力。

  • 顶尖AI模型在CL-bench测试中平均分仅17.2%,表现不佳。

  • 模型更依赖预训练知识,而非从新上下文中学习。

  • 归纳推理远比演绎推理更困难,是AI的明显短板。

  • AI竞争焦点或将从模型参数转向上下文工程。

AI大模型的下半场:上下文学习,腾讯首席科学家姚顺雨加入后首篇论文CL-bench发布精华内容

CL-bench基准测试的结果揭示了一个令人惊讶的现实:即便是顶尖的AI模型,在真正学习能力上的表现也远低于预期。这背后的原因是什么?它又如何重塑AI的未来?

CL-bench是什么

CL-bench是腾讯混元团队与复旦大学联合团队发布的新基准,专门用于评测大模型的上下文学习能力。其核心目标是验证模型在真实世界动态场景中解决实际问题的能力。该基准测试涵盖了领域知识推理、规则系统应用、程序性任务执行、经验发现与模拟四大现实场景,包含了由专家制作的500个复杂上下文、1899个具体任务和超过3万个验证标准,要求模型必须从上下文中学习预训练知识库外的新信息。

惨淡的测试结果

测试结果显示,所有前沿模型的表现均不理想。表现最好的GPT-5.1 (High)得分也仅有23.7%,而包括GPT、Claude、Gemini、Kimi、Qwen在内的所有模型平均分仅为17.2%。这意味着即便模型被授予了完成任务所需的全部信息,它们在绝大多数情况下依然失败了。数据表明,当前模型更像是“参数推理者”,擅长依赖静态的预训练知识,却不擅长从动态环境中吸收并应用新信息。

失败的根本原因

模型失败的根源在于它们倾向于“背诵答案”而非“解决问题”。当遇到一个新任务时,模型的第一反应不是仔细阅读上下文中的新规则或新流程,而是迅速在预训练的知识库中搜索相似的旧知识来套用。这种思维惯性导致它们在面对明确定义了全新规则的场景时,也常常视而不见,最终因无法适应新环境而失败。

两个关键发现

CL-bench的实证研究得出了两个颠覆传统认知的发现。首先,长上下文不等于上下文学习。能够处理长输入不代表模型能从中有效学习,关键在于其推理和指令遵循能力是否与真正的学习能力结合。其次,归纳推理比演绎推理困难得多。在从一堆数据中自行总结规律或在虚拟环境中摸索出路的归纳任务上,模型表现极差,任务解决率通常低于10%。毕竟,发现规律远比应用规律要难。

游戏规则改变

这一发现预示着AI行业的游戏规则正在改变。过去的焦点是训练更强大的模型,未来的竞争核心则可能转向提供更丰富、更精准的上下文信息。行业可能会从依赖预训练数据的“提示词工程”,转向关注上下文质量的“上下文工程”。当上下文信息爆炸时,如何高效提炼有价值信息、设计机制对抗遗忘,将成为新的关键课题。

CL-bench的出现,标志着AI发展进入下半场。真正的挑战不再是训练博学的“做题家”,而是培养能从真实环境中成长的学习者。当上下文成为决胜关键,未来的AI助手将如何从海量信息中提炼精髓,实现真正的智能进化?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章