张大妈

担任腾讯首席AI科学家后,姚顺雨带领团队揭晓首个研究成果

源自今日头条:南方都市报

02-19 13:17

尽管当前大语言模型已是顶尖“做题家”,但在面对真实世界任务时仍有短板。腾讯混元团队联合复旦大学的新研究,揭示了其在“从上下文中学习”上的显著不足,并指出未来AI竞争的焦点将从模型训练转向提供更优质的上下文。这一发现为理解大模型的能力边界和未来迭代方向提供了新视角。

担任腾讯首席AI科学家后,姚顺雨带领团队揭晓首个研究成果智能速览

  • 腾讯混元团队联合复旦大学发布新研究,指出AI从上下文学习存在能力短板。

  • 即便抹平信息差,模型也可能无法解决问题,凸显了其利用上下文的不足。

  • 研究团队构建了CL-bench评测基准,包含超三万条验证标准。

  • 全球前十的语言模型在该基准上的平均任务解决率仅为17.2%。

  • 未来竞争焦点或从“更好训练模型”转向“提供最丰富相关的上下文”。

担任腾讯首席AI科学家后,姚顺雨带领团队揭晓首个研究成果精华内容

大模型的学习能力远非完美,尤其是在模拟人类实时从环境中学习新知方面。为了量化这一差距,并探索未来的突破方向,一项严谨的评测研究应运而生。

AI的学习困境

近年来,大语言模型进化神速,能够解答奥数难题、推演复杂编程逻辑,甚至通过专业资格考试。然而,这些成就主要依赖于模型预训练阶段学到的海量知识,在需要实时学习的真实世界任务面前,其表现依然有待提升。人类可以边玩新游戏边学规则,科学家能从实验日志中推导新结论,这种从眼前上下文中学习的能力,正是当前顶尖模型所欠缺的。

评测基准CL-bench

为了精确衡量现有模型与真正“上下文学习者”之间的差距,腾讯混元与复旦大学的研究团队构建了全新的评测基准——CL-bench。该基准包含了由资深领域专家精心制作的500个复杂上下文、1899个任务和31607个验证标准。其核心要求极为苛刻:模型必须从给定的上下文中,学习并应用其预训练数据中不存在的新知识来解决问题。

顶尖模型的真实水平

实验结果揭示了严峻的现实。在全球排名前十的语言模型中,在CL-bench上的任务解决率平均只有17.2%。这一数据清晰地表明,即便是当今最强的模型,在有效利用上下文进行学习方面也表现糟糕,几乎可以说还“不会”利用上下文。这为后续大模型的迭代指明了一个关键方向:必须强化其从上下文中学习的能力。

未来竞争新焦点

研究预判,如果模型的上下文学习能力能被显著提升,人类在AI系统中的角色将发生根本性转变——从主要的数据提供者,变为上下文的提供者。这意味着,未来的AI竞争焦点将从“谁能把模型训练得更好”,转向“谁能为任务提供最丰富、最相关的上下文”。此外,模型记忆可能成为2026年大模型发展的另一核心主题,一旦上下文学习与记忆变得可靠,AI或将实现自主学习。

这项研究不仅揭示了当前大模型在上下文学习上的真实短板,更关键的是为AI的下一步发展指明了清晰路径。当模型能更有效地利用上下文,人类的角色和价值将如何重塑?这或许是开启AI自主学习新纪元的序章。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章