当前位置:
AIGC文章详情

张大妈

姚顺雨首篇挂名,大模型阅读理解分数仅20%

源自小红薯:杨浩🎈

02-04 11:21

一个由腾讯混元与复旦大学联合推出的新基准测试CL-bench,揭示了当前大模型在复杂阅读理解任务上的一个惊人短板。测试结果显示,即便在上下文中明确给出了标准答案,模型的正确率也普遍倒在了20%左右,这与人们普遍认为的“有上下文就能解决问题”的直觉相悖,引人深思。

姚顺雨首篇挂名,大模型阅读理解分数仅20%智能速览

  • 新基准测试CL-bench由腾讯混元与复旦大学发布,用于评估大模型阅读理解能力。

  • 测试中,即便提供了标准答案,大模型的正确率也普遍低于20%。

  • 此结果与“上下文至关重要”的主流观点形成反差,显得尤为反直觉。

  • 该发现预示着模型在长时记忆和深度理解方面仍面临巨大挑战。

姚顺雨首篇挂名,大模型阅读理解分数仅20%精华内容

为何一个看似简单的阅读任务,会成为顶尖大模型的“滑铁卢”?CL-bench的测试结果,迫使我们重新审视大模型真实的能力边界与“理解”的真正含义。

惊人的20%正确率

在腾讯混元与复旦大学的CL-bench基准测试中,出现了一个颇为反直觉的现象。测试任务要求模型根据提供的上下文回答问题,且上下文中已包含标准答案。然而,从结果来看,各大模型在回答正确率上基本都倒在了20%左右。

这个数据之所以令人惊讶,是因为从上下文的token长度和表面复杂度来看,似乎并不构成难以逾越的障碍。这表明,模型在利用上下文信息进行复杂推理时,可能存在我们尚未完全理解的深层次缺陷。

严苛的评估标准?

对于这一低正确率,一种可能的推测是评估标准(rubrics)过于严苛。或许模型需要满足所有细粒度的条件才能得分,任何一个环节的疏漏都会导致满盘皆输。

这指向了一个核心问题:模型可能擅长于信息检索和模式匹配,但在精确遵循复杂、多步骤的指令方面却显得力不从心。它反映出模型在“理解”指令的深层含义和细微差别上的能力不足,而非简单的信息找不到。

呼应与未来方向

这一发现与知名学者姚顺雨(Shunyu Yao)此前强调的“上下文至关重要”的观点形成了有趣的呼应。它进一步说明,仅仅提供上下文可能还不够,如何让模型有效吸收、记忆并深度利用这些信息才是关键。

这也为腾讯混元等模型的后续发展指明了方向。未来的研究可能需要更加聚焦于模型的记忆机制、长文本处理能力以及如何将信息转化为真正可用的知识,而不仅仅是短暂的上下文激活。

CL-bench的测试结果如同一面镜子,照出了大模型在复杂认知任务上的脆弱性。它提醒我们,通往真正“理解”的道路依然漫长。这或许不是终点,而是一个新的起点,未来的模型将如何突破这一瓶颈,值得我们持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章