张大妈

Qwen:LLM长程约束规划的认知边界评估

源自小红薯:乌萨奇今天读paper了吗

02-05 23:08

现有大模型评测多聚焦单步推理,而面对需要全局统筹和多重约束的现实任务,其能力边界尚不清晰。一项研究提出了名为 DeepPlanning 的评测基准,首次系统性地考察 LLM 在长程规划中的表现,揭示了其关键瓶颈与未来的提升方向。

Qwen:LLM长程约束规划的认知边界评估智能速览

  • 提出全新 DeepPlanning 评测基准,用于考察 LLM 长程约束规划能力。

  • 基准包含旅行和购物两大真实场景,包含超千个高难度查询。

  • LLM 普遍不擅长多约束的运筹优化问题,信息差是核心瓶颈。

  • 并行工具调用能显著提升 Agent 在复杂规划任务中的效率和成功率。

  • 评测不仅看结果,还考察硬约束通过率、软偏好满足度及调用效率。

Qwen:LLM长程约束规划的认知边界评估精华内容

LLM 真的会做规划吗?当面对预算、时间、地点等多重约束时,它们的表现或许会出乎意料。新的评测基准揭示了其“偏科”的现状。

评测背景

当前对 AI Agent 的评测大多集中于局部的单步推理或简单的工具调用,这并不能完全反映其在真实世界中的能力。现实中,像规划一次多日旅行这类任务,需要主动收集分散的信息,并在预算、时间、地理位置等硬性约束下找到全局最优解。现有 LLM 在这方面的能力如何,尚缺乏一个系统的评估标准。

新基准框架

为此,DeepPlanning 评测基准应运而生。它构建了两个高度仿真的现实领域:旅行和购物。其中,PlanBench 整合了携程与 Google Maps 的真实城市、景点及交通数据;ShoppingBench 则模拟了电商搜索环境,数据源自 Amazon。该框架的核心创新在于,Agent 必须通过调用 API 来获取信息,并生成满足严格硬约束(如预算低于5000元)和软偏好(如偏爱日料)的详细计划。整个基准包含 1031 个精心设计的查询,平均规划时长为 3.5 天,极具挑战性。

核心评测指标

DeepPlanning 采用了一套多维度的评测指标,全面衡量 Agent 的表现。首先是“通过率”,这是最严格的指标,只有当生成的计划完全满足所有硬约束(如时间不冲突、预算不超支、地点可达)时才算通过。其次是“得分”,在通过硬约束的基础上,根据计划对用户软偏好的满足程度进行打分。最后是“效率”,统计完成任务所需的 API 调用次数和 Token 消耗,评估其资源利用效率。

关键研究发现

评测结果揭示,当前的 LLM 更像是“偏科生”,它们在解决数学题或编写代码等任务上表现出色,但在涉及多约束的运筹优化问题上则显得力不从心。失败的核心瓶颈往往是“信息差”,即 Agent 未能通过 API 查询到准确的价格或时间信息,导致整个规划建立在错误的假设之上。研究还发现,对于需要收集大量信息的任务,能够并行调用工具的 Agent,其任务成功率和效率均显著高于只能串行调用的模型。

DeepPlanning 基准的价值在于,它为衡量 LLM 的真实世界应用能力提供了更精准的标尺。未来的研究若能解决信息获取与并行工具调用的难题,AI Agent 的规划能力或将迎来质的飞跃,这不禁让人期待它们未来能扮演的角色。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章