现有大模型评测多聚焦单步推理,而面对需要全局统筹和多重约束的现实任务,其能力边界尚不清晰。一项研究提出了名为 DeepPlanning 的评测基准,首次系统性地考察 LLM 在长程规划中的表现,揭示了其关键瓶颈与未来的提升方向。
智能速览
提出全新 DeepPlanning 评测基准,用于考察 LLM 长程约束规划能力。
基准包含旅行和购物两大真实场景,包含超千个高难度查询。
LLM 普遍不擅长多约束的运筹优化问题,信息差是核心瓶颈。
并行工具调用能显著提升 Agent 在复杂规划任务中的效率和成功率。
评测不仅看结果,还考察硬约束通过率、软偏好满足度及调用效率。
精华内容
LLM 真的会做规划吗?当面对预算、时间、地点等多重约束时,它们的表现或许会出乎意料。新的评测基准揭示了其“偏科”的现状。
评测背景
当前对 AI Agent 的评测大多集中于局部的单步推理或简单的工具调用,这并不能完全反映其在真实世界中的能力。现实中,像规划一次多日旅行这类任务,需要主动收集分散的信息,并在预算、时间、地理位置等硬性约束下找到全局最优解。现有 LLM 在这方面的能力如何,尚缺乏一个系统的评估标准。
新基准框架
为此,DeepPlanning 评测基准应运而生。它构建了两个高度仿真的现实领域:旅行和购物。其中,PlanBench 整合了携程与 Google Maps 的真实城市、景点及交通数据;ShoppingBench 则模拟了电商搜索环境,数据源自 Amazon。该框架的核心创新在于,Agent 必须通过调用 API 来获取信息,并生成满足严格硬约束(如预算低于5000元)和软偏好(如偏爱日料)的详细计划。整个基准包含 1031 个精心设计的查询,平均规划时长为 3.5 天,极具挑战性。
核心评测指标
DeepPlanning 采用了一套多维度的评测指标,全面衡量 Agent 的表现。首先是“通过率”,这是最严格的指标,只有当生成的计划完全满足所有硬约束(如时间不冲突、预算不超支、地点可达)时才算通过。其次是“得分”,在通过硬约束的基础上,根据计划对用户软偏好的满足程度进行打分。最后是“效率”,统计完成任务所需的 API 调用次数和 Token 消耗,评估其资源利用效率。
关键研究发现
评测结果揭示,当前的 LLM 更像是“偏科生”,它们在解决数学题或编写代码等任务上表现出色,但在涉及多约束的运筹优化问题上则显得力不从心。失败的核心瓶颈往往是“信息差”,即 Agent 未能通过 API 查询到准确的价格或时间信息,导致整个规划建立在错误的假设之上。研究还发现,对于需要收集大量信息的任务,能够并行调用工具的 Agent,其任务成功率和效率均显著高于只能串行调用的模型。
DeepPlanning 基准的价值在于,它为衡量 LLM 的真实世界应用能力提供了更精准的标尺。未来的研究若能解决信息获取与并行工具调用的难题,AI Agent 的规划能力或将迎来质的飞跃,这不禁让人期待它们未来能扮演的角色。