张大妈

先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看

源自知乎:机器之心

02-12 11:27

这项研究首次系统刻画了大模型智能体在真实搜索场景中的行为模式,提供1400万条请求、400万个会话的开源日志,并构建‘意图–轨迹–信息采纳’三层分析框架,填补了Agentic Search实证研究的关键空白。

先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看智能速览

  • 基于DeepResearchGym平台采集半年真实流量,发布首个开源Agentic Search行为日志数据集

  • 提出三类会话意图(陈述型/过程型/推理型)与四类检索轨迹动作(专化/泛化/探索/重复)分类体系

  • 定义CTAR指标量化智能体对历史检索信息的采纳程度,发现专化与探索动作CTAR超65%,重复动作仅约32%

  • 揭示智能体普遍存在‘下钻偏好’,且事实型任务后期易陷入CTAR偏低的重试循环

  • 提出三项可落地的系统设计启示:将重复动作视为停滞信号、按意图与轨迹自适应调整检索预算、将CTAR纳入运行时监控

先解行为,再训Agent:CMU开源首份Agentic Search日志数据,把Agent拆开给你看精华内容

当智能体不再只是生成答案,而是持续发起查询、改写问题、回溯文档,它的每一步行为背后,是否真正理解并利用了已获取的信息?这项研究首次用千万级真实日志给出了可测量的回答。

数据基础

数据源自CMU自建可复现检索平台DeepResearchGym,覆盖25个国家、近600个IP地址的半年真实流量。经严格匿名化与PII清洗后,形成1400万余条搜索请求、约400万个会话的日志数据集,在Hugging Face开源。所有请求均调用统一后端API,挂载于ClueWeb22等固定语料快照,确保行为可比性与结果可复现。

会话划分未采用简单时间阈值,而是融合语义连续性判别模型:先由LLM标注相邻请求是否同属一会话,再训练向量相似度模型进行在线预测。该方法有效识别高频并发请求下的真实会话边界,避免传统方法导致的误切分。

验证显示,日志中会话长度中位数为3轮,78%的会话包含2–5轮查询,任务分布以陈述型(52.3%)为主,推理型占31.1%,过程型仅16.6%,反映当前Agentic Search仍以知识检索为核心场景。

行为图谱

研究将单个会话内相邻查询的变化归纳为四类轨迹动作:专化(增加约束)、泛化(放宽条件)、探索(转向新侧面)、重复(语义微调)。统计表明,专化占比达41.7%,探索占29.3%,二者合计超七成;泛化仅占9.2%,重复占19.8%。

陈述型任务中,重复动作在第4轮后占比跃升至35.6%,且其检索结果重叠率高达82%,CTAR仅31.9%,显著低于专化动作的67.4%和探索动作的65.1%,印证其作为‘策略停滞’信号的有效性。

更值得注意的是‘重置-再细化’模式:智能体先专化(如‘拿破仑战役’→‘1796年意大利战役’),再泛化(回归短查询),随后沿新路径专化(转向‘埃及远征’)。该模式在12.4%的推理型会话中高频出现,说明泛化并非失效,而是轻量级回溯机制。

信息采纳

CTAR(Context-driven Term Adoption Rate)定义为:新查询中首次出现的术语,在此前所有检索文档中可追溯的比例。全量计算显示,整体CTAR为53.8%,即过半新词源于已有检索内容。

专化动作CTAR达67.4%,探索为65.1%,表明这两类动作高度依赖上下文信息推进;重复动作CTAR仅31.9%,证实其多为表达调整而非认知更新;泛化动作CTAR为44.2%,介于中间,符合其作为分支切换工具的定位。

进一步发现,仅使用上一轮检索结果时CTAR为41.6%,纳入全部历史文档后升至53.8%,提升12.2个百分点,说明智能体存在跨轮次回溯行为——约1/8的新词源自两轮以上之前的检索内容。

这份工作不仅交付了一个可复现的数据基础设施,更将Agentic Search从‘黑箱响应’推向‘可观测行为’层面。它让系统设计者得以依据真实轨迹优化调度策略,也让研究者拥有了检验‘智能体是否真在思考’的量化标尺。未来,当更多团队基于同一日志基准开展对比实验,Agentic IR或将迎来属于自己的‘常识层’共识。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章