LLM Agent 在处理复杂任务时,冗长的对话历史会推高推理成本与延迟。一项名为 AgentDiet 的新方法,通过智能缩减运行轨迹,解决了这一问题。它在几乎不影响任务成功率的前提下,大幅降低了 Token 消耗与计算开销,为 Agent 的大规模应用提供了关键的工程优化思路。
智能速览
LLM Agent 的对话历史堆积会导致 Token 消耗与推理成本飙升。
轨迹中存在无用、冗余和过期三类“废物”信息。
AgentDiet 是一种无需重新训练模型的推理时轨迹缩减方法。
该方法可将输入 Token 数量减少 39.9% 至 59.7%。
计算成本降低 21.1% 至 35.9%,且任务成功率几乎不变。
精华内容
如何在不牺牲 Agent 性能的前提下,为其运行轨迹“瘦身”?AgentDiet 方法提供了一套精准的解决方案,其核心在于识别并剔除不同类型的冗余信息。
轨迹臃肿之困
LLM Agent 在处理长流程任务时,每次推理都需重新输入全部历史对话,导致 Token 消耗量呈线性甚至指数级增长。这不仅直接推高了 API 调用费用,还显著增加了模型的响应延迟。
更严重的是,过长的上下文可能引入噪声,干扰模型对当前任务的精准判断,从而影响最终输出的质量,成为限制其规模化应用的技术瓶颈。
三类“废物”信息
研究分析发现,Agent 的运行轨迹中普遍存在三类可被优化的信息。第一类是无用信息,如因环境错误产生的冗余输出或重复的观察结果。
第二类是冗余信息,由多次执行相同或相似命令导致。第三类是过期信息,即早期状态已被后续操作覆盖,其信息对最终决策不再具有贡献价值。
精准“瘦身”方案
AgentDiet 是一种推理时干预方法,其核心优势在于无需重新训练模型即可部署。它不同于简单的滑动窗口截断,而是依据预设的启发式规则或模型辅助判断,精准识别并剔除上述三类“废物”信息。
该方法智能地保留了关键的决策依据和环境反馈,确保了 Agent 的核心能力不受损害,实现了对轨迹的精准“瘦身”。
成效与价值
在顶尖编程智能体上的测试证实了 AgentDiet 的有效性。结果显示,其成功将输入 Token 数量削减了 39.9% 至 59.7%,直接带来 21.1% 至 35.9% 的成本降低。
最重要的是,在此过程中,智能体解决任务的成功率几乎没有受到影响,证明了其在保持“智力”与降低“体重”间的出色平衡。
AgentDiet 的实践证明,LLM Agent 并非需要记住所有历史细节。通过智能化的轨迹管理,能够在维持性能的同时,实现显著的降本增效。这对于推动 Agent 技术在长周期、高复杂度商业场景中的落地应用,具有深远的意义。未来的 Agent 系统会因此变得更轻、更快吗?