2025年虽被称为AI Agent元年,但实际应用却充满挑战。此文深入剖析了业界普遍存在的两大认知误区——即多Agent协作与多轮次推理的失效,并基于前沿研究与实践,指出了两条切实可行的发展路径,为理解Agent技术的现状与未来提供了清晰、务实的视角。
智能速览
AI Agent在真实生产环境中常感“拧巴”,与预期存在差距。
多Agent协作反而会放大系统内耗与错误率,效率不升反降。
增加推理轮次对准确率的提升微乎其微,模型易在错误路径迷失。
解决思路之一是强化模型原生能力,将工具调用固化为内置技能。
另一思路是提升推理时的规模化能力,如Kimi支持高达300步的工具调用。
AI技术正重塑核心竞争力,提出问题和评估结果变得比重复技能更重要。
精华内容
面对当前Agent在组织分工与高阶策略上的明显短板,行业亟需跳出幻想,寻找更具实效的解决方案。技术演进正从两个方向给出答案。
多体协作的内耗
业界最初的设想是“群策群力”,集合多个Agent能力以弥补个体不足。然而,DeepMind等机构的深度调研揭示了残酷现实:多个Agent协作时,大量token消耗在互相理解彼此的输入和思考上,产生了严重的“信息内耗”。这种内耗不仅浪费时间,甚至还会放大单个Agent的幻觉。研究数据显示,即便单个Agent的错误率仅为5%,组合成一个系统后,整体错误率也可能飙升至86%。
这与人类“开会低效”的困境高度相似,简单的数量堆砌并不能带来1+1>2的效果,反而可能因沟通成本过高而陷入瘫痪。
推理上限的陷阱
另一大误区则是对“深度思考”的迷信。AI架构师们假设,只要给予模型足够的工具调用次数和推理轮次,就能产出更高质量的结果。实验将调用上限从10次提升至100次,且不设token消耗限制,但结果令人失望:准确率仅提升了0.2%。
更关键的是,模型平均只调用了14.2次工具便停止了。原因在于,模型一旦走上错误的推理路径,便会如同钻牛角尖般不断循环,最终迷失在海量无效结果中,无法完成整个推理链。这好比电影并非憋得越久越好,迟迟无法产出,很可能源于方向性错误。
固化原生技能
要走出误区,首要路径是让模型自身变得更强大。一个核心思路是通过“端到端训练”,将调用工具的能力固化为Agentic模型的原生能力。这意味着模型不再是依赖庞大Prompt驱动的“刚性大脑”,而是天生具备了与环境交互的“技能”。
例如,Cloud提出的“Skills”概念,就是将专业知识与业务流程封装为可动态加载的模块。这种做法从根本上简化了模型使用工具的难度,减少了多Agent协作的token消耗,并实现了类似的多技能协同效果,让模型成为能真正感知和行动的系统。
规模化推理
第二条出路是提升模型在推理时的规模化能力,即“Test Time Scaling”。通过优化模型架构和训练方式,大幅提升其多轮使用工具的上限,使其能够在复杂任务中进行更持久的探索。
11月发布的Kimi便是这一方向的典型代表,它可以自主实践高达300步的工具调用。这种规模的提升,意味着模型有更多机会试错、纠偏,并在漫长的推理链条中保持对主线的聚焦。当模型能更早察觉“撞了南墙”并重新调整策略时,解决复杂问题的能力自然水涨船高。
AI Agent的进化正在开启一个技术平权的新时代,其核心价值在于将人类从重复性劳动中解放出来。未来,提出高质量问题与精准评估结果的能力,将比掌握单一技能更为关键。这不仅是对生产力的革新,更是对人类核心竞争力的重新定义,不禁让人思考,在这样一个时代,我们真正需要掌握的是什么?