开发AI Agent时,模型不听指令、工具滥用是常见痛点。Anthropic在构建Claude Code的过程中,同样经历了这些挑战,并总结出一套宝贵的经验。这份复盘不仅揭示了AI与工具协作的本质,更提供了一套从工具设计到工作流优化的实战方法论,能有效解决开发中的典型难题,值得每一位开发者深入思考。
智能速览
别让AI思考,直接给它工具来规范行为。
工具集需随模型能力进化,定期审计并删除冗余工具。
利用CLAUDE.md文件固化团队经验,形成复利效应。
保持工具集精简,用子智能体替代复杂功能。
采用多智能体协作,各司其职以提升效率与准确性。
开发者的“设计品味”决定了AI交互的最终体验。
精华内容
在AI Agent的开发中,如何让模型稳定、高效地完成任务是核心挑战。Anthropic通过Claude Code的实践,揭示了从指令到工具、从堆砌到精简的进化之路,这套方法论值得借鉴。
从指令到工具
让AI稳定执行特定行为,依赖复杂的自然语言指令往往效果不佳。指令是让模型“思考”该怎么做,增加了认知负担,容易因概率性输出而失败。
Anthropic团队曾为了让AI学会提问,花费了三个月时间尝试各种方案,包括在提示词里强格式化,效果时好时坏。最终解决方案是创建一个名为“AskUserQuestion”的工具,模型需要提问时直接调用,行为稳定可控。这表明,想让AI做什么,就给它一个专门的工具,而非寄希望于它能准确理解并执行模糊指令。
动态的工具审计
工具的价值并非一成不变,它与模型的能力水平息息相关。当一个工具在模型能力弱时是“拐杖”,在模型变强后就可能成为“绊脚石”。
Anthropic早期为解决模型遗忘问题设计的“Todo List”工具,曾将任务完成率提升30%以上。但随着模型升级到Opus 4.5,该工具因其固定提醒机制限制了模型的自主性,最终被移除。这引出一个关键原则:必须定期进行“工具审计”,每升级一次模型,就重新评估所有工具的适用性,果断删除那些不再需要甚至产生干扰的工具。
高效工作流构建
Claude Code之父Boris Cherny的工作流,展示了如何实现高效的人机协作。他习惯同时开启多个Claude Code实例并行处理任务,将自己定位为项目经理,让AI自主执行,只在需要确认时介入。
他常用的两个技巧极具价值:一是使用项目根目录的CLAUDE.md文件,将团队经验(如“别这样做”的规则)固化下来,让AI的每次纠错都成为团队资产;二是多数对话从“Plan模式”开始,先与AI讨论并确定执行计划,再切换到自动模式一次性完成,避免了方向错误导致的高昂返工成本。
精简与分工
工具并非越多越好,泛滥的工具会增加模型的决策负担和出错概率。Claude Code的工具集最终收敛到20个左右,新增工具必须经过严格的价值评估。
面对新需求,Anthropic倾向于创建“子智能体”而非增加复杂工具。例如,用一个专门解答功能问题的子智能体,替代一个功能重叠的新工具。这种分工思想也体现在多智能体协作上,如Replit用一个编码Agent负责写代码,另一个测试Agent负责验证。不同智能体各司其职,互相制衡,其效果远胜于一个试图包揽所有任务的单体智能体。
设计的品味
AI Agent的交互体验,最终取决于开发者的“设计品味”。这种品味是一套判断标准,定义了AI在何种情境下该做什么、做到何种程度。
模型本身无法自带品味,因为它不理解具体业务逻辑和用户需求。开发者通过设计每一个工具、规定每一个流程,将自己的判断注入到Agent的行为模式中。一个优秀的Agent,懂得适时提问而非闷头瞎干,也懂得点到为止而非过度执行。这种恰到好处的“分寸感”,是开发者需要持续打磨的核心能力,也是产品体验差异化的关键。
Anthropic的复盘核心在于承认错误并持续进化。无论是工具的增删,还是工作流的优化,都体现了一种务实的设计哲学。对于开发者而言,真正的挑战不是找到一劳永逸的方案,而是建立一套能随着技术和需求变化而持续迭代的机制。你的AI Agent,准备好定期“体检”了吗?