这一周,做AI编程的人的信息流基本被同一个主题刷屏了:怎么省token。B站有播放不低、收藏更高的《为什么你的Claude Code特别费Token?》,小红书隔三差五冒出"禁用这几个Claude Code工具,Token直接省一半"这类帖子,今天早上Datawhale又转述了伦敦大学学院团队用Claude Code做的多Agent实验。大家算是反应过来了:模型价格战之后,AI编程成本的最大变量,其实是自己的用法。
今天就把这笔账算清楚。token确实烧,但到底烧在哪。
Agent式编程,天生就是个"token炉子"
Manus公开过一组经验数据:在Agent任务里,平均输入与输出token的比例约为100:1。知乎也就是说,模型"写"出来的那点代码只是零头,绝大多数开销花在"读"上——读系统提示词、读工具定义、读项目文件,还要读你和它之前说过的每一句话。
更要命的是,这个"读"不是一次性的。每一轮对话,全部上下文都要重新发一遍。对话越长,每一轮的输入越重,token消耗曲线不是线性上涨,是滚雪球。
真正能缓解这件事的是prompt caching机制:反复重发的内容,只要前缀没变,就能命中缓存,命中部分的计费在Anthropic官方价目里大约只有新输入价的十分之一。这也是为什么"连续用"往往比"断续用"便宜——你放置一阵,或者做了清空上下文这类改变前缀的操作,缓存就失效,下一轮又得按新输入的全价重新算。

多开Agent之后,账单不是加法,是爆炸
这周真正的新变量是:越来越多人开始并行开多个Claude Code——一个写前端、一个写后端、一个跑测试,再配一个协调的。
伦敦大学学院团队专门做了1902次Claude Code实验来算这笔账。知乎Datawhale今天刚转述了结论,相当反直觉:
在8个Agent参与、消息密集的任务里,把重复沟通换成一份共享文件,输出token少了约42%;
而专门设置一个"协调Agent",并没有稳定提高任务成功率——它看起来整天收进度、转消息很忙,实际上只是给团队多加了一层汇报。
逻辑不复杂:一个Agent改了接口,要通知前端、后端、测试,三方收到后还各自回复确认。Agent数量一多,点对点消息很快逼近N²——群越大,"会"越多,token全烧在开会上了。
他们的解法特别不酷:建一份共享文件,写上任务目标、验收标准、分工、进度和阻塞点,每个Agent开工前读一遍最新状态,干完活再更新。消息只用来通知一句"哪里变了",不再负责搬运整段背景。一句话:大家都要看的内容写在办公室白板上,真有急事再单独喊人。

不过,别把42%当成通用折扣,原实验的适用边界说得很清楚:如果只有两个Agent、只做一次交接,专门建文件、读文件、维护文件反而更贵。知乎判断标准就一句话——这条信息接下来会不会被多个Agent反复使用?会,就集中存;不会,直接交接。
单会话用户,也有几笔明白账可以省
知乎有位重度使用Claude Code 90天的用户晒出了自己的账本:4个正式项目、617次会话、token花费约1400元,交付了约2.3万行代码。知乎他总结的几条经验,特别值得对照检查:
超过一个文件的改动,先进Plan Mode(Shift+Tab)让它出方案再动手。他的一次通过率从六成左右拉到接近九成——返工是最贵的token浪费,因为你不光要重写,还要重新读一遍上下文。
别@一堆文件。他做过对比:同一个重构任务,一次给11个相关文件,效果反而不如给3个核心文件加一段自己写的架构说明。上下文里塞的东西越多,注意力越稀释,模型越容易抓错重点。
单会话别硬撑。他的实测是超过40轮之后输出质量明显下滑——一次60轮的会话里,模型在第50轮把他第12轮明确否决过的方案又捡了回来。知乎更好的做法是把大任务切成小会话,每个会话开头花30秒写个任务简报,让git提交记录去承担记忆,而不是聊天记录。
CLAUDE.md要像代码一样持续更新。那些"你们团队默认都知道"的项目约定,恰恰是AI最不知道的;文档不更新,AI就会按旧地图理直气壮地走错路。
B站那期视频还给了个自检入口:用/context随时查看当前上下文的占用构成,看清楚满了没有,再决定要不要清理,比凭感觉猜靠谱得多。哔哩哔哩

对症下药,别照单全收
你的情况 | 优先动作 | 原因 |
|---|---|---|
单会话为主,返工多 | 先Plan Mode、少给文件给精准、超40轮就拆 | 返工是最大的单笔浪费 |
长对话、上下文常满 | /context自查、换话题就清理、保持前缀稳定护住缓存 | 把输入成本压到缓存命中价 |
多Agent并行 | 用共享状态文件替代群聊式沟通,别多加协调层 | UCL实验中消息密集任务输出token降约42% |
只有两个Agent、一次性交接 | 直接交接,别加文件流程 | 避免过度工程反而更贵 |
最后一句提醒:像"禁用几个工具Token直接省一半"这类帖子,属于单个博主的经验,没有公开验证,禁用工具省token的同时也可能砍掉能力,当思路参考可以,数字别太当真。小红书
最后
模型的价格战已经很卷,外部定价也不以单个开发者的意志为转移。但这周的几笔账说明:用法这一侧还有大量可以挤的空间——你改变的不是模型,而是组织工作的方式。token应该花在干活上,不是花在开会上。
有两件事值得继续盯:一是Claude Code这类工具会不会给出更细粒度的成本统计,/context只是个开始;二是多Agent社区会不会演化出更成熟的通信规范——42%这个数字,可能只是个起点。