同一个模型,token账单差80倍

2026-09-14 07:35:58 0点赞 0收藏 1评论

3500个token,29.2万个token。同一批编程任务,跑在同一个模型上,外面那层工具一换,开销就差出80多倍。

我先交代我看到这组数字时的状态。周五晚上翻Composio的基准报告,翻到这行我坐直了。因为我上个月刚给团队的AI编程工具续了费,单价我比过,尺寸我挑过,自认为没花冤枉钱。现在看,我比错东西了。

这事值得每个为AI编程掏过钱的人停下来看五分钟。它跟模型强弱没什么关系,真正的问题是你开销单上的钱,到底花给了谁。

开销是工具吃掉的,模型只是标签

2026年6月有一项独立基准测试。12个Python任务,跑在同一个模型上,走同一个API通道,唯一变量是编程工具本身,就是Claude Code、Codex、Aider、OpenCode这类agent框架。

结果每解决一项任务,token开销从Aider的约3500个一路拉到OpenClaw的约29.2万个。

更扎心的是后半段。换一个完全不相关的模型重跑一遍,排名几乎不动。原来贵的还贵,原来省的还省。

这说明差距的来源压根不在模型智力,在工具软件自己。模型在所有测试里都是同一个,表现却像换了个物种。

差在哪?主要是一笔隐藏开销,研究人员给它起了个名字叫启动税。

工具每次替你干活,开工前要先把自己的系统提示词、工具说明书、环境配置打包发过去。Aider带的行李约700个token,OpenClaw带约2.6万个。

你要是觉得这钱一次付清也就认了,坏就坏在它是每轮对话都重发一遍。一个每轮拖着2.6万token行李的工具连跑15轮,光这些脚手架就烧掉约39万个输入token,真正的活儿还没开干。

研究人员算了笔公式,启动税乘以轮数,基本就能预测你的总开销,两个模型上拟合优度都是0.99。你的钱在动手之前就已经被机票和托运费分掉了。

同一个模型,token账单差80倍

第二个坑更深,藏在计费方式里

第二个发现比启动税更隐蔽,也更值钱。

同样的任务量,有的工具实际付的钱反而更少,靠的是缓存。

Composio的测试里,Codex大约70%的输入token走了缓存,缓存读取的价钱约为原价的十分之一。Claude Code只有1.5%。

新输入的价格约是缓存读取的5倍。于是出现了怪事,Codex计费的token总量比Claude Code还多一倍,落到结算单上的钱反而更少。

Composio还给出另一组数字。八个工具跑30个企业工作流,每解决一个任务的开销从Pi Agent的0.028美元到Claude Code的0.195美元,差着7倍。DeepAgents的通过率和Claude Code完全一致,单次成功的开销只要它的四分之一。

通过率呢?差距只有20个百分点,46.7%到66.7%。开销差的是倍数,质量差的是零头。

最气人的一组对照,四个开销档位完全不同的工具跑同一批任务,全都只解出10个里的1个。贵的那位没多干一件活。

有人会反驳,贵有贵的道理,更难的活上总能值回票价吧。这项测试专门看过这一点,agent那套反复看、动手、检查、再来的循环,在生代码和跨文件改动上确实帮大忙,可在小修改上基本是原地打转反复确认。开销翻着倍地涨,解决率原地踏步,这两条曲线早就分家了。

我的判断是,agent工具这层很快会卷出透明的成本披露,就像云厂商后来都学会了公开单价和折扣模型。在那之前,信息差就是纯利润,归平台收。

同一个模型,token账单差80倍

顺带说一句根因。Claude Code缓存命中率那么低,问题出在它的通信路径,它走的是另一种API协议,中转翻译的环节把缓存打碎了。同样的活儿,换条路走,价钱就变了。

看完这堆数据,我把我们那套AI编程的用法改了两处,你直接抄。

第一,评估编程工具别再看单价表。去看两个数,它每轮固定发多少token,典型任务要跑多少轮。乘一下,开销的大头就现形了。

第二,先查缓存命中率,再谈换模型。命中率差10倍,比任何模型之间的差价都狠。

我拿自己开的刀。我翻了团队的用量明细,缓存命中那栏不到一成,行李费交在哪一目了然。

这两个数去哪里查?工具文档里一般写着系统提示词的规模。再跑一个已知答案的小任务,把返回的用量明细拉出来,缓存读取占几成,一眼就能看穿。十分钟的事,省下的可能是下个季度一半的工具开销。

我做零售IT那些年见过一模一样的事。当年比价收银系统,A家软件license便宜,B家贵三成,年底一结算B家反而省。A家每个门店要单独部署一套服务器,B家走中央机房。软件的报价单从来不等于总拥有成本,这道理在2026年的AI工具上原样重演,连剧本都懒得换。

最后留一个问题给你。你手里那个AI编程订阅,它每轮开工前往模型那边寄多大一个行李,你知道吗?

不知道的话,这份开销单里最贵的那一行,可能跟模型的聪明程度一点关系都没有。

展开 收起
1评论

  • 精彩
  • 最新
  • 同一模型开销差这么多,日常用AI写代码的值友有没有对比过自己常用工具的实际token消耗?

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松