如果你同时在用 Claude Code、Codex 或 Cursor 里的两三个,大概率有过这种体感:让干的活差不多,某家的额度就是掉得快。过去半年,社区把这件事归因于"模型玄学"或者"厂商抠门",但 2026 年 9 月这三周发生的事,给出了另一个答案:决定你账单的,主要是套在模型外面的那层壳——行话叫 harness(智能体运行框架),而不是模型本身。InfoQ

三组实测,把壳的差距摊开了
9 月初,InfoQ 编译了三项独立基准测试(36氪 9 月 9 日转载,标题直接写《模型一模一样,Token 却相差 70 倍》)。这组数据值得每个付费用户细看:
今年 6 月的基准:12 种工具配置,通过同一个 API 网关跑同样的 12 个 Python 任务。每解决一个任务消耗的 token,从 Aider(architect 模式)约 3500 个,到 OpenClaw 的 29.2 万个。换了一个毫不相关的模型重跑,排名几乎没变——差异来自壳,不来自模型。
8 月的 Composio 测试:统一用 DeepSeek V4 Flash 跑 30 个企业工作流,240 次执行,每次成功完成任务的成本从 PiAgent 的 0.028 美元到 Claude Code 的 0.195 美元,差 7 倍;DeepAgents 通过率和 Claude Code 一样,单次成功成本只有它的四分之一。36氪
ArtificialAnalysis 的编码智能体指数:326 项任务、每项跑 3 遍,还做了一组固定模型(Claude Opus 4.7)分别搭配 Claude Code、Cursor CLI 和 Opencode 的对照——把"壳"单独拎出来称重。
注意,壳拉开的不只是成本:同模型下各家通过率从 46.7% 到 66.7%,差出 20 个百分点。选壳不是只选钱包,也是选成功率。
账单里的两笔暗账:启动税和缓存率
为什么差这么多?两项基准共同指向两个机制,这也是你判断自己工具好不好最实用的两把尺子。
第一笔叫启动税。每轮请求在干活之前,壳要先带上自己的系统提示词、工具说明和环境信息。6 月基准里,Aider 的这项开销约 700 token,OpenClaw 约 2.6 万——一个每轮带 2.6 万 token、跑 15 轮的会话,光脚手架就烧掉约 39 万输入 token。这个"启动税×轮数"对单任务 token 用量的解释度 R² 高达 0.99。所以长会话用户被壳坑得最深:轮数一多,固定前缀的差距被几十倍地放大。
第二笔更隐蔽:缓存命中率。新输入的单价约为缓存输入的 5 倍。Composio 披露 Claude Code 的输入 token 里只有 1.5% 走了缓存,Codex 约 70%。于是出现一个反直觉结果:在某些网关路径下,Claude Code 原始 token 只有对手一半,账单反而更贵——因为对面 77% 的量按一折左右的缓存价计费。而且这跟壳本身关系不大,跟它走哪个端点、经过哪层网关有关。36氪
9 月,所有人都在动这层壳
把这三周的事件排一下序,你会发现"模型价格战"之外,一场"壳子战"已经开打:
9 月 11 日:英伟达开源自家 harness SoL-Pi。对比原配壳,token 少 35%–64%、标价成本低 50%–54%,平均得分保留约 94%;做法很朴素——合并"编辑+跑测试"的中间轮次、算清压缩时机再压缩、大文件归档后只留索引、小模型先筛日志且逐条核对原文。152 个 AI 提出的优化方向,最后只活了 4 个。新智元
9 月 19 日:Claude Code 2.1.277 开始自动读 AGENTS.md——这个 OpenAI 牵头、已被 6 万多个开源项目采用、捐给了 Linux 基金会的项目说明书标准,Claude Code 拖了 13 个月终于认账(相关 Issue 攒了 5200 多个赞)。同一时间放出的 mods 机制更关键:AGENTS.md 支持本身就是官方写的第一个 mod,等于承认"壳读什么、怎么读"可以让用户自己改。而发布近一个月的 DeepSeek Harness(GitHub 22.9 万星)喊的是"一切皆插件",甚至能把 Claude Code、Codex 当子智能体调度。新智元
9 月 23 日:Cursor 发博客,公布动了五处壳换来整轮用户 token 成本降 7%:系统提示精简约 66%、常驻工具描述从 7793 砍到 3119 token(低频工具按需加载)、加缓存断点后冷缓存未命中率降 20%、文件行号从每行标改为每十行标、收口子智能体的默认使用。知乎
Cursor 那张支出结构图值得多看一眼:工具调用参数、读文件等"干活的量"占 59%,而系统提示+工具定义 17%、技能插件 8%——你账单里大约四分之一,是在为每轮重复携带的"说明书"付费。模型越强,说明书其实可以越薄。背景是任务确实在变长:据知乎工程师 9 月 24 日转述 Anthropic 公开的工程数据,其合并代码 80% 由 Claude 编写、人均交付量 8 倍,测试量涨到 10 倍、CI 任务半年涨 25 倍——轮次和上下文越长,启动税的乘数效应越狠。
不同用法的人,这周该动什么
如果你只养一个订阅、以中短任务为主:先别急着换工具,壳的差距在长任务里才被放大。真正值得动手的是清一遍自己的项目说明书——AGENTS.md/CLAUDE.md 塞得太满、软链接双份文件、启动钩子打印全文这些土办法,现在官方支持了可以统统撤掉,说明书每短一截,是之后每一轮都在省钱。
如果你在跑长任务、多 Agent 或按 token 计费:把选型指标从"每任务 token"换成"每次经验证成功的成本",并实测自己流量路径上的缓存占比(一个下午就能测完)。英伟达 SoL-Pi 的"证据核验"思路也可以白嫖:给 Agent 的日志类输入加一道小模型初筛+原文比对,比换模型便宜得多。

如果你爱折腾、想摆脱阵营绑架:这三个月是普通用户"换壳自由"的窗口期。说明书统一了(AGENTS.md)、壳可改装了(Claude Code mods、DeepSeek Harness 插件、pi 的 4 工具+扩展)、还有公开指数替你称重(ArtificialAnalysis)。社区 9 月 26 日那句"别做工具的精神股东",第一次有了工程层面的底气。
证据到哪儿,结论说到哪儿
几处必须泼的冷水:6 月基准每组只跑一次、没有方差;Composio 各家推理设置不统一,算不上严格单变量;Cursor 的 7% 和各分项都是自报,外部无法复核,且各分项分母不同不能相加;用量榜更只能看热度不看质量(OpenRouter 榜首 Hermes 47.5T token、第二名 Claude Code 12.8T,只代表被重度使用)。 SWE-bench Lite 那组还有个扎心结果:四种成本差几十倍的壳,最后解出的是同一道题——贵的壳不一定在干更难的活,可能只是在原地多烧了几轮。菜鸟教程
所以这篇的结论强度就到这:壳显著影响你的成本、缓存账单甚至成功率,值得与模型同等严格的审视;但"最便宜的壳最好"不成立。JetBrains 那份覆盖 1.5 万开发者的调查(90% 每周用 Agent、68% 每天用)说明这已经不是小众参数党话题——当 90% 的人都在为 Agent 付费,看账单前先看看外面那层壳,是今年下半年最划算的一次认知升级。CSDN

接下来盯三个信号:ArtificialAnalysis 固定模型对照组的更新(谁在裸泳一目了然);Codex、Cursor 们对 AGENTS.md 之外开放改装口的态度;以及各家"降本"数字有没有出现第三方复现。有下一个大动作,值得回来这篇评论区对账。