兴趣圈里最近吵得最凶的问题,已经不是"哪家模型更聪明",而是"我额度怎么又用完了"。知乎上一个41万浏览的问题"claude怎么订阅最便宜",高赞回答的结论很土:大部分人是为了省几美元差价,最后把整份订阅费都搭进去。知乎
过去两周,三项基准测试、Anthropic工程师的一次分享、加上一张开发者自己回放7天会话算出来的表格,把这件事摆到了台面上:你的订阅账单花多大,模型之外,至少还有"壳"(agent harness,包裹模型的那层软件)和你的使用方式在共同决定。
模型一模一样,账单能差70倍
9月9日InfoQ/36氪报道的三项harness基准测试,第一次把"壳税"量化了出来。
同一批任务、同一个模型、同样走OpenRouter,12种编程工具配置跑下来,每解决一个任务消耗的token,从Aider architect模式的约3500个,到OpenClaw的29.2万个——换个壳,成本差出几十倍。更关键的是:换用两个毫不相干的模型重跑,排名几乎没变。差异来自软件本身,不是模型脾气。36氪
差距的来源被命名为"启动税":工具自带的系统提示词、工具说明,每次请求都要打包带上。Aider约700个token,OpenClaw约2.6万个。一次性的40倍还能忍,架不住它每轮都发——一个每轮背2.6万token、跑15轮的会话,什么都没干,光脚手架就烧掉约39万输入token。回归测试显示,"启动税×轮数"能预测每项任务的token用量(R²=0.99)。
Composio用30个企业工作流测"解决一个任务花多少钱":最便宜的PiAgent每次成功0.028美元,最贵的Claude Code 0.195美元,差7倍;DeepAgents通过率和Claude Code完全一样,成本只有它的四分之一。36氪
最容易被忽略的是缓存率:Claude Code的输入token里只有1.5%走缓存,Codex约70%——新输入的价格大约是缓存输入的5倍。所以会出现"原始token只有对手一半、账单反而更大"的怪事。(边界说明:6月那项基准每种配置只跑过一次,单任务方差大,看机制可以,比规模请以每项任务跑三遍取平均的ArtificialAnalysis编码智能体指数为准。)
壳不光决定成本,还决定成功率
同一个DeepSeek V4 Flash,套不同的壳:OpenCode通过率46.7%,PiAgent 66.7%,20个百分点的差距,模型一个字没换。36氪
10月10日公开的HuggingFace"Multi-Harness RL"研究更狠:同一份2.6B参数权重(Liquid AI的LFM2.5,注意不是Claude系模型),塞进Mini-SWE-Agent能解决62%的任务,放进Claude Code只剩33%。把4个应用当训练环境做强化学习,Claude Code里从33%提到49%,Codex提到54%,工具调用还少了31%。哔哩哔哩
结论很直白:评测榜单测的从来不是"模型",而是"模型+壳"这个组合。你抄的模型排行榜,和你的钱包、你的成功率,可能都不完全是一回事。
现在就能拧的三个开关(以Claude Code为例)
1. 把自动压缩阈值改到40万token。默认情况下,原生100万上下文的模型要聊到约96.7万token才自动压缩一次——意味着在此之前每一条消息都背着到当时的整段历史,缓存读也照样计入额度。开发者rohit让模型读完自己7天的会话做回放,10月9日发出结果:阈值设40万,周额度省29%。Anthropic的Claude Code工程师Lydia Hallie次日确认了机制。回放账本是这样的:知乎
压缩阈值 | 周额度节省 | 每周压缩次数 |
|---|---|---|
60万 | 18% | 约30次 |
40万 | 29% | 约82次 |
30万 | 36% | 约126次 |
20万 | 41% | 约232次 |
从30万降到20万,压缩次数快翻倍,只多换5个百分点——30万以下不划算。操作:`/autocompact 400k`,按模型分别生效,Opus/Sonnet来回切的要各设一次;恢复默认用`/autocompact auto`。注意两件事:早年为省额度在settings里加过`CLAUDE_CODE_DISABLE_1M_CONTEXT`的,把这个变量删掉,否则模型被当成20万上下文,设40万等于白设;如果设过`CLAUDE_CODE_AUTO_COMPACT_WINDOW`环境变量,它优先级最高,会覆盖命令设置。知乎
压缩会丢细节(报错原文、随口交代的约束),所以要紧的规矩写进CLAUDE.md最稳,压缩后会自动从硬盘重新加载。干活间隙手动`/compact`加一句"重点保留什么",比让它在任务中间突然刹车体面得多;开新任务直接`/clear`,不花额度。
2. 删掉1M上下文禁用变量。见上,不少人额度用得快,是被这个"省电模式"反噬的。
3. 跑一次`/doctor`,给配置减负。据B站上搬运的Anthropic工程师分享(10月8日原视频),Claude Code的系统提示词被砍掉超过80%,MCP工具定义改成按需加载——过多上下文和过时规则会拖慢推理、降低准确率,`/doctor`命令就是用来审计本地技能、记忆和配置里的重复负担的。同样的逻辑适用于你自己:闲置的技能、重复的格式要求、挂了一堆没用的MCP,都是每轮都要交的隐形税。新模型发布或工作流大改后,定期审一遍。哔哩哔哩
云端的坑:10月10日Anthropic把Claude Projects向Pro/Max全量开放,一个项目线程就是一段完整会话,和你日常会话共用同一份额度,默认还是Opus+高effort。线程撞到上限不会停,挂着等额度一重置就接着烧;闲置超过一小时的旧线程缓存过期,再派活就是整段历史重读。线程数本身,就是新账单。知乎
订阅侧:抢人大战和悄悄缩水,都别当冤大头
把近三个月的事件线排开看,"最便宜的订阅"是个移动靶:
6月,SpaceX收购Cursor;8月29日,OpenAI对Cursor断供,Claude火速补位。36氪
8月19-20日,"晒Claude退订截图送200美元"的Cursor抢人活动刷屏,同期传出Claude Code增长失速、用户退订转投Codex。36氪
小红书有用户实测:点了"取消订阅",Cursor直接给出半价挽留(20美元档位砍半),评论区47个人互抄作业。小红书
9月11日,OpenAI因为Astra需求太猛暂停ChatGPT Pro 20X订阅;9月30日恢复时额度悄悄砍半,价格一分没降——“20X变10X”。36氪
能带走的两条:第一,退订前先把取消按钮点一遍,挽留折扣和竞品补贴的价值经常等于一两个月订阅本身;第二,别为传闻停订阅。马斯克系把X、Grok、Cursor打包成"XPass"四档订阅的传闻从9月底流传到10月上旬,但截至发稿官方并未上架任何套餐,连搬运传闻的帖子都自己标注"尚未上线"。真上线那天判据也简单:合并后的月费低于你现在Grok+Cursor的合价就换,否则当看个乐子。小红书
你该按哪种姿势花钱
每周用AI写不了10小时的小工具/副业党:20美元档入门(Cursor Pro,或Trae免费档+国产CodingPlan打底)就够了,不值得上Max。别纠结选哪个模型,先选"启动税"低的壳。
重度终端用户(Claude Code/Codex主力干活):先把上面三个开关拧了,按回放账本拿回约三成额度,再谈加钱升级;还不够用,参考站内25万浏览帖的主流打法——国产CodingPlan打底,难啃的任务再调用海外模型。知乎
在犹豫要不要订第二个工具:先拿同一个真实任务跑两个壳,记下token/轮数和通过率。"每个成功任务的成本"差距大,说明两个壳互补,值得双订;差距小,就是重复付费。
企业/团队:采购口径从"每token价格"换成"每个经过验证的结果的成本",另外务必在自家真实服务路径上测缓存率——网关的协议转换就能把缓存命中打回1.5%那种水平,这比迁移模型性价比高得多。
值得继续盯的信号
XPass何时官宣(以及四档的真实价格)、OpenAI Pro会不会二次缩水、Anthropic会不会把autocompact默认值改掉、ArtificialAnalysis编码智能体指数的下一轮更新。
AI编程买的从来不是单一模型,而是"模型+壳+额度策略"整条链。模型几周换一茬,壳的税一直躺在你的月账单里。先把400k这个开关拧上,一周后看用量面板的差额——如果你自己回放出了不一样的数字,欢迎拿账本来评论区对线。