8月中旬,Anthropic官方发了一篇讲Claude Code成本账的文章,核心就是求大家别再烧冤枉token36氪知乎。两天后,Anthropic向投资者披露,截至今年7月底,公司年化营收运行率(ARR)已达650亿美元,最近一个完整季度的初步收入也超过115亿美元36氪。
按此前《金融时报》报道,投资者预计Anthropic最快今年10月登陆公开市场,IPO估值达到2万亿美元甚至更高36氪。一边是收入狂飙,一边是官方教大家少花钱,因为他们比谁都清楚,这部分收入里有多少是"烧"出来的。对按月付费的用户来说,这篇官方成本课比任何攻略都实用。今天把五个最容易踩的成本陷阱和对应的省钱开关一次说清。

陷阱一:配额不是按月算的,每5小时清零一次
很多人以为订阅=买一个月的额度池慢慢用。其实不是。Claude 的额度不是按月给的,是每 5 小时滚动一次。一天四个多窗口,一个接一个往前滚。你睡觉的时候它在滚,开会的时候它在滚,周末没开电脑的时候它照样在滚。用不完的部分不累积,到点清零知乎。
国产套餐也是同样逻辑。比如DeepSeek V4上线OpenCode的Go套餐后,配额同样按每5小时的请求数计算微博。

这意味着,除非你每个5小时窗口内都在高强度写码,否则高配套餐很大程度是在买空气。日常每天几十个请求的轻度用户,入门档就够用,不必为"理论吞吐量"付钱。
陷阱二:每轮对话都在重发全部历史,会话越长越贵
最隐蔽的成本是上下文。你每输入一条指令,模型都要从头重新读一遍:系统提示词、CLAUDE.md、之前读过的文件、命令输出,全部跟着本次请求一起发送。每一轮对话都在拖着前面所有轮的全部内容重新发送,会话越长,每一轮就越贵36氪。到第40轮对话时,第1到39轮的全部积累内容都在被重新发送,增长接近平方级。

好在有提示词缓存:前缀相同的请求可以直接复用上次计算结果,缓存读取只要正常输入价的0.1倍,写入缓存贵一点,最高2倍36氪知乎。缓存一直命中,长会话的成本会大幅下降;缓存一旦被打断,整段对话历史就要按全价重新计算。
打断缓存的方式很多:切模型、切推理强度、开关Fast mode、用/compact重写历史、缓存过期(订阅用户保活1小时,API用户默认5分钟)、恢复很久前的旧会话,中任何一条都会从0.1倍打回全价。所以记住一条原则:会话开局就定好模型和effort,中途别乱动。
陷阱三:模型选错,等于牛刀杀鸡
模型之间的价差很直接:Opus 5输入每百万token 5美元、输出25美元,Sonnet 5输入2美元、输出10美元,Haiku 4.5输入1美元、输出5美元36氪。Opus是Sonnet的2.5倍、Haiku的5倍。再叠加推理强度决定思考token的消耗量,max和low之间能差出好几倍。官方的建议很直白:简单活用Sonnet,硬骨头才上Opus。日常机械活——改测试、修笔误、跑固定流程——小模型就够,把大模型留给真正困难、含糊、需要深推理的任务。
陷阱四:接国产模型也有坑,83%的上下文可能从没被用上
不少人靠改ANTHROPIC_BASE_URL把Claude Code接到国产模型或中转上省钱,这确实是国内的主流路线之一知乎。但这里有个隐藏坑:Claude Code对不认识的模型名默认按200K上下文管理。如果分母是 200k,但你用的模型标称 1M 上下文——你有 83% 的上下文从来没被用上过知乎。而且它不报错,只会让你觉得"这模型怎么老忘事"。

验证方法很简单:输入/context看第一行的分母。确认模型窗口是1M后,给模型名加[1m]后缀,比如glm-5.3[1m],Claude Code就会按1M管理压缩,这个后缀是纯客户端标记,发送前会被剥掉,不影响上游。注意别单独设置CLAUDE_CODE_AUTO_COMPACT_WINDOW,它走取小值逻辑,只能把窗口往下调不能往上抬,还会把唯一能提醒你的警告消掉。一句话:/context 的分母才是唯一可信的验收标准,警告消失不算数知乎。
陷阱五:订阅分三档,别为用不完的强度买单
订阅制月费从20美元到200美元分三档36氪。升降级的判断标准其实很简单:看你高强度连续编码时,是否每周都会顶到配额上限。不会,入门档就够;会,且是长期大项目,再往上走。最亏的是轻度用户因为怕不够用直接上顶配——叠加陷阱一的5小时清零,买的大部分都会被直接清掉。
国产替代的进度今年明显加快。DeepSeek开源Harness框架后,一周内GitHub Star突破12.5万,GLM-5.3也在DeepSWE v1.1基准上拿到66.9分,和Claude Sonnet 5约65分的差距已经很小知乎。MiniMax也在8月18日开放了终端Coding Agent mcode的公测微博。
另据一篇社区文章,阿里内部已将Claude Code列入高风险软件名单,推荐转用Qoder知乎。对有合规要求的企业用户,迁移已经不是"以后再说"的话题。
行动清单:对号入座做一件事
轻度用户(每天只写几小时码):留入门档,会话开局定好模型和effort,任务做完就/clear,别让这个任务的文件和输出拖进下一个任务。
重度用户(全天在烧):别中途切模型;休息前趁缓存还活着做/compact,成本只有正常十分之一;翻日志这类大输出任务扔给子Agent,只把结论带回来。
盯钱党:看用量统计里的cache_read_input_tokens,缓存读取占比越高会话越健康;在CLAUDE.md里给输出多的命令写一条静默参数,每次跑测试能省几百行上下文。
企业合规场景:别找一比一替身,按模型、框架、工具、部署四个维度拆开,分别评估国产组合。
问法也决定成本:同样一处修复,只说"测试挂了",模型要先搜仓库、翻一堆文件才定位,最后发出18个请求;直接指明文件与失败点,5个请求就够知乎。精确提示本身就是省钱开关。

三个值得继续盯的信号
第一,DeepSeek从8月18日零时起启用峰谷定价:高峰时段(9:00-12:00、14:00-18:00)价格翻倍,其他闲时价格只有高峰的一半微博。跑批量任务的,挪到夜间直接省一半。
OpenCode也同步调整了Go套餐里的DeepSeek额度,V4 Flash模型每月预估请求数从15万级降到18,900微博。"固定价格不限量"的时代,正在被越算越精。
第二,盯Anthropic的IPO节奏和订阅配额政策。650亿美元的年化营收是IPO最直接的筹码,但用户侧的"烧钱"效率不解决,配额政策只会越收越紧。第三,国产的降价与追赶潮:GLM-5.3、DeepSeek V4、mcode都在密集进入AI编程场景,接下来半年大概率还有价格和配额上的动作,这波羊毛值得等。
你踩过哪个成本陷阱?或者有什么独门省钱操作?评论区聊聊。