小红书8月有条Codex笔记,作者的一句话说中了很多重度用户:最近用Codex,最大的感受不是贵,是你根本不知道钱死哪去了。小红书 它提的"一行配置省25%",赞藏不过几百——真正的大流量在另一头:"4个设置降低80%Token消耗"拿了8107赞、16384收藏,"1个Skill降低90%"5375赞、10352收藏。
省钱小妙招转了一堆,没人回答那个根本问题:Token到底是怎么没的?
这周行业把答案补上了。9月9日,InfoQ翻译自The New Stack的三项基准测试综述挂上知乎热问,结论一句话:模型、API、任务全部固定,只换Agent框架(Harness,就是包在模型外面那套自动干活的软件),每任务Token消耗能差出70倍以上。知乎 同一天,Salesforce财报被扒出另一面:营收增长10.8%,GAAP营业利润率却从去年同期22.8%掉到20.5%,副CFO Mike Spencer直接点名——钱烧在了Claude上,2026年预计为Anthropic的Token花约3亿美元,几乎全在编程场景。36氪而前一天,全网在讨论"Token支出价格指数下跌50%创历史新低"。
三个数字摆在一起,意思很不舒服:Token单价在跌,公司和个人喊了几个月"降价",你的账单却不一定变轻。因为钱可能压根没从模型这扇门走。
一、三项基准:差异出在哪,数据先摆清楚
6月,一项独立基准测试(12种配置 × 2个模型 × 12个Python任务,全部走OpenRouter,保证API和模型一致):跑DeepSeek V4 Flash,再换英伟达Nemotron 3 Ultra跑一遍。结果,解决一个任务的Token消耗,从Aider architect模式的约3500,到OpenClaw的29.2万——差70多倍。InfoQ关键是两个毫不相关的模型之间,排名几乎不动。贵在哪,跟模型聪不聪明没关系,是模型外面那层软件决定的。

8月,Composio测了8个Agent框架,同一个DeepSeek V4 Flash,30个企业工作流(Airtable、Gmail、Google Sheets、GitHub、Slack等),单次运行上限900秒,用程序化验证器打分而不是LLM当裁判:240次运行,129次真正做成。每次成功任务的成本,从PiAgent的0.028美元到Claude Code的0.195美元,差近7倍。InfoQ DeepAgents通过率跟Claude Code打平,成本只有它的四分之一。通过率本身也从46.7%拉到66.7%。
ArtificialAnalysis的编码智能体指数样本最大:326个任务、每项跑3次。InfoQ 该指数还做了固定Claude Opus 4.7、只换Claude Code/Cursor CLI/Opencode的对照,按组合公开单任务成本、Token和耗时。想知道你手上这套组合在市场上什么水平,现在有个可以持续翻的公共账本。
二、机制拆解:钱是从哪三个口子漏的
口子一:启动税(Startup Tax)。你还没开口,工具已经替你带了一大摞进模型:系统提示词、工具Schema、环境信息。architect模式的Aider约700 Token,OpenClaw约2.6万。InfoQ一次也就罢了,但大模型API无状态,每一轮都要重新携带——每轮背2.6万、一个任务15轮,光脚手架就是39万输入Token。测试发现"每轮固定上下文 × 调用轮数"与总消耗高度相关,R²=0.99。还有个反直觉细节:贵价工具并没有在囤历史,各家每轮上下文只增长几百Token,差距不在积累,在每一轮都背着的那块地基。每多挂一个MCP服务器,模型每轮就多读一份它的工具说明书。

口子二:缓存命中率——同样的Token,两种账单。Claude Code的输入Token里只有1.5%命中缓存,Codex约70%,OMP约57%;而新输入的价格大约是缓存输入的5倍。InfoQ6月测试里,Codex一个套件计费超100万Token,其中77%是按约十分之一价格收费的缓存读取;按真实账单口径算,Codex每任务反而比原始Token只有它一半的Claude Code更便宜。要给Claude Code说句公道话:这个测试环境里它近乎零缓存,主要是走Anthropic风格messages端点被网关协议转换拖累,属于服务路径问题。但教训是通用的:缓存折扣不是工具的属性,是"工具×端点×网关"这条路径的属性。

口子三:工具输出回灌。AI跑一条cargo test,200多行日志整个灌进上下文,45行的ls -la、15行进度废话的git push,都会留在对话历史里每轮重复计费。这就是RTK(Rust Token Killer)这类"管道层"工具7个月拿下76800星的原因:把AI执行shell命令的输出先压缩再交给模型,砍60%-90%(cargo test从200+行折叠到约20行)。知乎它文档里那句诚实的话值得反复读:砍掉的是命令输出的90%,不是账单的90%——命令输出只是输入Token的一部分,输入Token只是账单的一部分,每层都在稀释。
三、先别急着换最便宜的:两个反证
看到"差70倍"就想迁到最轻的框架,先看完这两条:
静默截断。6月测试在任务前注入10万Token无关日志噪声,12种配置只有7种完整传输。Kilo和Opencode丢掉83%-89%的内容却照样报告成功。InfoQ 从输出来看,它跟"认真干完了"毫无区别。OpenClaw直接拒跑,KimiCode崩溃,Claude Code全量发送但表现下滑。一个便宜的Agent,可能只是"没听全",而且不告诉你。

贵≠做成。10道SWE-bench Lite高难度任务,4种成本跨度很大的框架,最后全部只解决了同一道;Aider花了80万Token,Codex花了1500万。InfoQ样本太小,不构成结论,但它立了个正确标尺:比"每个成功任务的成本",别比Token。Claude Code和DeepAgents在Composio做成同样多的活,前者每次贵4倍——只看Token数或只看通过率,都会把榜单排错。

企业侧也是同一套逻辑在退潮:硅谷年初还在流行tokenmaxxing——Meta、OpenAI内部挂着"谁烧公司算力最快"的员工排行榜,到年中,Meta、微软、Uber们相继踩下预算刹车。新浪微博Salesforce财报当天给出的新动作叫"精炼模式"——不是每个任务都喂最贵的模型,第二三梯队够用就换,跨供应商调度。36氪政策面也在跟进:工信部办公厅近日印发《关于开展人工智能应用服务商培育专项行动的通知》(工信厅科函〔2026〕414号),明确提出加大大模型、智能体、Token等服务采购力度。知乎 Token被写进政策鼓励的采购范围,"用了多少、由谁承担、值不值"这三笔账,迟早要从工程师的直觉变成流程要求。
四、落地:给自己做一次"脚手架体检",按这个顺序来
先查缓存,再谈换模型。拉一天真实流量的usage字段,看缓存读取占比——测试文章原话:花一个下午核实实际服务路径的缓存比例,比迁移模型更有价值。InfoQ
清点地基。每轮携带多少Token?MCP和工具数能不能砍到"当前任务真用得上"?
缩小范围。别说"检查整个项目",说"只看controller/login.go和service/auth.go,不要扫描node_modules、dist、日志和生成文件";把"重构+升级+补测试"拆成先分析后动手。
过滤输出。shell走RTK类钩子,或要求命令先管道grep再进模型。注意它只接管Bash调用,Claude Code自带的Read/Grep会绕过钩子。
给循环上限。同一测试连挂3次就停手转人工;停止条件写进任务里,别让它"继续优化"。
模型分级。陌生代码库、复杂调试给前沿模型,日常改动给第二梯队。

继续盯两个信号:ArtificialAnalysis指数的更新(现在DeepSeek又把运行时按MIT协议开源、组件可换,自建轻脚手架的门槛在降),以及你账单里"输入Token占比"的走势——如果usage明细里输入Token长期远大于输出,大概率就是启动税和工具输出回灌在大头。
这轮AI编程的账单争议吵了大半年,从"降价45%“吵到"额度腰斩”,三项基准测试终于把它拉回一个朴素的问题:不是模型贵不贵,是你那副看不见的脚手架,每轮替你多背了多少。下次账单异动,先查脚手架,再动模型。
你的工具每轮启动带多少Token?欢迎晒一下usage数字,攒一张中文用户版的"启动税对照表"。