单价跌了80%,账单反而涨疯了:Agent时代的Token省钱逻辑,从第一性原理就得换

源自167位全网作者

01:56

8月31日晚上,小红书有人晒出自己的8月AI账单:一个月87亿个token,三万五千次请求,总共604块。小红书发帖的人说了一句特别真实的话——“平均每百万Token约0.07元,这么算好像又不贵。但我还是肉疼。”

单价跌了80%,账单反而涨疯了:Agent时代的Token省钱逻辑,从第一性原理就得换

同一天,知乎上挂着一个被顶上热榜的问题——程序员每天消耗几千万上亿的Token,到底产出了什么?知乎底下有个回答很扎心:Token不是资源,更像发动机排出的尾气——有尾气说明发动机在转,但车到底在拉货还是在原地空转,就不好说了。

这两条内容放在一起看,就是2026年9月大模型推理最拧巴的现实:全行业的token单价都在往下打,但重度用户的账单反而在肉眼可见地变厚。

先算总账:这轮降价是真的,你的账单变贵也是真的

先把事实摆清楚,不玩虚的。

降价这一头:7月底,OpenAI把GPT-5.6系列里的Luna一口气砍了80%;8月中旬,前沿档的Sol又来一轮限时促销,部分服务再降逾20%。微博更早的7月初,还有报道称OpenAI找到了新的系统优化方案,能把推理成本砍掉一半以上,过去几万张GPU才能满足的需求,现在几百张就足够了。36氪国内这边不用说,7月份DeepSeek V4 Flash在高缓存命中率下,1亿Token的成本一度不到3块钱。知乎

用量这一头,涨得更猛:MiniMax在8月底中报电话会上说,今年7月,全平台的Token消耗量已经达到了1月份的20倍;B端收入同比暴涨703.1%,占比从三成翻到六成多。36氪行业口径的数字更夸张:中国日均Token调用量,2025年底还是100万亿,今年一季度末140万亿,到二季度末直接跳到500万亿。知乎半年涨20倍,这个说法不是营销号编的,是财报电话会里的原话。

一边是单价曲线往下,一边是消耗曲线往上,两条线交叉出来的结果,就是开头那位发帖人的604块:单位成本降了一个数量级,总消耗涨了两个数量级,落到账单上,反而是"越降价,越贵"。

单价跌了80%,账单反而涨疯了:Agent时代的Token省钱逻辑,从第一性原理就得换

问题来了:钱到底被什么吃掉了?如果你还是用"少写点字、别老问废话"的思路去省,那基本等于白省。因为吃掉账单的三样东西,跟你说多少话关系不大。

吃钱大户一号:Agent每一轮都在"重新背一遍全文"

过去用网页版聊天,一问一答,token消耗约等于对话长度。现在用Claude Code、Codex这类Agent工具写代码,计费单位悄悄变了:你不再是"问一个问题",而是"派一个任务"。

有个知乎回答把账算得很透:Agent每进行一轮对话,都要把系统提示词、工具定义、全部消息历史重新发送一遍,一个跑了30轮的会话,累计发送的prompt token是单轮的几十倍。知乎你以为你只是在"继续刚才的任务",在计费系统眼里,你把同一本使用说明书从头到尾重印了30遍。

这就是为什么"省token"的核心从来不是"少说话",而是让重复发送的部分尽可能命中Prompt Cache。这个机制本质上是对KV Cache的复用:模型第一次读完一段前缀(系统提示、工具定义、代码库上下文)后存下中间结果,后续请求只要前缀一致,就能直接复用。官方口径是最高把延迟降低80%,把输入token成本降低90%——注意,这是同一个任务在"命中"和"没命中"两种状态下高达10倍的价差。36氪

有人从9月1日起高强度实测V4系列,晒出了自己的分时面板:deepseek-v4-flash在中午12点到13点这一小时,命中缓存的输入token有993万,未命中只有2.3万,输出仅5.1万——Agent重复发送的前缀才是账单的大头,命中率直接决定这近千万token按什么折扣计费。

单价跌了80%,账单反而涨疯了:Agent时代的Token省钱逻辑,从第一性原理就得换

顺带一句反常识:缓存命中的红利正在收窄。7月那个"1亿token不到3块"的黄金窗口,进入8月后各家调价,已经回不去了。所以9月才做成本管理的个人开发者,和7月就动手的人,面对的是两套价格体系——这也是为什么账单监控要从第一天就建,而不是等肉疼了再回头查。

吃钱大户二号:思考模式在按"秒"收费,只是账单上写的是token

DeepSeek V4正式拆成Flash和Pro两条线之后,“该用哪个"成了选型题。Pro的设计哲学是"慢工出细活”:面对复杂问题先拆解、再推理、必要时检查中间结论——这些"内心戏"全部按输出token计费。它的正确用法是用在刀刃上:低频、高价值、错误代价大的任务,才值得为每一次深度推理付费。知乎反过来,用在"帮我写个正则"这种任务上,就是纯烧钱。

有实测可以参照:有人从9月1日开始高强度混用V4 Pro、V4 Flash和刚开源的Flash-Vision-Exp,1.2亿token花掉24元多。小红书也就是说,同一个人、同一个工具链,钱的分布极不均匀——账单结构本身就是你的任务结构

单价跌了80%,账单反而涨疯了:Agent时代的Token省钱逻辑,从第一性原理就得换

而小红书那条604块账单的帖子,百万token均价0.07元,明显是在Flash档和缓存命中的加持下跑出来的;知乎那位两个月烧100亿token的重度玩家,把结论收成了一句大实话:聪明的做法是给任务分级——真正贵的从来不是用得多,而是没把任务路由好。知乎

吃钱大户三号:最隐蔽的一档——弱模型返工,才是真烧钱

这条是最违反直觉的:很多人觉得用小而便宜的模型能省钱,实际跑下来,弱模型的理解能力差,一个需求它可能来回改五六轮才搞对,每一轮都在把整个上下文重新发一遍。知乎算总账,弱模型的消耗经常反超强模型一轮过——这还没算你盯着屏幕等输出、逐行审查、写修改意见的时间成本。

省Token这笔账里,返工才是隐藏税率最高的那个税种。合理的姿势是反过来的:预算允许时优先上能力强的模型保一轮过率,然后把省下来的预算用任务分级花出去——核心逻辑、架构决策、代码审查上Pro;格式转换、简单抽取、量大面广的检索问答,Flash甚至更小的模型就够。先默认便宜档,输出质量明显过剩就降级,明显不达标才升级,动态校准,而不是靠印象站队。

不同人怎么动:三档清单

低频问答用户(偶尔写文档、查资料、一个月几十块以内):这轮降价你是纯赚的,什么都不用改。单价从0.3跌到0.07,你的账单只是从两杯奶茶变成一杯。别被"token焦虑"带节奏去折腾工具链。

个人重度用户 / vibe coder:按优先级做四件事——①第一天接上用量看板(掘金的AI用量统计、各家控制台导出都行),没历史数据连问题出在哪都找不到;②保持上下文干净,这是缓存命中的前提,别让AI每次开口前重读一堆没用的历史;③任务分级,默认 Flash,复杂升级 Pro,把选型做成可配置项而不是写死。知乎④每隔一个月拿固定测试用例重跑你关注的几个模型——模型的世界里两个月就是一个世代,你的"XX不行"的印象随时会过期。

企业和小团队:账单超预算的根源通常不是单价,是"无限续杯"——没有任务级成本上限、没有路由策略、没人对单功能算ROI。企业侧的正解是把AI成本从"糊涂账"变成"投资账"。知乎值得抄的作业:网关层路由(默认Flash、命中规则升Pro)、Flash先做分块摘要、Pro只做深度结论的瀑布式调用、重复请求前置缓存,以及把省下来的token预算定期拿去评测新模型。

最后:盯住两个信号

一个是降价的成色:OpenAI这轮Sol是"限时促销"不是永久调价,而且GPT系此前一直没有国内厂商那种缓存命中折扣——如果下轮跟进降价带上缓存折扣,个人账单会再松一档;如果只是限时价到期回调,9-10月的账面成本可能反弹。36氪

另一个是用量的斜率:MiniMax的20倍、行业日均500万亿,这些数字说明推理成本的大头还在往Agent和企业端迁移。对普通用户,真正的省钱窗口不在等下一次降价,而在把自己的调用结构先理顺——单价决定你的成本下限,调用结构决定你的账单上限,而后者从来不在厂商的定价表里,在你自己手里。

你8月的token账单多少?评论区晒一下,看看重度玩家的分布到底长什么样。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章