2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

源自8位全网作者

06:55

有人跑一次任务用了2734万token,账单2.81元。知乎也有人用同一个模型干差不多的活,每个月多花好几倍的钱。这两天我把这件事翻来覆去研究了一遍,越看越确定:AI编程账单的真正差距,不在单价,而在一个大多数人压根没关注过的变量——缓存命中率。

尤其在这个时间点:DeepSeek已经在官网价格页预告整体上调API定价,原话是"预计涨幅较大",社区里从几倍到十几倍的猜测都有。极客公园单价你说了不算,那是厂商定的;但命中率是你自己能争取来的折扣,而且涨价之后,这个变量的分量只会更重。

账单算的已经不是"字数"了

跑过coding agent的人都有体感:你下一条指令之后,模型要读文件、做计划、调终端、改代码、跑测试、看报错,再循环。一次用户指令背后,可能是几十甚至上百次模型调用,而且每一次调用,都要把之前积累的全部上下文重新喂进去。

所以Agent任务的真实成本公式更接近这样:任务成本 = token单价 × token数量 × Agent步骤数 × 重试次数。腾讯科技这意味着两件事。第一,Agent任务的token消耗比聊天放大了一个量级,对价格极其敏感。第二,也是更关键的——每轮重复喂进去的上下文,绝大部分其实是同一批内容:系统提示词、历史对话、之前的工具调用结果。这部分如果每轮都按正常输入价计费,账单会爆炸;如果命中缓存,计费会掉到"缓存价"。

差距有多大?在OpenRouter的对比表里,DeepSeek官方的缓存命中价是每百万token 0.0028美元,是全表最低价,大约只有第三方平台缓存价的十分之一,相对正常输入价更低了一个量级。InfoQ知乎上有用户说得更直白:命中率无限趋近99%的时候,“四舍五入等于不要钱”。知乎

2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

所以,同一个模型、同样的工作量,命中率99%和命中率50%,账单差出几倍不是比喻,是算术。

2万次实验:缓存的"保质期"差距比你想的大

命中率听着玄学,其实有个很物理的含义:服务器端那份KV缓存能活多久。你隔一段时间回来,发同样的内容,它还能不能认得你?

有知乎用户为了排除单次测试的随机性,做了个很硬的实验:自己部署服务器,连续3天,每隔40分钟发27条随机请求,再分别在1分钟到12小时之后重发相同内容,看是否命中,覆盖DeepSeek、Kimi、智谱GLM、MiniMax和走OpenRouter的OpenAI一共五款模型、2万次请求。

结果分层非常清晰:DeepSeek在工作时间和非工作时间都保持100%命中率,间隔拉到12小时之后依然维持100%。知乎MiniMax排第二,非工作时间约90%,工作时间掉到70%左右,而且有个怪毛病——间隔1分钟时的丢失率反而偏高。Kimi和OpenAI居中。

GLM垫底,而且崩得很快:2分钟命中率80%,3分钟50%,5分钟只剩25%,几乎探测不到超过15分钟的缓存存活。知乎作者推测,原因可能是缓存只放在显存里、没法落盘到更便宜的存储,也可能是请求量太大把缓存容量打穿了。推测归推测,现象本身对用GLM跑长任务的人是实打实的提醒:任务间隔稍微一长,缓存就凉了,每一轮都在重新付全价输入的钱。

这个实验还有一个容易被忽略的坑:Qwen、Seed、MiMo这类模型不做自动缓存,需要手动创建、额外付费。知乎不知道这个机制就直接拿它们跑Agent,就是全程全价在烧。

这也不是孤证。DeepSeek相关问题下面,晒调用图、命中率97%到99%的用户一抓一大把,开头那个2734万token花2.81元的案例,命中率就是97.9%。而DeepSeek今年4月和5月两次调价时,都把"缓存永久大降价"单独列为一项——官方自己很清楚,性价比的护城河到底是哪一段。

第三方中转:看起来便宜,可能反而更贵

理解了命中率,就能看懂最近开发者圈在吵的另一件事。

OpenRouter上,第三方供应商的DeepSeek V4 Flash标价比官方便宜约36%——DeepInfra报0.09/0.18美元,官方是0.14/0.28美元。InfoQ只看价格表,中转完胜。

但OpenRouter的真实流量口径把另一面摆了出来:同一款模型,不同供应商的缓存命中率能从80%以上一路掉到20%、30%,甚至0%。标价便宜不代表账单便宜,你走哪扇门,决定了你能拿到几折。

2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

有位开发者做了个对照实验:在一个100多个仓库的代码库上,同时开两个终端跑相同的调查任务,一个走OpenCode Go订阅,一个直连DeepSeek官方API。结果短任务消费差约2倍,平均差约4倍,部分长会话超过10倍。InfoQ他归因到的核心变量还是缓存——Go一侧命中率低,会话越长,缓存未命中累积越多,重复的上下文全按完整输入价计费。

也要把反方观点摆出来:有人指出Go界面里显示的"美元"是订阅套餐内部的额度折算,不等于真金白银的支出,直接对比会夸大现金成本差距。这个说法有道理,但即便打个折扣,方向不变——长会话的重度Agent工作,"订阅标价"和"真实账单"是两回事。

还有一个更隐蔽的代价不在账单上:走OpenCode路由的V4 Flash,上下文窗口实际只有600k左右,超出后会被压缩截断,而官方是完整1M。InfoQ中转可能不仅让你多花钱,还会让模型"变笨"——很多关于DeepSeek聪不聪明的评价分歧,源头可能在这里。

所以判断可以很简单:短任务、尝鲜、对上下文不敏感的活,中转平台省事;长期跑仓库级编程任务,先看命中率和上下文完整性,再决定走哪条通道。

同一个模型,换个"驾驶舱"就是另一种命运

顺便说清楚一件事:同一个模型在不同工具里的成本和效果差异,为什么能这么大?因为命中率只是一半,另一半握在你用的编程工具——现在这层东西叫Harness——手里。

一个开发者的对比很有代表性:同一款V4 Flash,接在Codex里表现接近Fable 5,放在OpenCode里只能发挥出大约一半的真实水平。InfoQ差距体现在两处:一是整体把握能力,在OpenCode里更容易钻进局部细节、忽略整个系统;二是长任务记忆连贯性,步骤链一长就忘了最初目标,在不同方案之间打转。

2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

反过来看,DeepSeek官方给Codex的接入文档里,直接提供了一整套models.json配置:并行工具调用、约104万token上下文、95%的有效上下文窗口,还有上下文过长后怎么压缩历史、压缩后怎么接着干而不是从头再来——全是工程细节。这就是一个成熟Harness该有的工程沉淀。

开发者社区里流传的另一组数据同样说明问题:同一款DeepSeek模型,换不同的编程客户端,缓存命中率最高能到98.6%,最低只有89.3%。别小看这几个百分点,在Agent几十上百轮的调用里,它就是账单和效果的双重差距。

2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

这也解释了DeepSeek这两天最大的动作:8月13日深夜,V4-Pro正式版API上线,官方编程工具Harness以MIT协议开源了v0.1预览版,官方评测表上,Agent基准DeepSWE从预览版的12.8飙到正式版的62.7,TerminalBench从72.1到87.9。极客公园官方的公式是Model + Harness = Agent——模型是大脑,Harness是神经系统和四肢。36氪AI编程的竞争正在从"谁的模型更聪明",转向"谁能把大脑、手脚和工具箱组装成稳定干活的系统"。对用户的实际含义是:评估任何编程工具,别只看模型列表有多长,要看它接上你常用模型之后的真实成本和真实效果。

涨价前后,你能做的几件事

回到最现实的问题。涨价定在8月17日,新价格表还没公布,社区说的几倍、峰谷定价都还是传闻,别拿传闻下注。知乎但有几件事,不管价格怎么变都值得现在就做:

1. 先给自己测一次命中率基线。 API响应里有cached_tokens这类缓存命中字段,拿你日常的任务连跑几轮看看。90%以上和50%以下,优化方向完全不同。

2. 把前缀固定住。 缓存按前缀匹配:会话中途别随手改system prompt,别在上下文头部乱插内容。如果工具里有"不要重写历史消息、不要删除之前推理内容"这类选项,打开它——那相当于保缓存的开关。

3. 别随手清对话。 至少在DeepSeek上,缓存能活12小时以上,同一个项目接着昨天的会话跑,往往比新开一个便宜。反过来,如果你在用缓存偏弱的模型,硬撑长会话意义不大,不如把任务切短,一次干完。

4. 给任务分模型。 现在的行业方向是:贵的模型做规划和复杂推理,便宜的模型做分类、抽取、简单修改这些执行步骤。斯坦福一项覆盖51个企业落地项目的调研发现,42%的项目认为底层模型完全可以替换,规则明确的常规任务里这个比例是71%。腾讯科技社区维护的真实任务实测也反复显示:推理档位越高效果越好,但成本以数倍增长,低价模型落在"能力略低、成本大幅降低"的区域。高频、可验证、能重试的活,让便宜模型多跑几轮更划算。

2万次实验后,AI编程账单的真相浮出水面:差距不在单价,在“缓存命中率”

5. 盯住8月17日的价格表,尤其是缓存价那一行。 有人算过:DeepSeek的缓存价要涨到与第三方平台持平,全部价格统一上调约3倍才够;如果只涨缓存读取、不动普通输入,要涨约30倍。InfoQ缓存是它性价比的护城河,轻易不会填平——但价格表一旦落地,命中率的价值只会更大。如果出现峰谷定价,顺便观察谷时段的命中率和稳定性。

6. 用Qwen类模型的用户多提醒一句: 它们没有自动缓存,需要手动创建、单独计费,跑重度任务之前先查文档。

单价是厂商定的,命中率是自己争取的。8月17日之后,拿着新价格表对照这篇再算一遍你的账单,这篇建议先收藏。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章