最近用 DeepSeek V4 API 跑编程任务的人,大概率都听到了一声响:8 月 6 日,DeepSeek 官宣将大幅上调 API 服务定价,还要落地峰谷计费。知乎但更直接关系到你钱包的是另一件事:涨价之前,同一套 DeepSeek V4,不同人用出来的成本差距最高能到 7 倍——差的不在于模型,而在于模型外面套的那层「Harness」(Agent 外壳)。
一、同一个模型,同一批任务,7 倍成本差
8 月 11 日,Composio 团队把 DeepSeek V4 Flash 塞进 8 款主流 Agent Harness,跑同一批真实编程任务,结果最便宜的 Pi 平均每个成功任务约 0.028 美元,最贵的 Claude Code 约 0.195 美元,两者成本差 7 倍。36氪模型相同、任务相同,只是外壳不同——这是当下 AI 编程圈最反直觉的一笔成本账。
二、差距为什么这么大?一个字:缓存
DeepSeek 的计费结构里有个很多人没留意的细节:输入 Token 分「缓存命中」和「缓存未命中」两个价。以 V4-Flash 为例,官方输入价 0.14 美元/百万 Token,输出 0.28 美元,而缓存命中价只有 0.0028 美元,是正常价的五十分之一,这个缓存价在 OpenRouter 的供应商列表里是全场最低。36氪

编程 Agent 的场景恰好最适合吃满这套机制:它每一步都要把系统提示词、工具定义、历史对话和代码上下文一起发给模型,其中绝大部分是重复内容。请求开头字节每次一致,这一大段前缀就命中缓存、按「命中价」计费;前缀一旦变化——系统提示词里加了时间戳、工具定义换了顺序、历史对话被改写——缓存当场失忆,几十万历史 Token 全部按全价重新计费。很多通用框架把「压缩上下文、改写历史」当优化,语义上合理,字节层面却等于每轮都把缓存擦掉,会话跑得越久账单越贵。
而 DeepSeek 自己的缓存又特别稳。知乎答主「苏迟但到」做过一次 2 万次请求、持续 3 天的测试:相同内容间隔 1 分钟到 12 小时重发,DeepSeek 命中率始终保持 100%,有的竞品模型 5 分钟就掉到 25%。36氪省钱的钥匙已经递到用户手里,接不接得住,就看 harness 怎么选。
三、目前谁把 DeepSeek 的缓存用得最狠
第一个是 Pi(GitHub 地址 earendil-works/pi),一个 8.6 万星的开源编程 Agent。它默认只给模型 4 件工具——读文件、写文件、改文件、执行命令,会话只追加、不回头修改前文,计划模式、子 Agent、MCP 这类能力按需当扩展装。开发者 Evan Kim 晒出实测:DeepSeek 接入 Pi 后输入 Token 缓存命中率 99.93%,处理近 10 亿个 Token 只花 2.65 美元,同样的工作量不用缓存要 132 美元。36氪

第二个是 DeepSeek-Reasonix(npm 包名 reasonix),3.2 万星。它的三条规矩——不可变前缀、追加式日志、易失性暂存区——全都服务于同一件事:别动前缀。作者晒出真实账单:单日处理 4.35 亿输入 Token,DeepSeek 实际扣费 12.34 美元,同样的工作量不做缓存优化需要 61 美元。知乎它还原生兼容 Claude Code 的 Skills 格式,老工作流迁移成本不高。
而最多人用的 Claude Code,反而是这轮测试里最贵的那个。不是 Claude Code 不强,而是它整套工程体系是围绕 Claude 模型打造的,底层换成 DeepSeek 后,那套上下文管理方式吃不到 DeepSeek 的缓存红利——一份 48 小时的统计里,Claude Code 客户端的 DeepSeek 缓存命中率只有 89.31%,排第一的客户端则做到 98.6%。用开发者自己的话总结,主要差异似乎出在缓存命中率上。36氪Harness 影响的不只是账单,还有活干得漂不漂亮:有开发者发现同一款 V4-Flash 在 Codex 里能与 Fable 5 基本打平,放到 OpenCode 里只能发挥约一半实力。
四、四个直接能用的省流动作
先检查前缀是否「干净」:系统提示词、工具定义这类静态内容放前面,动态内容放后面,别往里面注入时间、随机数这类会变的内容。
历史只追加不改写:会话中途别手动压缩、重写历史对话,超长的工具输出及时截断。
尽量避开高峰:DeepSeek 的峰谷定价里,工作日高峰为北京时间 9:00—12:00、14:00—18:00,高峰时段价格为平时的 2 倍,能挪到平峰跑的批量任务尽量挪。知乎
成本敏感的话换个外壳试试:轻量的 Pi、功能全的 Reasonix 都可以先跑一周,对比账单再决定。
五、两个值得继续盯的信号
第一,官方 Harness 越来越近了。8 月 12 日消息,DeepSeek 组建 Harness 团队,已开启内测,预计与 V4 正式版同步发布。微博这个团队的负责人、ACM 金牌得主崔添翼,此前就公开招募过 Agent Harness 方向的开源项目开发者,官方版对自家模型缓存红利的吃满程度,值得期待。36氪

第二,涨价的具体方案还没公布,但不用过度焦虑:按 36 氪的测算,DeepSeek 就算只把缓存命中价提高 30 倍左右,也才和第三方平台基本持平,「便宜」这条护城河比多数人想象的深。36氪
一句话总结:涨价涨的是「单价」,Harness 决定的才是「你实际花掉多少 Token」。新定价落地之前,先把自己的缓存命中率拉上去——这是眼下最确定的一笔省钱操作。