如果你在用 DeepSeek 的 API 跑 Agent、做 Coding Agent 或者长上下文工作流,这三天有一件必须做的事:把成本重新算一遍。
8月13日被不少开发者称为中国AI史上最混乱的一天:DeepSeek-V4-Pro-0813 深夜低调上线,官方跑分与第三方实测口碑撕裂,发布横幅不到24小时被撤下;同日晚间,DeepSeek 又开源了首个 Agent 框架 DeepSeek Harness(DSH)。小红书但在这一连串大新闻里,真正和你钱包直接相关的是另一件事——8月17日0时生效的新定价与峰谷计价。
一、到底涨了多少?别看"12倍",看这三组数
这次转得最多的说法是"最高涨价12倍",它来自 V4-Pro 的缓存命中价。小红书但缓存命中本来就是单价最低的一项,拿它估算整张账单会严重高估,真正决定账单的是下面这张表(8月17日起,元/百万 tokens):
项目 | 现价 | 新闲时价 | 新高峰价 |
|---|---|---|---|
Pro 缓存命中输入 | 0.025 | 0.15 | 0.30 |
Pro 缓存未命中输入 | 3 | 4.5 | 9 |
Pro 输出 | 6 | 13.5 | 27 |
Flash 缓存命中输入 | 0.02 | 0.05 | 0.10 |
Flash 缓存未命中输入 | 1 | 1.5 | 3 |
Flash 输出 | 2 | 4.5 | 9 |
换算成体感涨幅:缓存未命中输入高峰涨3倍、闲时涨1.5倍;输出高峰涨4.5倍、闲时涨2.25倍,Flash 和 Pro 涨幅相同。高峰时段集中在北京时间上午和下午两段,V4-Pro 高峰输入未命中 9 元/百万 tokens、输出 27 元/百万 tokens,是现价的3到4.5倍。知乎
二、为什么这次最疼的是 Agent 用户
普通聊天用户几乎无感——一次对话几千 tokens,涨完也就是几分钱的事。但 Agent 类负载是另一种成本结构:长上下文,系统提示词、工具定义、历史记录每轮都要带上;多轮循环,一个任务动辄几十轮调用;高输出,写代码、生成报告都是输出密集型。用典型 Coding Agent 任务算一笔账(假设每轮10万输入 tokens、其中90%缓存命中,1万输出 tokens):
场景 | 单任务成本 | 相对现价 |
|---|---|---|
现价(8月17日前) | ≈0.09 元 | 基准 |
新价·闲时 | ≈0.19 元 | 约2.1倍 |
新价·高峰 | ≈0.39 元 | 约4.2倍 |
新价·高峰且缓存命中率降到50% | ≈0.74 元 | 约8倍 |
账算到这里,真正吓人的不是峰谷差,而是缓存命中率:Pro 高峰时段缓存命中输入 0.30 元/百万 tokens,未命中 9 元,相差30倍。社区分析也是同一个判断——聊天用户影响不大,但做 Agent、长上下文、多轮工作流的人,成本模型必须重算。小红书
这不是夸张。APPSO 的内测截图里,一个工程任务用 V4-Pro Max 跑下来1轮118步、输入1230万 tokens,同样的工作量账单没爆,靠的是状态栏里那行"缓存命中 100%"。

三、V4-Pro 跑分争议:官方分数为什么你测不出来
与涨价同时发生的,还有 V4-Pro 的口碑风波。官方口径里,它的 Agent 能力全面越级:HLE、Terminal Bench、Cybergym、DeepSWE 等指标超过 Claude Opus 4.8、逼近 Fable 5。知乎
但第三方实测撕裂成两派。一派说第三方评测平台上 V4-Pro-0813 只比 V4-Flash 高1分,不少开发者把 V4 四个版本拉去跑真实任务,Flash 赢下近半;另一派如36氪连夜实测7项任务,结论是长周期工程任务扛得住、“性能逼近 Fable 5 确实没有信口开河”。小红书
社区对"分数对不上"给出三种猜测:部署出错实际跑的还是 Flash、部分节点灰度未全量、Pro 真实水平本就如此,三种都没有官方回应。但有一个更关键的背景:官方更新日志里写着,V4-Flash 正式版的分数是用 DeepSeek Harness 极简模式作为框架测出来的,你用 Claude Code 或裸 API 测,和官方测的不是同一套东西。36氪APPSO 的内测也印证了这一点:同一个 V4-Flash,换到 Harness、Reasonix、Codex 三个执行层里跑同一个 Three.js 滑沙游戏,交付质量肉眼可见地不同。

这件事对选型的启示比拼分本身更值钱:任何一家的官方分数都别直接当选型依据,拿你自己的真实任务跑一遍,标准就两条——任务能不能完成,完成一次要花多少钱。
四、8月17日前后,四件能实际省钱的事
能错峰的任务全部挪到闲时。闲时价格是高峰的一半,批量处理、定时任务、日报生成这类不卡实时性的负载,排到18点以后或中午12–14点,成本直接砍半;在线服务没法错峰,就直接按高峰价重新估预算。
把缓存命中率当工程指标来管。系统提示词、工具定义这些前缀别频繁改动,会话尽量复用同一前缀结构。社区方案也在往这个方向卷,第三方适配框架 Pi 被报道做到 99.93% 的缓存命中率,GitHub 星标8万+。36氪缓存命中率每提升一点,都是在30倍价差里省钱。
重新掂量 Pro 和 Flash。涨价后 Flash 高峰输出 9 元,仍只有 Pro 高峰 27 元的三分之一,日常编程、办公自动化、批量文本处理大概率够用;确实需要 Pro 的,先小流量对比你手上 Flash 的结果,再决定值不值差价。
等 Harness 稳定再评"满血 Pro"。官方口径里"模型+Harness"才是完整体,DSH 目前还是开发者预览版,等正式版和插件生态稳了,再重新测一轮 Pro 的满血表现,现在急着切生产容易两头挨打。
五、真正的战场刚开始:从"谁的模型强"到"谁把事办完"
把这两天的新闻拼起来看,主线已经清楚:8月14日 DeepSeek 正式发布并开源首款 Agent 产品 DeepSeek Harness,官方公式是"模型+Harness=Agent"。微博它采用 MIT 协议、“一切皆插件"架构,发布后涨星速度惊人,被媒体称为 GitHub 史上最快涨星项目。知乎官方页面里,DSH 甚至直接贴出了一张与 Codex 的"直接对照表”:并行多智能体、文件沙箱、长任务后台执行、跨会话记忆、外部工具生态,执行层能力逐项对标。

同期阿里开放 Qwen3.8-2.4T 权重、xAI 发布 Grok 4.6,加上 Anthropic 的 Skills、社区的 Pi,Agent 执行层的竞争才刚开始。竞争越激烈,用户比价空间越大——稀缺的不再是"更聪明的模型",而是把模型拼成能稳定交付的生产工具的那套工程能力。
接下来值得盯的信号:8月17日后第一周的实际账单,是检验峰谷策略成色的最好样本;V4-Pro 的部署争议会不会有官方解释、会不会重新高调发布;DSH 正式版与插件生态的节奏。
一句话收尾:DeepSeek 最大的标签"便宜"正在变贵,Agent 用户省钱的主战场已经从"选哪个模型"变成"什么时候调、缓存命中率多高"。这两个杠杆抓好了,涨价也能把账算平。