DeepSeek峰时输出价6元涨到27元,8月17日生效:Agent用户账单变贵前做对这4项省钱自查

源自9位全网作者

11:15

如果你在用 DeepSeek 的 API 跑 Agent、做 Coding Agent 或者长上下文工作流,这三天有一件必须做的事:把成本重新算一遍。

8月13日被不少开发者称为中国AI史上最混乱的一天:DeepSeek-V4-Pro-0813 深夜低调上线,官方跑分与第三方实测口碑撕裂,发布横幅不到24小时被撤下;同日晚间,DeepSeek 又开源了首个 Agent 框架 DeepSeek Harness(DSH)。小红书但在这一连串大新闻里,真正和你钱包直接相关的是另一件事——8月17日0时生效的新定价与峰谷计价。

一、到底涨了多少?别看"12倍",看这三组数

这次转得最多的说法是"最高涨价12倍",它来自 V4-Pro 的缓存命中价。小红书但缓存命中本来就是单价最低的一项,拿它估算整张账单会严重高估,真正决定账单的是下面这张表(8月17日起,元/百万 tokens):

项目

现价

新闲时价

新高峰价

Pro 缓存命中输入

0.025

0.15

0.30

Pro 缓存未命中输入

3

4.5

9

Pro 输出

6

13.5

27

Flash 缓存命中输入

0.02

0.05

0.10

Flash 缓存未命中输入

1

1.5

3

Flash 输出

2

4.5

9

换算成体感涨幅:缓存未命中输入高峰涨3倍、闲时涨1.5倍;输出高峰涨4.5倍、闲时涨2.25倍,Flash 和 Pro 涨幅相同。高峰时段集中在北京时间上午和下午两段,V4-Pro 高峰输入未命中 9 元/百万 tokens、输出 27 元/百万 tokens,是现价的3到4.5倍。知乎

二、为什么这次最疼的是 Agent 用户

普通聊天用户几乎无感——一次对话几千 tokens,涨完也就是几分钱的事。但 Agent 类负载是另一种成本结构:长上下文,系统提示词、工具定义、历史记录每轮都要带上;多轮循环,一个任务动辄几十轮调用;高输出,写代码、生成报告都是输出密集型。用典型 Coding Agent 任务算一笔账(假设每轮10万输入 tokens、其中90%缓存命中,1万输出 tokens):

场景

单任务成本

相对现价

现价(8月17日前)

≈0.09 元

基准

新价·闲时

≈0.19 元

约2.1倍

新价·高峰

≈0.39 元

约4.2倍

新价·高峰且缓存命中率降到50%

≈0.74 元

约8倍

账算到这里,真正吓人的不是峰谷差,而是缓存命中率:Pro 高峰时段缓存命中输入 0.30 元/百万 tokens,未命中 9 元,相差30倍。社区分析也是同一个判断——聊天用户影响不大,但做 Agent、长上下文、多轮工作流的人,成本模型必须重算。小红书

这不是夸张。APPSO 的内测截图里,一个工程任务用 V4-Pro Max 跑下来1轮118步、输入1230万 tokens,同样的工作量账单没爆,靠的是状态栏里那行"缓存命中 100%"。

DeepSeek峰时输出价6元涨到27元,8月17日生效:Agent用户账单变贵前做对这4项省钱自查

三、V4-Pro 跑分争议:官方分数为什么你测不出来

与涨价同时发生的,还有 V4-Pro 的口碑风波。官方口径里,它的 Agent 能力全面越级:HLE、Terminal Bench、Cybergym、DeepSWE 等指标超过 Claude Opus 4.8、逼近 Fable 5。知乎

但第三方实测撕裂成两派。一派说第三方评测平台上 V4-Pro-0813 只比 V4-Flash 高1分,不少开发者把 V4 四个版本拉去跑真实任务,Flash 赢下近半;另一派如36氪连夜实测7项任务,结论是长周期工程任务扛得住、“性能逼近 Fable 5 确实没有信口开河”。小红书

社区对"分数对不上"给出三种猜测:部署出错实际跑的还是 Flash、部分节点灰度未全量、Pro 真实水平本就如此,三种都没有官方回应。但有一个更关键的背景:官方更新日志里写着,V4-Flash 正式版的分数是用 DeepSeek Harness 极简模式作为框架测出来的,你用 Claude Code 或裸 API 测,和官方测的不是同一套东西。36氪APPSO 的内测也印证了这一点:同一个 V4-Flash,换到 Harness、Reasonix、Codex 三个执行层里跑同一个 Three.js 滑沙游戏,交付质量肉眼可见地不同。

DeepSeek峰时输出价6元涨到27元,8月17日生效:Agent用户账单变贵前做对这4项省钱自查

这件事对选型的启示比拼分本身更值钱:任何一家的官方分数都别直接当选型依据,拿你自己的真实任务跑一遍,标准就两条——任务能不能完成,完成一次要花多少钱。

四、8月17日前后,四件能实际省钱的事

  1. 能错峰的任务全部挪到闲时。闲时价格是高峰的一半,批量处理、定时任务、日报生成这类不卡实时性的负载,排到18点以后或中午12–14点,成本直接砍半;在线服务没法错峰,就直接按高峰价重新估预算。

  2. 把缓存命中率当工程指标来管。系统提示词、工具定义这些前缀别频繁改动,会话尽量复用同一前缀结构。社区方案也在往这个方向卷,第三方适配框架 Pi 被报道做到 99.93% 的缓存命中率,GitHub 星标8万+。36氪缓存命中率每提升一点,都是在30倍价差里省钱。

  3. 重新掂量 Pro 和 Flash。涨价后 Flash 高峰输出 9 元,仍只有 Pro 高峰 27 元的三分之一,日常编程、办公自动化、批量文本处理大概率够用;确实需要 Pro 的,先小流量对比你手上 Flash 的结果,再决定值不值差价。

  4. 等 Harness 稳定再评"满血 Pro"。官方口径里"模型+Harness"才是完整体,DSH 目前还是开发者预览版,等正式版和插件生态稳了,再重新测一轮 Pro 的满血表现,现在急着切生产容易两头挨打。

五、真正的战场刚开始:从"谁的模型强"到"谁把事办完"

把这两天的新闻拼起来看,主线已经清楚:8月14日 DeepSeek 正式发布并开源首款 Agent 产品 DeepSeek Harness,官方公式是"模型+Harness=Agent"。微博它采用 MIT 协议、“一切皆插件"架构,发布后涨星速度惊人,被媒体称为 GitHub 史上最快涨星项目。知乎官方页面里,DSH 甚至直接贴出了一张与 Codex 的"直接对照表”:并行多智能体、文件沙箱、长任务后台执行、跨会话记忆、外部工具生态,执行层能力逐项对标。

DeepSeek峰时输出价6元涨到27元,8月17日生效:Agent用户账单变贵前做对这4项省钱自查

同期阿里开放 Qwen3.8-2.4T 权重、xAI 发布 Grok 4.6,加上 Anthropic 的 Skills、社区的 Pi,Agent 执行层的竞争才刚开始。竞争越激烈,用户比价空间越大——稀缺的不再是"更聪明的模型",而是把模型拼成能稳定交付的生产工具的那套工程能力。

接下来值得盯的信号:8月17日后第一周的实际账单,是检验峰谷策略成色的最好样本;V4-Pro 的部署争议会不会有官方解释、会不会重新高调发布;DSH 正式版与插件生态的节奏。

一句话收尾:DeepSeek 最大的标签"便宜"正在变贵,Agent 用户省钱的主战场已经从"选哪个模型"变成"什么时候调、缓存命中率多高"。这两个杠杆抓好了,涨价也能把账算平。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章