这周如果你在用 API 跑 Agent、做 AI 应用,大概率被 DeepSeek 涨价的消息刷屏了。但多数人把同一周发生的两件事,当成了两条互不相关的新闻。
8月13日,DeepSeek 发布调价公告:8月17日0时起,API 全面采用峰谷定价,高峰时段(工作日9:00-12:00、14:00-18:00)价格是空闲时段的两倍,V4-Pro 高峰输出价从原来的 6 元/百万 tokens 提到最高 27 元——达到原价的 4.5 倍。知乎
同一天晚上,DeepSeek 还开源了另一个东西:自研 Agent 执行框架 DeepSeek Harness(简称 DSH),MIT 协议,口号是「一切皆插件」。GitHub
一个涨价,一个免费开源,看起来一坏一好。但把两件事拼在一起,其实是同一件事:行业在给模型层「提价」的同时,把执行层「送」了出来。DeepSeek 官网首页挂着的那句公式,把意图写得很明白——「模型 + Harness = Agent」。
先把背景说清楚,这不是 DeepSeek 一家的动作。把今年以来的调价排一排:智谱年内三次上调 API 价格,一季度定价较 2025 年底累计上涨约 83%;腾讯云混元部分接口最高涨幅超 460%;阿里云、百度智能云也同步上调了 AI 算力产品价格。什么值得买社区月之暗面 7 月发布的 Kimi K3 参数量拉到 2.8 万亿,输入 20 元/百万 tokens,输出 100 元/百万 tokens。知乎
海外同样在涨,据行业统计,GPT-5.5 输入输出价格约 5 美元/30 美元每百万 tokens,Claude Opus 4.7 约 5 美元/25 美元。但也不是全行业一刀切:OpenAI 7 月 30 日把 GPT-5.6 的 Luna 档降价约八成,Anthropic 也取消了原计划对 Sonnet 5 的 50% 涨价。知乎分化本身就是信号——涨的和降的,押的不是同一个东西。
为什么集体涨?因为低价补贴真的撑不住了。据国家数据局 3 月披露,国内日均 Token 调用量已突破 140 万亿,较 2024 年初增长超千倍。什么值得买社区把调用量顶上去的主力是 Agent:一个复杂任务要多轮思考、反复调工具、循环纠错,token 消耗比普通对话高一到两个数量级。海外平台 OpenCode 的数据里,8 月 1 日单日,DeepSeek V4-Flash 一个模型就在其平台处理了 8 万亿 tokens。今日头条与此同时,全球高端 GPU、HBM 供给持续紧张,上游四大云巨头 2026 年资本开支合计约 7250 亿美元,同比涨了近八成。调用量越大亏得越多,补贴模式走到了头。

所以「便宜 Token 的时代结束了」这件事不用争论,值得争论的是涨价之后的规则变化。这周的信号拼起来看,改写的是两样东西:跑分和账单。
跑分被改写了:你测的不再是模型,是「模型 × 执行层」
和涨价几乎同时,V4-Pro 新版本引发了一场社区争议。官方口径里,它的 Agent 能力全面越级,多项基准超过 Claude Opus 4.8;但第三方实测迅速撕裂成两派:有开发者把 V4 的几个版本拉去跑真实任务,发现差距远没有跑分那么大。社区给出了好几种猜测,部署灰度未全量、评测环境差异等等,官方没有回应。
接下来两天,社区又挖出了两个更说明问题的样本。一个叫 J-Space Cognition Suite 的开源评测工具,作者宣称只加一个 Skill,就把 V4 Pro 的 TerminalBench 成绩从 87.9 提到 90.1、超过 Fable 5;但 8 月 18-19 日社区复测,实际只有 77.5%,和宣称的 87.1% 相去甚远。36氪作者随后删掉了相关 issue。
另一个是社区的开放评测项目:同一个 V4 Pro,标准模式跑 91 分、PTC 模式 92 分、极简模式 99 和 96 分——只换执行框架的运行模式,分差就有 8 分。36氪

但比「谁对谁错」更关键的,是一个藏在官方更新日志里的细节:V4-Flash 正式版的基准分数,是用 DeepSeek Harness 的极简模式作为执行框架测出来的。什么值得买社区
这意味着什么?你拿 Claude Code、Codex 或者裸 API 去测同一个模型,和官方测的根本不是同一套系统。执行层怎么管理上下文、怎么注入工具、怎么组织多轮循环,会直接改变模型的表现。过去我们默认「跑分是模型的属性」,现在这条假设失效了——跑分正在变成「模型 × 执行层」组合的属性。
对工程选型,这是一个很实际的提醒:任何一家的官方分数都别直接当依据。拿你自己的真实任务跑一遍,标准就两条——任务能不能完成,完成一次花多少钱。
账单被改写了:价差藏在工程里
再看钱。这次新价目表(8月17日起,元/百万 tokens)值得每个跑 Agent 的人存下来:
V4-Pro:缓存命中输入 0.15(闲时)/0.30(高峰),缓存未命中输入 4.5/9,输出 13.5/27。
V4-Flash:缓存命中输入 0.05/0.10,缓存未命中输入 1.5/3,输出 4.5/9。

表面上看,全项普涨。但真正拉开差距的不是峰谷差,而是缓存命中与否的价差:命中和未命中之间,相差 30 倍。知乎
拿一个典型 Coding Agent 任务算笔账(每轮 10 万输入 tokens、其中 90% 缓存命中,1 万输出 tokens,用 V4-Pro):
按旧价,单任务成本约 0.09 元;新价闲时约 0.19 元;新价高峰约 0.39 元;如果高峰时段缓存命中率再掉到 50%,约 0.74 元——同一模型、同一任务,成本差了 8 倍。
也就是说,涨价之后,「会不会做工程」直接变成了账单上的倍数。缓存命中率不再是个性能指标,它是个成本指标。社区已经在往这个方向卷:第三方适配框架 Pi 做到了 99.93% 的缓存命中率,GitHub 星标超过 8 万。什么值得买社区反过来,那些系统提示词频繁变动、上下文结构每轮乱改的调用方式,在新价格下等于按 30 倍的惩罚价付费。社区里已经有反面教材:有开发者的脚本在高峰时段陷入报错重试循环,短短两个小时愣是调了上万次。知乎token 一路空转,一晚账单飙掉半个月饭钱——旧价格下这种事故无伤大雅,新价格下每次重试都在吃「高峰 × 未命中」的双重加价。
顺带说一个容易被忽略的细节:旧价时代,Pro 的缓存命中价差高达 120 倍(0.025 vs 3),这次涨价把比值压缩到了 30 倍——缓存优化的相对杠杆变小了,但因为基数整体抬高,每次命中省下的绝对金额反而更大。缓存这件事,现在怎么做都不亏。
DSH 到底是什么:把执行层变成「可组装件」
理解了前面两条,再看 DSH 就顺了。它不是「DeepSeek 版 Claude Code」这么简单,官方给它的定位是:模型和执行环境之间的连接层。文件系统、终端、网页、代码工具、子 Agent,都通过它接入;上下文管理、工具调用、任务执行,都归它组织。
架构答案就一句:Everything is a plugin。模型、工具、技能、沙箱、存储、调度、甚至 Agent Loop 本身和 UI,全是可替换的插件,底层内核(基于开源框架 Cordis)只管插件的加载和依赖。想换模型?改配置。想换工具链?改配置。

对做工程的人,有两个设计值得多看两眼:
一是四种运行模式。标准模式是完整的编码 Agent 环境;PTC 模式让模型直接写一段 TypeScript 程序把多步操作串起来执行,比一次次单调工具更可控;极简模式只保留一个持久化 bash 和一个文件编辑工具——专门给模型评测用的最小环境;创造模式给想自己造轮子的人。注意那个极简模式:官方跑分就是用它测的,现在它开源了,你也能用同一套环境复测。
二是可观测性。Agent 最让人头疼的是「它到底干了啥」,DSH 用仅追加的会话日志记录模型看到的一切,配合轨迹视图支持恢复、分叉、回放、逐条审查——把 Agent 调试拉到了普通程序的水平。
当然要把丑话说在前面:这是 v0.1 开发者预览版,官方明说后续迭代可能有破坏兼容性的修改。GitHub插件生态倒是不缺热度——GitHub 的 dsh-plugin topic 下已聚起数千个仓库(截至发稿约 7900 个),但多数还在试水,能直接上生产的屈指可数。现在把 DSH 推上生产,大概率两头挨打。
不同人,现在该做什么
如果你在用 Claude Code、Codex 这类工具干活:不必急着迁移。先把 DSH 当评测沙盒用——极简模式 + 你自己的任务集,跑一轮对比,看你手上模型在不同执行层下的真实差距。选型标准前面说了:任务完成率 + 单任务成本,别信任何一家的官方跑分。
如果你在做 Agent 应用开发:这周必须做的是重算成本模型,三个变量相乘——峰谷时段 × 缓存命中率 × 模型档位。几个立刻能做的动作:把系统提示词和工具定义固定在 prompt 前部、别频繁改动,把缓存命中率当监控指标管起来;批量任务、定时任务全部挪到闲时(18 点后或 12-14 点),成本直接砍半;按任务难度做模型路由,简单任务走 Flash,复杂推理再上 Pro——涨价后 Flash 高峰输出 9 元,仍只有 Pro 的三分之一。
如果你在带团队、看技术方向:DSH 值得安排一个人在沙盒里跟进,重点看两件事——插件生态能不能长起来,MIT 协议下能不能沉淀成自己的可组装执行层。同时留意同期的大背景:Kimi K3 的权重 7 月底已经开放,据行业报道阿里 Qwen3.8 的权重同期开放、xAI 也发了 Grok 4.6——模型层在涨价,权重层在开源,「买推理」和「自建推理」之间的账,下半年值得重新算一遍。
接下来值得盯的三个信号
第一,8月17日新价生效后的第一周账单。这是检验峰谷策略和缓存优化成色的最好样本,社区里一定会晒出一批真实数据。
第二,V4-Pro 跑分争议有没有官方解释。如果确认是执行层差异导致的,等于官方承认「跑分绑定 Harness」,那「执行层进入评测标准」这件事就算坐实了。
第三,DSH 正式版和插件生态的速度。GitHub 发布当天星标 2.6 万以上,截至 8 月 19 日已冲到 16.5 万(GitHub 当日实时数据);插件 topic 下数千个仓库也在疯长——热度不缺,缺的是能上生产的生态。
社区里流传一种说法,AI 工程化经历了三个阶段:Prompt Engineering 教你怎么跟模型说话,Context Engineering 教你怎么给模型搭世界观,2026 年的主题是 Harness Engineering——设计 Agent 的「操作系统」。这周的涨价和开源,大概是这句话最直白的一次注脚:模型会越来越贵,但把模型变成生产力的那层工程,正在变得开放、可组装、可竞争。
对做 AI 工程化的人来说,这不是坏消息。贵的是别人定的价,省下来的每一分钱,都是你自己的工程能力。