昨晚的 AI 圈,几乎是同一时间发生了两件事。
第一件大家都知道了:DeepSeek V4 Pro 正式版上线(版本号 0813),Agent 跑分全面暴涨,价格却维持不变。这事今天已经有很多人解读,我不再展开。凌晨 DeepSeek 发布了 DeepSeekV4Pro0813 正式版,支持了 ResponsesAPI 与 AnthropicAPI。微博
第二件,对每天用 AI 编程工具的人来说,其实更值得关注:DeepSeek Harness 团队悄悄注册了公众号,头像是一只黑鲸,#DeepSeekHarness火了# 一度冲上热搜。不知道 Harness 是什么的,记住一句话就行:这是 DeepSeek 自己的「Claude Code」。
Model + Harness = Agent,DeepSeek 终于补上最后一块
DeepSeek 的招聘 JD 写得很直白:他们正在把前沿模型能力转化为领先的 Agent 产品,除模型本身以外的所有工作都属于 Harness 范畴,招的正是桌面端 Agent 产品。微博 翻译一下:模型是发动机,Harness 是整车。以前 DeepSeek 只卖发动机(开源权重 + API),你开车写代码用的 Claude Code、Cline、opencode,都是别人造的车。现在 DeepSeek 要自己造车了。
这两周的时间线非常密集:8 月初,DeepSeek Harness 开启内部测试。微博 8 月中旬,内测用户的截图开始流传,科技博主蚁工厂晒出三张图,配文只有一句「不知真不真」,评论区 49 条全在猜发布时间。8 月 12 日前后,Harness 团队公众号完成注册,券商中国记者核实,头像为「黑色鲸鱼」,与 DeepSeek 官微的色调并不相同。微博 8 月 13 日凌晨,V4 Pro 正式版上线,也就是开头那件事。
为什么挑这个时间把 V4 Pro 转正?看评测表就明白了:DeepSWE(软件工程基准)从预览版的 12.8 分飙到 62.7 分,Terminal Bench 87.9 分,Cybergym 83.3 分,清一色是长链路代码修改、环境操作类测试,恰好是预览版最容易翻车的地方。知乎 正式版还首次原生支持图像理解,这轮后训练指向同一个目标:把模型变成一个能干的「执行者」。而支持 Anthropic API,意味着现有 Claude Code、Cline 用户可以零门槛把后端模型换成 DeepSeek。模型层就绪,脚手架在内测,这条链路的节奏很清楚。

社区到底在吵什么
看了两天讨论,主要分三派。
对比派。李楠说得直接:按 V4 Flash 相对 V4 预览版的提升节奏推,V4 Pro + Harness 有机会无限接近甚至超过 Kimi K3 + Kimi Work,而且更便宜。微博 这句话正好踩在当前最热的话题上:Kimi K3 和 GLM-5.2 相继刷过屏之后,国产 Agent 组合谁更强,正是社区吵得最凶的问题。
生意派。梁斌penny 的判断很有意思:Harness 是门非常肥厚的生意,大模型公司肯定自己做,模型缺了脚手架根本跑不出结果,可靠性、安全性要求又极高,注定不会外包。微博 他还给期待「完全免费」的人提了个醒:这种东西肯定要付费,跑起来要消耗资源,和开源权重是两回事。
体验派。证券时报的消息称,不少参与内测的网友体验两天后评价「实力强劲」。微博 有内测用户甚至在社交平台直接喊出「宇宙最强」「吊打」。但注意:目前流出的只是极少数内测者的体验,没有官方公告、没有产品页、没有定价,连晒泄露截图的人都配了一句「不知真不真」。

泼三盆冷水,再上头
第一,评测表是官方自报的。Terminal Bench 87.9 分,有人解读成「反超 Fable 5」,也有人说「还差 0.1 分」,差别只在评测表的口径。知乎 DeepSWE 更是 DeepSeek 自家的基准。另一边,有人翻出 Artificial Analysis 的第三方数据,得出的结论相反:不及预期,甚至不如一些免费模型。知乎 不是说数字造假,而是这种数字,先看,再等第三方复测。
第二,实测也不一边倒。有 B 站 UP 主接入 Claude Code 测试,称效果「很拉垮」,后来发现是调用错了版本。实测和误会掺在一起,恰恰说明现在还不到下结论的时候。
第三,别忘了悬在头顶的涨价之剑。虽然 8 月 6 日 DeepSeek 已经预告「计划近期整体上调 API 定价,预计涨幅较大」,但目前 0813 版本还没动。知乎 现在 V4 Pro 还是每百万 tokens 输入 3 元、输出 6 元,缓存命中低至 0.025 元;有 B 站 UP 主实测,1 小时长任务成本 3 块钱左右。哔哩哔哩 窗口期能撑多久不好说,这也给 Harness 的未来定价多加了一个变量:模型涨价,会不会传导到 Agent 产品上?

谁该等,谁不该等
靠 Claude Code 和同类工具吃饭的人:现在不用切换,但值得留个位置。V4 Pro 的性价比在 API 层已经成立,价格是海外头部闭源模型的几十分之一,又支持 Anthropic API,完全可以先接上自己的真实任务,验证跑分数字,再决定 Harness 出来之后要不要搬家。
已经在用 Kimi Work 这类国产 Agent 的用户:重点看公测后的对比。「接近或超越、还更便宜」目前还是推断,黑鲸和竞品到底怎么排,要等正式版见真章。
只想找个便宜入口玩 AI 的人:先围观公测,别急着付费。Harness 目前所有信息都是发布前状态,任何「内部渠道」「保内测资格」的收费,一分钱都不要付、不要预订。
最后留一个观察信号清单,这几条里任何一条有动静,都值得回来重新解读:
公测时间和申请方式,盯紧黑鲸公众号;
定价模式:订阅、按量,还是部分免费;
Harness 本身是否开源;
第三方独立评测与真实编程任务对比;
API 涨价何时落地,和闭源旗舰的价差会不会被压缩。
有消息,跟进。