DeepSeek 八月中旬干的两件事,单看都不大,放在一起方向就很明确了。
第一件:8 月 13 日,DeepSeek V4 Pro 正式版(DeepSeek-V4-Pro-0813)低调上线,V4 全系转入正式版。百家号第二件:8 月 11 日,"DeepSeek Harness 团队"公众号完成注册。值得买社区这个团队 5 月就在内部组建,目标说得非常直白——对标 Anthropic 的 Claude Code,做 DeepSeek 自己的 Code Harness。今日头条
一个是能力已经交付,一个是产品方向亮牌,瞄准的都是同一块地盘:AI 编程。如果你正在用 Claude Code、Codex 这类工具,或者想把大模型接进自己的工作流又嫌订阅贵,V4 Pro 0813 值得认真看一眼。但在讨论"平替"之前,先把跑分和账算清楚。
V4 Pro 0813 的成绩单:跑分只差 0.1
官方基准里有个数字确实扎眼:终端 Agent 测试 Terminal Bench 上,V4 Pro 正式版拿到 87.9 分,Anthropic 旗舰 Fable 5 是 88.0 分,只差 0.1。今日头条在 CyberGym(AI 安全智能体评测)和 AutomationBench(高难度智能体评测)上,V4 Pro 甚至反超 Fable 5。值得买社区

两个提醒:这是 DeepSeek 官方自测口径,第三方复测还没大规模跟上;另外官方口径之外,V4 Pro 在 4 月预览期就已是 DeepSeek 内部员工在用的 Agentic Coding 模型,当时内部评测反馈是"体验优于 Sonnet 4.5,交付质量接近 Opus 4.6 非思考模式,但和思考模式仍有差距"。百家号
工程层面的信息比赛跑分更实在:1M 上下文、最大输出 384K,支持工具调用、Responses API、Anthropic 兼容接口,还有对话前缀续写和 FIM 代码补全(均为 Beta,FIM 仅非思考模式)。今日头条API 同时给了 OpenAI 和 Anthropic 两个 base_url,还明确支持 Codex 接入——也就是说,走 Anthropic 协议的编程工具理论上可以直接指向 DeepSeek。百家号

算账:编程场景下 1/27 的价格差
AI 编程是典型的高输出、高复用负载:Agent 跑代码每轮要喂大量上下文,输出量大,token 消耗远高于日常聊天,所以价格差在这里会被放大。
V4 Pro 正式版现价(元/百万 tokens):闲时(含周末全天)输入缓存命中 0.15、未命中 4.5、输出 13.5;工作日高峰(9:00-12:00、14:00-18:00)分别为 0.3、9、27。今日头条

对比一下:社区口径 Claude Fable 5 输出约 50 美元/百万 tokens,按汇率约 360 元,DeepSeek 闲时输出价约为它的 1/27,高峰也约 1/13。知乎和国内同行比,GLM-5.2 输出 28 元/百万、MiniMax M3 输出 16.8 元——V4 Pro 闲时 13.5 元有优势,但如果你的编程活儿全在工作日白天高峰跑,27 元的高峰价和 GLM-5.2 已经基本拉平。百家号
这轮涨价里涨幅最狠的其实是缓存命中价:Pro 从 0.025 元涨到高峰 0.3 元,涨了 12 倍。值得买社区好在是从"几乎不要钱"涨到"依然便宜"——对输入九成以上命中缓存的编程 Agent 来说,这部分成本仍可忽略;真正肉疼的是不做任何缓存复用、全部未命中的用法。
顺带一提:API 涨价不影响 DeepSeek App 和网页版,免费聊天照旧。今日头条另外两款模型默认开思考模式,思考 token 计费,简单任务关掉思考模式能省一笔。
三个坑,接之前先看
第一,跑分口径。官方自测不等于实测体验,社区对新模型"跑分通胀"的质疑一直存在。编程任务尤其如此:你的项目结构、你的测试用例,才是唯一可靠的评测集。
第二,算力。Pro 版每账号并发上限 500。微信而 DeepSeek 今年算力一直偏紧——8 月初 V4-Flash 登顶 OpenRouter 全球调用榜后,4 日就因"前所未有的访问量"出现容量不足。值得买社区编程 Agent 是连续多轮调用,高峰期如果排队,打断的不只是体验,是跑到一半的任务。
第三,接口兼容不等于体验对等。Anthropic 兼容端点解决的是"能接上",不保证"一样好用":工具调用行为、输出风格、思考模式的额外消耗,都需要实测。
真要接,建议这样灰度
别一把梭。先把 base_url 换成 DeepSeek 的 Anthropic 端点,挑非关键链路(修 bug、小功能开发)跑真实任务,和原来的模型对比完成率、重试次数、总 token;批处理、重构类任务挪到闲时(18 点后、周末全天),白天高峰只留交互任务;再给账单设个告警——Agent 任务一个死循环就能让 token 消耗一夜暴涨,涨价之后账单弹性比以前大得多。

纯个人开发者、用量不大的话,Flash 闲时(输出 4.5 元/百万)多数场景够用,把 Pro 留给复杂推理和长上下文任务更划算。值得买社区
接下来值得盯三件事
一是 DeepSeek 自己的编程 Harness 产品长什么样——目前只有团队和招聘,产品时间表未公布。值得买社区二是官方承诺过"下半年昇腾 950 超节点批量上市后 Pro 价格有望大幅下调",这个承诺兑不兑现,决定这笔账的上限。今日头条三是第三方对 V4 Pro 0813 的复测,87.9 分到底站不站得住。
最后一句:DeepSeek 还不是"中国的 Claude",但 V4 Pro 0813 至少让它第一次有资格在 AI 编程这张桌子上和 Claude 对坐——入场价是对方的 1/27。值不值得换,别听跑分的,听你自己任务 A/B 的。