8月12日深夜,DeepSeek又搞了一次突袭:没有发布会,没有官方公告,API页面上deepseek-v4-pro对应的模型版本悄悄变成了DeepSeek-V4-Pro-0813。华尔街见闻你之前一直在调的那个模型名,一夜之间已经是新模型了。更巧的是,另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。新智元两款高性价比模型同一时间冲进了第一梯队。
先说结论:正式版确实强,但“跑分上的强”和“你手里的强”之间隔着一道坎,这道坎主要取决于你用什么工具接入。准备把V4 Pro换上来省钱的人,动手前先把这篇看完——里面有一个马上会踩的坑,和一个只有你自己账号能验证的事。

跑分表很华丽,先读仔细三处
先说跑分表的来历。现在流传的对比表来自DeepSeek官方群流出,经媒体和社区转述,而DeepSeek目前并没有同步发布V4-Pro-0813的官方更新日志。华尔街见闻所以所有分数都只能先当作非官方披露信息看待。
数字本身值得看(官方群流出对比表,第三方转述):
基准 | V4 Pro正式版 | 与第一梯队对比 |
|---|---|---|
TerminalBench 2.1(终端操作) | 87.9 | Fable 5的88.0只高0.1,Kimi K3的88.3才是最高 |
DeepSWE(真实软件工程) | 62.7 | Preview版只有12.8,约4.9倍提升 |
CyberGym(安全环境) | 83.3 | 略高于Fable 5的83.1,少数真正登顶项 |
HLE无工具(纯推理) | 42.7 | 明显低于Opus 4.8的49.8和Fable 5的53.3 |

三处要读仔细。第一,“逼近Fable 5”是特定Agent项目上的事,不是全面反超——Terminal Bench是第二,不是第一:87.9排在Kimi-K3(88.3)和Fable 5(88.0)后面,比Opus-4.8(85.0)高。知乎第二,它强在“用工具把事做成”:终端操作、环境交互、自动化链路是强项,纯推理和学术问答不是它的长板。第三,代码重活追上了但还没越过:DeepSWE从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。新智元距离Fable 5的70.0分仍差7.3分。
实测评价两极,但最大变量不是模型
发布当夜,B站就出现了两个结论完全相反的连夜测评:一个跑1小时长任务花了3块钱,效果惊人。哔哩哔哩另一个标题是有些失望?!连夜测评DS V4 Pro正式版!效果不尽如人意?!。哔哩哔哩知乎上也有回答称实测不及kimi k3、比V4 Pro Preview巨幅提升,而小红书上已经有很多人也测了,几乎全部评论都认为不如Kimi K3。知乎
是模型的问题吗?一个88赞的实测回答提供了关键线索:作者把同一批任务分别接入Claude Code和OpenCode两个harness跑——阿尔忒弥斯II号绕月飞行模拟动画,在Claude Code上直接任务失败,飞船、星体、轨迹全都没有;接入OpenCode,效果做得出来。3D塔防游戏的差距更明显:Claude Code上它直接“摆烂”,只生成一个简陋的单HTML;换OpenCode后,3D场景、金币系统、交互体验明显高一个档次。作者的结论很直接:总之,先别接入cc就对了。知乎
这与技术背景对得上:V4 Pro接入Claude Code走的是Anthropic兼容接口,本质是第三方兼容方案,其官方并不支持通过Gateway把Claude Code路由到非Claude模型。知乎而DeepSeek这次官方主推的方向是Responses API和Codex接入——官方发言中提到“新版本增强了Agent能力,支持Responses API 和 Codex 接入”。知乎也就是说:掀翻很多人连夜实测的,大概率不是模型变笨了,而是你接入工具的协议适配层。昨夜试了觉得效果差的,先别下“跑分造假”的结论,换OpenCode或Codex再跑一遍同样的任务。
两个成本坑,一个比一个隐蔽
第一个摆在明面上:价格窗口期。现在V4 Pro还维持Preview期的老价格:缓存命中输入0.025元/百万Tokens、缓存未命中输入3元、输出6元。官方价格页面写明计划在不久的将来上调DeepSeek API服务的整体价格,而且“预计涨幅较大”。华尔街见闻“能力升级、价格暂不变”更像涨价前的窗口期,而不是长期承诺,准备重度接入的,现在就把预算弹性算一遍。
第二个更隐蔽:账单可能不是为你选的模型付的。有用户发现明明选的是v4-flash,用量明细里却有一笔不小的v4-pro扣费,排查下来原因出在harness层:以Claude code为例如果子Agent路由到了v4-pro,那么在网络搜索还有模型被要求/有需要使用子Agent的时候会自动调用v4-pro。知乎去用户目录下的.claude/settings.json里检查模型映射,用转接工具的更要确认Opus、Fable档位是不是已经被映射成了v4-pro。
再提醒生产环境用户一句:这次模型名没变,意味着你的老API在不知不觉中已经切换到新模型;老的模型名deepseek-chat和deepseek-reasoner已经在7月24日停用,现在分别指向V4-Flash的非thinking和thinking模式。知乎有回归流程的,别忘了重跑一遍。
换不换:按人群给建议
Claude Code主力用户:别急着换主力模型。现在走CC接入的实测降智明显,要么用OpenCode或网关在副项目里试,要么等DeepSeek自己的Harness——8月2日启动内测、面向开源开发者招募,被媒体称作「V4 Pro正式版黄金搭档」,放开之后或许才是它用着顺手的开始。知乎
Codex用户:值得试。官方群信息已明确支持Responses API和Codex接入,跑1小时重活也就3块钱左右,试错成本极低。但注意此前官方Codex文档仍明确标注,目前只有deepseek-v4-flash正式支持Codex,V4-Pro的支持尚未完成。知乎建议先跑一个完整工具链任务验证闭环,别用一句对话下判断。
重度长任务用户(大代码库、多步自动化、长文档处理):1M上下文+384K输出就是为这类场景准备的,可以把你最长、最贵的那个任务先迁过去跑一天再看结果。
冲着“深度思考”来的:先缓一缓。纯推理、学术问答不是它的长板,这一点上Opus 4.8、Fable 5仍然更稳。

接下来几天值得盯的信号
官方更新日志会不会补上V4-Pro-0813的发布说明和官方跑分——这决定现在的跑分表能不能从“传闻”变“证据”
权重是否开源——Hugging Face上还是4月的preview权重,本地部署只能等。知乎
Harness正式版开放时间——直接决定Claude Code生态用户能不能用顺手
涨价的时间与幅度——影响成本账的最大变量
Codex官方文档是否更新V4 Pro的正式适配状态
最后一句:V4 Pro正式版的到来,确实把Agent赛道的门槛又往下砸了一截,“3块钱跑一小时重活”是对现有成本结构的真实冲击。但在“只有API、没有公告、没有权重”的当下,对所有跑分保留一点耐心是值得的。想换的,从低成本试跑开始,别一夜之间把生产环境的主力模型换掉。