8月12日晚上11点多,多数人已经合上电脑的时候,DeepSeek搞了一次"零宣发"的重磅发布:官方API价格页上,deepseek-v4-pro对应的版本号悄悄从Preview换成了DeepSeek-V4-Pro-0813,定价一分没动,Flash和Pro两大版本全部就位。微博没有发布会,没有官方博文,最先发现变化的是社区里的API探针——有开发者在文档和公告更新之前,就发现模型指纹变了,Responses API上已经能正常调通。
更戏剧的是同一个夜晚:几个小时前,马斯克的Grok 4.6刚刚发布,直接对标其他前沿模型的一半价格;杭州另一头,阿里开放了迄今Qwen-Max系列最强的Qwen3.8-2.4T-A95B模型权重。知乎2026年下半年最重的三发子弹,在同一夜打出。这篇内容写给正在用DeepSeek、或者在几个模型API之间犹豫的人:正式版到底什么水平,"不涨价"为什么比跑分更值得看,不同用法的人现在该怎么动。
是正式版,但也是"半个发布"
先说清楚这次发布的性质:后端换了,官宣没跟上。更新日志页面的最新一条还停留在7月31日的V4-Flash更新,V4-Pro-0813的正式发布说明至今没补。知乎回想6月底官方曾预告7月中旬发布正式版,结果7月中旬过去又拖了一个多月,社区等来的是一次静默换后端。小红书截至深夜,正式版已经在API和官网Chat两端同时上线,支持原生Responses格式,可以直接导入Codex使用。微博
所以"正式版"目前的完整画像是:API和Web端可用、官方群流出评测表、全社区连夜实测,而官方完整基准报告尚未公布。模型名还是deepseek-v4-pro,无需更换端点,旧代码无感切换。小红书下面的所有讨论,都建立在这个前提上。

强了多少:与Opus 4.8、Kimi K3同梯队,不是独神
按官方群流出、后被多个社区账号复刻的评测表,V4 Pro 0813在一系列面向Agent的基准上已经贴着Fable 5,个别项甚至反超。社区整理的梯队很直观:第一梯队Fable 5;第二梯队Opus 4.8、Kimi K3、DeepSeek V4 Pro并列,综合分只差0.5分左右;第三梯队V4 Flash;第四梯队GLM-5.2。知乎

更有意思的是同梯队内的分工。有知乎回答概括得准:Opus 4.8强在"想得深",Kimi K3强在"做得久",DeepSeek强在"用工具把事情做出来"——不是裸推理突然天下第一,而是"工具+环境+推理结合把活干完"这条链路被彻底打通了。知乎Terminal-Bench 2.1它跑出87.9,超过Opus 4.8的85.0、逼近Kimi K3的88.3;DeepSWE、NL2Repo这类硬核编码集也大幅甩开预览版。
但也要泼两瓢冷水
跑分上头之前,先看社区实测。知乎和小红书连夜的声音比较一致:比预览版提升巨大,但和Kimi K3逐项掰手腕,部分长链Agent项仍有差距,位列当前国产模型第二。知乎
还有两个争议悬在社区头上。一是有用户发现正式版的思维链风格与网传内测不同、表现略逊,"是不是路由到了别的模型"的质疑也出现了,但目前仍是没有实锤的猜测。知乎二是官方那张表没有把同梯队对手全部放上桌,对比对象的选择本身也引发质疑。小红书这两件事,官方都还没正面回应。
比跑分更值得读的,是规格表
比起分数拉锯,规格表才是直接影响使用的部分:1M上下文、最大384K输出、思考模式可以用reasoning_effort调强度,还新增支持Responses API和Anthropic API。知乎前者意味着可以直接插进Codex,社区已经出现零代码接入教程;后者意味着原本挂Claude系API的用户几乎可以无感换模型。再加FIM补全、JSON Output,几乎是把开发者迁移最想要的东西逐项打钩。

价格不只是"没涨",它是这次发布的题眼
价格页没动:V4 Pro依旧是缓存命中输入0.025元、缓存未命中输入3元、输出6元每百万Token。作为对照,同夜发布的Grok 4.6定价为每百万输入Token 2美元、输出6美元,SpaceXAI直接将其定位为其他前沿模型的一半价格。知乎而Fable 5、Opus 4.8更是另一个价格带。

这个价格在真实世界里意味着什么?一位知乎重度用户全天挂机跑自动化任务,一天7亿Token、缓存命中率95-98%,账单只要30块钱——同样的工作量换别家国产模型API要贵上很多倍,还附带限流。知乎
但别忘了同一页面上的小字:DeepSeek明确写明"计划在不久的将来上调DeepSeek API服务的整体价格",而且"预计涨幅较大"。知乎把这两件事放在一起看,这次正式版的性质就清楚了——它是一次涨价前完成的模型切换,能力升级、价格未动的时间差,本身就是窗口期。
不同人现在该怎么动
正在用Pro预览版API跑生产任务的:可以切,但别盲切。模型名不变、后端无感切换,但正式版思维链有变化,切换前一定用自己的关键任务做回归测试,尤其是长链Agent和格式敏感的写作类任务。
用flash跑低成本场景的:不急。1元/2元的定价和2500并发仍是性价比之王,Pro正式版并发只有500。但Pro与flash的差距进一步拉大,之前不满意的任务值得重跑一遍。
官网和App的普通Chat用户:Web端也已切到正式版,直接用就行,自己感受工具调用和长文本表现的变化。
还在几个模型之间观望的:今晚的牌桌格外豪华——Grok 4.6半价对标前沿,Qwen3.8-2.4T-A95B开源了Qwen-Max系列最强权重。如果你的场景正好落在它们的长项上,值得跑同一组任务对比。
收尾前,留三个观察点
官方更新日志何时补上V4-Pro-0813的完整基准;涨价落地时涨多少、缓存命中价是否保留;以及官方如何回应"内测门"和"跑分选表"两个社区争议。这三个信号,比任何单个跑分都更值得用来做中期判断。
目前唯一确定的是:2026年下半年模型战争的发令枪,已经在深夜打响,而这一次,先开枪的人没有出声。