DeepSeek V4 Pro正式版上线:跑分表说“逼近Fable 5”,接入Claude Code的人却说“严重降智”

源自12位全网作者

08:04

8月12日深夜,DeepSeek又搞了一次突袭:没有发布会,没有官方公告,API页面上deepseek-v4-pro对应的模型版本悄悄变成了DeepSeek-V4-Pro-0813。华尔街见闻你之前一直在调的那个模型名,一夜之间已经是新模型了。更巧的是,另一边,马斯克砸下了下一代旗舰Grok 4.6,主打一个成本低,性能强。新智元两款高性价比模型同一时间冲进了第一梯队。

先说结论:正式版确实强,但“跑分上的强”和“你手里的强”之间隔着一道坎,这道坎主要取决于你用什么工具接入。准备把V4 Pro换上来省钱的人,动手前先把这篇看完——里面有一个马上会踩的坑,和一个只有你自己账号能验证的事。

DeepSeek V4 Pro正式版上线:跑分表说“逼近Fable 5”,接入Claude Code的人却说“严重降智”

跑分表很华丽,先读仔细三处

先说跑分表的来历。现在流传的对比表来自DeepSeek官方群流出,经媒体和社区转述,而DeepSeek目前并没有同步发布V4-Pro-0813的官方更新日志。华尔街见闻所以所有分数都只能先当作非官方披露信息看待。

数字本身值得看(官方群流出对比表,第三方转述):

基准

V4 Pro正式版

与第一梯队对比

TerminalBench 2.1(终端操作)

87.9

Fable 5的88.0只高0.1,Kimi K3的88.3才是最高

DeepSWE(真实软件工程)

62.7

Preview版只有12.8,约4.9倍提升

CyberGym(安全环境)

83.3

略高于Fable 5的83.1,少数真正登顶项

HLE无工具(纯推理)

42.7

明显低于Opus 4.8的49.8和Fable 5的53.3

DeepSeek V4 Pro正式版上线:跑分表说“逼近Fable 5”,接入Claude Code的人却说“严重降智”

三处要读仔细。第一,“逼近Fable 5”是特定Agent项目上的事,不是全面反超——Terminal Bench是第二,不是第一:87.9排在Kimi-K3(88.3)和Fable 5(88.0)后面,比Opus-4.8(85.0)高。知乎第二,它强在“用工具把事做成”:终端操作、环境交互、自动化链路是强项,纯推理和学术问答不是它的长板。第三,代码重活追上了但还没越过:DeepSWE从预览版的12.8分暴涨到62.7分,接近原来的4.9倍。新智元距离Fable 5的70.0分仍差7.3分。

实测评价两极,但最大变量不是模型

发布当夜,B站就出现了两个结论完全相反的连夜测评:一个跑1小时长任务花了3块钱,效果惊人。哔哩哔哩另一个标题是有些失望?!连夜测评DS V4 Pro正式版!效果不尽如人意?!。哔哩哔哩知乎上也有回答称实测不及kimi k3、比V4 Pro Preview巨幅提升,而小红书上已经有很多人也测了,几乎全部评论都认为不如Kimi K3。知乎

是模型的问题吗?一个88赞的实测回答提供了关键线索:作者把同一批任务分别接入Claude Code和OpenCode两个harness跑——阿尔忒弥斯II号绕月飞行模拟动画,在Claude Code上直接任务失败,飞船、星体、轨迹全都没有;接入OpenCode,效果做得出来。3D塔防游戏的差距更明显:Claude Code上它直接“摆烂”,只生成一个简陋的单HTML;换OpenCode后,3D场景、金币系统、交互体验明显高一个档次。作者的结论很直接:总之,先别接入cc就对了。知乎

这与技术背景对得上:V4 Pro接入Claude Code走的是Anthropic兼容接口,本质是第三方兼容方案,其官方并不支持通过Gateway把Claude Code路由到非Claude模型。知乎而DeepSeek这次官方主推的方向是Responses API和Codex接入——官方发言中提到“新版本增强了Agent能力,支持Responses API 和 Codex 接入”。知乎也就是说:掀翻很多人连夜实测的,大概率不是模型变笨了,而是你接入工具的协议适配层。昨夜试了觉得效果差的,先别下“跑分造假”的结论,换OpenCode或Codex再跑一遍同样的任务。

两个成本坑,一个比一个隐蔽

第一个摆在明面上:价格窗口期。现在V4 Pro还维持Preview期的老价格:缓存命中输入0.025元/百万Tokens、缓存未命中输入3元、输出6元。官方价格页面写明计划在不久的将来上调DeepSeek API服务的整体价格,而且“预计涨幅较大”。华尔街见闻“能力升级、价格暂不变”更像涨价前的窗口期,而不是长期承诺,准备重度接入的,现在就把预算弹性算一遍。

第二个更隐蔽:账单可能不是为你选的模型付的。有用户发现明明选的是v4-flash,用量明细里却有一笔不小的v4-pro扣费,排查下来原因出在harness层:以Claude code为例如果子Agent路由到了v4-pro,那么在网络搜索还有模型被要求/有需要使用子Agent的时候会自动调用v4-pro。知乎去用户目录下的.claude/settings.json里检查模型映射,用转接工具的更要确认Opus、Fable档位是不是已经被映射成了v4-pro。

再提醒生产环境用户一句:这次模型名没变,意味着你的老API在不知不觉中已经切换到新模型;老的模型名deepseek-chat和deepseek-reasoner已经在7月24日停用,现在分别指向V4-Flash的非thinking和thinking模式。知乎有回归流程的,别忘了重跑一遍。

换不换:按人群给建议

  • Claude Code主力用户:别急着换主力模型。现在走CC接入的实测降智明显,要么用OpenCode或网关在副项目里试,要么等DeepSeek自己的Harness——8月2日启动内测、面向开源开发者招募,被媒体称作「V4 Pro正式版黄金搭档」,放开之后或许才是它用着顺手的开始。知乎

  • Codex用户:值得试。官方群信息已明确支持Responses API和Codex接入,跑1小时重活也就3块钱左右,试错成本极低。但注意此前官方Codex文档仍明确标注,目前只有deepseek-v4-flash正式支持Codex,V4-Pro的支持尚未完成。知乎建议先跑一个完整工具链任务验证闭环,别用一句对话下判断。

  • 重度长任务用户(大代码库、多步自动化、长文档处理):1M上下文+384K输出就是为这类场景准备的,可以把你最长、最贵的那个任务先迁过去跑一天再看结果。

  • 冲着“深度思考”来的:先缓一缓。纯推理、学术问答不是它的长板,这一点上Opus 4.8、Fable 5仍然更稳。

DeepSeek V4 Pro正式版上线:跑分表说“逼近Fable 5”,接入Claude Code的人却说“严重降智”

接下来几天值得盯的信号

  1. 官方更新日志会不会补上V4-Pro-0813的发布说明和官方跑分——这决定现在的跑分表能不能从“传闻”变“证据”

  2. 权重是否开源——Hugging Face上还是4月的preview权重,本地部署只能等。知乎

  3. Harness正式版开放时间——直接决定Claude Code生态用户能不能用顺手

  4. 涨价的时间与幅度——影响成本账的最大变量

  5. Codex官方文档是否更新V4 Pro的正式适配状态

最后一句:V4 Pro正式版的到来,确实把Agent赛道的门槛又往下砸了一截,“3块钱跑一小时重活”是对现有成本结构的真实冲击。但在“只有API、没有公告、没有权重”的当下,对所有跑分保留一点耐心是值得的。想换的,从低成本试跑开始,别一夜之间把生产环境的主力模型换掉。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章