DeepSeek V4 Pro正式版深夜悄悄更新:跑分逼近Fable 5,但换上手前先弄明白这三笔账

源自11位全网作者

04:39

8月12日深夜:版本号悄悄换了,公告还没有

8月12日深夜,没有发布会,也没有更新日志,DeepSeek API 的“模型&价格”页面悄悄把 deepseek-v4-pro 指向的后端从预览版换成了 DeepSeek-V4-Pro-0813。知乎最先醒来的是开发者群,随后一张评测对比表开始流传:正式版 vs Preview vs Flash vs GLM-5.2 vs Kimi-K3 vs Opus-4.8 vs Fable 5。

那一晚热闹的不止这一个。接下来几天排队走来的还有 Grok 4.6、Gemini 3.5 Pro。微博其中 Grok 4.6 的 API 定价为每百万输入 Token 2 美元、输出 6 美元,直接定位为其他前沿模型的一半价格。知乎杭州那头,阿里 Qwen 团队正式开放性能最强的 Qwen3.8-2.4T-A95B 模型权重。知乎但对拿 AI 应用干活的人来说,今晚最要紧的,还是 DeepSeek 这次突袭。

这次升级的是什么:Agent 维度从“勉强可用”到“无短板”

官方群流出的评测表相当凶狠。在以 Agent 能力为主的评测集上,V4-Pro 正式版没有任何一项掉出第一梯队。知乎DeepSWE(软件工程)从预览版的 12.8 跳到正式版的 62.7,DSBench-Hard 从 31.1 到 67.2,Cybergym 甚至以 83.3 对 83.1 微超 Fable 5。这些测试全是终端操作、工具调用、代码仓库生成这类“真实干活”题,没有一道传统选择题。

但这不是横扫。Terminal Bench 输给 Kimi-K3 0.4 分,DeepSWE 输给 Fable 5 7.3 分,差距已经小到“按场景选”的级别。知乎更要提醒一句:这张表目前只在官方群和社区流传,更新日志页面还没有 0813 的发布说明,严格来说现阶段更接近“正式版已通过 API 上线”,而不是一场完整的官方发布。知乎跑分当参考,实测当准绳。

规格倒是干脆:1M 输入 + 384K 输出,JSON Output、Tool Calls、Responses API 全支持,还主动兼容 Anthropic API 格式——Claude Code、Codex 用户换模型不用重写一行代码。知乎

DeepSeek V4 Pro正式版深夜悄悄更新:跑分逼近Fable 5,但换上手前先弄明白这三笔账

成本账:标价不贵,贵不贵全看缓存

这次正式版上线,价格暂时没涨:Pro 缓存未命中输入 3 元/百万 tokens、缓存命中 0.025 元、输出 6 元,并发 500;Flash 是 1 元/2 元,并发 2500。注意 FIM 补全只在非思考模式开放,长输出任务记得显式给 max_tokens。

真实账单长什么样?一位小红书用户把 V4 Flash 接进 Codex 跑科研任务,5000 万 tokens、缓存命中率约 98%,账单 2.41 元。小红书

DeepSeek V4 Pro正式版深夜悄悄更新:跑分逼近Fable 5,但换上手前先弄明白这三笔账

同一位用户的后续战报是 6500 万 tokens、命中率 97.08%,“虽然不如 sota 但是便宜的多”;B站 UP 主跑的是 V4 Pro:用 Claude CLI 一口气开发 1 小时的长任务,成本 3 块钱。哔哩哔哩所有便宜的前提都是缓存:不复用长 prefix,走的就是 3 元/百万的未命中输入,那才会疼。结论很简单——高频批量走 Flash,长任务、硬骨头、长输出上 Pro。

深夜三个疑点:路由、回滚,还是灰度?

从深夜到今天,好几个独立实测踩了同一个坑。一位用 Claude 调 deepseek API 测评的 B站 UP 主反馈能力“非常非常拉垮”,怀疑正式版还没真正上线;做考研数学一实测的 UP 主则发现“测试后貌似模型撤回了”,重测的才是初版 GA。哔哩哔哩

知乎上有人直接问:0813 表现不如网传内测,“是真的路由到 fable 了吗”。知乎B站评论区说得更直白:“现在 dsv4pro 的 api 是虚的……肯定不是接的原来的 pro”。哔哩哔哩比较合理的解释是灰度放量、各端不同步;也有人怀疑 DeepSeek 在等自家的 Agent Harness 一起端上来,态度是“需要等待 harness 上线后再试试”。知乎样本都不大,但多源独立踩同一个坑,就值得当成换模型前的必查项,而不是噪音。

谁今天该换,谁再等等

价格还没涨,但预告已经挂上:价格页写明“计划在不久的将来上调 DeepSeek API 服务的整体价格”,且预计涨幅较大——现在这个“能力升级、价格不变”的状态,很可能是窗口期定价。知乎

  • 接 Claude Code、Codex、OpenCode 的 Agent 重度用户:今天就能换,但先跑一遍自己做过的任务对照效果,并核对账单里的版本号与缓存命中率。

  • Kimi K3 Coding Plan、各类月包订阅用户:先算账再动。评论区有人算过,“真算下来不如 k3 的 coding plan 和中转站的次顶模”。小红书同一份需求没必要付两次钱。

  • 轻聊天、批量任务用户:继续 Flash,5000 万 tokens 两块四的真实账单摆在那,够用。

DeepSeek V4 Pro正式版深夜悄悄更新:跑分逼近Fable 5,但换上手前先弄明白这三笔账

  • 长期重度使用的团队:涨价预告挂着,趁窗口期把缓存策略和迁移评估做完。

模型已经端上桌,但真正的大招可能还没出——DeepSeek 的 Harness 还没露面。接下来几天盯两个信号就够:更新日志页补不补 0813 的正式说明,Harness 什么时候上线。等这两个落地,才是这次 V4 Pro 正式版真正的开考时刻。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章