从“梁圣”到“梁子”只用一天:DeepSeek V4 Pro这24小时反转,多少能信、适合谁

源自4位全网作者

09:00

过去24小时,DeepSeek上了两次热搜。如果你不是一直蹲在评论区吃瓜,现在大概率是懵的:一边是"跑分逼近Fable 5,梁圣载入史册",一边是"只比自家Flash强1分,降级为梁子"。同一个模型,口碑完全相反,到底发生了什么?

我把微博、知乎、B站的实测、官方群流出的评测表、第三方评测平台的数据都翻了一遍,交叉核对后给你捋清楚这笔账。先说结论:跑分表只有一半是真的,反转也有实锤,涨价倒是千真万确。

这24小时到底发生了什么

先把时间线捋直(多方信源交叉核对):

8月12日深夜,DeepSeek在API文档的"模型&价格"页面,把模型版本从V4-Pro-Preview悄悄换成了V4-Pro-0813。电子大猫没有发布会、没有博客长文、没有倒计时。同一晚,马斯克的Grok 4.6、阿里的Qwen3.8 Max也扎堆发布,媒体直接称之为"梁文锋对垒马斯克"。

8月13日凌晨,一份来自官方群的评测对比表开始流传,数据确实炸裂:Terminal Bench 2.1打了87.9分,距离Fable 5只差0.1分;DeepSWE从预览版的12.8冲到62.7,接近4.9倍跃升。光子星球社区瞬间沸腾,Hacker News都在热议。

8月13日白天,第一批上手实测的开发者发现不对劲。B站出现两个结论完全相反的连夜测评;知乎、小红书的实测帖大多判定"不如Kimi K3";第三方评测平台ArtificialAnalysis给V4 Pro的综合评分只有53分,只比自家V4-Flash-0731高1分。电子大猫

8月13日下午,网友发现官网的0813发布通知和开放平台公告被撤回,距离静默上线还不到24小时。电子大猫

8月13日晚间,官方公众号正式官宣V4系列正式版发布,同晚还扔了两个炸弹:API大幅涨价,8月17日生效;智能体框架Harness v0.1开发者预览版开源(MIT协议)。知乎

从“梁圣”到“梁子”只用一天:DeepSeek V4 Pro这24小时反转,多少能信、适合谁

跑分表"一半真"在哪

这是整件事的关键。流传的评测表其实有两个版本:传播最广的是简版,只列了Claude Opus 4.8和Fable 5两列,一眼看去"多项逼近Fable 5"。但完整版里其实还有Kimi-K3和GLM-5.2两列,逐行对比会发现:十项里Kimi K3领先六项。电子大猫有小红书热帖直接吐槽这是"田忌赛马"(该帖目前已删除)。

从“梁圣”到“梁子”只用一天:DeepSeek V4 Pro这24小时反转,多少能信、适合谁

第三方的口径更直接:ArtificialAnalysis综合评分V4 Pro得53分,V4-Flash-0731是52分。要知道Pro是1.6万亿参数,Flash只有2840亿,体量差四倍多,只换来1分差距,这就很尴尬了。

不过公道地说,实测派自己也没统一口径。有媒体连夜跑了7项实测:前端生成的审美发生质变(60种设计风格的Bento卡片墙一次通过)、1.5小时做出来的3D浮岛网站首轮0 bug交付、全栈记账应用三轮迭代全过还会自己修bug。B站上也有人用它一句话生成四缸发动机3D仿真、还原《我的世界》,效果可圈可点。但与此同时,经典的"鹈鹕骑自行车"SVG测试它照样翻车——鹈鹕的脚踩在踏板上,踏板却不在自行车上。

跑分和实测为什么差这么多?社区目前有四种主流猜测,官方一个都没回应:

第一,灰度没全量。官网信息页至今没更新,最新日志还停留在V4-Flash-0731,有用户疑似被路由到性能更强的版本,不同人测出来的结果自然参差不齐。

第二,要配Harness。V4 Pro的完整性能可能依赖官方智能体框架Harness才能释放,直接调API效果打折扣。

第三,模型本身不稳。实测中发现了提前停止、反复思考、长任务完成质量波动的问题。

第四,跑分表选择性展示,挑对自己有利的对手比。

我的判断:大概率是一、二、三叠加。正式版比预览版强是实测共识,但"逼近Fable 5"这个说法,目前缺第三方证据。

涨价是千真万确的,而且比传闻更狠

8月17日0点起,API全面改峰谷定价:高峰时段价格是闲时的两倍。知乎V4 Pro新价目表(元/百万tokens):

项目

旧价

涨价后高峰

涨价后闲时

输出

6

27(+350%)

13.5(仍是旧价2.25倍)

输入(缓存未命中)

3

9(+200%)

4.5

缓存命中输入

0.025

0.3(+1100%)

0.15

V4 Flash也没逃过:输出从2元涨到高峰9元、闲时4.5元。官方自己的说法是:整体调价后价格为原来的1.5倍到12倍。知乎

三个重点:

第一,涨价只针对API。网页端、App端普通用户不受影响,"专家模式"用V4 Pro照样免费。知乎

第二,最狠的不是输出价,是缓存命中——涨了12倍。有开发者算账:小应用公司拿Pro做业务、缓存用得多的场景,综合成本接近涨10倍,“直接干穿毛利”。知乎

第三,8月17日前还是旧价,能提前的批量任务,趁这三天跑完。

从“梁圣”到“梁子”只用一天:DeepSeek V4 Pro这24小时反转,多少能信、适合谁

尘埃落定后,这模型适合谁

分三种情况说。

如果你做vibe coding、前端生成、长周期工程任务:值得一试。实测的强证据集中在这类场景——审美、任务完成度、自修bug能力都立得住。接入Anthropic兼容接口,Claude Code、opencode、Cline都支持,直接换base_url就能用。光子星球批量任务排到闲时跑,成本可控。但别抱"平替Fable 5"的预期,先拿你自己的典型任务试水。

如果你是拿Pro当主力API的开发者:先算账。高峰输出27元、缓存命中涨12倍,如果你的业务是实时交互、必须在高峰时段跑,这个成本已经逼近国产第一梯队——社区流传Kimi K3输出约100元/百万tokens,而K3在官方完整跑分的十项里领先六项。毛利模型撑不住的话,要么降级Flash走闲时(输出4.5元),要么看看最近降价的竞品。

如果你只是个人用户想尝鲜:网页和App的专家模式免费,直接用,涨价跟你无关。

后续值得盯的信号:官网部署状态是否更新(实测分歧会不会收敛)、Harness公测后的迭代、官方会不会出订阅套餐(社区呼声最高,目前只有按量计费没有订阅),以及17号之后的实际账单。

最后说两句

社区对这件事的总结挺到位:免费时代没结束,便宜时代在结束。V4 Pro 0813不是差模型——Agent能力比预览版有代际跃升,涨价后对海外旗舰仍有价格优势(Fable 5输出约360元/百万tokens,Pro高峰也才27元)。电子大猫但它被期待和定价同时架到了不该在的位置上。

我的建议很朴素:个人用户白嫖网页版就行;API用户别急着切换,等这几天灰度跑完、实测口碑收敛,再算账决定。值得买的精神是买对不买贵,选模型也一样。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章