过去24小时,DeepSeek上了两次热搜。如果你不是一直蹲在评论区吃瓜,现在大概率是懵的:一边是"跑分逼近Fable 5,梁圣载入史册",一边是"只比自家Flash强1分,降级为梁子"。同一个模型,口碑完全相反,到底发生了什么?
我把微博、知乎、B站的实测、官方群流出的评测表、第三方评测平台的数据都翻了一遍,交叉核对后给你捋清楚这笔账。先说结论:跑分表只有一半是真的,反转也有实锤,涨价倒是千真万确。
这24小时到底发生了什么
先把时间线捋直(多方信源交叉核对):
8月12日深夜,DeepSeek在API文档的"模型&价格"页面,把模型版本从V4-Pro-Preview悄悄换成了V4-Pro-0813。电子大猫没有发布会、没有博客长文、没有倒计时。同一晚,马斯克的Grok 4.6、阿里的Qwen3.8 Max也扎堆发布,媒体直接称之为"梁文锋对垒马斯克"。
8月13日凌晨,一份来自官方群的评测对比表开始流传,数据确实炸裂:Terminal Bench 2.1打了87.9分,距离Fable 5只差0.1分;DeepSWE从预览版的12.8冲到62.7,接近4.9倍跃升。光子星球社区瞬间沸腾,Hacker News都在热议。
8月13日白天,第一批上手实测的开发者发现不对劲。B站出现两个结论完全相反的连夜测评;知乎、小红书的实测帖大多判定"不如Kimi K3";第三方评测平台ArtificialAnalysis给V4 Pro的综合评分只有53分,只比自家V4-Flash-0731高1分。电子大猫
8月13日下午,网友发现官网的0813发布通知和开放平台公告被撤回,距离静默上线还不到24小时。电子大猫
8月13日晚间,官方公众号正式官宣V4系列正式版发布,同晚还扔了两个炸弹:API大幅涨价,8月17日生效;智能体框架Harness v0.1开发者预览版开源(MIT协议)。知乎

跑分表"一半真"在哪
这是整件事的关键。流传的评测表其实有两个版本:传播最广的是简版,只列了Claude Opus 4.8和Fable 5两列,一眼看去"多项逼近Fable 5"。但完整版里其实还有Kimi-K3和GLM-5.2两列,逐行对比会发现:十项里Kimi K3领先六项。电子大猫有小红书热帖直接吐槽这是"田忌赛马"(该帖目前已删除)。

第三方的口径更直接:ArtificialAnalysis综合评分V4 Pro得53分,V4-Flash-0731是52分。要知道Pro是1.6万亿参数,Flash只有2840亿,体量差四倍多,只换来1分差距,这就很尴尬了。
不过公道地说,实测派自己也没统一口径。有媒体连夜跑了7项实测:前端生成的审美发生质变(60种设计风格的Bento卡片墙一次通过)、1.5小时做出来的3D浮岛网站首轮0 bug交付、全栈记账应用三轮迭代全过还会自己修bug。B站上也有人用它一句话生成四缸发动机3D仿真、还原《我的世界》,效果可圈可点。但与此同时,经典的"鹈鹕骑自行车"SVG测试它照样翻车——鹈鹕的脚踩在踏板上,踏板却不在自行车上。
跑分和实测为什么差这么多?社区目前有四种主流猜测,官方一个都没回应:
第一,灰度没全量。官网信息页至今没更新,最新日志还停留在V4-Flash-0731,有用户疑似被路由到性能更强的版本,不同人测出来的结果自然参差不齐。
第二,要配Harness。V4 Pro的完整性能可能依赖官方智能体框架Harness才能释放,直接调API效果打折扣。
第三,模型本身不稳。实测中发现了提前停止、反复思考、长任务完成质量波动的问题。
第四,跑分表选择性展示,挑对自己有利的对手比。
我的判断:大概率是一、二、三叠加。正式版比预览版强是实测共识,但"逼近Fable 5"这个说法,目前缺第三方证据。
涨价是千真万确的,而且比传闻更狠
8月17日0点起,API全面改峰谷定价:高峰时段价格是闲时的两倍。知乎V4 Pro新价目表(元/百万tokens):
项目 | 旧价 | 涨价后高峰 | 涨价后闲时 |
|---|---|---|---|
输出 | 6 | 27(+350%) | 13.5(仍是旧价2.25倍) |
输入(缓存未命中) | 3 | 9(+200%) | 4.5 |
缓存命中输入 | 0.025 | 0.3(+1100%) | 0.15 |
V4 Flash也没逃过:输出从2元涨到高峰9元、闲时4.5元。官方自己的说法是:整体调价后价格为原来的1.5倍到12倍。知乎
三个重点:
第一,涨价只针对API。网页端、App端普通用户不受影响,"专家模式"用V4 Pro照样免费。知乎
第二,最狠的不是输出价,是缓存命中——涨了12倍。有开发者算账:小应用公司拿Pro做业务、缓存用得多的场景,综合成本接近涨10倍,“直接干穿毛利”。知乎
第三,8月17日前还是旧价,能提前的批量任务,趁这三天跑完。

尘埃落定后,这模型适合谁
分三种情况说。
如果你做vibe coding、前端生成、长周期工程任务:值得一试。实测的强证据集中在这类场景——审美、任务完成度、自修bug能力都立得住。接入Anthropic兼容接口,Claude Code、opencode、Cline都支持,直接换base_url就能用。光子星球批量任务排到闲时跑,成本可控。但别抱"平替Fable 5"的预期,先拿你自己的典型任务试水。
如果你是拿Pro当主力API的开发者:先算账。高峰输出27元、缓存命中涨12倍,如果你的业务是实时交互、必须在高峰时段跑,这个成本已经逼近国产第一梯队——社区流传Kimi K3输出约100元/百万tokens,而K3在官方完整跑分的十项里领先六项。毛利模型撑不住的话,要么降级Flash走闲时(输出4.5元),要么看看最近降价的竞品。
如果你只是个人用户想尝鲜:网页和App的专家模式免费,直接用,涨价跟你无关。
后续值得盯的信号:官网部署状态是否更新(实测分歧会不会收敛)、Harness公测后的迭代、官方会不会出订阅套餐(社区呼声最高,目前只有按量计费没有订阅),以及17号之后的实际账单。
最后说两句
社区对这件事的总结挺到位:免费时代没结束,便宜时代在结束。V4 Pro 0813不是差模型——Agent能力比预览版有代际跃升,涨价后对海外旗舰仍有价格优势(Fable 5输出约360元/百万tokens,Pro高峰也才27元)。电子大猫但它被期待和定价同时架到了不该在的位置上。
我的建议很朴素:个人用户白嫖网页版就行;API用户别急着切换,等这几天灰度跑完、实测口碑收敛,再算账决定。值得买的精神是买对不买贵,选模型也一样。