DeepSeek旗舰9月14日变脸,你的账单自动降七成

2026-09-12 07:55:19 0点赞 0收藏 0评论

一家AI公司把自家旗舰悄悄下了架,还顺手替你把账单打了折。天底下有这样的好事?

9月14日北京时间中午12点起,所有发往deepseek-v4-pro的请求,一律改道到9月10日刚上线的V4.1-Flash。费用全部按Flash的价格计价,直到新的V4.1-Pro上线。DeepSeek官网的公告写得明白,新模型什么时候来,没给日期。

我翻了官网公告和模型卡,把三行价格抄了下来。高峰时段每百万token的输出价格,V4-Pro是3.96美元,Flash是1.2美元。缓存未命中的输入,从1.32美元降到0.3美元。缓存命中的输入更狠,从0.044美元降到0.006美元。我算了下,输出砍70%,输入砍77%,缓存命中砍86%。

关键是,你的代码一行都不用改。

模型名还是deepseek-v4-pro,接口照常响应,延迟大概率还更快。跑批结束你去核对费用,数字自己瘦了一圈。没有弹窗,也没有迁移指南。多数人的第一反应是,降价还需要适应吗?需要的。你先得想明白,你省下的钱,对应着你原来花钱买的那个东西。它本身换了芯。

便宜是真的,代价也是真的

两边的基准分数都摆在官方模型卡上。代理类任务,Flash反超Pro,Terminal-Bench拿到90.6分对87.9分,DeepSWE 74.2对62.7,赢得不小。纯知识和推理,Flash就矮了一头,GPQA Diamond 90.9对92.4,HLE 39.1对42.7,SimpleQA-Verified差得最多,42.3对55.2。

DeepSeek旗舰9月14日变脸,你的账单自动降七成

谁受益谁受损,这条线画得很清楚。跑agent工作流、写代码、调工具的团队,坐着就把折扣吃了。靠模型硬答知识题、做长链推理的应用,等于被人换了一台排量更小的引擎,油钱省了,马力也小了。

Flash为什么能这么便宜,答案藏在缓存里。552B总参数的MoE,输入只激活8B,输出激活16B。全局KV缓存压到每token约890字节,只有上一代的四分之一左右。挂agent的人都知道,缓存命中的输入费是重复成本的大头。这部分从0.044美元压到0.006美元,跑批的底价直接削掉一格。官方口径是多轮测试里,Flash在性能、成本、速度、任务总时长四个维度都赢了Pro。这话不算吹,前提是你的活恰好落在它赢的那两项里。

国内的价格也同步换了。9月10日生效的新定价,非高峰时段每百万token,缓存命中收0.02元,缓存未命中收1元,输出收4元,高峰时段全部翻倍。峰谷计价是一起生效的,灵活的任务挪到谷段,还能再省一半。

我在零售做过几年采购,对这种操作眼熟。供应商停掉老型号,发货单上的料号不变,到货的箱子里装的是新款。便宜了,规格表上也说得过去,可你要的那个老批次,生产线已经停了。ERP换底层引擎也是一样。报表数字对得上,某个角落的舍入规则悄悄变了。等你发现,往往是被业务方找上门的时候。

换下来的选择权去哪了

我的判断是,这次改道真正的信号在别处。DeepSeek没有停售旗舰,没有发迁移邮件。它用一次路由切换,替所有调用方做了一个决定,你们中的大多数,用不着最贵的那个模型。够用就行这三个字,从你自己选的,变成了它替你给的。

DeepSeek旗舰9月14日变脸,你的账单自动降七成

这也不是DeepSeek一家的招数。这一年里GLM、Qwen、Gemini都在把Flash档位往下压,轻量模型吃掉重量的场景越来越多。旗舰还存在,只是你的默认流量不再流向它。模型厂商的生意,正从卖最强大脑变成替你管钱袋子。

退路也有。V4.1-Flash的权重挂在HuggingFace上,MIT协议,1M上下文,谁都能拉下来自己部署。这算DeepSeek留的后手,也是在意推理质量那批人的活路。前提是你养得起自部署的机器。

DeepSeek官方还做过一组测试。同一个模型套进八种agent框架,DeepSWE成绩最大能差出8.7分。换工具壳的差距,比好几个模型之间的差距还大。你的流水线用什么壳,比你想的分量更重。

我点开自己后台的调用记录对了一遍。挂着的定时任务和文档摘要是纯agent活,留在Flash上吃折扣正合适。知识问答那部分迁回了开源权重自部署,跑得慢点,但答案的成色我自己说了算。同一个接口名,背后已经是另一个模型,下次你的AI应用行为有点不对劲,你会先查自己的代码,还是先想想,是不是厂商换了脑子?

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松