DeepSeek V4.1 Flash来了:比自家Pro更强,还更便宜
图片今天DeepSeek干了件在AI圈相当离谱的事:
正式发布V4.1 Flash,然后宣布——V4 Pro四天后(9月14日12点)下线,所有请求自动路由到新Flash,按Flash的价格计费。
注意这个辈分关系:Flash是轻量款,Pro是旗舰款。小弟上市,大哥退役。
先复盘一下这一个月有多魔幻
8月13日,DeepSeek发布V4 Pro正式版,同时甩出一张涨价单:API价格最高涨了11倍,首次搞峰谷定价,高峰时段翻倍。开发者社区当场炸锅,原话是"没有性价比了"。
8月17日,新价格生效,骂声一片。
9月9日,DeepSeek悄悄宣布Flash系列降价:缓存命中价砍60%,不少价格回到了涨价前。
9月10日,谜底揭晓:哪里是良心发现降价,是新模型把成本真的打下来了。V4.1 Flash发布,性能、速度、费用、总用时四项全面超越V4 Pro——官方原话。
也就是说,V4 Pro正式版在市面上只活了28天,就被自家一个"小尺寸"模型送进了博物馆。
它是怎么做到又便宜又强的?
说两个技术细节,不用懂技术也能听明白。
第一,新模型换了个脑子结构。以前的模型读东西和写东西用同一套参数,V4.1 Flash改成了"不对称":读输入的时候只激活80亿参数,写输出的时候激活160亿。
为什么这么改?因为现在AI干活的模式变了。一个Agent跑任务,要读大量的代码、文档、工具返回结果,真正自己写出来的内容反而不多——典型的"读多写少"。既然读的部分不需要那么聪明,那就用小脑子读、大脑子写,账单自然就下来了。
第二,它把"短期记忆"占的显存压缩到了极致。KV Cache(可以理解成模型读长文时的草稿纸)缩小到每token 890字节,对显存的需求降到上一代的四分之一,比DeepSeek初代模型缩小了437倍。Agent任务反复读上下文,这张草稿纸以前是成本大头,现在基本等于白送。
图片如图展示了 DeepSeek 在减少上下文存储方面的持续进展。相对于初代模型,KV Cache 已经缩小了 437 倍。
总参数5520亿,MIT协议开源,100万token上下文,还原生带视觉理解——看图、读截图、分析图表不用再单独调模型了。
价格账算一下
闲时每百万token:缓存命中输入2分钱、未命中1块钱、输出4块钱。高峰时段翻倍。
图片对比8月涨价前的老Flash:输入价回到了从前,输出还是以前的两倍。但对比V4 Pro的价格,Hacker News上有人算了笔美元账——输出token,新Flash闲时0.6美元,Pro是1.98美元,差了三倍多。
所以9月14日之后会出现一个很魔幻的场景:你指着deepseek-v4-pro的接口发请求,后台给你跑的是更强的模型,收的是更便宜的钱。
降级?不,这叫"向下升级"。
更值得琢磨的是后半句话
官方说,V4.1 Flash是"全新模型结构系列中尺寸最小的型号"。
最小的,已经把上一代旗舰打死了。
图片那大的呢?报告里写得很明白:新结构就是为了"可扩展到更大参数模型"。V4.1 Pro正在暗处憋着。DeepSeek这波相当于先放个小号出来清场,把"旗舰能力"的价格锚直接砸穿,等大号出来,定价和想象空间全是它说了算。
时间点也很微妙。昨天路透社刚曝出DeepSeek请中信证券辅导科创板IPO,估值5000亿;今天就用一场"加量还降价"把全球开发者的好感度拉满——Hacker News上相关帖子冲到近400分,评论区一片"便宜得离谱"。
资本市场讲故事需要想象力,开发者生态需要真金白银的便宜。DeepSeek两天之内,两头都喂了。
再看大洋对面:同一天,OpenAI那边GPT-6 Astra因为需求太猛,放话可能暂停新的Pro订阅注册——一个忙到要关门谢客,一个敞开大门还降价。
AI竞赛打到2026年秋天,画风已经很清楚了:有人在卖奢侈品,有人在卖自来水。
而对国内开发者来说,建议很实在:这几天可以把Agent任务往闲时(晚上和周末)挪挪,能再省一半;9月14日之后如果还在调v4-pro的接口,不用改代码,但记得去后台看看账单——会有惊喜。
