先报三个数字,你的账单就是被它们改写的
8月17日0时,DeepSeek-V4系列新定价生效,取消统一计费、改成峰谷分级,高峰时段(9:00-12:00、14:00-18:00)收费标准直接是空闲时段的两倍。梨视频旗舰V4-Pro高峰输出价由此前的约6元涨到27元/百万token,缓存命中价从0.025元涨到0.3元,翻了12倍。核心榜B站上那条「千问降价、DeepSeek涨价,直接配了」的视频底下,评论区挤满了账单受伤的人:“钱包大的直接全配了(指API)”。哔哩哔哩
8月27日12点,阿里云百炼发布通知,下调Qwen3.8-Flash计费单价,输入价格调整前1元、调整后0.8元,输出价格调整前3元、调整后2.7元(每百万token)。财联社往前数10天,才刚有DeepSeek涨价这回事——一边涨一边降,价格战的剧本就这么换了写法。
智谱也没闲着:GLM-5.3-Flash定价与千问几乎持平,还叠加限时5折,折后输入0.4元、输出1.4元,窗口只到9月9日。36氪今天是9月6号,想按这张牌价重新算成本的,只剩三天。
降价背后有两个反常识
反常识一:千问Flash这次是「小模型打赢了自家旗舰」。 8月26日晚,阿里正式发布Qwen3.8-Flash,多模态MoE模型,主模型参数125B、每token激活仅6B,外挂51B的N-gram Embedding,训练开销约为上一代的1/9。微博训练成本先塌下来,降价才不是赔本赚吆喝——这也是官方敢把新架构(GDN线性注意力+稀疏QSA+MoE)直接开源的底气。

数码区UP主“无机酸”的六项能力实测标题就叫「Qwen3.8Flash:小模型远超Max,这次千问真没刷分!」,视频下533条评论,一半在认:文本能力“坐稳国模T0”、编码“堪称第一flash”。哔哩哔哩
另一半在骂:「Qoder上这个模型的排队超级抽象,能在你任务中某一步骤突然开始排队让你多等一会,本来就慢的模型雪上加霜」。哔哩哔哩便宜和排队,在这款模型上是同时成立的——你的项目能不能接受不可控的等待,比每百万token省几毛钱更早决定账单。
反常识二:被喊涨价喊得最响的DeepSeek,闲时缓存命中价反而还是三家最低。 0.05元/百万token的缓存命中输入价,眼下没人比它更低。36氪峰谷定价的坑就在这:如果你的任务是夜间批跑、离线洗数据、赶在明早看结果,DeepSeek的谷时段压根没“贵”多少;如果你的业务是白天实时在线,新账单才真正打到你脸上。涨价生效当天,就有博主在教“DeepSeek正式涨价之后,你需要的提示词是……”,还有人把按北京时间的分时段回复规则直接写进了系统提示词。微博换不换,先看你一天里哪些时段在烧token。
真要动手,这三层账先算完
第一层:牌价不等于账单。 0.8元是标价,但三家都支持上下文缓存,缓存命中的输入价会大幅下探——千问低至0.1元/百万token,系统提示长、上下文重复度高的智能体场景,实际账单还能再砍一截。36氪重度用户晒的另一种算法是订阅制:“用token plan能比ds flash便宜4-5倍”。哔哩哔哩也有人实测撞上额度墙:「499套餐开两个窗口并发居然限流,提工单反馈说是建议我不要开两个窗口,另外就是额度问题,阿里明知道自己模型贵,499只给到一周4w额度」。哔哩哔哩
通道的玩法也在变:8月15日起千问TokenPlan移除了5小时限额,Plan可以当“加油包”用。微博8月25日起APIKey绑定千问App和PC端,即可直接调用订阅额度。IT之家但同一个模型,不同入口的实际水平、额度规则并不是一套数:评论区有人怀疑token plan通道与Qoder积分通道“水平有差”,也有人在第三方Agent里直接撞上“默认供应商不支持千问云API”、自己搓了一份配置才跑通。微博先拿你最真实的那个任务,在你会用的那个通道里跑满一周,再谈迁移。

第二层:智谱的4毛是限时,千问的8毛才是长期。 9月9日之后GLM-5.3-Flash回到0.8/2.7的原价带,和千问重新站上同一水位,按4毛去签你下半年的预算表一定会翻车。涨价外溢倒是真的:DeepSeek调价第三天,就有观察者记录到小米的份额当天爬到了18.9%。微博“斩杀线”每隔几周往下挪一次,几个月后回头看,今天的0.8元大概率还是贵的。
第三层:降价的真实逻辑,是Agent替你把账算好了。 行业里一个日活50万的客服智能体,全部用传统旗舰模型单日API成本可达1.5万元、一个月超45万;切换到降价后的Qwen3.8-Flash或GLM-5.3-Flash,单日可压进1000元以内。36氪
企业场景85%以上的日常任务对极致智商要求并不高,却对时延和成本极度敏感;而一个Agent业务闭环动辄几十次连续调用,全交给旗舰只会成本成倍膨胀。36氪聪明的接法是双核路由:Flash吞掉高频流量,复杂架构、长链推理留给旗舰。实测区也有反面样本,有人用Flash审查代码变更出现误判——它再卷,也不是全干的。顺带一提,千问的API同时兼容OpenAI与Anthropic协议线,可直接配合ClaudeCode、Codex使用,工具链迁移不再是拦路石。智东西

对号入座:你属于哪一档
白天在线、高频调用、跑Agent/工作流:千问Flash 0.8/2.7+缓存0.1的组合现在就能拍板,重点先把提示词结构改成长系统提示+高复用,把缓存命中率打上去。
夜间批处理、极限抠成本:先别急着迁,把跑批挪到18点以后、系统提示做成可缓存前缀,DeepSeek那张“免费牌”还没作废。
想抢智谱5折:9月9日收口,值得上,但POC用真实任务跑满一周再定长期方案,限时价不是承诺价。
千问App/Qoder/TokenPlan订阅用户:先看你所在通道的积分系数、额度周期和排队情况,降价红利未必自动传导到你这个入口。
想本地部署:125B总参数不是“便宜”就等于能跑,社区实测32GB显存档才有25t/s的流畅体验,6G/8G显存的用户看的是量化版和27B,别买错卡。
顺带一提C端:千问办公已首发搭载这个Flash模型并上线免费的标准模式,日常文档、PPT任务先在那边试水,不吃你API的钱。
接下来盯什么
三件事:9月9日智谱折扣到期后,千问是否跟进下一轮调价;ArtificialAnalysis何时补上Qwen3.8-Flash的第三方分数——目前最可比的口径只有GLM-5.3-Flash 57分、DeepSeek V4-Flash 50分,千问缺席,这一项暂不下结论。36氪以及评论区那句被点赞的原话:“别叫Qwen3.8-Flash-Next了,改名Qwen4-Flash-Preview算了”——千问自己也说,提前释出新架构,就是让社区先检验Qwen4。
价格战打到第三周,牌桌上比的已经不是谁便宜,是谁的便宜还能持续一个季度。你的这个月账单,涨还是省?评论区报个数。