这两天如果你关注AI新闻,大概率被这组消息刷屏了:9月1日凌晨,Anthropic发布Fable 5.1,缓存读取价格一刀砍掉75%;第二天,谷歌放出Gemini 3.8 Flash,号称"用六分之一的价格买到旗舰级编程能力";Meta也在同一天发布Muse Spark 1.3。36氪48小时,三家公司,标题里全是"降价"和"性价比"。
但先说结论:这一轮降价,价目表基本没动,动的是账单。
价目表没动,账单动了
把三家的账拆开看,会发现三种完全不同的"降法"。
Anthropic的降法最隐蔽。Fable 5.1的输入输出价格和上一代一分没动,每百万token还是10美元/50美元。钛媒体真正动的是缓存读取——模型反复读取已处理过的上下文时收的钱,从1美元直接砍到0.25美元,官方账本是典型工作负载整体成本降约25%、高频Agent任务最高降约45%。钛媒体
听着很美对吧?独立评测机构Artificial Analysis(AA)拿自己的评测任务跑了一遍,得出另一个数:Fable 5.1的单任务实际成本比上一代Fable 5高20%。知乎原因不复杂——这代模型变"话痨"了,输出token消耗约是上一代的1.7倍。缓存省下的钱,被多出来的输出吃掉还倒贴。两边报的都是真实数据,谁都没撒谎,只是量的不是同一件事。同一份AA榜单还有另一面:在综合智能指数里,Fable 5.1的Max档以66分登顶,压过上一代和所有竞品——这代模型是典型的"又强又费"。钛媒体

谷歌的降法更反直觉。Gemini 3.8 Flash的价目表一分没涨:输入0.75美元、输出3.75美元每百万token。但AA实测发现,完成同一个任务的总成本涨了40%——模型在每个任务里"想得更努力",推理步骤更多、工具调用更频繁,单任务输出token多了30%。钛媒体它在DeepSWE软件工程基准上追到只差旗舰Opus 5仅0.3分,价格不到对方六分之一,代价就是模型主动"加班"。

Meta干脆反着来。Muse Spark 1.3不谈降价,直接晒"省":同类任务的工具调用次数比上代少约20%,token消耗少约25%。36氪当另外两家都在用"想得多"换分数时,"少干活也能干完"本身就成了卖点。
价格战悄悄换了计价单位
把这三本账连起来看,会发现一个很清楚的信号:大模型价格战的竞争口径,正在从"每百万token多少钱"切换到"完成一个任务烧多少钱"。
第一阶段的价格战很简单,比单价,谁低谁赢。行业统计的大模型token价格指数这个夏天从高点一路腰斩,跌到每百万约0.97美元的历史低位。微博但当单价咬平之后,新的定价杠杆就冒出来了:推理深度、缓存命中率、输出膨胀率、推理档位。价目表看起来都一样透明,账单却开始长得完全不一样。
对要掏钱用AI的人来说,这里面有三个坑值得单独说。
第一个坑:官方"降25%"是按厂商自己的典型负载算的。知乎有开发者拿两个真实项目实测Fable 5.1,实际省下来的只有13.7%和16.6%,官方折扣落到真实任务上会缩水;同一个模型的低推理档比上一代便宜23%、还多写了4.5倍的测试,中档却比低档和高档都贵——档位调低不等于省钱,得自己测。知乎
第二个坑:优惠期。Gemini 3.8 Flash的0.75/3.75美元是限时价,12月31日到期后单价翻倍到1.5/7.5美元。钛媒体用量涨一轮、单价再涨一轮,两波叠加才是完整的价格路径。有社区消息称已经有团队在评估切回3.7 Flash控制预算。
第三个坑:跑分边界。Gemini 3.8 Flash在开放式Agent基准Terminal-Bench 4.0上只有19.1%,而Opus 5是51.8%;OSWorld电脑操作测试是59.0%对75.4%。钛媒体规律大致是:边界清晰、终点明确的专业任务,Flash能贴着旗舰打;需要自主规划下一步的开放任务,差距会被明显拉开。沃顿教授Ethan Mollick的评价很直白:这是一个很好的Flash模型,但不等于前沿模型。
续费之前,先问三个问题
那普通付费用户怎么应对这种"降价"?给你一套可以直接套用的三问清单,续订、换模型之前先问完再动手:
第一问:我跑的任务长什么样?短问答、写文案这类轻任务,几乎不受token放大效应影响,哪家便宜用哪家。但如果你跑的是编程Agent、自动化工作流这类长链路任务,成本弹性大得很——任务越长,模型反复读上下文、反复"多想"的空间越大,这正是两本账差出几十个百分点的地方。
第二问:我用的是哪个推理档?这一代模型几乎都留了档位开关:Gemini 3.8 Flash支持低/中/高三档thinking强度,Fable 5.1的低档在CursorBench上性能接近上代高配,成本只有三分之一。知乎同一个模型,踩哪档油门,价钱能差三倍,而且不是越低越便宜——找到自己任务的最优档位比换模型更划算。
第三问:我看的价格是谁的口径?厂商官网是"典型负载"的账,第三方评测是"自家任务集"的账,都不是你的账。重度用户最靠谱的办法,是拿一个自己的真实任务在新模型上跑一遍,看单次成本——这一步花不了一小时,比看十篇发布解读都管用。
顺便说个对国内用户重要的变化:这轮价格战已经打到订阅制了。智谱刚在天猫开出官方旗舰店,把GLM Coding Plan做成类似手机套餐的订阅,个人版Lite每月118元起,但Pro档从149元涨到了538元,官方理由是换成积分制、模型升级到GLM-5.3。36氪国产订阅同样进入了"别看单价、看额度和任务成本"的阶段。

接下来值得盯的三个信号
最后留几个可以继续观察的线索:
Gemini 3.8 Flash的限时优惠12月31日到期。单价翻倍之后还能不能守住性价比前沿,是谷歌"用Flash走量"策略的第一次大考。
六月就预告的Gemini 3.5 Pro至今没发布——业内分析认为Flash太强,Pro的价格锚点立不住。真旗舰什么时候端上来,什么时候才是这轮"Flash降价潮"的真正分水岭。
企业端的账。Ramp的企业支付数据显示,上一代旗舰Fable 5只占Anthropic企业端约6%的token消耗。知乎跑分是简历,成本才是试用期。这一轮缓存大降价能不能真正让旗舰打进企业工作流,是这次价格战区别于上一次的关键。
价格战打到第二阶段,比的是谁的账单更会"藏"。下次再看到"降价"两个字,别先盯着价目表,先问一句:完成我的一个任务,它到底要花多少钱?