这周AI工具圈炸锅了:Opus 5.1被曝本周发布。知乎再加上已经在灰度测试的Fable 5.1,这据说是下半年最密集的一波大模型发布潮。
对我们这种自费买AI干活提效的人来说,这不是吃瓜:新模型意味着调价、额度变化、API模型号变更,每一条都直接影响口袋里的成本。但在冲进去之前,先看两组数据——真金白银说的和传闻不太一样。
先给「本周发布」泼盆冷水
把时间线捋一遍,目前所有信息都还是爆料和推测。8月24日,claude-marshmallow-eap、claude-melon-eap两个神秘模型ID现身。量子位而在此之前,已有消息称Fable 5.1在暗中灰度测试了两周,还有「加量不加价」的说法。新智元截至今天,Anthropic没有任何官宣,两个代号对应哪款模型,社区也没有共识。知乎
不过历史可以参考:代号Honeycomb是7月9日被发现的,7月23日正式发布时就是Opus 5,价格刚好是旗舰Fable 5的一半;再往前,今年3月泄露的代号Mythos,两个多月后对应到了6月发布的Fable 5。两次泄露,两次验证,从代号被抓包到正式发布,窗口大约是2到4周。量子位
Polymarket预测市场目前给「约两周内发布下一代旗舰」的定价是74%——大概率会来,但不一定是这周。新智元

企业的钱包,比传闻诚实
比发布时间更有意思的,是企业支出里的一个数字。给企业管账的支付公司Ramp统计了约7万家美国企业的采购数据:旗舰Fable 5卖出的收入只占Anthropic整体的11.4%,卖出的token量只占6%;而定价只有一半的中端Opus 5(每百万token输入/输出$5/$25,旗舰是$10/$50),上线不到一个月,卖出的量就超过了这位贵一倍的旗舰。量子位
做个对比:OpenAI的旗舰版本GPT-5.6 Sol,占token购买量的25%、收入的23%。也就是说,不是企业买不起旗舰——是在Anthropic这边,大家就是不选它。而且这个分化,发生在Anthropic年化收入从5月的470亿美元涨到7月650亿美元的大盘里:蛋糕在变大,旗舰的份额反而在缩小。
Accel合伙人Miles Clements说得挺直白:「多数人不需要跑在前沿,客户只认最强模型的那个时代,不是一个能持续的时代」。量子位

个人用,算一笔单任务的账
企业数据离得远,再看个人实测。Artificial Analysis在发布分析里给Opus 5 max的智能指数打了61分,Fable 5 max是60分,基本打平。知乎而302.AI基准实验室的对比表显示,两者的单任务成本是$2.03对$2.75——同级产出,近半价格。

鱼皮对7个真实项目的实测也印证了类似结论:考察在命令行里独立做完一整套编程任务的Frontier-Bench上,Opus 5拿了43.3%,顶配的Fable 5只有33.7%,连GPT-5.6 Sol都有37.5%。知乎便宜一半的,反而在最难的任务上赢了旗舰。
那旗舰的溢价到底花在哪?知乎博主玩AI的fox拿Opus 5和Grok 4.6跑了一组同类任务(每个模型跑4次,小样本,仅供参考):同一个任务,Opus 5的账单是Grok 4.6的3.6倍,同时多交回1.75倍代码,耗时只有一半。知乎按产出归一化后,只贵2倍左右——旗舰的价值在「啃硬骨头」和「省时间」,不在日常每一单。
发布潮之前,三个判断
第一,按任务分流,别按模型编号分流。日常写作、代码补全、文档处理钉死在中端Opus线;碰到架构设计、深度研究、复杂多步任务再切旗舰。这正是7万家企业已经用钱投过票的方案。
第二,发布当天不动自己的工作流。爆料和灰度意味着API模型号、价格档、速率限额随时可能变,发布前一天迁模型是风险最高的时刻。等两三天社区的实测反馈,再决定切不切。
第三,真正的省钱点在定价和额度。发布潮通常伴随旧版降价或套餐调整,盯住这两条线,才是实际能省到钱的时候,而不是发布当天。
接下来值得盯的信号
一,Anthropic本周是否官宣,传闻是否落地;二,marshmallow、melon两个代号到底对应Opus 5.1还是Fable 5.1;三,Polymarket那个74%的两周窗口(从8月26日起算);四,新版发布后旧版价格是否调整;五,下一轮Ramp数据里,Fable 5的收入占比是不是继续往下掉——那决定「旗舰溢价」这个策略本身还能撑多久。任何一条信号亮了,回来再算这笔账。