这几天,AI Agent 圈子有点热闹。
周一开始有爆料:Opus 5.1 可能本周突袭发布。36氪周三又有消息:Fable 5.1 已经在 Claude 网页端灰度上线。知乎再加上泄露出来的两个代号"甜瓜"和"棉花糖",Anthropic 这是要在下半年一口气把牌打完的节奏。微博
评论区已经分成两派:一派说"等新模型,现在跑的都是过渡版";另一派说"发布潮就是换代潮,等等党永远胜利"。
但对真在跑 Agent 的人来说,这不是八卦——你的 Claude Code 订阅、API 脚本里的模型 ID、跑了一宿的长任务,都可能在这一两周里被波及。所以我把微博、知乎、36氪几边的信息捋了一遍,分成"确定的"和"不确定的"两份清单,帮你判断这周该做什么、不该做什么。
先说确定的四件事。
第一,发布潮是真的,而且节奏快得反常。Opus 5 是 7 月 24 日发布的,才过了一个多月,5.1 已经在路上。知乎按社区流出的信息,Fable 5.1 已经在网页端灰度,有业内人士推测 8 月底前全量上线。微博OpenAI 那边也没闲着:GPT-5.6 的多智能体 v2 月中刚上线,代号"Bel"的 10 万亿参数模型据称也已完成预训练,有人说 9 月会更热闹。36氪下半年的模型军备竞赛,已经打到门口了。

第二,目前没有任何涨价信号。Opus 5 本身就把旗舰价格锚打了下来:官方定价每百万输入 Token 5 美元、输出 25 美元,比同门旗舰 Fable 5(输入 10 美元 / 输出 50 美元)便宜一半。知乎Fable 5 现价不动,多位博主爆料 Fable 5.1 也会延续这个定价。微博注意,这是社区信息不是官方口径,但至少现在,没有任何信号指向"新模型=涨价"。
第三,这次的主战场明确转向了 Agent。按流出的泄露信息,Opus 5.1 的三个强化重点:编程能力、复杂逻辑推理,以及长时间运行的 AI Agent 能力。36氪最后一条是题眼——厂商卖的不再只是"聊天更聪明",而是"能更久地接管复杂工作流"。这个方向跟你搭的智能体直接相关。
第四,新模型不等于第一天就好用。有消息值得留意:Opus 5 目前问题不少,官方还在修复。微博基准数据里也藏着代价:Artificial Analysis 的 Briefcase 测试里,Opus 5 max 平均要跑 36.2 分钟、103 轮才能完成一个任务,上一代 Opus 4.8 max 是 24.1 分钟、55 轮——分更高,但时间和轮次也涨了。知乎现役版本都在打补丁,5.1 的首批用户大概率也要踩一轮坑。
再说不确定的三件事,别当结论传。
发布时间不确定。"本周发布"传了三天,截至发稿没看到官方公告。预测市场倒是给出了 74% 的概率:Anthropic 会在两周内发布下一代旗舰模型。36氪当大家需要靠赔率来判断进度时,说明谁都没有准信。
实测能力不确定。确实有参与 EAP 早期测试的人说,代号"棉花糖"(被普遍推测就是 Opus 5.1)对话自然度反超 Opus 5,但综合能力还没到 Fable 级别。微博知乎相关问题下有条回答直接泼冷水:下一轮洗牌不会只看榜单多一分还是少一分,而要看一次任务能否稳定做完,以及做完究竟花了多少钱。知乎看 Artificial Analysis 最新的智能指数也一样:Grok 4.6 已经打到 61 分,跻身第一梯队,头部分数咬得很紧,新版本未必能拉开代差。小红书这代表了相当一部分开发者的态度。

第一天能不能用上也不确定。用 Claude Code 的都懂那种痛:订阅额度一会儿就烧完,5 小时的用量 10 分钟见底。知乎新模型发布后多久能下到各订阅档、早期会不会对用量做额外限制,这些都有过先例。
那到底谁该等、谁别动?分三种情况说。
Claude Code 订阅快到期的朋友:不用急着囤,也不用抢着升级档位。定价没变,正常续就行。值得等的是两件事——Opus 5 的 bug 修复周期走完,以及 5.1 的 Agent 增强被社区实测验证。反正 Claude Code 里切模型就是一条命令的事,真不差这几天。
API 流水线上锁死了 Opus 5 的朋友:发布当天别急着切。模型 ID 一定会变——这次连代号都是先在第三方应用里泄露的,新模型 ID 长什么样目前没人说得准。新版本几乎必然要经历一轮回归测试,让第一批用户先踩坑,等一周实测再切,这个时间成本花得值。还有一组数字值得琢磨:Ramp 的 8 月报告显示,企业客户的 Anthropic 模型采购里,Fable 5 只占 Token 购买量的 6%,却占了支出的 11.4%——旗舰单价会在账单里被迅速放大。知乎换模型不只是换个 ID,还要算清楚成本会涨多少。

正考虑从国产工具转入 Claude 生态的朋友:发布潮其实不是你的窗口期,而是一个信号——大模型正在跟自家 Harness 深度绑定。Opus 5.1 的长时运行 Agent 能力,大概率会优先在 Claude Code 上落地。社区里还有个值得琢磨的观察:模型会对自家 Harness “过拟合”,换一个框架跑,效果可能打折,DeepSeek V4 Pro 在自家 DSH 上的表现就是个例子。知乎以后"选哪个模型"会越来越多地变成"住进哪个框架",这个决定比追新模型更值得想清楚。
最后给一份值得继续盯的信号清单:Anthropic 的官宣节奏(这周不动,下周概率更大);第三方应用里 EAP 代号的出现频率;Claude Code 模型列表的变动;以及发布后第一周的实测对比——尤其是长任务表现,那才是这代模型真正的考点。
一句话收尾:发布潮是真的,价格暂时没涨,Agent 能力是核心卖点;但日期不确定、实测不确定、当天可用性也不确定。对真在跑 Agent 的人来说,这周的最优解是钱包和模型 ID 都先稳住,好奇心可以先放在预测市场上。
顺便问一句:如果 Opus 5.1 这周真来了,你最想让它修好 Opus 5 的哪个毛病?评论区聊聊。