写给谁看:每天开 coding agent 干活、月底会瞄一眼 token 账单、要么自费要么被公司限额的重度用户。你已经知道什么是 Claude Code、Codex、token plan,这篇不再科普,只讲这周的三个价格信号分别跟你有什么关系、现在该动什么、什么别动。
一、三天里,"价格"这条线出了三件事
先摆事实,全部可对时间线:
9月1日,Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,两版共用同一底层,后者只开放给经过审核的网络安全和生命科学机构。基准涨幅是官方口径:Terminal-Bench-Science 从 24.7% 到 52.6%,接近翻倍;Terminal-Bench 4.0 从 42.0% 到 55.8%;AutomationBench 从 17.1% 到 31.4%,官方称能连续跑数十小时复杂任务。小红书关键点不在分数:输入输出单价没动,动的是缓存读取价,直降 75%,到每百万 token 0.25 美元。小红书上一条整理帖算的账:典型任务整体成本约降 25%,高度 Agent 化的任务最高降 45%。
同一周,OpenAI 的 GPT-6 Astra 发布,和 Fable 5.1 前后脚隔一天,被搬运的海外实测里两家定价一致:输入 10 美元/百万、输出 50 美元/百万。哔哩哔哩用B站up主们的话说,“世界最强模型的头衔,这周换了两次主人”。Astra 已经进了 Codex,Plus 档就能用;前端和 3D 表现的实测视频是本周弹幕区最热闹的内容——程序员阿江那条两个全栈项目(在线表格+多机器人仓库调度)的对比拿到 1.7 万播放、134 条评论。哔哩哔哩哔哩哔哩
9月5日,知乎问题"如何评价阿里 token plan 取消 5 小时限额"一天内冲上 5 万浏览。"5 小时滚动限额"是国产编码套餐的老规矩,今年 4 月小米 MiMo 发 TokenPlan 时,"没有 5 小时限额"就是头号卖点,四档 39 元起、采用统一 Credit 点数计费。微博半年后阿里把自家限额也撤了,等于套餐侧开始集体松绑。有个回答被顶在前面,话很损但很真实,打窝阶段已经结束了,小活一支烟,大活一包烟,上不封顶,都已经不会古法编程,回不去了。知乎
三件事指向同一个问题:账单的结构变了,但大多数人还在看单价。
二、价目表没变,砍掉的是"记忆税"
为什么单价不动,账单能降两到四成?得先承认一个多数用户没细想过的事实:agent 编程的 token 消耗大头根本不是"让模型写代码",而是反复重发上下文。
知乎 9 月 1 日有个 22 万浏览的回答把机制拆穿过(作者 pansz,251 赞):一个命令走 200 步,第 200 步时,第 1 步的上下文已经被原样发送了 199 遍。知乎烧 token 的本质是"给模型买记忆",他给的量级感也值得抄下来:一个程序员 prompt 基本盘 2M token,一天 100 个请求就是 2 亿;"1M 上下文"不是总共用 1M,是当前每次调用都要带上 1M;一个提示词几十个工具调用,加起来几十 M 很正常。所以为什么 token 要用 M 计量?“只有用 M 为单位的时候,它看起来才是个正常的数值。”
看懂这个,Fable 5.1 的降价就不是"降价",是定向补贴:长任务=同一份上下文被反复读取,缓存读取价就是重发次数的乘数。砍掉 75% 的缓存价,等于专挑"高度 Agent 化"的用户给优惠——越重的活,降得越多(最高 45%)。这跟本周 B 站另一条"装了一年 73 个 skill,/skill-doctor 一查全是 0 次调用,cache 命中率从 40% 回到 78%"的讨论正好是同一枚硬币的两面。哔哩哔哩命中率就是钱。
一句可直接背走的判断:任务成本 ≈ 表观单价 × 上下文长度 × 重发次数。厂商这三周全在第三个变量上做文章,而社区讨论还停在第一个变量上吵谁便宜。
三、“同价不同账”:选型该换坐标系了
单价一样的两个旗舰,账单不一定一样。本周各家实测的口径高度一致:跑分接近,烧钱差很多。几条被反复提到的信息——
NixAI 那期 GPT-6 Astra vs Fable 5.1 给出的原版结论是,分数、实际体验和 token 成本之间有差距,高分模型未必是日常首选。哔哩哔哩
创哥的 AI 实验室做了 DeepSeek V4 Pro vs Fable 5.1 三个同题编程挑战,标题的追问很扎心:当成本相差几十倍甚至两百多倍时,我们到底多得到了什么?哔哩哔哩注意,那是灰测模型对旗舰,差距换来的是稳定性,不是玄学。
74,000 行代码库上的语义层建模实测(海外博主 DukePan,有中配搬运):Fable 5.1 最细,产出设计文档+迁移计划+四选项矩阵,但单次任务成本近 8 美元、15-16 分钟。哔哩哔哩
海外圈已经把这周的价格战消化成了工作流:流传的 "Gauntlet 循环"让 Fable 5.1 这类贵模型只做架构和评审,写码放量的活压给便宜模型。哔哩哔哩旗舰当军师,国模当施工队,这可能是本周最实用的一个范式。
还有一层更根本的变化:你买的已经不是"模型",是"模型×harness"的组合。Anthropic 自己出文档承认过同一模型在不同客户端表现有差异,小红书 9 月 2 日那条"不是 Claude 笨,是你的 Harness 不行"说的就是这个。小红书DeepSeek 官方开源的 harness 则把这层能力做成了明牌:20.5 万 Star、MIT 协议、一周连发两个 alpha、52 项变更,“一切皆插件”,同一个客户端今天接灰测 DeepSeek,明天接 GLM-5.3-Flash,配置改两行。<#&!53#&!>哔哩哔哩Kimi API 本周也原生支持了 Codex 和 Claude Code 直连,不用挂中转。哔哩哔哩工具和解耦、模型随便换,正在从极客玩法变成套餐厂商的默认战场。
四、限额取消之后:从"额度焦虑"到"烧速焦虑"
国产套餐松绑听着是好事,但 delta255 那句"打窝结束"值得全文背诵。把三件事排在一起看:4 月小米用"无限额"打差异化,9 月阿里跟进取消 5 小时限额,同期知乎上"程序员自费买 token""公司 token 太贵开始限额"两个问题分别挂着 68 万和 96 万浏览——限额的本质从来不是防你用,是替你兜底。
上限撤了,账单从"固定月费+踩刹车"变成"敞口烧钱"。企业侧更早体会过这个荒诞:埃森哲内部吐槽被传开,公司每月巨资买 token,消耗大头居然是用 AI 把 PDF 转成 PPT,就像坐飞机去买早餐,花大钱办小事。知乎对个人是同一面镜子:额度自由之后,第一个该装的是逐笔 token 监控——知乎 9 月 3 日已经出现"月底查完账单"的实践帖——而不是更多 skill。知乎
五、四档人怎么接这波降价(对号入座)
Claude Code + 官方订阅/API 的重度用户:这是唯一"无需任何操作直接受益"的人群。长任务越多、上下文越大,缓存降价吃得越满。顺手做一件事:清掉一年没调用过的 skill 和 CLAUDE.md 冗词条目,把 cache 命中率当 KPI 看。
Astra/Fable 5.1 之间纠结要不要跳船的:别比榜单,比"单任务平均烧钱"。本周实测区已经给出标准动作,同一任务先比分镜、只试关键段、再决定整条的试法被反复引用。哔哩哔哩跨生态要额外算 harness 迁移成本——你的 MCP、插件、hook 配置能不能原样带走。
国产套餐用户:限额红利是真的,但按"上不封顶"过日子之前,先跑一周烧速基线;灰测白嫖通道(DSH 接 DeepSeek 0831 之类)当观察窗,不当生产环境。
还在观望要不要入坑的轻用户:这轮"能力×单位任务成本"的比拼对你最有利——等长程任务账单被打下来再进,比现在站队任何一家都划算。
继续盯四个信号:①国产模型跟不跟进缓存计价降价(Fable 5.1 这一刀切在 agent 用户命门上,跟进是大概率);②DeepSeek V4 Pro 灰测转正后的第三方复现(目前所有"吊打"结论都出自自媒体,无独立复现);③Astra 登陆更多入口后 Plus 档的实际限流;④DSH 这类开源 harness 的插件生态会不会反向被闭源工具吸收。
六、反证与保留
照例泼三盆冷水:本文引用的基准(Terminal-Bench 系列、AutomationBench)全部是官方口径,独立复现结果出来前看个趋势就好;B 站搬运实测不少内嵌 API 聚合站和课程推广,"XX 倍成本差"这类数字先默认打折;灰测模型的表现与正式版可能存在出入,本周所有基于灰测的对比都请当作预告片。证据覆盖到这里,结论就只能到这里:这轮真正的变化不是"谁降价了",而是价格战的战场从价目表挪到了账单结构——单价、缓存命中率、上下文重发次数,三个变量里厂商只动了后两个,而账单会替你记住。