单价一分没涨,Agent账单先降45%:这周AI编程的"降价",不在价目表里

源自53位全网作者

06:51

写给谁看:每天开 coding agent 干活、月底会瞄一眼 token 账单、要么自费要么被公司限额的重度用户。你已经知道什么是 Claude Code、Codex、token plan,这篇不再科普,只讲这周的三个价格信号分别跟你有什么关系、现在该动什么、什么别动。

一、三天里,"价格"这条线出了三件事

先摆事实,全部可对时间线:

  • 9月1日,Anthropic 发布 Claude Fable 5.1 和 Mythos 5.1,两版共用同一底层,后者只开放给经过审核的网络安全和生命科学机构。基准涨幅是官方口径:Terminal-Bench-Science 从 24.7% 到 52.6%,接近翻倍;Terminal-Bench 4.0 从 42.0% 到 55.8%;AutomationBench 从 17.1% 到 31.4%,官方称能连续跑数十小时复杂任务。小红书关键点不在分数:输入输出单价没动,动的是缓存读取价,直降 75%,到每百万 token 0.25 美元。小红书上一条整理帖算的账:典型任务整体成本约降 25%,高度 Agent 化的任务最高降 45%。

  • 同一周OpenAI 的 GPT-6 Astra 发布,和 Fable 5.1 前后脚隔一天,被搬运的海外实测里两家定价一致:输入 10 美元/百万、输出 50 美元/百万。哔哩哔哩用B站up主们的话说,“世界最强模型的头衔,这周换了两次主人”。Astra 已经进了 Codex,Plus 档就能用;前端和 3D 表现的实测视频是本周弹幕区最热闹的内容——程序员阿江那条两个全栈项目(在线表格+多机器人仓库调度)的对比拿到 1.7 万播放、134 条评论。哔哩哔哩哔哩哔哩

  • 9月5日,知乎问题"如何评价阿里 token plan 取消 5 小时限额"一天内冲上 5 万浏览。"5 小时滚动限额"是国产编码套餐的老规矩,今年 4 月小米 MiMo 发 TokenPlan 时,"没有 5 小时限额"就是头号卖点,四档 39 元起、采用统一 Credit 点数计费。微博半年后阿里把自家限额也撤了,等于套餐侧开始集体松绑。有个回答被顶在前面,话很损但很真实,打窝阶段已经结束了,小活一支烟,大活一包烟,上不封顶,都已经不会古法编程,回不去了。知乎

三件事指向同一个问题:账单的结构变了,但大多数人还在看单价。

二、价目表没变,砍掉的是"记忆税"

为什么单价不动,账单能降两到四成?得先承认一个多数用户没细想过的事实:agent 编程的 token 消耗大头根本不是"让模型写代码",而是反复重发上下文。

知乎 9 月 1 日有个 22 万浏览的回答把机制拆穿过(作者 pansz,251 赞):一个命令走 200 步,第 200 步时,第 1 步的上下文已经被原样发送了 199 遍。知乎烧 token 的本质是"给模型买记忆",他给的量级感也值得抄下来:一个程序员 prompt 基本盘 2M token,一天 100 个请求就是 2 亿;"1M 上下文"不是总共用 1M,是当前每次调用都要带上 1M;一个提示词几十个工具调用,加起来几十 M 很正常。所以为什么 token 要用 M 计量?“只有用 M 为单位的时候,它看起来才是个正常的数值。”

看懂这个,Fable 5.1 的降价就不是"降价",是定向补贴:长任务=同一份上下文被反复读取,缓存读取价就是重发次数的乘数。砍掉 75% 的缓存价,等于专挑"高度 Agent 化"的用户给优惠——越重的活,降得越多(最高 45%)。这跟本周 B 站另一条"装了一年 73 个 skill,/skill-doctor 一查全是 0 次调用,cache 命中率从 40% 回到 78%"的讨论正好是同一枚硬币的两面。哔哩哔哩命中率就是钱。

一句可直接背走的判断:任务成本 ≈ 表观单价 × 上下文长度 × 重发次数。厂商这三周全在第三个变量上做文章,而社区讨论还停在第一个变量上吵谁便宜。

三、“同价不同账”:选型该换坐标系了

单价一样的两个旗舰,账单不一定一样。本周各家实测的口径高度一致:跑分接近,烧钱差很多。几条被反复提到的信息——

  • NixAI 那期 GPT-6 Astra vs Fable 5.1 给出的原版结论是,分数、实际体验和 token 成本之间有差距,高分模型未必是日常首选。哔哩哔哩

  • 创哥的 AI 实验室做了 DeepSeek V4 Pro vs Fable 5.1 三个同题编程挑战,标题的追问很扎心:当成本相差几十倍甚至两百多倍时,我们到底多得到了什么?哔哩哔哩注意,那是灰测模型对旗舰,差距换来的是稳定性,不是玄学。

  • 74,000 行代码库上的语义层建模实测(海外博主 DukePan,有中配搬运):Fable 5.1 最细,产出设计文档+迁移计划+四选项矩阵,但单次任务成本近 8 美元、15-16 分钟。哔哩哔哩

  • 海外圈已经把这周的价格战消化成了工作流:流传的 "Gauntlet 循环"让 Fable 5.1 这类贵模型只做架构和评审,写码放量的活压给便宜模型。哔哩哔哩旗舰当军师,国模当施工队,这可能是本周最实用的一个范式。

还有一层更根本的变化:你买的已经不是"模型",是"模型×harness"的组合。Anthropic 自己出文档承认过同一模型在不同客户端表现有差异,小红书 9 月 2 日那条"不是 Claude 笨,是你的 Harness 不行"说的就是这个。小红书DeepSeek 官方开源的 harness 则把这层能力做成了明牌:20.5 万 Star、MIT 协议、一周连发两个 alpha、52 项变更,“一切皆插件”,同一个客户端今天接灰测 DeepSeek,明天接 GLM-5.3-Flash,配置改两行。<#&!53#&!>哔哩哔哩Kimi API 本周也原生支持了 Codex 和 Claude Code 直连,不用挂中转。哔哩哔哩工具和解耦、模型随便换,正在从极客玩法变成套餐厂商的默认战场。

四、限额取消之后:从"额度焦虑"到"烧速焦虑"

国产套餐松绑听着是好事,但 delta255 那句"打窝结束"值得全文背诵。把三件事排在一起看:4 月小米用"无限额"打差异化,9 月阿里跟进取消 5 小时限额,同期知乎上"程序员自费买 token""公司 token 太贵开始限额"两个问题分别挂着 68 万和 96 万浏览——限额的本质从来不是防你用,是替你兜底。

上限撤了,账单从"固定月费+踩刹车"变成"敞口烧钱"。企业侧更早体会过这个荒诞:埃森哲内部吐槽被传开,公司每月巨资买 token,消耗大头居然是用 AI 把 PDF 转成 PPT,就像坐飞机去买早餐,花大钱办小事。知乎对个人是同一面镜子:额度自由之后,第一个该装的是逐笔 token 监控——知乎 9 月 3 日已经出现"月底查完账单"的实践帖——而不是更多 skill。知乎

五、四档人怎么接这波降价(对号入座)

  1. Claude Code + 官方订阅/API 的重度用户:这是唯一"无需任何操作直接受益"的人群。长任务越多、上下文越大,缓存降价吃得越满。顺手做一件事:清掉一年没调用过的 skill 和 CLAUDE.md 冗词条目,把 cache 命中率当 KPI 看。

  2. Astra/Fable 5.1 之间纠结要不要跳船的:别比榜单,比"单任务平均烧钱"。本周实测区已经给出标准动作,同一任务先比分镜、只试关键段、再决定整条的试法被反复引用。哔哩哔哩跨生态要额外算 harness 迁移成本——你的 MCP、插件、hook 配置能不能原样带走。

  3. 国产套餐用户:限额红利是真的,但按"上不封顶"过日子之前,先跑一周烧速基线;灰测白嫖通道(DSH 接 DeepSeek 0831 之类)当观察窗,不当生产环境。

  4. 还在观望要不要入坑的轻用户:这轮"能力×单位任务成本"的比拼对你最有利——等长程任务账单被打下来再进,比现在站队任何一家都划算。

继续盯四个信号:①国产模型跟不跟进缓存计价降价(Fable 5.1 这一刀切在 agent 用户命门上,跟进是大概率);②DeepSeek V4 Pro 灰测转正后的第三方复现(目前所有"吊打"结论都出自自媒体,无独立复现);③Astra 登陆更多入口后 Plus 档的实际限流;④DSH 这类开源 harness 的插件生态会不会反向被闭源工具吸收。

六、反证与保留

照例泼三盆冷水:本文引用的基准(Terminal-Bench 系列、AutomationBench)全部是官方口径,独立复现结果出来前看个趋势就好;B 站搬运实测不少内嵌 API 聚合站和课程推广,"XX 倍成本差"这类数字先默认打折;灰测模型的表现与正式版可能存在出入,本周所有基于灰测的对比都请当作预告片。证据覆盖到这里,结论就只能到这里:这轮真正的变化不是"谁降价了",而是价格战的战场从价目表挪到了账单结构——单价、缓存命中率、上下文重发次数,三个变量里厂商只动了后两个,而账单会替你记住。

内容由AI生成

精选参考来源

1. 代码模型又降价了?

2. GPT-6 Astra与Fable 5.1首发对比:社区实测与基准数据梳理|GPT-6 Astra vs Fable 5.1 - The AI War Beg…

3. GPT6 Astra 发布实测,对比 Claude Fable 5.1,两个全栈项目实测

4. gpt6 astra对比 fable5.1 kimi k3

5. #小米MiMo大模型首次推出TokenPlan#面向开发者和养虾爱好者的 AI 大模型调用套餐,没有行业普遍存在的5小时 token 使用限额,支持集中消耗 token ,能为大容量套餐用户带来更高强度的养龙虾、编程体验。国产AI越来越懂普通人需求了

6. 如何评价阿里token plan取消5小时限额?

7. 程序员每天消耗几千万上亿的Token,到底产出了什么?

8. 73个skill吃灰一年?v2.1.261一招找出白装的

9. GPT-6 Astra 全面实测:和 Fable 5.1 正面对比,谁才是真正赢家?

10. DeepSeek V4 Pro vs Fable 5.1:国产大模型距离国外顶尖模型还有多远

11. Fable 5.1 大战 GPT-6 Astra:在 74,000 行代码上的实测对比 | Duke Pan

12. [中配]Claude Fable 5.1太贵?用Gauntlet循环和子代理策略,低成本榨干顶级模型价值

13. 不是Claude笨是你 的Harness不行

14. 【开源项目】DeepSeek 官方 Agent 框架一周两版连发,52 项变更都在打磨什么?

15. Kimi API原生支持Codex和Claude Code:三步直连国产模型

16. 网传一些公司因为token太贵开始限额了,会重返「古法编程」吗?AI全栈可行性如何,只适合大公司吗?

17. 月底查完 AI 编程账单,我终于决定把每笔 Token 都看明白

18. GPT-6 Astra vs Fable 5.1|实测学会怎么选

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章