先看四行数字。这是 Terminal-Bench 2.1 公开榜单上的成绩,准确率旁边多了一列成本:
Claude Code + Fable 5:成功率 83.8%,成本 552.67 美元
Codex + GPT-5.5:成功率 83.1%,成本 2059.19 美元
Codex + GPT-5.6 Terra:成功率 78.4%,成本 421.15 美元
Codex + GPT-5.6 Luna:成功率 75.7%,成本 241.45 美元
前两行,分数只差 0.7 个百分点,账单差出将近 4 倍。后两行,Luna 比 Terra 低 2.6 分,价钱却便宜一半。分数和账单,已经不成正比了。新智元

这是基准测试环境里的评测成本,不是你我的月度账单,但它暴露的问题是一样的:用"每百万 token 多少钱"给 AI 编程工具定价的时代,快结束了。现在该问的是:让它把一件事做完,到底要花多少。
发生了什么:官方只降价 20%,账单却少八成
8 月 24 日,OpenAI 和 AWS 公布了一项联合测试结果:GPT-5.6 Terra 在 Kiro(AWS 的开发智能体平台)里,于 Terminal-Bench 2.1 上"每成功完成一个任务的成本"降低了约 82%。知乎
而 Terra 最近一次官方调价是 7 月 30 日,幅度只有 20%。新智元中间多出来的那六十多个百分点,是从哪省出来的?
答案是弯路钱。
Agent 写代码和自动补全不是一种花钱方式。智能体把任务做砸一次,账单照记;中途选错路径、跑偏三轮再回头,这些 token 也照收。OpenAI 官方把效率拆成三层:发起请求、组织上下文的智能体框架,中间调度请求的编排系统,最后才是 GPU 上跑的模型本身。还有一层省法叫模型分工:先用高档位的 Sol 把问题想清楚、把计划定下来,再换轻量的 Luna 去实施改动、写测试、跑评估,同一条流水线上不同环节配不同档位的智能。

Kiro 本身是 spec-driven 的:不许上来就写代码,先把含糊的需求拆成需求文档、技术设计和任务清单,再加两道闸——代码真正修改前停下来让人过一眼,活干完后自动跑一轮测试。每拦下一次返工,省的都是真金白银。
你算过的账,可能只算了第一层
社区里早就有人开始算账了。小红书上有帖子把各家订阅和 API 统一折算成"每 1 亿 token 花多少人民币"来排序。小红书也有人晒出用 Claude 加 DeepSeek 写网站、五个小时烧光六十多块钱的血泪教训。小红书

这些算法都是第一层账:token 单价。但这次榜单暴露的是第二层:每成功任务成本。
单次调用价格决定每一步多贵,弯路、重试、失败和返工决定你要走多少步。单价便宜但天天跑偏的,总账单可能比单价贵但一次走对的高得多。8 月 25 日知乎上一篇专门拆解此事的文章说得清楚:82% 证明的是"组合优化有机会省钱",它不是降价公告。
82% 别直接带进你的预算表
这 82% 得捏着看,它至少有五个限定条件:
只代表 Terra,不代表 GPT-5.6 整个家族;
只在 Kiro 里成立,模型没有脱离工具、提示词和工作流;
只代表 Terminal-Bench 2.1 的命令行任务场景,不自动覆盖你的遗留仓库、微服务依赖和团队交付标准;
分母是"成功任务",失败烧掉的钱全在分子里;
这是 OpenAI 和 AWS 的联合测试,不是独立第三方复现,而且没公布比较基线、绝对成本和样本细节。
所以正确的姿势是:把 82% 当成去做一组对照实验的理由,而不是写进预算表的依据。知乎
四步重算你自己的账
与其围观别人的百分比,不如给自己算一次:
第一步,固定任务集。从自己的待办里挑一组边界清楚的真实任务:新功能、跨文件修改、缺陷修复、测试补齐,别只挑 AI 擅长的。
第二步,定义成功。"代码能跑"不算成功,至少要满足:需求对上了、测试通过、审查能过、一周内不返工。
第三步,记全成本。模型用量、失败尝试、工具调用、你人工审查花的时间,一样都不能漏。有人让 AI 跑一个长程任务,AI 预估执行 5 天,实际跑了两天半,最后一算花了 2000 多块——失败尝试的钱,不能从账本里消失。小红书

第四步,看三个数。任务成功率、每成功任务成本、达到成功花的时间。只盯其中一个,总会被质量、成本或速度里的某一项骗到。
谁该动,谁先别动
自己掏订阅的个人开发者:不用急着换平台。Kiro 这套真正值得抄的不是模型,是流程——先把规格写清楚再动手,关键节点设闸,重模型做规划、轻模型做执行。账单上最大的漏洞是返工,这三件事都能堵。真想试 Kiro 加 GPT-5.6 的先看清楚门槛:目前只对 Pro 及以上用户渐进开放,区域只有美国弗吉尼亚北部和法兰克福,而且思维链是隐藏的,你看不到它的推理步骤。新智元
准备采购的团队:把评估标尺从 token 单价换成单位产出,质量、成本、速度、责任边界并列进评估表。行业风向也在变:AWS 已经把三档 OpenAI 模型和 Claude 并排塞进了同一个模型选择器。知乎上也开始出现"亚马逊内部推广 Kiro、限制 Claude Code 对员工效率有何影响"这样的讨论。知乎两家前沿模型在同一个采购清单里互相压价,这在一年前很难想象。
先观望的人:留三个观察信号——有没有独立第三方复现 82%、Kiro 何时全量开放并扩大区域、Anthropic 怎么接成本这个话题。大背景是整体环境在变贵:DeepSeek 刚大幅涨价,OpenCode 的 CEO 都出来解释成本了。连 Rust 社区都在给 AI 编程立"能用多少"的新规。36氪
最后说一句:以前买 AI 编程,问的是"这个模型每百万 token 多少钱";现在该问"让它把这件事做完,我要花多少"。一句话的差别,账单能差出 4 倍。已经有像 KiloBench 这样的新基准,公开质疑每百万 token 定价反映不了用户实际支出。知乎计价口径的迁移,可能才刚刚开始。