问AI一句"1+1",主流那款终端编程智能体还没开口,先递出去两万八千个Token;换成一个只有四个工具的轻量壳,只要一万上下。这是B站UP主"不确定体验局"10月7日在自己机器上一笔一笔量出来的:清掉一百多个技能插件,几乎没省;拿掉自己写的规则文件,省了七千二;剩下两万多,是工具出厂自带的。哔哩哔哩
同一天,知乎上"什么是Harness税"的回答刚被顶上热榜;往前翻三天,ArenaAI那组21个"模型×外壳"组合的实测被各家AI编程群转了个遍;再往前一周,OpenAI把200美元档的额度砍了一半。三件事凑在一起,指向同一个被绝大多数订阅者忽略的事实:你AI编程账单的大头,可能从来就不是"模型贵",而是你套在模型外面的那层壳,和那根你永远看不见金额的额度进度条。这篇不聊"AI会不会取代程序员",只算三本账,适合正在纠结续费、升级Claude Max还是ChatGPT Pro的付费用户。
第一本账:外壳拿走第一刀
ArenaAI的实验设计很朴素,覆盖7个模型、3个Harness(Claude Code、Codex CLI、开源的Pi),在SWE-bench Lite和Terminal-Bench 2.0各随机抽30个任务,每组跑3次。知乎
知乎用户wangleineo在10月3日的科普里把结论拆得很干净,核心就一句话:换外壳,成功率只浮动±2%(SWE-bench Lite)到约±5%(Terminal-Bench 2.0),但成本最大能差5倍。知乎
最扎心的样本是Claude Fable 5:在Claude Code里解题率97.8%,换进Codex和Pi是96.7%,只差1.1个百分点,但Claude Code的花费是1.33对0.67,贵了整整一倍。平均下来,Claude Code的成本约为Pi的2.0倍、Codex的1.6倍。多出来的钱从第一次调用就开始烧:7个模型里,Claude Code的平均初始上下文都超过Pi的10倍以上,靠的是更长的指令和更大的工具schema。知乎
而Pi只给模型4个工具——read、write、edit、bash——却在两个基准上都站上了帕累托前沿;在6个Anthropic/OpenAI模型乘以2个基准的12组对比里,有9组是"别人家的Harness"拿下最高实测成功率。wangleineo由此下了个不客气的判断:Claude Code的高Token消耗很可能是一种故意的设计,利用模型认可度和用户习惯的暂时垄断收溢价。这句是个人推论,不是研究结论,信不信由你。知乎
但两件事是可核的:同一模型换壳,成本差确实到倍数级;官方订阅页只给你几根进度条,从不告诉你外壳先扣了多少。模型决定智力水平,Harness决定你为这份智力付多少钱——挑编程Agent时,这是比"选哪个模型"更前置的问题。知乎
第二本账:进度条背后的金额
外壳是工具收的,额度是厂商藏着的。10月7日刷屏的知乎文章"深扒Claude vs ChatGPT额度"里,作者引用了研究机构SemiAnalysis的做法:把OpenAI、Anthropic在内九家厂商的订阅额度逐个实测,反复发请求、盯着进度条,每次烧完记录消耗的token,再按各家官方API标价折成美元。知乎
折算结果差距相当直白:200美元的Claude Max 20x配Opus 5.5,一个月等价API用量约11726美元,折合人民币将近8万;同样200美元的ChatGPT Pro配GPT-6.1 Sol,只有2084美元——相差5倍还要多。知乎
但这5.6倍要拆开看,这也是本篇替你做的去噪:Claude Opus 5.5的API单价(每百万输入4美元/输出20美元)恰好是GPT-6.1 Sol(2/10)的2倍,所以其中2倍是"标价贵",剩下2.8倍才是订阅实打实多给的token——按token直接比,Max 20x配Opus一个月约286亿,Pro配Sol约102亿。原作者自己从9月中旬起用Claude Code日志连续两周对同一个账号记账,和SemiAnalysis的数字"基本吻合",两边独立方法得出同一结论,这组数目前可信度较高。知乎
表里还有三个对个人决策更实用的数字:
档位之间不打折,窗口才是真消耗。所谓"20倍"指的是5小时窗口更宽,不是token单价更低。原作者专门把5小时额度烧完过一次,消耗4亿token,按API标价折算超过300美元——一个窗口就烧回了整月的订阅费。只有经常把5小时窗口烧满的人,升级才有意义。知乎
模型之间有汇率。Max 20x里全用Sonnet 5.5值12529美元、用Opus 5.5值11726、用Fable 5.1只值2485且最多占一半额度。同样的订阅费,Opus换回的用量是Fable的4.7倍,而Anthropic官方自己说Opus 5.5大部分任务与Fable 5.1同级——主力用Opus/Sonnet、Fable只啃硬骨头,是唯一不亏的用法。
这是一场"健身房经济学"。SemiAnalysis估算,订阅只给Anthropic带来约10%收入,却吃掉近42%推理算力;同一兆瓦算力,卖API收入1亿多美元,卖订阅只有1600万。Max 20x配Opus,只要用户平均用量超过额度的20%,Anthropic就开始亏钱——所以砍额度是迟早的动作。
第一刀已经砍下来了:9月29日,ChatGPT Pro 200美元档用量从20x降到10x,关闭前订阅的存量用户补偿价值2500美元的额度,同时OpenAI顺手推出25x用量的500美元Pro新档。微博上有用户的反应很真实:“两个账号一个月200美金,额度也不够用,充值了70美金,猜猜用了多久,就30分钟。”微博
第三本账:你自己能控制的那一段
前两本账是别人的定价和别人的壳,第三本账在你手里。开发者Miaa在9月29日公开了团队的全流程Agent工作流降本实录:1个主调度加6个子Agent,跑一个中等需求要20多次子Agent调用,钱烧得很快但完全不知道烧在哪。先上度量工具把每轮token拆开,发现大头就三类:系统提示词、工具返回信息、历史消息。知乎
他们的改法普通用户也能抄,而且每项都有实测数字:把只在特定场景才用的模板、规则挪出常驻提示词、按需加载,按Anthropic的渐进式披露思路,装了20个Skill初始加载也只有1000-2000个token;让重数据查询走子Agent、只回传结构化摘要,同一工作流单轮输入从1,030,000降到634,905,降了38.4%;测试、视觉对比这类规则性强的角色换成成本约为Sonnet 36%的国产多模态模型,该角色开销直降六成。整体全流程预估降本50%到65%。知乎
对照开头那个实验:出厂壳贵,是工具的事;而会话里滚雪球的历史消息、塞满上下文的无关文件,是用法的事。普通用户最省钱的三个动作,按见效速度排:长会话勤开新session,别舍不得丢弃陈旧上下文;把配置文件里的大段规则文件和用不上的MCP清一遍;重复的脏活(跑测试、查日志)交给便宜的模型或轻量壳,只有要判断的环节动用主力模型——“贵的动脑子、便宜的动手”。哔哩哔哩
四档人对照着办
每天问答、偶尔写点小脚本的轻度用户:20美元档够用。Claude Pro、Max 5x、Max 20x三档每1美元换到的API用量一样多,最便宜的Pro档一个月也能用出约1178美元等价的Opus,你大概率连5小时窗口都摸不到,别为"更多token"升档。知乎
以AI编码为主力的中度用户:先查自己每一轮的初始上下文里,规则文件、MCP、技能各占多少,再谈续费;主力放Opus/Sonnet,Fable按4.7倍汇率的账只留给硬骨头;重复性子任务可以试试工具集更小的轻量壳。
跑多Agent长流水的重度或团队用户:没有度量就没有优化,先把各类消耗拆开看,再决定买不买更贵的订阅——同样的任务,降本的杠杆主要在你手里,不在套餐里。
在纠结要不要买显卡本地跑的:10月7日有UP主用RTX 4090和Mac M5 Max实测多款本地模型,从速度、代码质量、工具兼容性和成本四个维度对比云端订阅,结论相当坦率:95%的人应该用云端,本地只适合隐私刚需。买卡预算先缓一缓,这笔钱够付好几年的顶配订阅。哔哩哔哩
最后
这轮涨价、砍额度、改名都不新鲜,新鲜的是两件事第一次被量化:外壳的税(1.1个百分点的成功率浮动,2到5倍的成本差)和额度的真实汇率(5.6倍拆成2倍标价加2.8倍用量)。AI编程的消费决策正在从"买哪个套餐"变成"模型×外壳×自己的上下文管理"的三项乘法。接下来值得盯的信号:各家会不会公开额度条对应的token数;Claude Code要不要把出厂初始上下文压下来;OpenAI的重置机制会不会再动;以及Pi这类四工具极简壳在真实项目里的口碑。账单的第一行是定价,第二行是壳的计费表,第三行是你自己的习惯——三本账都算完,再决定要不要按下那个"升级"按钮。
(说明:本文外壳成本结论来自ArenaAI基准测试经知乎用户wangleineo转述,SWE-bench类任务与真实复杂工程的差距可能不同;订阅金额折算依赖各厂API标价与SemiAnalysis及个人的实测记录,厂商官方从未披露真实额度,所有数字请以自己账号日志复测为准;文中UP主实测为小样本个人实验,量级与研究结论互相印证,但精确数字因环境与配置而异。)