这周AI编程圈发生了三件事,单看都不挨着,拼在一起指向同一个结论。
第二件:10月6日,多家媒体援引知情人士报道,微软把内部使用Claude的年度预算预期(此前预计至少10亿美元)砍掉了超过三分之一,Meta内部用Claude Code的员工从年初约6万人降到了约3万人,腰斩。第三件:开源极简编程Agent Pi在10月1日发布1.0,GitHub约11.1万星,官方称全球每周有数十万人在用。
三件事说的是同一句话:模型决定智力水平,外壳决定你为这份智力付多少钱。而过去我们挑工具,几乎只盯着模型。
一份研究,把"壳"的税单摊开了
先解释一句什么是Harness(外壳/驾具):模型之外,让模型能真正干活的那一整套东西——系统提示词、工具定义、上下文管理、执行环境、任务调度。Claude Code、Codex CLI、Cursor,都是套在模型外面的壳。
ArenaAI联合伯克利Sky Computing实验室方向的这份研究,测了21组"模型×外壳"组合:7个模型,分别装进Claude Code、Codex CLI和Pi三个壳里,在SWE-bench Lite和Terminal-Bench 2.0两个基准上各随机抽30个任务,每组跑3次。结果挺扎心:微博知乎
换外壳,成功率只浮动±2%(SWE-bench Lite)到±5%(Terminal-Bench 2.0);但成本最大差距达到5倍。
跨模型平均看,Claude Code的成本约为Pi的2.0倍、Codex CLI的1.6倍(SWE-bench Lite口径);Terminal-Bench上约为Pi的1.5倍。
最典型的对照组:Claude Fable 5装进Claude Code,解出97.8%;装进Codex和Pi都是96.7%——只差1.1个百分点,但成本是1.33对0.67,贵了整整一倍。
干活轮数几乎一样:Fable 5跑SWE-bench Lite,Pi平均15.4轮,Claude Code平均15.3轮。同样的轮数、几乎同样的成功率,一倍的钱。
12组"Anthropic/OpenAI模型×两个基准"的对比里,有9组是"别家的壳"拿下最高实测成功率。
钱是从哪儿多出来的?从第一次调用就开始了。7个模型里,Claude Code的平均初始上下文都超过Pi的10倍——更长的系统指令、更大的工具schema。B站的解读视频给了个具体数:首次调用约2.7万token的框架开销。Pi呢?默认只给模型4个工具:read、write、edit、bash,别的一概不带,却在这份研究的两个基准上都站上了帕累托前沿。哔哩哔哩知乎

有个知乎作者把这笔账总结得很到位:超出Token效率最优解的那部分钱,就是"Harness税"。他还补了一刀(这是他的观点,不是研究结论):Claude Code的高消耗未必是没想到优化,更可能是"利用暂时的垄断地位收取高溢价"——模型认可度加用户习惯,构成了收税的底气。知乎
需要说清口径:这个"2倍"是按2026年9月初的API标价对token量计价的,不等于任何人的真实账单——提示词缓存、折扣、订阅制都会改变实际数字。但"初始上下文差10倍"这个结构性差距,缓存并不能完全抹平,因为缓存输入也要按折扣价计费,而且长指令在每个新会话都要重新加载。哔哩哔哩
大公司已经开始"抗税"了
如果说研究还只是实验室里的账,微软和Meta的动作就是真金白银的投票。
微软这边,高管今年早些时候预计公司内部使用Anthropic技术的年度支出至少10亿美元,随后要求员工减少使用Claude、更多用自研AI工具,预算预期直接下调超过三分之一。Meta这边更有意思:内部Claude Code用户从年初约6万降到近期约3万,除了春季裁员约10%的因素,更主要的原因是自家工具顶上来了——内部工具MetaCode用户已超3万,对外测试的MuseCode也有超6000人在用。据报道,Meta还专门设了预算和监控,防止员工超用。微博微博
这两条新闻对你我这种个人订阅用户的意义,不是"大公司自研了所以我们也要自研",而是一个信号:当token开销大到一定规模,第一个被审视的不是模型,而是壳。壳的溢价在企业尺度上是亿美元级的,在个人尺度上,就是你的账单和周限额。
Pi:这轮"抗税"的样板,但别急着封神
被研究反复拿来当"低税样板"的Pi,值得单独说说。它是Mario Zechner(GitHub ID:badlogic)写的终端原生开源编程Agent,也就是前几个月爆火过的OpenClaw背后的引擎——OpenClaw的声量下去了,Pi反而越跑越快:仓库迁到earendil-works名下,约11.1万星、1.4万Fork,官方称每周有数十万人在使用(官方口径,姑且听之)。知乎

10月1日的1.0版本干了两件有戏剧性的事。
一是MCP立场大反转。Pi曾把"不支持MCP"骄傲地写在README里,作者还专门写过文章质疑"你真的需要MCP吗"。结果1.0把MCP收进了核心、默认开启,官方还发了篇自我打脸的解释文,标题就叫《You Said No MCP!》。理由说白了是:世界变了,MCP的改造顺带让整个工具装载架构变得更好。
二是Codemode,这才是省token的真家伙。传统方式是把每个MCP工具的schema都塞进上下文(实测约580 token/工具,还每轮重复加载);Codemode让模型写一段JavaScript,在沙箱里并行、批量地调工具,只把最终输出带回上下文。知乎有作者跑了对照实验:20个MCP工具的场景,首请求token省72%;带120KB日志分析的完整任务,累计省82%——120KB的日志过滤完,回到上下文的只有275个字符。官方口径是单请求提示词从约5300 token降到约3300。官方演示的一个例子里,Codemode跑了331次以上工具调用,中间结果一个字都没进模型上下文。知乎知乎
社区的真实声音也在。有从Claude Code转过来的用户说,最爽的是Pi上下文满了会自动压缩接着干,而Claude Code直接甩一句prompt too long停下,“我希望转头过去已经有结果,而不是看到报错”。但反面同样真实:1.0把界面改成全屏TUI后,home/end键被改成了翻页回顶回底、右键粘贴行为也变了,知乎上有老用户直接开骂"难用的要死",最后还是让AI帮他把按键改回去。加上只有终端形态、没有VSCode集成,对习惯IDE的人是实打实的门槛。微博知乎

顺带一提,这股"壳竞赛"是全行业的:Claude Code推了Mods、Codex更新插件系统、DeepSeek Harness(DSH)搞"一切皆插件"且国庆刚发了桌面版v0.2。微博上有博主总结得准:所有超级Agent都在做让用户自己叠功能的插件体系,只是作用位置各不相同。微博

这笔账,按你的付费身份算
研究是宏观的,账是每个人自己的。分四类说:
API按量付费党:税是现金,最该算。同样的模型、同样的任务,壳选低税的,账单立省一半量级。两条路:整体换Pi/Codex CLI,或者保留模型偏好、只换壳——把Anthropic的API key接进Pi这类第三方壳,正是那位知乎作者的建议:“要用Anthropic的模型,也要用其他的Harness驱动,才能获得高性价比”。注意研究口径是标价计价,你的实际节省取决于缓存命中率,先拿自己的典型任务跑一周对照,再决定搬不搬家。知乎

订阅党(Pro/Max):税以限额的形式收。你不按token付钱,但10倍初始上下文意味着同样的周限额,被壳吃掉的速度完全不同——你感觉"这周怎么这么快就用完了",一部分答案就在这2.7万token里。频繁撞限额的人,可以把Pi+同一个模型的API计费当"溢出通道":日常重活走订阅,撞墙后的长尾任务走轻壳。
团队/企业:学微软的动作,不必学微软的自研。自研壳的投入你复制不了,但"壳采购"思路可以:同一笔模型预算,优先给token效率高的壳;给用量设监控和预算线——Meta连这个都专门建了系统。
轻度用户/非工程师:别被带节奏去装终端工具。Pi的门槛是真实的:终端、手动配MCP、社区插件自装自管。如果想低成本低门槛试试水,DeepSeek Harness桌面版是免费的、双击就能装——但也提醒一句,知乎上有用户反馈DSH"烧token烧得挺多",免费的是壳,不免费的是模型的量。知乎
三盆冷水,泼给想立刻搬家的人
第一,1.1%的成功率差不是零。研究里Claude Code在自家模型上确实拿到了最高成功率(97.8%对96.7%),贵一倍换来的那一点点稳定性,在关键项目上可能值回票价。省钱的壳适合修bug、写脚本、批量任务;架构级的活,你愿意为"少翻车一次"付的溢价,只有你自己知道。
第二,harness红利可能被下一代模型吃回去。这不是新观点——早在今年5月,社区就有讨论指出:壳层面的优化空间,会被更强的模型(更长上下文、更便宜的token、更好的原生工具调用)逐步蚕食。今天为Pi省下的token,明天可能是模型降价直接送你的。搬家前想清楚:你是在做一次长期迁移,还是一次短期套利。知乎

第三,迁移成本是真的。MCP配置倒是能整段从Claude Desktop/Cursor抄过来(Pi用的就是标准mcpServers结构),但习惯、Mods插件、团队流程搬不动。Pi 1.0连按键布局都能惹恼老用户,说明"极简"的代价是很多东西要自己搭。知乎
接下来盯什么
Claude Code会不会"减税":系统提示词和工具schema瘦身,是这份研究发布后最直接的观察点。减了,说明竞争起作用了;不减,"故意设计"的说法就多一分佐证。
Pi的下一步:社区已经在聊Pi 2.0,配套的PiDurable(断点续跑的实验包)如果转正,长任务场景的账会重新算。
微软、Meta的自研壳会不会对外:MetaCode和MuseCode目前一个对内一个内测,放开的话,壳市场会从"三家比价"变成真正的红海。
更多复现数据:单一研究的5倍差距值得警惕也值得验证,等更多模型、更多任务类型的第三方复现出来,再做大搬家不迟。
最后说句谈资。以前饭桌上聊AI编程,问题是"你用什么模型";这周之后,内行的问题变成了"你用什么壳"。因为研究已经说明白了:模型之间那点成功率差距,远小于壳之间的价格差距。你多付的那部分钱,买的到底是智力,还是税——这笔账,值得每个续费前的人算一遍。
校验提示文案
校验提示文案