在中文讨论区还在吵"Opus和GPT谁更强"的时候,开发者已经用脚投了票。
OpenRouter公开的30天应用用量数据(截至2026年8月中旬)里藏着一个很有意思的事实:Claude Code用量最大的模型不是Anthropic自家的,而是GLM 5.2——单模型3.14T token,占它前十流量的近一半;把Opus 4.8、Sonnet 5、Opus 5、Fable 5四个亲儿子全加起来,也才1.98T。 反倒是Codex,前十里约86%的量留在OpenAI自家模型上。Cline和Pi的头名,则都是DeepSeek V4 Flash。知乎
同一时间,加州大学伯克利分校和Arena的研究团队做了一项直接给这件事定性的研究,并且起了个扎眼的名字:HarnessTax,Harness税。结论用一句话说就是:同一个模型,换一套"壳",任务成功率几乎没变,账单却可能差出好几倍——你以为你在选模型,其实你一直在替壳交税。
先把词对齐:Harness到底是哪一层
Harness字面意思是挽具、马具。在AI编程语境里,它是包在模型外面的那层程序,负责把"生成token"变成"在你仓库里干活"。Claude Code、Codex CLI、Cursor、OpenCode、Cline、Pi,包括8月13日发布后一度刷屏的DeepSeekHarness,都是这一层的东西。
模型是发动机,harness是变速箱、底盘和刹车。它干的是模型自己干不了的五件事:组装上下文(决定哪些文件、哪几轮历史发给模型);定义并执行工具(让一次read_file真的读到文件);把关权限(rm -rf是直接跑、先问一句还是拒绝);管理恢复(补丁打不上、测试变红之后怎么办);保存会话状态(中断的任务能不能接着跑)。
所以两个人跑同一个模型,体验能差出十万八千里——不是玄学,是这五件事的配置全不一样。

21种组合实测:成功率几乎没差,成本差到5倍
HarnessTax研究的设计很克制:7个模型×3种harness(Claude Code、Codex CLI、Pi)共21种组合,在SWE-bench Lite和Terminal-Bench 2.0两个基准上各抽30个任务,每种组合每个任务跑3次,token成本按2026年9月1日的固定API价目表计算。 三个发现值得逐个看:知乎
发现一:换壳几乎不掉成功率,但真掉钱包。 在所测基准上,harness对成功率的平均影响在SWE-bench Lite上不超过±2个百分点,Terminal-Bench 2.0上约±5个百分点。但成本呢?Claude Fable 5在Claude Code里尝试成功率97.8%、平均花费1.33美元;在Pi里96.7%、0.67美元——成功率差1.1个百分点,价格差一倍。 按几何平均算,Claude Code的成本在SWE-bench Lite上约为Pi的2.0倍、Codex的1.6倍;两个基准合看,不同harness下的成本最高能差5倍。知乎
发现二:亲儿子组合,12次里有9次没拿到最好成绩。 在Anthropic和OpenAI的6个模型、2个基准构成的12组比较里,有9组的最高成功率出现在别家harness上。 最打脸的例子:GPT-5.6 Sol离开OpenAI自家的Codex去了Pi,在Terminal-Bench 2.0上成功率反而从78.9%升到83.3%,成本大约减半(0.42美元对0.76美元)。厂商嘴上说"针对自家环境优化",数据并不买账。知乎

发现三:极简壳摸到了帕累托前沿。 Pi只给模型四种工具——read、write、edit、bash,不搞MCP、不堆子agent,就靠干净的循环,在两个基准上都达到了成本-成功率前沿。研究还量出了税单的主要来源之一:Claude Code的平均初始上下文超过Pi的10倍,更长的系统指令和更大的工具schema,从第一次调用就开始计费。知乎

壳和壳的真差距,跑分看不见
伯克利量出了"贵",另一组九款harness横评则量出了"贵在哪"。他们在一个小Python仓库里埋了个真bug(重试函数catch的是HTTPError,而SDK抛的是RateLimitError,导致429分支永远进不去),让六个harness接同一个网关、同一个模型、拿到一字不差的提示词。结果最没意思:六个全说对了根因。有意思的是循环行为——Codex CLI、OpenCode、Cline先跑测试再回答,Claude Code、Reasonix、Pi靠读代码直接答;修完之后留下的那行没用的import,Codex在正文里点出来了,Claude Code在diff里悄悄删掉,另外四个原样留着。
最关键的一句:决定循环要不要自己验一遍补丁的是harness,而这六个一个都没验。 模型质量是入场券,循环在压力下的行为——改之前读没读对文件、diff收不收得住、测试挂了能不能爬起来——才是所有跑分都不报的那一项。这大概也解释了为什么"同一个模型,别人手里的AI一次过、我这里来回返工"会成为评论区高频抱怨。知乎
先泼三盆冷水,再说怎么选
结论说到证据覆盖为止,这篇也一样:
第一,这项研究只测了两个开源基准、各30个任务、终端场景,研究团队自己也承认模型可能在训练中见过这些题,其他负载上结果未必相同。 第二,真实大型代码库是另一回事——有工程师复盘称,AI在长上下文里存在过度工程化和"漂移":一个原本一天的需求,被包上防抖、兜底、提前设计的扩展之后可能变成1.5到2天。 代码库越大,幻觉和偏离越明显。壳的护栏挡不住这种臃肿,这是人和流程的活。第三,社区里从头到尾存在"造个harness不难"的反方声音,认为炒作大于工程门槛——但无论门槛高低,账单上的差价是实测存在的。知乎知乎
在这三条边界内,把"哪个工具最好"拆成两个问题——按控制循环挑壳,再单独挑模型——对普通用户其实就够用。上手前真正该问的只有四件事:跑在哪(终端可挂脚本SSH,还是编辑器内、独立客户端);模型能不能你自己说了算——这是整个品类最干脆的分界线,比任何跑分都更能预测你的账单和被锁定程度。Copilot、Cursor的agent模式要付费席位才能接自定义供应商,Antigravity不登录Google账号根本不开口。 靠什么扩展(hooks、子agent、MCP堆满,还是像Pi一样刻意留白);以及上面说的循环行为。知乎

分人群说:
纯入门的vibe coder:先用功能最全的第一方壳(Claude Code/Codex订阅),护栏、审批、开箱即用值这个钱;等你开始在意每轮开销,再回头看"税"。
中度单人开发者:这是收益最大的人群。挑一个允许自选模型的壳(Pi、Cline、OpenCode这一类),让模型成为一行配置而不是绑定关系——Claude Code的用户近半在跑GLM,你手里其实早有同样资格。
团队/生产环境:优先审循环行为:谁先跑测试、diff收不收得住、中断能不能续、权限怎么把关。成本第二,可控第一。
值得继续盯的信号:研究团队计划公开全部运行轨迹,并下一步在"需求会变、任务跨多个会话"的真实流程里评估harness、探索自动选壳;国产这一层也还在密集迭代——DeepSeekHarness发布一个多月就更新桌面端alpha,9月的讨论区从"热度过去了吗"变成了"已经上生产环境"。壳层竞争刚开始,现在下"谁赢"的结论都太早。
一个可以直接做的实验:把你现在用的模型原样挪进另一个壳,跑同一个任务,看一眼两边的成功率和你自己的钱包。Harness税这笔钱,交得糊涂不如交得明白。