先说个能让不少人心里一咯噔的实测:同样在终端里问一句"1+1",某款主流 AI 编程工具还没开始答题,光"开场白"就先烧掉两万八千个 token,而极简工具 Oh My Pi 只需要一万上下。有 UP 主把这两万八拆开量了一遍:清掉自己装的一百多个技能插件几乎没省,删掉自己写的规则文件省了七千二,剩下两万多,全是工具出厂自带的。哔哩哔哩
你为这句"1+1"付的钱,大头没花在模型思考上,花在了模型外面那层"壳"上。
这层壳,最近有了个专门的名字——Harness(马具/外壳),而多付的那部分,被社区叫作"Harness 税"。过去半年大家还在比"谁的模型写代码更准、上下文更长",这两个月风向突然调转:开始比谁的外壳更省 token。
一、“模型 + Harness = 智能体”,税就藏在等号右边
先把概念说清楚,不然后面全是玄学。
Harness 不是模型,也不是训练框架,而是模型之外的全部工程部分:系统提示词、工具定义、上下文管理、记忆、子 Agent 调度、权限、交互界面……社区给的公式很直白——模型 + Harness = 智能体。同一个模型,塞进不同的 Harness,就是两个脾气、两副账单的产品。知乎
那"Harness 税"是什么?一句话:在能把活干成的前提下,最省 token 的那个外壳所花的钱是"底价",你实际多付的部分,就是税。
这个概念之所以这周突然刷屏,是因为它第一次被一组严肃实验量化了。
二、Arena 的 21 组对照:准确率差几个点,成本能差 5 倍
Arena AI 做了一组很"较真"的实验:21 组"模型 × Harness"组合,覆盖 7 个模型 × 3 个外壳(Claude Code、Codex CLI、Pi),在 SWE-bench Lite 和 Terminal-Bench 2.0 上各随机抽 30 个任务,每组跑 3 次。UC Berkeley Sky Computing Lab 的博士生 Melissa Pan 也在解读这套结果。哔哩哔哩
结论有点反直觉,我把它摊成一张表你看:
对比维度 | 换外壳带来的变化 |
|---|---|
任务成功率 | 只浮动 ±2%(SWE-bench Lite)到约 ±5%(Terminal-Bench 2.0) |
花费成本 | 最大差距达 5 倍 |
Claude Code vs Pi(跨模型均值) | Claude Code 约为 Pi 的 2.0 倍、Codex 的 1.6 倍(SWE) |
首次调用的初始上下文 | Claude Code 平均 >10 倍于 Pi(更长指令、更大工具 schema) |
换 Harness,成功率浮动只有 ±2% 到约 ±5%,但成本最大的差距达到 5 倍。知乎

最典型的一个例子:Claude Fable 5 这颗模型,在 Claude Code 里解出 97.8%,在 Codex 和 Pi 里都是 96.7%——差 1.1 个百分点,但 Claude Code 这一趟花了 1.33 美元,Pi 只花 0.67 美元,贵了整整一倍。跑的轮数几乎一样(15.3 vs 15.4 轮),多花一倍的钱,买来 1.1% 的成功率。更扎心的是,在 6 个 Anthropic/OpenAI 模型 × 2 个 benchmark 的 12 组对比里,有 9 组是"别家的外壳"拿下了最高实测成功率——"原厂模型配原厂外壳最香"这个直觉,数据并不完全支持。
一句话总结这波实验的价值:模型决定智力的上限,Harness 决定你为这份智力付多少钱。
三、光谱两端:4 个工具的"毛坯房",和 26 个工具的"全家桶"
为什么差这么多?看看外壳光谱的两端就懂了。
极简的一端是 Pi。作者是游戏框架 libGDX 的 Mario Zechner,他有句吐槽挺损但挺准:Claude Code 变成了一个 80% 功能都用不上的宇宙飞船。于是他自己动手写了个极简 Agent,核心工具只有 4 个:read、write、edit、bash,系统提示词加工具定义加起来不到 1000 token,是主流外壳里最短的一档。它的逻辑是:前沿模型已经被大量 RL 训练过,天生就懂 coding agent 的套路,犯不着再用上万 token 的提示词手把手教它做事。知乎

Pi 在 10 月 1 日发了 1.0,还带了个实验性的 Pi Durable(进程崩了、机器睡了、容器重部署了,能从断点接着干);OpenClaw 拿它当底层框架,Databricks 的 CTO Matei Zaharia 也公开夸过它在 Terminal-Bench 2.0 上的表现。嫌 Pi 太"毛坯"、不想自己配的人,还有个开箱即用版 Oh-My-Pi(omp),内置 LSP、调试器、MCP、AST 工具——定位类似"LazyVim 之于 Neovim"。
重的一端,是 Claude Code 和 DeepSeek Harness 这类"全家桶":子 Agent、MCP、Plan 模式、记忆、搜索、Skills,出厂全配好,拎包入住;DeepSeek Harness 更是首次请求就带上 26 个工具、默认沙箱、插件扩展。
四、先别冲动换工具:三笔反证账要认
概念很爽,数据很硬,但真要动手前,这几盆冷水必须泼——这也是"税"这个说法最容易被带节奏的地方。
第一笔,把"观点"和"事实"分开。“Anthropic 是故意把 token 消耗做高、用暂时垄断收溢价,It’s a feature not a bug”——这是那篇《什么是 Harness 税》作者的个人推测,不是被证实的事实。它逻辑自洽、也解气,但你不能拿一个未经证实的"动机论"当决策依据:数据能证明"贵",证明不了"故意"。
第二笔,厂商跑的 benchmark,先打个折。你会看到各种"Pi 比某某省 48.7% token"的对比图,很多来自 API 中转商、工具作者的自测,连其中一篇自己都注明"这不算严格 Benchmark,工具调用轨迹、输出长度、交付物规模都会影响结果"。方向可以参考,具体数字别当真。
第三笔,Benchmark ≠ 你的真实项目。SWE-bench、Terminal-Bench 都是标准化的短任务;而你的活可能是几十万行代码、连续几小时、读几十个文件、反复跑测试的长会话。这种场景下,重外壳的上下文压缩、断点续跑、diff 管理,省下的可能比你多付的 token 更值钱。有个高赞回答就说得很到位:你去逆向 Claude Code、Devin 这类真能干活的系统,会发现源码动辄几万行,塞满了状态机、AST 解析、进程树监控、增量 diff 和复杂的上下文管理。这些不是纯脂肪,是长时间、多文件、易崩的真实工程里替你兜住混乱的骨架。极简外壳把这部分控制权还给了你,也把这部分的活儿甩给了你。知乎
还有一笔隐性成本:Pi 是间"毛坯房",理念像 Vim,你得自己写 AGENTS.md、配 Extensions 才顺手。省下的 token,可能有一部分是用你多花的时间换的。

连 Anthropic 自己都在往"Harness 可编程"走:Claude Code 刚放出官方的 Mods 定制能力,其领衔工程师也公开表示要"少写单次提示词、多在外壳这层外骨骼上投入"。方向上,轻重两端其实在互相靠拢。
五、到底该怎么做?按你付费的方式分三类
别问"哪个外壳最好",先问"我这笔钱是怎么付出去的"。
① 按 token 付费的重度 API 用户——税是真金白银,值得动手。 如果你走 API 计费、还老撞用量墙,Harness 税直接进你账单。可以先做两件事:用 /cost 或调用日志,量一量你当前外壳的"初始上下文"和"每任务 token"到底多大;再拿一个真实任务,在极简外壳(Pi/omp)上跑一遍对比。省下的可能不止额度,还有"更晚撞上限速"。
② 包月订阅的 Claude Code/Codex 用户——税很大程度上是"平台替你扛了"。 你付的是固定月费,per-token 的开销更多是 Anthropic/OpenAI 的成本,不直接从你口袋多掏。这时你的真实约束是额度和限速,不是单价。换极简外壳未必省钱,但可能换来"同样的额度能干更多活"和"更高的可控性"——值不值,取决于你被限速折磨的程度。
③ 团队/复杂项目/求稳——那笔税买的是"省心",别为极简而极简。 多人协作、长周期、易崩的大项目,重外壳的权限控制、diff、断点续跑、上下文管理是生产力,不是纯负担。为了"政治正确"去追极简,反而可能把 robustness 的钱省了、把踩坑的时间赔进去。

一个通用的省钱思路,社区叫"贵的动脑子、便宜的动手":用强模型 + 精简上下文做规划和关键决策,把大批量、机械的执行交给更便宜的外壳或模型。
六、接下来值得盯的几个信号
这事还没完,想持续跟进的可以标记这几个观察点:
Pi 生态成熟度:omp 的开箱体验、Rust 实现 rpi、Pi Durable 的稳定性,决定它能不能从"极客玩具"变"日常主力"。
"外壳自优化"这条路:NVIDIA 联合南洋理工、MIT 的研究者把优化对象放在了 Harness 这层,提出 SoL-Pi,让 AI 从执行轨迹里自己找开销、再改这层软件,号称 token 砍半。如果这条路走通,"外壳税"可能被工具自己降下来。知乎
Anthropic 会不会正面回应:Claude Code 会不会优化那个"10 倍于 Pi"的初始上下文?Mods 是不是变相承认了"外壳该由用户定制"?
国产外壳 + 国产模型的组合:DeepSeek Harness 这类配上高性价比国产模型,会不会跑出新的"省钱解"。
最后回到开头那句"1+1"。下次挑编程 Agent,别只盯着"用哪个模型"了——模型决定它有多聪明,外壳决定你为这份聪明掏多少钱。先搞清自己属于上面哪一类,再决定这笔"外壳税",你是该认、该省,还是该换个交法。