这几天刷B站和知乎的朋友应该都察觉到了:AI编程区突然被一个叫 Pi 的终端工具刷屏。
节奏是这样的:10月1日,Pi 发布 1.0 正式版,同一天 Pi 团队放出实验性新包 Pi Durable。10月2日,Cloudflare 官方宣布支持。然后从10月4日到7日,B站一夜之间冒出一大批实测视频,播放量从几百到两万都有,知乎上"为什么越来越多人放弃 Claude Code 转而用 Pi"这类问题也开始密集出现。Hacker News 评论区回复最多的一条问得很直白:大家到底是怎么用 Pi 的?哔哩哔哩
真正把火点起来的,是一个UP主做的小实验:同样问 AI 一句"1+1",Claude Code 还没开口先烧掉约2.8万 token,而 OhMyPi(Pi 的一个全家桶 fork)只要1万上下。他在自己机器上把账单拆开逐项量了一遍——清掉装的一百多个技能插件,没用;删掉自己的规则文件,省了7200;剩下两万多,全是 Claude Code 这个工具本体自带的:系统提示词加工具描述,活还没干,钱先花了。哔哩哔哩
评论区给这笔钱起了个名字:Harness 税。

同一个模型,不同的账单,这事有三组实测数据
先说清楚 harness 是什么。模型是大脑,harness 是工位:每一轮让模型看到哪些上下文、给它哪些工具、历史怎么压缩、失败了要不要重试、什么时候算干完——这层"壳"决定了跑多少轮、烧多少 token。Pi 官方给自己的定义就是 minimal agent harness,两句口号:Primitives, not features(给基础构件,不给成品功能);Adapt Pi to your workflows(工具适配你的工作流,不是反过来)。知乎
极简到什么程度?默认只给模型4个工具:read、write、edit、bash,系统提示词不到200 token。对比一下,Claude Code 的系统提示词接近1万 token。Pi 的作者 Mario Zechner——对,就是游戏开发框架 libGDX 那位作者——给的理由很激进:顶级模型经过强化学习已经足够聪明,超长系统提示词是给弱模型打的补丁,强模型不需要。

这不是玄学,今年有三组数据反复在验证"外壳差价"的存在。
第一组是 Composio 的横评,最近这轮用 DeepSeek-V4-Pro 做统一模型,让 Claude Code、Pi、OpenCode、Hermes、DeepSeek Harness 五个编程 Agent 各跑30个真实任务,全部拉满推理强度。结果很有意思:通过率最高的是 Pi(21/30),成本最低的却是 DeepSeek Harness(每个成功任务0.028美元),速度最快的是 Claude Code(平均181.8秒一题)。而 Claude Code 的成本是每题0.074美元——是 Pi(0.031美元)的2.4倍。更扎心的是速度:通过率第一的 Pi 平均362.9秒一题,几乎是 Claude Code 的两倍,倒数第一。有人总结得精辟:Claude Code 用 token 换时间,Pi 用时间换 token。知乎

这组测试还有个容易被忽略的数字:30题里,15题谁来都能过,7题谁来都挂,剩下8题——接近三成——成败由你选的外壳决定。所以 harness 从来不只是省钱问题,它还直接改写结果。
第二组是 Databricks 在7月8日公布的内部基准:六组"同模型、同推理强度、只换外壳"的配对实验,Pi 的每任务成本六组全部更低,幅度1.20倍到2.08倍。知乎
第三组更远一点:今年5月,Tulane、Rutgers 和 Virginia Tech 三所大学联合发了篇论文,标题就很冲——《别再不披露 Harness 就比较智能体了》。控制实验的结论是:harness 引起的性能波动可以显著超过换模型引起的波动,甚至导致排名逆转。知乎
别急着夸极简,先看清这笔税买到了什么
看到"2.4倍差价"就打算卸载 Claude Code 的话,先把另一半事实看完。
Claude Code 那1万 token 的系统提示词不是白烧的。Composio 官方的解释是:提示词长意味着指令明确,模型看到任务就知道该调哪个工具,不用反复试错——所以它才最快。再加上预置的权限控制、plan mode、skills、hooks、子代理这一整套生态,以及团队协作需要的审计和治理,这些都是 Pi 默认没有的。
Pi 的极简把边界管理责任整个交给了你。官方安全文档写得很直白:Pi 不包含内置沙箱。装什么扩展、加载什么包、让 Agent 碰到哪些目录,全是你自己的事。JavaGuide 在知乎那篇热文里也专门提醒:安装 package 之前应该先看源码和维护状态,别下载到带安全隐患的包。换句话说,省下的 token 钱,有一部分要用"自己当安全管理员"来还。知乎
嫌纯 Pi 太素的人,走的是另一条路:OhMyPi(OMP),Pi 的一个 fork,内置31+工具、LSP、调试器,兼容40多家模型提供商,GitHub 也有3万多星。知乎上"极简派还是全家桶"的讨论,本质就是在问:你想要多少预置功能,愿意为它付多少税。哔哩哔哩
还有一条来自内部的观察值得记住。一位做过大量 harness 实验的开发者在知乎高赞回答里说,商用 harness 之间的大多数差异,其实就是 compact(上下文压缩)设计和系统提示词这两件事的差异;而且他提到,上一个版本的 Claude Code 提示词长得离谱,新版一次性删掉了一大批——“算是给 Claude 大减负了”。这意味着 Harness 税率不是固定的,商用壳自己也在减肥。你现在测出来的差价,半年后可能收窄。知乎
顺手把这波流量里的噪音清一清
信息越密,错得越真。三个流传中的说法需要校准:
第一,“Pi 2.0 发布了”——假的。10月1日发布的是 Pi 1.0,Pi Durable 是同日放出的独立实验包。网上确实有标题写着"Pi 2.0"的视频,点进去内容讲的还是 1.0,属于搬运频道的错标。Pi 的 star 数倒是真涨得凶:8月中旬约8.9万,10月初已过10万。
第二,“Pi 质量碾压 Claude Code”——证据不足。Databricks 那六组配对里,成本侧 Pi 六组全低是硬结论,但质量侧的点估计有高有低(+3到-7个百分点),官方自己都只说"质量保持同一水平"。有篇很较真的分析文章提醒得对:不能把六个成本倍数直接平均成一个数,更不能宣布统计胜负。省钱是真的,"更强"还没被证明。知乎
第三,“评测第一等于干活第一”——小心外推。Composio 那30题是横跨 Gmail、Google Sheets、Slack 的多平台集成任务,不是纯代码任务;Databricks 的任务是筛过的、测试完善的历史 PR。两种分布下的结论,都不能直接套到你自己的项目上。
迁不迁?先看你是哪种付钱方式
这才是真正影响决策的变量。同样一句"省 token",对不同账单结构的人,含金量完全不同。
如果你是订阅包月用户(Claude Pro/Max 或 Codex 月费):Harness 税根本不出现在你的账单上——包月制下 token 是平台的成本,不是你的。你迁移能得到的不是省钱,而是三样别的东西:模型自由(Pi 自带 API key,随便换模型)、行为可控(提示词和工具全在自己手里)、以及长会话的树形管理(Pi 把会话存成 JSONL 树,/tree 能跳回任意历史节点分叉试错,这个功能连很多老用户都说香)。代价也要认:你在 Claude Code 里攒的 CLAUDE.md、skills、hooks 资产不能直接搬,权限确认的习惯要自己重建。

如果你是 API 按量付费用户:税率就是你的真实折扣,1.2倍到2.4倍的差价直接落在钱包上。月 token 开销上了三位数美元的话,值得花一个下午做配对测试(方法在下面)。注意两点:Pi 慢,但按 token 计费下慢不等于贵,只是费你的等待时间;复杂任务上 Pi 可能需要现场用 bash 造工具,这部分时间成本要自己掂量。
如果你在国内,被充值和封号问题困扰:Pi 接受任意模型 API key 的特点,让它天然是个现实出口——接 DeepSeek、GLM、Kimi 都是官方支持的路径,DeepSeek Harness 这种完全免费的开源壳也在同一波讨论里被反复拿来对比。这条路的坑不在工具,在 key 的来源,此处不展开,你懂的。
想动手的话,最省弯路的三步
第一步,别全量迁移,先做配对测试。照 Databricks 的思路简化成三句话:固定同一个模型和推理档位,只换外壳;任务用你自己项目里近期真实干过的活(修 bug、加功能都行);记录"每个成功任务的成本"和通过率,别只看平均分。你自己的任务分布,比任何榜单都有发言权。
第二步,装一个玩玩成本极低。Pi 就是一条 npm 命令的事,终端输入 pi 就能跑。想要开箱即用就试 OhMyPi。插件别贪多——有UP主在 Pi 1.0 之后专门做了"删插件"教程,结论是基本上一个联网插件加一个子代理插件就够,剩下的要么 Pi 已经原生做了,要么是给自己加税。哔哩哔哩

第三步,留意 Pi 1.0 的两个新东西,可能改变你的测试结论:一是它把曾经写进 README 拒绝的 MCP 又接回来了,做成了四档按需曝光,实测20个工具的首请求能省72%的 token。二是 Codemode——让模型写小型 JavaScript 程序在沙箱里并行调用工具、过滤中间数据、只回传结果,对 GPT 这类喜欢疯狂调工具的模型尤其对味。哔哩哔哩
值得持续盯的信号有三个:Pi Durable 什么时候从"实验性"转正(它解决的崩溃恢复、审批不重复执行,是长任务 Agent 的真痛点,Cloudflare 已经下场支持)。其次是 Anthropic 会不会继续给 Claude Code 的提示词减肥(减一次,税率就变一次);以及 DeepSeek Harness 兼容 Claude Code Mods 那个实验层的安全问题什么时候补上——目前 Mod 的 Hook 模块直接拥有 Node 全局权限,没有沙箱,官方文档自己都在提醒。知乎
最后照例问一句:你现在主力用的是哪个壳,月账单多少?如果真算出"同一个模型、账单差一倍",你会为了省钱忍受慢一倍,还是为了快继续交税?评论区聊聊,这题没有标准答案,但你的账单有。