这两天刷 AI 编程圈的消息,大概率绕不开一个词:Harness。8 月 13 日深夜,DeepSeek 把自家的 Agent 框架开源了,名字就叫 DeepSeek Harness,半天几万个 star,官方口号是「Model + Harness = Agent」。知乎 一夜之间,好像不懂 Harness 就不配聊 AI 编程了。但这个词到底跟你的钱包有什么关系?其实一个多月前,Databricks 就用自家几百万行的代码库做了一次实测,把答案写得明明白白:同一个模型,换一个外壳,干同样的活,成本能差出 2 倍以上,质量还基本一样。
先用一句话把 Harness 说清楚:模型是发动机,Harness 是变速箱、底盘和刹车。模型只负责生成 token,而把 token 变成「在你仓库里干活」的那层程序就是 Harness——组装上下文、执行工具、把关权限、失败后恢复、保存会话状态,全是它的活。Databricks 的结论更直接:一个模型从哪个 harness 里被调用,会剧烈影响成本和质量。Databricks官方博客 Claude Code、Codex、Cursor、Pi,本质上都是不同风格的 Harness。
再说说为什么这份实测值得认真对待。市面上的公开跑分有个老问题:题目是公开的,答案早晚混进训练数据。Databricks 干脆自己造了一套:从工程师日常合并的真实 PR 里抽任务,覆盖 Python、Go、TypeScript、Scala 等十几种语言,人工逐条审核,用真实测试用例判分,不用 LLM 裁判——用他们的话说,LLM 裁判「奖励听起来对,而不是真的对」。Databricks官方博客 更狠的是,早期实验里他们发现 agent 会顺着 git 历史翻出标准答案,于是每次跑测试直接把工作副本和仓库历史切断。

结论里有三条,条条冲着账单去。第一条,也是最反直觉的一条:模型不变、思考档位不变,只换 Harness,有的任务成本差出 2 倍以上,质量几乎一样。小红书用户转述这次实测时的原话也很直白:同一个模型、同样的 thinking 档位,变量只有 Harness,产物质量基本持平,任务成本能差出 2 倍以上。小红书

差别出在哪?出在每一轮喂给模型的上下文有多少。轻量路线的 Pi 每一 turn 发出去的 context 大概只有别人的三分之一,工作集收得更紧,更少的来回就把活干完了。知乎 Databricks 的原话很克制:教训不是「某个 Harness 永远更便宜」,也不是「官方外壳更差」,而是「选模型只是拼图的一块」。

第二条:token 单价是个假信号。很多人挑模型先看单价表,但实测里,Sonnet 5 的单价比 Opus 4.8 便宜约 1.7 倍,真跑任务反而更贵——$2.09/任务对 $1.94/任务——因为 Sonnet 5 干得更久、读得更多,token 消耗是 Opus 的 1.9 倍,质量还低了 6 个点(81% 对 87%)。Databricks官方博客 盯着单价做决策,很可能把账算反。
第三条:按任务档位配模型,比「全程最贵模型」省得多。他们分析了内部所有 coding 交互,约四分之一被标为低复杂度,约六成是中等复杂度。Databricks官方博客 但工程师默认用的永远是最贵的模型,于是他们把更多日常工作推给 Haiku、GPT-5.4 Mini 这个档位的模型。另一个值得注意的数据:开源的 GLM 5.2 质量与 Opus 4.8 打平,$1.28/任务对 $1.94/任务。

这不是孤例。在成本-质量坐标图上,Pareto 前沿同时横跨 OpenAI、Anthropic 和开源三家阵营,单一模型家族覆盖不了全部档位。AI 集成商 Composio 拿 DeepSeek V4 Flash 塞进 8 个不同 Harness 跑 30 个高难度任务,Pi 通过 20/30,且是全场最便宜。知乎 最夸张的 Prime 单次能烧 350 万 token。OpenRouter 的 30 天用量数据更有意思:Claude Code 里用量最大的模型不是 Anthropic 自家的,而是 GLM 5.2;Cline 和 Pi 的头名则都是 DeepSeek V4 Flash。知乎 「按控制循环挑外壳、再单独挑模型」这件事,老玩家们早就用脚投票了。

国内社区也一样。小红书上有用户晒出「把 Claude Code 换成 Pi」,换完之后高强度使用,中途一次都没用回 Claude Code,评论区第一条就是问怎么安装。小红书
那对你意味着什么?分三种情况说。如果你是订阅党(Claude Pro/Max、ChatGPT Plus/Pro、Copilot):不用急着推翻现有工具,但 Pi 支持直接挂你已有的订阅,等于零成本多一个选择——订阅用户直接 /login 授权,Claude Pro/Max、ChatGPT Plus/Pro、Copilot 都行。知乎 可以先在非关键项目上跑几天小任务,对比一下同类任务的 token 消耗,再决定要不要扩大使用面。如果你是 API 自费党:账单异常时,先怀疑外壳的上下文膨胀,再考虑换模型;动手之前先做一件事——把「每任务成本」记下来,别只看单价,同一个常用任务在不同工具里各跑两遍,账单自己会说话。如果你是团队负责人:Databricks 给了个谁都能抄的办法——你们仓库里那些已合并的 PR,本身就是一套模型没见过的天然题库,配上你们自己写的测试就能判分,与其看别人的跑分表纠结,不如在自己的代码上测一遍。
最后照例泼三盆冷水。其一,Databricks 的结论建立在他们的代码库和任务分布上,百万行、十几种语言、大厂工程规范,不等于你的场景,抄作业前先掂量任务结构。其二,Pi 的「薄」是有代价的:别人拼命做加法,堆 MCP、子代理、计划模式、权限弹窗,它偏偏做减法,默认只给模型 read、write、edit、bash 四把刀。知乎 安全感要靠自己搭,习惯了 Claude Code 护栏的人未必适应。其三,让 Harness 出圈的 DeepSeek Harness 目前还是 v0.1 开发者预览版,发布当晚过程也几经波折,生态刚起步,等等党不亏。
接下来值得盯三个信号:Claude Code、Codex 这些官方外壳会不会跟进「单任务成本统计」;DeepSeek Harness 的插件生态能不能长出真东西;以及你手里的工具,愿不愿意把每一轮的上下文占用亮给你看。模型决定能力上限,外壳决定账单下限——这句话,大概会是接下来一年 AI 编程圈的主线剧情。