Pi通过率第一、DeepSeek Harness最省钱、Claude Code最快:同模型30题之后,换哪个先看自己缺什么

源自75位全网作者

08:15

同一个模型,五个编程 Agent,三十道题,三个冠军——而且三个冠军分属三个不同的工具。看到这组横评结果,我的第一反应不是"谁最强",而是:大多数争论该选哪个 AI 编程工具的人,可能从一开始就争错了维度。

做智能体工具集成的平台 Composio 最近做了第三轮 Agent Harness 横评。模型统一为 DeepSeek-V4-Pro 正式版、全部开到最大推理强度,让 Claude Code、Pi、OpenCode、Hermes、DeepSeek Harness 五个 Harness 各自完成同样的 30 道题。结果是:通过率最高的是 Pi,成本最低的是 DeepSeek Harness,速度最快的是 Claude Code,没有一个工具三项全拿。

这场考试考的到底是什么

很多人看到"AI 编程横评"会默认是算法题考试,这次不是。这 30 道题都是真实的多应用集成任务,横跨 Gmail、Google Sheets、GitHub、Slack 等平台,每题限时 900 秒,只有通过和没通过两种结果。知乎它考的不是"会不会写一个函数",而是更接近很多人日常用 AI 助手干活的样子:能不能调度多个应用把一件事办成。也正因如此,这份结果对已经在用这些工具的人参考价值很直接。

五个选手里,DeepSeek Harness 是当下讨论度最高的一个。它号称"Agent 界安卓",一切皆插件,GitHub 仓库星标已超过 168k,而这次参考的正是它的主界面。

Pi通过率第一、DeepSeek Harness最省钱、Claude Code最快:同模型30题之后,换哪个先看自己缺什么

三笔账:通过率、成本、速度

先把通过率和成本放在一起看:

Harness

通过题数(30 题)

每成功一题平均成本

Pi

21

$0.031

DeepSeek Harness

20

$0.028

Claude Code

19

$0.074

OpenCode

19

$0.032

Hermes

18

$0.037

通过率咬得很紧,第一名和最后一名只差 3 题,没有碾压。但成本差距完全不同:Claude Code 每成功解决一题要花 $0.074,是 DeepSeek Harness 的 2.6 倍。速度更是反直觉,最贵的 Claude Code 反而最快,平均每题只要 181.8 秒;通过率冠军 Pi 垫底,362.9 秒,接近 Claude Code 的两倍。知乎Composio 官方的解释是,Claude Code 的系统提示词虽长但高度优化,模型看到任务就知道该调哪个工具,不做无用功。一句话概括:Claude Code 用 token 换时间,Pi 用时间换 token。

把 30 道题再拆开,真正值得争的其实只有 8 道:15 题不管用哪个 Agent 都能通过,7 题不管用哪个都挂,剩下 8 题的结果由你选的 Harness 决定。接近三成的任务,成败不由模型而由工具框架说了算。知乎

为什么 Harness 能决定近三成成败

这个判断在社区里也有呼应。有 B 站 UP 主用同一个 DeepSeek 模型,分别在 Claude Code 和 DeepSeek Harness 里跑同样的任务,结论是模型本身当然重要,但 Harness 在插件化、流程记录、缓存命中和任务组织上的设计,会明显影响最终输出质量。哔哩哔哩

Pi通过率第一、DeepSeek Harness最省钱、Claude Code最快:同模型30题之后,换哪个先看自己缺什么

一个看得见的差异,是喂给模型的"说明书"完全不同。Claude Code 的系统提示词接近 10000 tokens,Pi 的不到 200 tokens。知乎提示词长,单次请求的 token 消耗就大,但模型拿到的指令明确,动作更确定;Pi 默认只带读文件、写文件、编辑、执行命令四个内置工具,极简换来专注,代价是复杂任务要现场用 Bash 自己写工具,时间就花在了这里。

这种差异已经上升到学术层面。今年 5 月,Tulane、Rutgers 和 Virginia Tech 三所大学联合发表论文《别再不披露 Harness 就比较智能体了》,用控制实验证明 Harness 引起的性能波动可以显著超过模型引起的波动,甚至导致排名逆转。知乎换句话说,以后看到"某个 Agent 比另一个强"的结论,先问一句用的是什么 Harness,否则比的可能根本不是模型实力。

想换之前,先弄清三件事

第一,横评的成本账是按 API token 消耗折算的,不是订阅价。如果你是 Claude Code 或 Codex 的订阅用户,体感会不一样:社区里已有用户反馈同一个提示词,CC 消耗的额度会更多。知乎对订阅用户来说,成本体现为"额度掉得快不快",而不是账面上的美元;反过来,按量付费、任务量大的 API 用户,2.6 倍的单题成本差就是实打实的钱。

第二,考题是多应用集成,不是纯写代码。如果你的日常主要是仓库里的编程任务,这份通过率排名不能直接平移——Claude Code 的主场恰恰是代码仓库,这次题型没有覆盖到它的优势区。

第三,DeepSeek Harness 的成本优势是在早期版本上跑出来的:它开源刚六天、还是 v0.1 预览版,本次测试用的是默认标准模式,不是为跑分优化过的极简模式。知乎这说明它的优化空间还大,但成熟度也要如实评估——有开发者花三天读完源码后给出的判断是"它不会是未来",理由包括依赖注入模型的局限和 Skill Hub 生态的现实问题。哔哩哔哩

Pi通过率第一、DeepSeek Harness最省钱、Claude Code最快:同模型30题之后,换哪个先看自己缺什么

对号入座

没有通吃的答案。有开发者在梳理这几个工具的选型时说得很直白:没有统一模型、任务、环境、权限和预算的实验,两种推断都不成立。知乎以这轮横评的三笔账为参照,可以分成四种情况:

  • 按量付费的 API 用户,成本敏感:可以优先试试 DeepSeek Harness。单题成本最低、通过率第二,标准模式尚且如此,后续优化还有空间;前提是你愿意接受 v0.1 预览版的粗糙。

  • 追求最高通过率,任务可以等:选 Pi。21/30 的通过率第一,但要接受每题 362.9 秒的最慢速度,适合后台批量任务,不适合交互式写码。

  • Claude Code 订阅用户,日常图快:不急着换。Claude Code 每题 181.8 秒最快,这次的多应用集成考题又不是它的主场,横评替代不了你在自己仓库里的真实体验。

  • 现在的工具用着没有明显痛点:先不动。"近三成任务由 Harness 决定"是值得长期关注的信号,不是必须马上换工具的理由。

如果你是重度仓库用户,选型时还可以多看一层:不同 Harness 对 Git 历史和任务状态的管理方式差异很大,这一层只有把真实项目跑一遍才能比出来。

Pi通过率第一、DeepSeek Harness最省钱、Claude Code最快:同模型30题之后,换哪个先看自己缺什么

值得继续盯的信号

有两个后续会直接影响这次的结论。一是 Composio 的下一轮横评:前两轮分别用 DeepSeek-V4-Flash 和 Kimi K3 评测,趋势和这轮几乎一样。知乎如果第四轮仍然如此,"Harness 决定一部分成败"就从单次数据变成趋势。二是 Harness 之间的边界正在模糊:DeepSeek Harness 在 8 月 19 日发布了 v0.1.0-rc.8,Claude Code 与 Codex 可作为 Profile Bundle 按需安装,也就是把别的 Agent 当子代理调用。哔哩哔哩“选哪个"这个问题,下一轮可能会变成"谁把谁装进去”。

这轮横评最值得带走的,不是"Pi 最强"或"DeepSeek 最省钱",而是一个更基础的问题:你要解决的到底是通过率问题、成本问题,还是速度问题。想清楚这个,答案不需要等下一轮横评。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章