当前位置:
AIGC文章详情

七天17万star,但我劝你先别急着迁移:Agent“壳战争”开打,换底座前要看清这三个坑

源自33位全网作者

08-26 18:19

最近在做 LLM 应用开发的朋友,这两周应该都被两条消息刷屏了。

8月13日晚,DeepSeek 以 MIT 协议开源了 DeepSeek Harness(圈里简称 DSH),GitHub 星标一路飙升——5 天突破 15 万。知乎到 8 月 20 日已经拿到约 17.37 万 star、1.88 万 fork,相关帖子在 Hacker News 上拿到 744 分、310 条评论。36氪整整七天后,OpenAI 发了一篇《Codex as a platform》,把 Codex 底层的 Agent Harness 作为平台开放给开发者。

先交代一个大背景:JetBrains 最新的年度调查(覆盖全球 1.5 万+开发者)显示,约 90% 的专业开发者已经每周至少使用一次 AI 编程 Agent,Claude Code 使用率半年翻倍、反超 GitHub Copilot 登顶,Codex 使用率涨了约 5 倍,OpenCode、Google Antigravity、智谱 ZCode 这类新面孔也在快速进场。36氪也就是说,Agent 开发早就不是小众爱好,而是十个人里九个人的日常。

七天17万star,但我劝你先别急着迁移:Agent“壳战争”开打,换底座前要看清这三个坑

在这个节骨眼上,DeepSeek 和 OpenAI 一周之内先后开放自家的“壳”,味道就和“又出了个新框架”完全不一样了。知乎上有篇高赞专栏说得直白:Agent 的竞争,正在从 Model War 转向 Harness War。知乎

Harness 是什么?为什么巨头要抢这一层

没跟上这个概念的朋友,用一个公式就能说明白:Agent = Model + Harness + Tools + Environment。

模型是大脑,负责理解、推理、拿主意;Harness 是身体,负责把想法变成一连串连续、可靠、可控的动作——会话管理、上下文压缩、工具调用、沙箱隔离、人工审批,全靠它。你每天在用的 Claude Code、Codex、OpenCode,底层跑的就是这层执行系统。

Harness 对模型能力的放大是实打实的,OpenAI 自己给过数据:ARC-AGI-3 测试里,GPT-5.6 Sol 裸跑得 13.3%,加上 Codex Harness 的持续推理和上下文压缩后升到 38.3%,输出 Token 还降到原来的约六分之一。36氪同一个模型,换个壳,能力差出近三倍。

那巨头为什么抢着把这一层开源?行业里的判断很现实:Harness 不是护城河,模型才是,抢的是入口——就像互联网时代的浏览器、PC 时代的操作系统。知乎上有个比喻很传神:打印机可以便宜卖,墨盒必须赚钱。知乎壳开源得越彻底,用的人越多,用自家模型的人就越多,Token 就卖得越多。

但我今天不想聊热闹,想聊一个更实际的问题:作为真的在写 Agent 应用的开发者,要不要把项目迁到 DSH 上?要不要基于 Codex Harness 做自己的产品?

先说结论:这个热闹值得看,但迁移别急。三个坑,我一个个说。

坑一:模型在“过拟合”自家壳,换壳可能让战斗力打折

这是这次最反直觉的发现。知乎上有位开发者系统梳理了 DeepSeek、Kimi、Qwen、快手四家的技术报告,发现这件事是各家自己承认的:

DeepSeek V4 Pro 在 DSH 的 minimal preset 下能发挥出接近能力上限的水平,换到官方 standard preset 或第三方通用 agent 框架就明显退化。知乎Kimi K3 要求 harness 必须完整回传 thinking 历史,否则生成质量会“高度不稳定”,官方甚至建议不要在会话中途切换到 K3;Qwen3-Coder-Next 的技术报告说得更直白:许多现有模型是用单一的 tool chat template 训练的,导致过拟合到特定输出结构,部署到没见过的 tool-calling 格式时鲁棒性下降。

快手的发现最有意思:他们给模型一套工具更少的脚手架配置,模型表现反而更好——因为模型的停止语义和反思节奏,是跟训练时那套接口一起“长”出来的,工具给多了反而不知道什么时候该收手。知乎翻译成人话:壳和核是深度绑定的组合,同一套权重在不同 harness 下的实战表现可能差得很远。

以后看到“某模型+某壳屠榜”的截图,先问一句分数是在哪个 harness 下跑的。快手报告里有句话值得贴在工位上:Harness Scaling 的关键不在于 harness 的数量,而在于多样性是否落在对泛化有用的维度上。知乎

坑二:17 万 star 不等于生产可用

热情是真的,但 DSH 现在的版本还是 Developer Preview,官方团队自己提前打了预防针:早期阶段,会有破坏兼容性的修改。DSH 作者之一 Tianyi Cui 在 Hacker News 上也提醒,粗糙的地方不会少。Reddit 上的试用反馈,槽点集中在速度慢、Token 消耗高、插件文档不清楚;有开发者检查代码后估算,DSH 包含约 45.3 万行代码和 219 个包。36氪但首个公开版本只有一笔压缩后的 Git 提交,外部开发者很难追溯项目演进。

连 Flask 作者、Pi Agent 主要开发者 Armin Ronacher 都说,这套架构很有新意,但离生产环境还有距离。36氪36氪的观察比较客观:17 万 star 证明开发者愿意研究这套新东西,但还难以证明在企业生产端,真有人愿意把关键工作交给它。

当然也有狠人。今天知乎上“deepseek-harness 的热度这么快过去了吗?”这个问题下,高赞回答来自一个已经把它接进生产环境的团队:对接私有化部署的 DeepSeek 替代 RPA,自动登录、自动处理、自动交付。知乎他们还顺手重构了一个只支持 Oracle 的史前遗留系统。但这条回答下面追着问的两个问题——“还在 rc 版有破坏性更新,后续升级兼容怎么办”“工具类场景怎么限制高危操作”——都还没有完美答案。

公允地说,DSH 的社区生态进化速度确实快:内测期约 300 名测试者两周做出 200 多个插件,正式发布两天后社区精选列表已收录 270 个插件。36氪WebUI、手机远程控制、模型适配器、额度监控、插件市场陆续冒了出来。插件开发的跑马圈地期还没结束。

七天17万star,但我劝你先别急着迁移:Agent“壳战争”开打,换底座前要看清这三个坑

坑三:Token 烧得快,新壳不等于新省钱

DSH 热帖评论区里点赞最高的一条,就一句话:“我就问花多少 token,烧不动了。”

这不是段子。Harness 工作流的 Token 消耗是个黑洞:系统提示词、工具返回信息、历史消息,滚雪球一样越滚越大。有个团队给“1 个调度主 Agent + 6 个子 Agent”的全流程工作流做了一轮完整降本实践:先用工具把成本按任务波次拆开看,再从架构拆分、稳定前缀缓存、渐进式披露、代码图谱、CLI 替代 MCP、工具白名单、模型分层路由等 10 个方向优化,最后全流程成本降了 50%~65%。知乎其中两个数字值得记住:

  • 把需求文档、设计稿这类大体积 MCP 调用下放给专属子 Agent、只返回结构化摘要,单轮会话的输入 Token 从 103 万降到 63.4 万,直降 38.4%。知乎

  • 把自动化测试、视觉还原这类高频但规则性强的角色换成更便宜的多模态模型,这部分角色成本再降 64%。

这给我们的提醒有两个:第一,迁新壳之前先把成本度量建起来,不知道钱烧在哪,连优化都无从下手;第二,成本这门课不挑壳,是每个 Agent 团队的必修课。

那到底怎么办?三类人,三种动作

第一类,产品已经上线的业务团队:别动。一位接受 36氪采访的大模型开发者给出的建议很直白:除了交互流程优化,其他方向碰都不要碰 Harness。36氪模型还在快速变化,不同模型需要的执行策略不一样,换底座的成本比你想的高。可以盯着 Codex 的 SDK 和 app-server——把 Agent 能力嵌进 CI/CD、客服、审批流这类现有系统的路已经通了,GitHub、JetBrains、Cisco 都已经有落地案例,OpenAI 展示的物流运营控制台场景里,Codex 已经被嵌进业务系统排查异常订单。

七天17万star,但我劝你先别急着迁移:Agent“壳战争”开打,换底座前要看清这三个坑

第二类,想蹭生态红利的技术爱好者:现在恰恰是最好的窗口。DSH 的插件生态还在蛮荒期,做插件、做垂直技能包、写教程都是跑马圈地。但记住两条:别放重要数据,留好回滚路径——UI 和远程连接类插件,正是兼容事故的高发区。

第三类,准备做自家 Agent 产品的团队:现在基本是三条路线。基于 Codex Harness 搭——发动机给你调好了,但深度绑定 OpenAI 模型,API 只认自家接口;基于 DSH 搭——连发动机都能自己组装,自由度拉满,但成熟度要自己扛;基于 Pi、OpenCode 这类 MIT 开源壳——Pi 已经有 8 万+ star,公开报道里的缓存命中率最高到 99.93%。微博核心判断只有一个:你的产品命脉绑在哪家模型上?绑,就选离那家最近的壳;不绑,就选协议层开放最彻底的壳。

最后,留四个观察信号

这场壳战争值不值得持续投入,接下来几个月盯住四件事就行:

  1. DSH 正式版和破坏性更新的节奏——预览版能不能收敛,是一切的前提;

  2. DeepSeek 会不会推 TokenPlan 这类订阅套餐——Harness 是他们把计费从“按 Token”转向“按任务”的筹码;

  3. 插件生态能不能长出评分、精选和安全审查机制——没有质量机制,270 个插件就只是数字;

  4. 新模型版本会不会缓解壳过拟合——这决定“壳核绑定”这堵墙最终有多厚。

模型战争还没打完,但第二战场已经开了。在聪明不再稀缺的年代,谁能把聪明变成稳定、可控、便宜的执行力,谁才拿得到订单。这一次,让子弹多飞一会儿。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章