这周 AI 编程圈很热闹,但很多人没注意到热闹的主角。
8 月 13 日深夜,DeepSeek 开源了 Harness v0.1 开发者预览版,这个 Agent 工作台首日 GitHub Star 破 3 万、登顶 Hacker News。36氪
8 月 19 日深夜,DeepSeek Harness 放出 RC.8,最有嚼头的不是多模态,而是 Claude Code 和 Codex 现在可以作为"子代理"被装进这套框架里调度——竞对的产品,变成了自家仓库里的零件。
8 月 20 日,OpenAI 跟进:将 Codex 的底层核心框架 Harness 作为平台全面开源,许可证是 Apache-2.0。36氪一周之内,AI 编程领域最能打的两家公司,同时在抢同一样东西——而且这样东西不是模型。
一、Harness 是什么:模型外面那层"马具"
今天在 Claude Code、Codex、DeepSeek Harness 里感受到的差异,很多时候并不来自模型本身,而来自模型外面那层 Harness。知乎模型负责思考,Harness 负责模型之外所有的工程脏活:任务拆解、工具调用、记忆管理、错误重试、上下文压缩、人类审批。

这套系统有个行业名字叫 agent harness——字面意思是马具,给不听话的马套上挽具让它能拉车。知乎DeepSeek 官方的公式写得更直白:Model + Harness = Agent。36氪
这不是本周才冒出来的新概念。Anthropic 官方工程博客在 2025 年下半年连着发了几篇专门讲 harness 的文章。知乎OpenAI 也在去年秋天提出 Shell、Skills、Compaction 是 agent 的"三大基元"。社区已经把这个方向命名为 Harness Engineering,GitHub 上甚至出现了专门追踪各家 harness 设计的资源集合 awesome-harness-engineering。
真正的信号,是一线的痛点先追上了概念。知乎上有个近百万阅读的问题:"为什么刚开始觉得 AI 编程很厉害,用久了就不行了?"高赞回答的诊断很直白:React 热更新这个问题一个工具一直搞不定,最后靠 Claude Code 弄成的,同一个模型,差别就在外面那层工程化。知乎体感像内功和外功——模型是内功,工具链是外功,得配套。
一位在 B 端 SaaS 项目上实践了三个月的开发者,把问题总结得更系统。第一是长对话降智:上下文用到 60% 之后开始明显退化,重复读已经读过的文件、在已经验证失败的路径上再走一遍、忘记前面定过的硬规则。知乎第二是跨 session 失忆,每开一个新对话都是白纸,昨天三小时讨论出的结论全部清零。第三是规则会被绕过,你在规则文件里加粗大字写下的禁令,模型卡住、上下文将满时仍会"理性地"选择违反。他的结论值得贴墙上:规则写在 markdown 里是宪法,宪法靠合作,真正的边界必须是物理的。
二、硬证据:Harness 能改变模型的命运
如果社区体感还只是个案,OpenAI 随 Codex 开源一起给出的数据,就是直接砸场子的锤子。在难度极高的 ARC-AGI-3 基准上,OpenAI 只对 Harness 做了两项关键调整——保留推理链与上下文压缩,完全没动模型权重,GPT-5.6 Sol 的得分就从 13.3% 飙升到 38.3%,输出 Token 还减少了六倍。36氪模型变"聪明"了,API 账单还变少了,这笔账每个带团队的人都算得过来。
这意味着什么?过去比较 AI 编程工具,第一个问题总是"谁的模型写代码更强",现在答案要加个前缀:得看谁的 harness 在驱动这个模型。裸模型更像一个会思考的函数,Coding Agent 则是一套会循环执行的工程系统。知乎同一匹马,换一套挽具,拉出来的活完全不是一个量级。
这次 OpenAI 在 Apache-2.0 许可下一口气放出了完整的三大开源组件。36氪具体分工是:codex exec 是 CLI,跑有边界的自动化流水线,适合 CI 和后台一次性任务;官方 SDK 支持 TypeScript 和 Python,用代码精准控制任务生命周期;app-server 则是深度嵌入自有产品的核心引擎,持久会话状态、流式事件、中途打断、把自家工具暴露给 AI、人类审批,全部通过 JSON-RPC 协议走。

Greg Brockman 的转发话说得很直:Codex 能驱动的远不止编程工具。第一批吃螃蟹的人已经把这套 harness 嵌进了专业税务准备工作流,试点处理了 7000 份申报表,单份准备时间缩短约三分之一;Cisco 也用 SDK 在自家云控制平台里搭了 App Builder。聊天框,正在不再是 AI 的唯一入口。
三、三方路线:闭源整车、开源引擎、调度层
现在的格局,一张表可以看清:
阵营 | 开放程度 | 定位 | 打法 |
|---|---|---|---|
Claude Code | 闭源成品 | 体验优先,绑定 Anthropic 模型 | Harness 设计成熟,但模型与生态封闭 |
Codex Harness | Apache-2.0 全开源 | 组件化引擎 | CLI、SDK、app-server 三件套,鼓励把 Agent 嵌进自有产品 |
DeepSeek Harness | MIT 开源 | "一切皆插件"的调度层 | 模型可换、可离线,还能把 Claude Code 和 Codex 收编成子代理 |
三种打法完全不同。Claude Code 像一辆精装修的整车,体验目前最好,但你得接受 Anthropic 的全套;Codex Harness 是把发动机拆出来卖,界面、数据、审批权限都留在你手里;DeepSeek 走的是安卓路线——不造手机,但想让所有厂商都跑在自己的系统上。
DeepSeek 的进攻节奏很快。RC.8 最实质的一条,是把 Claude Code 和 Codex 做成按需安装的子代理,在 Harness 的工作流里当具体任务的执行者,Codex 还支持非交互权限模式和多个命名实例,一个任务里可以同时挂好几个干不同的活。36氪RC.8 还支持原生看图:面对不支持图像输入的模型,harness 会调用 OCR、颜色统计等工具把图片拆成结构化信息再喂给文本模型,相当于用工具编排拼出一套"土法视觉"。

支撑这一切的是 Cordis 微内核,架构上最狠的一刀是"一切皆插件":模型、工具、技能、会话、沙箱、存储、调度、UI,甚至 Agent 主循环本身,全部是插件,全部可替换。知乎Cordis 是一个元框架,一个用于构建框架的框架,这套理论的核心想法和部分公式,早在几年前就发布在了一个不那么起眼的聊天机器人框架的文档里。知乎

项目投入也相当狠:从 6 月 10 日第一条提交到 8 月 13 日公开,64 天里干了 12293 次提交,附带 683 篇设计笔记,连被否决的 11 条方案都摊在仓库里。36氪成本端,V4-Flash 输出 2 元/百万 token,8 月 17 日起还改成了分时计价——低定价加 MIT 协议、可完全离线部署,对成本敏感团队的吸引力是实打实的。
但冷水也得泼。官方文档用全大写警告:将会有破坏兼容性的变更;内测开发者也直言,当前体验确实不如 Claude Code 和 Codex 完善,每天几百次提交的仓库,文档滞后是必然的。36氪新版 SQLite 数据结构已有不兼容变更,升级前一定要备份本地数据;还有开发者注意到,跑起来后本机会生成 UUID 随每次请求发送,遥测开关并不影响它,企业用户要提前评估。"一切皆插件"同样是双刃剑:大量开发者自由定制之后,插件兼容性和生态碎片化的风险迟早会来。
Claude Code 这边,气氛也有点微妙。这两天知乎上"Claude Code 增长熄火,网传现大规模退订"的问题热了起来,不少老用户在讨论转用 Codex。知乎社区观点纷杂、不能全当真,但它说明一件事:当 harness 层变成变量,原本以为稳固的用户忠诚度,开始松动了。
四、避坑提醒:Harness 值得投入,但它不是咒语
本周有个很有教育意义的闹剧。社区项目 J-Space Cognition Suite 在 X 上刷屏,宣称不改 DeepSeek V4-Pro 的权重、只加一套推理时 harness,就能在多个 Agent 基准上大幅提升、“击败 Fable 5”。但截至 8 月 18 日,项目方公布的所有性能提升数据都来自自测,没有独立团队在相同条件下复现。36氪
有尝试过的开发者说得很直白:这是炒作,而且是假的,没能复现其中任何一项说法,Token 消耗反而比基线更多。36氪还有人扒了仓库后发现,这套神秘的"外挂"实现形式就是一个 skill 插件。顺带一提,它和 Anthropic 7 月发表的 Claude 内部表征研究只是撞名,没有任何关系,但确实骗到了不少人。
这个闹剧给所有人提了个醒:harness 工程值得投入,但它的本质是确定性工程——验证闭环、记忆管理、边界防护、上下文纪律,不是咒语,更不是装一个就变强的插件。下次再有人告诉你"装上某某插件模型智商暴涨",先做个 A/B:同模型、同提示词、同工具权限,只换 harness,看差异能不能稳定复现。
五、落地判断:谁该观望,谁该上手
最后落到行动。这波变化对不同处境的人意义完全不同,我的判断是:
1. 已经重度用 Claude Code、体验顺畅的:不急着换车。成品 harness 的成熟度不是一天能追上的。但有两件事今天就可以做:一是学 harness 思维——规则文件、hooks、skills、上下文管理,这层知识不依赖任何具体工具,是谁也拿不走的长期资产;二是留好评估的后门,尤其当你已经吃过封闭生态的亏(换不了模型、接不进内部系统),Codex 和 DeepSeek 的追赶窗口正在打开。
2. 想把 AI 能力嵌进自家产品、看板、业务系统的:Codex Harness 是当前最值得评估的选项。Apache-2.0 可商用可修改,三件套齐全,app-server 把"审批界面"和"执行循环"分开,官方还给了完整的集成示范。最大的风险是进化节奏:OpenAI 已经放话,下一代 harness 将脱离 PC,两三个月后现在的工作方式可能淘汰。知乎集成时务必给架构迁移留余地。
3. 成本敏感、需要多模型切换或有信创部署需求的:值得认真试试 DeepSeek Harness。MIT 协议、可完全离线、子代理还能调度 Claude Code 和 Codex,2 元/百万 token 的定价是真香。36氪但记住三条:v0.1 状态,别一上来就接核心生产流程;升级前备份,SQLite 已出现不兼容变更;遥测和数据外发问题,企业环境提前评估。
4. 值得持续盯的信号:DeepSeek Harness 的更新节奏能不能保持——它已经注册了商标,生态化运作的准备动作很明确;Codex 云端 harness 的进展;以及 Anthropic 会不会跟进开放 Claude Code 的 harness 层。这三件事任何一件落地,“用哪个工具"的问题就会进一步变成"把工作流搭在哪个调度层上”。
一句话收尾:AI 编程拼"选模型"的时代正在结束。内功(模型)大家越来越没得选——前沿模型都足够强;外功(harness)才是工程人能真正攒在自己手里、能产生复利的那一层。这周 OpenAI 和 DeepSeek 的开源二连发,本质上是把外功的定义权,交到了你的手上。