本周关注Agent工具的人,应该都被DeepSeek Harness刷屏了。8月13日,DeepSeek开源了这款Agent框架的v0.1公测版;不到一周,8月19日深夜又推送了v0.1.0-rc.8:此次更新共带来14项调整,覆盖多模态输入、子代理协作、终端体验、工具调用和开发者支持等多个方向,Claude Code和Codex也被进一步接入它的子代理体系,可以按需安装。智东西
看到这条更新,我的第一反应不是"DeepSeek厉害",而是:Agent架构圈到底发生了什么,为什么竞品能被当插件装进对方系统里?我翻了36氪、机器之心的报道、知乎上几篇架构拆解和GitHub上的issue,把这条线捋了一遍,说说它到底值不值得你花一个周末。

先说清楚Harness是什么
DeepSeek给了一个很简洁的公式:Model + Harness = Agent。36氪模型是大脑,负责理解和推理,但纯语言模型只能输出文本,成不了真正干活儿的Agent。
分工很明确:模型负责决定下一步想做什么,Harness负责让这个决定真正发生。知乎工具调用、文件读写、沙箱环境、权限管理、任务编排,全都发生在模型之外。没有Harness,模型只是一台会说话的引擎。
这次开源本身就带着戏剧性:8月12日深夜,V4-Pro模型没有发布会、没有预告地静默上线,官网横幅和开放平台公告一度被撤下,同天晚上,DeepSeek重新发布公告确认V4Pro正式版上线,同时开源DeepSeekHarness开发者预览版,一切又回到了主场。36氪此前Claude Code和Codex的Harness实现一直是闭源黑箱,"怎么把模型变成Agent"更像特权知识,DSH是第一次把这整套方法论完整摊开。
三个系统摆在一起,差别不在功能列表
DSH、Claude Code、Codex看起来都有LLM、工具、Skill、子代理、沙箱、权限,只做功能对比会得到一张"大家都有"的表格。真正的分岔在一个问题上:系统的中心是什么,什么不可替换。
Claude Code的中心是"一只高能力Agent"。Skill是给它的经验包,Hook是替它设的强制检查点,Subagent帮它分工,一切外围能力都在增强中心那个模型,是典型的Agent-centric架构。Codex的中心是"执行边界":Sandbox管能碰什么,Approval管何时必须停下授权,很像操作系统在管进程权限和隔离。DeepSeek Harness最激进:它没有中心,官方文档写得很直白——There is no privileged core to patch,从模型适配器、工具注册、会话到Agent Loop主循环本身,全是可替换插件。知乎
这里有个设计值得企业架构师抄进笔记本:Capability Seam。DSH把能力拆成Service Definition、Provider、Consumer三层,以Shell能力为例,上层Agent只依赖"Shell Service"这个抽象,底层可以接本地进程、容器或远程沙箱,上层代码一行不改。这套"一切皆插件"的设计背后,是北大与DeepSeek联合提出的"时空可组合性"范式:时间维度用可逆效应机制,自动记录并撤销组件卸载后的副作用;空间维度用声明式依赖,让运行时自动协调组件启停。36氪

三种哲学没有赢家,只有你优化的是什么问题
做体验极好的专业Agent(编程助手、研究助手这类"一个主Agent完成复杂工作"的产品),Claude Code的思路最值得学:强模型+高质量上下文+少而强的工具+Skill和Hook。Agent要操作真实系统——改代码、动数据库、调生产接口——学Codex,因为一旦Agent能行动,架构难点会立刻从"模型够不够聪明"变成"模型做错了怎么办"。做Agent平台,多模型、多工具、多执行环境要共存,DSH的可组合运行时才开始有吸引力。
三家框架看似各走各路,其实都在回答同一个问题:模型究竟应该拥有多少控制权。知乎顺手给一个我提炼出来的四问框架,评估任何Agent框架都能用:①它把什么当架构中心?Agent、Workflow还是Runtime,中心决定哲学;②它把多少事交给模型动态决定?理解、规划、路由、执行、终止,交给模型越多,灵活性越高、确定性越低;③它怎么限制模型?Hook、权限、沙箱、人工审批,限制越靠近执行层越可靠;④它怎么面对变化?加新工具、换模型、换沙箱、换主循环,哪件容易哪件难。四个问题答完,基本能看出一家框架的真实设计水平。
想上手之前,先泼三盆冷水
第一盆:插件生态已经出现第一起刷分翻车。上周一个叫J-Space的插件刷屏,宣称装上一个Skill就能让V4 Pro在多个基准大幅提升、部分成绩甚至超过Claude Fable 5。社区复测完全相反:第三方盲评对照组平均8.30分,J-Space组只有7.87;有测试者用8张H20部署V4 Flash实测,89道题中,模型通过69道,最终得分为77.5%,远低于报告宣称的87.1%。机器之心质疑声出来后,作者不仅没有公开完整的评测记录或者运行日志,还被曝删除质疑issue。
第二盆:运行环境本身就会显著改变成绩。同一个V4 Pro跑同一个工程任务,DSH的Standard模式91分、PTC模式92分,换成工具更少的Minimal模式,两次测试分别达到99分和96分,接近8分的差距全来自Harness配置。机器之心以后再看到"某某框架释放某某模型"的跑分,先问一句跑的什么模式。
第三盆:学习曲线不温柔。Claude Code需要理解的大致是Agent+Skill+Hook;DSH要理解Cordis、Context、Service、Provider、Consumer、Effect、Event、Bundle、Profile等一整串概念。知乎上那篇架构拆解,作者自己都说如有理解不到位的、错误疏漏的,恳请各位批评指正,全文46000字靠个人写作与校对。知乎Runtime非常优雅,但使用者的理解成本非常高。
那到底值不值得折腾
我的判断分人群。适合三类人:想搞懂"Agent Runtime该怎么设计"的架构师和技术负责人,DSH是目前唯一开源的公开教材,插件拆分和Capability Seam比十篇论文都值得读;想自建企业Agent平台的团队,Service/Provider抽象直接回答"开发用本地进程、生产用容器、客户要求远程沙箱"这类问题;想读源码补Agent工程课的人,v0.1代码量还不算大,现在进场正好。
不适合三类人:想要开箱即用编程助手的,成熟CC/Codex的体验目前仍更完整,DSH还在rc阶段快速迭代;生产环境要求稳定的,v0.1意味着没有兼容承诺;不想碰命令行的,安装基于npm,可以直接运行npx @deepseek-ai/dsh web启动,零Node环境会比较痛苦。36氪好在rc.8的实际体验在快速补齐:原生图片请求和图文混合输入已经支持,Windows上也有了持久PowerShell会话,离"能用"又近了一步。智东西

后续值得盯三个信号:GitHub的release节奏,公测不到一周就出rc.8,迭代速度在线;刷分风波之后,社区能不能长出基准复核机制;多模态和子代理生态有没有真实落地案例。

这次DeepSeek真正引爆的不是一款工具,而是"如何构建一个强Agent"的黑箱第一次被打开。OpenAI和Anthropic选择向下整合,把Harness和自家模型深度绑定,巩固AI应用层的优势;DeepSeek选择横向铺开,试图成为模型中立时代的Agent基础设施标准。36氪对架构师来说,工具会过时,方法论的免费课值得蹭。