过去一周,哪怕你平时不太关注AI圈,大概率也被一个词刷过屏:DeepSeek Harness。
8月13日深夜,DeepSeek两小时三连发:V4 Pro正式版、API调价预告,最后是这个MIT协议开源的"Agent工作台"。36氪五天后,star数突破15万。知乎而发布首日,GitHub star就破了3万、冲上Hacker News,创下最快破2万star的纪录。
更新的节奏也很猛:8月17日rc.7,19日深夜rc.8带着14项更新落地,距离上一版才过去两天。36氪今天(8月21日),又放出了视觉实验模型V4-Flash-Vision-Exp。知乎从rc.7到rc.8再到视觉模型,社区把它总结为"一周三更"。
但热闹归热闹,大家真正在问的问题其实很朴素:它免费、开源,还能把Claude Code和Codex收编成"下属"——我是不是也该装一个?
回答之前,先把三个问题想清楚。
一、Harness到底是个什么东西
Harness直译是"挽具",就是套在模型外面的那层工程外壳。DeepSeek官方给的公式很直白:Model + Harness = Agent。36氪模型负责思考,Harness负责思考之外的一切:任务拆解、工具调用、记忆管理、错误重试、结果闭环。
你熟悉的Claude Code、Codex,本质上也是harness——但它们是闭源成品,还各自绑死自家模型。DeepSeek这次做的是把"外壳"整个开源:MIT协议、模型随便换、可以完全离线部署。
架构上最狠的一刀是"一切皆插件":模型、工具、技能、会话、沙箱、存储、调度、UI,甚至Agent主循环本身,全部可插拔替换。DeepSeek官网底层微内核的启动清单只有129行,没有一个零件是焊死的。有博主把它比作安卓的打法:自己不造手机,但让所有厂商跑在自己的系统上。

还有个细节值得说:这个项目从6月10日第一次提交到8月13日公开,64天里做了12293次提交,附带683篇设计笔记,连被否决的11条方案都摊在仓库里。36氪一向爱挑刺的Hacker News,这次高赞评论是:“这次它看起来相当原创。”
二、它值得关注的点,不是"又一个编程工具"
rc.8最有嚼头的更新,不是大家讨论最多的"原生看图",而是这条:Claude Code和Codex,现在可以作为插件包安装,在Harness的工作流里当子代理干活。36氪Codex还支持非交互模式和多个命名实例——一个任务里可以同时挂几个Codex干不同的活,干完了自动回传结果、唤醒等待中的父任务。
竞对的产品,变成了自己流水线上的零件。等于DeepSeek官方盖章了一种玩法:用一个harness,指挥所有模型。

对普通用户来说,这有个很实际的场景:你手上可能同时有Claude的订阅、Codex的额度、DeepSeek的API,过去它们是三个工具、三套习惯;现在理论上可以塞进一个Harness里统一调度。社区动作也快,已经有人做出一站式接入各家AI订阅套餐的插件,目的写在脸上——应对涨价,把每一份买过的算力都用起来。哔哩哔哩
三、泼冷水:有三种"热闹"别当真
做决定之前,冷水必须先泼。
第一,v0.1就是v0.1。官方文档用全大写警告:将会有破坏兼容性的变更。36氪rc.8的SQLite数据结构已经出现不兼容,本地存了大量会话数据的,升级前要先想清楚。另外有媒体实测发现,程序跑起来后本机会生成UUID随每次请求发送,且不受遥测开关影响——在意这点的,用之前心里要有数。
第二,体验还没有口碑那么好。内测开发者直言,当前体验不如Claude Code和Codex完善。36氪知乎上有位做了详细实测的答主反馈:官方推荐安装方式太慢,clone源码装了800多个依赖,27分钟才跑起来;内置工具是常规开源水平,弱于成熟商业产品;让它写个小插件,人离开一会儿回来发现进了死循环。知乎这些是个人体验,但和社区共识方向一致:能玩,还不能当饭吃。
第三,也是最容易被忽略的:插件生态里的"跑分",别当真。Harness火起来之后,比框架更火的是插件。上周有个叫J-Space的Skill刷屏,宣称接入后能让DeepSeek V4 Pro在多个基准上超过Fable 5。结果社区复测完全相反:有人用8张H20跑89道题,得分77.5%,和报告里的87.1%对不上,token消耗反而更高。机器之心质疑的issue还被作者删了,最后变成一场公开打假。

这场打假其实揭示了一件更重要的事:同一个V4 Pro跑同一个工程任务,在Harness的Standard模式下得91到92分,换成工具更少的Minimal模式,能到96到99分——模型没变、任务没变,只是换了运行环境,差距接近8分。机器之心Agent时代的"模型成绩",本质是"模型+运行环境"的联合成绩。
而Harness在产品层面其实已经给出了应对:它的官方实现里,Agent的完整执行轨迹是摊开可查的——哪一轮调用了什么工具、传了什么参数、返回了什么、耗时多少,逐轮记录在案。36氪效果到底行不行,除了看别人晒的跑分表,你还可以自己翻轨迹。

以后再看到"接入XX,性能超越XX"的宣传,第一反应应该是:复现步骤在哪?
四、所以,到底该不该上车
把人群分三类来说。
第一类,爱折腾的玩家、有多模型调度需求的:可以上。“一切皆插件"就是给这类人准备的玩具,MIT协议随便改,把自己的订阅和工具链塞进一个工作台,可玩性拉满。哪怕只是装上Claude Code和Codex的插件包,体验一下"指挥两个下属干活”,也值回时间成本。
第二类,指望开箱即用干活、拿来交付生产任务的:先等等。你现在每天靠AI编程吃饭的话,Claude Code和Codex目前仍然更稳。Harness一天几百次提交、文档滞后、数据结构随时可能不兼容,把工作流押在上面,风险收益不成正比。
第三类,成本敏感、想省钱的:单独算账。Harness本身免费,花钱的是你接的模型。DeepSeek的API在8月17日刚调过价,引入了峰谷定价(北京时间上午9到12点、下午2到6点是峰时,谷时半价)。36氪不同渠道的价格、缓存命中率差异也不小。上车前按自己的真实任务算一遍账单,比看任何一篇"性价比吹爆"都靠谱。
还有三个信号值得持续观察:一是官方能不能把"一周三更"的节奏保持到稳定的正式版;二是插件生态的质量——现在已经有近千款插件,但J-Space这样的注水项目也在里面浑水摸鱼;三是DeepSeek会不会跟进官方Coding Plan,社区已经在讨论99、199、299的定价。哔哩哔哩一旦套餐落地,成本结构会再改写一次。
写在最后
DeepSeek这波,真正值得琢磨的不是又一个开源工具,而是竞争位置的挪动:模型层已经卷成红海,新的战场在"调度层"——谁来组织模型、管理任务、握住你的工作台。36氪Claude Code绑Anthropic,Codex绑OpenAI,Harness押注开源和中立。
如果安卓式的剧本成立,以后大家比的也许不再是"你用哪个模型",而是"你在哪个harness上干活"。
不用急着今天上车,但这层正在发生什么,值得你现在就搞懂。