三周20.7万星、官方自认"还很不完善":DeepSeek harness这波真正的收获,不是框架迁移,是那11份SOP
这半年,玩自动化工作流的人基本都被教育过一轮:n8n是不是过时了、"小龙虾类"平台一夜停服、WorkBuddy的免费额度改了三回、囤的Skill一半在白嫖token。每一次风向变动,都逼着人回答同一个问题:要不要动?这次轮到DeepSeek下场——8月13日,它以MIT协议开源了自己的agent运行框架deepseek-harness(社区简称dsh),三周拿下20.7万星。知乎
评论区照例分裂:有人花40分钟跑通、直呼"体会了一把程序员的快乐";也有人刚上手就撞上"低级错误",基本能用但毛病不少;还有人翻出旧账说论harness能力kimi才是国模第一。小红书 到底该不该跟着这波动?先把这件事拆开看。
30秒看懂:它是什么,不是什么
dsh的核心主张是一个等式:Agent = Model + Harness。模型负责推理,harness负责让模型真的能干活——能看到什么、能调用什么、出错怎么恢复、越界怎么拦截。它有两大设计:一切皆插件(模型适配器、工具、会话记忆、Agent循环全是插件,188个npm包组成底座,最小配置49行YAML就能搭出整套agent栈)。知乎 每次运行可追踪(模型看到的每一行输入都写进只追加的会话日志,界面可以逐条回放),底座Cordis还有一篇北大×DeepSeek合作的配套论文。

但注意:它不是又一个工作流编排工具。9月1日它还在发0.1.2-alpha.3。知乎 此前官方框架一周内连发两个预发布版本、合计52项变更。哔哩哔哩 连发布人崔添翼自己在开源当天都说"目前的版本还很不完善,请大家多提提意见"。这是一个值得盯着的运行基座,不是一个今天值得把生产流程押上去的成品。
这波浪潮真正动摇的是哪一层
过去半年我们吵"工作流还是Agent",其实问的是画布上怎么连线。dsh把这层窗户纸捅破了:WorkBuddy这类办公成品内部本来就自研了一套私有harness,只是包在黑盒里不给你看;Codex、Claude Code同理。知乎 所谓"基座开源",动摇的不是你那张n8n画布——确定性流程照跑,不会因为dsh发布就过时——真正被重新定价的是"平台锁定":模型换成兼容端点即可、会话日志留在自己机器上、插件可装可卸。

有意思的是,DeepSeek官方文档里直接提供了dsh接Codex的集成教程,等于承认这不是你死我活。小红书 社区也很快跑出务实的配对公式:GPT配Codex、Claude配Claude Code,开源模型配dsh。知乎 挑工具的标准也从"比谁模型分高"变成"谁能把完整项目接过去、记住上下文、自己跑测试、出了错自己回来修"。微博
比框架更值钱的,是那11个文件
仓库里有个不起眼的目录:.agents/skills/,放了11个DeepSeek内部真实在用的工程规范,相当于把自己团队的SOP摊开了:做Code Review要"一个简短的、有实证的blocker,比一堆nit有价值得多"。微博 推送前不跑全量测试,按改动范围选最小检查集;专门有一个Skill处理"思维链泄漏"——把"之前是"“不再是”"审查者确认了"这种AI推理痕迹从代码注释里删掉。连改了GUI的PR都必须附一段从真实服务器录制、带commit SHA的GIF证据。
这跟之前那篇"启动就吃22000token、装的Skill一半在白嫖"正好接上:如果你不打算碰框架,至少可以拿这份"大厂内部版参考答案"去体检自己囤的Skill——你写的是规范,还是废话。
三种人,三个动作
不懂代码、只想提效的办公流玩家:别折腾。有拆解说得很直接——不要幻想拿基座直接提升日常办公效率,你的核心价值是业务,不是调试Agent框架。知乎 该做的是把11个SOP的写法抄进自己的工作流提示词。
有node环境、能看懂YAML的半技术党:值得花40分钟用sdk-minimal跑一个任务,重点体验轨迹视图——你的agent每一步干了什么、token花在哪,全程可回放。这恰好是自建工作流最常缺的审计能力。
跑生产流程、接单帮人搭系统的:先别迁。盯三个信号:alpha到stable的发布时点;社区插件生态的扩展速度——插件盘点已经更新到"第十三弹"、一次新增任务看板、工程安全、云数据库等5个品类,桌面版、Python复刻版也在被自发跟进;以及WorkBuddy们面对基座开源的定价与自定义策略反应。小红书

半年前那波"过时论"教会我们:工具没死,是入门方式在变。这一次分工线又往下挪了一层——它不在"用n8n还是用Agent"里,而在你跑agent的那层外壳,握在厂商手里还是你自己手里。先看懂这个,再决定动不动。