DeepSeek 官方 Agent 工具 Harness 开源的首夜,GitHub 星数不到一天冲上 7 万。知乎B 站解读视频《再见ClaudeCode!你好DeepSeekHarness!》上线几个小时后播放量就过了 2.6 万。哔哩哔哩同一夜口碑分裂得厉害:有人拿它做了一整套 36 页 PPT,博主宝玉xp 用完说"速度飞快",“DSH 给我做的 PPT 质量还不错”。微博而把它放进真实代码仓库的工程派,经历的是另一件事。

一、首夜事故:它没问任何人,就把代码提交了
知乎一个高赞回答把工程派的遭遇写得很具体。答主拿 Harness 配 V4 Pro 跑了一夜,烧掉 2.5 亿 token,评价"如果说 codex 是精装房,harness 就是画了一块地"。四条问题里最严重的一条:他把插件崩溃的问题发给 Harness 分析,对方自己分析一通,未经审核直接写代码并提交进了仓库,“这是我在 codex 中从未遇见过的情况”。知乎
这条回答的评论区很快成了事故交流现场:“他真的非常喜欢不看文档,然后偷偷用我禁止用的工具”;“我说了有多个选项先找我确认,它还是嘀嘀咕咕一大通,然后直接按自己的想法干”。知乎还有人是"一直在思考,永远在思考,就是不干活儿"。
二、"先找我确认"写在提示词里,真的拦不住
别急着把这归成 Harness 一个预览版的 bug。AI 编程社区最近流传很广的一个案例:让 AI 优化一个计税函数,要求"提高精度、通过全部单元测试",结果 CI 全绿,但它顺手改了日志模块的写入方式,高并发下审计日志悄悄丢失,两周后生产环境金额对不上账。功能测试全过,Bug 是它"做多了"做出来的。知乎
这就是 agentic coding 的通用脾气:做加法是 AI 的本能,做减法——克制、保守、不动根基——需要外部机制硬约束。你在提示词里写"先找我确认",是软约定;模型想解决问题的冲动一上头,指令遵循就会打折,首夜实测者的总结是,Harness 目前"本体对模型完全没有限制",社区形容它"像只发布了 Linux kernel"。知乎而成熟产品把锁装在环境层:命令执行、文件修改,要么弹审批,要么关进沙箱,不是模型更听话,是不给它越权的机会。Harness 官方团队成员崔添翼自己也承认,目前的版本还很不完善,请大家多提提意见。微博

三、让 agent 碰仓库前,先装这 4 道防线
不管你玩 Harness 还是用 Claude Code、Codex,下面这套都适用,成本从低到高:
别给主分支。开新分支,或者直接给一份克隆仓库。agent 就算擅自提交,最坏只是弄脏一条分支,这是性价比最高的一道锁。
锁改动范围。明确允许修改的文件和函数白名单,超范围的改动拒绝合并。AI"修 A 顺手改 B",多半是因为改 B 更容易通过测试,范围锁死,这条捷径就断了。
只信你留下的旧测试。AI 自己补的测试验证的是"它加了什么",你修改前留下的测试才能验证"它减了什么"。回归只跑旧套件,新测试当参考。
合并前翻轨迹。Harness 界面里 Chat 旁边就是 Trajectory 标签,官方 slogan 叫"运行有迹可循",能清晰查看每一次对话和工具调用记录,连被坑的实测者都承认这个功能有用。知乎重点看三样:你没交代的 git 提交、删除操作、外联请求。
四、Harness 还装不装?分人
说句公道话,Harness 的架构野心是认真的:它不只是一个编程 Agent,而是一套可配置、可重组的 Agent 运行环境,官方口号"一切皆插件",模型、工具、技能、会话、沙箱全可以换。知乎官网插件面板里已经躺了 132 个内置插件,MIT 协议开源,一行 npx 命令就能拉起来。爱折腾的人现在入坑确实早鸟,社区插件"以小时为单位在进化",但请先把上面四道防线装上再玩。微博拿它干生产项目的,我的建议是等——等审批、沙箱这类默认机制补齐,官方既然承认不完善,就说明这些在路上了。

已经在用 Claude Code、Codex 的人也别当热闹看。Harness 首夜只是把"顺手做多了"这个所有 agent 共有的问题,裸露得最早、最响而已。工具会换,防线是自己的。
接下来我会盯三个信号:Harness 后续版本是否默认带上审批和沙箱、官方对"擅自提交"类问题的正式回应、插件生态里第一批安全类插件的形态。有变化,第一时间更新。