当前位置:
AIGC文章详情

一周暴涨17万Star,口碑却两极:DeepSeek Harness现在值得切换吗?

源自109位全网作者

19:08

如果你混AI编程圈,这周的Feed大概率被一个词刷屏了:Harness

8月14日,DeepSeek开源了DeepSeek Harness(简称DSH)。一周没走完,GitHub Star就破了17万,是近期涨得最快的开源项目之一。36氪

一周暴涨17万Star,口碑却两极:DeepSeek Harness现在值得切换吗?

6天后的8月20日,OpenAI跟进,发博客宣布Codex是一个"开放的智能体Harness",鼓励开发者在它上面搭自己的Agent应用。而Kimi Code、智谱的ZCode,其实早就有自己的执行层。以前把编程工具内部当核心机密的大厂,在同一周集体掀了桌子。

也是这一周:上周日Claude全球大规模宕机,Claude.ai、Claude Code、Cowork全挂。微博今天小红书上又有人吐槽Claude宕了近3个小时,“这级别该算重大事故了”。小红书三件事撞在一起,问题其实是同一个:当AI替你写代码时,那个替你干活的"执行层"归谁管,你该不该把工作流交出去?

先一口气说清Harness是什么

社区有个流传很广的总结:Model + Harness = Agent。模型是大脑,Harness是手,加上手周围的那套工厂体系——上下文管理、工具调用、沙箱、人工审批、"想一步、做一步、看一步"的Agent循环,全在这一层。

这一层为什么突然重要了?OpenAI这周给了一组很有说服力的数字:ARC-AGI-3测试里,GPT-5.6 Sol单跑只有13.3%;把同一个模型放进Codex Harness,加上持续推理和上下文压缩,跑出38.3%,输出token还压到约六分之一。36氪同一个大脑,换一双手,成绩接近三倍,成本反而降。这就是这周"AI工程方法"给出的答案:工程层不再是胶水,是乘数。

大厂为什么同时开源

不是做慈善,是三笔算盘,都写在明面上:

第一,抢"Agent运行时"。Codex已经嵌进Cisco的云管理、GitHub和JetBrains的IDE,甚至报税公司的申报系统——7000份报税单,准备时间砍掉三分之一。36氪企业代码、客户数据、审批流都跑在这个运行时里,谁握住它,谁就握住了工作流。

第二,数据闭环。DeepSeek以前只卖API,你的任务跑在Claude Code这些别人的Harness里,它只能看到请求,看不到任务卡在哪、最后成没成。有了DSH,模型和执行过程可以一起观察——用户在什么任务上失败、重试几次、哪种上下文策略更省,都是改进下一代模型的养料。

第三,计费入口。DeepSeek目前没有官方订阅,第三方平台把它的API包装成月卡在卖。有了自己的Harness,才能精确统计每个会话跑了几轮、缓存命中率多少。将来如果做订阅,计费可能从"卖token"变成"卖任务量、卖并发"。

国产阵营也没闲着:Kimi Code直接把完整执行层开源,智谱的ZCode则更像GLM的官方执行环境。

一周暴涨17万Star,口碑却两极:DeepSeek Harness现在值得切换吗?

DSH自己的迭代也猛:一周三更,新版一口气上了14项更新,还把Claude Code和Codex收编成可调用的子代理。36氪意思很明白:在Harness这一层,一切可替换,包括你现在的主力工具。

但17万星,先泼盆冷水

这里是ZDM的惯性动作:看口碑。这周社区实测,明显是两极的。

热的一面:"一切皆插件"的架构确实新,模型、工具、会话、沙箱、Agent循环都能换,底层由Cordis插件系统统一管理挂载卸载。Flask作者Armin Ronacher说,这是他第一次看到一个新项目,想回头重新思考自己的产品设计。约300名测试用户两周做了200多个插件,社区整理的精选列表发布第二天就收录了270个。36氪

但冷的一面,官方自己先认了:项目还在早期预览,有作者在Hacker News上提醒,后面还有很多粗糙之处和破坏兼容的变更。36氪

一周暴涨17万Star,口碑却两极:DeepSeek Harness现在值得切换吗?

开发者实测的证据同样硬:有人翻代码发现45.3万行、219个包,执行日志和沙箱设计不错,但首发只有一个压缩过的git commit,也没提供基准测试,外人看不到项目是怎么演化的。Reddit上的实测反馈集中在"慢、token消耗大、文档不清"。插件生态长得快但质量参差:大量插件只有一句话说明、没有真实用户评分,UI和远程连接类插件玩坏了,得自己有能力回滚排查。更直接的教训:上周一个号称让"DeepSeek V4 Pro越级打旗舰模型"的热门插件被锤,效果没人能复现,token开销反而翻倍。36氪

17万星能证明开发者愿意研究新东西,不能证明你可以把关键工作交给它。就像一位大模型开发者说的:“离开模型能力谈Harness,没有意义”。36氪

那到底要不要切换?看你是哪类人

  • 生产交付主力、Claude Code或Codex订阅是饭碗的:别切换。 DSH现在扛不住生产。但这周的两次宕机值得你记取一个教训:别把工作流全绑在单一闭源运行时上。起码把CLAUDE.md、spec文档、上下文文件留一份可移植的文本格式,再留一条随时能用的备份通道。

  • 已经在烧国产模型API、爱折腾的:值得试。 DSH最大的卖点是"Harness免费、模型可换",DeepSeek、Kimi、GLM、Qwen都能接。DeepSeek刚宣布周末全天谷价,现在周末跑任务最便宜。36氪但记得设预算上限,别上生产任务。

  • 想给自己产品或团队搭Agent的:这是最好的对照观察期。 Codex Harness走"发动机调好给你"的路线——SDK、app-server、企业案例都落地了;DSH走"发动机都给你自己装"的路线。两种开放哲学正面对撞,值得深看。

  • 纯观望的:盯三个信号。 Fable 5.1全量能否在月底前稳定落地(灰度已经开始,官方口径价格不变)。微博Anthropic会不会跟进开放Claude Code的执行层;DSH插件生态能不能长出质量筛选和安全审核。这三个问题的答案,比Star数重要。

无论切不切换,这周有四个方法值得带走

  1. 把工作流像Harness一样显式化。 上下文、工具、校验,每一块能独立替换、独立讨论、独立评估,这是AI编程和"跟AI聊天"的根本分界。

  2. 把token预算当工程指标。 输出token按输入约5倍计价,prompt缓存命中最高能省90%。哔哩哔哩Claude Code新版上了/cost、状态栏、预算上限三个入口,可以实时看成本。哔哩哔哩Fast模式快2.5倍,但账单可能翻倍。小红书还在糊涂烧钱的,该开始看数字了。

  3. 别把工作流押在单一运行时上。 这周两次宕机之后,这个不用多解释了。

  4. 用生产眼光看开源项目。 Star数、提交历史、基准测试、插件质量,缺一项都是坑。17万星是热度,不是就绪度。

第2条值得配一个真实例子。有社区实测跑DSH:一个54步的任务,LLM耗时34分22秒,缓存命中率99%——任务可以很长,但成本靠缓存摁住了。长上下文任务里,缓存命中率每涨一个点,都是实打实的钱。36氪

一周暴涨17万Star,口碑却两极:DeepSeek Harness现在值得切换吗?

引擎们在接连开源,这是好事。但驾驶技术——怎么组装上下文、怎么设校验、怎么管预算——从这周起,更明确地变成你自己的事了。17万星的热闹过去之后,真正该留下的,不是某个别人的运行时,而是你自己的工程方法。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章