当前位置:
AIGC文章详情

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

源自118位全网作者

08-24 13:29

这周关注AI编程的人,应该都被一头鲸鱼刷屏了。

DeepSeek开源了一个叫DeepSeek Harness(圈内简称DSH)的Agent运行框架,上线当天GitHub star冲到9.5万,几天内一路涨到十四五万甚至更高,fork 1.8万。知乎什么概念?有知乎博主翻了下GitHub Trending:Claude Code攒到这个量级用了半年,DSH只用了一周。

更耐人寻味的是OpenAI的反应:8月19日,它把Codex背后的执行系统Codex Harness直接开源了,Apache-2.0协议。36氪36氪的标题很直白——“AI编程的护城河,被亲手拆开了”。

两家头部玩家一周之内抢同一样东西,说明行业竞争的焦点正在从"谁的模型更聪明"转向"谁是Agent的运行时"。对我们这种跑自动化、用Agent干活的人来说,这是直接影响工作流和钱包的事。今天把知乎、B站、微博、36氪的信息全翻了一遍,帮你分清楚哪些是信号,哪些是噪音。

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

先搞清楚:Harness到底是个什么东西

很多人第一反应是"又一个AI写代码的工具"。不对。

这波有个被反复提到的公式:Agent = Model + Harness。模型是大脑,决定多聪明;Harness是躯体——任务循环、工具调用、上下文管理、沙箱隔离、结果验证,决定这份聪明能不能真正用出来。

Claude Code和Codex好用,不只是模型强,更是底下那层harness调教得好。但这两家的harness一直是闭源黑盒:模型锁死、工作流锁死,你最多选选模型、加几个MCP、调调system prompt,底下的agent loop碰都碰不到。

DSH干的事就是把这层打开了:MIT协议全栈开源,README里的口号就四个词——everything is a plugin。模型随便换(DeepSeek、Anthropic、OpenAI、自部署的都行),工具可换,agent loop本身是插件,连UI都是插件。知乎

更狠的是它的Profile Bundle:release notes里明确写着,Claude Code和Codex可以作为子代理挂在DSH里按需调用。不是你选A还是选B,而是你坐在中间,让A和B一起给你打工。36氪

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

热度是真的吗?一半是真火,一半要警惕

先说真的部分。

star数本身有争议,社区里已经有人在问"这会不会又是刷星",不同时间点的截图从14万到17万都有。但生态爆发是刷不出来的:B站搜"DeepSeek Harness",48小时内涌出几十条视频,从零基础安装、四种模式(极简/标准/PTC/创造)对比到源码逐章解读;微博上的开发者已经在认真讨论怎么把它当Agent后端嵌进自己的系统。

插件生态一周之内长出来的东西更有说服力:

  • dsh-android:让AI直接操作安卓真机和模拟器,内置20个工具,你说一句"打开设置,点显示",它自己截图、认界面、点按滑动,全程可视可接管。微博

  • 浏览器会话复用插件:直接复用你已登录的浏览器会话干活,一句话让它翻译、总结、查价格;

  • 可视化工作台:社区玩家爆改一周开源,点几下就能生成多窗口应用,B站那条视频攒了两百多个收藏。哔哩哔哩

  • 还有终端TUI、Mac菜单栏启动器、鸿蒙移植版……

这种"框架发布一周,外围插件长成一个生态"的速度,是实打实的社区热度。

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

但另一半泡沫,必须点名。

8月中旬有个热门Skill刷屏,号称装上它"DeepSeek V4-Pro就能碾压Fable 5",名字还和Anthropic官方的Skills机制撞车,很容易让人误会。结果呢?没人能复现,token开销反而翻倍,被36氪直接点名"热门插件被锤了"。36氪

这提醒一件事:DSH生态里真有宝藏,也有蹭热度的投机品。看到"一个Skill脱胎换骨"的爆款视频,先别信,等复现。

真正的差距在哪:三组值得记住的数字

第一组,关于Harness为什么重要。OpenAI自己给了个很直观的实证:同一个GPT-5.6 Sol模型,只改Codex Harness里的两个配置,ARC-AGI-3得分从13.3%飙到38.3%,接近翻三倍,输出token还降了6倍。36氪同一个大脑,换个躯体,表现差这么多——这就是"运行时"的价值。

第二组,两条完全不同的路线。Codex Harness走垂直整合:Rust写的核心、云托管沙箱、和自家模型深度绑定,企业级安全开箱即用(OS级沙箱、审批门控、云端两阶段运行);DSH走全栈插件化:自由度拉满,但安全这块也是插件化的,企业级成熟度还在迭代——rc.1版本刚修过一个Bubblewrap沙箱的/proc逃逸漏洞,那可是内核级的坑。

第三组,也是自动化党最该关心的:钱。按B站一条热门对比视频的数据,Codex的输出价约10美元/百万token,而DSH搭配DeepSeek API约0.42美元/百万token,差了约24倍。雪上加霜的是——不对,是锦上添花的是——8月23日起,DeepSeek API周末全天按谷价计费:周六周日不再区分峰谷,统一最低价。机器之心V4-Pro周末输出价13.5元/百万token,差不多是工作日高峰价27元的一半。知乎

要知道,就在6天前的8月17日,DeepSeek刚因为峰谷涨价被开发者骂上热搜(部分价格最高涨了11倍)。这波周末降价本质上是个调度信号:长任务、批量任务、不着急的自动化流水线,请往周末和深夜放。知乎对跑Agent pipeline的人来说,改一行cron表达式,成本直接砍半,这钱不赚白不赚。

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

严谨起见补一句:两家宣传的benchmark(SWE-bench Verified 74.5%对Terminal Bench 2.1的87.9%)测试集不同,不能直接对比,看个方向就行,别拿数字互喷。

谁该上,谁别急:对号入座

翻完全网,我的判断分四类:

跑生产关键任务的,先别上。 DSH还在rc阶段,官方文档自己写着"会有兼容性破坏变更"。36氪知乎一位老运维的总结很实在:生产环境不要上,但测试环境跑通很快。高可靠长程任务,继续交给Codex Harness或Claude Code。

8天15万star,OpenAI连夜开源应战:DeepSeek Harness这波热度是真的,但没看清这4点别急着换

环境都懒得折腾的,缓一缓。 源码构建的坑先说清楚:45万行TS、219个workspace包,本地build至少5到10分钟,Node版本低于18连依赖都装不上,建议20+。指望"五分钟装好开箱即用"的,要么找社区打包好的客户端,要么等正式版。

要多模型编排、数据不出域、深度定制的,值得冲。 这是DSH最对味的场景:模型随时换、loop能改、UI能换,MIT协议没有商用顾虑。把Claude Code和Codex收编成子代理一起调度,这个玩法目前只有它能给。

大多数观望党,最优策略是"先用起来,但别迁移"。 日常工作流保持不动,在测试环境装一个感受下everything is a plugin,盯着它的正式版节奏。就算最后DSH没赢,它把运行时开源这件事本身,也会逼着闭源产品把黑盒越拆越多。

接下来值得盯的三个信号

  1. DSH正式版什么时候发、API稳定下来——现在所有"不兼容重建"的坑,都要等这一步填上;

  2. Codex Harness开源后长出什么生态。Agentic MD已经进了Linux基金会,MCP成了事实标准,Agent运行时正在从各家壁垒变成公共基础设施;

  3. DeepSeek的下一次调价。十天调两次价之后,峰谷定价大概率常态化,"按电价排任务"会变成自动化玩家的必修课。

这周的事回头看,有点像移动时代的操作系统之争:模型厂商还在卷大脑谁聪明,但真正的入口之争,已经悄悄转移到运行时上了。

你现在跑自动化任务用的是哪套方案?评论区聊聊,看看多少人已上车、多少人在观望。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章