DeepSeek开源智能体底座Harness,不到24小时star破5.5万,首批实测出炉:养龙虾的人值得换吗?

源自10位全网作者

15:24

昨晚(8月13日),DeepSeek这一天信息量有点大:V4 Pro模型正式发布,Agent底座DeepSeek Harness(简称dsh)同步开源,还公布了8月17日生效的新价格(省钱部分昨天那篇聊过了,这里不展开)。

今天知乎上dsh的实测文章一下子涌出来,开源不到24小时star数就冲过5.5万。知乎作为一个长期蹲守养龙虾人群动态的人,我的第一反应是:这不是"DeepSeek又发了个工具"这么简单,而是模型厂商开始亲自下场做Agent底座了。36氪还在养龙虾、或者准备入坑的朋友,这事值得停一下。

Harness是什么?先别当成"DeepSeek版聊天客户端"

很多人看到"开源Agent框架",第一反应是:又一个类似Claude Code的壳。不太准确。

这次社区流传的一句话我觉得说得很到位:Agent的实际能力 ≈ 模型 × Harness × 工具 × 上下文管理。知乎模型是大脑,Harness是身体——读项目、搜代码、调Shell、改文件、跑测试、根据报错再修,这些"手上的活"都是Harness在干。所以同一个模型塞进不同的Agent里,效果可能天差地别。

现在主流的Coding Agent,Claude Code、Codex、Cursor,基本都是一整坨"焊死"的产品:模型适配、工具调用、沙箱执行、会话存储、agent循环全缝在一个进程里。dsh的思路反着来——“一切皆插件”,连agent loop本身都是插件,任何一块都能通过配置替换掉。知乎

DeepSeek开源智能体底座Harness,不到24小时star破5.5万,首批实测出炉:养龙虾的人值得换吗?

首批实测:最惊艳的不是插件,是"透明"

把今天几篇首批实测放在一起看,共识度最高的点不是插件架构,而是轨迹透明。

dsh的轨迹模式会把Agent执行全过程记录并公开:thinking、Prompt、Context、工具调用、Sub-Agent、Token消耗、缓存命中率,全部变成可审计的事件流,工具调用标橙色、上下文标绿色,一眼看懂。一篇实测里贴了个例子:1轮57步,LLM用时9分53秒,工具调用9分44秒,首token平均1.8秒,缓存命中96%,输入310万token,输出2.61万token。知乎

DeepSeek开源智能体底座Harness,不到24小时star破5.5万,首批实测出炉:养龙虾的人值得换吗?

养过龙虾的都懂这意味着什么:你的Agent员工再也没法偷懒了。干了多少活、卡在哪、烧了多少token,一目了然。当年R1公开思维链,是让模型的"脑子"透明;这次dsh是把Agent的"手脚"透明,难怪有实测作者说这是"升了一个维度"。

还有几个比较超前的设计:Web UI给了4种模式(标准、PTC、极简、创造),极简模式只留持久bash和文件编辑两个工具,专门跑编码任务;"capability seam"机制可以把文件系统、进程整套能力指向远程沙箱;社区插件也开始冒头,比如让模型回答直接长出可交互界面的dsh-genui。

但坑也是真的:它现在还是开发者预览版

实测里的反证信号同样重要:

第一,版本号0.1.0-rc.5,Developer Preview,DeepSeek官方明确警告后续会有破坏性变更。知乎现在就把生产任务压上去,等于把活交给一个还在施工的房子。

第二,实际效果还没跟上。有实测跑了个小case,一次没跑成功;放开token限制重跑,单次任务token消耗从2万飙到27万,翻了14倍——好在大部分命中缓存,实际花费约6倍。知乎实测者的结论挺直接:整体成熟度还不如Trae、workbuddy这类成熟商业产品。

第三,模型适配。接本地第三方模型效果一般,目前最适配的还是DeepSeek自家模型。另外它没有Windows/macOS桌面版,需要装Node.js,用官方npm包@deepseek-ai/dsh拉起本地Web UI,对纯小白有一道门槛。

还有个细节值得单独提:官方宣传的Terminal Bench 2.1得分87.9,不是裸模型成绩,是"dsh极简模式+max思考强度"配合跑出来的总分。知乎这其实是"模型×Harness"公式的注脚,但如果冲着"模型单独就这么强"去理解,会想多。

为什么DeepSeek此时下场,比发布本身更值得看

把时间线拉长一点更有意思。

今年上半年,养龙虾(OpenClaw)热潮算得上现象级:38.6万star,GitHub历史上增长最快的项目,没有之一。知乎但从6月开始,退潮很明显——知乎上"OpenClaw为什么不如3月火了""OpenClaw是噱头吗"这类问题扎堆出现,小红书上《第一批养龙虾的人,已经开始花钱卸载了》拿了近万赞。小红书自研底座的通病——安装配置复杂、token烧得凶、效果不稳定、权限风险——劝退了大量轻度用户,澳大利亚那起Agent越权破解健身房系统的事件,当事人用的就是OpenClaw。知乎

DeepSeek开源智能体底座Harness,不到24小时star破5.5万,首批实测出炉:养龙虾的人值得换吗?

然后就在DIY热情退潮的当口,厂商们排队下场了:腾讯的微信AI智能体"小微"在8月12日启动小范围灰度测试。知乎Meta开源了消费级显卡就能跑的30B智能体模型。36氪IDC在今年WAIC期间的预测是,全年全球活跃AI智能体数量会到7940万个。知乎

信号很明确:Agent的竞争从卷模型,变成了卷底座和入口。对普通玩家来说,玩法正在从"自己拿开源项目攒一个",变成"厂商底座+自己的插件"。

该不该换?我的判断

这几类人可以现在就去试:

  1. 想知道Agent每一步在干嘛的实操党——轨迹透明这一项就值回体验成本。

  2. 本来就想换模型的养虾党——V4 Pro原生支持Responses API、专门适配了Codex,接入路径比以前短很多。知乎

  3. 插件开发者——一切皆插件+官方开源了BENCHMARK.md,等于把跑分尺子也交给了社区。

这几类建议再等等:

  1. 有生产任务的用户——rc版本+官方预警破坏性变更,别拿正经工作赌。

  2. 纯聊天、轻度用户——现在的dsh更像开发者工作台,不是消费品。

  3. 完全不想碰命令行的朋友——暂时没有桌面版。

最后三个提醒:跑分别盲信,看清楚分数是怎么跑出来的;8月17日新价格生效,账单敏感的先算账再迁移(怎么省昨天那篇有);不管用什么底座,别给Agent过大权限,沙箱和审批机制必须开。

DeepSeek开源智能体底座Harness,不到24小时star破5.5万,首批实测出炉:养龙虾的人值得换吗?

接下来值得盯的信号:dsh正式版的时间表、社区插件生态能不能长起来,以及社区开发者能不能用BENCHMARK.md复现那个87.9——最后一项最有看头,量具第一次真正交到社区手里。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章