DeepSeek Harness 上手指南:模型是发动机,它是驾驶舱

2026-08-14 16:41:12 1点赞 11收藏 1评论

DeepSeek 发模型从来不缺热度,但这次发的不是模型,是一个产品。

8 月 13 日,DeepSeek Harness(命令行名字叫 dsh)v0.1 开发者预览版全球开放,MIT 协议,源码全在 GitHub。消息来得不算突然,V4 Flash 正式版的更新日志里就埋了一行字,说 Flash 的评测是用 “DeepSeek Harness 极简模式(即将发布)” 当框架跑的。拿自己的框架测自己的模型,这比任何宣传都实在。

DeepSeek Harness 上手指南:模型是发动机,它是驾驶舱

一句话理解它:模型决定 Agent 聪明不聪明,Harness 决定 Agent 能不能干活。DeepSeek 喊了小半年的 “Model + Harness = Agent”,这回兑现了。

先说结论:它不是 DeepSeek 版 Codex

首发体验过的媒体都说了同一件事,这东西不像 Codex。

Codex 交付的是一个拿来即用的 Agent,你装好、选个场景、开跑。DeepSeek Harness 更像一套组装 Agent 的运行时,模型、工具、提示词、会话日志、甚至界面,全是插件,你说了算。

内测用户已经在用插件改它整个工作界面了,这个自由度,Codex 给不了。

有意思的是,负责带队的是崔添翼,前 TSY Capital 联合创始人、Jane Street 干了 9 年的量化专家。量化背景的人做产品,风格藏不住,可靠、可追溯、状态一致、安全风控,全是交易系统的思路。追记式日志、可回放会话这些设计,明摆着是从 “复盘交易记录” 里长出来的。

5 分钟跑起来

最快的路径是 Web UI,一条命令的事:

想装成全局命令也行,装一次以后直接 dsh web 就能起:

浏览器打开 http://127.0.0.1:3080,按三步走:

  1. 配置模型。设置页里填 DeepSeek API Key 就行,不用重启。想用别的模型也随便,Kimi、OpenAI、Anthropic、Google,将近 40 家提供商都列着,还支持自定义 OpenAI 兼容端点。

  2. 选工作区。点 Choose workspace,把项目目录加进去选中。没选工作区之前,会话编辑器是灰的。

  3. 开跑。新建会话,发提示词,Agent 会读写文件、执行命令、拆任务、维护计划。遇到高权限操作会先问你要批准。

想从源码跑也行,仓库在 github.com/deepseek-ai/deepseek-harness

四种预设,别选错了

对话的设置里,模型旁边有三档推理等级,Off、High、Max。预设(Preset)才是这个产品真正的主菜,相当于给 Agent 定岗,身份、规则、工具、工作方式全由预设决定。

内置四个:

极简模式(minimal),只有一个 shell 和一个文件编辑工具,是给模型跑基准测试用的。V4 Flash 正式版那 82.7 分的 Terminal Bench 成绩,就是在这个预设里刷出来的。

标准模式(standard),日常写代码、修 Bug、分析项目的默认选择。

代码模式(code),大批量搜索、并行读文件、多步骤自动处理,处理脏活累活用的。

创造模式(cordis),用来造新预设。可以让 Agent 按你的要求一步步生成一个全新预设,也可以直接在内存里试插件组合。

预设之间用 / 命令切指令,标准、代码、创造模式都带对话压缩、目标、计划这些命令,极简模式只有目标。

同一个进程里,写作 Agent、编码 Agent、研究 Agent 可以同时跑,各看各的工具和指令,不用开四套服务。预设的作用域按 agent 到 preset 到 global 一层层解析,这一套很像配置管理系统。

一个值得单独说的设计:PTC

程序化工具调用(Programmatic Tool Calling)是 DeepSeek Harness 自己的特色。

一般 Agent 是一步步调工具,调用一次、回一个结果、再调下一次。PTC 反过来,模型先写一段 TypeScript,把一串工具调用编排成程序,中间数据全部留在运行环境里,只有最终结果进模型上下文。

好处是往返次数少了,出错的缝也少了,多步工作流干净不少。博客园那篇完全指南里把它单独拎出来讲,不是没道理,这是和所有主流 Harness 都不一样的地方。

一切皆插件,不是说说而已

DSH 的整个架构建立在 Cordis 插件框架上,元框架只负责插件的加载卸载和依赖管理。模型适配器是插件,工具注册表是插件,会话日志是插件,Agent 循环是插件,连前端界面都是第二棵插件树。

想换模型?换个模型插件。想换沙箱?换沙箱插件。想换掉默认的 Agent 循环?挂你自己的。没有需要打补丁的特权核心,插件卸载时注册效果干净回滚,不残留。

内测那几天,用户已经搓出大约 300 个插件。有人改了 DSH 的整个界面布局,有人给对话页加了侧边栏,有人做了个 “跨会话长期记忆 + 后台自我进化” 的插件,不走向量数据库加 RAG 的老路,用本地文件持久化加分层上下文注入加 LLM 自我整理,让 Agent 定期回头审视自己的完整工作上下文,把临时经验压缩成长期知识。

说白了,普通产品插件是在按钮和功能上加东西,DSH 的插件是在 Agent 的大脑、工具箱、规则和界面里加能力,不是一个量级的自由度。

追记式日志,调试神器的样子

这是我最想夸的设计。模型看到的一切,系统提示词、思维链、每次工具调用和结果、子 Agent 调度、上下文注入,全部写进追记式(append-only)会话日志,不覆盖、不删除。Trajectory 视图里按来源一条条查。

上下文压缩也不会删原始历史,只是用替换事件改变模型之后看到的 “表面”,原始事件流原封不动。

这带来一个实打实的好处。Agent 跑崩了,你能精确看到它在每一步看到了什么,确切提示词、确切工具输出,不用猜。恢复、分叉、检索、回放,全共享同一份事件流,做生产级 Agent 的团队最缺的就是这个级别的可追溯性。

实测:同一个模型,换个 Harness 天差地别

爱范儿在发布前拿了内测资格,做了一组对照实验,让同一个 DeepSeek-V4-Flash 在 DeepSeek Harness、Reasonix 和 Codex 里做同一个 Three.js 滑沙游戏。

结果:DSH 里跑出来的基本没 Bug,玩家从开局就在滑,穿过每个门,抵达绿洲,画面金黄、快速、阳光明媚。Reasonix 虽然号称最适合 DeepSeek 的第三方 Agent,但渲染的模型、人物、天空都糙,不像个 3D 游戏。Codex 版本不错,可一旦上下文被别的项目 “污染”,金字塔就完全不像金字塔了。

有意思的是,刚发布的 V4 Pro 在 DSH 里跑同样任务,用时更长,表现反而没那么好。以快著称的 DeepSeek,跑编程任务也可能要半个多小时,别期待秒出。

单次案例说明不了所有问题,但它至少证明一件事,模型完全相同时,Harness 提供的工具、提示词、上下文组织和执行策略,足以显著改变最终产物。

冷静一下,这些坑得知道

v0.1 是开发者预览版,官方自己说了,预计会有破坏性兼容变更。想上生产环境的,先固定版本,盯紧仓库发布说明。

网上的评价两极分化得厉害。一边说它代表了一种新的 Agent 形态,一边说它太极客、太难用。说实话两边都有道理。它对不写代码的普通用户不友好,预设、插件、补丁、Profile,这些词已经筛掉一大批人。但反过来想,它本来也没打算服务所有人,官方邀请的是 “全球 Harness 开发者”。

还有个变量值得盯着,OpenAI 那边有科学家公开说过,别在 Harness 上花太多力气,下一代模型可能把这些能力内建了。Harness 到底是不是终局,业内也没吵完。

我的判断

DeepSeek 过去最受关注的是模型,现在它开始处理模型之外的问题,工具和上下文怎么组织、执行过程怎么保存、同一套系统里怎么配置不同的 Agent。从卖模型到卖运行时,这一步走得比很多人预期的快。

以前我们挑 Agent,挑的是哪家公司做出了最好用的那个产品。DSH 给出的另一种可能,是 Agent 和模型一样变成基础设施,开发者和用户自己组装出属于自己的 Agent。

下一步很具体,克隆仓库,跑一句 npx @deepseek-ai/dsh web,在创造模式里花一小时试插件。不管它最后能不能成为你的生产 Harness,这套 “一切皆插件” 的架构都值得拆开看看,毕竟这次,它是开源的。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
1评论

  • 精彩
  • 最新
  • 追记式日志确实香,跑崩了能回溯每一步。不过v0.1还说会有破坏性变更,真上生产得谨慎。

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
11
扫一下,分享更方便,购买更轻松