上周四(8月13日),DeepSeek发布了他们的首款Agent产品DeepSeek Harness。微博官方定位是代码智能体(Code Agent)赛道,直接对标OpenAI的Codex和Anthropic的Claude Code。随后的故事大家都看到了:发布当晚仓库公开不到两小时,Star数破万,12小时内突破5万。知乎五天左右冲到15.5万,有统计说这打破了GitHub单日Star涨幅的历史纪录。知乎

但今天,Harness最值得一看的消息变了:那个刷屏的“装一个Skill就能让V4 Pro超越Fable 5”的项目,翻车了。
对做智能体开发的人来说,这事很值得聊。今天一次性讲清楚:哪部分是假的,哪部分是真的,哪些东西你真正用得上。
翻车的是谁:J-Space
前几天,一个叫J-Space Cognition Suite V3.6的社区项目在X上刷屏。它宣称:不动模型权重、不做微调,只给Agent环境加一个Skill,就能显著提升V4 Pro在多项Agent基准上的表现,甚至超过Fable 5。36氪

官方给出的对比数字是:Terminal-Bench成绩从87.9提到90.1,NL2Repo从61.5提到73.4。36氪他们自己讲的故事也挺像那么回事:agent跑长任务有四个毛病——工作区信息过载、表征漂移(越跑越偏)、无效重试、过早宣布完成。J-Space说要用一套“短判断—执行—深推理—验证结果”的循环加外部账本,帮模型“记住自己在做什么”。
然后就被锤了,社区复测的结果接连出现:

一位开发者用V4 Flash做了两轮A/B测试共12次,第三方盲评对照组8.30分、J-Space组7.87分,非但没提升,还消耗了更多资源。
另一位开发者用8张H20自己部署复测,89道题只拿到77.5%的得分,报告宣称的对应成绩是87.1%,失败题目重跑至少3次也没能复现。36氪
至于仓库里的质疑Issue,作者选择了删除,有人只好重新发帖备份。完整的评测记录和运行日志,至今没有公开。
“这就是炒作,而且是假的。我没能复现其中任何一项说法。”有尝试过的开发者直言不讳。36氪
顺带避个坑:此“J-Space”非彼“J-space”
这个J-Space和Anthropic在7月公布的“J-space”研究不是一回事,后者是对Claude模型内部神经表征的可解释性研究。36氪不少人就是误以为它带着Anthropic光环才冲进去的,名字像,东西完全两码事。
假奇迹翻了车,但踩中的是真痛点
为什么这种宣称能在几天里疯传?因为V4 Pro对运行环境异常敏感,这是被多方验证过的事实。
先看官方benchmark底下的小字:DeepSeek-V4-Pro-0813的官方分数,是用自家Harness的“极简模式”跑出来的。知乎这行字当时没人在意,直到发布后官方Terminal-Bench跑出88分、第三方Artificial Analysis只测出79分,有人用和官方一模一样的配置复现出官方分数,大家才反应过来:差距出在Harness上。
再看社区对照实验:同一道工程维护题、同一个V4 Pro,在OpenCode上91分,DSH标准模式下91分,一换到工具最少的极简模式,直接99分。知乎另一场测试里,同一模型同一任务,只换运行环境,两次分别跑出99分和96分,差距接近8分。36氪原理不复杂。极简模式只给模型两个工具:Bash和Edit,系统提示词固定成一句话。这套提示词和工具schema恰好是V4 Pro在后训练时见得最多的那套,用它等于回到了自己训练时的世界。标准模式一上来甩给它25个工具,分布偏离,第一步走偏,后面一路错。
还有个更精细的发现:真正起作用的是模型第一次看到的“工具目录”。有实验把首次请求只暴露两个工具,等模型发出第一次工具调用之后再放开全部25个,结果照样能跑到99分。知乎也就是说,首轮锚定到正确轨迹,后面工具再多也不容易跑偏。
Harness这个词原本指马具,就是把马的力气接到马车或犁上、又不让它脱缰的那套皮带扣具。36氪这也是DeepSeek从发布第一天就给出的定义:Model+Harness=Agent,大模型负责思考推理,Harness承担模型外所有工程化工作。微博harness绝对不止是套个壳,一个模型的真实能力,是被harness重新定义过的。知乎判断一个coding agent强不强,要看“模型×harness”的组合成绩,而不是单看模型。
三个问题,给下一个刷屏“奇迹”备着
J-Space不会是最后一个。Harness官方已经内置了一百多个插件,到8月15日,社区目录收录的精选插件已有1117个。知乎GitHub上带dsh-plugin话题的非Fork仓库已经约7000个。知乎这种热度下,任何“大幅提升”的宣称,都值得先用三个问题量一量:

有没有独立复现?数据全是项目方自己跑的,没有独立团队在相同条件下复现出来,数字再漂亮也只是“项目方宣称”。36氪J-Space恰恰栽在这第一问上。
Token成本是多少?很多“提升”是用更多重试、更长上下文换来的。有开发者实测:在原生接口上加J-Space,成本大约是基线的2~4倍,在Harness内也高出约50%。36氪分数涨了、开销翻倍,这笔账要重新算。
基线是否对齐官方?如果一个项目的“改造前”成绩明显低于官方或公开结果,就要警惕基线被人为压低。
这次J-Space倒不算最糟:其公布的改造前基准与DeepSeek官方成绩基本接近,至少没靠压低基线制造夸张提升。36氪社区也已经在用更扎实的方式解决V4 Pro的真实问题:RoutingSuite按任务类型选择推理模式。AnchoredStandard则是前面说的“首轮锚定”思路,首轮先用简短提示和少量工具让模型进入稳定轨迹,随后再开放完整工具能力。36氪这两个方向,目前比J-Space值得关注。
最后,谁该关心这件事
如果你还在观望要不要试Harness:它目前还是Developer Preview,官方明确提醒会有破坏性兼容变更。知乎官方每发一次版本,一批插件跟着炸,社区已经在自救式地起草互操作标准(dsh-community-standard,目前还是Draft)。如果你不是那个愿意自己动手修插件的人,建议等整合包和桌面客户端成熟一些再上车。
如果你已经在用:极简模式目前只支持Linux和Mac。知乎它对V4 Pro的提升是实打实的,值得自己试试;另外可以留意8月17日发布的v0.1.0-rc.7,Codex和Claude Code子代理任务的管理面板、MCP/ACP图片附件持久化和几项稳定性修复都已经上车。36氪往大了说,这一周的热闹其实是给所有agent开发者上的一课:只看模型强弱就下结论的时代过去了。选coding agent也好,看benchmark也好,评估某个新插件也好,记得多问一句——这个分数,是配什么Harness跑出来的。
能被复现的提升才叫提升。拿不出过程的结果,数字越惊人,越该先打个问号。