这几天刷AI工具内容的人,多半都刷到过一张表:给DeepSeek V4 Pro装上一个叫“J-Space”的插件,基准测试成绩全线飙升——TerminalBench从87.9干到90.1,NL2Repo从61.5直接拉到73.4,按报告里的说法,部分成绩甚至超过了Claude Fable 5和Opus 4.8。36氪宣称的卖点还不止于此:不改模型权重、不用微调,只在Agent环境里加一个Skill,附带速度提升2.53倍、Token效率提升2.21倍。知乎
这张表在48小时内刷爆了X和国内各大平台,J-Space-Cognition-Suite-V3.6的GitHub仓库收下2.3k star,配套的“能力释放报告”又收了1.0k star。小红书然后,打假来了,而且锤得很实。
它宣称解决什么
先说句公道话:J-Space宣称解决的问题,是真实存在的。
模型跑长链路Agent任务时,常见两类毛病:一是“表征漂移”,跑着跑着偏离目标,忘了前文、重复劳动;二是“过早停止”,代码没改完、测试没跑完,它就宣布“任务完成”。J-Space的思路,是在模型外面加一层“外部脚手架”:短判断、执行操作、深入推理、验证结果,循环推进;再把关键目标、已验证信息、下一步操作记进外部账本,防止模型干着干着忘了自己要干什么。
这个方向本身不新鲜,是整个Harness生态都在补的课。但J-Space给出的数字太亮眼了,亮眼到盖过了所有需要追问的细节。

为什么那么多人信了
这波刷屏不是无缘无故的,它精准踩中了三个真实的点。
第一,V4 Pro确实“看环境下菜碟”。正式版发布当晚,有网友用相似提示词两次测试3D直升机游戏:凌晨0点50分生成的结果还很粗糙,不到四小时后再跑,却交出一个完整得多的项目。更直观的是一个名为Project2的工程任务:同一个V4 Pro,在DeepSeek Harness的Standard模式下跑91分、PTC模式92分,换到工具更少的Minimal模式,两次测试分别达到99分和96分。36氪模型没变、任务没变,只是运行环境不同,差距接近8分。大家本来就相信“V4 Pro的实力没被完全榨出来”,一个宣称能“解锁实力”的脚手架,自然有人愿意信。
第二,时机太对了。8月13日DeepSeek开源Harness(DSH),GitHub star一路冲高,有用户感叹“这才几天,已经150k+ Star”。知乎整个社区都在给DSH找插件、装技能,热情正愁没处安放。
第三,名字起得有迷惑性。今年7月Anthropic刚发过一项关于Claude内部“J-space”的可解释性研究,听起来很前沿。J-Space Cognition Suite借了这个词,让不少人误以为它和Anthropic的研究有血缘关系——实际上,此次围绕DeepSeek V4 Pro传播的J-Space Cognition Suite,是一个完全不同的社区项目,与Anthropic没有任何官方关系。36氪
故事越顺,越要先看证据。
锤一:独立复现一个没有,反向结果排着队
截至8月18日,按ExplainX的梳理,J-Space公布的所有性能提升数据,全部来自项目方自己的测试,没有任何独立团队在相同条件下复现出来。36氪
而社区自发的复测,方向出奇一致:
Issue #10:一位开发者用V4 Flash做了两轮A/B测试,覆盖数学推理、代码生成、仓库开发、中断恢复等任务。第二轮对照组和J-Space组各跑3次共12次,任务完成度没有明显差异,J-Space组反而消耗更多资源;第三方盲评中,对照组平均得分为8.30,J-Space组只有7.87。36氪
Issue #26:用户Jyleaves用8张NVIDIA H20部署V4 Flash,通过DSH Standard模式加载J-Space跑89道题,通过69道,最终得分为77.5%,而J-Space报告给出的对应成绩是87.1%。36氪失败任务至少重跑3次,依然够不到报告里的数字。
GitHub用户GoForceX严格按项目说明用Terminal Bench独立复测,最终结果与宣传完全相反:分数不升反降,Token消耗明显增加,推理速度还比原生模型更慢。知乎

还有一个容易被忽略的细节:J-Space报告里那张对比表,Fable 5、GLM-5.3、Kimi-K3、Opus 4.8的分数,全部来自各厂商自己公开的评测结果,评测环境、Harness、工具配置、采样参数都不一样。小红书把不同赛道的成绩贴在同一张表里比大小,这不叫评测,叫剪辑。
锤二:效果没提升,Token反而多烧50%到4倍
对按token付费的用户来说,这一锤更疼。
一位开发者用V4 Flash搭配DeepSeek官方API实测:PI+J-Space的成本大约是基线的2~4倍;DSH+J-Space的Token消耗也比基线高约50%。36氪他的结论很直接:没有观察到任何成本节省,实际消耗反而比裸跑更高。
把时间线拼起来看更扎心:DeepSeek的API价格从8月17日起上调,V4 Pro正是焦点。微博之前大家算的是“V4 Pro便宜、性价比高”,现在价格上去了,任何一层“效果没提升、消耗先翻倍”的脚手架,都是在把你的钱直接烧成账单。
X上有位尝试过的开发者留下了毫不客气的评价:这就是一场炒作,而且全是假的,他没能复现其中任何一项说法,实际消耗的Token反而比基线更多,推理表现也没有超过不使用这个Skill的DeepSeek。36氪

锤三:面对质疑,作者选择了删帖
复测不过关,还可以说是测试条件的分歧;接下来发生的事,性质就变了。
Issue #23里,一位开发者称自己发布的质疑issue被作者删除,只能重新发帖备份。36氪面对社区要求公开完整评测环境和运行日志的声音,作者承认数据“确实夸张”,却始终拿不出可复现的运行日志,反而开始删除质疑issue。知乎
顺便把这次传播中最大的误会说清楚:J-Space Cognition Suite和Anthropic的“J-space”没有任何关系,前者是运行在DeepSeek外部的推理时脚手架,后者是Anthropic对Claude内部神经表征的可解释性研究。项目仓库里,编号#28的issue标题就是社区的一声怒吼:“STOP, THIS IS NOT J-SPACE!”

公道话:方向是真的,刷屏的数字是另一回事
不想把话说绝。J-Space押中的问题是真问题:长任务状态怎么保存、什么时候算真正完成、工具失败后怎么恢复——这是所有Agent Harness共同的短板。社区也已经有更扎实的同类尝试:RoutingSuite按任务类型选择推理模式,避免简单任务过度思考、复杂任务过早行动。36氪AnchoredStandard先稳住第一轮轨迹,再开放完整工具能力。Harness优化确实能改变同一个模型的产出,StateM相关研究用同一套Harness,把V4 Flash在Terminal-Bench 2.1上的成绩从82.7%提到88.1%。36氪
DSH官方的更新也在补这些课:8月17日发布的v0.1.0-rc.7增加了子代理任务管理、图片附件持久化。36氪rc.8又一口气更新了14项,还新增了low推理强度选项。知乎
所以“Harness值得投入”是成立的;但“某一个特定插件值得装”,需要的是严格A/B对比,不是一张自测表格。
想装插件之前:三个检查、三个动作
最后落到实操。以后再遇到“装上就能让模型变神”的刷屏插件,先过三道检查:
查独立复现:数字是不是全部来自项目方自测?有没有第三方在相同条件下做过A/B?改造前的基准如果和官方成绩接近,算加分项;改造后的数字如果只有自测,先当宣传看。
查Token开销:Harness层越复杂,Token消耗越高,这是规律。装之前先算:宣称的提升值不值50%、2倍甚至4倍的消耗?尤其是刚涨完价的现在,这笔账必须算。
查质疑的处理方式:Issue区有没有人提质疑?作者是公开数据和日志,还是删帖?删帖本身就是预警信号。
已经装了J-Space或同类插件的:拿你真实在跑的任务,对比装前装后的任务完成率和Token账单,用自己的数据决定去留,别让刷屏的表格替你做决定。
还没装的:不急。等两个信号——作者公开完整评测日志,以及有独立团队复现出相近结果。这两个信号出现之前,表格再漂亮,也是别人的数字。
Agent时代,Harness确实能拉开同一个模型的差距——但正因为如此,每一个“拉开差距”的宣称,都值得先过一遍复测这一关。