两天前,一张benchmark对比表在Agent圈子里刷屏了。
主角是一个叫J-Space Cognition Suite的开源项目。作者宣称:不改模型、不做微调,只要把这套Skill接入Agent运行环境,DeepSeek V4 Pro就能在多个基准上大幅提升,部分成绩甚至超过Fable 5,速度和token效率还能提高两倍以上。
一个Skill,让模型连跨两个档次。这种故事传播速度可想而知。
然后它就翻车了。
据机器之心的报道,社区用户很快开始了复测。用户Jyleaves在项目仓库的issue里写明:自己用8张NVIDIA H20部署V4 Flash,通过DeepSeek Harness的Standard模式加载J-Space,89道题通过69道,最终得分77.5%——而J-Space报告里给出的对应成绩是87.1%。36氪这位测试者把失败任务至少重跑了3次,依然复现不出宣称的提升,token消耗反而更多。另一条复测issue里,测试者的结论更直接:加了Skill之后成绩略有下降,token用量和成本都在增加。

更致命的是后续操作。有开发者爆料,自己此前发布的质疑issue被作者直接删除,只能重新发帖留证。36氪至此,这个「神Skill」基本被定性为一场公开打假。
为什么那么多人信了?因为它借用了真问题
回头看,J-Space最有迷惑性的地方,不是凭空编造,而是精准踩中了V4 Pro当时讨论度最高的痛点:对外部运行环境过于敏感。
这个痛点有实打实的证据。V4 Pro正式版发布当晚,有人用相似提示两次测试3D直升机游戏,模型两次交出的结果差距明显;在一个工程任务里,同一个V4 Pro跑在DeepSeek Harness的Standard和PTC模式下分别得91分和92分,换成工具更少的Minimal模式,两次测试直接拿到99分和96分——模型没变、任务没变,只换运行环境,就拉开了近8分。36氪正因如此,社区天然愿意相信「换个运行环境,就能释放模型能力」,也确实有正经项目在朝这个方向做:RoutingSuite按任务类型选择推理模式,AnchoredStandard用首轮短提示帮模型进入稳定轨迹。J-Space借用了这个真实存在的需求,包装出来的却是一张拿不出复现过程的结果表。
这就是这件事给所有Skill使用者和开发者上的一课:高明的伪装不编造事实,而是借用事实。一个Skill宣称解决的问题越真实,越要去单独验证它的效果本身是否站得住。
233万个Skill,这个生态有点鱼龙混杂
J-Space不是孤例,它只是这个生态里被锤得最响的一个。
先看疯狂的一面。一个Skill聚合收录站的计数器显示,被收录的Agent Skills数量已经达到233万。知乎

社区里,一个给Claude Code装画图能力的Skill一天涨星1600,总星数冲破11.5k,产出的架构图、流程图是真能直接放进文章用的水平。知乎

小红书、B站上,「50个Skills」「必装Skill」清单帖随手就是几万收藏,最火的Skill安装教程播放量能到40万+。
但另一面,是没人替你算的账。Claude Code启动时,会把skills目录下的所有Skill全部注入system prompt——Skill装得越多,留给真正任务的上下文就越少。知乎一位知乎开发者整理自己的Skill列表时发现,他已经装了218个,整理后只保留132个高频使用的,归档84个,上下文开销直接降了40%。也就是说在整理之前,这些Skill每天都在悄悄收「上下文税」。

还有更隐性的成本。有微博用户吐槽,让Claude Code把备忘录草稿整理成一个Skill,花了10美金还没跑完;而你辛苦攒下的热门Skill,也可能很快被官方收编——最近就有用户反馈,Claude Code已经内置了Claude Design这类热门设计能力,自建Skill的贬值速度比想象中快。
增长是真的,账单也是真的,再混进几个假benchmark,选Skill和做Skill都成了需要擦亮眼的技术活。
选Skill三问,一个都别省
结合J-Space踩过的坑和社区复测经验,装一个Skill之前,建议先问三个问题:
第一问:效果可复现吗? 真正的提升敢交复现条件:模型版本、运行环境模式、题集、参数设置。J-Space只给了一份「能力释放报告」和结果表。如果一个Skill只有前后对比图,找不到复现步骤,直接降级为「观望」。
第二问:过程公开吗? 看issue区。有人质疑时,作者是认真回应,还是直接删帖,比任何README都诚实。J-Space的崩盘点正是删除质疑issue。对评测提升类Skill,「敢不敢公开运行日志」应该是一道必答题。
第三问:基线对齐了吗? 测试环境和你的实际环境是否一致,有没有只报分数不报token成本。J-Space的报告宣称「效率提高两倍」,社区复测却是分数下降、token和成本双增。只谈分数不谈消耗的单边benchmark,和虚假宣传没有区别。
也替较真的复测者说句话:这一轮打假里,J-Space的复测issue被挖了出来,而RoutingSuite、AnchoredStandard这类项目同样在被社区反复验证。对真正干活的Skill来说,复现不是负担,是广告。
自建Skill的四个坑,社区已经替你踩过一遍
如果不满足于装Skill,还想自己写,社区实战里这四个坑值得记下来:
坑一:AI把特例写成规则。 一位逐字重写Skill的知乎作者总结过AI写Skill的两大毛病:一是把举例内容写成铁定规则,「指定性太强,换个项目就不好使」;二是钻牛角尖,把「感悟不能改」理解成「一字不改」。他的结论很直接:AI生成的Skill必须人工逐条审,「用token换心安」是值得的。知乎
坑二:只写不测。 怎么证明你的Skill真的有效?方法不复杂:同一个任务,装Skill跑3次、不装跑3次,对比成功率和token消耗。很多「感觉变快了」的Skill,真测起来和安慰剂差不多。
坑三:描述吹牛。 description是Skill的广告位,但Agent判断什么时候调用它,靠的也是这一句。把描述写成营销文案,不光误导别人,还会让Skill在不该触发的时候乱触发。社区里现在的通行做法:两句话写清楚,用在什么场景、不能干什么。
坑四:只装不管。 上下文窗口是Agent时代最硬的通货。那位整理Skill的知乎作者给出的判断标准很实用:过去一个月没用过的Skill,就不该待在活跃目录里——归档,或者用软链接按需挂载。
接下来值得盯什么
最后给两个趋势信号。一是Agent Plugins规范开始推进Skill的跨客户端兼容,过去同一套能力换个客户端就要重排目录、重填MCP的日子有望结束。知乎Matt Pocock的Skills v1.2也已经补齐Codex支持,「一套Skill多处可用」在慢慢变成现实。知乎二是官方收编高频能力的速度在加快,通用型Skill的护城河会越来越浅。对自建者来说,这既是坏消息也是好消息——同质化的Skill会加速贬值,但有真实领域经验、效果可复现的Skill,会越来越值钱。
机器之心在打假报道里写了一句话,值得贴在每个Skill开发者的桌面上:能被复现的提升才叫提升,拿不出过程的结果,数字越惊人,越应该先打一个问号。36氪装Skill如此,做Skill也如此。