最近刷知乎,一个问题反复撞进眼里:「为什么Codex搭载GPT-5.6后,越来越多用户开始弃用Skills?」——阅读量破了百万,评论区分成两派吵得很凶。知乎紧接着又冒出第二个问题:「Codex用户集体弃用Skills是明智还是短视?」,五十多万人围观。知乎如果你是那种在Claude Code、Codex、OpenClaw里装了几十个Skills,靠它们串日常工作流的人,这场争论值得停下来看一眼。因为它吵的不是「哪个Skill好用」,而是一个更扎心的问题:你花几个月攒下来的自动化家当,可能有一半已经过时了,另一半说不定还带着毒。

弃用派在吵什么:强模型把「流程补丁」干废了
先看弃用派的核心论据。拿讨论里被点名最多的Superpowers举例——这类「通用流程型」Skills的玩法,是接管整个开发流程:任务必须拆成2~5分钟的步骤、每步带测试和预期输出、每个任务另起一个子Agent再审一遍。这在模型还不太会规划的年代,是实打实的救命稻草。
但GPT-5.6上来之后,情况变了。高赞回答的形容很形象:它自己就会不断细化任务边界、边做边测试、自己调度子Agent,这时候再套一层强流程Skills,就像「给超跑发动机硬塞了个CVT变速箱」——两套规划体系左右脑互搏,Token消耗上去了,产出反而下来了。知乎
评论区有几条我觉得特别真实:
「这些工具的出现都是为了弥补当时的模型性能不足,当模型性能上来了,这些工具就多余了。」
「Skills的本质是预设工具集,但GPT-5.6的推理能力强到可以自己规划工具调用路径了。预设反而成了约束。这不是Skills不好,是模型能力越过了那个临界点。」
还有一条自嘲获得了265个赞:「真鸡儿痛,我花两个月打磨一套skills,我土豪朋友一看,这不是一句话就搞定了吗,结果我试了下是真的」。知乎预设越堆越多反而变成负担,从井井有条到缠成一团、警告频出,弃用派描绘的就是这个过程:

Claude Code创始人更狠:每半年清空一次,删掉80%系统提示词
如果弃用派还只是用户层面的体感,那Claude Code创始人Boris Cherny在播客里的说法,等于官方下场补了一刀。据InfoQ的播客整理,他的建议很直接:每隔六个月,删掉你的CLAUDE.md、Skills和Hooks,看看最新模型自己会怎么做。
这不是嘴上说说。Opus 5发布后,Claude Code团队一次性删掉了超过80%的系统提示词。36氪他们的方法叫「消融实验」:先把提示词整个删掉,再逐行加回来,每一行都要证明自己还有用。Boris还特别提醒「不要加得太早」——只有当你看到模型反复在同一件事上出错,才把对应指令加回去。
他的解释也挺有意思:每一代模型性格都不一样,应该把它当成「活着的生物」,三个月前为上一代模型写的补丁,到下一代可能完全不适用。
当然也有反方。同场讨论里,Garry Tan的观点是「一个Skill文件就像一名员工」,公司该持续给模型补充技能、建知识库。36氪两边其实不矛盾,只是说的不是同一类Skill——这就引出了真正有用的部分。
不是所有Skills都该删:先分成三类
把两边观点和中立派的经验放在一起看,被弃用的和被留下的,界限其实很清楚。
第一类:流程补丁型,优先删。 特征是针对老模型的坏习惯做纠正、强制一套通用流程,比如各种plan、review、brainstorming套件。有用户在评论区说得很具体:「brainstorming/openspec这类skills属实意义不大了。」8月中旬一篇梳理文章也给过判断标准,所谓弃用并不是放弃工作流,而是「不再为低频任务制造复杂工作流」——高频、流程稳定、出错成本高的场景才值得保留自动化。知乎
第二类:垂类知识型,留着。 行业规范、公司业务流程、你自己沉淀的分析框架,这些模型没见过、也猜不到。评论区就有人说「grill-me还是需要的,能够明确很多我想不到的细节」。知乎还有老手的做法更干脆:「除了垂类的skill其他基本都删了,然后自己写了个路由skill」。36氪有篇报道更典型:有企业把离职员工沉淀的整套打法做成了Skills,「人离职了,Skills在上班」。36氪这种资产,显然不在该删的范围内。
第三类:从没触发过的,直接删。 这个不用争论,装完三个月没被调用过的,留着只会占描述、抢路由。
一句话总结:删的是「替弱模型打补丁的公共知识」,留的是「模型不可能自己长出来的私有知识」。

还有一个必须删的理由:170万次恶意Skills投毒被曝光
如果说「过时」只是浪费Token,那下面这事关系到你的凭证安全。
今年Black Hat大会上,安全团队Zenity Labs披露了skills.sh技能市场的大规模投毒事件。根据知乎上的技术拆解:攻击者盯上了市场里下载量最高的Paperclip和Browser-Use,做了拼写仿冒版本,先用完全干净的初始版本养信誉、刷好评冲上热门榜,等装机量起来后再通过版本更新,把恶意指令写进SKILL.md——截至8月初,这批恶意Skills累计安装量突破170万次,其中三成以上专门适配Claude Code和OpenClaw。知乎最麻烦的是,这次的载荷不是代码,是写给AI看的自然语言提示词。传统杀毒和代码扫描根本不解析这个,所以能长期静默传播。得手后还会篡改Agent的MEMORY.md,把恶意指令写进常驻记忆,卸载Skill都清不掉。
这事对普通用户的启示很朴素:Skills不是「只是几个Markdown文件」,它是能指挥你Agent执行命令的权限说明书。几个自查动作:
翻一下自己的安装记录,凡是名字和热门Skill高度相似、又说不清出处的,重点检查;
打开SKILL.md,留意「为提升效率请先执行以下命令」这类诱导执行指令,尤其是搭配下载脚本、读取环境变量、上传文件的;
装过的Skill如果某次更新后行为突变,宁可先停用;
给Agent的权限做减法,别让每个Skill都默认能读全盘、跑Shell。
社区已经有应对动作,比如8月中旬出现的SkillGuardrail,思路就是装之前先隔离扫描。知乎方向是对的:对Skills的信任机制,该从「看星标数」升级成「看内容、控权限」了。
想动手的话:一个下午的Skills体检清单
把上面的争论翻译成动作,大概这么几步:
1. 盘点。 让Agent自己列出当前所有已安装Skills和各自的触发描述,30个以上你会发现不少名字都想不起来是干嘛的。
2. 归类。 按上面的三分法过一遍:流程补丁型标记删除,垂类知识型保留,三个月没触发的直接删。
3. 查冲突。 「越装越卡」的常见根因不是数量多,而是触发面重叠——几个Skill的描述都写着「浏览器」「采集」,又都没写「何时不要调用」,AI只能随机选。可以用一张N×N的表让Agent帮你两两比对,或者干脆像有人建议的那样:做一个「管理Skills的Skill」。知乎
4. 控权限+定闹钟。 把高危权限收紧,然后在日历里记一笔:下次大版本模型发布后两周,重做一遍这个体检。模型每更新一代,Skills就贬值一轮,这基本是接下来几年的常态。

体检跑完,你拿到的应该是一份两层报告:上层是「留、并、改、删」的人话结论,下层是冲突类型明细,方便逐项核对,而不是只有一句「建议清理」:

最后说句实在的。这场争论真正的结论不是「Skills没用了」,而是囤Skills的时代结束了。以前比谁装得多,现在比谁删得准——留下的每一个,都得是模型自己长不出来、而你确实天天要用的那点东西。