一边27万星疯狂囤,一边官方劝你删:你囤的Skills是资产还是负债?先算清这笔"描述税"

源自225位全网作者

08:05

这个国庆假期,AI编程圈出现了一个有点分裂的场面。

一边是"囤技能"热潮还在加速。Matt Pocock的mattpocock/skills仓库,8月底已收获23.6万星。10月5日它发布v1.3,implement-spec、/pr、/retro三个skill从"进行中"正式转正。还有人把此时已到27万星的仓库里的GrillMe接进了论文写作流程,视频一天468播放。哔哩哔哩哔哩哔哩

Persona周报把职业角色skill更新到了386个工种;微博上有建筑博主晒threejs-architecture-effects,一句话就能重建带拆解过程的三维古建。连机械原理这种冷门领域,都有了能让课本连杆机构"动起来"的专用Skill。微博

另一边,10月5日知乎出现了一篇标题很冲的文章:《你的Codex,可能正在被曾经的Skill和AGENTS.md毁掉!》。它背后的依据不是个人吐槽,而是OpenAI官方在9月11日发布的《Rethinking skills and prompts for GPT-6 Astra》——核心观点一句话:随着模型越来越强,以前为了让AI"别犯傻"写下的那些规则,现在可能反而开始限制它了。知乎

一边疯狂安利安装包,一边官方劝你删。对已经装了一堆skills的中度用户来说,这个矛盾值得算清楚:你囤的到底是资产,还是负债?

每个Skill都在向你收"描述税"

判断Skill值不值得装,先看它的收费方式。

Skill的结构是一个带YAML元信息(name、description)和Markdown正文的文件夹,可以附脚本和参考资料。关键在加载机制:启动时只预载名字和描述,agent判断相关了才读正文,需要时再读附属文件。知乎

一边27万星疯狂囤,一边官方劝你删:你囤的Skills是资产还是负债?先算清这笔

这种按需加载对上下文友好,但也意味着:只要你装了,名字和描述就常驻上下文占一个位置。一个不多,几十个堆起来呢?那篇知乎文章把问题说得很直白:Skill数量越多,这些描述本身就越占上下文,数量再涨,描述还会被截短;更麻烦的是不同Skill之间可能重复、重叠甚至互相矛盾,最后一个本来很普通的任务,agent先陷入哲学问题——“我到底该听谁的?”

这不只是定性判断。有人整理过SkillsBench的实证数据——84个任务、11个领域、7308条测试轨迹——结论之一就是:Skill越多,Agent反而越笨,每个任务2-3个聚焦的Skill才是最佳区间。小红书

Matt Pocock在8月那条1.8万播放的视频里给了两个值得抄在墙上的数字。第一,上下文窗口的"聪明区"只有约15万token,超过了就该拆成spec和工单分窗口干活——这是他整套25个skill共用的设计前提。第二,他的大多数技能是用户手动调用的,agent平时根本不知道它们存在,所以上下文占用几乎为零。这就是收费逻辑的核心:自动触发的Skill按会话收税,手动调用的Skill几乎免税。很多人囤完skill感觉agent"变慢变笨",不是skill写得烂,而是不知不觉装了一堆自动加载的,把聪明区提前吃掉了。税率不由skill的质量决定,由加载方式决定。哔哩哔哩

昨天的拐杖,今天的镣铐

"负债"的另一半来源不是数量,是时间。

OpenAI那篇官方文章点破了一个扎心的事实:大量Skill和AGENTS.md规则,是旧模型能力不足时代的产物。以前模型不太会判断什么时候该做什么,所以大家把Skill写得极细:第一步做什么、第二步检查什么、第三步再做什么;AGENTS.md也一样,模型犯一次错就加一条规则,再踩一个坑再补一条,写到最后,它更像一本"Codex历史踩坑记录",而不是规范。但模型换代了。GPT-6 Astra在9月初发布,Opus 5.5在9月23日上线,这一代模型对任务边界的判断能力明显更强:涉及数据库就自己去看数据库文档,跟部署没关系就不碰部署资料。于是那些为弱模型准备的防呆规则开始产生副作用——过度具体的分步Skill妨碍模型自己发挥,一堆"不许做这做那"让它过度谨慎。知乎

这就像冰箱里的过期药:当年囤它是因为真有用,现在该清一清了。OpenAI甚至给了一键迁移命令:`openai-docs migrate this project to the GPT-6 model family`,让Codex按新一代模型的标准重新检查整个项目的规则和skills。知乎

资产还是负债?四个问题过一遍

那是不是该一键清空?也不是。我把这周社区信号里三个质量完全不同的案例翻了出来,用四个问题就能分清去留。

问题一:它沉淀的是"流程知识",还是"防呆拐杖"?

正面案例是机械原理Skill solve-planar-linkages。给它一张课本机构简图,它先确认拓扑——哪些是杆、哪些是铰链,再按几何依赖正向求解,以0.1°步长重验一周共3601个姿态、周期闭合误差为零之后,才生成与位移曲线同步的动画。注意它防的坑:图里两根杆某一瞬间恰好共线,不能据此把它们合并成一根刚体——这种专业判断,模型再聪明也猜不出来,必须靠人沉淀。这类Skill存的是领域知识加验收规则,是资产。而"提交代码前必须先跑测试"这种防呆条目属于拐杖,新模型自己会做,删。知乎

一边27万星疯狂囤,一边官方劝你删:你囤的Skills是资产还是负债?先算清这笔

问题二:输入假设明确吗?结果可验证吗?换个同类问题能复用吗?

这是solve-planar-linkages作者自己给出的四条标准:输入与假设是否明确、中间模型能否审查、结果是否有实际验证、换一个同类问题能否复用。漂亮的输出只是第一眼,能解释、能复现、能修改,才有长期价值。装任何第三方skill之前,拿这四条过一遍,能刷掉大半。

一边27万星疯狂囤,一边官方劝你删:你囤的Skills是资产还是负债?先算清这笔

问题三:方法论快照过期了吗?

反面参照是GitHub上那个549星的"五平台起号Agent Skill包",把公众号、小红书、抖音、视频号、X的起号方法论完整写进SKILL.md。它的工程质量其实很好——有单元测试、有frontmatter校验器、甚至有安全扫描——但最后更新停在7月8日。作者自己在README里写得很清楚:平台规则类内容都是"经验假设",保底不保顶,动手前自己核验当期规则。定位、对标、简报、复盘这套核心框架是慢变量,可以继续用;但三个月前的流量主门槛、处罚边界这些快变量,装进来就是过期资产,用之前先问一句还成立吗。知乎

问题四:有没有工程护栏?

还是说起号包,它的安全扫描值得全行业抄作业:发布前自动检查SKILL.md里有没有本机路径、API key、token、cookie,防止把敏感信息随skill分享出去。反过来,那些连frontmatter都写不齐、来源不明的skill,星标再多也别往主力环境装。知乎

清理动作就三步

判断做完了,落地很简单。

第一步,给存量做一次"审计"。原则就三条:没用的删掉、重复的合并、描述太长的缩短,只保留真正有价值的工作流。Codex用户直接跑上面那条官方迁移命令,让agent先出一版审计清单;Claude Code用户目前没有对应的官方工具,需要手动翻一遍`~/.claude/skills/`和项目里的`.claude/skills/`目录。

什么算"真正有价值"?SkillsBench的对比数据可以当参照:人工策划的Skill比不用skill的基准高出16.2分,模型自己写的反而低了1.3分。审计时的第一道筛子,就是看这个skill有没有经过人工沉淀和验证。小红书

一边27万星疯狂囤,一边官方劝你删:你囤的Skills是资产还是负债?先算清这笔

第二步,把"自动触发"尽量改成"手动调用"。参考Matt Pocock的设计哲学:大多数skill不让agent平时感知,要用的时候手动点名。免税额度用足,收税的位置只留给少数真正高频的刚需,比如危险命令拦截这类保命的。

第三步,多工具党注意skill漂移。Skill目前散落在Claude Code的文件系统、Codex的目录、网页端上传等多个路径里,各端并不自动互通;虽然有了agentskills.io开放标准,“家规"属性仍然很强。这周已经有人在做工具了:开源的Bifrost在本地统一管理Claude Code和Codex的Agent Skills,实测把同一个带版本管理的skill同时接入两端,跑通完整工作流。如果你的工作流横跨两个agent,这类工具能避免"改了一边忘另一边”。哔哩哔哩

顺带说一句经常被问的老问题:Skill和MCP到底怎么选?官方帮助中心的边界其实很清楚——MCP负责连接外部服务与数据源,Skill负责教agent拿到工具后按什么规矩把事办成。选型可以很粗暴:接不到系统就先MCP,每天都在重复交代同一套口头流程就先Skill,两边都缺就一起上,不必二选一吵架。知乎

接下来盯两个信号

一是Anthropic会不会跟进。OpenAI已经官方表态"为新一代模型重估skills",Anthropic目前的动作还是推生态扩张,没见官方清理指引。如果接下来一个季度它也出类似的迁移或审计工具,说明"技能重估"从个案变成行业动作,到时候存量还要再过一遍筛子。

二是模型换代的节奏。GPT-6 Astra和Opus 5.5都是这个9月发布的,间隔不到一个月,这个节奏短期不会慢下来。模型每换一代,旧skill就经历一轮贬值——这是囤技能热潮比"描述税"更现实的长期成本。你以为囤的是资产,其实囤的是有折旧期的资产。

最后总结一下。囤Skill的本质,是想把个人经验固化成可复用的资产,这个方向没有错——起号包作者那句话说得挺对:方法论会过时,但"把方法论固化成系统"这个动作永远保值。错的只是囤的姿势:把手动调用的免税skill当资产囤,把自动触发的收税skill当负债管,模型每换一代就给全冰箱做一次审计。

这笔账算明白,27万星的热闹才是你的热闹;算不明白,囤得越多,agent越笨。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章