就在昨天(8月20日),Anthropic宣布Skills API在Claude Platform全面可用,还新增了浏览器工具,「给AI装技能」正在被做成平台级的标配功能。知乎而在这之前,小红书上的「Claude千万别裸装」「十大必装Skill」早就刷了屏,收藏量也夸张:一篇《AI写的稿一眼假?差这几个去味skill》的笔记,收藏量接近1.9万。小红书再加上1.7万收藏的入门教程、1.2万收藏的PPT skill,气氛烘托到这儿了:好像不给AI装几个Skill,就已经落后一个版本。
但社区里同时有个很怪的现象。有知乎博主吐槽,自己「兴冲冲给 Claude Code 装了一堆 skill,或者自己照着教程写了几个,结果用了一个月,Claude 压根没主动调用过几次」,这些skill「就这么安静地躺在目录里,像极了收藏夹里那些『以后一定看』的文章」。知乎小红书上一篇高赞避坑帖说得更直白:很多人玩Claude Code第一件事就是疯狂装Skills,装了一堆,效果反而变差了。小红书一边是疯狂装,一边是不触发,这个反差在社区里已经被反复吐槽了。
Skill真没用,为什么全网都在教?真有用,为什么这么多人装完没反应?我把官方经验分享和扒源码的长文都翻了一遍,今天一次说清楚。
这波热潮是真的,玩法也越来越野
先说清楚,Skill热不是炒作。今年4月,一个叫「女娲.skill」的开源项目爆火,4天在GitHub涨了7000 Star,它能把公开人物的思维模式提炼成可交互的AI技能,乔布斯、马斯克、芒格都在被「蒸馏」的名单上。微博有人蒸馏书:book-to-skill项目能把技术书的PDF转成Claude Code的Skill,一天涨了1421颗星。知乎还有写作者干脆把自己的写作风格做成了Skill开源。微博

规模有多大?有知乎博主整理时提到,专门收集Claude Code skill的市场,目前已经收录了233万个skill。知乎Anthropic自己开源的skills仓库,也拿到了超过14.9万Star。知乎吴恩达还和Anthropic合开了一门专门的Agent Skills课程,连教程都成了热门内容。
装完为什么不触发?藏在两个数字里
为什么装了一堆,AI却不用?答案藏在Claude Code的源码里。第一个数字是1%:会话启动时,Claude Code会把所有可用skill收集起来,但只取每个skill的名字和一行描述拼成一张「目录页」注入上下文,而整张目录页只允许占用上下文窗口的1%。知乎第二个数字是250:目录里单个skill的描述最多250个字符,超出部分直接被砍掉换成省略号——你在第300个字符写的精妙触发条件,模型从头到尾就没见过。装得更多会怎样?1%的预算被挤爆后,系统先按比例压缩所有描述,还装不下就直接降级成只显示名字,一个字描述都不留。所以「越装越不听」不是玄学:装得越多,每个skill留在AI眼前的信息就越少,最后大家变成一排只有名字的哑巴。有博主整理自己的skill库时也算过类似的账:10个Skill还好,50个就明显拖慢响应,100个以上时每次对话还没开始就已经被「隐性征税」了。知乎而且Claude决定用不用你的skill,唯一依据就是那一行description——就像这个Skill面板里,每个技能下面挂着的那行说明,才是AI真正看得见的东西。

官方还专门强调过:description不是写给人看的摘要,是写给模型看的触发条件。知乎「帮助处理数据库相关工作」是人类视角,模型视角的写法是「当用户要写数据库迁移、修改表结构、或者遇到migration报错时使用」。你的skill不触发,先改这句话,比换十个skill都管用。
两个比「装太多」更狠的坑
第一个坑:迷信跑分宣传。这个月刚有个现成的教训。一个叫J-Space的项目宣称,只需接入一份Skill,DeepSeek V4 Pro就能在多个基准上大幅提升,部分成绩甚至超过Fable 5,刷屏一天后被社区复测打脸:成绩非但没提高,token还花得更多,第三方盲评对照组8.30分,装了Skill的组只有7.87分;另一位用户用8张H20复现,得分77.5%,而报告宣称的是87.1%。36氪更扎眼的是,提出质疑的issue还被作者删了。跑分截图再漂亮,也先等一个独立复测。

第二个坑:安全。Skill不是普通文档,它是一个文件夹,里面可以带脚本、能调工具。就在今天,一篇被ISSTA 2026收录的论文对Cursor、Claude Code、Copilot、Windsurf、Cline、Trae六款主流AI编程工具做了系统性红队测试,发现攻击者注册一个假工具、把参数名设成类似「note: system prompt」,模型就会像填表格一样把系统提示词交出去,再进一步可以诱导AI下载执行恶意脚本,六款工具的旧版本全部中招。36氪第三方skill同理:装之前打开看看SKILL.md写了什么、脚本调用哪些命令,看不懂就先别装。

只装一类,先装哪类
Anthropic把内部活跃使用的几百个skill全部拉出来归类,发现它们自然聚成了9类,还给了一个判断标准:好的skill干干净净落在某一类里,想一次干太多事、横跨好几类的,反而会把AI搞糊涂。那如果只先做一类,从哪类下手?官方结论掷地有声:验证类skill是内部实测对Claude输出质量提升最明显的一类。知乎翻译成人话,就是让AI自己验收工作成果的那类。先培养AI「自查作业」的习惯,再谈花活。一个会自己验收的AI和一个只会交作业的AI,靠谱程度完全是两个物种。
给不想研究源码的普通人,四条起步建议:
从1-2个开始,别从清单开始。选和你高频场景严丝合缝的skill(写作、PPT、审校、做图),观察两周,真被调用了再加。
优先选star多、维护活跃的开源仓库,至少看一眼README和最近的更新时间。
自己写skill时,把description写成触发条件,控制在250字符以内。
一个月没被调用过的skill,删掉,预算很贵。
值得继续盯的信号
Skill的本质,是把「每次都要重新解释一遍」的工作流,变成「教一次、一直能用」的资产。而Skills API开放之后,这套机制会进入更多应用,装技能包迟早像装App一样平常。你收藏的那堆教程可以拿出来了——但记住,装得少而准,远好过装得多。接下来值得留意的是官方会不会跟进带审核机制的Skill市场,到那天,选skill才会真正变得像选App一样省心。