最近你大概很难躲开"Skills"这个词。
小红书上一条"我不允许还有律师不会用这些 Skills"的自用帖,被藏了 2133 次、点了 1264 个赞;一条"南大教授蒸馏的 skills 新手直接用"也拿下 1399 收藏。B 站上"Agent Skills 从入门到实战"的教程一天能冒出好几条,标题一个比一个狠——“七天从小白到大神”“学完薪资翻倍”“比付费强百倍”。吴恩达开了 Agent Skills 的课,斯坦福 CS146S 把技能库拆进课程笔记,李宏毅的 Harness Engineering 也在讲怎么"驾驭"它。连 Gemini 都在十月连夜跟进,小红书上一片"Gems 要被替代了吗"的惊呼。小红书
热闹到这个程度,一个已经在用 Claude Code、Codex 或者豆包干活的人,很难不心里发毛:这玩意儿到底是又一次范式革命,还是给"提示词"换了个洋气的壳、再配一波卖课和软文?我要不要现在就花时间上车?
我把知乎、小红书、B 站上这一轮的讨论翻了一遍,也读了几个热门技能库的实测。结论先放这儿:Skills 是真的有用,但它被吹的和被骂的,其实都不是同一件事。 下面把账算清楚,你自己对号入座。
一、先把概念吵清楚:Skills 不是"更长的提示词"
很多人第一反应是"这不就是把提示词写长点、存起来复用吗"。这个理解对了一半,但漏掉了最关键的东西。
按 Anthropic Skills 团队负责人 Barry Zhang 的定义,Skills 是"composable procedural knowledge for agents"——给智能体的、可组合的程序性知识。程序性知识是认知科学里的词,跟"知道是什么"(事实性知识)相对,指的是"知道怎么做、以及怎样算做对"。说白了,就是从某个具体领域里蒸馏出来的实操经验。知乎
落到形态上,它简单到让人怀疑:一个文件夹,一个 SKILL.md 说明书,再加上可选的脚本(scripts)、参考资料(references)和模板(templates)。装一个 Skill,不是训练了个新模型,而是给原来的 Agent 塞进去一套"遇到这类活就照这个流程走"的可复用手册。
那它和你手写的提示词到底差在哪?一句话:Skill 管流程,Prompt 管当前这次任务。提示词像手搓,每次从零描述一遍;Skill 像一把提前配好的手术刀,把"怎么系统审一篇论文""怎么按规范生成一份 PDF 报告"这种反复要干的活固化下来。它俩不是替代关系,实际用的时候是叠着的——你调用 Skill 走既定流程,同时用 Prompt 补上这次的具体对象、要求和限制。知乎
真正让它跟"一长段提示词"区别开的,是渐进式披露(Progressive Disclosure)这个机制:Agent 平时只把 Skill 的一句描述(metadata)挂在上下文里,判断这次任务用得上,才去读 SKILL.md 正文,需要更深的细节,再按需打开 references。这套"目录常驻、正文按需、引用深挖"的设计,本质是把宝贵的上下文窗口省下来留给模型真正要思考的地方——这也是为什么老手说它"省 token"。知乎

顺带把几个容易混的词一次性理清,省得你被绕晕:
Skill vs MCP:MCP 是把外部工具(数据库、接口)标准化接进来的协议;Skill 是一种轻量的"经验打包格式",能被不同的 Agent 读取。Skill 里的 scripts 你可以理解成 MCP 的本地简化版。知乎上"为什么 skills 优于 mcp"的讨论能有 36 万浏览,恰恰说明这俩不是竞争关系,而是解决不同层的问题。
Skill vs Agent 框架:它不是又一个框架。它更像"别造 Agent 了,造 Skill"(Don’t Build Agents, Build Skills Instead)这个思路的产物——把精力从搭架子,挪到沉淀具体领域的做法上。
二、这波生态到底有多大:从律师到科研,从 150k 星到 370 万安装
如果你觉得这只是程序员圈子的自嗨,那可能低估了它的扩散速度。
先说规模。Karpathy 相关的 skills 仓库在 GitHub 上超过 150k 星。一份专门盘点"Agent 做视频"的榜单,把 180 个开源 Skill 逐一读了 README、分成 10 类做了安全评级,光整理这一遍的模型调用成本就花了约 200 美元——里面 107 个星数不到 50,过千星的只有 20 个。换句话说,大量能用的东西还沉在水面下,光看热门榜根本捞不全。 像 OpenMontage 这种"全家桶"(61.5k 星),一个项目里就内置了 700 多个 Skill。知乎知乎
再说垂直渗透,这才是最猛的地方:
律师:清华开源了 38 个法律技能(Legal-Skills-Chinese),加上诉讼可视化、法律文件本地脱敏、案件分析、MinerU 扫描解析……一整条办案工作流都能拆成 Skill。小红书
科研:专门站点 sciskills.tech 把文献检索、论文写作、同行评审、统计建模、科研绘图按学科分好类;scientific-agent-skills 号称 182 项可检索、可编排;生信、经济金融、人文社科各有专属包。知乎
通用办公:docx 一句话生成整份 Word、Excel 公式按规则写对、CSV 变动态图表(还保证每帧数字准确)、免费配音(走微软公开语音服务)……
配套的工具链也在长出来:skill-creator 帮你从零写技能,Skills Manager 一句话安装部署,Superpowers 定了条"先查技能再动手"的铁律,甚至出现了 UUMit 这种把 Agent、API、Skill 挂成"能力卡"出售、让 Agent 自己接单的平台——被网友戏称"AI 闲鱼"。哔哩哔哩

一个信号很能说明问题:知乎上"现在 Agent Skills 那么火,有什么强烈推荐"的问题,浏览量 23 万;"2026 年有哪些好用的 skills 推荐"13 万。它已经从"要不要用"进入了"用哪个"的阶段。
三、泼三盆冷水:这波热潮里,被吹的和被骂的不是同一件事
到这儿如果你已经想冲,先停一下。这一轮讨论里最有价值的,恰恰是那些反常识的声音。
第一盆:装得多 ≠ 有用,反而更乱。 有人翻了 WorkBuddy 的技能目录,145 个,把自己吓了一跳——因为每天真会点开的就 5 个,剩下 140 个"装的时候觉得以后肯定用得上,装完就再没打开过"。他最后总结的那句话值得裱起来:“技能库不是收藏夹,是项目,它需要有人定期去看、去改。” 契合度永远高于数量,从自己最高频的一两个任务开始,比一口气装几十个实在得多。知乎
第二盆:现成的 ≠ 能直接用、有人维护。 一位律师的坦白很典型——找现成 Skill,效果不稳定、没人维护;自己搭又要花大量时间反复调试。更真实的坑是:Skill 会过期、会写错。上面那位实测时,一个配音 Skill 的文档里赫然写着"四川话"音色,他试了 6 次全报错,回头查官方清单才发现中文一共 8 个音色、方言只有东北话和陕西话两个,"四川话"根本不存在——文档不仅信息错了,还教了个错的排查方法。而且别忘了安全:很多 Skill 不只是 Markdown,它会真的跑 Python、R、Shell,甚至调第三方 API、改你本地的文件。那份视频榜单给 180 个仓库做评级,178 个 SAFE、2 个 CAUTION,但评级只看 README 文本、没做完整源码审计。装之前扫一眼 SKILL.md 和 scripts 目录,是底线动作。知乎知乎

第三盆,也是最该想清楚的:模型越来越强,Skills 会不会失业? 这不是杞人忧天。“为什么 Codex 搭载 GPT-5.6 后,越来越多用户开始弃用 Skills"的讨论,浏览量破了百万。但点进去看,结论比标题冷静得多:被抛弃的是"通用流程型 Skill"——那些教模型"怎么思考、怎么一步步干"的东西,模型变强后原生就能做,确实不需要了。但"领域型 Skill"反而更金贵,因为强模型解决得了"怎么想”,解决不了"该按什么规范执行":你公司的内部规范、行业合规清单、操作手册、特定业务模板和执行脚本,这些是模型不具备、网上也搜不到的私有知识,用 Skill 沉淀成可复用的结构化封装,目前仍是最优解。知乎
把通用流程和领域知识一起扫地出门,就像"除草的时候把杂草和庄稼一起清了"。真正的问题不是要不要 Skill,而是缺一套评测筛选机制——用可用性、成功率、鲁棒性、误触发率这些硬指标去淘汰低质货,而不是靠下载量和评分盲选(这俩最容易被流量和包装干扰)。
四、要不要现在上车:对号 3 类人
把上面的账合起来,你就能给自己定位了。
该上,而且现在就该上:你已经在用 Claude Code、Codex、WorkBuddy 这类能干活的 Agent,手里有明确、重复、且有"规范/模板/私有知识"的工作流——程序员、科研党、律师、做内容/运营/数据的。对你来说 Skill 的 ROI 最高,因为它省的是你每天重复描述流程的时间和 token,沉淀的是别人抄不走的领域经验。别追热门榜,从你最烦、最重复的那一两件活开始。
可以先观望,别被 FOMO 推着走:你是轻度用户,偶尔用 AI 问问题、写点东西,还没有稳定的重复工作流。那你当务之急是把 Prompt 用顺、把一两个 Agent 用熟,而不是急着囤一堆用不上的 Skill。Skills 是"把重复劳动打包"的工具,你还没有值得打包的重复劳动,装再多也是收藏夹吃灰。
要格外小心,甚至先别碰:你是被"学完薪资翻倍"“七天从小白到大神”"靠 skills 月入过万"这类标题吸引进来的。B 站上这类低质教程和软文已经泛滥(有些"自用推荐"帖末尾就顺势带出了自家付费产品)。记住一个朴素的判断:真正的 Skill 价值在"把你自己的经验固化",不在"买别人包装好的捷径"。 凡是承诺速成变现的,先默认它在割你。
五、真决定上车,这份避坑清单收好
从 1–2 个高频任务起步,别一次装几十个。用熟了再加,契合度高于数量。
装前必做安全检查:打开 SKILL.md 看它到底会干什么,扫一眼 scripts 目录有没有可疑脚本、要不要 API Key、会不会改本地文件。来源不熟的项目,回 GitHub 看 README、最近更新时间、License。
别跨 Agent 无脑复制:Claude、Codex、Gemini 的目录结构和适配不完全一样,很多项目会出专门的 Codex 适配版,默认能直接搬是错觉。
输出必须自己核验:Skill 让流程更稳,但不保证结果对。公式、引用、数据、法条、统计结论,尤其要人工过一遍。
把技能库当项目维护:定期查废弃引用、规则冲突、过期信息(skill-management 这类工具就是干这个的)。技能会老,没人管就会在某个早上用一个不存在的"四川话音色"坑你一把。
终点是沉淀你自己的 Skill:最值的玩法不是收藏别人写好的,而是借鉴别人的工作流拆解思路,慢慢改成贴合自己习惯的版本。这也正好呼应前面那条判断——领域型、带你私有知识的 Skill,才是模型再强也替代不掉的那部分。

写在最后
Skills 不是魔法,也没那么玄。它本质是 AI 应用从"能不能干"走向"怎么干得又稳又省"的一次工程化沉淀——把散在你脑子里、聊天记录里的重复经验,打包成 Agent 能反复调用的模块。
所以这波刷屏里,真正值得你关注的,从来不是"哪个 Skill 最神"“哪个安装量最高”,而是一个更朴素的问题:你每天在重复劳动里,有多少是可以被打包出去的? 想清楚这个,你就不会被教程和软文带节奏。
想继续跟进的话,盯这几个信号就够了:模型每次大版本升级后,你手里哪些"通用流程型 Skill"开始变得多余(该删);你所在的垂直领域,有没有出现高质量、带测试用例、有人持续维护的领域型 Skill(该上);以及技能市场会不会长出真正的评测/评分机制——那一天到了,"靠下载量盲选"的尴尬才算真正结束。