当前位置:
AIGC文章详情

一个月涨了5万星,8,135次试验却说装多了更糟:Agent Skills热潮的冷静决策指南

源自43位全网作者

15:58

8月22日,一个没什么名气的开源仓库 mattpocock/skills 在GitHub单日涨了3368星,直接冲上Trending;整个8月,它的月涨星数是50,486,总星数来到23万+。知乎同一个月,Andrew Ng发布官方Skills Map、arXiv上挂出一篇8,135次试验的Skills论文、DeepSeek Harness开源48小时破10万星、Salesforce和阿里在同一天放出官方Skill工具。哔哩哔哩

如果你在用Claude Code、Codex这类编程Agent,最近大概率被"装Skill"刷过屏。但这一轮和之前的提示词热潮不一样:Skills正在从"玩法"变成"工程问题"。值不值得跟、怎么跟,这篇替你把8月的信号捋一遍。

一个月发生了什么

先把时间线拉出来。8月14日,Andrew Ng发布了AI Engineering Skills Map第一版,8月21日又亲自展开其中的第一部分。知乎论文这边,8月19日,《Demystifying Agent Skills》在HF Daily Papers排到当天第一。知乎紧接着8月22日,mattpocock/skills登顶GitHub Trending。知乎

再看GitHub月榜:抓取的Top 19里,直接和Agent、Skills、上下文/记忆、模型路由相关的项目占了13个。知乎更值得注意的是,@claude、@codex、@cursoragent这些AI账号,大量出现在热门项目的贡献列表里——Agent已经在替人写代码、提PR,这不再是宣传口径,而是写进git log的事实。

mattpocock/skills火在哪?作者Matt Pocock是前Vercel工程师、Total TypeScript创始人,仓库里39个技能全是他自己带AI写代码时的实战沉淀,还给失败模式归纳成四类:对齐失败、语言冗长、反馈缺失、架构腐化。知乎像/grill-me让AI反过来拷问你的需求,/tdd强制先写测试,全是把"怎么管AI"固化成了可复用的文件。

一个月涨了5万星,8,135次试验却说装多了更糟:Agent Skills热潮的冷静决策指南

8,135次试验泼的冷水

狂热的时候,论文数据值得看一眼。这篇论文的结论很反直觉:作者把Skill的作用归类后发现,65.7%的案例属于程序性锚定,也就是帮Agent稳定执行一套动作,明确的知识注入只占4.5%。知乎也就是说,往Skill里堆资料基本没用,写清步骤才有用。

Skill确实比让Agent自己记笔记强:匹配实验里比Workflow Memory高6.06个百分点,成功率61.9%对55.9%。这个结果值得看,但研究比较的是受控条件下的匹配任务,不能直接翻译成"Skill永远更好"。

最该警惕的是第三组数据:检索池从5个Skill扩大到100个时,实际使用精度从29.6%掉到了3.3%。知乎装得越多,模型越不知道该用哪个。所以"Skill是不是智商税"这个问题可以放下了:它有效,但有效的前提是少而精、写流程而不是堆知识。

社区已经分成两派

装过一波Skill的人,现在正在分道扬镳。一派是"删除派":有深度玩家直言,GPT-5.6上线之后,他把Superpowers、GSD、Impeccable这类编排框架几乎全删了。知乎理由是新模型自带了这些能力,通用开发类Skill正在被模型本身淘汰。

另一派是"沉淀派"。Codex的项目里出现了贴着PR流程走的Skill:codex-pr-body负责把PR写清楚,babysit-pr负责在PR创建后持续盯评审、CI和合并状态。知乎开源不到48小时破10万星的DeepSeek Harness,把"一切皆插件"做成了架构,skill在它那里是纯指令、由插件系统承载加载。知乎还有一个极端案例:i-have-adhd在GitHub拿下超过1.8万星,核心内容只有一份SKILL.md,仅把AI的回答顺序重新规定了一遍。知乎

一个月涨了5万星,8,135次试验却说装多了更糟:Agent Skills热潮的冷静决策指南

两派吵归吵,落点其实一致:通用技能会被模型迭代吃掉,但"你的项目为什么这么设计、你的团队怎么验收"这类只属于你的知识,模型永远变不出来。项目级Skill不再规定工作流,而是补充上下文。

看懂这一轮的两个坐标

如果不想被每天的新闻牵着走,可以用两个轴给这波变化定位。运行轴:CLI → Shell → SDK → Harness,Agent的运行外壳越来越厚;能力轴:临时 Prompt → 可复用 Skill → 受版本与评估管理的 Skill,提示词是一次性的,Skill是可分发的,而今年8月开始,头部玩家在做的是给Skill加版本管理和效果评估——这才是"工程化"三个字的真实含义。知乎

一句人话总结:Shell负责确定性动作,Skill负责上下文相关的判断。知乎判断你该投入哪边,就看你的痛点是"AI执行不稳定"还是"AI不懂我的规矩"。

一个月涨了5万星,8,135次试验却说装多了更糟:Agent Skills热潮的冷静决策指南

Andrew Ng的判断也是同一个思路:Agent Performance = Model + Harness + Context + Tools + Environment。知乎模型只是其中一项,剩下四项全是工程活。这张Skills Map来自对超过10,000条招聘信息、专家访谈和调查反馈的整理,分量不轻。

要不要上手,先问四个问题

给准备动手的人一个决策清单。一问:模型是不是在重复犯同一个错?是,就值得写Skill,这是程序性锚定的主战场。二问:这个知识是不是只对你的项目成立?是,优先级拉满;不是,等模型更新,通用Skill大概率会被吃掉。三问:你能不能写清验收标准?写不清就先别写,Skill的价值在流程明确。四问:你愿不愿意持续维护它?Skill不是一次性配置,是活的文档。

方法论上可以直接抄Anthropic的实践建议:早期项目先从20到50个真实任务起步,远比一开始就构建数千条测试数据有效,用评估驱动开发,拿数据说话而不是凭感觉。知乎

一个月涨了5万星,8,135次试验却说装多了更糟:Agent Skills热潮的冷静决策指南

谁不用急,以及盯什么信号

不用急的是两类人:纯观望党不必现在上车,通用Skill的淘汰速度比模型更新还快;重度用户也别焦虑,你已有的CLAUDE.md、AGENTS.md就是Skill的雏形,迁移成本很低。

值得持续盯的三个信号。一是"录屏教AI"正在成共识:两个月前Codex上线了Record & Replay,Anthropic在Claude Cowork里加入Record a skill,最近微软又把这套思路封装成开源桌面工具Skill Recorder,写Skill的门槛马上要降到零。知乎二是skills.sh这类Skill榜单的涨落,能看出哪些方向在被社区投票。三是大模型厂商的动向——每次新模型发布,都会洗掉一批通用Skill,也都会逼出一批新的项目级需求。

这一轮Skills浪潮,本质上和当年从裸写SQL到用上ORM是一回事:工具把底层能力封装掉之后,竞争就从"会用"变成"用得有没有章法"。模型能力是租来的,谁都能调用同一个API;但沉淀在你仓库里的那几十个Skill,才是你自己的复利。

内容由AI生成
1
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章