如果你用Claude Code超过三个月,大概率听过这个名字:Superpowers。
Claude Code生态里最火的skill插件,GitHub星标6月突破23万、7月已被引用到25万,还进了Anthropic官方市场。巅峰时期,微博、知乎的推荐清单里它稳坐第一排,标准话术是"大项目必备"。装上之后,你的Agent会被注入14个skill模块,每个任务强制走一整套流程:头脑风暴、写spec、做计划、TDD、写代码、review,一步不能少。微博
但从今年夏天开始,风向变了。7月中旬,知乎出现《曾经人手一个的Superpowers,为什么现在都在卸》;9月,又有人开问"LLM编程能力突飞猛进,我们还要Superpowers之类的开发流程skill么";到10月初,“OpenSpec最近火了"的讨论把规范驱动开发的争议顶上热榜——16万浏览。一边在卸载,一边在换框架,还有一边在喊"需要,非常需要,永远需要”。知乎专栏知乎

对已经有真实项目在跑的中度用户来说,这不是八卦,是个很实际的问题:你自己的Claude Code里,到底该留几层"流程"?多一层,token和时间都在烧;少一层,AI乱写的时候你可能根本发现不了。
我把这半年知乎、B站、微博、Hacker News、GitHub issue里的讨论翻了一遍,站队之前,先算清三笔账。
第一笔账:token账——流程不是免费的,而且贵得具体
卸载潮里最硬的证据,全是数字。
有用户专门做了测试:装上Superpowers之后,Claude Code还没开始干活,启动就要吃掉22000个token,直接烧掉11%的上下文窗口。再算上系统本身的占用,有效工作空间大打折扣。GitHub issue里更离谱的原话是:“after 5 minutes I went from 0% to 100% quota reached”——一个简单任务,5分钟把整月配额打满。知乎专栏

这不是Superpowers一家的问题,是整个重型工作流的通病。知乎用户"Kitt在进化"在对比了几个主流框架后给出实测结论:GSD(把任务拆成原子计划、每个计划在全新子代理会话里执行的那套)token消耗约是Superpowers的5倍;SpecKit七步工作流最完整,但"独立开发者用起来仪式感太重"。知乎
还有一笔更隐蔽的账:注意力。Hacker News上有条评论被反复引用:"我个人不太喜欢Superpowers,但我老板喜欢。我的体感是装了之后Claude犯的错反而更多了。"这其实说得通——上下文窗口是有限的,塞进14个skill,每个都带一堆指令和规则,Agent一边处理你的需求一边背操作手册,注意力被稀释了。维护者自己也意识到了,后来做了次大优化,把14个skill的代码从3150行砍到977行,砍掉69%。但砍完核心问题还在:它依然在每个任务前强制插入完整流程。改个变量名,先花一分钟头脑风暴,再写spec、做plan,十秒钟的活搞了五分钟。知乎专栏
YouTube开发者WebDevCody公开发推说卸载了,原话很扎心:“为了实现一个简单功能要回答它20个问题,我宁可让Claude先莽一遍,不行再重来。”
第二笔账:模型换代账——你买的"补丁",正在变成贬值资产
Superpowers刚出来的时候(2025年秋),解决的是真痛点。那时候的Agent还比较"莽":丢个需求过去,上来就写代码,不规划、不测试,写完一堆bug。给它套一层SOP,相当于给冲动的实习生立规矩,效果立竿见影。
问题是,那是2025年的Agent。
这半年模型换代的速度肉眼可见:Fable 5、Opus 5.5(9月22日发布)、Sonnet 5.5(9月28日发布)、GPT-6.1这一代,规划和自检能力直接上了台阶。MCP Directory的专题文章说得很直白:Fable 5会先调查再动手,并且用更少的提示自己验证自己的工作。以前你不告诉Agent"先想清楚再写",它真会直接莽;现在你丢一个复杂需求给新旗舰,它会自己先看相关文件、理清依赖、想好方案再动手,改完还会自己跑测试。知乎专栏知乎专栏
知乎那篇卸载文里有个比喻很准:这就像智能手机早期,手电筒、计算器、扫码都要装第三方app,后来系统全内置了,那些百万下载的工具app安静地消失,没有人怀念它们。当底层能力足够强,上层的补丁自然退场。这不是skill做得不好,是它完成了历史使命。
所以社区里流传出一句实操口诀,来自B站一条1.2万播放的对比视频标题:"强模型配轻规范,弱模型配强约束。"用最新旗舰,流程skill的边际价值快速趋近于零;还在用便宜的老模型跑量,重型约束才值回token。"Kitt在进化"的选择很有代表性:GPT-5.5发布后从Superpowers换到OpenSpec,理由是后者最轻——propose→apply→archive三步,delta spec机制只对本次修改写增量规范、不重写全量文档,还有专门给老项目用的baseline命令逆向生成初始specs,“迁移成本几乎为零,OpenSpec是我唯一留下来的”。哔哩哔哩知乎
但注意,这笔账有个反面,也是"永远需要派"的核心论点。知乎用户"纤夫张"在9月那篇回答里说得很清楚:LLM再强,软件开发最难的两个问题它自动化不了——一是选择(一件事有一百种做法,没有对错,只有你的品味和习惯),二是持续遵循规范(代码从第一天开始就是个不断腐化的悲剧,武功再高也没用)。所以他的结论是:“你还是需要 superpowers 之类的 skill,只不过可能你不再满意 superpowers,而不是你不需要这类 skill”——要么选一个持续维护的用下去,要么fork了自己定制,要么让AI照着你的要求写一个。换句话说:会贬值的是"流程说明书",不会贬值的是"你的选择"。框架可以换,把选择外包给框架不行。知乎

第三笔账:返工账——真正该投钱的地方,框架根本没管到
这是三笔账里最关键的一笔,因为它回答了一个更根本的问题:AI编程的瓶颈到底在哪?
先看两组数据。Anthropic自己披露过:Claude写了他们生产代码库八成以上的代码,PR数量涨了98%,但团队交付效率几乎没动。专门做软件工程数据分析的机构Faros AI统计了1255个团队、一万多名开发者,结论更扎心:AI使用程度高的团队,人均完成任务多了21%、合并PR多了98%,但PR审查时间增加了91%,PR体积增长了154%,人均bug数多了9%——产出上去了,审查、体积、缺陷一起上去了,净交付速度几乎没变。把这几组数连起来读,结论只有一个:AI编程的瓶颈早就不是"生成",是"验证"。写代码那一段提速100倍,review那一段还是人肉速度,PR全堵在审查口。
而大多数工作流框架,恰恰止步于"写下来"。10月6日那篇16万浏览的OpenSpec讨论里,作者陈凡把话说透了:规范驱动开发"现在就是一个正在被用坏的工具"——几乎所有人把规范写成了人话,然后期待AI像读代码一样读懂它。他举了AWS自家Kiro的实测翻车案例:让它写一个读取运动数据的简单应用,出来20个文件、1500多行代码,人写200行就够,代码里还塞满没删干净的console.log;任务失败后上下文直接丢,从头再来。还有那个被反复提到的词——drift(漂移):requirements和design文档不会自动更新,代码跑到哪去了,规范还在原地站着。知乎
OpenSpec用户的体感也一样:“和AI来来回回十几轮,沟通时间比自己写代码还长。你花半小时写proposal,AI花半小时读proposal,然后生成一堆你不信的代码,你再花一小时review。这不是效率,这是把开发工作换了个地方做。”
那什么才管得住?陈凡给的答案在社区里获得了广泛共鸣:你不能让AI付出代价,但你可以让CI付出。AI写的代码违反规范,它自己不会痛;但同一份代码进CI,流水线会红、会拦住merge、会通知到人。他把自己的约束拆成三层:Rules是可机器验证的硬规则,由CI脚本执行,AI绕不过;Skill是稳定复用动作的编排,人可审;MCP是只读数据源,权限受控。三层里只有中间那层是给AI看的"规范",另外两层根本不给AI看。他还有条红线值得所有用AI编程的人抄下来:AI生成的测试脚本,绝对不能自己标记"已审核",评审状态永远由人写。这条口子一开,验收标准就变成AI自己给自己打分——所有测试都是绿的,所有bug都是已知的,然后上线炸了。知乎
另一个高赞经验来自"人月聊IT"(10月6日,25万浏览问题下的回答):项目刚启动时千万别急着上复杂工程化框架,先用轻量方式把核心功能跑起来,再逐步引入治理层;测试也别每次全量E2E,变更测试跟着提交跑,全量半天手动触发一次就够。知乎
把三笔账合起来:你的配置清单该怎么改
三笔账算完,其实可以把这半年的工作流大战提炼成一张"资产表":
层级 | 代表 | 价值走势 | 建议动作 |
|---|---|---|---|
模型能力 | Fable 5、Opus 5.5、GPT-6.1 | 快速增值,规划/自检已内置 | 能升就升,升级后重新评估skill存量 |
流程类skill | Superpowers、SpecKit、GSD | 快速贬值,token成本高 | 只留1-2个关键节点(如brainstorm/review),其余卸掉 |
轻量规范 | OpenSpec(delta spec)、AGENTS.md | 中性,看项目阶段 | 存量项目用baseline逆向生成,增量修改只写delta |
验证闸门 | CI检查脚本、测试证据链、权限锁定 | 持续增值,模型再强也替代不了 | 最早投入,一条规范配一条检查脚本起步 |

再按你自己的情况对号入座:
单人做小工具、用最新旗舰模型:基本可以裸奔,最多保留头脑风暴和代码审查一两个轻skill。社区共识是"Agent不需要你给它套那么多规矩,它需要在关键节点被轻轻推一下"——有开发者做了个只有6个轻量skill的fable-skills项目,用多轮压力测试验证"轻量引导完全够用"。知乎专栏

维护存量老项目:别上全量文档型框架,用OpenSpec这类增量规范,baseline命令扫一遍代码库生成初始specs,之后每次修改只写delta。老项目最大的风险是drift,规范必须跟着代码走。
团队协作、或者碰资金/权限/支付这类高风险域:钱不要花在流程说明书上,花在CI闸门上。把最重要的3-5条规范写成可机器验证的检查脚本挂进流水线,评审状态权限锁死只留给人。参考那条被验证过的路径:需求带唯一编号进表格→用例落成Markdown且只有人能标"已审核"→CI每次提交自动跑→报告用固定模板,人只看报告。这套跑起来之后,"发现AI写错了"的时间能从两小时压到十分钟以内。
新手:和上面相反,重型流程对你是有价值的——不是因为它效率高,而是它逼你养成"先想清楚再动手"的习惯。把它当教练轮,等你能自己判断AI什么时候在糊弄你了,再拆。
如果你只想做一件事验证这篇文章靠不靠谱:挑一条你团队最常被AI违反的规范,写成一行的检查脚本,挂上CI,跑一周。这比装任何框架都便宜,一周后你就有自己的答案了。
最后说点感性的
这轮讨论里传播最广的,其实是一个梗。知乎问题"你用AI编程用到什么深度了"下面,浏览205万的回答虚构了一位58岁的"陈师傅":不用Copilot、不用Agent,坚持纯手工编程,给变量起名要"顺"——“Count才稳,Num是浮的”;写if要一层一层来,“括号要有呼吸感”;一上午只写一个synchronized,“锁这个东西,跟榫卯一样”。窗外新一代软件工程Agent每天生成七千万行代码,陈师傅一天三百行,其中一百二十行是测试。大家转发这个段子的时候在笑,笑完又有点沉默。因为它戳中的正是Faros数据背后的真问题:当生成变得无限便宜,稀缺的就不再是写,而是审——是"味道不对"这三个字背后的几十万小时,是"这个需求凭什么这么实现"那条能追溯的证据链,是框架和模型都给不了你的、属于人的那部分判断。知乎
流程skill会像手电筒app一样退场,模型会继续换代,但"你还审不审得动"这件事,从头到尾都只取决于你自己。
接下来值得盯的两个信号:一是各家的skill注入token开销会不会写进官方文档(已经开始有框架把"启动成本"当卖点);二是新模型的changelog里"自主规划/自检"相关条目出现的频率——它每多一条,你手里的流程skill就再多贬一分。