8月23日晚,一篇刷屏的技术圈文章说,一个叫 Superpowers 的 AI 编程 Agent Skills 框架"三天内斩获超过26万颗星",超越此前所有开源项目的最快破星纪录。知乎差不多同一时间,《代码整洁之道》作者 Uncle Bob 因为"不再看代码"在小红书上了热门:他让 Agent 写代码,自己不再逐行检查,改为叠加约束——单元测试、Gherkin 测试、变异测试、覆盖率。小红书这条笔记收藏过千、评论两百多条,很多已经在用 Claude Code、Codex 的朋友开始纠结:这东西到底要不要装?
先说结论:方向是真的,数字是注水的,而且它不适合所有人。
先把星数算清楚
Superpowers 由 Jesse Vincent(GitHub ID:obra)在 2025 年 10 月 9 日——恰好是 Anthropic 给 Claude Code 推出插件系统的同一天——发布,两天后登上 Hacker News 首页,拿到 435 分、231 条评论。知乎这个开场相当扎实,但和刷屏文章里"三天 26 万星"的说法完全对不上。
真实的星标轨迹是这样的:2026 年 2 月底约 6 万星。哔哩哔哩到 8 月 19 日涨到 27.4 万,三天后(8 月 22 日)的 GitHub API 数据是累计 275,873 星、24,665 个 fork、300 个开放 issue——10 个多月,平均每天约 870 星。知乎

所以"3 天 26 万星"在数学上就不成立:8 月 19 日它才 27.4 万星,3 天后再涨 26 万,意味着总量得奔着 50 万去。那篇爆文还宣称另一个框架 ECC"紧随其后,拿下24万星",并断言 AI 编程已从模型能力竞争转向"执行框架竞争"。知乎但 ECC 的 24 万星,我在知乎、B站、小红书、微博都找不到任何佐证——ECC 确有其物(Claude Code 插件生态的一员),这个数字却查无实据。这类文章大多是旧闻来回洗的流量稿,一个教 AI 编程别胡编的框架,自己的热度反倒被胡编了一把。
方向是真的:Superpowers 到底是什么
抛掉注水数字,这东西本身值得认真对待。它不是新模型,也不是新 IDE,而是一套给 AI 编程代理"上工程纪律"的技能框架:MIT 许可,主体是一组 Shell 脚本加 Markdown 文档,官方文档列出 14 个技能,从头脑风暴、写计划、测试驱动开发、子代理驱动开发,到系统化调试和"声称完成前必须跑验证",串成一条流水线。

这些技能不靠代理自觉。安装之后,每次会话启动,代理都会先读到一段引导指令,被要求只要有一个技能可能适用于当前任务,就必须先调用它,没有例外。知乎官方的表述也很硬:技能是"强制的工作流,不是建议",代理可以连续自主工作数小时而不偏离你批准的计划。知乎

中文教程把这套理念概括为一句话:Process over Prompt,流程大于提示。知乎装上前后的差别也很具体:没装的 Claude 接到"加个登录功能"会直接开写,装上之后会先连环追问技术栈、认证方式、数据库选型,确认设计后才进入实现。这背后的逻辑,和 Uncle Bob 刷屏是同一件事——当 AI 写代码的速度超过人读代码的速度,质检只能从"读代码"挪到"流程和测试"上。这就是 Superpowers 爆发的土壤。
效果到底怎么样?两边的话都得听
先说官方口径。今年 6 月 v6 版本发布时给过一组数据:一个自主研究循环完成 25 个实验,花费约 165 美元 token(未补贴口径约 650 美元),官方结论是构建墙钟时间降 50%、token 消耗降 60%。知乎注意前提:这是官方团队自己跑的内部实验,评估套件 superpowers-evals 同步开源。实验细节里有几个很实在:精简审查合同让审查输出减少 41% 且结论不变;固定实现代理的模型档位,每轮省 0.5~1 美元;而"给控制器思考设上限"被证伪——回合数从 92 涨到 138,官方直接标记为失败方向。
质疑方的声音同样存在。发布帖的 HN 讨论里,高赞批评把这类方案称为"让 slop 更好看的第 73895 种提示词技巧",指出缺少严格 A/B 对照,还担心大代码库下代理出现隧道视野、技术债堆积。知乎
官方公开的 eval 里也有自曝家丑的结果:把 TDD 技能里一段"为什么顺序重要"的论述删掉后,代理的测试先行行为从 8/10 掉到 5/10,Claude 和 Codex 两个模型都复现了。知乎这件事同时证明两点:流程文本真的会改变代理行为;但这种效果是脆弱的,靠措辞维持。比较公允的判断是:Superpowers 是一个被认真维护、有公开评估数据的工程资产,不是银弹。
再说说钱:框架免费,真正的成本是 token
Superpowers 本身不要钱,官方反而承认:"用户最常见的抱怨就是 token 很贵,而 Superpowers 用掉大量 token。“更多的流程、验证和子代理审查,都在往输入端加量,v6.1.0 还专门压缩了每次会话注入的引导文本来省开销。旁边有一组对照实验:Composio 团队把同一个模型 Kimi K3 分别放进 Claude Code、Hermes、Kimi Code 三个框架跑 28 个相同任务,成功率几乎一样(20/21/22),但 token 消耗中位数差出约 6 倍,极端情况最多差 30 倍。36氪差距主要在输入端——框架在多轮交互里反复把上下文塞回模型,换算成钱,单任务成本能差出 2 美元对 0.22 美元。所以装 Superpowers 之前要算的账,不是订阅费,而是"我的计费方式 × 任务复杂度 × 开全流程还是只开几个技能”。

谁该装、谁可以等、谁先别装
建议装的:已经在重度用 Claude Code、Codex,经常把长任务交给 agent 跑,项目要长期维护、要过代码审查,或者被"AI 自由发挥"坑过的。安装没有门槛,官方安装文档覆盖 Claude Code、Cursor、Codex、Gemini CLI、GitHub Copilot CLI、OpenCode 等 14 种以上宿主,Anthropic 官方插件市场里也有。知乎
可以等的:平时写的是小脚本、一次性短任务,模型够新够强——原生流程就够用,也可以看看更轻的 Matt Pocock skills:8 月 19 日的 Trending 榜上,它和 Superpowers 同日在榜,22.29 万星对 27.4 万星,当日新增 1,214 对 514。知乎B站有支 3 万多播放的视频,专门讨论模型越强、Superpowers 和 Matt Pocock Skills 该删谁的问题。哔哩哔哩这个争论本身就在提醒:框架的价值和模型能力此消彼长,别急着堆料。
先别装的:连主力工具都还没用熟、需求还说不清楚的——纪律框架治不了需求不清;以及 token 预算非常紧张、按毛算钱的,先把上一节的账算明白。
装的话,三个实操点
中文社区有 superpowers-zh:14 个技能全汉化,还加了 6 个本土技能(Gitee/极狐 GitLab 中文工作流、中文 commit 规范等),支持 17 款工具,npx superpowers-zh 一键安装。知乎建议先只开头脑风暴、写计划、TDD 这条核心链,在小项目上跑顺了再谈全流程,别拿生产代码直接上全套。每个技能链里还要留好人的判断节点——连那篇刷屏爆文都承认,Superpowers 的设计是"Agent 作为团队成员"而不是"Agent 替代人"。知乎
后续值得盯的信号:星标增速已经回落到每天几百个,下一波催化看 v7 和官方 eval 数据会不会进一步公开;观望的人重点看两件事——强模型配轻量 skill 的阵营会不会拿出更多证据,以及 Superpowers 的 token 开销在下个大版本能不能结构性降下来。