8 月 17 日周一,北京时间 21:40。不少开发者正在晚高峰里收尾工作、合并当天的 PR,GitHub 的状态页开始一行一行变红——网页、API、Actions、Pull Request、身份验证、Copilot,挨个倒下。知乎
等所有服务恢复,已经是第二天凌晨 5:15。官方复盘给出的时长:7 小时 47 分。微博
如果只是一次普通宕机,这事一周就过去了。但这次不一样:压垮 GitHub 的不是黑客,而是它自己养大的 AI 流量;宕机开始几个小时后,刚被 SpaceX 收入囊中的 Cursor,上线了 Agent 原生代码托管平台 Origin;而一周过去,全网对「到底发生了什么」的说法,乱得超乎想象。
我们把 GitHub 官方复盘、状态页、Hacker News 讨论和中外报道交叉核对了一遍,整理出三件被证实的事、三件被夸大的事,以及三件靠 GitHub 吃饭的人现在值得做的事。
三件被证实的事
第一,这次真是「容量被打爆」,不是代码事故,也不是被黑。
GitHub CTO Vlad Fedorov 在 8 月 20 日发布了完整复盘:流量达到创纪录峰值时,美国中西部数据中心的一个关键基础设施组件没有同步扩容,容量压力在系统内扩散,引发认证连锁失败。知乎官方措辞很明确——8 月 17 日和 8 月 6 日两起事故「都不是代码或配置变更导致的,本质都是容量失败」。微博
影响面比想象中宽:最严重时段,网页与 API 流量错误率约 20%,仓库归档和原始内容下载错误率约 50%,Git 操作、Webhooks、Issues、PR、Actions、Pages、企业 SSO(SAML/OIDC)和 Copilot 全部中招。36氪注意,这是请求级错误率,不等于「两成用户掉线」;但对恰好要跑 CI、要发版的团队来说,那晚是整条交付链在多个环节同时瘫痪。

第二,GitHub 的压力确实在爆炸式增长。
复盘给了一组数字:4 月以来,月提交量从 14 亿涨到 29 亿,四个月翻倍。GitHub 已经加装了超过 300 万颗 CPU 核、120PB 高速存储,Azure 承载的平台负载比例从 5 月的 12% 拉到约 58%。知乎即便如此,第三方报道说它的扩容设计目标已按「当前规模的 30 倍」起步,甚至开始向老对手 AWS 租用容量。
这也不是孤立事故。官方可用性报告里,6 月记录了 6 起事故,7 月记录了 8 起;7 月 8 日那次中断 7 小时 4 分钟,部分企业环境峰值 5xx 错误率约 96%。而自 2025 年 10 月起,GitHub 一直处在从自有数据中心向 Azure 迁移的「半迁移」状态,这本身就是不稳定的持续来源。36氪
第三,一个少有人提的细节:AI 工具自己拖慢了恢复。
恢复期间,认证令牌重试和 Copilot 客户端的重试循环反向推高了流量——用户的工具越着急重试,恢复越慢。微博GitHub 最后不得不「部分禁用重试」,才把 Copilot 安全救回来。这是「客户端重试」第一次被官方写进事故变量。用 AI 工具越多的团队越该记住这条:你的脚本和 Agent 如果没有重试上限和退避,下一次风暴里你就是风暴的一部分。
三件被夸大的事
「GitHub 要完、帝国崩塌」——可以小声点。
这一周刷屏的标题里有「GitHub 帝国崩塌前夜」,也有「微软失去 1.5 亿开发者」。但 GitHub 官网挂着的数字还是超过 1.5 亿开发者、4.2 亿个仓库。知乎Hacker News 上确实吵翻了:两篇宕机主帖分别拿到 694 分和 510 分,「Ask HN: Alternatives to GitHub」也有 479 分。可讨论热度不等于迁移事实——多方报道交叉确认:截至目前没有出现成规模的迁移潮。GitLab、Bitbucket、Gitea、Codeberg 都涨了讨论度,但也只是讨论度。36氪
「全是 AI 流量干的」——离定论还差一份完整 RCA。
官方定性是容量型故障,但截至事故后数日,GitHub 并没有公布出问题组件的具体名称和整改技术细节。知乎独立综述的意见是:在完整 RCA 发布之前,不能把「AI 流量」当作已被证实的唯一根因。方向大概率没错,但引用时最好带上「官方定性」四个字。
「Cursor Origin 绝杀 GitHub」——先看 Origin 现在的真实形态。
Origin 目前是 Beta。用它必须先关联 GitHub 账号,主打姿势是把 GitHub 仓库「镜像」进 Cursor:可以浏览、搜索、拉取,但推送仍然发回 GitHub,权威来源还在 GitHub 手里。Cursor 团队成员 Thomas 自己调侃:「你至少得关联 GitHub 账号才能打开 Origin,这怎么能算竞争对手?」。36氪另外,Origin 不免费——只对 Pro、Teams、Enterprise 付费套餐开放;而 GitHub 的免费层和开源生态,暂时还没有对位产品。

还有两组数字别较真:宕机时长,官方博客说 7 小时 47 分,状态页从 13:40 UTC 到 21:15 UTC 算下来约 7 小时 35 分;Downdetector 的报告量,一个版本说超 1 万条,另一个说峰值约 3000 条。知乎口径不同,不用争,但也别把它当成受影响用户数。
真正变了的事:AI 正在改写代码托管的规则
剥掉噪音,这次宕机真正的信号是:代码托管进入了被 AI 流量正面冲击的第一年。
GitHub 的处境有点讽刺——Copilot、Agent 生态、AI 灌水式的提交洪流,都是它自己养大的,如今成了压垮它的负载。一个中型团队跑满 Agent,每小时能推出上百条分支;Cursor 演示过 22.6 commits per second 的吞吐量——这都不是人类时代的提交形态。
对手们全都在沿着这条裂缝布局。Cursor 的 Origin 干脆把 Agent 放在产品设计的中心,官方数据称其平台上已有 35% 的合并 PR 由云端虚拟机里的 Agent 自主提交,首批还接上了 Vercel、Depot、Buildkite,连你存量的 GitHub Actions 工作流都能接着跑。36氪更早的 3 月,The Information 就曝出 OpenAI 也在秘密开发自己的代码托管平台,导火索同样是 GitHub 反复宕机。微博

还有一个变量是马斯克。SpaceX 联合 xAI 以约 600 亿美元全股票收购 Cursor 母公司 Anysphere 的交易 8 月中旬落地。知乎企业客户的信任问题立刻浮出水面——有人公开表态「我绝对不会和马斯克分享我的代码」,转而使用 Claude Code 和 Codex。36氪代码托管卖的终究是信任,所有权变更带来的信任成本,是这门生意里以前不需要考虑的新项。
GitHub 自己也没闲着。官方路线图是三件事:加容量、提效率、拆架构瓶颈,原则是「可用性优先,其次容量,再次功能」。知乎可验证的里程碑很明确:2026 年底前把生产流量全部迁出自有数据中心、读容量随读者数线性扩展、服务间统一施加重试上限与重试预算。
开发者现在该做的三件事
与其争论要不要离开 GitHub,不如把单点故障变得可控。官方复盘和独立综述其实已经给出答案,按人群拆开:
个人开发者、开源项目作者:把关键仓库 `git clone --mirror` 一份到本地,最好再加一个第二 remote;别让安装脚本吊死在单一下载链路上,依赖下载留好镜像或缓存;关注 githubstatus.com,红灯亮起时别疯狂重试,那只会让下一次恢复更慢。
团队技术负责人:盘点 CI 可迁移性——你的工作流有多少和 Actions 语法深度绑定,明天要搬到别的 CI 上需要几天?提前定义紧急发布流程:PR 合不了、Actions 跑不动的时候,谁拍板、怎么降级、怎么对外同步。给自家工具链的脚本和 Agent 设置重试上限、超时和退避,这既是帮平台,也是保护自己。
企业与合规敏感团队:重新评估单一托管平台的 SLA 风险,多云或双托管值得排上议程;对 Origin 重点盯两件事——数据隔离承诺能不能变成可审计的合规文件,以及 Beta 何时全量、如何定价。它现在是给 Cursor 重度用户的尝鲜项,还不是企业级选项。
最后留几个值得持续盯的信号:下一次峰值流量事故是否更早到来,这决定容量矛盾有没有缓解;完整 RCA 公布时,看看出问题的到底是哪个组件;Origin 哪天开放免费用户、不再强制关联 GitHub,才是它真正变成 GitHub 对手的时刻。
GitHub 没有崩塌。但「默认使用 GitHub」这个持续了 18 年的行业习惯,从这个周一晚上开始,被认真打上了问号。这可能是这 7 小时 47 分里,最值得记住的一件事。