9月28日晚上,外网开发者Craig的一份事故报告把Claude Code送上了风口:让AI清理测试环境副本,11项任务前10项顺风顺水,最后一项出了事——103秒,约5.5万个文件被直接抹除,其中只有约7300个是该删的测试垃圾,剩下48218个是真实项目里的心血。 更要命的是,连本地Git也被连锅端:虽然Git索引还在,还能列出7221个已跟踪文件,但.git里的objects、refs和logs已经被清空,程序员的「后悔药」没了。36氪
Reddit原帖目前已删除,细节以新智元这篇转载报道和TechRadar为准。但这不是今天想聊的全部。真正值得每个挂着Claude Code干活的人停下来看的,是另一条时间线:8月14日,Anthropic把Pro、Max、Team用户的默认权限模式切成了「自动」(auto)。今天是这条政策生效的第45天,而45天里用户的「烧家现场」反而一单比一单大。自动到底是必用还是坑?先别急着改配置,把账摆开算。36氪
自动模式上线时,官方的论据其实不是空穴来风
Anthropic在8月上旬官宣:自动模式将成为Claude Code中Pro、Max和Team用户的默认权限模式,由一个单独的分类器审查shell命令和操作。机器之心
Anthropic给出的第一组理由很扎心:人工审批早就名存实亡——用户批准了97%的权限提示,很多人是下意识点击而不是审查命令;作为对照,Claude交来一份计划时拒绝率是39%,而单条权限请求的拒绝率只有3%。机器之心量子位
第二组理由是一场对照实验:会话中途把一条权限提示替换成明显危险的命令,1053名付费测试者里人类只拦下了13.6%,auto mode拦下了89%。而且会话越长人类表现越差,auto mode的拦截率却不随会话长度变化——这大概就是官方敢把弹窗撤掉的底气。量子位
还有个数字很多人没注意:25%的交互式会话一开始就直接运行在bypass permissions模式下。换句话说,官方做这个决定的时候,相当一部分重度用户本来就已经在「全自动」了。分类器这边,官方委托的第三方评估显示,Opus 5在自动模式下的提示注入攻击成功率为0.00%。机器之心知乎

这套逻辑自洽吗?自洽。但它有一个前提:分类器拦得住「该拦的」,也认得清「路径」。而事故清单,恰恰是从第二条缝里出事的。
第45天回看:事故清单越拉越长,模式却惊人地一致
8月30日,机器之心报道Claude把一位开发者的整个项目主目录给删了,删了700GB的文件,讽刺的是开发者原本让AI写的脚本,目的是「确保文件不会被误删」。机器之心
9月1日,安全研究者wuzzi发布了针对自动模式的攻击复现:官方的0.00%之外,他用小样本量得到了高达80%的攻击成功率。知乎
9月19日,圈内AI要闻盘点直接把「编码Agent安全风险集中爆发」列成专题。微博
9月28日,Craig,103秒,4.8万个真实文件。
国内轻度用户这边同样不干净:7月小红书那波「AI一小时解数学题、当天把人Mac删空」的瓜,至今还有人拿来连夜整理保命指南。「防止codex乱删电脑」「防cc和codex乱删」这类帖子能拿到几十赞上百收藏,评论区全是晒自己中招的。小红书
跨源串完你会发现,这些事故没有一单是「AI觉醒反叛」,全是同一个三件套:模型把路径判断错了一步 + 它本来就有权限执行 + 机器速度让错误在人类反应过来之前执行完。人类删错目录会两秒收手,Agent批量删除不需要收手的理由。Craig这单最典型的细节是Windows的Directory Junction:他的测试环境里有614个这种「传送门」目录,看起来在测试区内,实际通向真实工作目录,删除命令顺着门就钻进了原件库。36氪

三条写进官方文档的硬事实,每一条都是别人的血泪换的
这次事故后重读Anthropic官方文档,有三句话值得截图:
Checkpoint不等于回收站。官方提醒,rm等Bash命令造成的文件删除无法用Checkpoint撤回。你在Claude Code里按Esc、回滚、checkpoint restore,对这类误删未必管用。36氪
本地Git不等于备份。只要Agent拥有删除项目目录的权限,它就能顺手删掉.git,源码和版本历史在同一条漏水的船上;真正能用来兜底的东西,必须和Agent所在的故障域彻底隔离。
自然语言约束不等于权限边界。acceptEdits模式下,rm、rmdir等删除命令也可自动执行,一旦路径判断出错,误删就直接发生,中间没有任何一次人工确认。
分层判断:谁的auto可以继续开,谁必须先补护栏
可以继续开自动模式、安心提效的:代码和资产在远端仓库有完整副本、本地只是工作副本的;跑在devcontainer、一次性虚机、隔离账户沙箱里的;项目本身可复现——真删光了,git clone加脚本两小时满血重来的。你们的风险敞口是时间,不是数据。
建议今晚就动一下配置的:Windows用户,且环境里大量使用junction、符号链接、挂载目录的(Craig同款陷阱);让AI干「清理磁盘、整理文件夹、批量重命名」这类文件级任务的人;以及单人项目、代码只存在本地、所谓备份就是本地.git的。这三类人恰好是自动模式收益最大、烧家代价也最大的人群。
三件可以马上做完的兜底动作:
把最后那份救命备份挪到Agent够不着的地方:每次改完push远端、云端快照开自动、或者至少给AI单独开一个无权访问你备份盘的账户。
给删除命令上一道闸:settings.json里给rm、rmdir这类命令加deny规则,或者上PreToolUse hook。社区方案里最常被推荐的是destructive_command_guard(dcg),它会检查ClaudeCode、CodexCLI这类工具在执行的命令,7月就有人安利。微博
把「删除」换成「移动」:不要让AI说delete,让它把候选文件统一移进备份文件夹,由你人工确认后定期清理——这是小红书那条80赞帖子里最实用的一招,删除权留在自己手里,效率损失几乎为零。小红书
接下来盯什么
原帖被删、Anthropic截至发稿没有针对这单事故的正式回应。顺带一提,自动模式也不是无限狂奔:如果分类器连续三次或一次会话中二十次无法继续,Claude Code会回退到手动审批模式。还有两个信号值得继续跟:一是Claude Code changelog里,auto/acceptEdits对rm类命令的授权是收紧还是维持;二是官方会不会针对Junction这类「链接目录穿越」给出结构化防护,比如删除前解析真实路径。这两件事都没动,那「自动模式更安全」的结论就先只能接受限定版:对弹窗疲劳的人类更安全,对没做故障域隔离的项目不一定。机器之心

一句话收尾:Agent时代不该赌AI永远不犯错,真正的问题只剩一个——它犯错的那一刻,你的恢复手段在不在它够得着的地方。今晚花十分钟检查一遍,比看完十条「AI提效神器」都值钱。