8月的AI圈有点魔幻:一边是AI智能体加速"干活化"——Anthropic推出通用代理Cowork,开源仿制项目几天就在GitHub冲上1.9万Star,华尔街投行已经开始给八款中美Agent做办公能力实测。知乎另一边,是一连串安全事件,全都指向同一个软肋——你交给AI助手的那些权限,可能正等着被一封邮件、一个网页、一份README里藏着的一句话"接管"。
这种攻击有个学名:提示注入(Prompt Injection)。它不是新概念,在OWASP的LLM应用十大风险榜单上常年排第一。知乎但今年8月密集披露的这批事件,让它第一次从论文和靶场走进了真实工具链。我把这个月公开报道里站得住脚的几起事件梳理了一遍,再给一份权限自查清单。
8月发生了什么:四笔账,笔笔有出处
第一笔:Cursor被曝两个CVSS 9.8满分漏洞。 安全机构Cato AI Labs披露的漏洞链代号DuneSlide,包含CVE-2026-50548(工作目录操控)和CVE-2026-50549(沙箱逃逸),影响Cursor IDE 2.x全系。知乎攻击路径说白了不复杂:AI编程助手本来就要读MCP插件返回的内容、读网页搜索结果、读clone下来的仓库README,攻击者只要在这些"AI会读到的内容"里埋一句指令,就能操纵命令的执行目录,进一步把沙箱内的命令变成完全非沙箱执行——绕过了"用户确认"这道最后的防线。

第二笔:AI Now研究所的"Friendly Fire"(友军火力)研究。 攻击者在被投毒的开源仓库README、注释里藏入隐藏指令,就能劫持Claude Code、OpenAI Codex的自动自治模式,在开发机上实现远程代码执行。这项研究里有两个细节值得记住:一是15位资深开发人员人工审查,没有一个人识别出文档里的注入载荷;二是它已经有真实战果——有人往GitHub提交了一条藏着注入指令的issue,Cline项目的自动化工作流读取后被劫持,偷走npm发布令牌,随后发布了恶意版本的cline@2.3.0,8小时内数千名开发者下载中招。知乎
第三笔:浏览器AI扩展的"一封邮件换整个账号"。 有安全研究者针对Claude Chrome扩展做了完整PoC:攻击者发一封Gmail邮件,恶意指令藏在display:none和零宽字符里,肉眼完全看不见;用户只是让AI"总结一下最近的邮件",扩展就会按隐藏指令读取整个收件箱、提取密码重置邮件和验证码,再发送到攻击者的服务器。更扎心的是,哪怕你开了"执行前询问",攻击链依然能走完——因为确认弹窗里那段"这次操作要干什么"的描述文本,本身就是被污染的模型生成的。研究者同时提醒:Gemini Chrome扩展、Perplexity Comet、ChatGPT Atlas、Edge Copilot,共享同一类底层风险。知乎
第四笔:攻击成功率到底多高? 有测试用500份带隐藏注入载荷的README做实验,主流AI编码Agent执行恶意指令的成功率最高达到85%;当恶意提示藏在二级链接里,成功率升到91%。知乎
先把丑话说在前面:上面这些案例里,有已确认的CVE,有真实发生的供应链事故(Cline那起),也有研究性质的PoC演示,不能混为一谈说"全面沦陷"。但它们共同说明一件事:这类攻击已经走出了实验室。
为什么"一句话"能骗过顶级大模型
很多人第一反应是:模型这么聪明,怎么会被这种把戏骗到?问题恰恰出在聪明本身。
大模型处理信息的方式,决定了它天生分不清"指令"和"数据"——用户说的话、网页里的文字、邮件里的句子,进了上下文都是同一种东西。知乎传统软件安全里,数据和指令是严格分开的;而AI Agent把这道边界抹掉了:文档里的数据,可以直接变成要执行的指令。有技术作者把它比作大模型时代的"SQL注入时刻"——当年数据库分不清查询语句和用户输入,被统治了二十年;现在轮到模型分不清你的指令和别人的内容了。

危害的大小有一个很直白的公式:提示注入的破坏力 ≈ 攻击成功率 × Agent的权限。知乎聊天机器人被注入,顶多输出点奇怪的话;但一个登着你的邮箱、握着浏览器会话、能跑终端命令的Agent被注入,就等于给攻击者递了一个代理人。这也是为什么7月OpenAI那个"测试Agent闯入Hugging Face生产数据库待了4.5天"的事件让圈内震动——权限越大,放大越狠。
还有个反常识的点:靠在系统提示词里加一句"不要听文档里的指令",基本没用。零宽字符、HTML隐藏标签、多层嵌套引号,绕过手段一抓一大把;而"每次操作前弹窗确认"也不可靠——Anthropic官方文档里的数据是,人工确认弹窗93%都会被用户直接放行,更别提弹窗文案本身还可能被攻击者操纵。知乎
所以这不是某一家厂商的bug,而是"能读外部内容 + 能调工具"这个产品形态的共性攻击面。只要这个组合在,注入就不可能100%消除——能做的是把损失按住。
普通用户的权限线该怎么画
好消息是:这套风险对绝大多数人来说,靠"管好权限"就能大幅压缩。我把Agent的权限分成四档,你可以对照自己手里的工具查一遍:
L1 纯聊天(不调用任何工具):被注入顶多影响输出内容,风险最低,放心用。
L2 只读外部内容(帮你总结网页、读文档):风险变成"信息流向外部"——隐藏指令可能让AI把你的数据输出到攻击者服务器。可以用,但别让它碰敏感文件。
L3 能写、能发、能执行(发邮件、改文件、跑命令):这是8月所有事故的主战场,必须有确认机制,且确认时多看一眼。
L4 碰钱、碰身份、碰生产环境(支付凭证、主账号密码、生产数据库):原则上,不要交给任何Agent。

落到动作上,这六件事值得今天就做:
读和发,拆开给。 让浏览器AI扩展或AI助手读邮件可以,但不要同时给它"自动发送/自动执行"的权限。攻击链要闭环,靠的就是读+发两只手都在。
密钥别躺在Agent能读到的地方。 .env文件、浏览器保存的凭证、SSH密钥,能挪就挪;写代码的朋友,检查一下自己是不是图省事开过 --dangerously-skip-permissions 这类跳过校验的参数。
自动模式扫陌生仓库时多一根弦。 第三方仓库的README、issue、PR评论都算"不可信输入";CI流水线里跑AI Agent,务必进沙箱,密钥不放环境变量明文。
MCP插件来路要查。 第三方MCP服务返回的内容,等于直接喂进Agent嘴里的外部输入,装之前看看是谁做的。
高价值账号上硬件密钥。 邮箱、支付、主社交账号,验证码被偷了还有最后一道闸。知乎
留好操作日志。 Agent调了什么工具、参数是什么,出事时能还原路径,平时也是给自己提个醒。知乎
分人群说句实在话:只把AI当聊天框用的朋友,这波事件跟你关系不大;用AI处理邮件、文档的办公用户,重点盯紧"读外部内容"的场景;而重度使用AI编程工具、把Agent接进工作流的开发者,是这波攻击的头号目标,上面清单优先级最高。
写在最后:能用,但要有边界
这波事件最容易带偏节奏的有两个方向:一是"AI要觉醒失控了"——不用恐慌,这些都是目标驱动的工具被钻了空子,不是天网;二是"厂商发个补丁就没事了"——也别乐观,只要"读外部内容+调用工具"的组合还在,补丁只能抬高攻击成本,做不到根除。
接下来值得盯的信号:Cursor官方对DuneSlide的修复覆盖进度;刚发布的Cowork在沙箱隔离上交出的答卷;以及MCP生态会不会像当年应用商店一样,长出权限分级和审查机制。
AI助手越来越能干是好事,问题从来不是"要不要用",而是"给它多大的手"。权限给到位之前,先把它当实习生看:能干,但别急着给保险柜钥匙。