一周四场地震:AI 编程被攻破的不是模型,是你交给 Agent 的权限链

源自30位全网作者

05:06

先说一件有点反直觉的事:7 月 25 日出现在 OpenAI 内部代码仓库 openai/openai 里的那条 PR(编号 #1186742),不是 AI 被"骗"了,而是 AI 被合法地"指挥"着提交的。提交者是一位 OpenAI 员工账户里绑定的 Codex,账户则被三名外部安全研究员接管。这条细节来自《华尔街日报》9 月 18 日的报道,执行方 Hacktron 团队把整个过程完整复盘了出来。DeepTech深科技

如果你的第一反应是"这是别人家公司的事",那建议你把 9 月 11 日到 18 日这一周的信源摊开看一遍:中转站、技能市场、工具更新机制、隐私回传、官方警示,五条线同时爆了。而且这五个爆点,每一个都踩在 AI 编程重度用户的日常操作路径上——不是未来风险,是"你现在这台机器上可能就有"。

一、一周时间线:五件事,先分清楚哪些是实锤

日期

事件

证据等级

9/11

安全研究员披露购买到中转站流出的 6TB 大模型调用数据集;配套论文实测 428 个 API 中转路由器

论文+可复现实测,实锤

9/17

国安部公开提醒警惕 AI 代理"抱团接头"风险,社区破圈传播

官方口径,实锤

9/18

WSJ 报道三名研究员用 Claude 在 72 小时内攻入 OpenAI 内部仓库(事件发生于 7 月)

WSJ+当事团队复盘+厂商公告三方对齐,实锤

9/18

媒体披露 Claude Code、Codex、Gemini CLI、Copilot 四大编程代理的 Skills 更新机制存在同一类缺陷

媒体转述,厂商未回应,待确认

9/18

B 站、小红书出现对编程工具回传代码标识符/仓库名指纹的静态分析实测、"本地模型 App"反编译实测

个人样本测试,证据有限,方向值得警惕

最后两行的证据强度和前三行不是一个量级,后面会单独说边界。但前三件事的共同点已经足够扎心:攻击者一个都没碰"模型漏洞",碰的全是权限和供应链。

二、72 小时、不到 3000 美元,攻击链长什么样

Hacktron 这个代号为"HEIF Heist"的项目历时约两个月,但真正打穿 OpenAI 的时间不到 72 小时,调模型的花费不到 3000 美元。链路一共三跳:DeepTech深科技

第一跳:论坛的一张图片。 OpenAI 社区论坛基于 Discourse,用户上传 HEIC/HEIF 格式图片时,系统会走 ImageMagick → libheif 解码。研究员构造恶意图片触发 libheif 内存越界,在论坛服务器上拿到远程代码执行(RCE)。Discourse 在 7 月 28 日的安全公告中确认了这个路径属实;Debian 随后也发布了 libheif 的集中修补公告。DeepTech深科技

第二跳:单点登录的裂缝。 论坛账户归属 OpenAI 主站 SSO 体系。拿着论坛服务器的权限,结合一处 SSO 配置缺陷,研究员直接渗透进多名员工的 ChatGPT 账户,拿到了其中一人的 Codex 访问权。

第三跳:员工自己配好的授权。 这位工程师此前为了把日常开发委托给 AI,已经给 Codex 绑定了内部仓库权限——于是攻击者命令 Codex 向内部仓库提交了那条 PR。DeepTech 的复盘里还提到:该账户同时关联 Slack、企业邮箱,横向移动空间远不止代码仓库。

一周四场地震:AI 编程被攻破的不是模型,是你交给 Agent 的权限链

两个细节值得多看一眼。其一,研究员先让 Claude Opus 4.8 找漏洞、写利用脚本,卡在没有跨过 ASLR(内存地址随机化)这道工程门槛,直到 7 月 24 日 Opus 5 发布,几小时内在本地跑通首版,再自动迭代适配目标架构。其二,Claude 起初拒绝直接针对远程主机写利用程序——研究员把自建靶机包装成 CTF 比赛环境绕过了拦截。模型的安全护栏拦住了"话术",没拦住"产物":靶机上生成的代码,人工无缝迁移到了真实目标。

防守方的处境同样扎心:libheif 这个被全球广泛引用的基础图形库,核心维护常年靠一名独立开发者业余无偿承担,仅 2026 年 1-8 月就发布了 37 份安全公告——AI 把"挖漏洞"的速度提上去了,"修漏洞、复现、回归、发布"的每一步还是人肉。

三、中转站:从"被动泄密"到"主动作恶"已经有工业化证据

如果说 OpenAI 事件离普通用户还有一层距离,9 月 11 日披露的中转站链条就是贴脸警告。00 后安全研究员寿超璠花五位数美元,从一家国内头部大模型中转服务商手里买到了一份 6TB 的模型调用数据集——未脱敏的请求历史里装着 GitLab 访问令牌、SSH 私钥、VPN 配置、公有云最高权限密钥,按他公布的清单,足以接管华为、小米、蔚来、MiniMax 等 19 家科技公司和张江实验室、中科大等 7 家重点机构的内部系统。36氪

泄露机制一点都不神秘:编程 Agent 会自动扫描工作区、读 .env、抓终端输出。当你把 API Host 指向一个没审计过的中转站,SSH 密钥和云服务 SecretKey 就随着上下文一起明文过境——中转站解包重写认证头的那几毫秒,只要开着日志,一切沉淀进它的数据库。

更狠的是他和高校团队那篇《Your Agent Is Mine》的主动实测:从淘宝、闲鱼、Shopify 买了 28 个付费中转服务,从社区收集 400 个免费节点,放进可追踪的诱饵凭证。428 个样本里,17 个的后台脚本在几分钟内就自动提取了 AWS 凭证并发起未授权探测,1 个直接把测试钱包里的 ETH 转走了,9 个会主动篡改模型返回内容、往里塞反弹 Shell 和后门——其中赫然包括花钱买的商业服务。他们另一位客户的钱包因此被洗走约 50 万美元。一个中转节点被反向验证后,几小时内就顺出下游约 400 台开发主机。36氪

一周四场地震:AI 编程被攻破的不是模型,是你交给 Agent 的权限链

而论文里最扎心的统计是:91.1% 的开发会话正跑在不弹窗、不确认的 YOLO 模式下。中转站偷不偷你是一回事,你机器有没有"读了就执行"的默认信任,是另一回事。36氪

一周四场地震:AI 编程被攻破的不是模型,是你交给 Agent 的权限链

四、剩下的两条线:更新机制和"回传",哪个该慌、哪个先别慌

9 月 18 日多家媒体转述:Claude Code、Codex、Gemini CLI、Copilot 这四大编程代理在 Skills/技能更新机制上存在同类缺陷,更新通道可被劫持——如果属实,攻击逻辑和传统软件供应链投毒一脉相承,只是这次植入的不是二进制,是让 Agent"自己执行"的指令。目前四家厂商均未公开回应,先按"待官方确认"处理,但值得你现在就去查一下自己装的第三方 Skill 来源知乎

同一天 B 站的静态分析视频(2655 播放)称多个编程工具会回传代码标识符、仓库名等指纹信息,小红书也有反编译"本地模型 App"后发现仍有数据回传的实测。这类个人测试样本小、方法未必完备,够不上"它们在偷你代码"的结论;但它们和第三节"提示词过境即泄露"的机制方向一致——"我用了本地模型,所以什么都不出去"这个假设,别当成安全结论。小红书

一周四场地震:AI 编程被攻破的不是模型,是你交给 Agent 的权限链

五、把五件事叠起来看:攻击面已经从"代码"迁到"权限链"

单看每一条都是瓜,叠起来看是一张图。这一周被攻破的五个环节——输入侧(中转站明文过境)、执行侧(YOLO 模式静默执行)、更新侧(Skills 供应链)、配置侧(SSO 与 Codex 授权绑定)、遥测侧(客户端回传)——没有一个是"模型说错了话"。模型只是执行者,链条上每一环的默认信任,才是攻击者的入口。AI 编程圈这一年的竞争叙事都在比"Agent 更自主、更少确认",而安全侧的账单,正好从这些词的字缝里长出来。

这也不是说 AI 编程不能用。同一周里,Rust 社区给 AI 参与立了"可辅助审阅、不可代写、滥用熔断"的规矩,Discourse 和 Debian 的补丁也都发了——行业的正确姿势是收紧授权,不是回到手搓

六、分层自查:按你的使用方式对号入座

1)正在用中转站降本的个人开发/小团队——最高优先级。 现在就去:换掉或审计 API Host;把中转链路上可能明文过境的凭证全部轮换一遍(GitLab token、SSH key、云 SecretKey、.env 里的东西);把任何"折扣 API"和私人凭证、生产密钥物理隔离。省下来的差价,对照 50 万美元被洗的那个案例做个期望值。

2)装了一堆 Skill/MCP 的用户。 盘点来源:只保留可验证仓库(GitHub 可查、维护者可追)的;不认识的先导出它的配置和脚本看一遍再留;关注四大厂商对更新机制问题的回应,补丁出来当周就升。

3)YOLO 模式重度用户。 这是五个环节里唯一纯靠习惯就能关掉一半风险的:给 Agent 加执行确认,敏感目录(~/.ssh、~/.aws、密钥库)单独设禁区。91.1% 这个占比说明你不是个例,也说明改的人还不够多。

4)"本地模型=绝对安全"党。 把这句话从脑子里删掉,改成"本地模型减少出境面,不消灭出境面"。看客户端的网络行为,比看模型在哪跑更实际。

5)企业里被推着用 AI 的工程师。 注意 OpenAI 事件的第三跳:员工个人为了方便给 Codex 绑了仓库权限,这在公司视角就是未申报的高危授权。自查你给 Agent 授权过什么、能不能一句话撤掉;把"Agent 能访问什么"当成和"电脑装了哪台内网机器"同级的合规问题。

七、接下来盯什么

四个继续观察的信号:① 四大厂商是否确认并回应 Skills 更新缺陷、给出补丁时间表;② 中转站事件后续是否引发国内企业级采购政策变化(已有法务圈在讨论"影子 IT 入刑边界");③ 各家 Agent 是否把"默认确认"提回产品默认值——如果"更省心"继续跑赢"更安全",下一张账单只是时间问题;④ libheif 这类"单人维护的基础库"会不会成为 AI 攻防里下一个被点名的大动脉。

这周的五条线里有两条还停留在"媒体转述+个人实测",等官方口径落地再下结论不迟。但 9/11 和 9/18 的三件实锤已经够回答一个问题了:你的 Agent 越能干,你借给它的权限就越值钱——区别只在于,定价的人是你,还是别人。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章