当前位置:
AIGC文章详情

大厂加密思维链被小模型背出来了:Snyk 参与的这篇论文,从公开日志里挖出 704 个泄密凭证

源自27位全网作者

14:57

如果你对 Snyk 的印象还停留在"扫开源依赖漏洞的那个工具",那它今年下半年这波操作,可能会让你重新认识它。它和马普所智能系统研究所、ELLIS 研究所等机构联名发了一篇 116 页的安全论文,直接把 OpenAI、Anthropic、Google 三家小心翼翼藏起来的"加密思维链"给读了出来。36氪顺带,团队从几千份公开日志里挖出了 704 个高危敏感凭据。知乎

这件事值得拆成三层看:洞是什么、泄了什么、以及你自己的习惯要改什么。

不是密码学失败了,是这层"加密"本来就不是保护你的

先交代背景。为了防止竞争对手蒸馏自家模型,大厂不把推理模型的完整思考链存在服务器,而是加密成一个"不透明数据块"发给客户端,下一轮对话再由客户端原样带回。表面上这串密文谁也读不懂,于是很多开发者默认它是安全的,把它写进日志、传进测试集、贴上 GitHub。

问题就出在这。论文《Stealing Reasoning Traces from Proprietary LLM APIs》(arXiv:2608.09867)指出:服务端只校验"这个加密块是我发的、没被篡改",却不校验它属于哪个用户、哪个会话、哪个模型。换句话说,它像一个没有绑定身份和生命周期的无状态令牌,谁拿到都能用。

于是攻击路径简单得有点荒谬:拿一段 Opus 4.8 这类强模型签发的加密思考块,喂给同厂更便宜、对齐更松的小模型(比如 Haiku 4.5、o4-mini),配一句越狱提示,小模型就会把强模型的完整思考过程用明文"背"出来。论文管这些小模型叫"模糊解码器"——它不做密码分析,它只是在同厂模型共享的"母语"里把内容念了出来。

大厂加密思维链被小模型背出来了:Snyk 参与的这篇论文,从公开日志里挖出 704 个泄密凭证

为排除"小模型在现编",研究者把恢复出的明文长度和 API 账单里实际计费的 thinking token 数对比,Anthropic、OpenAI、Google 三家大多数样本都紧贴 y=x 线。成本也低得离谱:按 Haiku 4.5 的定价,解码一万条完整思维链大约 720 美元。36氪

按论文列出的跨模型重放矩阵,除了 Anthropic 的 Fable 5,Claude 系、GPT-5.6 系、Gemini 系基本都能从低端读到高端。

大厂加密思维链被小模型背出来了:Snyk 参与的这篇论文,从公开日志里挖出 704 个泄密凭证

泄的不是模型秘密,是你的钥匙

如果说"思维链被看光"还只是大厂自己的麻烦(防蒸馏失效),那第二层才是让开发者后背发凉的地方。

团队扫描了 GitHub 和 Hugging Face 上 6708 份公开的 Agent 与调试日志,重构出 31.5 万个加密思考块,从中挖出几百个还能用的敏感凭证:62 个高权限生产 API Key、33 个明文密码、24 个 Access Token、30 个私人邮箱。36氪更扎心的细节是:有些凭证在可见对话里已经被开发者手动抹掉了,但在模型隐藏的思考过程里,这些字符串被原样引用、复述,完整保存在那块"以为安全"的加密块里。知乎

论文给的示例中,一条 GPT-5.2 Codex 的推理日志解密后直接吐出了 AWS Secret 和 HuggingFace Token;另一条 Claude Sonnet 4.6 的日志里,是完整的护照号、信用卡号和 CVV。也就是说,你在对话窗口里删掉的东西,没删干净——它活在思维链里。

大厂加密思维链被小模型背出来了:Snyk 参与的这篇论文,从公开日志里挖出 704 个泄密凭证

"蒸馏悬案"那部分,建议持保留态度

论文的第三层是传播最广、也最该谨慎对待的:用同样的方法,研究者发现 Kimi-K3 逐字复现 Opus 4.8 推理的理论查询成本,比 DeepSeek-V4-Flash、Inkling 等对照模型低了 4 到 6 个数量级;只注入 1% 的 Opus 推理前缀,Kimi-K3 的回答风格也会明显向 Claude 漂移,GLM-5.2 有类似的定向漂移,而 DeepSeek-V3.1 保持稳定。

大厂加密思维链被小模型背出来了:Snyk 参与的这篇论文,从公开日志里挖出 704 个泄密凭证

这些数据确实像留在模型权重里的"数据指纹"。但论文自己也强调:这只能证明异常的行为兼容性,不能反推训练数据来源,更不能直接给谁定罪。这一层,当作谈资和观察线索可以,当作结论不行。

为什么是 Snyk?这其实是它 2026 年的主线

很多人的意外在于:Snyk 不是扫依赖的吗,怎么研究起 API 加密了?Snyk 平台快速发现并修复专有代码、开源依赖、容器映像和云基础设施中的安全问题,这是它的基本盘。小红书

把它今年的动作串起来就清楚了:年初它发布 Agent Skill 安全研究,基于数百个 Skill 的人工审查总结了八类风险,做进了 MCP-scan 扫描引擎。知乎这次又把视线推到了模型厂商的 API 层。再加上对外招聘里出现 agentic 方向的团队——Snyk 在做的,是把"软件供应链安全"的坐标系,扩成"AI 供应链与 AI 运行时安全"。依赖里的漏洞它扫,AI 时代的插件和 Skill 它扫,如今 AI 产出的推理日志,它也研究。

对 Snyk 用户的直接信号是:这家公司的安全情报重心,正在从 CVE 列表扩展到推理痕迹这类 AI 相关泄露。它会不会把这次研究产品化成"日志/推理痕迹泄露检测",值得继续观察。

洞在补,但你传上去的东西收不回来

最后说和你最有关的部分。按 8 月中旬安全媒体的说法,三家已经对这个重放洞做了修复,并给出了开发者侧的处置建议。微博但要清楚一件事:修复 API 只意味着新的加密块不再被随意重放,而那些已经发在 GitHub、贴在 Issue、传上 Stack Overflow 的日志,收不回来。加密块还躺在那,谁拿到都还能试着解码。

所以行动清单很具体:

  1. 搜:翻自己的公开仓库、Issue、博客和分享过的调试包,找 reasoning、encrypted_content、signature 这类字段,以及 Codex、Claude Code 的完整 trace。

  2. 轮换:凡是命中日志里出现过的 API Key、密码、Token,一律按已泄露处理,全部轮换。

  3. 改习惯:调用侧剥离 reasoning 字段,别把思维痕迹写进日志和持久化,贴社区前先脱敏。

  4. 对团队:把"加密 CoT"当敏感数据纳入零信任范围,“加密"不等于"可以安全存储和传输”。

接下来值得盯的信号:三家是否出官方修复说明、加密块是否加生命周期绑定;社区是否出现更多同类扫描结果;以及 Snyk 会不会把这篇研究变成产品化的扫描能力。这三件事落地任何一件,这篇论文对行业的冲击都才刚刚开始。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章