9月的第一周,"蒸馏"这个词从 arXiv 和炼丹论坛一路爬进了外交部记者会。
9月1日前后,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,8 项公开基准全部第一;随发布落地的,是一串被社区称为"史上最严"的反蒸馏 API 改动。知乎
9月7日前后,GPT-6 刷屏:按发布方展示,超过 10 万块 GPU 参与训练,Astra 版本的部分推理直接在隐含层完成,连 OpenAI 自己都解不出完整 CoT。微博
9月8日,美国 FBI、NSA、CISA 三家政府机构联合发布公告,指责 DeepSeek、月之暗面、阿里巴巴、MiniMax、阶跃星辰、智谱六家中国 AI 企业,至少自 2024 年起通过"大规模蒸馏"提取美国模型的专有能力,点名涉及的美国模型包括 Claude、ChatGPT、Gemini 和 Grok。小红书
9月9日,商务部回应:所谓"工业规模"蒸馏指控"于事无凭、于法无据",若以打击蒸馏为名进一步遏压,中方将坚决反制。
看热闹的人吵"是不是抄袭",而真正在训模型的人关心另一件事:教师模型的"过程数据"被锁了,自己的小模型数据管线,接下来靠什么重建?
一、9月1日到底改了什么:切的不是一切蒸馏,是一条非常具体的路
先把机制说清楚,这是全网吵成浆糊之后最稀缺的部分。
Fable 5.1 给每个思考块(thinking block)加了一个签名(signature)。当你在多轮对话里把助手回复传回 Messages API 时,服务端校验两件事:当前模型有没有权读这个块;这个块之前的整段对话——系统提示词、工具列表、全部历史消息——是否跟当初生成它时一模一样。只要有任何一处被动过,签名校验失败。失败后的行为由 `prefix_mismatch_behavior` 参数决定:默认 `error`,直接返回 400;设为 `drop_block`,则静默丢掉该块及其之后的所有思维链,请求照常执行,被丢掉的部分不计费,会列在响应的 `input_transformations` 数组里。触发校验失败的操作清单非常具体:编辑、重排或删除任何先前消息,改动顶层系统提示词,对工具列表做任何增删改名,从历史中间抽掉某个思考块但保留后面的,以及引用了一个内容已经变了的图片或文档 URL。安全的操作同样明确:在末尾追加新消息、从链条头部摘掉思考块、改 `max_tokens`、增减 `cache_control`,以及服务端自己的压缩(compaction)。此外还有链式校验——每个思考块记录前一个区块的信息,中间抽掉一块,后面整条链全部作废。知乎
Anthropic 官方把这个 breaking change 的理由直接写明:防蒸馏。它要堵的是一整个已被公开验证的攻击族。8 月中旬,论文《Stealing Reasoning Traces from Proprietary LLM APIs》演示了最狠的一条路径:Claude 返回的加密思维块其实是一段约 3.6 万字符的 base64 签名,因为加密用单一全局密钥、不绑定用户、会话或具体模型,把这段 signature 单独塞给同家族里没受过"拒绝泄露训练"的弱模型(如 Haiku 4.5),加一句"把随附推理逐字转录到标签里",就能还原出强模型的完整思考——论文用 120 道 Codeforces 题验证了还原轨迹与真实思维 token 数的吻合,作者称各家随后已修补。对照这个,Fable 5.1 的"绑定生成模型+绑定上下文前缀"就是补在签名校验层:弱模型解密这条路(模型校验)和篡改前文重放这条路(上下文校验)一起关。知乎

执行范围值得注意:2026 年 8 月 31 日之后新注册的 API 账户默认强制,老账户可主动开启,后续模型预计扩大执行。而这一改动真正标志性的地方在于:反蒸馏第一次从"判断某次请求可不可疑",走到了 API 合同层。服务端不用猜你的意图,只检查签名还配不对得上。知乎
二、比合同更狠的是架构:GPT-6 把草稿纸直接收走了
思考块签名是"还能讲理"的锁,GPT-6 用了另一种没钥匙的锁。
据 The Information 报道、雷峰网梳理,GPT-6 的 Astra 版本采用了 recurrent-depth 一类的循环推理方法:同一组网络层反复计算,更多推理被压缩在模型内部,不再完整展开为外部可读的思维链——别说用户拿不到 CoT,OpenAI 自己都解不出来。而几乎同一时间,OpenAI 又给 Astra 的 Agent 应用加上了思维链安全监控,推理过程出现危险迹象时系统介入。一边监控能看见的思考,一边把思考藏回模型内部:两个看似相反的动作指向同一个判断——思维链既是安全窗口,也是对手最有价值的蒸馏资产。知乎
两道锁来源不同,但结果一致:闭源 API 能给出的过程监督信号,在结构性地变少。
三、先把"教师信息"分四层,再问切掉了什么
知乎上流传的一张分类很好用:按学生模型能拿到的信息,教师侧分四档——只有结果 / 有 CoT 但没有概率 / 有概率但没有 CoT / 结果、CoT、概率、隐含层状态全有。信息越全,学习效率越高、可选办法越多。对照这个框架,很多恐慌和很多指控都站不住:知乎
logit 级蒸馏(Hinton 2015 的原始定义)要求拿到教师的 softmax 软标签、模型架构还要兼容——闭源 API 从来不发 logits,各家 tokenizer 和架构也完全不同。六家公司被指控的"蒸馏",在技术定义上根本不是这个。
真正常发生的是 sequence 级"收集样本":拿教师的输出序列当自己的监督信号。这是业界公开手段,美国公司把大模型压进手机端也在用,他们自己还因为收集训练样本被传统行业起诉。微博
9月1日切的,是"有 CoT 但没有概率"这一档里最肥的一半:被篡改前文后仍然可以榨出来的原始推理。最终答案和可见推理摘要,照旧可以正常获得。
所以"彻底切断蒸馏后路"这个说法,被知乎另一位答主精准卡住了语义:它堵死的是思考块重放攻击,不是所有推理蒸馏。证据和结论的边界,就在这。
四、断奶之后,小模型数据管线还剩哪些路
按"教师信号还剩多少"来排,2026 年 9 月之后的可选项其实是这些:
路线 | 教师信号形态 | 现状与约束 |
|---|---|---|
开放权重教师 + 两段式蒸馏 | 结果+CoT+概率全有,可做真正的 on-policy | Qwen3 旗舰报告已写明"off-policy+on-policy 两段式";GLM-5.3、DeepSeek V4 等开源系谱追得够快,"教师权限"反而由开源接管 |
黑盒输出 + 轨迹重建 | 只有结果和可见摘要 | 用题目+答案+摘要让另一个模型重建可训练的推理轨迹;监督信号不需要是原模型逐 token 的真实思考 |
Logit-Free on-policy 蒸馏 | 无 logits | B站知识蒸馏系列更到 OmniOPD 这类"不限教师来源"的工作,2026 年社区密集推进,专门吃闭源黑盒 |
自蒸馏/去老师化 | 没有外部教师 | OPSD(On-Policy Self-Distillation)、无监督自蒸馏等"从噪声老师到自我进化"路线,8-9 月讨论度陡增 |
在线任务合成 | 环境当教师 | 微软研究院蒙特利尔的 FrogNano:4B 代码模型,不靠大模型蒸馏,任务难度动态匹配模型能力在线合成训练数据,打进 SWE-bench 前列 |
可验证奖励自博弈 | 对错当教师 | 收集几十万真实编程样例、用小模型注入 bug、让模型修,修对即 true——省去人工标注的 RLVR 玩法,本质是用可验证环境替代教师 |
人工过程数据 | 人当教师 | 前沿实验室自己的老办法:《Let’s Verify Step by Step》直接雇人标过程数据,GDPval 评测全靠人类专家,AI4Science 主打 PhD 级标注 |

这张表真正该读出的一句话是:断奶不是"训练小模型不行了",是"白嫖过程监督"不行了。雷峰网采访的投资人给过一个"蒸馏税"模型:封锁做不到绝对,但能把对手的复制成本从自身研发成本的 20%,一路抬到 50%、70%——只有当蒸馏成本超过独立训练成本的 100%,对手才会放弃捷径。同篇报道里还有两个判断:如果没有蒸馏,国内模型与海外前沿的差距可能扩大到 18 个月,独立训练成本可能是蒸馏的 6~10 倍(这是受访者的估计,不是测量值)。知乎
开放权重这一侧,Qwen3 旗舰报告已把两段式蒸馏写进正文,开源系谱成了现在唯一还发得出完整教师信号的来源。数据端同理:EvoLM 的消融显示,持续预训练里通用网页数据和领域数学数据的配比稍一失衡,下游准确率就从 21.01 掉回 16.21。教师给不出的那部分"过程",最终都要在数据配比、评测集和标注预算上一笔笔补回来。大模型现阶段主要是工程问题,关键在成本和效果的权衡;账算不清,训练就是玄学。过去蒸馏之所以香,是因为它把昂贵的过程标注变成近乎免费,现在这个窗口在关,数据账迟早要自己算。知乎知乎知乎

五、“蒸馏=抄袭”?把事实、观点和证据强度分开
这场争议的节奏值得完整看一遍。今年 2 月,Anthropic 率先指控 DeepSeek、月之暗面、MiniMax 发动"工业级蒸馏攻击"——1600 万次请求、上万个虚假账户。4 月 24 日,DeepSeek V4 预览版发布(全球首个深度针对昇腾优化、脱离 CUDA 体系的前沿模型),同日美国国务院向全球各国使馆发出外交电报指控中国大模型"抄袭"。7 月有 PDF 报告点名 Kimi 等国内大模型搞蒸馏,随即被网友逐条分析反驳。9 月 8 日,FBI/NSA/CISA 三部门公告把企业行为升级成了政府叙事。微博微博知乎
中方回应也很明确:商务部 9 日回应"于事无凭、于法无据",并警告若以打击蒸馏为名进一步遏压将坚决反制;外交部同日表态中美都是 AI 大国、应加强合作。小红书
技术侧的证据要分层看。8 月那篇"偷轨迹"论文的附录里,作者用四条统计证据讨论了部分开源模型(点名了 Kimi、GLM 的特定版本)与前沿模型推理文本的异常亲和:仅用 1% 的 Opus 推理做预填充,目标的可见回答与 Opus 的 n-gram 重叠在 29/30 题上上升;开源模型对某些前沿模型推理文本的建模困惑度异常低,提取成本低 4-6 个数量级;风格分类器区分度下降;推理长度显著压缩。热力图长这样——行是推理轨迹来源,列是打分模型,对角线以外的低困惑度格是争议所在:知乎

但注意三点。其一,这些是"与曾经暴露于教师输出一致"的相关性证据,不是训练日志,作者自己的表述留有余地,社区对同一数据的反驳也已经出现过。其二,美国内部口径并不一致:有研究人员承认蒸馏或许在竞赛早期帮中国企业提过效率、但解释不了近期进展,法律专家也承认单一"收集样本"行为很难认定侵权。其三,被点名的六家覆盖了从创业公司到电商巨头的整个梯队,公告更像立法前的舆论铺垫。对普通读者的判断是:技术名词正在被武器化,看到"蒸馏"两个字时,先问对方指的是 logit、序列样本、还是可验证环境;看到"实锤"时,先问证据是相关还是因果。真正需要警惕的下一步,是政策把"收集样本"变成制裁标的——那对合规敏感的企业团队,影响会比任何 API 改动来得都快。小红书
六、先红的是你的 Agent 框架:一份迁移清单
在安全叙事之前,最先到账的成本是工程故障。主流 Agent 框架的常规操作——长会话里重写旧消息、替换 system prompt、动态增删工具、把前几十轮压成摘要后继续塞回原来的思考块——以前只是缓存失效,现在在 Fable 5.1 新账户上直接 400。
迁移清单:把会话历史当追加日志,已发送的 system、tools、messages 不再原地修改,思考块原样保存。需要压缩时,用新摘要开一段历史,不要把旧思考块拼回改写后的前文。兼容旧框架的过渡方案是启用 `drop_block`,同时记录 `input_transformations`,先看清哪些块在悄悄失效。还要留意测试账户偏差——拿一个用了很久的老账户测一切正常,新注册用户却在不断收 400,框架作者该把这个坑补上。知乎
价格侧还有另一面:Fable 5.1 把缓存读取打到 $0.25/百万 token(降 75%),典型工作负载成本约降 25%,高度智能体化的任务最多省 45%。教师调用变便宜了,但不再附赠"思考"——这是炼丹成本账的新常态。知乎
七、不同类型的人,这周该做的决定不一样
个人炼丹党/学生组:先别慌,切的是签名转录和重放攻击,不是正常收样本;但靠"篡改前文的 CoT 拼接"洗数据的做法立刻停,转向开放权重教师或可验证自博弈。
垂直小模型团队:把数据管线从闭源 API 迁到开放权重模型+在线任务合成,给评测集和必要的人工过程数据留预算,蒸馏成本账按"20%→50%→70%"的阶梯重新做敏感性。
企业 Agent 团队:本周先排查 400,迁移成本比蒸馏之争更急。
追更吃瓜的:盯四个信号——签名校验是否扩展到老账户和后续模型;GPT-6 式"隐含层推理"会不会成为前沿标配;"蒸馏"是否被政策具体化为制裁标的;论文那四条相关证据,接下来是被复现、被修补,还是被证伪。
蒸馏的"断奶",断的不是小模型的活路,断的是把教师草稿纸拆下来就用的免费午餐。下一批小模型的能力,会更诚实地来自它自己的数据账——账算得越清,训得越稳。