思考块被验了签名:这波"蒸馏断奶",切掉的是哪条路,还剩哪几条路?

源自53位全网作者

05:56

9月的第一周,"蒸馏"这个词从 arXiv 和炼丹论坛一路爬进了外交部记者会。

  • 9月1日前后,Anthropic 发布 Claude Fable 5.1 与 Mythos 5.1,8 项公开基准全部第一;随发布落地的,是一串被社区称为"史上最严"的反蒸馏 API 改动。知乎

  • 9月7日前后,GPT-6 刷屏:按发布方展示,超过 10 万块 GPU 参与训练,Astra 版本的部分推理直接在隐含层完成,连 OpenAI 自己都解不出完整 CoT。微博

  • 9月8日,美国 FBI、NSA、CISA 三家政府机构联合发布公告,指责 DeepSeek、月之暗面、阿里巴巴、MiniMax、阶跃星辰、智谱六家中国 AI 企业,至少自 2024 年起通过"大规模蒸馏"提取美国模型的专有能力,点名涉及的美国模型包括 Claude、ChatGPT、Gemini 和 Grok。小红书

  • 9月9日,商务部回应:所谓"工业规模"蒸馏指控"于事无凭、于法无据",若以打击蒸馏为名进一步遏压,中方将坚决反制。

看热闹的人吵"是不是抄袭",而真正在训模型的人关心另一件事:教师模型的"过程数据"被锁了,自己的小模型数据管线,接下来靠什么重建?

一、9月1日到底改了什么:切的不是一切蒸馏,是一条非常具体的路

先把机制说清楚,这是全网吵成浆糊之后最稀缺的部分。

Fable 5.1 给每个思考块(thinking block)加了一个签名(signature)。当你在多轮对话里把助手回复传回 Messages API 时,服务端校验两件事:当前模型有没有权读这个块;这个块之前的整段对话——系统提示词、工具列表、全部历史消息——是否跟当初生成它时一模一样。只要有任何一处被动过,签名校验失败。失败后的行为由 `prefix_mismatch_behavior` 参数决定:默认 `error`,直接返回 400;设为 `drop_block`,则静默丢掉该块及其之后的所有思维链,请求照常执行,被丢掉的部分不计费,会列在响应的 `input_transformations` 数组里。触发校验失败的操作清单非常具体:编辑、重排或删除任何先前消息,改动顶层系统提示词,对工具列表做任何增删改名,从历史中间抽掉某个思考块但保留后面的,以及引用了一个内容已经变了的图片或文档 URL。安全的操作同样明确:在末尾追加新消息、从链条头部摘掉思考块、改 `max_tokens`、增减 `cache_control`,以及服务端自己的压缩(compaction)。此外还有链式校验——每个思考块记录前一个区块的信息,中间抽掉一块,后面整条链全部作废。知乎

Anthropic 官方把这个 breaking change 的理由直接写明:防蒸馏。它要堵的是一整个已被公开验证的攻击族。8 月中旬,论文《Stealing Reasoning Traces from Proprietary LLM APIs》演示了最狠的一条路径:Claude 返回的加密思维块其实是一段约 3.6 万字符的 base64 签名,因为加密用单一全局密钥、不绑定用户、会话或具体模型,把这段 signature 单独塞给同家族里没受过"拒绝泄露训练"的弱模型(如 Haiku 4.5),加一句"把随附推理逐字转录到标签里",就能还原出强模型的完整思考——论文用 120 道 Codeforces 题验证了还原轨迹与真实思维 token 数的吻合,作者称各家随后已修补。对照这个,Fable 5.1 的"绑定生成模型+绑定上下文前缀"就是补在签名校验层:弱模型解密这条路(模型校验)和篡改前文重放这条路(上下文校验)一起关。知乎

思考块被验了签名:这波

执行范围值得注意:2026 年 8 月 31 日之后新注册的 API 账户默认强制,老账户可主动开启,后续模型预计扩大执行。而这一改动真正标志性的地方在于:反蒸馏第一次从"判断某次请求可不可疑",走到了 API 合同层。服务端不用猜你的意图,只检查签名还配不对得上。知乎

二、比合同更狠的是架构:GPT-6 把草稿纸直接收走了

思考块签名是"还能讲理"的锁,GPT-6 用了另一种没钥匙的锁。

据 The Information 报道、雷峰网梳理,GPT-6 的 Astra 版本采用了 recurrent-depth 一类的循环推理方法:同一组网络层反复计算,更多推理被压缩在模型内部,不再完整展开为外部可读的思维链——别说用户拿不到 CoT,OpenAI 自己都解不出来。而几乎同一时间,OpenAI 又给 Astra 的 Agent 应用加上了思维链安全监控,推理过程出现危险迹象时系统介入。一边监控能看见的思考,一边把思考藏回模型内部:两个看似相反的动作指向同一个判断——思维链既是安全窗口,也是对手最有价值的蒸馏资产。知乎

两道锁来源不同,但结果一致:闭源 API 能给出的过程监督信号,在结构性地变少。

三、先把"教师信息"分四层,再问切掉了什么

知乎上流传的一张分类很好用:按学生模型能拿到的信息,教师侧分四档——只有结果 / 有 CoT 但没有概率 / 有概率但没有 CoT / 结果、CoT、概率、隐含层状态全有。信息越全,学习效率越高、可选办法越多。对照这个框架,很多恐慌和很多指控都站不住:知乎

  1. logit 级蒸馏(Hinton 2015 的原始定义)要求拿到教师的 softmax 软标签、模型架构还要兼容——闭源 API 从来不发 logits,各家 tokenizer 和架构也完全不同。六家公司被指控的"蒸馏",在技术定义上根本不是这个。

  2. 真正常发生的是 sequence 级"收集样本":拿教师的输出序列当自己的监督信号。这是业界公开手段,美国公司把大模型压进手机端也在用,他们自己还因为收集训练样本被传统行业起诉。微博

  3. 9月1日切的,是"有 CoT 但没有概率"这一档里最肥的一半:被篡改前文后仍然可以榨出来的原始推理。最终答案和可见推理摘要,照旧可以正常获得。

所以"彻底切断蒸馏后路"这个说法,被知乎另一位答主精准卡住了语义:它堵死的是思考块重放攻击,不是所有推理蒸馏。证据和结论的边界,就在这。

四、断奶之后,小模型数据管线还剩哪些路

按"教师信号还剩多少"来排,2026 年 9 月之后的可选项其实是这些:

路线

教师信号形态

现状与约束

开放权重教师 + 两段式蒸馏

结果+CoT+概率全有,可做真正的 on-policy

Qwen3 旗舰报告已写明"off-policy+on-policy 两段式";GLM-5.3、DeepSeek V4 等开源系谱追得够快,"教师权限"反而由开源接管

黑盒输出 + 轨迹重建

只有结果和可见摘要

用题目+答案+摘要让另一个模型重建可训练的推理轨迹;监督信号不需要是原模型逐 token 的真实思考

Logit-Free on-policy 蒸馏

无 logits

B站知识蒸馏系列更到 OmniOPD 这类"不限教师来源"的工作,2026 年社区密集推进,专门吃闭源黑盒

自蒸馏/去老师化

没有外部教师

OPSD(On-Policy Self-Distillation)、无监督自蒸馏等"从噪声老师到自我进化"路线,8-9 月讨论度陡增

在线任务合成

环境当教师

微软研究院蒙特利尔的 FrogNano:4B 代码模型,不靠大模型蒸馏,任务难度动态匹配模型能力在线合成训练数据,打进 SWE-bench 前列

可验证奖励自博弈

对错当教师

收集几十万真实编程样例、用小模型注入 bug、让模型修,修对即 true——省去人工标注的 RLVR 玩法,本质是用可验证环境替代教师

人工过程数据

人当教师

前沿实验室自己的老办法:《Let’s Verify Step by Step》直接雇人标过程数据,GDPval 评测全靠人类专家,AI4Science 主打 PhD 级标注

思考块被验了签名:这波

这张表真正该读出的一句话是:断奶不是"训练小模型不行了",是"白嫖过程监督"不行了。雷峰网采访的投资人给过一个"蒸馏税"模型:封锁做不到绝对,但能把对手的复制成本从自身研发成本的 20%,一路抬到 50%、70%——只有当蒸馏成本超过独立训练成本的 100%,对手才会放弃捷径。同篇报道里还有两个判断:如果没有蒸馏,国内模型与海外前沿的差距可能扩大到 18 个月,独立训练成本可能是蒸馏的 6~10 倍(这是受访者的估计,不是测量值)。知乎

开放权重这一侧,Qwen3 旗舰报告已把两段式蒸馏写进正文,开源系谱成了现在唯一还发得出完整教师信号的来源。数据端同理:EvoLM 的消融显示,持续预训练里通用网页数据和领域数学数据的配比稍一失衡,下游准确率就从 21.01 掉回 16.21。教师给不出的那部分"过程",最终都要在数据配比、评测集和标注预算上一笔笔补回来。大模型现阶段主要是工程问题,关键在成本和效果的权衡;账算不清,训练就是玄学。过去蒸馏之所以香,是因为它把昂贵的过程标注变成近乎免费,现在这个窗口在关,数据账迟早要自己算。知乎知乎知乎

思考块被验了签名:这波

五、“蒸馏=抄袭”?把事实、观点和证据强度分开

这场争议的节奏值得完整看一遍。今年 2 月,Anthropic 率先指控 DeepSeek、月之暗面、MiniMax 发动"工业级蒸馏攻击"——1600 万次请求、上万个虚假账户。4 月 24 日,DeepSeek V4 预览版发布(全球首个深度针对昇腾优化、脱离 CUDA 体系的前沿模型),同日美国国务院向全球各国使馆发出外交电报指控中国大模型"抄袭"。7 月有 PDF 报告点名 Kimi 等国内大模型搞蒸馏,随即被网友逐条分析反驳。9 月 8 日,FBI/NSA/CISA 三部门公告把企业行为升级成了政府叙事。微博微博知乎

中方回应也很明确:商务部 9 日回应"于事无凭、于法无据",并警告若以打击蒸馏为名进一步遏压将坚决反制;外交部同日表态中美都是 AI 大国、应加强合作。小红书

技术侧的证据要分层看。8 月那篇"偷轨迹"论文的附录里,作者用四条统计证据讨论了部分开源模型(点名了 Kimi、GLM 的特定版本)与前沿模型推理文本的异常亲和:仅用 1% 的 Opus 推理做预填充,目标的可见回答与 Opus 的 n-gram 重叠在 29/30 题上上升;开源模型对某些前沿模型推理文本的建模困惑度异常低,提取成本低 4-6 个数量级;风格分类器区分度下降;推理长度显著压缩。热力图长这样——行是推理轨迹来源,列是打分模型,对角线以外的低困惑度格是争议所在:知乎

思考块被验了签名:这波

但注意三点。其一,这些是"与曾经暴露于教师输出一致"的相关性证据,不是训练日志,作者自己的表述留有余地,社区对同一数据的反驳也已经出现过。其二,美国内部口径并不一致:有研究人员承认蒸馏或许在竞赛早期帮中国企业提过效率、但解释不了近期进展,法律专家也承认单一"收集样本"行为很难认定侵权。其三,被点名的六家覆盖了从创业公司到电商巨头的整个梯队,公告更像立法前的舆论铺垫。对普通读者的判断是:技术名词正在被武器化,看到"蒸馏"两个字时,先问对方指的是 logit、序列样本、还是可验证环境;看到"实锤"时,先问证据是相关还是因果。真正需要警惕的下一步,是政策把"收集样本"变成制裁标的——那对合规敏感的企业团队,影响会比任何 API 改动来得都快。小红书

六、先红的是你的 Agent 框架:一份迁移清单

在安全叙事之前,最先到账的成本是工程故障。主流 Agent 框架的常规操作——长会话里重写旧消息、替换 system prompt、动态增删工具、把前几十轮压成摘要后继续塞回原来的思考块——以前只是缓存失效,现在在 Fable 5.1 新账户上直接 400。

迁移清单:把会话历史当追加日志,已发送的 system、tools、messages 不再原地修改,思考块原样保存。需要压缩时,用新摘要开一段历史,不要把旧思考块拼回改写后的前文。兼容旧框架的过渡方案是启用 `drop_block`,同时记录 `input_transformations`,先看清哪些块在悄悄失效。还要留意测试账户偏差——拿一个用了很久的老账户测一切正常,新注册用户却在不断收 400,框架作者该把这个坑补上。知乎

价格侧还有另一面:Fable 5.1 把缓存读取打到 $0.25/百万 token(降 75%),典型工作负载成本约降 25%,高度智能体化的任务最多省 45%。教师调用变便宜了,但不再附赠"思考"——这是炼丹成本账的新常态。知乎

七、不同类型的人,这周该做的决定不一样

  • 个人炼丹党/学生组:先别慌,切的是签名转录和重放攻击,不是正常收样本;但靠"篡改前文的 CoT 拼接"洗数据的做法立刻停,转向开放权重教师或可验证自博弈。

  • 垂直小模型团队:把数据管线从闭源 API 迁到开放权重模型+在线任务合成,给评测集和必要的人工过程数据留预算,蒸馏成本账按"20%→50%→70%"的阶梯重新做敏感性。

  • 企业 Agent 团队:本周先排查 400,迁移成本比蒸馏之争更急。

  • 追更吃瓜的:盯四个信号——签名校验是否扩展到老账户和后续模型;GPT-6 式"隐含层推理"会不会成为前沿标配;"蒸馏"是否被政策具体化为制裁标的;论文那四条相关证据,接下来是被复现、被修补,还是被证伪。

蒸馏的"断奶",断的不是小模型的活路,断的是把教师草稿纸拆下来就用的免费午餐。下一批小模型的能力,会更诚实地来自它自己的数据账——账算得越清,训得越稳。

内容由AI生成

精选参考来源

1. Claude最强Fable 5.1发布!8项屠榜,最高降价45%,反蒸馏机制上线

2. GPT-6。这玩意儿刷屏了。OpenAI说这是“当今世界上最智能、最均衡的模型”。俺看了下,两个亮点。3D/CAD空间能力炸裂,AI能处理3D空间建模,这对3D扫描仪、3D打印机、工业设计软件这些方向有直接催化。二,用了超过10万块GPU训练。你品品,10万块GPU是什么概念?算力还是大模型的决定性因素,没有之一。#A股#

3. 美国指责中国AI“蒸馏”,商务部回应

4. 怎么看 Claude Fable 5.1 修改Messages API 的反蒸馏?

5. Anthropic轨迹是如何被破解的

6. 大厂打响「反蒸馏战」:中国AI会被拉开18个月代差吗?

7. Fable5.1 改写 API 彻底切断大模型蒸馏后路,此举将如何改变 AI 模型开发生态?

8. 想明白了大模型蒸馏的问题,现在的原理已经是聪明地收集少量训练样本,而不是能力复制最近美国密集指责中国头部大模型抄袭,用的说法就是“蒸馏”。这个名词有些晦涩,到底是不是某种程度的抄袭,不好理解。蒸馏,英文distillation。用大白话说,就是有个能力强的“教师模型”,有个能力弱的“学生模型”,通常规模也要小不少。这个学生模型本来是要自己找样本组织训练的,但现在方便了,直接让教师模型来产生海量输出就能训练了。训完了,一些看上去很强的能力,就从教师模型转移到学生模型上了,当然学生超不过教师,会有各种隐患。最开始是图灵奖得主辛顿2015年的蒸馏论文,讲的是logit-level 蒸馏,就是模型架构也需要“兼容”,才能搞蒸馏训练。学生拿到教师的“软标签”(softmax 概率分布),学到教师对每个token的"置信度结构"。这需要访问模型内部,权重结构要兼容。中国大模型是开源的,架构显然和美国大模型不一样,参数规模、tokenizer、训练数据管道都是自搞一套。也拿不到美国模型的最终输出概率分布,根本不可能是严格意义上的logit蒸馏。现在新闻里说“蒸馏”,根本不是能力转移,而是收集训练样本。中国公司访问美国大模型,就有几百万、上千万个反馈。处理后会是不错的训练样本,能帮提升模型能力。但这只是训练样本中很少的一部分,绝大多数预训练、后训练都是各家公司自己组织的。从别人的模型里处理出一些训练样本,是业界公开的秘密。概念上这叫sequence-level distillation。学生不接触教师内部,只看教师的输出序列,用这些输出做自己的监督信号。但这和logit-level 蒸馏的“全面复制”明显不一样,有个比例问题。如果学生模型绝大部分样例都是教师模型的输出序列,就几乎没有自己开发的,水平高不到哪去,名声也不好。现在情况是,中国大模型只用一点美国大模型的输出序列引导下,主要是自己组织的训练样本、后训练绝活,能力超过美国大模型完全可能。在一些局部指标上,已经有这样的现象发生。这既不是logit-level 蒸馏,也不是10年前说的低效sequence-level distillation,技术进步了非常多。最典型的,就是编程能力的提升。马斯克xAI最近能力提升很快,Grok 4.6是个突破。据说原因是600亿美元收购了Cursor,但全是拿SpaceX股票换的,这就是炒高股价的意义。用Cursor 开发的人每天写下约1.5 亿行代码,喂给Grok训练编程能力,这就是交易的核心逻辑。交割仅两周后,OpenAI 宣布终止向 Cursor 提供模型服务,就是怕编程能力泄露。中国公司没这么多钱,那如何学习美国大模型的编程能力?技术有意思的地方就在这,不需要太多sequence-level distillation。要优雅得多,原理是DeepSeek R1论文提出的自学习训练,用到编程上了。具体办法是,收集几十万个实际编程样例(这很容易),用个小模型往里随机加bug(模仿出错的人类程序员)。中国模型一开始没法改对,能力弱一些。让美国大模型来修这些bug,就留下了一些中间输出、最终输出。关键是,这种训练样本非常简单,修好了就是true,修不好就是false。这省去了麻烦的人工标注,而且这种简单样本,就能通过DeepSeek R1的自学习训练,把编程能力也训练好。技术上,这和原始论文里的蒸馏差异非常大了。概念上,应该说就是收集样本,只是许多种收集样本手段中的一种。而美国大模型公司收集样本的手段,被很多传统公司告了。说成蒸馏,是一种宣传,暗示中国公司没什么技术,就是复制美国大模型的能力。如果说是收集样本,攻击力就不足。实际中国公司的能力非常强,技术创新得到了业界认可,核心技术绝对不是蒸馏或者收集样本,钱不多算力少会想办法是真的。中国大模型高性价比威胁美国大模型的“钱景”,是最真实。

9. 【文/观察者网专栏作者 关心】最近,美国人工智能巨头Anthropic公开指控DeepSeek等三家中国AI企业,在科技圈掀起了不小的波澜。这家美国企业声称,DeepSeek、月之暗面和MiniMax三家中国AI企业对其旗舰模型Claude发动了所谓“工业级蒸馏攻击”,用1600万次请求、上万个虚假账户,系统性地“抽取”模型能力。消息一出,迅速占领了各大科技媒体的头条。首先值得注意的是,Anthropic公司先是上周对美国国会提交了备忘录,本周一又在其官方博客重复了相同的指控,其炒作意图十分明显,且超出了一般的商业竞争,而是试图上升到政治层面阻挠中国AI企业的发展。“蒸馏”是将大参数模型迁移到小模型的常用技术,更类似于模仿学习,而非抄袭或者搬运。Anthropic将蒸馏技术污名化,试图抹黑中国竞品,给自己脸上“贴金”。其声明文章越看越不像安全报告,倒更像一份精心包装的产品宣传册。Anthropic公司特意强调,这三家实验室专挑Claude“最具差异化的能力”下手,比如代理推理、工具使用、编程。这是在指控,还是在向潜在客户喊话“我们的模型强到对手只能靠偷”?他们还绘声绘色地描述,MiniMax在他们发布新模型后“24小时内”就把近一半流量转向最新系统。这故事讲的是对手不择手段,还是想炫耀“我们的迭代太快,对手必须实时追踪”?他们在声明中展示的监控能力,更让人细思极恐。他们说,能通过分析请求元数据,把某些账户追溯到“DeepSeek实验室的特定研究人员”;能根据调用模式,推断出对方尚未公开的产品发布计划。这意味着什么?意味着当你使用Claude的时候,你的问题、你的思维习惯、你的研究方向、你的工作计划,全都在向Anthropic交底。所有人们对私有AI模型最深的恐惧,不管是数据被监控、行为被分析、还是隐私无从保障,在这份声明里,全都得到了印证。当然,最讽刺的还不止这些。埃隆·马斯克第一时间跳出来开火:你们Anthropic当年不也是靠“侵权”用海量数据训练出来的吗?这话虽然火药味十足,却戳中了整个行业的痛处。回旋镖打到自己,Claude和所有大语言模型一样,是靠扫描互联网上的书籍、论文、新闻、博客长大的,里面有多少是未经授权的版权内容?《纽约时报》在告OpenAI,图库公司Getty Images在告Stable Diffusion,背后大家都在谈同一个问题:大模型时代的“知识抽取”,早就以更大规模发生了,只不过被抽取的对象是整个人类文明的数字遗产。这一点也引发了全球AI圈同仇敌忾的群嘲,真是适得其反。Anthropic指责对手从Claude身上“偷”能力,却对自己从整个互联网“拿”知识的历史闭口不谈。他们强调蒸馏出来的模型缺乏“安全护栏”会带来风险,却没解释凭什么只有他们有权定义什么是“必要的护栏”。这种双重标准,说到底就是这样的霸权逻辑:规则由最强者制定,强者的行为是惯例,弱者的行为是攻击。有意思的是,Anthropic本想通过这份声明打击对手,却无意间成了开源AI最有力的广告。他们用自己的行为向所有人证明:在闭源AI服务的架构下,你的隐私、你的自主权、你的知情权,都是无法保障的。当一家公司可以随时以“安全”的名义监控你、评判你、惩罚你,所谓的“信任”就不再是一种美德,而是一种风险。Anthropic创始人和CEO达里奥·阿莫迪曾经在百度短暂工作过,如今却成了人工智能行业最反华的角色。阿莫迪曾多次呼吁对华实施算力管控,去年9月,Anthropic公司在文件中将中国列为“敌对国家”,断然封禁对中资企业的服务。这也使得清华物理天才姚顺宇愤然离职Anthropic,转投谷歌。把商业竞争包装成国家安全,这招看似精明,其实危险。它暗示只有特定国家的公司有资格开发强大的AI,其他国家只能用“安全阉割版”。想展示实力,结果暴露了自己。真正需要被拷问的,并不是那些蒸馏技术,而是人们对闭源AI系统越来越深的不信任。

10. 【DeepSeek首次基于华为芯片训练!美国当天就坐不住了:指控中国大模型“抄袭”】上周五(24日),DeepSeek正式发布V4大模型预览版。这是全球首个主要针对华为昇腾AI处理器深度优化的前沿大模型,全程脱离NVIDIA CUDA体系。而就在同一天,美国国务院已向全球各国大使馆发出外交电报,指示其工作人员警告外国政府,指控DeepSeek和其他中国人工智能公司“涉嫌窃取知识产权”。DeepSeek V4参数规模达1.6万亿,上下文窗口达100万token,分为Pro与Flash两个版本。Pro版输出定价每百万token 24元,Flash版仅2元,远低于GPT-5.4、Claude Opus4.6等海外闭源模型。官方表示,DeepSeek V4 Pro性能比肩顶级闭源模型。此次发布最大突破是彻底切换算力底座。DeepSeek上一代V3依赖2048张NVIDIA H800训练,曾被调查涉嫌通过第三方采购受限芯片。V4全程采用华为昇腾芯片训练,华为确认昇腾全系列超节点与最新950系列实现首日兼容。DeepSeek透露,下半年昇腾950超节点批量上市后后,Pro版价格有望进一步下调。据知情人士透露,DeepSeek发布V4之前,没有向美国芯片公司NVIDIA和AMD提供模型早期访问权限,而是率先让中国企业华为提前数周开展软件适配优化工作。“breaking from standard industry practice(打破行业惯例)。”报道中如此形容这一事件。毕竟,这是此前无论中国公司还是外国公司的大模型,都没有采用过的方式。早在去年8月,DeepSeek V3.1就支持了UE8M0 FP8 Scale参数精度,并特别表示这一数据格式是针对即将发布的下一代国产芯片设计,为脱离CUDA生态埋下伏笔。据悉,DeepSeekV4发布当天,美国国务院向全球使馆发送外交电报。美方要求驻外人员提醒各国,提防DeepSeek、月之暗面、MiniMax等企业“窃取并蒸馏美国AI模型”。白宫此前也发布备忘录,指责中方开展工业化规模模型蒸馏。OpenAI与Anthropic早前均指控过DeepSeek涉嫌蒸馏其模型。“不诱于誉,不恐于诽,率道而行,端然正己。”DeepSeek在官方新闻稿中表示。“感谢每一位用户的信任与支持,大家的肯定、建议和期许,是我们不竭探索、持续进步的动力,也让我们始终坚守初心,专注于不懈的创新。我们将始终秉持长期主义的原则理念,在尝试与思考中踏实前行,努力向实现AGI的目标不断靠近。”NVIDIA CEO黄仁勋曾公开警告,DeepSeek若在华为芯片上完成首发,意味着AI模型有望在美国技术架构之外实现最优运行。如果这款模型针对华为架构完成专属优化,会直接让美国在全球AI竞争中落入劣势,这对美国是重大损失。DeepSeek首次基于华为芯片训练!美国当天就坐不住了:指控中国大模型“抄袭”

11. 【概念讲解】Off-Policy + On-Policy 两段式蒸馏

12. EvoLM :大模型的训练的每个阶段:Pre train → CPT → SFT → RL每都做了啥?

13. 如何看待网传 pdf 抨击 Kimi 等国内大模型蒸馏但被网友分析反驳?真实性如何?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章