张一鸣说「宁可落后也不蒸馏」,同一周匿名PDF指控Kimi、GLM「抄袭」:这周三场蒸馏风波,站队前先分清事实、立场和流量

源自6位全网作者

03:46

这周 AI 圈就一个关键词:蒸馏。

三天之内,三件事接连炸出来:先是《The Information》爆料张一鸣在字节 Seed 全员会上罕见表态——「哪怕落后,字节也不走蒸馏这条捷径」;紧接着,一份匿名 PDF 在网上流传,直指 Kimi K3、GLM-5.2 是「蒸馏」Claude 和 GPT 蒸馏出来的,还附上了所谓证据;然后,一篇号称能用极低成本从闭源模型 API 里「套出」隐藏思维链的论文又被炒成了「百元蒸馏 Claude」。

评论区已经打起来了:有人说国产模型全靠抄,有人说张一鸣在立人设,还有人已经开始转发「教程」。但我越看越觉得,吵得最凶的这几拨人,其实根本没在聊同一件事。今天就把这三场风波拆开,帮你分清哪些是事实、哪些是立场、哪些纯粹是流量。

一、先把「蒸馏」讲明白:它真不等于抄袭

很多人一上来就给蒸馏定了性:抄。这是这轮争论里最大的误解。

知识蒸馏是个再正常不过的训练技术:让一个大而强的「教师模型」去指导一个小而快的「学生模型」,学生学的是教师的输出和解题思路。好处很实在——训练快、成本低、部署轻。你手机上跑的很多轻量模型,本质都是蒸馏产物。

关键在于,这行里人人都在用:

OpenAI 自己就用 GPT-4o、o1 当教师,训出了 GPT-4o mini。马斯克今年 5 月公开承认,xAI 训练时就部分蒸馏了 OpenAI。知乎而 Meta 则是另一个极端——内部明令禁止工程师把 Claude 生成的内容用进训练数据,有些团队甚至被要求暂停相关调用,就怕 Claude 的产出流进自家训练集。

所以你看,蒸馏本身是中性的,美国公司也在用、也在防。真正的争议点从来不是「蒸不蒸馏」,而是「有没有未经授权,去蒸馏竞争对手最贵的那个前沿模型」。把这两件事混为一谈,是这周所有争吵的源头。

张一鸣说「宁可落后也不蒸馏」,同一周匿名PDF指控Kimi、GLM「抄袭」:这周三场蒸馏风波,站队前先分清事实、立场和流量

二、第一场风波:张一鸣「宁落后不蒸馏」,这是路线宣言,不是道德审判

先说事实。据《The Information》报道,两位字节员工透露,在上个月的 Seed 团队全员大会上,张一鸣罕见开口:字节不会把蒸馏当作提升模型能力的捷径,即便这意味着眼下落后于国内竞争对手。36氪国内媒体的补充报道里还有个细节:Seed 成立以来,内部动过三次大的蒸馏念头,都被集团层面掐断了。知乎同一时间,业界还传出字节拟建国内最大、约 5 万亿参数大模型的计划。知乎

张一鸣为什么这么选?把几位研究员和学者的说法拼起来,逻辑其实很清楚:蒸馏最大的诱惑,是让人暂时绕开最难的事——自己找高质量数据、自己设计训练方案。而这条路一旦上瘾,挤压的是架构、数据、基础设施这些真正需要长期投入的自研能力。用一位研究者接受采访时的话说:模型可以暂时落后,但不能失去追赶模型的能力。对照一下另一个细节:DeepSeek 的梁文锋今年 5 月提过,DeepSeek 差不多一半的研究员都在做数据标注——自研数据的钱,省不掉。

但这里要划一条重点:张一鸣的表态,只说明了字节自己的路线选择,它不构成「别人都抄了」的证据。可这周评论区里,已经有人拿这句话当锤子,到处给别家模型定罪——这是第一层需要警惕的误读。

张一鸣说「宁可落后也不蒸馏」,同一周匿名PDF指控Kimi、GLM「抄袭」:这周三场蒸馏风波,站队前先分清事实、立场和流量

三、第二场风波:匿名 PDF 指控 Kimi、GLM「抄袭」,指控不等于事实

再说那份传得很凶的匿名 PDF。它的核心说法是:GLM-5.2 和 Kimi K3 蒸馏了 Claude Opus 4.8、GPT-5.6,还给出了一份「reasoning prefill」的证据。知乎但网友很快就找到了漏洞:这份所谓证据,套在一组时间线上根本不可能构成师生关系(GLM-5.2 与 GPT-5.6)的组合上,居然同样「成立」。有人直接嘲讽这是「超时空蒸馏」——证据如果放之四海而皆准,那它恰恰什么都证明不了。

这类指控其实不是第一次。今年 2 月,Anthropic 就发难,指控几家国产模型累计蒸馏调用超过 1600 万次。知乎这个数字看着吓人,但受访的基础模型研究员直言:我们也不清楚 Anthropic 是如何计算的,里面有没有夸大的成分。

所以这一层目前的状态是:指控存在,证据存疑,没有任何权威结论。国产模型有没有蒸馏、蒸馏了多少,外界从公开信息里根本无法验证——连业内研究员都这么说。在这种时候,转发即定罪,成本是零,但代价是把判断让给了带节奏的人。微博上有条高赞说得挺实在:豆包不蒸馏别家可能是真的,但到底谁家蒸馏了别人模型,诛心就没意思了。

四、第三场风波:论文「百元蒸馏 Claude」,技术是真的,标题是夸大的

最后是那篇论文——《Stealing Reasoning Traces from Proprietary LLM APIs》。按 36氪等媒体的报道,它声称只需极少的 API 调用,就能批量还原闭源大模型刻意隐藏的推理思维链。36氪B站上已经有播放量破万的视频,把它包装成了「一篇论文教你百元蒸馏 Claude」。哔哩哔哩这事要分两面看。

真的一面:蒸馏最有价值的目标,确实是思维链(CoT)——它揭示了模型拆解问题、调用工具、验证修正的完整轨迹,相当于省掉了后训练里最贵的强化学习环节。也正因为如此,各大厂商都在做反蒸馏:把思维链加密、藏起来。这篇论文说明,攻防战里攻方又进了一步。

但夸大的一面更值得说:套出思维链,不等于复制一个 Claude。伦敦大学学院博士、布里斯托大学助理教授杨梦月在接受采访时讲得很透:提问没法覆盖对方的所有决策逻辑,你能拿到的只是一部分。知乎而模型的架构设计、数据管线、训练配方这些真正的核心,从输出里根本反推不出来。真能靠几个 API 调用掏空别人几十亿美元的研发,OpenAI 和 Anthropic 早就被搬空了。

不过对普通开发者,这事有个实际提醒:随着这类技术扩散,闭源模型厂商大概率会收紧 API 条款、加强调用限制。如果你的业务里沾任何「用别家 API 训自己模型」的边,合规风险正在上升,这条值得现在就开始留意。

张一鸣说「宁可落后也不蒸馏」,同一周匿名PDF指控Kimi、GLM「抄袭」:这周三场蒸馏风波,站队前先分清事实、立场和流量

五、那么,这事到底和你有什么关系?

分三种人,结论不一样。

第一种,日常用豆包、Kimi、DeepSeek 这些助手的普通用户:基本零影响,不用改变任何使用习惯。模型值不值得用,看它在你真实任务里的表现,而不是看「血统纯度」——后者连业内人都没法从外部验证,你更没必要替它操心。

第二种,用闭源 API 做开发的:值得盯一下。思维链提取技术如果继续扩散,厂商收紧条款、加强检测是可预期的,涉及蒸馏擦边的用法要提前评估风险。

第三种,关注行业和二级市场的:路线之争是真的——自研复利对蒸馏捷径,这是未来几年国产模型分化的关键变量。但请别把匿名 PDF 当成基本面。

往后看,三个信号比站队更值得关注:一,有没有可复验的硬证据出现,而不是匿名文档;二,被点名的厂商是否正式回应,或监管、第三方机构是否介入;三,闭源模型的 API 定价和条款,有没有因此发生变化。

说到底,这场蒸馏之争的内核就两件事:前沿模型公司捍卫自己的投资回报,国产模型焦虑自己的追赶路线。事实、立场、流量,三样都有。先分清再开口,才不至于替别人吵了一场不该吵的架。

你觉得国产模型里,谁是真的在自研?评论区聊聊。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章