两个token让Kimi带出Claude味
AI厂商给你看的思考过程,是上了一把锁的。两位德国研究员把这把锁拆了,顺带拆出一场大模型的身世疑云。
事情有两层,一层是安全漏洞,一层是行业悬念。两层都跟每个用AI的人有关。
我先说拆锁这层。
Ilia Shumailov,前Google DeepMind研究员,离开后跟图宾根大学的博士生Alexander Panfilov搭伙,研究一个很具体的问题。现在的大模型回答你之前会先思考,厂商把这段思考加密后再交还给你,名义是让你看不到中间过程。他们想知道这把锁结不结实。这类加密思考已经成为行业标配,你买的每一次会员服务,背后都跑着这套流程。
先说厂商为什么要上这把锁。agent干活要把中间过程传回你的设备,厂商既想让你看到结果,又怕思考过程被同行整包抄走拿去蒸馏,于是加密,折中。逻辑通顺,问题出在实现。
答案是几乎不设防。
两人从GitHub和Hugging Face上公开的agent运行轨迹里,解码出31.5万条隐藏推理。我核了两遍原文,31.5万条全部来自公开轨迹。有些推理文本里就摊着API密钥、邮箱、内部IP地址,谁下载谁就能看。这些轨迹本来就是agent开发者调试时传上网的,谁也没料到里面裹着能解开的明文。要是哪个密钥碰巧还是付费的,捡到的人等于白刷你的卡。密钥泄漏按调用量扣费,扣的是真金白银。
这层发现已经够劲爆了,不过它还只是前菜。安全漏洞能修,下面这件事修不了。引爆社交媒体的是下一层。
两个token,风格就变味
两人在Kimi K3的推理开头,塞进了两个来自Claude Opus的token。就两个。

K3的回答风格,开始变得像Opus。
换成GLM、DeepSeek、Inkling,同样的实验,没这个现象。只有Kimi中招。
这条消息在X上40小时拿了300万浏览量,评论区吵成了两派。一派说这就是Kimi蒸馏了Claude的实锤,模型权重里带着老师傅的手艺。另一派搬出论文原话,研究员自己写的是「非因果证明」,是「公开互联网上迄今最相关的证据」,证据,不定罪。
月之暗面没有正面回应学术问题,倒是忙着替创始人辟谣并报了案,那是另一场风波,这里不展开。
我家那台跑开源模型的小主机,权重就是从Hugging Face拉下来的。我盯着这个实验设计看了很久,它妙就妙在便宜,两个token,任何人都能复现,也任何人都能质疑。
这案子为什么定不了
蒸馏这件事的麻烦在于,它几乎没有现场。
这里先补一句背景。蒸馏就是拿一个强模型的输出当教材,去练另一个模型,行业里半公开的秘密。前OpenAI联合创始人John Schulman提过一个观察,这么多人从Claude蒸馏,结果所有开源模型写东西都开始一个味儿,他管这叫单一文化。风格趋同本身就是大面积蒸馏的旁证。

模型训练完成后,你没法解剖它的权重,指着某一块说这来自Claude。风格像,可以是蒸馏,可以是训练数据里混了大量Claude生成的网页文本,甚至可以是巧合。两个token触发风格偏移,是最接近指纹级的证据,但指纹要配上完整证据才能定案,关键材料在月之暗面的训练日志里,外人拿不到。
所以这案子大概率会一直悬着,学术界慢慢磨。K3的技术报告和权重都公开了,后续会有更细的分析,我持币观望。我下单买过几家模型的年度会员。以后再挑,我会多问一句,这口气风格是模型自己的,还是别人教的。
这个案子里,你能带走的教训在那把锁上。厂商把思考过程加密还给你,这个设计的潜台词是「锁着的就是安全的」。研究员用31.5万条样本证明,这种锁只防君子。
顺手说一句两位研究员的态度,我挺认同。模型能在你眼皮底下藏东西,这算失控。但你能把藏的东西挖出来,说明我们审视模型内部的能力还在,这本身就是一种控制力。他们还留了一句话,防御的提升会比攻击的提升更快。那些不该外发推理数据的厂商会改架构,这不会是最后一次。
加密的思考,说到底更像一条拉链。拉上了看着挺严实,可谁都拉得开。我做IT这些年见过太多类似的东西,加密狗、license文件、源码混淆,每一层都号称防得住,最后一层层都被拆。我们上数据中台那年,审计提过一条硬要求,操作日志明文留存且不得加密脱敏,理由就一句,黑箱不可审计。当时嫌它土,现在看是先见。安全这个东西,从来都买不来现成的,只能靠持续盯着。
留个问题给你。你敢把公司内部资料交给一个「思考过程加密」的AI助手吗?
这个问题在锁被拆开之后,答案已经跟以前不一样了。
