Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

2026-07-30 16:56:41 0点赞 2收藏 0评论

前言

Kimi K3 的技术报告,47页,我花了一个周末看完。

开头第二段就写了一句让我愣住的话:整体性能仍落后于最强的两个闭源模型,Claude Fable 5 和 GPT-5.6 Sol。一个团队花几个月、烧掉天文数字算力做出来的旗舰,报告里第一件事是承认自己打不过。

但你往下读会发现,这份坦诚背后站着的东西一点都不软。2.8万亿总参数,全球第一个开源的3T级别模型。原生多模态。100万token上下文。报告里还藏着一句话——在K3开发的后期,一个还没发布的K3早期版本,已经在承担团队大部分的GPU内核优化工作了。

一个还没出生的模型,在帮着优化生它的那条流水线。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

这篇把47页报告拆开,讲清楚三件事:这个3万亿的大家伙架构上动了什么手脚,这么大的模型怎么训得起也训得稳,以及它为什么已经能给自己造芯片、写编译器、剪自己的宣传片。


架构总览:一个模型朝三个方向同时长大

传统上把一个语言模型做大,大家想到的就是堆层数、堆参数。K3的设计思路更立体,它让信息沿着三个方向同时流动——序列长度、网络深度、模型宽度。你可以把它想象成一栋楼,长度是每层楼有多宽敞,深度是楼有多少层,宽度是每层能同时容纳多少个专业工种。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

注意力机制(Attention)让模型处理每个词时,能同时看到句子里其他所有词,并判断谁更重要。就像你在嘈杂的聚会里找朋友,眼睛会自动扫向熟悉的轮廓,而不是逐张脸排查。它是所有大模型的地基。

序列方向上,K3用了一套混合注意力,把三层Kimi Delta Attention配一层Gated MLA,三比一的比例贯穿整个网络。深度方向上,一套叫Attention Residuals的机制,让每一层都能回头看之前所有层的信息。宽度方向上,每层注意力后面接一个Stable LatentMoE,从896个专家里每次只挑16个干活。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

这三招合起来,加上更精细的数据和训练配方,换来一个硬指标——相比上一代Kimi K2,整体的扩展效率提升了约2.5倍。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

扩展效率(Scaling Efficiency)指花同样的算力能换出多少智能。2.5倍的意思是,K3用一份算力干的活,K2得用两份半才能追上。在动辄烧掉上亿美元训练成本的年代,这个倍数直接决定了一家公司烧钱的性价比。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

下面把这三个方向一个个拆开。


序列方向:让长文本变便宜的KDA

大模型读长文本,最大的敌人是成本。

标准注意力有个要命的毛病,每多读一个词,它都要拿这个词跟前面所有词两两比对一遍,计算量随着长度平方级暴涨。读一篇短文没事,读一百万字的文档,光注意力这一项就能把显存和时间烧穿。

K3的解法是Kimi Delta Attention,简称KDA。

线性注意力(Linear Attention)把注意力从平方级成本压到线性级。传统注意力像你每记一件新事,都要把脑子里所有旧事翻出来对一遍。线性注意力像随身带一个不断更新的笔记本,来一件新事就往本子上改几笔,不用每次重翻全本。KDA就是这类笔记本里比较聪明的一种,它给笔记本的每一栏都配了一个可调的遗忘开关,哪些旧信息该淡忘、哪些该留着,模型自己学。

但纯线性注意力有个短板,它太依赖那个压缩过的笔记本,有时候会漏掉需要精确翻查原文的细节。所以K3每隔三层KDA,就插一层Gated MLA做全局注意力兜底,把最要紧的全局关系重新精确算一遍。而且网络最后一层一定是Gated MLA,保证模型收尾时看的是全局。

省钱的活交给KDA,较真的活交给MLA,三比一搭配。这套组合还带来一个意外的好处——K3处理位置信息不靠传统的位置编码,而是靠KDA那套遗忘和衰减机制隐式地记住谁先谁后。好处是它能直接外推到一百万token,不需要任何位置编码上的魔改。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

深度方向:让每一层都能回头看

第二个方向是深度,也就是层与层之间怎么传信息。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

常规的深层网络有个隐忧,信息是一层一层顺着往上传的,传到几十层之后,最底下那层学到的东西,可能早就在层层转手里被稀释得差不多了。就像一个消息在一百个人之间口耳相传,传到最后跟原话往往对不上。

K3用Attention Residuals(注意力残差)解决这件事。

注意力残差(AttnRes)让网络里每一个模块,都能越过中间所有层,直接回头去调取最初的输入、以及之前任意一个模块的输出。打个比方,普通网络像流水线上的工人,只能拿到上一个工位递过来的半成品。而装了AttnRes的工人,随时能调出仓库里的原材料和之前任何一道工序的成品,按需取用。它靠一组可学习的伪查询来决定每一层该回看哪些历史。

对一个有93层的深层模型来说,这个能力很关键。它让深层的信息访问不再是单线的接力,变成一张可以按需检索的网。底层学到的原始信号,到了顶层依然能被精准调用。


宽度方向:896个专家里怎么只用16个还不翻车

第三个方向,宽度,也就是MoE。

混合专家模型(MoE)把一个巨大的模型拆成很多个专家子网络,每次只唤醒其中几个来处理当前的词。好比一家896人的会诊医院,每个病人只安排16个最对口的专家出诊,其他人待命。医院名义规模巨大,但每次接诊的实际人力成本很低。这是万亿级模型能跑得起的核心原因——参数量做得极大,但每个token实际激活的计算量被控制得很小。

K3的这套叫Stable LatentMoE,把路由专家扩到896个,每个token只激活16个。这个稀疏度相当极端,激活的专家还不到总数的百分之二。

稀疏度一旦拉到这么高,训练就容易出乱子。最典型的问题是专家分配不均,有些专家被抢着用、累到冒烟,有些常年闲置、白占参数。K3用了一个叫Quantile Balancing的办法,直接从路由分数的分位数来推导专家分配,砍掉了传统方法里那个又敏感又难调的平衡超参数。配合归一化和一个新的激活函数SiTU-GLU,才把这么稀疏的模型在训练时摁稳。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

三个方向拆完,K3的设计意图很清楚了:它想明白了信息在一个巨型模型里会在哪几个方向卡住,然后一个方向一个方向地把管道拓宽。


从K2到K3,到底大了多少

这些改动落到具体数字上,是一次全面的放大。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

激活参数(Activated Parameters)指模型每处理一个token,实际参与计算的那部分参数。K3总参数2.78万亿,但每次只激活1042亿。这个区分很重要——总参数决定模型见识的上限,激活参数决定它跑起来的实际开销。K3相当于一个见多识广的巨人,但每次只调动身体的一小部分肌肉,所以既聪明又跑得动。

还有一点容易被忽略,K3是原生多模态。它没有先训好一个语言模型再把视觉模块焊上去,从训练的第一天起,文字和图像的token就交织在同一个预测目标里一起学。

视觉这条路用的是一个叫MoonViT-V2的4亿参数视觉编码器,能处理最高3584×3584像素的图像,还能在百万token的上下文里放得下。


一百万token是怎么喂进去的

上下文从K2的12.8万直接干到K3的一百万,把数字改大没用,底下全是工程活。

又长又连贯的文档和视频在公开数据里很稀缺,网上大量的长内容是重复、截断、机器生成的垃圾日志。K3先用一套专门的清洗流水线把这些噪声滤掉,再刻意把优质长文档上采样,免得训练时被海量短文本淹没。

光有长文档还不够,长度本身不等于长程能力。所以团队还合成了一批特殊的长上下文数据,把多个文档和子任务精心打乱、拼接,让里面埋的任务只有跨越整个一百万token、把散落各处的信息都串起来才能解出来。这等于是逼着模型在真实的长距离上练本事,防止它偷懒退化成只看眼前。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

训练的时候,上下文窗口是分四个阶段慢慢撑大的,预训练期从8K长到64K,冷却期再从256K拉到1M。把最烧钱的超长序列计算集中在训练后期一小段,既省了成本,又让模型循序渐进地适应越来越长的依赖关系。


九个专家,蒸成一个

架构和预训练之后是后训练,这一步决定模型好不好用。

K3的后训练分三步走。先用监督微调打个高质量的底子,再用强化学习练出各个领域的专家,最后把这些专家合并成一个统一的模型。

强化学习(RL)让模型通过大量试错来学习,做对了给奖励,做错了给惩罚,逼它自己摸索出更优的策略。就像训练一只牧羊犬,你不用逐个动作教它,你只在它把羊赶到位时奖励它,它自己就会琢磨出该怎么跑位。当前最强模型的推理和智能体能力,很大程度上都是RL练出来的。

K3的RL铺得很广,横跨三大领域——通用任务、通用智能体、编程智能体。每个领域再配三档思考强度,低、高、最高。三乘三,一共练出9个专家模型。

问题来了,用户总不能面对九个模型自己挑。K3用一套叫多教师在线策略蒸馏的方法,把这九个专家的本事统统压进一个统一的模型里。

蒸馏(Distillation)让一个模型(学生)去模仿一个或多个更强模型(老师)的输出,从而把老师的能力学过来。这里是九个各有所长的老师同时带一个学生,学生最后一个人就能顶九个专家。用户拿到的是一个既全能、又不用手动切换的模型。

还有个工程上的细节,K3从监督微调阶段就开始做量化感知训练,权重用MXFP4、激活用MXFP8这种低精度格式。

量化感知训练(QAT)在训练过程中就让模型习惯低精度的数字格式,而不是训练完再压缩。好比运动员平时就穿着比赛装备训练,正式上场时不会因为装备变化而失常。这让K3天生兼容各种硬件的低精度推理,跑起来更省。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

把2.8万亿训起来,靠的是基建

一个2.8万亿参数、要吃一百万token的模型,光有好设计还不够,底下得有能扛住的基建。报告里这部分是硬功夫,挑三个最关键的讲。

第一个是训练时的负载均衡。这么多专家分布在成百上千张卡上,只要有一部分专家忙一部分闲,整个集群的吞吐就会被最慢的那批拖垮。K3搞了一套叫MoonEP的方案,让专家执行完美均衡,用静态的计算形状和零拷贝通信,把这种忙闲不均消灭掉。

第二个是推理时的缓存。KDA那个固定大小的笔记本状态,和MLA那个随长度增长的常规缓存,两者性质完全不同,分开管会把逻辑搞得又乱又重。K3设计了一套KDA感知的前缀缓存,把两种缓存统一到同一套分页管理里,让百万token的前缀既能便宜地存着,又能跨请求复用。这直接关系到它能不能以有竞争力的价格对外服务。

第三个是智能体训练用的沙箱。K3的很多任务动辄要调用成百上千次工具、跑上几百万token,中途一旦崩了不能从头再来。团队用了可恢复的微型虚拟机沙箱,配上部分回合保留、外部KV缓存保持等一系列手段,把长命的模型状态和环境状态都稳稳兜住。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

这些东西平时没人聊,但一个3T模型能不能跑起来,地基全在这里。


跑分:能打,而且便宜

现在看成绩单。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

K3的整体定位很清楚,落后于Claude Fable 5和GPT-5.6 Sol这两座山,但对其余所有开源和闭源模型都保持领先。这是它自己承认的,也是评测印证的。

但在几个具体项目上,它是全场第一。SWE-Marathon(超长软件工程任务)拿了42.0分,全场最高。BrowseComp(网络浏览搜索)拿了91.2分,全场最高。OmniDocBench(文档解析)拿了91.1分,超过所有闭源模型。WebDev Arena上以1678的Elo登顶,成为第一个拿下这个榜单第一的开源模型。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

第三方的独立评测也给了位置。在Artificial Analysis的智能指数v4.1上,K3拿到57.1分,在580个模型里排第四。

但K3最有杀伤力的地方是成本。

在Kimi Code Bench 2.0上,它只比Claude Fable 5低4分,成本却只有对方的38%。在BrowseComp上,它拿了全场最高分,每个任务只花2.03美元,是GPT-5.6 Sol的一半,比Claude系列在最高强度下便宜一个数量级。

报告的原话是,K3稳稳坐在成本效率的前沿上,用Fable 5零头的价格,交付接近顶尖的分数。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

对一个开源模型来说,能打是本分,又能打又便宜才是杀招。


它已经开始给自己干活了

技术报告的最后是案例研究,这部分最能说明K3到底强在哪,也最超现实。

先说开头埋的那个伏笔。团队测了各家模型优化GPU内核的能力,每个模型在相同沙箱里独立干最多24小时。

K3把一个AttnRes内核的延迟从283.6毫秒压到114.4毫秒,另外两个内核分别提速55%和74%,成绩追平带回退的Fable 5,大幅甩开其他对手。而在K3开发后期,一个早期版本的K3就已经在承担团队大部分的内核优化工作了。

Kimi K3 技术报告拆解:全球第一个开源3万亿参数模型

模型帮着优化生产它自己的流水线。这个自举的循环,是这份报告里最让人后背发凉的信号。

再往下,一个比一个夸张。

K3从零写了一个类Triton的编译器MiniTriton,从DSL前端、中间表示优化,一直到PTX代码生成和运行时,是一条完整的链路,某些工作负载上性能还超过了Triton本身。

它甚至给一个基于自身架构的nano模型设计了一块推理芯片,在一次48小时的完全自主运行里,用开源工具完成构建、优化和验证,4平方毫米内跑到100 MHz、每秒8700多token的解码吞吐。

科研上,为了复现计算天体物理里的一组普适关系,K3审阅了20多篇论文、评估了300多个状态方程、写了3000多行Python,还顺手揪出了已发表公式里的错误,全程约2小时。一个有经验的研究员干这个要一到两周。

它还做了一份关于ASIC行业42年历史的交互式研究网站,经历120多轮自我改进,翻阅了超过1.1万页材料。

最后一个案例带点黑色幽默。K3用它的原生多模态能力,剪了一支自己的发布预告片,56段素材,逐帧卡点。它还做了一支数学动画风格的架构讲解视频,讲的正是它自己的架构。

模型给自己做科普。这个画面想想就很魔幻。


写在最后

回到开头那个反常的开场。一份技术报告为什么敢在第二段就承认打不过对手?读完47页你会明白,因为它手里的牌根本不需要靠话术来撑。全球第一个开源3T模型,一块自己设计的芯片,一个从零手搓的编译器,还有五分之一的旗舰价格。承认与Fable 5的差距,反而把开源阵营最强这件事衬得无可辩驳。

报告结论里有一句话我很喜欢。它说,尽管与最强闭源模型的差距仍在,K3建立起了一个新的开源前沿,一个人人触手可及的前沿。

过去很长一段时间,前沿是个封闭的词,被锁在几家巨头的服务器里。这份报告在说的是,从现在起,那道前沿的门向所有想研究、想部署、想创新的人打开了。

我反复看了好几遍那个自举信号。K3优化了生产K3的内核,K3给基于自己架构的模型设计了芯片,K3讲解了自己的架构。一个模型开始参与构建它自己的下一版,这件事正在从科幻概念变成技术报告里一行行朴素的记录。

模型学会造模型的那一天,也许不会有惊天动地的宣告。它可能就是这样,安安静静地写在一份坦诚的技术报告里,夹在一句"早期版本已经在帮我们优化内核了"的轻描淡写之间。

原文来源:Kimi K3 Technical Report · Moonshot AI

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
2
扫一下,分享更方便,购买更轻松