Kimi K3“8GB内存就能跑”是真的,但一个字要等30秒:2.8万亿参数落地本地,三条路给三种人

源自7位全网作者

06:05

这周本地部署圈的消息有点挤:DeepSeek涨价、Harness刷屏、内存一天一个价。但有个事很多人没顾上——7月27日,月之暗面把2.78万亿参数的Kimi K3全量开源了,这是迄今最大的开源模型。央视新闻满血版跑起来需要64张高端显卡、价值数千万元的硬件。机器之心

Kimi K3“8GB内存就能跑”是真的,但一个字要等30秒:2.8万亿参数落地本地,三条路给三种人

然后营销号标题就起飞了:“8GB内存跑Kimi K3”“128GB的Mac就能跑”。这两句话居然都是真的,但代价都没写在标题里。今天把全网实测信息凑齐,帮你想清楚一件事:你的机器到底能不能跑K3,以及你该不该跑。

GitHub上有个叫kimi-k3-in-c的项目,用不到200KB的C语言代码做纯CPU推理,不用显卡、不用CUDA。它能跑,是因为K3是MoE架构:总参数2.78万亿,但每生成一个token只激活约1040亿,占3.7%。36氪项目把用不上的专家权重全扔在固态硬盘上,按路由结果现读现算,内存里只留8.24GB。

代价呢?要准备约1.7TB的固态硬盘;实测平均32.69秒才吐一个字,速度0.03 token/s——问一句“法国的首都是哪”,等四分多钟。36氪更关键的是,这个“8GB”是在一台124核的AMD EPYC服务器上、用Linux资源限制卡出来的上限,根本不是普通笔记本的体验。所以它是严肃的工程验证,不是给你抄的作业。

Kimi K3“8GB内存就能跑”是真的,但一个字要等30秒:2.8万亿参数落地本地,三条路给三种人

再说“128GB Mac跑K3”。这条路走的是Unsloth的动态1-bit量化,把模型体积压到能塞进128GB统一内存的Mac里。机器之心机器之心那条5万播放的视频底下,评论区比视频清醒:最高赞直接拆穿“不就是1bit量化加分层到固态,营销号骗流量的”;也有人说自己用3060跑起来了,速度32秒一个字。量化版在128GB机器上的具体速度,目前社区还没有统一实测口径,但“能跑、很慢、能聊天”是普遍共识。

把这两条路放一起,你就能看懂本地部署圈今年最重要的一个认知变化:总参数量已经不决定部署门槛了,“能跑”和“能用”是两码事。

36氪一篇配置指南把这件事拆成三档:能跑,是权重装得下;能用,是速度、上下文、能力撑得住任务;值得部署,是省下的钱和拿到的隐私、控制权,能覆盖硬件和电费。36氪K3恰好把这三档拉到了极端:8GB能跑,0.03 token/s谈不上能用;128GB统一内存勉强够到“能用”的边;至于“值得部署”,现在还得打个问号。因为K3的API虽然不便宜,有平台实测单次提问K3约2.8分钱,是DeepSeek V4 Pro的10倍。哔哩哔哩但这仍比你买台机器跑它便宜得多。

Kimi K3“8GB内存就能跑”是真的,但一个字要等30秒:2.8万亿参数落地本地,三条路给三种人

所以按人群分,结论很清楚:

第一种,想体验K3的能力、用它干活。直接用API,别碰本地。哪怕这周DeepSeek涨价给大家上了一课,对策也是用谷时半价、开前缀缓存这种省钱姿势,而不是回家装机器。36氪B站有条高赞评论算过账:就算本地部署便宜模型,一天API只花20块的话,硬件也要6-7年才回本,而模型还在疯狂迭代。哔哩哔哩

第二种,手里是16-24GB显存的游戏党、普通PC。别追K3,追不动。这个档位的甜点是27B级模型:Qwen3.8-27B开源后社区反馈在AMD 7900 XTX上能跑到62 token/s,24GB显存正好是它的舒适区。知乎在K3那条视频评论区有人问“96G内存加5080该跑什么”,高赞回复也是27B。把预算和热情留给真正跑得动的模型,体验好十倍。

Kimi K3“8GB内存就能跑”是真的,但一个字要等30秒:2.8万亿参数落地本地,三条路给三种人

第三种,手里有或者正打算上128GB以上统一内存的设备——Mac Studio、M系Ultra、Ryzen AI Max+ 395这类小主机——并且有隐私合规或长时间跑Agent的硬需求。你才是K3量化版真正的目标用户。但注意时机:这一波内存涨价非常凶,Mac Mini一度断货、苹果上调产品线起售价,英伟达DGX Spark从3999美元涨到4699美元。36氪群联电子CEO甚至预警NAND紧缺会持续到2030年。微博现在追高买新机跑本地AI,是今年以来最差的买点;二手大内存机型或者等价格回落,都更合理。

最后送你一个防忽悠口诀,以后看到“XX内存跑XX模型”的标题,先问三个问题:一问速度,多少token/s,不敢报速度的“能跑”都是耍流氓;二问量化,几比特、砍了什么,动态1-bit不等于满血;三问测试机,是服务器还是普通笔记本,有没有cgroup之类的限制。

我的判断:对绝大多数人,K3的正确姿势是看它在云端跑,本地跑自己机器装得下的模型。K3开源真正的意义,是证明了MoE加量化加磁盘流式加载能把“部署门槛”这四个字重写得面目全非——但这只是起跑线,不是终点线。接下来值得盯的信号:MTP这类加速优化什么时候轮到万亿级MoE、1-bit量化生态的成熟速度,以及内存行情什么时候降温。这三个里任何一个变了,这篇的结论我再来更新。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章