纯CPU跑大模型?我把抽屉里吃灰多年的硬件翻出来了
这周原本计划写文章的,结果一头扎进了纯CPU推理的坑里,彻底爬不出来了。#
为了折腾这事,我把在抽屉里吃了好几年灰的硬件全翻了出来——看着那一堆内存条,我不禁陷入沉思:当年我到底是多钟情小主机,才攒了这么多?
先给大家汇报一下这周的折腾成果。
纯CPU推理,能跑吗?能,就是慢得让人怀疑人生。
如果你只是想尝鲜、体验一下本地部署AI的乐趣,或者跟我一样——硬件受限、还能放在公司蹭电不用考虑电费——那确实多了一个可以搞的理由。
CPU推理其实有个隐藏优势:模型上限比显卡高。
原因很简单——内存是可以插满的。我这台破笔记本,AMD 4750U,16G板载+16G扩展,总共32G。这个规模,已经能跑32B参数的稠密模型了,虽然慢到无法想象。但换个思路,上MoE模型(比如32B-A3B),激活参数量少很多,速度立刻就舒服多了。
那核显呢?能推理吗?
完全可以。我已经跑通了。但这里有个坑:别想着CPU和核显并行跑。受限于内存带宽,两者并行效率极低,还不如单跑一个。
先说到这。显卡已经在路上了,到了之后继续折腾。等我把CPU推理、核显推理、独显推理的完整对比都摸清楚,再单开一篇详细聊。
大家猜猜,我买了什么显卡?评论区见。














