洋垃圾大容量傲腾内存方案,低成本跑万亿参数大模型!
最近在海外社区 上,一位大佬的帖子引起了众玩家的关注:他仅用一张3060显卡和一堆过时的“洋垃圾”硬件,在本地以 4 tokens/s 的速度,跑起了万亿参数级别的国产大模型——Kimi K2.5!
Kimi K2.5 的常规配置
在聊具体配置之前,我们要先了解一下:正常跑 Kimi K2.5 这种万亿级别的大家伙(MoE 架构)需要什么?
常规显存需求: 如果是未压缩的 FP16 精度,模型体积接近 2TB。即便是目前主流的 4-bit(Q4_K_M) 量化,也需要约 600GB-700GB 的显存或内存。
标准企业配置: 这种级别的模型,通常是放在 8 张 H100 80GB 组成的算力集群上跑的,整机成本轻松破百万。
顶级民用配置: 至于Apple 方面,也要有两台 192GB 统一内存 的 Mac Studio M2/M3 Ultra组成的集群才能勉强跑顺,成本大概也要 5 万人民币以上。
海外大佬的方案:傲腾持久内存
这位国外大神并没有去卷昂贵的 H100,而是把目光投向了已经被 Intel 停产的傲腾持久内存(Optane PMem)。
这种 PMem 模块长得像普通内存条,插在服务器主板的 DIMM 插槽上。它的优点在于:容量极大(单条可达 128GB/256GB/512GB),价格却远低于普通 DDR4 内存。
海鲜市场上128G的价格核心思路: 利用傲腾的 “Memory Mode(内存模式)”,将 6 根 128GB 的傲腾当作系统主内存(共 768GB),而原有的 192GB DDR4 内存则变成这一庞大存储池的 L4 级缓存。这样,原本需要几十万成本才能装下的万亿参数模型,就能装进一台总价极低的“洋垃圾”服务器里了。
完整配置清单

核心算力: RTX 3060 12GB(老外选它是因为 12GB 显存是低成本跑 llama.cpp 的门槛,能装下模型的核心路由组件)。
内存池: 6x 128GB Intel Optane DCPMM(这是装下 Kimi K2.5 的关键)。
基础平台: Intel Xeon Gold 6246 + 泰安(TYAN)S5630 级别服务器主板。
缓存: 6x 32GB DDR4 ECC 内存(给傲腾当缓存使)。
存储与机箱: 西数 SN850X 2TB + 银欣 HTPC 卧式机箱。
性能表现
在跑 Kimi K2.5(Unsloth Q2_K_XL 量化版) 时,这套组合得出了 4 tokens/s 的成绩。说实话,这个速度在实际使用中几乎没有实用价值。
正常人阅读速度大约在每秒 5-8 个词。4 tokens/s 意味着你盯着屏幕时,文字是一个一个蹦出来的,比你读的速度还慢。
哪怕是目前公认较慢的 GPT-4,在线推理速度通常也能达到 20-50 tokens/s。4 tokens/s 速度更像是回到了 20 年前的拨号上网时代,慢得让你怀疑人生。
虽然跑万亿模型很卡,但这套方案如果用来跑中小参数模型的话,速度说不一定会有另一番景象。总的来说,这套方案的实验意义远大于实用意义——它证明了物理极限,但并不适合拿来当日常生产力工具。
最后,各位对这种“傲腾黑科技”怎么看?欢迎在评论区留言!

永远的青葱
校验提示文案
nsh1120
校验提示文案
胡作非伟
校验提示文案
我吃猪肉我光荣
校验提示文案
知值址智
校验提示文案
然而并沒有
校验提示文案
天下寒士
校验提示文案
没钱最理性
校验提示文案
千般好
校验提示文案
没有摩托车的摩托车手
校验提示文案
值友7657479915
校验提示文案
稻光亦是永恒
校验提示文案
值友1227772903
校验提示文案
choosewin
校验提示文案
值友7139661344
校验提示文案
值友1824674854
校验提示文案
稻光亦是永恒
校验提示文案
值友1824674854
校验提示文案
值友7139661344
校验提示文案
值友7657479915
校验提示文案
没有摩托车的摩托车手
校验提示文案
天下寒士
校验提示文案
然而并沒有
校验提示文案
我吃猪肉我光荣
校验提示文案
知值址智
校验提示文案
千般好
校验提示文案
没钱最理性
校验提示文案
choosewin
校验提示文案
nsh1120
校验提示文案
胡作非伟
校验提示文案
永远的青葱
校验提示文案
值友1227772903
校验提示文案