8月17日0时起,DeepSeek的新价格正式生效,V4系列API改用峰谷定价,V4-Pro也结束测试转为正式商用。微博开发者社区最直观的反应,是账单开始变贵,有人直呼两天就花掉了30块,真服了。微博
于是有一派人开始拨算盘:token变贵了,不如自己攒一台机器本地跑。最近两三周,B站和小红书上「二手EPYC服务器本地跑DeepSeek V4」的实测内容明显多了起来。我把全网散落的实测整理成了一张档位表,先说最重要的结论。
瓶颈不是CPU,是内存
很多人攒第一台本地大模型机,会先想着上一颗多核CPU,但实测样本看下来恰恰相反。有人用消费级主板加一张3090部署DeepSeek V4-Flash的Q8无损量化版,生成速度约10 token/s。哔哩哔哩也有人用单张2080Ti 22G魔改显卡配256G内存,走FastLLM混合推理跑出11~12 token/s。哔哩哔哩甚至还有人直接拿双路X99主板把它部署了起来。这些方案横跨消费级平台、老服务器平台和垃圾佬平台,能跑出可用速度的共同点只有一个:内存容量够大、内存通道够多。
原理并不复杂:V4-Flash是284B参数的MoE模型,混合推理的核心思路是把注意力层和共享专家放上GPU,把海量专家层放进CPU加内存。CPU负责调度运算,但决定「能不能跑、跑多快」的,是内存能不能装下权重、喂得上数据。所以EPYC在这波装机里扮演的不是「高性能CPU」,而是「便宜的内存扩展坞」:一块服务器主板能给到8通道甚至16通道DDR4插槽,内存容量和带宽上限都是消费级平台给不了的。

档位表:多少钱,配多大内存,跑出什么速度
以下都是DeepSeek V4系列本地部署的实测数据,来自多位博主的实测帖与视频,按内存容量从低到高排:
128G档:能用的入门线。官方284GB的原始模型,通过非对称量化方案可以压缩到85GB,128GB设备就能本地部署。哔哩哔哩128G统一内存的设备经过优化后,输出峰值约48 Tokens/s,日常大多稳定在20~40 Token/s。哔哩哔哩垃圾佬路线更直接,4条三星32G服务器内存凑128GB就够。小红书

192G档:消费级性价比甜点。消费级主板加一张3090再加192G内存,跑Q8无损版约10 token/s,模型运行时占用约131GB,博主的建议是内存别低于160GB。哔哩哔哩
256G档:老平台的稳妥选择。单张2080Ti 22G魔改卡配256G DDR4 ECC内存,FastLLM混合推理实测稳定在11+~12+ Tokens/s。哔哩哔哩同一视频还专门验证了DDR4与DDR5、NUMA、内存带宽对速度的影响,结论一致:通道插满,速度上一个台阶。
512G档:正经生产力的起点。双路epyc 7642、16通道DDR4内存加两张5060Ti,Flash原版开启推测解码后最高输出decode 40t/s。哔哩哔哩也有人一万元攒一台64核EPYC加512G内存的服务器,干脆不装显卡,纯CPU推理。小红书
1TB档:目前的家用天花板。双路epyc 7642加1T DDR4内存,再配两张3090和两张5060Ti,DeepSeek-V4-Pro原版输出速度15t/s。哔哩哔哩想在家跑Pro原版,这基本是目前唯一的路。
再给个对照:Mac路线上,M3 Ultra加512G统一内存跑Flash量化版,接近200K上下文时TG还能保持20.8 tok/s。哔哩哔哩不想折腾硬件、预算又够的话,这是现成答案;只是512G配置的价格,也妥妥是EPYC方案里的「重度档」预算。
钱到底花在哪:CPU便宜,内存贵
看完档位表会发现一个反直觉的事实:整机里最不值钱的恰恰是CPU。一颗二手64核EPYC 7642不过几百元,真正的大头是配套的主板和大容量内存——而且内存还在涨。DDR4三季度还要再涨50%,DDR5同比涨幅已经冲到483%。小红书原因也不复杂:晶圆厂都在赶HBM和AI订单,成熟制程的DDR4产能没人管,供需错配之下现货价涨得最猛。
所以这波装机里最狠的方案,干脆把DDR3都翻了出来:E5-2698BV3加X99主板加DDR3 ECC 16G两条,整机算下来总共2887元(不含显卡)。小红书帖主那句话点破了本质:好在推理机不需要对平台有很高要求。只要内存装得下、喂得饱,上上代的洋垃圾也能发光发热。

主板是第二大件。好消息是零售带质保的新板出现了,华南金牌H12D被称为首款零售带质保的单路Epyc主板。哔哩哔哩二手拆机主板更便宜,但BIOS设置、BMC固件这些坑要自己扛,这部分的钱不建议盲省。
坑,已经有人替你踩过了
第一,多卡不等于快。有人实测8张2080Ti 22G跑Flash,结论先放:能跑,但毫无性价比。哔哩哔哩问题出在没有NVLink互联时,llama.cpp只能按层切分,任一时刻只有一张卡在满负荷计算,其余七张干等。MoE混合推理堆显卡收益很低,钱不如花在内存上。
第二,先定量化版本,再定内存容量。同一个模型,官方原版、Q8和低比特量化版的体积差着好几倍,Q8版运行时就占131GB,建议配置不低于160GB。哔哩哔哩拿着128G内存想跑原版,是最典型的预算错配。
第三,机箱和电源别将就。垃圾佬帖主的血泪教训:3090涡轮版太长了,普通机箱完全塞不下,最后把海景房机箱都贡献了出来;双3090单卡375W的功耗,1200W电源只是勉强,他直接上了1650W。小红书
第四,内存通道插满,NUMA别乱绑。40t/s这类速度都是在16通道插满的前提下跑出来的,8通道平台尽量把通道占满,进程按NUMA节点分配,速度差距会非常明显。
谁该装,谁别装
先说谁别装:轻度用户。涨价后的API依然很便宜,有人实测1.6亿Token只花9块。哔哩哔哩而且新价格有闲时折扣:白天9-12点、14-18点是高峰,夜里和周末属于闲时,闲时价格直接打对折。微博每天用量不大的话,闲时API完全够用,装机纯属给自己找活干。
适合装的三类人:一是每天大量调用token的coding、写作重度用户,本地机器边际成本几乎为零;二是有数据不出本机需求的隐私敏感用户;三是把装机本身当乐趣的折腾党。但要有心理预期:本地速度普遍在10~40 token/s,跟云端API拼不了高并发,图的是长期零账单和数据自由。
值得盯的信号
EPYC这个领域最大的变量已经在路上:7月24日AMD发布了第六代EPYC Venice CPU,台积电2nm工艺,256核心、2030亿晶体管、5GHz+频率。微博发布会规格页上256核512线程、1.6TB/s内存带宽、PCIe Gen6这些参数,说明新平台仍是数据中心导向;但按以往规律,新一代上市后,上一代Rome、Milan的二手行情会松动一轮,想蹲双路7003、9004系列的可以留意。

还有两件事值得持续观察:一是内存价格,DDR4若真如预期再涨50%,整机方案的成本优势会继续收窄;二是DeepSeek后续的价格调整和峰谷规则,直接决定「本地装机值不值」这道题的答案。有新的实测数据出来,这篇会继续更新。