DeepSeek涨价后自己装机划算吗:二手EPYC本地大模型机档位拆解,瓶颈不是CPU是内存

源自50位全网作者

12:31

8月17日0时起,DeepSeek的新价格正式生效,V4系列API改用峰谷定价,V4-Pro也结束测试转为正式商用。微博开发者社区最直观的反应,是账单开始变贵,有人直呼两天就花掉了30块,真服了。微博

于是有一派人开始拨算盘:token变贵了,不如自己攒一台机器本地跑。最近两三周,B站和小红书上「二手EPYC服务器本地跑DeepSeek V4」的实测内容明显多了起来。我把全网散落的实测整理成了一张档位表,先说最重要的结论。

瓶颈不是CPU,是内存

很多人攒第一台本地大模型机,会先想着上一颗多核CPU,但实测样本看下来恰恰相反。有人用消费级主板加一张3090部署DeepSeek V4-Flash的Q8无损量化版,生成速度约10 token/s。哔哩哔哩也有人用单张2080Ti 22G魔改显卡配256G内存,走FastLLM混合推理跑出11~12 token/s。哔哩哔哩甚至还有人直接拿双路X99主板把它部署了起来。这些方案横跨消费级平台、老服务器平台和垃圾佬平台,能跑出可用速度的共同点只有一个:内存容量够大、内存通道够多。

原理并不复杂:V4-Flash是284B参数的MoE模型,混合推理的核心思路是把注意力层和共享专家放上GPU,把海量专家层放进CPU加内存。CPU负责调度运算,但决定「能不能跑、跑多快」的,是内存能不能装下权重、喂得上数据。所以EPYC在这波装机里扮演的不是「高性能CPU」,而是「便宜的内存扩展坞」:一块服务器主板能给到8通道甚至16通道DDR4插槽,内存容量和带宽上限都是消费级平台给不了的。

DeepSeek涨价后自己装机划算吗:二手EPYC本地大模型机档位拆解,瓶颈不是CPU是内存

档位表:多少钱,配多大内存,跑出什么速度

以下都是DeepSeek V4系列本地部署的实测数据,来自多位博主的实测帖与视频,按内存容量从低到高排:

128G档:能用的入门线。官方284GB的原始模型,通过非对称量化方案可以压缩到85GB,128GB设备就能本地部署。哔哩哔哩128G统一内存的设备经过优化后,输出峰值约48 Tokens/s,日常大多稳定在20~40 Token/s。哔哩哔哩垃圾佬路线更直接,4条三星32G服务器内存凑128GB就够。小红书

DeepSeek涨价后自己装机划算吗:二手EPYC本地大模型机档位拆解,瓶颈不是CPU是内存

192G档:消费级性价比甜点。消费级主板加一张3090再加192G内存,跑Q8无损版约10 token/s,模型运行时占用约131GB,博主的建议是内存别低于160GB。哔哩哔哩

256G档:老平台的稳妥选择。单张2080Ti 22G魔改卡配256G DDR4 ECC内存,FastLLM混合推理实测稳定在11+~12+ Tokens/s。哔哩哔哩同一视频还专门验证了DDR4与DDR5、NUMA、内存带宽对速度的影响,结论一致:通道插满,速度上一个台阶。

512G档:正经生产力的起点。双路epyc 7642、16通道DDR4内存加两张5060Ti,Flash原版开启推测解码后最高输出decode 40t/s。哔哩哔哩也有人一万元攒一台64核EPYC加512G内存的服务器,干脆不装显卡,纯CPU推理。小红书

1TB档:目前的家用天花板。双路epyc 7642加1T DDR4内存,再配两张3090和两张5060Ti,DeepSeek-V4-Pro原版输出速度15t/s。哔哩哔哩想在家跑Pro原版,这基本是目前唯一的路。

再给个对照:Mac路线上,M3 Ultra加512G统一内存跑Flash量化版,接近200K上下文时TG还能保持20.8 tok/s。哔哩哔哩不想折腾硬件、预算又够的话,这是现成答案;只是512G配置的价格,也妥妥是EPYC方案里的「重度档」预算。

钱到底花在哪:CPU便宜,内存贵

看完档位表会发现一个反直觉的事实:整机里最不值钱的恰恰是CPU。一颗二手64核EPYC 7642不过几百元,真正的大头是配套的主板和大容量内存——而且内存还在涨。DDR4三季度还要再涨50%,DDR5同比涨幅已经冲到483%。小红书原因也不复杂:晶圆厂都在赶HBM和AI订单,成熟制程的DDR4产能没人管,供需错配之下现货价涨得最猛。

所以这波装机里最狠的方案,干脆把DDR3都翻了出来:E5-2698BV3加X99主板加DDR3 ECC 16G两条,整机算下来总共2887元(不含显卡)。小红书帖主那句话点破了本质:好在推理机不需要对平台有很高要求。只要内存装得下、喂得饱,上上代的洋垃圾也能发光发热。

DeepSeek涨价后自己装机划算吗:二手EPYC本地大模型机档位拆解,瓶颈不是CPU是内存

主板是第二大件。好消息是零售带质保的新板出现了,华南金牌H12D被称为首款零售带质保的单路Epyc主板。哔哩哔哩二手拆机主板更便宜,但BIOS设置、BMC固件这些坑要自己扛,这部分的钱不建议盲省。

坑,已经有人替你踩过了

第一,多卡不等于快。有人实测8张2080Ti 22G跑Flash,结论先放:能跑,但毫无性价比。哔哩哔哩问题出在没有NVLink互联时,llama.cpp只能按层切分,任一时刻只有一张卡在满负荷计算,其余七张干等。MoE混合推理堆显卡收益很低,钱不如花在内存上。

第二,先定量化版本,再定内存容量。同一个模型,官方原版、Q8和低比特量化版的体积差着好几倍,Q8版运行时就占131GB,建议配置不低于160GB。哔哩哔哩拿着128G内存想跑原版,是最典型的预算错配。

第三,机箱和电源别将就。垃圾佬帖主的血泪教训:3090涡轮版太长了,普通机箱完全塞不下,最后把海景房机箱都贡献了出来;双3090单卡375W的功耗,1200W电源只是勉强,他直接上了1650W。小红书

第四,内存通道插满,NUMA别乱绑。40t/s这类速度都是在16通道插满的前提下跑出来的,8通道平台尽量把通道占满,进程按NUMA节点分配,速度差距会非常明显。

谁该装,谁别装

先说谁别装:轻度用户。涨价后的API依然很便宜,有人实测1.6亿Token只花9块。哔哩哔哩而且新价格有闲时折扣:白天9-12点、14-18点是高峰,夜里和周末属于闲时,闲时价格直接打对折。微博每天用量不大的话,闲时API完全够用,装机纯属给自己找活干。

适合装的三类人:一是每天大量调用token的coding、写作重度用户,本地机器边际成本几乎为零;二是有数据不出本机需求的隐私敏感用户;三是把装机本身当乐趣的折腾党。但要有心理预期:本地速度普遍在10~40 token/s,跟云端API拼不了高并发,图的是长期零账单和数据自由。

值得盯的信号

EPYC这个领域最大的变量已经在路上:7月24日AMD发布了第六代EPYC Venice CPU,台积电2nm工艺,256核心、2030亿晶体管、5GHz+频率。微博发布会规格页上256核512线程、1.6TB/s内存带宽、PCIe Gen6这些参数,说明新平台仍是数据中心导向;但按以往规律,新一代上市后,上一代Rome、Milan的二手行情会松动一轮,想蹲双路7003、9004系列的可以留意。

DeepSeek涨价后自己装机划算吗:二手EPYC本地大模型机档位拆解,瓶颈不是CPU是内存

还有两件事值得持续观察:一是内存价格,DDR4若真如预期再涨50%,整机方案的成本优势会继续收窄;二是DeepSeek后续的价格调整和峰谷规则,直接决定「本地装机值不值」这道题的答案。有新的实测数据出来,这篇会继续更新。

内容由AI生成

精选参考来源

1. #DeepSeek涨价后怎么用更划算# 8月17日零时起,DeepSeek-V4系列API正式启用全新定价机制

2. deepseek怎么涨价这么多!两天花了30我真服了…

3. 消费级本地部署 DeepSeekV4-Flash 0731 Q8 无损量化

4. 【实测】单张2080Ti 22G + 256G内存运行DeepSeek-V4-Flash!FastLLM混合推理速度到底有多快?

5. Redis之父开发DS4引擎!Mac128G本地跑DeepSeekV4-Flash|贪吃蛇+STM32嵌入式全实测

6. 不用MacM3Ultra了!AITOPATOM本地跑DeepSeekV4Flash!128G内存塞满,512K上下文实测

7. 跑开源视频模型minimax-H3垃圾佬方案

8. Lsglang 40ts混合推理DeepSeek V4 Flash 0731原版,双epyc7642,ddr4 16通道,双5060Ti

9. 万元服务器本地跑起满血Deepseek R1 671b

10. DeepSeek-V4-Pro-0813原版,推测解码15t/s,双路epyc 7642,1T ddr4 3200,3090*2 + 5060Ti *2

11. Mac竟然能本地跑284B!DeepSeek V4 Flash 0731实测:M3 Ultra 512G,20万上下文还有20 tok/s

12. 离谱!!DDR4还在涨??

13. 垃圾佬方案千元廉价服务器配双3090做推理机

14. 华南H12D装机注意事项及功耗测试,首款零售带质保的单路Epyc主板,本地aideepseek671b服务器主板

15. DeepSeek-V4-Flash-0731 本地2080Ti推理测试

16. 1.6亿Token只花9块!DeepSeek V4 Flash实测:梁圣,还是梁子?

17. #DeepSeek调价方案# DeepSeek这次API调价算是行业一个大信号,8月17号正式上线峰谷定价

18. AMD 发布第六代 EPYC Venice CPU:台积电 2nm 工艺,256 核心、2030 亿晶体管、5GHz+ 频率

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章