今年8月,本地部署圈基本都在聊同一件事:Qwen3.8-27B开源了。知乎B站一条聊Qwen3.8实测的视频能跑到9万多播放、900多条评论,"本地部署Qwen3.8"的内容每天都在往外冒。哔哩哔哩背景也不藏着:API的token一直在涨价,有B站UP主感叹,普通开发者快扛不住API成本了,27B开源算是喘了一大口气。于是越来越多人开始算同一笔账:把27B放进自己机房,到底要什么配置。
这波里最有意思的,是小红书上一份四卡机排雷帖。一位广东的公司用户,用华南金牌H12D-8D主板配EPYC 7452,塞了4张Pro5000 48G,专门跑Qwen3.8的nvfp4量化,目标是"公司用,只考虑27b,尽可能多几个并发"。小红书帖子8月17号发的,一直更新到21号,45条评论里全在讨论技术细节。它珍贵就珍贵在:踩过的坑,一个没落下全写出来了。
先看这台机器:为通道数而生的配置
配置单先摆出来(均按楼主描述):
主板:华南金牌H12D-8D,单路EPYC,8条DDR4插槽、4条PCIe 4.0 x16
CPU:EPYC 7452,Rome架构24核
显卡:4张Pro5000 48G
电源:长城N20 2000W
机箱:没有机箱,开放式机架,淘宝深圳的店,一百多块
为什么是寨板?一句话:消费级平台给不出4条直连的PCIe 4.0 x16。那篇帖子的评论区里,一位跑双5070Ti的用户直接说"考虑整4卡,但是没合适的主板"——这就是H12D这类板子的生存空间。EPYC 7002/7003给足128条PCIe 4.0通道,寨板厂把它做成零售板,还带质保,这是过去只能蹲咸鱼摸奖的东西。去年这板子刚出时,上手测过的用户给出的评价是:“能上4张双槽涡轮卡 3个m2硬盘 还带bmc 只要2千多的价格”。小红书

坑一:一根没屏蔽的延长线,白折腾三天
这是全帖最疼的一个坑。楼主原话大意是:PCIe 4延长线一定要用带屏蔽的,“黑色那种排线千万别用,会有通讯干扰,线尽可能不碰金属”。小红书他在这上面卡了整整三天,先后怀疑主板坏、显卡坏、vllm配置不对,买了退、退了买,最后发现问题就出在延长线互相干扰。
这个坑不是寨板独有,但在这种机器上中的概率远高于普通装机。一是PCIe 4.0对信号质量的要求比3.0高,线材更敏感;二是四卡机器线材密度大,开放机架没有机箱理线,线贴着线,干扰概率直线上升。B站早有"一根显卡延长线烧了我俩张显卡"这种6万播放的血泪帖。哔哩哔哩当年"精粤主板用显卡延长线无法开机"的4万播放视频,也是线材和协议设置惹的祸。结论很简单:都上PCIe 4.0四卡了,别省这一两百块的线材钱,认准带屏蔽。
坑二:没有NVLink,就别硬上张量并行
评论区有条很扎心的:"你这卡没有NVLink,四卡张量并行带宽低得吓人,完全浪费算力。"楼主的回复只有五个字:“所以tp=1。”
他自己跑出来的数据也站在这个选择这边(按楼主描述):
vllm,tp=2 dp=2,131k上下文,18并发:很慢,只有30 token/s左右
tp=1,每张卡各起一个实例,nvfp4量化:192k满载、12并发,能到111 token/s
道理不复杂:Qwen3.8-27B的nvfp4量化,一张48G的卡装得下,评论区有用户实测"单卡、双路192k、开了MTP正好到47.1G"。模型单卡能装下时,每卡一个实例做数据并行,通常优于把模型切开做张量并行——后者在没有NVLink的卡上,每生成一步都要跨卡通信,全走PCIe,带宽直接变瓶颈。评论区还有人说"4卡通讯,tp=4完全不能动",方向是一致的。顺带一提,也有人甩出"同价格不如8卡A100",这当然是条路,但8卡A100的电源、散热和主板预算完全是另一个量级,不是每个小团队够得着的方案。
坑三:框架也分快慢,换SGLang后并发稳了
8月19号,楼主把推理框架从vllm换成了SGLang,同样这台机器:154K上下文,稳定16并发,50 token/s左右。小红书他还给了一个很实用的结论:这台机器的甜点区是16-18并发,“往上可以20并,但不是带宽问题,是算力不够,等待时间巨长”。同型号显卡的单卡公开压测也印证了这个取舍:飞致云用一张RTX Pro 5000 Blackwell部署Qwen3.8-27B做并发压测,并发往上抬,人均输出吞吐一路走低——并发从来不是越高越好,甜点区就是总吞吐和人均体验的平衡点。知乎

参考系也值得记下:他同时测了老寨板平台,X99加双3090跑w4a16量化,263K上下文、双并发,60 token/s。小红书也就是说,本地模型这波浪潮里,老寨板平台并不是废铁,关键看你跑什么量化、要多少并发。
坑四:寨板专属——内存没插满,BMC只学了半套
这个坑才真正属于华南金牌自己。楼主特意提醒"内存建议插满,目前是预算不够"。小红书H12D-8D是八通道平台,8条插槽不插满,内存带宽就打折扣,而推理服务恰恰是带宽敏感型负载,这部分损失是实打实的。
另一块是BMC。7月B站那条144条评论的测评说得挺直白:“值得鼓励,但终究还是拉完了”——新版BMC升级了,但老模块用户要寄回官方升级、等物料;装机须知视频的评论区里也有人吐槽,BMC除了KVM,风扇调速、硬件信息这些基础功能缺失。哔哩哔哩再加上这台机器待机不插显卡也要150W、不支持睡眠,公司机房无所谓,想搬回家的话这两点比想象中膈应。还有个官方都点名过的细节:H12D装机时螺丝孔位和普通ATX不一样,要补齐机箱缺失的铜柱、去掉多余的铜柱,不然会磕坏板子背面。
这套机器,到底适合谁
把小红书、B站这一波讨论摆在一起看,大致分三类人:
第一类,一张卡就够的,别碰EPYC寨板。Qwen3.8-27B的Q4量化,16G显存都有人跑出70 token/s,24G显存轻松装下,完全没必要折腾服务器平台。
第二类,双卡用户,普通消费级主板就够。评论区里双3080 20G、双5060Ti 16G、双2080Ti魔改的部署方案都不少,Z390这种x8+x8拆分的板子就能干。
第三类,要上3-4张卡、要长上下文、要多人并发的,才真正需要EPYC的通道数。这时候华南金牌H12D-8D几乎是零售市场里为数不多、带质保的选择——也有用过的用户拿它和超微H12SSLi对比,结论是"开机自检加速,还带显示指示灯,还有BMC,插线接口布局非常合理,国产确实崛起了"。小红书但你也得接受它的半成品BMC、150W待机、以及延长线的试错成本。
接下来有两个信号值得盯:一是双路版H12D-16D的铺货进度,这块板5月已经亮相,官方评论区里催双路的帖子从去年排到现在,它真正大规模上架,会直接抬高多卡机的上限。哔哩哔哩二是配件价格,三天前刚有用户发帖帮群友装4卡水冷塔式机,用的也是华南H12D,配完就在感叹"最近看大部分配件一直再涨,估计今年会慢慢持续涨价,内存固态还会涨"——H12D平台只能上D4,这波内存涨价会直接影响"插满8条"的成本,想上车的得把这笔账算在前面。小红书

最后问一句:你的Qwen3.8现在跑在什么配置上?欢迎评论区报一下卡、并发和速度,给正在纠结装机的人一个参照。