先交代这篇文章替谁写:手里捏着五千到五万预算、Q4 想给自己攒一台"能跑 Qwen3.8、DeepSeek V4 Flash 这一代开源旗舰"的机器的人。他现在大概率在四个选项里反复横跳:上 5090 整机、咬头上 DGX Spark、买 128G 统一内存迷你主机、或者干脆把老 8G 卡再榨一榨。我不讲 Ollama 怎么装,也不复述"本地部署更省钱"这种车轱辘话——那篇《很多人认为本地部署一个大模型就实现 token 自由》的知乎问题已经刷到一百多万浏览,常识不需要再讲一遍。这篇只干一件事:把全网这两天晒出来的真实测速数字,按路线摆到同一张桌上。知乎
这周为什么值得专门算这笔账:9 月 19 日 Qwen3.8-27B 开源,官宣口径是"最低 8GB 显存就能跑"。小红书那条拿了 222 赞、343 收藏;接着几天,第三方量化和提速方案像下饺子:ISTA 系的 GSQ-RCO、专调 3090/4090 的 HyperQwen、swift 1.5 改版、给苹果硅写的开源引擎 Splash。与此同时,DGX Spark 四机组网的帖子把 Mac 党和 N 卡党又点燃一次,而内存和显卡正在双双涨价——有帖子原话是"DDR5 现在又贵得离谱",连五年前的二手 3090 都半年涨了一波。也就是说:选型窗口期撞上方案爆炸期,这是今年最适合算账的一周,也是最容易买错的一周。小红书知乎小红书
先把数字摆上桌:这周全网晒出来的实测
以下全部来自各博主自己晒的终端截图或日志,我把口径一起抄回来——本地圈吹牛不带口径的太多了,口径本身就是信息。
方案 | 路线 | 跑什么 | 实测速度 | 口径备注 |
|---|---|---|---|---|
RTX 5070 Ti(16G) | 单卡 | Qwen3.8-27B | 25.21 token/s | 9/25 小红书,鹈鹕测试 13685 token |
RTX 5090(32G) | 单卡 | Qwen3.8-27B NVFP4 | 130+ token/s | 权重仅占 20G 显存 |
RTX 5080 Laptop(16G) | 单卡+三值量化 | Bonsai-2-27B | ≈90 token/s | 9.8G 制品文件,25 万上下文,自建 40 题全对,9/26 知乎 |
M5 Max Mac | 统一内存+多并发 | Qwen3.8-27B | 144 token/s | Splash 引擎,注意是"四路"合计吞吐 |
DGX Spark 单机 | 统一内存小超算 | Qwen3.8-Flash NVFP4 | 平均 30 token/s | 128K 上下文口径 |
8G 老卡+大虚拟内存 | 单卡硬扛 | Qwen3.8-Flash-Next 177B | 6 token/s | 32G 内存、虚拟内存拉到 96G,56/60 正确率 |
普通笔记本(无显卡) | 硬盘跑专家 | 744B 级 colibri | 0.05–0.1 步/秒 | 答案对,但只适合挂机 |
迷你主机双机 vs 单机 | 集群 | 70B 级 | 双机反而更慢 | 万兆网 1.25GB/s,比片内带宽低约 200 倍 |

这张表里最扎眼的是 27B 那一行行的对比:同一代模型,5070 Ti 上 25,5090 上 130,差了五倍——而 5090 的算力并不是 5070 Ti 的五倍。秘密只有一个:本地推理的交互速度,短期看基本是内存/显存带宽的函数。27B 模型量化后一步要把十几 GB 权重从显存里读一遍,带宽多高,每秒能过几遍。投机解码、多路并发、量化位宽都是在"少读点"或"读得更巧"上做文章,谁也逃不出带宽这个底。
所以看测评先别看 t/s,先看它是什么模型、什么量化、多长上下文、单路还是并发。DGX 评论区那条骂得难听但在理:感觉没有一个本地部署实践过,就拿着测评博主挑好的测评数据吹,长上下文是不敢提的。小红书
路线一:上张好卡,简单粗暴但最贵
单卡路线的逻辑最朴素:带宽买断,交互体验最稳。这周晒出的 5090 NVFP4 方案是 27B 档的天花板——130+ token/s,权重 20G 还留着 12G 给上下文,是目前本地"聊天级"体验的标杆。代价是 5090 本身溢价严重,海外博主拆机视频里已经在吐槽。小红书

A 卡党这周也有作业:一位 7900XTX(24G)用户晒了单卡跑 Qwen3.8-27B 的完整方案,小红书那条"花 1.6 万装的 AMD 电脑,跑出了本地最强大脑"拿到 12 条评论,基本都是来看结果的——跑通了。但 B 站有博主专门拆过这条推文的三个卖点:24G 显存是真的,“比 1000 美元便宜"两份比价汇总差了 49%,而"Windows 插上就跑”——AMD 自家的 vLLM 文档里只写了 Linux 装法。省下的显卡钱,很大概率要以折腾 ROCm 的时间利息还回去。小红书哔哩哔哩
路线二:大内存统一机器,门票是容量,电费是带宽
这是今年被吹得最狠的路线:128G 统一内存迷你主机(AMD AI Max+395 这一挂)和 Mac 大内存机型,卖点是"装得下别人装不下的"。
9/24 B 站那条"64G×2 换不来 128G 的速度"把物理账算得很清楚,建议准备买这类机器的直接背下来:395 这挂统一内存带宽 256GB/s,32G 版、64G 版、128G 版带宽一模一样——容量翻倍,速度一点不动。128G 单机最多划 96G 给 GPU,70B 量化确实装得下;但装得下不等于跑得欢,256GB/s 除以 70B 量化后的几十 GB,单路个位数 t/s 是正常水位。它真正的适用面是:离线批处理、数据敏感不能上云、长文档慢慢啃。想拿它一问一答当 ChatGPT 用,会失望。哔哩哔哩
同一天发布的海外实测(Hardware Canucks 中文字幕版)给了镜像结论:跑 70B 级别模型时,32G 显存的 5090 因为装不下被迫走 PCIe 通道来回搬数据,256G 统一内存的 Mac Studio 直接加载,速度快出 20 倍、功耗还相当。大内存机器不是更快,是"不溢出"——它赢在 5090 跌出舒适区的那一侧。所以这两类机器不是竞品,是补位:单卡吃 7B-27B 交互,大内存吃 70B+ 吞吐。哔哩哔哩

至于拿两台便宜机拼集群:万兆网才 1.25GB/s,比 395 片内带宽低约 200 倍,每次前向都要跨机同步激活值,"网络税"交到你怀疑人生。结论一句话:集群只补容量、不补带宽,适合挂任务,不适合聊天。哔哩哔哩
路线三:DGX Spark 组网,客厅里最贵的"宿舍"
这周骂战中心。小红书 9/25 那条《DSV4.1-Flash 四机组网 TP4,就问还有谁》拿了 16 赞 11 评。评论区一半在问"四台不是要交换机吗"“能跑 Kimi K3 吗”,一半在互喷 Mac 和 Spark 谁更强;更早几天还有博主晒 MiaAI-Lab 用 3 台和 4 台 Spark 跑 DeepSeek-V4.1-Flash 的记录(56 赞 29 评);9/7 有人用 4 台 Spark TP4 跑 285B 的 V4 Vision;到 9/26,已经有人自嘲"刚看到有人要搞 36 台的 Spark 集群,太疯狂了"。小红书小红书
真实水位大概这样:国行现货小三万一台(128G+4T),单机跑 Qwen3.8-Flash 量化平均 30 token/s——不算快,胜在安静省电、啥都不用拼。组网的溢价大头在网络上:那位被老婆"查房"的博主(55 赞 40 评)给两台 Spark 拉的是 200G 专用线,屋里风扇 24 小时呜呜响。而干电网那位博主半年回家测的结论被翻出来反复引用:“有些 AI 注定上不了云”,值不值三万看的是合规需求,不是 token/s。小红书小红书

对绝大多数个人用户,我的判断很直接:Spark 组网目前是小圈子行为艺术+真刚需(数据不能出门的行业用户)并存的品类,它解决的是"这台机器物理上必须存在",不是"更便宜的智能"。同样三万块,一张 5090 + 好 U 好内存的 27B 交互体验会快四倍以上。
路线四:跑不起就换打法——MoE 下放,这周最大的变量
第四条路线不花钱,改变的是"读多少"而不是"读多快"。MoE 模型每步只激活一部分参数,于是"大模型"第一次可以用内存和硬盘硬扛显存:
9/26 小红书那条《Qwen3.8 177B,8GB 卡跑通了》写得非常诚实(18 赞 23 评):72.5GB 的模型文件、32G 内存的机器,先把 Windows 虚拟内存上限从 47G 改到 96G,实测 6 token/s,6 项考试对 56/60,数学题全对;加载姿势不同速度差 3 倍(113 秒→59 秒→37 秒)。他的定位词我建议记住:“不适合聊天,适合挂机出活”——写长稿、啃长文档、读图核数。同一天还有个叫 colibri 的 2MB 纯 C 小工具在圈内传开(40 赞 101 收藏):常用层放内存、专家放硬盘,普通笔记本跑 744B,冷启动 0.05–0.1 步/秒,慢但答案是对的。小红书小红书

量化这条腿也在这周卷出新高度:Bonsai-2-27B 三值量化把权重压到 9.8GB,16G 笔记本卡跑出 90 token/s。周末冒出来的提速项目喊出稳跑 150 t/s、四并发 400+,一天收了 122 个收藏。电信团队的 Xing4.0-29B-A4B 则是从模型侧回应了大家的许愿——30B 级别 MoE,每步只激活 4B。知乎小红书

但这条路线的水也最深。177B 那位 UP 自己就在预告下期:“这模型三个参数数字,两个在忽悠人”;评论区也直接质疑"q1 量化的真能用吗?我觉得 q4 都很凑合了"。我的读法:慢速挂机路线的正确率数字是实的,但"旗舰能力保留多少"这种话术,在没有第三方基准出来前,一律按宣传价对待。
那三万块到底怎么花
把四条路线按预算和用途对号入座:
预算 ≤ 8k,手里有 16G+ 卡:别买新硬件。等社区基准把 Qwen3.8-27B 的各家量化版(GSQ-RCO/HyperQwen/swift)跑分出齐,25–90 t/s 的档位现在就能覆盖聊天到生产。
预算 1.2–1.8 万、要"人机对话级"体验:单卡路线,5090 整机或等量 A 卡方案(但要想清楚 Linux/ROCm 的折腾税)。这是目前单位 token 体验最确定的钱。
预算 3 万上下、有 70B+ 或行业合规刚需:大内存统一机器(Mac Studio 或 395 系 128G/192G)+ 接受"吞吐型"定位;只有"数据绝对不出门 + 模型单机装不下"两条同时成立,才轮到 Spark 组网。
预算不动、只想尝鲜:colibri/虚拟内存下放路线,一台笔记本今晚就能跑,代价是别拿它聊天。
还没有明确高频需求的新手:先用 API。"别急着买电脑本地部署模型,新手先用 API 入门"是这周小红书的高赞共识,比买错机器省下的是一整个季度的钱包。
另外提两个正在漏水的成本:内存和固态正在涨价周期里,大内存方案的"晚买享折扣"今年不成立;电费和回本别听夸张说法,装机圈那篇"显卡跑本地 AI 14 年才回本"的算法本身有争议(它把闲置折旧全摊给 AI 用量),但方向没错——本地部署的成本模型是"利用率 × 时长",买之前先数自己每天真的会跑几个小时。
接下来盯什么
9/27 早上,177B 帖主预告拆"参数忽悠",他自己点出这模型三个参数数字里两个在忽悠人。177B 档的真实能力保留度,会有第一轮社区答案;小红书
云栖大会(9/22)已经公布 Qwen4 在训。按节奏 Qwen3.8 系的 MoE 中小尺寸(比如大家许愿的 35B-A3B)随时可能补位,那会直接改写"上卡还是等大内存"的答案;小红书
"DeepSeek Harness 桌面客户端"安装包在圈内传开,但官方没有宣布。先按传闻处理;小红书
内存价格:如果 395/128G 方案回不去发布价,大内存路线的性价比会被持续削弱。
一句话收束:这周的数字证明,本地大模型已经不是一个预算的问题,而是四个——单卡买带宽、大内存买容量、组网买合规、换打法买时间。先想清楚自己每天要哪种"快",再掏钱。