知乎上有个 194 赞的帖子,标题就是一部翻车史:16GB 显存根本装不下 32B 的模型,白花 3000 块,最后只能跑个 7B 的小模型。这不是个例。B站一位 UP 主把自己手里的迷你主机一台一台测了过去,跑了 29 个模型:最快的一台每秒吐 63 个字,最慢的一台每秒 2 个字,差了 30 倍。而它们的价格,可能只差一千块。知乎哔哩哔哩
更扎心的是另一个实测:同样 32GB 内存的机器,插两条内存和只插一条,核显推理性能差了 81%。芯片型号一字不差,速度天壤之别。哔哩哔哩
2026 年买迷你主机跑本地大模型,最大的坑不是品牌、不是芯片,而是你根本不知道手里这台机器"能装多大的模型、能跑多快"。厂商现在都爱在详情页印一个"AI PC"标,但没人告诉你:这个标,和你的内存容量之间,隔着一条硬邦邦的物理分级线。
今天把这条线画清楚。
一、先说结论:容量决定"装不装得下",这是一条没有商量余地的线
本地跑大模型,第一道门槛只有一个字:装。模型参数要完整放进内存/显存里,装不下就是装不下,算力再强也没用。
按社区实测和各路数据,可以画出一条五档能力线:
第一档:16GB —— 7B~9B 量化版,勉强够用
9B 级模型 Q4 量化后大约只吃 5-6GB 内存,16GB 机器装得下,还能留出系统和上下文的空间。知乎有篇 814 赞的攻略说得很直白:9B 模型量化版 8G 显存可以跑,但很勉强,16G 才算舒服。至于"16G 跑 27B"?B站确实有人用 Mac mini M6 16G 跑通了 Qwen3.8 27B 的 Bonsai 2 剪枝版,但那是把模型"削"到只剩骨架的特殊玩法,不能当作 16G 的常规能力。知乎哔哩哔哩
第二档:32GB(必须双通道)—— 14B~27B,中端甜点起步线
27B 模型 Q4 量化后需要 24GB 左右起步,32GB 刚好装下还有富余。但注意前面说的那个实测:32GB 插两条和插一条,性能差 81%。买这个档位,双通道是底线,不是加分项。
第三档:64GB —— 32B 全量化 + 长上下文
32B 级模型 Q4 量化约需 32GB,64GB 机器可以同时开长上下文、挂知识库,是"认真用 AI 干活"的入门档。
第四档:128GB 统一内存 —— 120B 级,质变线
这是 AMD AI Max+395 这批机器的主场:128GB LPDDR5X 统一内存,约 110GB 可以分给核显当"显存",能一口气装下 GPT-OSS 120B 这种级别的模型,实测约 11 tok/s——比阅读速度慢一些,但已经是"能对话"的水平。知乎昨天刚出的一篇四方横评给的结论是:AI Max+395 迷你主机是"2026 年普通人的性价比之王",用 DGX Spark 约一半甚至更低的价格,换来同样 128GB 容量、只慢约 6% 的推理速度,功耗还只有 120W。知乎
第五档:192GB —— 320B 级,但价格是 5 万
AMD 新一代 AI Max+ PRO 495 把统一内存顶到 192GB,CPU 和 GPU 共用同一个内存池,最高 160GB 可以设为可变显存,官方口径能本地跑 GLM 5.3 Flash 320B 这种三千亿参数模型。磐镭的机型已开启全网首发预约,相关知乎问题的标题直接就在问价格怎么这么贵。听起来很美,但极摩客 Evo-X5 Pro 的定价是 5 万元。这一档目前不是消费决策,是信仰充值。知乎知乎知乎

一个有意思的对照:铭凡现在官方视频置顶评论里,已经直接给自家产品线标了"能跑多大的模型"——M1 Lite 跑 3B、UM880 Plus 跑 7B、M2 跑 7-14B、X1 Pro-470 跑 13-30B、带 5060 独显的 G1 Pro 跑 3-20B。厂商开始把话挑明,这是行业进步;但这份"官方分级"更该拿来当验证对象,而不是信仰依据。哔哩哔哩

二、再说速度:带宽和通道数,决定"跑得快不快"
装得下只是及格,跑得快才算好用。这里的规律简单粗暴:推理速度约等于内存带宽除以模型体积。
所以你会看到这样一组实测数字:RTX 5090 独显能跑到 224.8 tok/s,RTX 3060 12G 只有 55 tok/s;Mac Studio M5 Max 128GB 跑 Gemma4 31B 约 23.9 tok/s,靠的是 614 GB/s 的带宽;而 AI Max+395 同样跑 31B 级模型只有约 10 tok/s,因为它的带宽只有 256 GB/s。知乎

这就是迷你主机的先天短板:统一内存再大,带宽摆在那。好消息是软件正在补课——针对 Strix Halo 平台的新推理引擎 halogen 和 SnowLLM 上线后,知乎有测评直接用了"halogen已经可以让你获得Token 自由了"当标题,395 平台的实际推理效率被明显拉高。买 128GB 这档机器,值得把"社区优化活跃度"也算进决策。知乎
至于笔记本和迷你主机详情页上那个大大的"NPU 50 TOPS"——跑 70B 大模型时它基本帮不上忙,主力永远是核显/独显加内存带宽。TOPS 数字好看,但那是营销税,别为它掏钱。
三、两个正在改写分级线的变量,买前必须知道
分级线不是铁的,2026 年有两个变量正在松动它:
变量一:小模型在变聪明。 知乎一篇 222 赞的年度精选里提到,5-9B 的小模型在 MMLU-Pro 综合推理评测上跑出 82.5 分,反超了 OpenAI 的 GPT-OSS-120B(80.8 分)。9B 打赢体积 13 倍的对手,两年前不可想象。这意味着"16G 档只能跑玩具"的老印象正在过期——对写作、翻译、代码补全这些日常任务,一颗蒸馏到位的 9B 模型可能就够了。知乎
变量二:新推理技术在压容量。 10 月初爆火的 Strata 项目(B站相关视频播放 14 万+)演示了用 12GB 显存跑 125B 参数的 Qwen3.8-Flash-Next,短文本场景能到 90+ tok/s。原理是把不常用的层放到内存/硬盘里按需调入。知乎

这类技术如果成熟,"小内存跑大模型"会从演示变成日常。但要泼一盆冷水:目前它依赖特定模型适配,稳定性和通用性还没经过大规模验证,别拿演示视频当选购依据。
这两个变量指向同一个策略:为"确定性"买容量,不为"追新"付溢价。 硬件容量是买定离手的,软件红利是白送的——先保证装得下,再等着技术迭代给你加速。
四、内存涨价的年份,这笔账要重新算
绕不开的大背景:存储涨价潮。按 9 月的华强北口径,32GB DDR5 套装从约 900 元涨到 3300-3900 元,16GB 单条从 450 元涨到 1500-1850 元,1TB 固态从 410 元涨到 930-1000 元。美光 CEO 甚至放话,2027、2028 年的供需可能比今年更紧。这对迷你主机选购的影响是颠覆性的:知乎知乎
"准系统+自己加内存"的省钱路线,基本被堵死了。 去年买台准系统再插两条 32GB 是最会玩的姿势,今年这套操作要多花三千多,比直接买整机还贵。
板载大内存整机,从"坑"变成了"值"。 以前我们劝人远离焊死内存的机器,现在 AI Max+395 这类板载 128GB LPDDR5X 的机器,等于把内存成本锁死在整机价格里——在涨价周期里,这反而是保护。闲鱼上连板载 24GB LPDDR5 的国产锐龙 R7 准整机,都开始被当成"内存贵过整机"的捡漏对象。
中端档依然优先买带插槽的。 32GB/64GB 这个价位段,"内存能不能自己加"仍然是第一优先级:哪怕内存贵,加一根也比换整台便宜。华硕破晓 VM61 这类用 DDR4 插槽的机器重新吃香,也是同一个逻辑——16GB DDR4 只要 650 元,DDR5 要 1400 元。知乎
五、掏钱之前:店里四步验机法
不管线上线下,下单前把那位 B站 UP 主的四步走一遍,能避开 90% 的坑:
问容量:内存多大?板载还是插槽?
问扩展:能不能自己加?最大支持到多少?
数通道:32GB 是两条 16GB 还是一条 32GB?(单通道直接砍掉一半带宽)
跑一句:让商家现场跑一个模型,数第一个字出来要等几秒——首字延迟骗不了人,跑分可以。哔哩哔哩

然后按预算对号入座:
2000-3000 元,尝鲜党:目标 7B-9B 代码副驾、文案助手。32GB 双通道是底线,16GB 机器再便宜也别碰。这个价位跑 8B 档正合适,别幻想 27B。
3000-6000 元,干活党:敏感文档本地处理、翻译、写作。优先 64GB 或高带宽 32GB,14B-27B 量化模型是主力。评论区有位说得实在:“纯码代码的带个 7B 模型两千多足矣”——先想清楚自己是不是这类人,能省一半预算。
6000-15000 元,认真玩 AI:120B 级的质变档。AMD AI Max+395 的 128GB 机器是当前性价比锚点;预算再往上,Mac Studio M5 Max 128GB 胜在带宽、静音和生态,适合既要跑模型又要剪片的人。值不值,还可以算一笔账:AMD 官方按每天 8 小时智能体负载测算,纯云端调用 6 个月约 4641 美元,本地设备(硬件+电费)约 4096 美元,交点大约落在第五至第六个月——重度用户半年就能把机器钱跑平,轻度用户则相反,云端按量付费更划算。知乎
想碰 320B 的:192GB 的 495 机器定价 5 万,等等党稳赢概率很大——这个价格里有多少是内存涨价的泡沫,明年初就见分晓。

最后留三个观察信号,值得加进你的收藏夹定期看一眼:三星 11 月中旬恢复 DDR5 合约报价后的价格走向;双 11 期间 AI Max+395 机型的实际成交价有没有破发;Strata 和 halogen 这类推理优化什么时候支持你在用的那个模型。
内存涨价的年份,买迷你主机跑 AI 的逻辑只剩一句话:先保装得下,再谈快不快,容量买确定性,速度等软件红利。