前阵子刷到一条视频,标题特别扎心:《现在怎么没有人提用AMD MAX 395去跑本地大模型了?》。哔哩哔哩评论区两百多楼,基本就是本地跑模型的人在大倒苦水。
但诡异的是,这条路线明明没死。苹果上周发布新Mac mini和Mac Studio,发布稿通篇都在讲本地AI。知乎8月底极摩客刚发了台AI Max+395的迷你主机,宣称能跑235B大模型。哔哩哔哩连英伟达都带着128GB统一内存的RTX Spark到处巡展。知乎
一边是"没人提了",一边是新品不断。这个反差挺值得掰扯的——到底是统一内存这条路翻车了,还是买它的人不再吆喝了?我把知乎、B站这半年的实测帖子翻了一遍,结论先放这儿:统一内存没翻车,它只是被"容量幻觉"坑了一轮,现在正回到自己该待的位置。

“装得下"和"跑得好”,是两笔完全不同的账
很多人(包括我自己最初)对统一内存的理解就一句话:显存不够,内存来凑。128GB统一内存,听起来比5090的32GB显存阔气多了,284B的大模型都能塞进去。
问题出在第二笔账上。大模型生成每一个token,都要把模型权重从内存/显存里完整搬一遍进计算单元,所以推理速度很大程度上取决于带宽,而不是容量。知乎把三条路的账面数据摆在一起看:
RTX 5090:32GB显存,带宽1792GB/s;
RTX 4090:24GB,1008GB/s;
M5 Pro(64GB统一内存):307GB/s;
AMD AI Max+395(128GB统一内存):256GB/s;
DGX Spark(128GB):273GB/s。
容量上统一内存碾压,带宽上被独显碾压,这就是全部矛盾的根源。知乎

有开发者在AI Max+395上跑DeepSeek V4 Flash(284B)跑到32 tok/s,当时刷屏了,“APU实现token自由”。哔哩哔哩但注意,那是MoE模型,每个token只激活一小部分参数,搬的数据少。换成稠密模型就露馅了:有人在64GB的M5 Pro上实测Qwen 3.8 27B的4bit版,短上下文也就33 tok/s;同一道题,4090能跑117 tok/s,5090是138 tok/s。知乎

差的那四倍,就是带宽的差距。容量决定"能不能开机",带宽决定"开机后你等不等得起"。
它为什么安静了:三个很现实的原因
回头看"没人提"这事,社区里踩坑的人基本指向三处。
第一,内存涨价把性价比打没了。 AI Max这套统一内存用的是特挑颗粒、四通道设计,成本本来就高。知乎偏偏今年DDR5一路暴涨——有大内存需求的AI用户(包括拿核显共享内存跑模型的人)把48G×2、64G×2买成了硬通货,96GB内存从两千多涨到七千左右。结果是:原本"加条内存"就能平替的玩法,成本也上来了,AI Max整机更显得不便宜。
第二,软件生态慢半拍。 这套平台要靠ROCm和llama.cpp这条线才跑得动,首发那批机器(比如幻X 2025)发出来大半年,主流框架的适配才慢慢跟上。抢首发的人等于花钱当测试员,这批人的差评声音最大。
第三,也是最伤的:买的人发现自己要的根本不是它。 很多用户是被"128GB"吸引来的,真实需求却是跑ComfyUI生图生视频、追最新的CUDA工作流——这些恰恰是带宽和CUDA生态说了算的场景。一位入手64GB M5 Pro的用户复盘得很直白:机器装得下Qwen 3.8 27B,可一旦想本地跑视频模型,大量工作流只有CUDA实现,Metal这边缺算子、报错,最后只能退回云端。他总结的那句话我觉得值得裱起来:64G回答的是放不放得下,带宽和软件生态回答的是放进去以后跑多快。知乎
买了的含泪出二手,没买的观望,热度自然就下去了。
但这条路线没死:它只是换了一批用户
把实测数据看全了会发现,统一内存机器在自己的主场依然很能打:
单机跑MoE大模型,不想折腾多卡。 gpt-oss-120B这种120B级MoE,DGX Spark上常见报告是40-60 tok/s。三张3090组多卡能跑到100-120 tok/s,但那是水冷、巨型机箱、上千瓦功耗换来的。知乎AI Max 395迷你主机跑235B、284B级的MoE量化版也能出字,图的是"一台安静的小盒子",不是跑分。

离线、隐私是硬需求。 材料不能上传、机器必须断网,这种场景下本地能装下多大模型就是多大话语权。统一内存是目前单机容量最便宜的解法。
不想学装机的人。 迷你主机插电即用,对比双卡工作站的供电、散热、PCIe通道,省心本身就是价值。
所以更准确的说法是:独显卖给要快的人,统一内存卖给要大的。 之前的问题在于,营销把"大"说成了"又快又大"。
2026年现在要买,我的建议是按需求对号入座
生图、生视频、追新模型、要高吞吐:老老实实N卡。预算内16GB起步(5080整机大约2.5万档),24GB更从容。别被"5090"三个字冲昏头——国内能买到的5090 D v2是24GB版,起售价16499,装不下的模型照样装不下;社区还碰到过它在Ollama特定版本崩溃的案例,新卡生态还在补课。知乎
单机跑120B-284B级MoE、要安静、不想折腾:128GB版AI Max+395迷你主机或DGX Spark。记住买128GB,64GB版是重灾区——统一内存没法自己加,买小了只能整机换。
便携+离线+日常办公混用:64GB起步的Mac,Qwen 3.8 27B 8bit实测15-20 tok/s,能用,但别指望它当视频工作站。知乎
预算八万、要单卡装70B-120B:可以看看84GB的RTX Pro 6000D,7月社区询价5万出头,注意它是600W的服务器卡,散热要另花钱改。知乎
只是偶尔用用:认真算一笔账,这笔钱买云端额度可能爽用一年。

接下来值得盯的三个信号:一是9月下旬新Mac Studio(M5 Max 128G/614GB/s)交付,苹果官方数据之外第一批第三方实测出来之前,大内存Mac先别急着下单。知乎二是内存价格——DDR5这轮涨势和大模型进入长上下文时代绑在一起,统一内存机器的成本短期难降。知乎三是英伟达Rubin已经官宣全面量产,数据中心卡供给改善后,云端推理价格大概率继续往下走,本地机器买贵了也不心疼的前提是——你用它做的事云端真的替代不了。知乎
一句话收尾:本地跑大模型的钱,先买"带宽和生态",再买"容量"。顺序反了,就是下一个在评论区倒苦水的人。