九月底到十月头这几天,AI小主机圈有点过年那意思。微星10月2日把PRO MAX EDGE AI+摆上桌,4升机身、最高128GB统一内存,宣传语直接就是"把私人AI放到桌上"。 ACEMAGIC的锐龙AI Max+ PRO 495新机9月30日上架,给到192GB内存,官方口径是该机可本地运行70B Q4至200B MoE大模型,实测兼容DeepSeek V4 Flash 284B超大模型。 再往前一天,雷神AI Master M7000的实测视频挂在B站,64G内存的笔记本,靠一块在资源管理器里连盘符都没有的隐藏分区,跑起了59G权重的120B大模型,视频一天涨了一千四百多赞。小红书微博哔哩哔哩
再往回翻,这轮"装得下120B"的军备竞赛早就开始了。联想5月的AI主机P7喊出"190 TOPS、私有Token工厂、最大1220亿参数"。 6月的百应AI主机300说"实测流畅部署Qwen3.6-35B、GPT-OSS 120B";七彩虹灵创K16的软文更直接:“96GB动态显存,本地跑120B大模型毫无压力”,标准版23999元,一年省下的API钱说不定就回本。微博微博

9月1日的AMD发布会上,苏姿丰拎着饭盒大小的Max+395主机上台,现场跑起2350亿参数大模型。 微博搬运版的账算得更猛——“128GB版约2399刀,不到一年回本”。9月21日的M5 Pro Mac mini首发评测又把"本地AI到底能跑到什么水平"拿出来实测了一遍:本地跑大模型、让Agent自己写代码做网页、再到生成图片,逐项过堂。 这条980赞的评测微博下面,最高赞评论(710赞)问得很直接:"跑图生成质量到底咋样,要是脸崩了本地就没意义。"9月27日苹果给IT部门用户大会公布的一组数据也被搬了出来:很多人买Mac mini当AI主机,高端机集群甚至能跑1.6万亿参数的AI。微博微博微博

一边是刷屏,一边是"凉凉帖":两个帖子对不上账
有意思的是,同一时间在知乎,那个48万人看过的问题——“现在怎么没有人提用AMD MAX395去跑本地大模型了?”——10月1日最新回答在泼冷水:御三家(DeepSeek、GLM、Qwen)最新flash模型的"主流简化版",得256G才跑得动,预算直接上6-7万(二手Mac Studio的路子);96-128G机型玩社区魔改版可以,但商业价值有限,没法搞成Token工厂。知乎
但9月11日另一位答主(金猪升级包)给出的实测却完全相反:Qwen3.8-Flash-Next总参数176B、激活只有6B,“高容量低带宽需求,简直SuperUMA圣体”,128G的395单机Q4裸跑大约25 token/s,补上MTP之后Decode速度完全可用。 真正的短板是Prefill,只有300多token/s,9月18日用上社区加速方案后Prefill提升到3倍。他甚至用一根雷电线搞出了RDMA over USB4——两台Strix Halo互联的延迟从130µs压到7µs,理论上任意一台395小主机都能跑TP=2张量并行。34条评论吵的就是这两派。知乎
这两个帖子对不上账的地方,恰恰是买AI小主机前必须先拆开看的地方:厂商宣传的"支持120B/235B",和社区实测的"能不能干活",中间隔着至少四道数字。

买AI小主机前,先对一遍这四道数字
第一道:装得下≠跑得动。 "120B"是显存/内存口径,也就是量化后的权重塞得进去。雷神M7000那台64G内存机的实际口径就是59G权重的量化版,不是满血。同一台机器上Q4能跑和"毫无压力"之间,隔着的是你的耐心。
第二道:看激活参数,别看总参数。 统一内存平台真正的天花板是内存带宽,Decode阶段每个token都要流式读一遍激活权重。总参数176B但激活6B的MoE,带宽压力和十几B的小稠密模型是一个量级——这就是"Flash-Next把395带活了"的全部原理。 也是为什么同样128G,有人25t/s可用、有人只能玩魔改小模型。厂商页面上那个大数字,偏偏都只写总参数。知乎
第三道:核显"显存"是个设置题,不是硬件题。 395那颗Radeon 8060S没有独立显存,CPU和GPU共用同一套LPDDR5X。知乎有答主(枫淡月)做过三轮A/B:Windows下宣传"最多可分配96G显存",但他实测把carve-out从64G调到0.5G,Prefill反而快2.1-3.3倍,12个组合里0.5G设置赢下10个,Decode只损失3.5%-5.7%——"动态显存"这个卖点,设置错了就是负优化。 同一位答主5月的全栈方案也提过另一个坑:LM Studio在这类机器上会把GPU占用怼到99%造成系统卡顿,他的用法是LM Studio只负责下载、预览、测试模型,常驻交给llama.cpp。知乎知乎
第四道:用途比机器重要。 9月16日另一篇实测帖《我测了本地大模型的三个用途,两个行不通》把账算得很直白:5060Ti 16G(2800元)跑32B编码模型,层溢到内存后"每秒几个词,等它写完一个函数我手动都写完了";跑Wan 2.1出五六秒的视频要8-15分钟,“渲染机器比吃饭慢”;唯一活下来的是出图——LoRA、ControlNet随便试错,边际成本接近零。他的结论按人群给:“想用AI写代码的,别买卡,直接买API;想做图的,16G是入场线;想做视频的,再等等。”知乎
把这两周的产品口径和社区实测摆进同一张表,大概是这个样子:
机型/方案 | 宣传口径 | 该去核对的数字 | 社区现状 |
|---|---|---|---|
微星PRO MAX EDGE AI+ | 4L机身、最高128GB统一内存、“私人AI常驻工位” | 具体SKU的内存容量/频率,首发实测t/s | 10月2日刚发布,第三方实测还没出 |
ACEMAGIC 495新机 | 192GB、“70B Q4至200B MoE、兼容284B” | 284B是什么量化、什么速度下"兼容" | 上架次日,无独立复测 |
雷神M7000 | 64G内存"跑120B"、断网零Token | 权重实为59G量化版;隐藏分区方案可否复刻 | 视频1469赞,评论区质疑"企业信息安全"故事是软文脚本 |
七彩虹K16/联想百应300/P7 | “120B毫无压力”“190TOPS Token工厂”“一年回本” | TOPS是NPU营销算术,与内存带宽无关;回本账按你的订阅档位重算 | 软文密度高,实测少 |
AMD Max+395系(Halo/零刻GTR9 Pro等) | 128G统一内存、现场演示235B | 单机Q4约25t/s(6B激活MoE);Prefill原生约300t/s;carve-out设置 | 被"凉凉帖"和"复活帖"来回拉扯,双机TP=2是玩家魔改路线,无官方支持 |
这波热闹里,谁该冲,谁该等
数据不出门的刚需党(笔记库常驻问答、合同/病历这类敏感资料、无审核陪伴向):128G统一内存这一档是真解法,但选模型时先查激活参数,6-8B激活的MoE是当前最适配"带宽穷"架构的物种。B站那条721赞、433评的"云端AI已经这么强了,我为什么还要跑本地模型?“视频里,高赞评论说得很实在:本地党图的就是隐私、不限速和"没审核”。哔哩哔哩
想让AI写代码干活的:先别为这个买AI小主机。编码Agent要的是多轮快速推理,Prefill 300t/s和"一次几十秒"的差距会直接杀死工作流——这是冷水派和实测派难得一致的点。
冲着"235B/284B"数字来的:等两样东西——微星和ACEMAGIC的新机首发第三方实测,以及更多"低激活"MoE的GGUF放出。数字游戏拆穿了就一句话:装得下的那个B,不是给你干活的那个B。
老395/16G卡持有者:这轮涨价(电脑城已经有人喊"4000块配不出跑大模型的机器")反而让手里的存量设备更值了,Flash-Next+MTP+Prefill加速工具(halogen、pwilkin方案)值得跟进,不用换机就能续命。

接下来值得盯的信号就三个:微星/ACEMAGIC首发实测的decode数字;社区加速方案会不会被推理引擎官方收编;以及内存价格对128G/192G整机售价的下一轮传导。这三个都落地之前,"Token工厂"这个词,建议只当广告语看。