AI小主机集体刷屏“支持120B”:装得下的那个B,不是给你干活的那个B

源自248位全网作者

12:14

九月底到十月头这几天,AI小主机圈有点过年那意思。微星10月2日把PRO MAX EDGE AI+摆上桌,4升机身、最高128GB统一内存,宣传语直接就是"把私人AI放到桌上"。 ACEMAGIC的锐龙AI Max+ PRO 495新机9月30日上架,给到192GB内存,官方口径是该机可本地运行70B Q4至200B MoE大模型,实测兼容DeepSeek V4 Flash 284B超大模型。 再往前一天,雷神AI Master M7000的实测视频挂在B站,64G内存的笔记本,靠一块在资源管理器里连盘符都没有的隐藏分区,跑起了59G权重的120B大模型,视频一天涨了一千四百多赞。小红书微博哔哩哔哩

再往回翻,这轮"装得下120B"的军备竞赛早就开始了。联想5月的AI主机P7喊出"190 TOPS、私有Token工厂、最大1220亿参数"。 6月的百应AI主机300说"实测流畅部署Qwen3.6-35B、GPT-OSS 120B";七彩虹灵创K16的软文更直接:“96GB动态显存,本地跑120B大模型毫无压力”,标准版23999元,一年省下的API钱说不定就回本。微博微博

AI小主机集体刷屏“支持120B”:装得下的那个B,不是给你干活的那个B

9月1日的AMD发布会上,苏姿丰拎着饭盒大小的Max+395主机上台,现场跑起2350亿参数大模型。 微博搬运版的账算得更猛——“128GB版约2399刀,不到一年回本”。9月21日的M5 Pro Mac mini首发评测又把"本地AI到底能跑到什么水平"拿出来实测了一遍:本地跑大模型、让Agent自己写代码做网页、再到生成图片,逐项过堂。 这条980赞的评测微博下面,最高赞评论(710赞)问得很直接:"跑图生成质量到底咋样,要是脸崩了本地就没意义。"9月27日苹果给IT部门用户大会公布的一组数据也被搬了出来:很多人买Mac mini当AI主机,高端机集群甚至能跑1.6万亿参数的AI。微博微博微博

AI小主机集体刷屏“支持120B”:装得下的那个B,不是给你干活的那个B

一边是刷屏,一边是"凉凉帖":两个帖子对不上账

有意思的是,同一时间在知乎,那个48万人看过的问题——“现在怎么没有人提用AMD MAX395去跑本地大模型了?”——10月1日最新回答在泼冷水:御三家(DeepSeek、GLM、Qwen)最新flash模型的"主流简化版",得256G才跑得动,预算直接上6-7万(二手Mac Studio的路子);96-128G机型玩社区魔改版可以,但商业价值有限,没法搞成Token工厂。知乎

但9月11日另一位答主(金猪升级包)给出的实测却完全相反:Qwen3.8-Flash-Next总参数176B、激活只有6B,“高容量低带宽需求,简直SuperUMA圣体”,128G的395单机Q4裸跑大约25 token/s,补上MTP之后Decode速度完全可用。 真正的短板是Prefill,只有300多token/s,9月18日用上社区加速方案后Prefill提升到3倍。他甚至用一根雷电线搞出了RDMA over USB4——两台Strix Halo互联的延迟从130µs压到7µs,理论上任意一台395小主机都能跑TP=2张量并行。34条评论吵的就是这两派。知乎

这两个帖子对不上账的地方,恰恰是买AI小主机前必须先拆开看的地方:厂商宣传的"支持120B/235B",和社区实测的"能不能干活",中间隔着至少四道数字。

AI小主机集体刷屏“支持120B”:装得下的那个B,不是给你干活的那个B

买AI小主机前,先对一遍这四道数字

第一道:装得下≠跑得动。 "120B"是显存/内存口径,也就是量化后的权重塞得进去。雷神M7000那台64G内存机的实际口径就是59G权重的量化版,不是满血。同一台机器上Q4能跑和"毫无压力"之间,隔着的是你的耐心。

第二道:看激活参数,别看总参数。 统一内存平台真正的天花板是内存带宽,Decode阶段每个token都要流式读一遍激活权重。总参数176B但激活6B的MoE,带宽压力和十几B的小稠密模型是一个量级——这就是"Flash-Next把395带活了"的全部原理。 也是为什么同样128G,有人25t/s可用、有人只能玩魔改小模型。厂商页面上那个大数字,偏偏都只写总参数。知乎

第三道:核显"显存"是个设置题,不是硬件题。 395那颗Radeon 8060S没有独立显存,CPU和GPU共用同一套LPDDR5X。知乎有答主(枫淡月)做过三轮A/B:Windows下宣传"最多可分配96G显存",但他实测把carve-out从64G调到0.5G,Prefill反而快2.1-3.3倍,12个组合里0.5G设置赢下10个,Decode只损失3.5%-5.7%——"动态显存"这个卖点,设置错了就是负优化。 同一位答主5月的全栈方案也提过另一个坑:LM Studio在这类机器上会把GPU占用怼到99%造成系统卡顿,他的用法是LM Studio只负责下载、预览、测试模型,常驻交给llama.cpp。知乎知乎

第四道:用途比机器重要。 9月16日另一篇实测帖《我测了本地大模型的三个用途,两个行不通》把账算得很直白:5060Ti 16G(2800元)跑32B编码模型,层溢到内存后"每秒几个词,等它写完一个函数我手动都写完了";跑Wan 2.1出五六秒的视频要8-15分钟,“渲染机器比吃饭慢”;唯一活下来的是出图——LoRA、ControlNet随便试错,边际成本接近零。他的结论按人群给:“想用AI写代码的,别买卡,直接买API;想做图的,16G是入场线;想做视频的,再等等。”知乎

把这两周的产品口径和社区实测摆进同一张表,大概是这个样子:

机型/方案

宣传口径

该去核对的数字

社区现状

微星PRO MAX EDGE AI+

4L机身、最高128GB统一内存、“私人AI常驻工位”

具体SKU的内存容量/频率,首发实测t/s

10月2日刚发布,第三方实测还没出

ACEMAGIC 495新机

192GB、“70B Q4至200B MoE、兼容284B”

284B是什么量化、什么速度下"兼容"

上架次日,无独立复测

雷神M7000

64G内存"跑120B"、断网零Token

权重实为59G量化版;隐藏分区方案可否复刻

视频1469赞,评论区质疑"企业信息安全"故事是软文脚本

七彩虹K16/联想百应300/P7

“120B毫无压力”“190TOPS Token工厂”“一年回本”

TOPS是NPU营销算术,与内存带宽无关;回本账按你的订阅档位重算

软文密度高,实测少

AMD Max+395系(Halo/零刻GTR9 Pro等)

128G统一内存、现场演示235B

单机Q4约25t/s(6B激活MoE);Prefill原生约300t/s;carve-out设置

被"凉凉帖"和"复活帖"来回拉扯,双机TP=2是玩家魔改路线,无官方支持

这波热闹里,谁该冲,谁该等

  • 数据不出门的刚需党(笔记库常驻问答、合同/病历这类敏感资料、无审核陪伴向):128G统一内存这一档是真解法,但选模型时先查激活参数,6-8B激活的MoE是当前最适配"带宽穷"架构的物种。B站那条721赞、433评的"云端AI已经这么强了,我为什么还要跑本地模型?“视频里,高赞评论说得很实在:本地党图的就是隐私、不限速和"没审核”。哔哩哔哩

  • 想让AI写代码干活的:先别为这个买AI小主机。编码Agent要的是多轮快速推理,Prefill 300t/s和"一次几十秒"的差距会直接杀死工作流——这是冷水派和实测派难得一致的点。

  • 冲着"235B/284B"数字来的:等两样东西——微星和ACEMAGIC的新机首发第三方实测,以及更多"低激活"MoE的GGUF放出。数字游戏拆穿了就一句话:装得下的那个B,不是给你干活的那个B。

  • 老395/16G卡持有者:这轮涨价(电脑城已经有人喊"4000块配不出跑大模型的机器")反而让手里的存量设备更值了,Flash-Next+MTP+Prefill加速工具(halogen、pwilkin方案)值得跟进,不用换机就能续命。

AI小主机集体刷屏“支持120B”:装得下的那个B,不是给你干活的那个B

接下来值得盯的信号就三个:微星/ACEMAGIC首发实测的decode数字;社区加速方案会不会被推理引擎官方收编;以及内存价格对128G/192G整机售价的下一轮传导。这三个都落地之前,"Token工厂"这个词,建议只当广告语看。

内容由AI生成

精选参考来源

1. 小主机+AI,把私人AI放到桌上

2. 【ACEMAGIC将推出升级版F9A迷你主机,搭载锐龙AI Max+ PRO 495芯片】

3. 数据不出门、Token 零花费!雷神 AI MASTER M7000 把 120B 大模型装进了笔记本

4. 联想推出AI主机P7,以高达190 TOPS的本地AI算力,打造属于每个人私有的“Token工厂”,支持最大1220亿参数本地大模型运行

5. 128G+2T!这台「零标识」的16寸AI工作站,核显叫板RTX4060独显

6. 【AMD CEO 苏姿丰拎了个饭盒大小的主机上台,现场跑起2350亿参数大模型】

7. 【本地AI能跑到什么水平?M5 Pro Mac mini首发评测】

8. 在AI时代苹果的Mac电脑异军突起,很多人都在买Mac Mini当AI主机,还能跑一些本地大模型

9. 现在怎么没有人提用AMD MAX395去跑本地大模型了?

10. 现在怎么没有人提用AMD MAX395去跑本地大模型了?

11. AMD Ryzen AI MAX+ 395 统一内存windows11系统下显存分配对本地大模型推理性能的影响

12. 我的AMD AI MAX+ 395主机 本地AI全栈方案:从运维到知识库,全程离线运行

13. 我测了本地大模型的三个用途,两个行不通

14. 云端AI已经这么强了,我为什么还要跑本地模型?(拥有自己的算力的体验)

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章