AMD 锐龙 AI Max PRO 400 解析:凭什么本地跑 3000 亿参数
一台巴掌大的迷你主机,本地跑起一个 3000 亿参数的模型——两年前这话像 PPT,9 月 10 日 AMD 在北京把它当成了开场白。

这场叫「携手创新 共赢智能体AI时代」的媒体沙龙,主角是全新的锐龙 AI Max PRO 400 系列。AMD 第一次把「本地可跑的模型参数量」从上一代的 2000 亿(200B)拉到 3000 亿(300B),统一内存从 128GB 扩到 192GB,并直接断言:这是首款能本地运行 3000 亿参数模型的 x86 客户端处理器。
单看这句话,很多人会先冒出两个疑问——为什么是「内存」当主角,而不是算力?3000 亿参数对普通人到底意味着什么?这两个问题,正是这次发布真正想讲的事。
智能体时代的瓶颈,不在算力在内存
前两年整个行业吹 AI PC,口径几乎一致:比 NPU 算力,你 45 TOPS 我 48 TOPS,卷得像在比市值。但 AMD 这次把重点,几乎从「算力」挪到了「内存」。
这不是它突然想换个话题,而是智能体(Agent)改了游戏规则。
过去的 AI 是「你问一句、它答一句」,轻量、单次、发到云端再回来。而智能体要干的是连续的事:规划任务、调用工具、检查结果、再往下执行,一条工作流里可能要串起好几个模型、挂上一长串上下文。这套东西最吃紧的地方,恰恰不是峰值算力,而是「能不能把足够大的模型和足够长的上下文,一次全装进本地内存里」。
模型一旦必须发到云端,就有延迟、有网络抖动、有隐私和成本的账要算;而它在本地跑得动的前提,是内存装得下。3000 亿参数要想舒服地塞进本地,内存本身就得到百 GB 量级——这就是为什么 AMD 反复强调 192GB 统一内存,而不是把 55 TOPS 的 NPU 放在最前面讲。
「统一内存」四个字,第一次被大众记住要追溯到苹果的 M 系列芯片。CPU 和 GPU 共享同一块内存池,谁要多少现场划,省掉了数据在 CPU 内存和显卡显存之间来回倒腾那一步。
这套思路对 AI 尤其对味。传统 x86 的配置是:CPU 这边 32GB、64GB 内存,独立显卡那边 24GB、48GB 显存,两边是隔离的。想跑一个几百 GB 的模型,你会卡在哪?不是买不起算力,是找不到一块「能一次装下整个模型」的地方——显存装不下,拆开来量化、裁剪,模型又掉血。
AMD 把统一内存带进 x86、做到 192GB、最多划 160GB 当显存,等于把这个老问题绕了过去。更要紧的是生态:苹果的统一内存再香,也只服务 macOS 一家;而锐龙 AI Max PRO 同时支持 Windows 11 和 Linux x86_64,等于开发者手里那套跑满血的 PyTorch、vLLM 工具链,能原样搬进一台 192GB 的机器里。对写代码、调模型的人,这一条比任何 TOPS 数字都实。
一口气说清旗舰这颗锐龙 AI Max PRO495
旗舰型号锐龙 AI Max+ PRO 495 的基本盘,还是那套熟悉的异构三件套:
- CPU:Zen 5,16 核 32 线程,最高加速 5.2GHz;
- 显卡:Radeon 8065S,RDNA 3.5,40 个图形计算单元;
- NPU:XDNA 2,最高 55 TOPS。
减配的两款 490、485,分别砍到 12 核和 8 核、NPU 降到 50 TOPS,但全系都保住了 192GB 统一内存这张王牌,cTDP 也在 45–120W 的区间里,从巴掌大的迷你主机到工作站都能塞得进去。
这里有个细节值得单独拎出来:全系统一内存都是 192GB,没在低配版上缩水。AMD 显然清楚,这个系列真正的卖点是「内存」,而不是那两颗核心。

沙龙现场首秀了 9 款搭载 495 的新品,几乎把国内迷你主机和工作站的玩家叫齐了:联想 ThinkCentre X Ultra、超聚变 FusionXpark M 系列、铭凡 MS-S1 MAX-P495、极摩客 EVO X5 Pro、七彩虹灵创 Mini Pro、阿迈奇 F9A、亿道(Emdoor)、六联的两款。


有意思的是,这些机器虽然都吃同一颗 495,形态却明显分成了两拨:一拨走「桌面 AI 超算」的老路,把工作站级算力塞进一台机器里,吃本地大模型、数据密集任务的饭;另一拨走「迷你主机」的新路,把 192GB 内存压进一个只有几升体积的小盒子,主打「开发者桌面上的私有推理服务器」。
AMD 给的口径是,近期还有 20 多款基于 495 平台的新品要上市。一个刚从概念走进真机的品类,能这么快铺开 20 多款,说明生态伙伴不是来站台的,是真打算卖。
我们正处于智能体 PC 的分水岭
如果只把这场发布会看成「AMD 发了颗新处理器」,那会漏掉它真正想押注的东西。
智能体 PC 的分水岭,正在从「算力 TOPS」转向「内存容量」。
第一,模型在变。行业这两年的事实是,模型一边变强一边变小,越来越多云端专属的能力被压缩到本地能跑的量级。这些模型的落地门槛,几乎全是内存,不是算力。
第二,工作负载在变。智能体是「连续调用多个模型+长上下文」的场景,它对峰值算力的瞬时需求,远不如它对内存容量的持续需求来得真实。
第三,账在变。AMD 大中华区市场营销副总裁纪朝晖那句「本地调用中小规模模型、大幅降低推理成本」,落到企业和开发者的账本上,就是省下了每一笔按次计费的云端推理。对个人用户,这 192GB 大概率是「过剩」;但对要本地跑大模型、做私有部署的开发者、科研和政企,它是刚需。
所以直到现在,我对这颗芯片的期待,仍旧不在「普通消费者要不要冲」,而在它能不能让「本地跑大模型」从发烧友的玩具,变成开发者工具箱里的一件常备设备——就像当年配了 128GB 内存的开发机,贵,但有人就是离不开。
往回想这几年的 AI PC,其实藏着一个挺有意思的转折。第一轮,大家抢的是能不能把 NPU 塞进去、TOPS 数字谁更大;等 NPU 都塞完了,才慢慢看明白,智能体想要的根本不是瞬时那一口算力,而是一块能一次装下整个模型和上下文的地方。锐龙 AI Max PRO 400 把统一内存做到 192GB,等于在 x86 这条老路上,替想干这件事的人把门踹开了。
20 多款新品一旦铺开,本地推理会先被一群「离不开」的人接住——要调模型的开发者、数据不能送出本地的政企、想低成本做私有部署的中小团队。等这批人把工具链和部署方案磨顺了,本地跑大模型才会真的往普通人的桌面上滑。这件事不会很快,但一定会来。

张大妈
校验提示文案
张大妈
校验提示文案