395刚从"玩具"变"工具",就被挂成了"理财产品":想跑本地大模型的,先对完软件、带宽、价格、192G这四本账再决定掏钱还是等495

源自266位全网作者

03:11

这周AMD的三件大事,居然都不是显卡:9月10日,AMD在北京发布锐龙AI Max PRO 400系列,旗舰Max+ PRO 495把统一内存从128GB推到192GB、本地可运行模型从200B推到300B,联想ThinkCentre X Ultra、铭凡MS-S1 MAX-P495、极摩客EVO X5 Pro等9款伙伴机型同步集中首秀。官方称近期将有超过20款新品上市。9月16日,知乎一篇《halogen-flash-server:AI MAX 395终于迎来了属于它的杀手级应用》被顶上社区热帖;而在B站今年7月那条《现在怎么没有人提用AMD MAX395去跑本地大模型了?》(3.7万播放、225条评论)下面,9月13日的最新回答画风已经变成"本来也没指望它跑AI,现在只恨没多买,眼睁睁从1w5涨到2w2就应该买它十台"。知乎知乎

395这台机器,热度是回来了,价格也是。一个纠结要不要上车的AI玩家,现在真正要算的是四本账:软件账、带宽账、价格账、新品账。

395刚从

第一本账·软件:社区刚从"300多pp、15tg"的泥潭里爬出来,但"可用"有三个边界

395的底子,halogen热帖原文说得很不客气:128GB统一内存、约256GB/s带宽、GPU算力大约59.4 TOPS,外加早期糟糕的ROCm驱动——一开始就给人一种"除了显存什么都没有"的糟糕印象。知乎

它的高光出现在2025年8月:gpt-oss-120b(总参117B、激活5.1B的超稀疏MoE,本体约60-63GB)没有一张民用独显塞得下,395蹭上了这个封口,llama.cpp社区把prefill从476 t/s一路优化到999.6 t/s、decode从33做到47.5 t/s。但两个月后DGX Spark带着官方1939/56.3 t/s的成绩抢走王座——首发36888元、各路合作商3w起步,而那时395无硬盘准系统探底约1万元,"最廉价大显存"的剧本还能继续。知乎

然后就是漫长的泥潭期:glm-4.5-air、qwen3.5-122b-a10b、nemotron-super-120b……换什么模型都是"熟悉的300多pp、15tg";而llama.cpp要兼容从CPU到全系显卡,对395这种APU的专项补丁基本不支持。今年coding和智能体任务兴起后,这个数值正式宣告不合格。

转折发生在最近两周,一共两件事。第一件是ROCm新构建补齐了gfx1151(Strix Halo的GPU架构)支持,一位社区作者为此跑了23组、391条记录的全排列测试。三后端、三档显存划拨交叉下来,新ROCm在Windows下交出了全场最低的暖机TTFT约0.85秒(对比Vulkan 0.5G档的约1.5秒)和最高的长上下文吞吐约150-161 t/s。用他的话说,从ROCm全败到多项领先,根因是架构支持补齐,不是玄学。知乎知乎

第二件事就是halogen-flash-server:作者实测对llama.cpp系全部变体形成断层式领先——要知道社区特调版刚刚卷到jcbtc的548.5 pp/34.74 tg、ehm的660 pp/28 tg、halo-box的800 pp/30 tg,连调优老手kyuz0也只跑出过750 t/s的prefill。热帖作者的原话是,有了halogen之后,AI MAX 395才终于等到了属于它的杀手级应用,正式从玩具蜕变成了生产力工具。知乎

但这本账要用三个边界来过滤情绪。一是halogen目前闭源、Linux限定、Docker部署、只支持Qwen3.8-Flash-Next一个模型,推荐跑在无头服务器模式——意味着它不干活本机,你得拿另一台电脑来调用。二是"安全性"目前依赖个人良心——热帖作者用Ghidra逆向了9个版本,宣称到0.11.1未发现后门和运行作弊,但这是逆向行为,不是审计结论,开源承诺还没兑现。三是它的并发上限只有4,且总pp/总tg会被均分,别按翻倍算力去买单。哔哩哔哩知乎

第二本账·带宽:prefill是软件问题,decode是物理问题

同一批全排列实测里最反直觉的一条:所有能跑起来的组合,decode都落在22-25 t/s这个区间。原因写在数据里——Radeon 8060S是核显,没有独立显存,CPU和GPU共用同一套LPDDR5X和同一个内存控制器,carve-out(显存划拨)不增加带宽、不降低延迟。一句话:后端切换改不了物理带宽。知乎知乎

395刚从

分开看两类负载:prefill吃算力,对内核路径和内存分配策略敏感,换系统、换后端能刷出±15%的跨度,甚至出现"ROCm prefill快3.7倍、decode反而慢13%"这种两类负载方向相反的组合。decode吃带宽,是那条约256GB/s总线的天花板,软件救不了。知乎

显存划拨的玄学也在这组数据里破了:三款被测模型总占用(权重+KV缓存+计算缓冲)约24-25GB,在0.5GB/64GB/96GB三档下全都装得下,差异根本不是"放得下放不下";但Windows + Vulkan在64GB大池下综合prefill反而比0.5GB甜点档慢了一半,0.5GB才是该守的位置。ROCm则需要64GB起,模型吃到约61GB、系统余量只剩3GB时decode会掉到18.9 t/s,换96GB立刻回到22.6。知乎知乎

Ubuntu侧更极端——Vulkan只在96GB下能加载、ROCm全败,同一块硬件,系统不同,加载门槛差近200倍,所以社区结论很直白:“部署前先定系统:Windows灵活,Ubuntu只能顶满96G走Vulkan”。知乎

模型侧同理:这轮把395重新抬起来的Qwen3.8-Flash-Next(总参180B、激活6B的MoE),全量权重约94.5GB、显存需求98.8GB,在128GB统一内存上要跑起来靠的是AD量化把54.5GB驻留内存、38.4GB放SSD实时调度。实测decode约21 t/s,比人眼阅读速度(约10-15字/秒)快,但离"快"差着一个数量级;而开思考模式,首字延迟还会从约1.5秒涨到约5.2秒。知乎知乎

评论区也没少给反证:有人晒双5060Ti 16G跑nvfp4约50 t/s、“而且价格还比395便宜很多”,有人自组双5070Ti/9070XT跑MoE卸载约35 t/s(均为个人自述,只能当方向看)。哔哩哔哩

但方向本身就值得记下来:395买的是容量和常开低功率,不是速度——“能跑和跑得快是两码事,395只解决了能跑,解决不了跑得快”。哔哩哔哩

第三本账·价格:从9800到2万2,一个你没买、但先涨了的东西

这条价格线全部来自海鲜市场自述和帖子记录,不是官方价目表:无牌子(代工尾货方案)11000元、有牌子14999元、最便宜的时候卖到9800。哔哩哔哩

然后是今年:“我11000买的,上个月15000卖了,白用一年还赚钱,妥妥的理财产品”——注意这条高赞评论的"理财产品"是反讽口径,因为他的上一句是"谁买谁冤种"。更有人直言6月底买的128G花了两万多"不知道买了个啥",到9月13日,帖子下面已经变成"眼睁睁从1w5涨到2w2"。哔哩哔哩知乎

推手不是AMD,是内存。128GB板载LPDDR5X的迷你主机,本质上是一台整块内存的载体,这轮DRAM/HBM挤占LPDDR和GDDR产能的大趋势它全吃了——一份9月15日的行业整理引用Geizhals 9月12日数据:RTX 5090德国最低价5249欧元,同比暴涨73%(2026年1月均价3029欧元),美国市场6449-9500美元。再叠加刚下发的AMD全系约10%涨价通知,"理财"这件事轮到APU主机了。知乎

但理财产品的波动是双向的:halogen热帖记录,DGX Spark二手价7月31日一度跌到约2.1万,随后一路高歌猛进、回归首发原价。你在曲线上哪个点接盘,决定了这台机器是生产力还是冤种。知乎

所以这本账的真实问题是机会成本:等,Q4内存行情大概率还往上走、495上市后395可能逐步停产缩量;买,等于为峰值价买单,而395此刻的产品力有相当一部分建立在halogen这类闭源项目上——哪天社区热情退潮或者上游断供,溢价立马反噬。

第四本账·新品:495的192G很诱人,但要看官方强调了什么、没说什么

先把发布会写了什么放这儿:Max+ PRO 495,16核32线程Zen 5、最高5.2GHz、RDNA 3.5架构的Radeon 8065S 40CU核显、XDNA 2 NPU最高55 TOPS、cTDP 45-120W;统一内存最高192GB、可划拨最高160GB作显存、支持本地跑3000亿参数模型,原生支持Windows与Linux双生态。9款伙伴机型集中首秀,官方口径是近期预计将有超过20款上市。知乎

395刚从

没写的部分才是观望党要盯的:核显仍是RDNA 3.5的40CU,通稿里没有内存带宽和矩阵算力改善的任何表述——192GB解决的是"装得下300B",不是"吐字更快";第二本账那条22-25 t/s的物理解码墙,按现有信息,495撞不撞得开完全未知。首批公布内存规格的伙伴机型已经能做个粗算:极摩客EVO X5 Pro定档9月28日全球发布,给的内存规格是192GB LPDDR5X-8533。相比395的四通道8000MT/s,频率只高约6%,对decode那条带宽墙基本是挠痒。铭凡则把495塞进了NAS,N5 MAX-P495整机AI算力标称131 TOPS、最高支持192GB内存、200TB本地存储,完整规格和售价暂未公布。cTDP 45-120W加上各种形态,意味着"20款新品"完全不是一个产品,性能释放高度依赖各家散热设计。至于时间,495机型落地窗口正好撞上Q4内存涨价周期、它单台内存含量又比395更高——首发价大概率跟涨而不是打折。这是推断,不是官方承诺,但值得作为下单前的默认预期。IT之家快科技

395刚从

四本账合上:什么人现在买,什么人等,什么人别买

已经有395的人:先别急着挂海鲜市场卖。这轮真正兑现的是软件生态(gfx1151补齐的ROCm、halogen、Flash-Next的量化方案),不是硬件——按2万2的挂牌价卖掉,等于是把一年学费换成账面浮盈,但你的工作流大概率比这台机器值钱。要榨性能,就按实测结论走:Windows优先ROCm新构建(64GB起,吃96GB的模型直接划96GB档),Vulkan用户守住0.5GB甜点、别开大显存池。

正在犹豫上车的人:把需求写具体——要一台24小时在线、数据不出本地的大内存智能体/知识库,能接受Linux无头模式,395今天才第一次到达"可用";但你在为峰值价买单,建议只按"容量刚需"付款,速度焦虑去对第二本账。对"180B模型"没刚需、只是听说了"128G显存"这个卖点的人,双5060Ti那条自组路线和你的需求更配。

等495的人:盯三件事——9月28日极摩客EVO X5 Pro首发价、铭凡N5 MAX-P495的正式售价、ROCm对gfx1151的支持什么时候进官方构建而不是"新构建补齐"。

继续观察的信号:halogen兑现开源承诺的时间点;AMD下一轮涨价通知会不会把锐龙AI Max平台整机纳入;内存行情有没有在Q4见顶。

这台395现在对的那道题,已经不是"本地大模型能不能跑",而是——你愿不愿意用一个理财产品的价格,去买它唯一真正擅长的东西:容量。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章