8月中旬,两条消息撞在了一起。
第一条来自DeepSeek:8月13日,DeepSeek正式推出V4 Pro正式版,官方同步宣布8月17日起API实行峰谷调价。知乎实际账单让重度用户坐不住了——有用户直言,虽然已经做好涨价的准备,但真想不到涨了四五倍。知乎"DeepSeek大涨价后,谁才是性价比之选"的讨论,这两天在社区里刷了屏。知乎
第二条来自内存市场:AI吞掉存储产能,DDR5一路涨,现在一根64G内存条能卖到4000元。哔哩哔哩直接后果是,搭载AMD锐龙AI Max+ 395的迷你主机,从去年媒体评测时的1.5万元上下,普遍涨到了2万+,部分机型已经摸到26000元附近。知乎
而恰好也是这个8月,社区里悄悄完成了一件事:被迫用llama.cpp一年多的395本地大模型推理,终于在vLLM上开始迎来真正可用的一天。知乎对关注本地大模型的人来说,这三件事叠在一起,指向同一个问题:这颗去年发布时被称为"王炸"、又被骂了一年"难用"的芯片,现在到底值不值得上车?
先说清楚:395到底是个什么机器
一句话:把服务器级内存塞进了一颗APU。Zen 5架构16核CPU,加Radeon 8060S核显,整机最高128GB统一内存,其中最多96GB可以直接划给核显当显存。哔哩哔哩

这里最关键的数字不是算力,是内存。本地跑大模型,能跑多大、输出多快,瓶颈几乎全在显存容量和带宽上。这就是为什么一张5090装不下、跑不动的200B级模型,一台巴掌大的395主机能塞进去——也是这台去年的"过气平台",会在DeepSeek涨价后重新火起来的原因。
现在到底什么水平:三个实测结论

结论一:旗舰卖点是真的,但要做好"极致量化"的心理准备。
极摩客EVO-X3的实测里,DeepSeek-V4-Flash的284B参数真的跑起来了——IQ2_XXS量化,占88GB。哔哩哔哩社区也已经放出V4 Flash的本地部署方案:用专为它打造的ds4推理引擎,128GB统一内存的设备即可运行,实测效果"在各种测试跑分上非常接近官方API,没有明显可感的性能差异"。知乎但注意,IQ2_XXS属于极限量化,输出是"能用"级,不是"享受"级。至于V4 Pro完整版,1.6T参数,社区目前的方案是8台DGX Spark组TP8并发才把它跑起来。知乎——那就不是单台消费级机器该想的事了。
结论二:真正的甜点位在30-40B的MoE模型。
Qwen3.6-35B-A3B这类模型,llama.cpp下输出稳定在30-50 tok/s。知乎一位真实买家的说法很直白:“我就买了台395,目前做做推理养养龙虾,用comfyui画画图做做视频,家用够用了,另外不要上什么70B,200B大模型,就算能跑也是便秘输出,这玩意就适合跑多个小模型”。知乎
结论三:软件拐点刚好发生在这个8月。
过去一年多,395跑大模型基本只有llama.cpp一条路,官方vLLM在这颗芯片上的表现用"能运行"形容都嫌客气——128K上下文下单流解码只有1.38 tok/s。知乎
8月,社区开发者CIRU发布了专为Strix Halo打造的vLLM原生运行包:从第一个能在这颗芯片上跑起来的上游兼容构建(0.269 tok/s)到最终发布版(26.23 tok/s),单流解码累计提升97.55倍。知乎跑同一个Qwen3.6-35B,解码速度比官方vLLM快2.9-5.2倍,128K长上下文从"不可用"变成"可用"。
但坑也要说清楚:
量化别贪低。35B级别的实测对比显示,Q4量化已经明显损伤事实召回能力,生产用途建议至少Q6-H。知乎
多并发和长上下文不能同时要。16K以上语境再叠加多路并发,速度衰减剧烈。知乎想当多人共用的高并发服务还不现实,"单流/双流+长上下文"或"多流+短上下文"才是当下的可用范围。
训练别想。这台机器能跑推理,跑不了训练。知乎12B级别的小模型全量微调倒是可以跑。哔哩哔哩70B以上的微调、继续预训练,请出门右转CUDA或租云卡。
三条账线:买之前先算一遍
第一条:机器账。
128G版:从评测期的1.5万元上下,涨到现在的2万+,顶配机型摸到26000元附近;64G版:1万元左右能拿下。知乎有评论区的账算得很精:“我是这样理解的,9950X+主板+64G内存条+5060显卡性能+电源,1W整买的不带硬盘的,在64G内存条卖4000的当下,我甚至觉得挺有性价比的”。哔哩哔哩内存涨价是这台机器最大的敌人,也是它当下最大的合理性——统一内存相当于"显存+内存"一次买齐,躲过了单独买显存的溢价。
第二条:token账单。
这条最值得算。把你现在每月花在DeepSeek或其他API上的钱,乘以12,跟机器价对比。月账单几十上百块以内,2万出头的机器永远回不了本,云端永远更便宜;但如果你是重度Agent、重度代码用户,尤其这次涨价后账单跳到每月几百块,395的回本周期可能比你想的短。这次最大的变量是:API定价不再稳定,"按现在的低价算未来成本"这个前提本身塌了。
第三条:对比账。
NVIDIA的DGX Spark同样128GB统一内存,官方价已从3999美元涨到4699美元,国内整机直奔4万。知乎

它强在CUDA生态、200GbE组网和多机集群,能给模型划出约112GB。知乎但只做个人推理的话,这近一倍的差价就是395的生存空间。还有人走了另一条路:买台64G的395装SteamOS,容器里部大模型,“不耽误玩游戏也不耽误用token”。哔哩哔哩
不同人群,不同动作
重度token用户(Agent全天跑、重度依赖API):先算第二条账。涨价后月账单已经到两三百以上的,128G版395值得认真考虑——V4 Flash 284B本地确实能跑。
RAG知识库/文档处理/ComfyUI出图用户:这是395的甜点区,多个小模型常驻、数据不出本地,64G就够,还能少交一份内存涨价税。
要微调训练70B+的人:别买。这是推理机,不是训练机。
纯游戏玩家:黑神话2K高画质60帧、2077 2K超级画质78帧。哔哩哔哩核显是真不差,但纯游戏,X3D+独显的组合性价比更高,别为统一内存付溢价。
两个值得继续盯的信号
一是AMD官方的Ryzen AI Halo。这台官方迷你主机7月已经正式亮相,同样是395+128GB统一内存。哔哩哔哩官方定位是面向本地AI开发的"公版AI迷你主机",体积不到1L,海外预订价3999美元,折合人民币接近3万元。小红书它的定价会直接锚定这个品类的天花板。AMD还声称两台Ryzen AI Halo就能跑400B级模型,已经有UP主亲自实测检验这个说法。哔哩哔哩双机集群是这台机器为数不多的扩展路径。

二是内存价格走势。这轮存储涨价由AI产能挤占驱动,短期没有回落迹象。已经决定要买的,越往后越贵是大概率;还在犹豫的,别只盯机器价,盯自己的token账单和vLLM生态的成熟度,那才是这台机器"值不值"的变量。
最后说一句判断:395用一年时间,从"参数王炸"走到了"真的能用",这个8月是软件、需求第一次真正对上。但下单之前,先算自己的账单,别看别人的跑分。