9月2日预售开启那天,GPD公众号发了一篇标题很提气的推文:《WIN Max 3 预售开始》。副标题是"395版+128G统一内存部署ComfyUI+Z-Image-Turbo一气呵成,1024×1024出图仅需不到25秒"。微信公众号
但你往下滑就会发现不对劲——这篇文章的大半篇幅,是一份《为什么你会踩坑》的排障教程。官方把"能跑"的成绩和"跑通之前摔的跤"捆在一起发了出来,这在掌机圈营销里相当罕见。它等于亲口承认:这台被官方定位为"桌面级开发者工作站"的顶配机(395+128GB+2TB,预售价21999元,零售26499元),买的不是即插即用,是"调好了才好用"。今日头条今日头条
现在是9月8日,定金通道开到10月15日,最晚发货12月15日。微信公众号窗口期一个多月,足够把三个数字掰扯清楚:44秒、12tps、51tps。搞懂它们,你才知道这128G统一内存的钱到底花在哪、值不值。

一、官方演示的背面:显存锁得越大,出图越慢还崩
GPD自己的实测记录写得很老实:同样是Ubuntu 26.04 + ROCm、同样的Z-Image-Turbo,先在BIOS里把显存分配项(这台机器叫Dedicated Graphics Memory)锁到64GB——出图一张43~44秒,而且画到第三张直接OOM崩掉。改回32GB之后,不崩了,时间缩到25秒以内;正常状态下平均24秒一张(1024×1024、8步,首张另含kernel编译时间)。微信公众号
这是个典型的反直觉点:统一内存机器上,BIOS预留显存是"先圈走的死地",锁64G意味着系统侧可用的内存池跟着变紧。官方给的"活路"一共五条:BIOS显存分配设最小(0.5G或32G);GRUB里用amdgpu.gttsize把GTT开到约110GB、给系统RAM留16~24GB;PyTorch只装TheRock为gfx1151预编译的ROCm nightly;ComfyUI的requirements.txt不能让它覆盖torch;启动只留–highvram,别加ROCm 6.x时代的那些精度workaround参数——官方原话是"在ROCm 7.13下反而有害"。
翻译成人话:这套25秒,是工程机+魔改环境+按顺序抄攻略的结果。Windows下直接装个Ollama点开的体验,和这个数字之间隔着一整篇教程。
二、12tps和51tps:同一块395,四倍差距
9月4日有个抖音实测拿到了不错的互动:在395+128GB共享内存主机上部署Qwen3.8-27B,作者一句话说透了社区现状——“你搜Strix Halo跑大模型,大概率找到的是:装个Ollama、下载GGUF、跑起来12 tokens/s,然后大家心照不宣地说APU不行”。他自己在同一块芯片、同一个模型、不超频不改散热的条件下,把decode速度从12.65一路推到了51tps。抖音12到51,同一台机器差出4倍,变量全在框架和设置上。
更早流传的另一组数可以当参照:苹果M5 Max 128GB跑同类模型约27tps,接近正常阅读速度。今日头条
而英伟达那边,RTX 5090D能到80+tps的输出比打字还快,可24GB显存就是天堑,超过35B的量化模型直接就没法运行。今日头条
所以Strix Halo这套东西的真实位置是:容量上,它是把百B级模型准入门槛从十万级(96GB专业卡一张近7万、整机奔十万)砸到两万级的门票;速度上,大约256GB/s的统一内存带宽决定了它永远跑不快,装得下和用得爽是两回事。今日头条
AMD官方DeepSeek R1推理基准里那个"模型超出RTX 5080显存限制后,395速度是它的3倍以上",说的也是同一件事——不是短跑赢了,是独显根本站不上跑道。今日头条

三、被容量光环盖住的三笔账
社区这波"128G平民神器"的论战(相关文章从4月一直吵到8月底,头条的发文密度就是热度证据),把坑基本踩明了,总结三笔账:
第一笔:容量决定装得下,带宽决定跑得快。 LPDDR统一内存带宽普遍在250~300GB/s区间,而高端游戏显卡显存带宽可以突破1000GB/s。今日头条短对话时体感还行,一旦上32K长上下文、多轮对话,KV缓存持续读写内存,"前几句回复尚可,十几轮之后token速度腰斩"是普遍反馈。
第二笔:可用内存不是128。 系统和后台吃掉之后,真正可以分配给大模型的可用内存,通常只有95~110GB左右。今日头条再挂RAG知识库、向量库、多插件工作流,余量很快见底,一旦开始用SSD当交换内存,卡顿和OOM就来了。GPD官方攻略里"128G机器GTT给约110G、系统RAM留16~24G"的经验值,侧面印证满配跑重工作流并不宽裕。顺带说一句宣传话术:顶配那个"128G最多分配96G显存",是把共享内存池划一块给GPU用,不是多出一条96G的独显。
第三笔:稠密模型和MoE是两种体验。 同样的总参数量,稠密模型每次输出都要动全部权重,在这个带宽上属于硬吃;而MoE模型每次运算只激活部分参数,运行会流畅不少。今日头条这台机器目前真正跑得舒服的场景,是生图、27B级别的稠密(调优后)、大参数MoE、长文档离线处理——而不是"拿它替代4090对话"。官方发布稿写的是"依托最高126TOPS AI算力,设备可本地流畅运行700亿参数大模型",70B稠密Q8在这个带宽上的实际对话速度,建议按"能用但别指望快"预期。微信公众号
四、21999到底买了什么:把同平台方案的价目表拉齐
单看掌机圈,WIN Max 3三档预售/零售价是:
配置 | 预售价 | 零售价 | 预售省 |
|---|---|---|---|
388 + 32GB + 1TB | 9999 | 11999 | 2000 |
388 + 64GB + 2TB | 12999 | 15599 | 2600 |
395 + 128GB + 2TB | 21999 | 26499 | 4500 |
但如果你"买128G是为了跑AI",对手就不是掌机了,是这一桌子:第三方395+128GB迷你主机,京东自营价今年4月已经降到1.8万左右,比首发参考价还低了近6000。今日头条DGX Spark约3.5万,买的是预填充速度和CUDA生态;MacBook Pro M5 Max 128GB约4.2万,买的是随身27tps加成熟生态;二手4090方案,买的是小模型极致速度。顶配比迷你主机贵出的那几千块,买的是四样:815g本体能揣走的形态、9.06英寸2400×1504的165Hz Real RGB OLED、能打游戏的全套手柄件+键盘、以及双M.2加Mini SSD的扩展。
注意第三样的代价——97Wh电池模块和双风扇散热模块共用同一个仓位,二选一。今日头条真拿去跑连续生图或长文本,高负载下靠机身自带散热并不从容,拿到内测机的UP主已经反映"在高功耗时风噪声音比较大"。哔哩哔哩换句话说,它的AI主力形态其实是"插电+风扇模块"的桌机姿势,"随身百B大模型"更多是形态上的可能性,不是体验上的承诺。
预售期三个配置都附赠散热风扇,想要出门续航就得另补第二块模块化电池——预售399元,单独零售599元。今日头条今日头条微信公众号

还有一个买前必须想明白的点:388和395标配的是同一颗满血40CU Radeon 8060S核显,官方口径55W功耗下跑分就超越移动端RTX 4060。也就是说只为打游戏的话,顶配的溢价几乎与你无关——这21999里,你付的是16核对多核编译、并行工作流和128G容量本身的钱。百家号微信公众号
五、抄作业区和劝退区:对号入座
纯掌机玩家:9999入门版,32G对游戏毫无压力,预售送风扇。想户外多带一块电池,399的预售电池记得和定金一起锁。
轻度本地AI(生图玩玩、27B对话、代码辅助):12999中配的64G已经能灵活分配显存;上不上128G,取决于你要不要跑百B模型和多大并发的知识库——不需要就别为容量光环多掏9000。
认真要一台"能出门的大模型盒子":目前GPD家族里只有顶配给到128G,预售比零售直接省4500,10月15日定金截止前是这个窗口最便宜的拿到方式。但请默认你到手第一天就要按官方那五条坑规走一遍Linux+ROCm,或者等社区把Windows侧的坑趟平。
AI需求但不需要它移动:1.8万的395+128G迷你主机是同一块芯片的老实答案,省下的钱和折腾都实打实。

最后一个待观察信号:现在所有实测都建立在预生产样机和ROCm 7.x nightly上,早期上手评测也明说"最终零售版的固件、功耗限制和性能表现可能会有所不同"。哔哩哔哩12月中旬首批发货之后,量产固件有没有保住这套GTT默认值、ROCm正式版对gfx1151的支持走到哪一步,才是25秒这个数能不能"人人都抄得走"的关键。
你的27B在这类机器上跑到第几轮开始腰斩?顶配定金你是锁了还是再等等?评论区聊聊。