25秒出图,是GPD自己踩完所有坑之后的成绩:看懂44秒、12tps、51tps这三个数,再决定WIN Max 3顶配的定金交不交

源自140位全网作者

04:30

9月2日预售开启那天,GPD公众号发了一篇标题很提气的推文:《WIN Max 3 预售开始》。副标题是"395版+128G统一内存部署ComfyUI+Z-Image-Turbo一气呵成,1024×1024出图仅需不到25秒"。微信公众号

但你往下滑就会发现不对劲——这篇文章的大半篇幅,是一份《为什么你会踩坑》的排障教程。官方把"能跑"的成绩和"跑通之前摔的跤"捆在一起发了出来,这在掌机圈营销里相当罕见。它等于亲口承认:这台被官方定位为"桌面级开发者工作站"的顶配机(395+128GB+2TB,预售价21999元,零售26499元),买的不是即插即用,是"调好了才好用"。今日头条今日头条

现在是9月8日,定金通道开到10月15日,最晚发货12月15日。微信公众号窗口期一个多月,足够把三个数字掰扯清楚:44秒、12tps、51tps。搞懂它们,你才知道这128G统一内存的钱到底花在哪、值不值。

25秒出图,是GPD自己踩完所有坑之后的成绩:看懂44秒、12tps、51tps这三个数,再决定WIN Max 3顶配的定金交不交

一、官方演示的背面:显存锁得越大,出图越慢还崩

GPD自己的实测记录写得很老实:同样是Ubuntu 26.04 + ROCm、同样的Z-Image-Turbo,先在BIOS里把显存分配项(这台机器叫Dedicated Graphics Memory)锁到64GB——出图一张43~44秒,而且画到第三张直接OOM崩掉。改回32GB之后,不崩了,时间缩到25秒以内;正常状态下平均24秒一张(1024×1024、8步,首张另含kernel编译时间)。微信公众号

这是个典型的反直觉点:统一内存机器上,BIOS预留显存是"先圈走的死地",锁64G意味着系统侧可用的内存池跟着变紧。官方给的"活路"一共五条:BIOS显存分配设最小(0.5G或32G);GRUB里用amdgpu.gttsize把GTT开到约110GB、给系统RAM留16~24GB;PyTorch只装TheRock为gfx1151预编译的ROCm nightly;ComfyUI的requirements.txt不能让它覆盖torch;启动只留–highvram,别加ROCm 6.x时代的那些精度workaround参数——官方原话是"在ROCm 7.13下反而有害"。

翻译成人话:这套25秒,是工程机+魔改环境+按顺序抄攻略的结果。Windows下直接装个Ollama点开的体验,和这个数字之间隔着一整篇教程。

二、12tps和51tps:同一块395,四倍差距

9月4日有个抖音实测拿到了不错的互动:在395+128GB共享内存主机上部署Qwen3.8-27B,作者一句话说透了社区现状——“你搜Strix Halo跑大模型,大概率找到的是:装个Ollama、下载GGUF、跑起来12 tokens/s,然后大家心照不宣地说APU不行”。他自己在同一块芯片、同一个模型、不超频不改散热的条件下,把decode速度从12.65一路推到了51tps。抖音12到51,同一台机器差出4倍,变量全在框架和设置上。

更早流传的另一组数可以当参照:苹果M5 Max 128GB跑同类模型约27tps,接近正常阅读速度。今日头条

而英伟达那边,RTX 5090D能到80+tps的输出比打字还快,可24GB显存就是天堑,超过35B的量化模型直接就没法运行。今日头条

所以Strix Halo这套东西的真实位置是:容量上,它是把百B级模型准入门槛从十万级(96GB专业卡一张近7万、整机奔十万)砸到两万级的门票;速度上,大约256GB/s的统一内存带宽决定了它永远跑不快,装得下和用得爽是两回事。今日头条

AMD官方DeepSeek R1推理基准里那个"模型超出RTX 5080显存限制后,395速度是它的3倍以上",说的也是同一件事——不是短跑赢了,是独显根本站不上跑道。今日头条

25秒出图,是GPD自己踩完所有坑之后的成绩:看懂44秒、12tps、51tps这三个数,再决定WIN Max 3顶配的定金交不交

三、被容量光环盖住的三笔账

社区这波"128G平民神器"的论战(相关文章从4月一直吵到8月底,头条的发文密度就是热度证据),把坑基本踩明了,总结三笔账:

第一笔:容量决定装得下,带宽决定跑得快。 LPDDR统一内存带宽普遍在250~300GB/s区间,而高端游戏显卡显存带宽可以突破1000GB/s。今日头条短对话时体感还行,一旦上32K长上下文、多轮对话,KV缓存持续读写内存,"前几句回复尚可,十几轮之后token速度腰斩"是普遍反馈。

第二笔:可用内存不是128。 系统和后台吃掉之后,真正可以分配给大模型的可用内存,通常只有95~110GB左右。今日头条再挂RAG知识库、向量库、多插件工作流,余量很快见底,一旦开始用SSD当交换内存,卡顿和OOM就来了。GPD官方攻略里"128G机器GTT给约110G、系统RAM留16~24G"的经验值,侧面印证满配跑重工作流并不宽裕。顺带说一句宣传话术:顶配那个"128G最多分配96G显存",是把共享内存池划一块给GPU用,不是多出一条96G的独显。

第三笔:稠密模型和MoE是两种体验。 同样的总参数量,稠密模型每次输出都要动全部权重,在这个带宽上属于硬吃;而MoE模型每次运算只激活部分参数,运行会流畅不少。今日头条这台机器目前真正跑得舒服的场景,是生图、27B级别的稠密(调优后)、大参数MoE、长文档离线处理——而不是"拿它替代4090对话"。官方发布稿写的是"依托最高126TOPS AI算力,设备可本地流畅运行700亿参数大模型",70B稠密Q8在这个带宽上的实际对话速度,建议按"能用但别指望快"预期。微信公众号

四、21999到底买了什么:把同平台方案的价目表拉齐

单看掌机圈,WIN Max 3三档预售/零售价是:

配置

预售价

零售价

预售省

388 + 32GB + 1TB

9999

11999

2000

388 + 64GB + 2TB

12999

15599

2600

395 + 128GB + 2TB

21999

26499

4500

但如果你"买128G是为了跑AI",对手就不是掌机了,是这一桌子:第三方395+128GB迷你主机,京东自营价今年4月已经降到1.8万左右,比首发参考价还低了近6000。今日头条DGX Spark约3.5万,买的是预填充速度和CUDA生态;MacBook Pro M5 Max 128GB约4.2万,买的是随身27tps加成熟生态;二手4090方案,买的是小模型极致速度。顶配比迷你主机贵出的那几千块,买的是四样:815g本体能揣走的形态、9.06英寸2400×1504的165Hz Real RGB OLED、能打游戏的全套手柄件+键盘、以及双M.2加Mini SSD的扩展

注意第三样的代价——97Wh电池模块和双风扇散热模块共用同一个仓位,二选一。今日头条真拿去跑连续生图或长文本,高负载下靠机身自带散热并不从容,拿到内测机的UP主已经反映"在高功耗时风噪声音比较大"。哔哩哔哩换句话说,它的AI主力形态其实是"插电+风扇模块"的桌机姿势,"随身百B大模型"更多是形态上的可能性,不是体验上的承诺。

预售期三个配置都附赠散热风扇,想要出门续航就得另补第二块模块化电池——预售399元,单独零售599元。今日头条今日头条微信公众号

25秒出图,是GPD自己踩完所有坑之后的成绩:看懂44秒、12tps、51tps这三个数,再决定WIN Max 3顶配的定金交不交

还有一个买前必须想明白的点:388和395标配的是同一颗满血40CU Radeon 8060S核显,官方口径55W功耗下跑分就超越移动端RTX 4060。也就是说只为打游戏的话,顶配的溢价几乎与你无关——这21999里,你付的是16核对多核编译、并行工作流和128G容量本身的钱。百家号微信公众号

五、抄作业区和劝退区:对号入座

  • 纯掌机玩家:9999入门版,32G对游戏毫无压力,预售送风扇。想户外多带一块电池,399的预售电池记得和定金一起锁。

  • 轻度本地AI(生图玩玩、27B对话、代码辅助):12999中配的64G已经能灵活分配显存;上不上128G,取决于你要不要跑百B模型和多大并发的知识库——不需要就别为容量光环多掏9000。

  • 认真要一台"能出门的大模型盒子":目前GPD家族里只有顶配给到128G,预售比零售直接省4500,10月15日定金截止前是这个窗口最便宜的拿到方式。但请默认你到手第一天就要按官方那五条坑规走一遍Linux+ROCm,或者等社区把Windows侧的坑趟平。

  • AI需求但不需要它移动:1.8万的395+128G迷你主机是同一块芯片的老实答案,省下的钱和折腾都实打实。

25秒出图,是GPD自己踩完所有坑之后的成绩:看懂44秒、12tps、51tps这三个数,再决定WIN Max 3顶配的定金交不交

最后一个待观察信号:现在所有实测都建立在预生产样机和ROCm 7.x nightly上,早期上手评测也明说"最终零售版的固件、功耗限制和性能表现可能会有所不同"。哔哩哔哩12月中旬首批发货之后,量产固件有没有保住这套GTT默认值、ROCm正式版对gfx1151的支持走到哪一步,才是25秒这个数能不能"人人都抄得走"的关键。

你的27B在这类机器上跑到第几轮开始腰斩?顶配定金你是锁了还是再等等?评论区聊聊。

内容由AI生成

精选参考来源

1. WIN Max 3 预售开始 | 高清实拍图曝光 | 395 版 + 128G 统一内存部署 ComfyUI + Z-Image-Turbo 一气呵成,1024×1024 出图仅需不到 25 秒

2. GPD WIN Max 3掌机价格公布:9999元起,顶配21999元,9月2日开售

3. GPD正式确认Win Max 3掌上游戏本的全球售价,该机型将于9月2日通过Indiegogo平台开启众筹,被官方称为“地表最强掌机”。 核心配置上,Win Max 3搭载AMD Strix Halo系列处理器,提供锐龙AI Max+ 388 与锐龙AI Max+395两款芯片,均集成Radeon 8060S显卡。国行共三个版本: 入门版(388+32GB内存+1TB)预售价9999元、零售价11999元 中配版(388+64GB内存+2TB)预售12999元、零售15599元 顶配版(395+128GB内存+2TB)预售21999元、零售26499元。 其中顶配的128GB LPDDR5X-8000内存最多可分配96GB作为显存。 该机采用模块化设计,可拆卸的97Wh主电池与110W外置风扇散热模块位于同一电池仓、二选一安装,以保障45W至110W TDP下的持续性能释放。存储方面提供M.2 2280与M.2 2230双硬盘位,支持Mini SSD扩展。 屏幕为9.06英寸 AMOLED,分辨率2400×1504、刷新率165Hz。目前预售订单附赠风扇模块,单独电池模块零售价599元。

4. GPD WIN Max 3掌机正式发布,9.06英寸OLED屏幕,97Wh磁吸热插拔电池

5. GPD WIN Max 3 掌上游戏本预售:本体 9999 元起,第二电池 399 元

6. 本以为128G统一内存横扫大模型,实际运行才知短板明显

7. 本地大模型拼性价比 统一内存方案到底该怎么选

8. 苏姿丰的饭盒放了个大招:128GB统一内存把本地大模型门槛砸穿了

9. 在395 128GB共享内存部署Qwen3.8-27B实测 #本地部署大模型 #统一内存 #AIMAX395 #strixhalo #qwen 如果你现在在网上搜"Strix Halo主机跑大模型",大概率找到的都是:装个 Ollama或者lmstudio、下载个 GGUF。跑起来 12 tokens/s,然后大家心照不宣地说"APU 这不行,那不行的"。我肯定不会这么测,这次我在这台 AMD AI MAX+ 395 128GB LPDDR5X 共享内存的主机上,把 Qwen3.8-27B 的decode从12.65一路推到51 ,同一块芯片,同一个模型,没有超频,没有改散热。而且这中间踩的坑、测的数据、反转的结论,每一组都是真实跑出来的。

10. 沐丨GPD WIN MAX3内测机开箱简评

11. 花生AI也能做同款

12. GPD Win Max 3 三档配置价格全公开:入门9999元预售,顶配直奔2.7万,哪个版本最划算?

13. 一台掌上游戏本卖到近2.7万,内存翻四倍却没多给硬盘,这钱花得值不值?

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章