AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

源自182位全网作者

08:37

Qwen3.8-27B 在 8 月 14 日正式开源,Apache 2.0 协议,谁都可以免费下载部署。知乎 紧接着 8 月 18 日,AMD 正式发布了对 Qwen3.8 27B 的 Day 0 支持,开发者从模型发布之日起就能在 AMD 平台的 PC 和工作站上本地运行这款高密度稠密模型。知乎 在本地部署圈,这种待遇不算常见:以往新模型发布后,社区往往要自己摸索一段时间适配,这次 AMD 直接把官方通路铺好了,而且主角不是专业卡,是一台迷你主机。

官方 24.5 tokens/s,是什么口径

先看 AMD 给出的初步数据:Qwen3.8 27B 在 Ryzen AI Max+ 395 上最高每秒 24.5 Tokens,单块 Radeon AI PRO R9700 32GB 显卡上最高每秒 51.8 Tokens。知乎 对一台核显机器来说,这个数字足以让本地党停下来看一眼。

测试条件值得读仔细:Windows 系统、llama.cpp 项目加 Vulkan 后端,395 的 MTP 设置为 4、R9700 设置为 2,取至少三次运行的平均生成吞吐。知乎 测试机也不是什么内部参考板,而是市面上能买到的迷你主机:GMKtec 极摩客 EVO X2,128GB 系统内存,VGM 划分 64GB。尾注里还有一句值得圈出来:所有数值均为最高值,实际性能可能有所不同。

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

社区实测:数字的另一面

把视角切到用户社区,这个数字的含义就不太一样了。7 月底知乎有一篇比较完整的 395 实测:用本地推理引擎跑 Qwen3.6-27B,写入速度 12 tokens/s,作者自己算了一笔账——256GB/s 的内存带宽,27B 模型每生成一轮都要把几十 GB 的权重读一遍,理论值就是十来 tokens/s,实测 12 属于符合预期、不虚标。知乎

B 站一个题为"现在怎么没有人提用 AMD MAX395 去跑本地大模型了"的热帖,评论区说得更直接:有高赞评论认为能跑和跑得快是两码事,395 只解决了能跑的问题;也有人给出自己的实测区间,Qwen3.6 的 27B 最高约 20 tokens/s。哔哩哔哩

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

那位实测作者还晒出了模型详情弹窗:Qwen3.6-27B 模型文件 16.53GB,显存需求 15.3GB,引擎 llama.cpp,显示速度 8.4 tokens/s——和正文的 12 tokens/s 属于不同测试项,但都落在同一个数量级。再往前翻,4 月份一篇对比实测里,Q4 量化的 27B 模型在 395 上跑 13 tokens/s,作者形容"能打字,但每行出来你得等,体验像打字机",同时给出了另一个参照:45 tokens/s 才算真正边想边说的流畅。知乎

把几组数字摆在一起:官方上限 24.5,社区实测 8.4 到 20,多数落在 12 到 13。差距其实不难解释:官方口径开了 MTP——AMD 自己强调,要获得最佳性能必须启用 MTP 并设置正确的草稿 Token 数量。知乎 这是一种用草稿 token 预生成来抬高吞吐的加速手段,计数方式和裸解码天然不同,再叠加"最高值"口径,24.5 和 12 并不矛盾:一个是优化后的上限,一个是开箱即用的日常值。想按 24.5 做购买决策的,先搞清楚自己会不会折腾 MTP 配置。

12 tokens/s 到底能不能用

先说结论:能用,但要想清楚拿来干什么。做网站、写脚本、改文案这类活,12 tokens/s 完全可以接受,只是急性子会觉得磨——3692 个 token 的输出用了五分多钟。知乎 换来的是 0 API 成本、0 隐私顾虑:模型一次性装好,后续边际成本约等于电费,关掉网线照样跑。对代码和敏感文档不出本机的场景,这个价值比速度更硬。

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

工具链这块也不用太担心。LM Studio 已经可以在 AMD 平台上直接发现、下载并运行 Qwen3.8 27B,社区向的本地推理引擎则把模型商店、一键下载、上下文配置、OpenAI 兼容接口打包成了图形化流程,个人玩家不用自己配环境。知乎 部署时的上下文长度、KV 缓存精度、温度这些参数,都能在启动弹窗里一次性设好。

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

模型本身也在往本地友好的方向走:Qwen3.8-27B 原生支持 262K 上下文,还新增了 reasoning_effort 参数,可以按任务难度控制思考深度、省资源。知乎 对 128GB 统一内存的 395 来说,27B 量化模型占掉十几 GB 之后,剩下的大头全可以留给上下文——这是统一内存机器跑稠密模型最实在的优势。

395 的真正对手是谁

定位问题,4 月份知乎上已经有过一轮很清楚的讨论:395 不是 RTX 4090 的替代品,应该放进统一内存阵营,和 DGX Spark、Mac Studio M3 Ultra 正面比。知乎

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

和 DGX Spark 的对比结果有点反直觉:后者带宽 273GB/s,只比 395 的 256GB/s 高一点,同模型实测体验基本拉不开差距。知乎 所以 395 相对 DGX Spark 的卖点从来不是推理速度,而是便宜,以及能当一台正经电脑用。

AMD给Qwen3.8-27B做了Day 0支持:395迷你主机官方24.5 tokens/s,但社区要问的是这个数字打几折

Mac Studio M3 Ultra 则是另一个量级的选择:国内到手约 8 万元,主要面向预算充足、想在桌面上跑 671B 满血模型的发烧友。知乎 三台机器各有各的生态位,想清楚自己要跑多大的模型、多快的速度,再谈值不值。

最大的变量其实是价格

今年 395 迷你主机市场被内存价格搅得不轻。前面提到的 B 站热帖里,最高赞评论相当有代表性:涨价后已经没有性价比,自己 11000 买的机器,上个月 15000 卖掉了。哔哩哔哩 一年白用还小赚一笔,听起来像段子,其实是这波内存行情下 395 机器的真实写照。

厂商也在被迫调整:天钡的 NEX 395 迷你主机宣布"重新上线",代价是内存降级到 64GB。微博 对一台卖点就是本地跑大模型的机器来说,内存砍半基本等于砍掉半条命——128GB 满配版本只会越来越稀缺,价格也越来越硬。

连 AMD 自己都下场了:6 月发布第一方迷你主机 Ryzen AI Halo,同样搭载 Ryzen AI Max+ 395 和 128GB 统一内存,定价 3999 美元,官方口径是"和 OEM 小伙伴竞争"。知乎 官方亲自做整机、配 ROCm 给主流模型做 Day 0 支持,对生态是明确的加分项,但 3999 美元的定价也说明:这台机器的成本结构就摆在那里,捡漏窗口基本关上了。

值不值得买,以及接下来看什么

给观望党一个可以对照的决策线——4 月份那篇对比文说得很直白:预算 18000 以内、主要跑 35B 以内的量化模型、又需要一台日常能用的电脑,395 可以考虑。知乎 放到今天,这条线受涨价影响只会更紧;反过来,手里已经有一台 128GB 版 395 的,这次 Qwen3.8-27B 的 Day 0 支持就是纯粹的利好,升级模型本身零成本。

接下来有几个值得盯的信号:

一是社区能不能在 Qwen3.8-27B 上复现官方 24.5 tokens/s——MTP=4 的配置是否稳定、驱动版本有什么要求,这决定 Day 0 承诺的成色;

二是内存价格走势,它直接决定 128GB 版本机器的新机和二手行情;

三是新机节奏:极摩客 EVO-X3 已经露面,官方 Ryzen AI Halo 的供货和实际成交价也值得等一等;

四是模型侧:Qwen3.8-27B 的 reasoning_effort 加 262K 上下文能不能在本地 Agent 工作流里玩出花,这决定这台机器的利用率上限。

一句话收尾:本地部署这条路上,AMD 这次把新模型的官方路铺到了家门口,但路能跑多快,终究还是带宽说了算——256GB/s 的天花板之下,24.5 是努力的上限,12 才是日常的底色。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章