极摩客EVO-X5 Pro号称"全球首台离线跑300B",一道除法算出它每秒只能吐几个字:10月扎堆上市的192GB迷你主机,两万多谁该掏、谁别碰

源自155位全网作者

01:14

9月15日,AMD把锐龙 AI Max+ PRO 495的国内发布会开了。博主曝光的通稿名单里一口气列了八款产品:联想ThinkCentre X Ultra、超聚变FusionXpark M系列、铭凡MS-S1 MAX-P495、极摩客EVO X5 Pro、Emdoor AGH27、七彩虹灵创Mini Pro、阿迈奇F9A、六联的两个型号——一半是迷你主机。微博

再往前数几天:9月14日,AOOSTAR官宣了NEX495S;9月5日,极摩客在柏林IFA上全球首发了EVO-X5 Pro,宣传口径是"全球首台能完全离线跑300B大模型的迷你主机"。快科技

对一直观望"本地跑大模型"的人来说,这就是传闻里的"Q4的192GB"从PPT变成货架的时刻:192GB统一内存的迷你主机,要在10月扎堆上市了。但下单之前,先把"能跑300B"这三个字拆开看——里面藏着两笔完全不同的账。

极摩客EVO-X5 Pro号称

一、先把这台机器的事实钉死

项目

极摩客 EVO-X5 Pro

处理器

AMD 锐龙 AI Max+ PRO 495,16核32线程

统一内存

192GB LPDDR5X-8533

内存带宽

273GB/s

可划给核显当显存

最多约160GB

海外售价

3600美元起(约2.6万元),192GB+8TB顶配约8000美元(约5.8万元)

国行售价

未公布,预计10月上市

极摩客EVO-X5 Pro号称

同芯片的AOOSTAR NEX495S规格口径几乎一样:192GB统一内存,可划出160GB充当显存,定位紧凑型AI工作站。今天国内发布会上联想、铭凡、超聚变、七彩虹也都在名单里——10月这波不是一台机器,是一批。快科技

二、"能跑300B"三个字,拆开是两件事

第一件事是容量,192GB确实装得下。300B参数的模型做4-bit量化后,权重文件大概150GB上下。395那一代迷你主机128GB封顶,塞不进去,这就是"全球首台"的由来。192GB里划160GB出来当显存,容量这关是真的过了。

极摩客EVO-X5 Pro号称

第二件事是带宽,273GB/s决定它跑多快。大模型生成文字时,每吐一个token,都要把激活的权重从内存里完整读一遍。做一道除法:273GB/s ÷ 150GB ≈ 每秒1.8个token——这是理论天花板,实际效率再打个折,300B的dense模型在这台机器上每秒大概只能吐一个字出头。小红书

那官方为什么敢说"两位数"?因为IFA展台演示用的是Qwen3.8-Flash-Next,官方口径是"输出token每秒两位数,交互基本流畅"。两位数成立的唯一方式,是模型每生成一个token只需要读全部权重的一小部分——稀疏激活的MoE架构正是这么工作的。也就是说,“能跑300B"和"流畅跑300B”,演示的是两个不同的东西。小红书

有一组现成的实测可以做对照。知乎博主"怂中求稳"用395主机(128G版,带宽256GB/s)死磕Qwen3.8-27B本地部署:最开始用ollama跑只有10 tok/s,换适配后的llama.cpp框架跑到20 tok/s,有人放出同型号40 tok/s的截图。知乎

他接入DeepSeek Harness跑完整agent评测,输出26 tok/s——但首token平均要等1分18秒,因为一次塞进去了27.9万token的输入。知乎

这组数字基本框定了这类机器的真实能力范围:27B级模型在这套带宽上刚好踩到"agent可用"的门槛,300B dense离"可用"还差一个数量级。

还有一个比输出速度更隐蔽的坑:输入。小红书评论区有程序员点破:“90%的token都是输入。10%的token才是输出。prefill阶段速度更要紧,可惜AMD不太行”。你让它先读一份20万token的代码库再回答问题,等它第一次开口就要一两分钟——跑agent工作流,这个延迟是致命的。小红书

三、两万多块钱的账:博主算了一版,评论区改了三版

小红书博主"半窗烟雨"的原版账目是这样的:按3600美元折2.6万元算,对照云端DeepSeek V4 Pro输出12元每百万token的定价,得跑21亿token才能回本;就算每天100万token的重度用户,也要6年多,而这机器三年就过时了。结论是"只有一种情况值得买:数据绝对不能出内网,或者要在断网环境跑模型"。小红书

评论区立刻出现了三版修正。

修正一:他只算了输出,没算输入。每天100万token的输出,对应的是20倍的输入,计费口径是纯输出的2-3倍,私有部署如果用量够,2-3年就能回本,而且数据不出门。对真实的agent工作流来说,输入token才是大头,这笔账一改,回本周期从6年缩到2-3年。小红书

修正二:多并发才是收益上限。有本地多并发用户现身说法,一天多并发基本能赚回150块,一年能省5万API费。这笔收益成立的前提,是这台机器真的天天在满负荷跑,而不是吃灰。小红书

修正三:最狠的一版,连利息和残值都算了。先把买机器的钱存定期,看token账单能不能跑赢利息,还要扣掉电费和三年后的二手残值。外加一条清醒剂:AI的成长速度比硬件的淘汰速度要快得多,很可能模型规模已经翻倍,你的硬件却只值一半价值。小红书

知乎上一位已经用128G设备跑了大模型的老玩家(幻X 2025,qwen3.8-27B Q6_K量化)的判断更直接:聊天15TPS上下,可以用;但分析代码项目就是不可用状态,就算495能力翻倍也不够,想拿495部署大模型代替ds4、gpt可以直接放弃。知乎

四、这批机器到底给谁做的

把上面所有账合起来,人群其实非常清楚:

该掏钱的四种人:

  1. 数据有合规红线、模型绝不能出内网的单位——这不是省钱问题,是能不能用的问题;

  2. 有断网、移动、现场作业环境的团队;

  3. 真实的重度agentic用户,且能多人分摊一台机器——一天多并发跑满,2-3年账面上确实能回本;

  4. 需要160GB"显存"干别的事的人:大内存本地开发环境一把梭、中小模型微调、超长上下文的知识库问答,这些负载对带宽没那么敏感,192GB是实打实的生产力。

千万别碰的两种人:

  1. 想"一步到位离线跑300B替代云端旗舰"的个人玩家——你买到的是每秒一个字的300B,和官方演示里"两位数"的MoE模型,中间隔着一道除法;

  2. 轻度尝鲜党——两万六的机器,对应的是几百块就能玩一年的API账单,这笔钱拿去订阅云端服务,能用到硬件过时。

另外提醒一句:这颗芯片的核显是40个计算单元的Radeon 8065S,玩游戏不是它的卖点,同价位想要游戏性能,独显小钢炮阵营选择多得多。

五、10月上市前,盯住这三个信号

1. 国行定价和内存价差。锚点现成:极摩客自家EVO-X2(395+128GB)首发起售价15999元。PRO495+192GB的物料成本只会更高,还赶上了这波内存涨价。但这次同芯片有八家同时上,铭凡、联想、超聚变、七彩虹互相盯着,价格未必没有惊喜。真正值得盯的是同一款机器"192GB版"和"小内存版"的价差——价差越大,说明厂商越清楚192GB是专供给谁的。知乎

极摩客EVO-X5 Pro号称

2. 首批评测里的两个数字。一是标称"300B级"模型的实测输出token/s,低于每秒5个就当营销话术看;二是长上下文的首token延迟,塞进去十几万token后超过30秒,agent场景基本没戏。这两个数比任何发布会都诚实。

3. 395老款清不清仓。老玩家都在等"495上市、395降价"这一天。如果你的真实需求就是27B级模型加本地agent,128GB的395机器现在已经是可用状态——这波上新带动的老款降价,可能才是普通玩家真正的上车机会。

一句话收尾:192GB解决的是"装得下",273GB/s决定的是"等得起"。装得下300B是工程上的进步,等不等得起,是你自己的时间成本。10月国行价格公布那天,把这篇翻出来再看一眼。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章