9月7日,尔英周报照常发出。这一周的大事件是GPT-6 Astra发布、英伟达129亿美元收购Hugging Face。而在惯有的"尔英视角"栏目里,那句话已经连着第N周出现:“最终都需要落地到本地推理与部署……无论是AI开发者的本地模型调试,还是中小团队的推理验证,都能以更低门槛获得可靠的算力支撑”。知乎
不只有尔英在讲这个叙事。竞品信克8月21日官宣"首块AI-MoDT":最新一代3nm旗舰芯片、首块AI-MoDT(36 TOPS)、DDR5 128GB/6400MHz。哔哩哔哩另一边,是被内存、显卡双线涨价挤压的本地部署人群——B站"Qwen3.8-27B要用什么配置"的单条视频评论区,攒下了一场真实的民间算力定价会。
于是尔英粉和AI玩家共同的念头就一个:一两千块的板U一体、十几个核、24小时开机不心疼,是不是就是涨价潮里的"穷人推理机"?
一、先对齐标尺:本地部署圈按"容量→带宽→速度"排座次
这个圈子对一台推理机的评价标尺,早被实测党们说透了:显存容量决定能否加载,内存带宽决定生成速度。哔哩哔哩
具体到27B级别的模型,评论区给出了带价钱的标尺:Q4量化最丐的方案是魔改2080Ti 22G,速度20token/s左右,有点钱的上3090,能够到40token/s。哔哩哔哩
而苹果阵营首发囤了M5 MAX 128G的用户实测,跑8bit量化中文约30tokens/s、英文50左右,自认"日常干活完全够了"。哔哩哔哩
这套标尺可以粗暴地折成一个式子:单流decode的tok/s上限≈内存带宽÷每token要读一遍的权重体积。27B Q4约摸16GB权重:936GB/s的3090算出来约58、实测40,616GB/s的2080Ti算出来约38、实测20——真实速度还要在理论值上再打个六折七折。记住这个"带宽税",因为它马上要来收尔英的。
二、尔英的带宽上限,是官方上周刚科普过的
9月4日,尔英自己发了一条视频,专门解释MoDT平台"内存标 6400,为什么用起来只有 4800"。哔哩哔哩说的就是MoDT平台的老问题:移动CPU的内存控制器天花板摆在那里,尔英13代MoDT今年就被大UP实测过"DDR5内存超频部分有缺陷,最高只能5600频率"。哔哩哔哩双通道DDR5-5600是什么概念?约90GB/s——丢进上面那个式子,27B Q4的理论上限只有5-6 token/s,打完折基本告别"能对话"。7B级Q4约14-20 token/s,勉强够读,不够用。
官方视频评论区的画风倒是比周报诚实:“oem的商用整机就没法开xmp”。哔哩哔哩
另一位一口气买了20片的用户追问:“这绿灯的话是卡内存吗?你这玩意儿怎么没说明书啊”。哔哩哔哩尔英把售后吐槽做成科普,态度值得记一功,但频率墙是移动芯的物理属性,不是BIOS教学能解决的。
更拧巴的是官方自家口径。那篇《从行业寒冬到MoDT破局》里,尔英推荐的商务整机标配是"16GB DDR4内存",宣传口径是XTU超频下性能逼平桌面i5-12600KF。知乎周报喊"本地模型调试",自家整机连27B Q4的权重都装不下——16GB给的是办公场景,不是推理场景,这两个用户画像被话术缝在了一起。
三、但别急着盖章"智商税":容量、并发与通宵,恰是MoDT的窄门
MoDT推理机有两个被忽视的真实优势。一是容量便宜:一套板载i5或i7级移动处理器的MoDT主板,价格往往在1000至1500元之间,13900HX/14900HX级也控制在2000至2500元上下(尔英官方口径)。知乎插64GB内存就装得下27B全家,这是24G显存党花三倍钱都够不着的池子。二是并发和功耗:同为板载14500HX的主板,社区实测整机待机仅26W,14核20线程随便开。哔哩哔哩评论区有人算过同样的账:“整机算下来或许170HX/64G也没有贵多少,而且可以开多个并发”。哔哩哔哩CPU推理的batch吞吐随核数走、单流速度不涨——“速度不行,但可以多开、可以通宵”。
所以MoDT真正的位置,是把"实时对话"换成"通宵批处理":RAG索引、embedding、Whisper转写、定时任务。值得注意的是,尔英官方用词其实很鸡贼——它说的是"调试"和"推理验证",没说"生产推理"。调试要的是容量、多开和别关机,恰恰不苛求token/s;玩家想要的"用起来"和官方卖给你的"调试起来",中间差着5-6个token/s的带宽税。
同一赛道两个参照物的话术也该对半砍再听:极摩客给128GB的EVOX2喊的卖点,是总AI算力126TOPS、LMStudio性能超RTX4090的2.2倍。哔哩哔哩可它那颗Strix Halo的统一内存带宽约256GB/s,赢4090(1008GB/s)的前提只能是"对方根本装不下这个模型"。信克的"36TOPS"同理——TOPS是NPU的营销单位,和大模型解码吃的带宽根本不是一回事。
四、这笔账最后怎么算:先回答三个问题再下单
把尔英MoDT放进涨价潮的完整决策表。第一问:你是重度交互式干活,还是24/7常驻服务?agent改代码、长文精修这类活,社区的标准已经被抬高了——就算有5090的100t/s以上,照样有人嫌一个任务思考五分钟,而二手5090已经要26000元。哔哩哔哩这种活别上MoDT,攒魔改卡或Mac。
如果你是后者——那位月耗API近万元的重度用户已经喊出"还是自己部署吧"。哔哩哔哩一台尔英HX板U+64GB的盒子,跑的是转写、embedding、家用助手这类"快5token/s慢5token/s都无所谓"的常驻小模型,55W级别的功耗意味着全年电费可以忽略。
第二问:桌面平台现在有多贵?连尔英自己引用的行业口径都是:2026年全球PC出货量预计下滑11.3%、均价上涨约17%,整机涨幅或达15%-20%。知乎"买板U送核显"的MoDT不是便宜里的最优解,但大概率是"全新件+大内存+常开"这个组合里的最低门槛。第三问:你手里是不是已经有32G+内存的旧电脑?先装上Ollama跑一周再谈下单,多数人会发现自己缺的不是更快的模型,而是把模型用起来的那个场景。
最后留一个诚实的注脚:截至发稿,全网没有一条"尔英平台实测27B token/s"的公开视频。话术很热、案例很冷,这个缺席本身就是信号。在出现第一个14500HX+64G的实测数据之前,周报里的"可靠算力支撑",建议只当愿景读。