最近两周,迷你主机圈在吵一台"新物种"。
7月29日,零刻上市了SEi13 AI和SEi14 AI两款机器,卖点很反常规——x86 CPU+独立NPU的双计算架构。微博说白了,就是把一张类似固态硬盘的AI加速卡插进迷你主机,专门拿来跑大模型。这个思路业内传了很久,但做成整机量产上市,这是头一遭。8月14日,UP主"爱折腾的老高"发出首发实测,评论区直接打起来:最高赞那条是"2000块的2080Ti 22G直接碾压",UP主本人则在评论区逐条回应。哔哩哔哩而小红书上,已经有人买了机器在问"怎么恢复出厂设置"。小红书我把实测视频和官方视频下面的200来条评论翻完了,连同上市信息和芯片背景一起核了一遍,今天说清楚。
一、这台机器是什么,钱到底花在哪
先看配置。SEi14 AI用的是Ultra 9 185H——注意,这是2023年底的芯片,单看CPU部分,它是一台"老平台"。真正的主角是那块独立NPU:最高160TOPS算力,配24GB推理专用内存,官方口径是兼容Windows/Linux、预装Qwen3.5-9B。小红书

价格更有意思。评论区汇总的信息是整机1.18万到1.4万,其中差不多一半,是那块M.2 NPU算力卡的钱。哔哩哔哩有人报算力卡单价7900元,也有人认出它是国产存算一体厂商后摩智能的LQ50模块。对照公开资料:后摩今年WAIC上展出的M50芯片,正是10W功耗、160TOPS算力,其LQ50/M50平台用的是官方定制版llama.cpp,和实测视频里"基于llama.cpp运行"的说法能对上。知乎也就是说,这台1万2的机器,6000多块的成本压在那张NPU卡上。你买的其实不是性能强的电脑,是一张"推理加速卡"加个载体。
二、为什么偏偏是现在出现这台机器
想搞本地AI的人,这一年被价格挤得很难受。要跑得舒服,基本只有几条路:锐龙AI Max+ 395这类Strix Halo机器,但内存涨价潮把128G配置普遍推上2万,铭凡MS-S1 MAX的64G版国补后还要16400元;独显方案体积功耗摆在那;Mac稳定但容量上限明显。预算一万出头、又想24小时挂模型的人,发现货架上没东西可买。
SEi14 AI就是冲这个空档来的。用老高的原话概括:“大概一半的395性能,一半的395价格”。哔哩哔哩
三、跑起来什么样:MoE真香,稠密模型真惨
这是评论区吵得最凶的地方,也是这台机器最核心的真相。实测视频里,Qwen3.6-35B-A3B这类MoE模型能跑到30tok/s上下,有人觉得"本地这速度还可以";但马上有人泼冷水:“主流是27B稠密模型,Q4量化在这机器上最多6t/s,约等于没用”。哔哩哔哩两句话其实都对。MoE模型激活参数小,吃的是调度不是带宽,天然适合这类低功耗推理硬件;稠密模型每个token都吃内存带宽,恰好是外挂NPU卡的短板。另外,实测视频没展示prefill首字速度,评论区有人直接点名:宣传160TOPS,那首token延迟呢?
还有生态。这套NPU走的是后摩定制llama.cpp,没进主线,意味着每出一个新模型,都得等厂商适配。8月15日后摩刚完成Qwen3.8-27B的Day0适配,算好消息,但这种"模型等驱动"的节奏,是PC玩家最不习惯的。知乎

四、它也不是没有成立的逻辑
UP主在评论区的回复把定位说得很白:让独立NPU+24GB专用内存"承担持续推理任务,减少对系统CPU和内存的占用"。哔哩哔哩翻译一下:你正常办公、写代码,后台的大模型挂在内核上24小时跑,互不抢资源。跑OpenClaw这类AI Agent、自建对话服务的人,对这个场景是真有需求的。低功耗是另一张牌,24小时常开的电费账单,比独显友好得多。
有位网友的评论我觉得最中肯:“性能、算力极其有限,优点是功耗极低,买之前要考虑清楚购买需求”。哔哩哔哩也有人说:“这个形式、这个功耗的表现还是很好的,只能希望有更多厂商加入。”
五、谁能买,谁该等
直接说结论。

三类人现在别碰:追速度的,想拿大模型当主力生产力,二手2080Ti、Mac mini、395的路都更成熟;主跑稠密模型的,27B Q4的6tok/s就是天花板;不想折腾的,Windows下驱动框架有门槛,新模型等适配,上下文和多模态也还没补齐。
只有一类人可以考虑:你明确要7x24小时低功耗挂一个轻量推理任务——小MoE模型、对话Agent、家庭AI服务——不想让AI占用主系统资源,也接受生态慢慢长。
不着急的话,盯三个信号:llama.cpp支持什么时候进主线、新热门模型的适配能不能当天跟上;这块NPU卡会不会单卖、价格能不能打到合理区间;有没有二代或竞品进场——有竞争,这类机器的定价才会说实话。
这波"AI PC",营销确实跑在了体验前面。但把NPU插进迷你主机,至少是认真在解"预算有限的人怎么跑本地AI"这道题。值不值得买,让需求和钱包各投一票。