7月29日,零刻悄悄上架了两台不太像零刻的迷你主机——SEi13 AI和SEi14 AI,京东首发价11895元和13988元。快科技IT之家两台机器主要差在处理器:SEi13 AI是i7-13620H,SEi14 AI是Ultra 9 185H,都标配32GB内存+1TB固态(以商品页为准)。孤城Hardware要知道,零刻平时活跃在两三千元的办公小主机价位段,这次直接冲上了一万二。
它敢卖这个价的底气,是一张插在M.2插槽里的独立NPU算力卡:INT8算力最高160TOPS,自带24GB LPDDR5推理专用内存,192bit位宽。快科技零刻给这套方案的定义是“x86+独立NPU双计算架构”——CPU管系统和日常办公,NPU卡专门负责AI推理,两边各走各的内存通道,互不干扰。零刻官方

更有意思的是发布之后的舆论场。今天(8月14日)B站刚出第一个第三方首发实测,标题喊得很猛——“独立NPU算力卡性能炸裂,仅次AI MAX 395”;但评论区一点不给面子,吵成了三派。哔哩哔哩我们把官方渠道、芯片厂商动向、首发实测和两个视频的130多条评论都翻了一遍,给大家把这件事捋清楚。先说结论:这台机器不是给所有人准备的,但它确实精准踩中了一类人的痛点。
这张NPU卡,到底是什么来头
先做个背景科普。现在想在本地跑大模型,主流路子有三条:显卡、苹果统一内存、AMD AI Max 395这种大统一内存平台。第三条路今年出了大问题——内存和硬盘一路涨价,128GB内存的395整机价格直接起飞。哔哩哔哩零刻自家的GTR9 Pro,128GB+4TB版本7月已经卖到28599元。Beesing必炫数码想要本地算力,又不想被内存价格收割,这就是SEi AI出场的背景。
那这张卡是谁家的?官方没说,但多源信息交叉下来,基本可以锁定是后摩智能的M50存算一体芯片:
去年后摩发布的“天璇”架构端侧大模型芯片,规格就是160TOPS算力、最高48GB内存、153.6GB/s带宽,和SEi AI算力卡(24GB版、带宽约150GB/s)的指标几乎逐项吻合。科创板日报
今年7月的WAIC上,后摩展出多款搭载M50的AI终端。水母量化官方口径是“10W功耗下算力达160TOPS,可流畅运行30B至120B参数量级大模型”。
联想、长城电脑的Agentic Computer也用了M50,不过联想AI主机P7还没正式开卖——从公开信息看,零刻是第一个把这颗芯片做成零售整机并开卖的厂商。智慧芯片案内人

这个出身带来两个实际好处:一是功耗,AI推理这部分只有10W上下,7×24小时开机的电费和噪音都远低于整机140W的395机器;二是那张卡理论上只占一个M.2位,机器的x86部分该干嘛干嘛。
首批口碑:一处真香,三处硬伤
先说香的。
官方演示视频里,跑Qwen3.6-35B-A3B这类MoE模型,生成速度在30 token/s上下。哔哩哔哩评论区有老哥一句话点破了这台机器真正的卖点:“我先后用过树莓派、Radxa、华为的NPU加速卡,基本生态闭塞,想用新模型得付费找官方支持;零刻这个以llama.cpp为底层,兼容性和迭代速度想必会很可观。”被国产NPU生态坑过的人,看到llama.cpp这几个字是真的会心动。哔哩哔哩
另一个被低估的点:推理时系统资源完全不被占用。24GB在卡上,系统内存留给办公、网页、视频会议——边跑模型边干活,机器不卡。零刻官方在评论区也明确了定位:让独立NPU+24GB专用内存承担持续推理任务,低功耗、长期运行。哔哩哔哩
再说三处硬伤,都是评论区和首发实测里吵得最凶的:
第一,稠密模型基本没戏。有懂行网友估算,现在主流的27B稠密模型用Q4量化,在这张卡上“最多6 token/s,约等于没用”。也就是说它只适合MoE这类激活参数小的模型,想拿它快速跑稠密大模型,方向就错了。哔哩哔哩首发实测也没展示prefill(首字响应)速度,长上下文场景到底怎么样,还得等后续测试。
第二,生态还在早期。llama.cpp对它的支持没有进主线。哔哩哔哩后续新模型要等NPU厂商一点点适配;系统方面,Ubuntu拿到的是最新版框架,Windows虽然支持(首发实测作者和厂家确认过,有Windows版推理框架和驱动),但版本更新明显慢半拍。
第三,也是最现实的——价格。11895元起,评论区立刻给出了三套“灵魂 alternative”:
API派:“有这个钱拿去充API能用好几年,还能随时升级”;
Mac mini派:有网友实测对比,Mac mini M5跑同款35B MoE能到70+ token/s,更便宜还快一倍多(这是个人实测,但Mac系统一内存跑MoE确实一直是强项);
显卡派:“两张2080Ti不香吗,整机价格一半也就下来了”。
这三派说得都有道理,但它们也都没说全——因为它们对应的都不是“24小时开机”这个场景。
到底该不该买:按需求对号入座
把信号摆完,给个能对号入座的判断:
值得考虑的人:
7×24小时跑本地Agent、“养龙虾”的用户。 OpenClaw这波本地Agent热潮之后,一直有一批人需要一台安静、省电、不占主力机的常开设备。36氪10W级的推理功耗+系统资源零占用,这台机器几乎是照着这个场景设计的。
隐私敏感的企业/行业用户。 合同、财务、公文不出内网,这是API永远解决不了的需求。
预算充足、想尝鲜新形态的开发者。 前提是你能接受第一代生态:模型适配靠厂商、Windows慢半拍、新模型要等。
建议绕道的人:
追求稠密大模型速度的。 6 token/s的预估摆在那,同样预算上显卡或395才是正解。
想要游戏、剪辑全能主机的。 这台机器的卖点是NPU推理,图形性能并不是它的重点,一万二预算买游戏力,血亏。
轻度尝鲜用户。 每天问不了几次AI的话,API的成本优势是碾压级的,没必要买硬件。

观望党,盯这几个信号就够了:
llama.cpp主线什么时候合并这颗NPU的支持——这是生态能不能滚起来的关键;
算力卡会不会单卖、什么时候降价。评论区有人说一片要7900元。哔哩哔哩如果单卡价格打到两三千元,这台机器的性价比逻辑会彻底改写;
联想AI主机P7的上市价格——同款M50芯片,大厂的定价会直接暴露这张卡的合理价位;
想尝鲜的注意:零刻旗舰机型(如GTR9 Pro)的销售信息里带“30天试玩”政策,SEi AI的部分商品页也被网友看到类似字样。Beesing必炫数码下单前跟客服确认好退换条款,等于给自己留了后悔药。
最后说两句
零刻这一步棋,本质上是在“395太贵”和“普通迷你主机干不了AI”之间挤出来的第三条路:x86保基本盘,独立NPU卡做增量,用功耗和架构隔离换“常开可用性”。第一代产品硬伤明显——稠密模型慢、生态早期、价格不低——但把国产存算一体芯片做成消费级零售整机,这件事本身值得记一笔。
对大多数人,我们的建议是:值得持续关注,不必急着掏钱。真到了llama.cpp主线支持、单卡降价那天,这台机器和它的后续型号,才是真香的时候。而如果你正好被395的价格伤到、又需要一台24小时在线的本地AI设备——那它现在可能真的没有对手。