当前位置:
文章详情

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

2026-08-27 10:39:36 0点赞 0收藏 0评论

自从前几年开始接触和使用小主机后,我已经不怎么去碰 PC 台式机了。原因很简单,没有独显游戏需求,日常办公也不需要过强的处理器,在静音、桌搭上更倾向小体积。

在我家,有 2 台小主机,一台负责 Linux 跑 Coding,另外一个负责日常使用;而我在办公室,则是直接在屏幕后悬挂了 1 台用来办公,整个桌面搭配得异常舒服。

但最近,我犯难了。因为我有了本地 AI 算力的需求。如果要让我用小主机再去外挂一个 OCulink 的显卡坞,也不是不行,但是总感觉是不是直接换回 PC 台式机会更好一点。

直到最近在东子闲逛,在看到零刻家发布的一款「 AI 迷你主机」时,我心动了。

这台小主机搭载 i7-13620H 处理器、32GB 内存、2.5G 网口,并且内置 24G NPU,提供 160 Tops 算力,可以实现本地 9b 稠密、35b MoE 架构的运行,输出 23 tok/s 往上。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

这是在小主机通过 OCulink 外接显卡,或者雷电4 降性能接扩展坞之后,第三套小主机上的 AI 算力解决方案。

而当我真正拿到手体验之后,我才发现这套方案里,还有一个非常重要的点。

玩 NAS 的时候,我们就在讲一个概念,叫做 “存算分离”。用低性能 NAS 来存储设备,用高性能 NAS 来跑计算,通过网络实现数据交互。

而零刻这款 SEi13 AI,也有一个“分离”,可以理解为 “算、算分离”。第一个算,指的是 CPU 通用算力。第二个算,指的是 NPU AI 推理算力。

以前我们玩本地 AI ,遇到一个最大的问题就是模型无法完整放入显存后,部分计算和模型数据会落到 CPU/系统内存,性能下降并明显增加系统资源占用。这就导致了一跑模型,电脑直接卡死了,必须老老实实等 AI 跑完结果才可以。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

包括小主机也是,我们之前看到的某个 CPU 里集成了多少多少算力的 NPU,但本质上它还是集成了的处理器内部 AI 加速单元,虽然可以承载部分算力,但是依旧占用系统资源。

而零刻 SEi13 AI 的 NPU 算力体系,它通过引入一块 M.2 接口的 NPU 算力卡,将 AI 推理资源从主机系统中独立出来。这块 NPU 模块拥有自己的计算单元和 24GB LPDDR5 专用推理内存。

也就是说,小主机在接受到用户需求指令,在通用计算部分解决任务分配,再将具体的模型调用请求分派给 NPU,等 NPU 完成推理后,CPU 再将其结果返回到应用层。整个过程,CPU 只是负责派活、收集、分配,真正消耗大量算力的模型推理环节,全都由 NPU 独立完成。

这套模式就解决刚才说的问题,本地 AI 算力在计算的过程中,我的小主机依旧是一个低占用的状态,我可以正常浏览网页、看视频、办公乃至进行 Agent 工作和云端 API 调用。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

零刻 SEi13 AI ,预装了一套 Ubuntu 系统,并且内置了对应的 llama.cpp 推理框架,默认使用了 qwen3.5-9b 模型。而且不止 LLMs,embedding、Reranker、ASR 等多种适配模型,都可以通过零刻模型库下载。

经过我的实测,我在零刻 SEi13 AI 上跑了两套体系,都可以在 24G NPU 体量内加入,并且比较顺畅的进行工作和输出。

第一套是 qwen3.5-9b LLMs(128K 上下文)常驻;额外增加 BGE-0.5b-embedding + qwen3-reranker-8b + qwen3-asr-1.7b,按需运行。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

第二套是单 qwen3.6-35B-A3B (128K 上下文)MoE 架构。内存基本占用大部分,没办法在 NPU 增加 RAG 配套模型。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

一。开箱

先开个箱。零刻SEi13 AI 这台设备最大的特色就是整体通红的外观。它的外包装设计上增加了 OpenClaw 的经典形象,并且整机设计成 OpenClaw Logo 的大红色,非常有特色。桌搭效果好于目前主流的黑、白色系。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

设备整体为铝合金外壳,表面细砂喷砂,尺寸和零刻传统的 SEi 系列保持一致。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

正面接口比较常规,但该有的基本都有,包括电源键、CLR CMOS、3.5mm 音频接口、Type-C 10Gbps,以及一个 USB-A 3.2 10Gbps 接口。

日常办公时连接耳机、读取 U 盘,或者临时接个高速移动硬盘、扩展坞,都不需要绕到机身背后,使用起来还是比较方便的。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

背面的接口就丰富很多了。显示输出方面,提供一个 DP 1.4a,最高支持 4K@144Hz;一个 HDMI,最高支持 4K@60Hz;顶部的 Type-C 10Gbps 同时支持视频输出,所以整机在多屏办公方面基本不用担心。

数据接口方面,背面还有 3 个 USB-A 接口,其中左侧上下分别是 USB 3.2 10Gbps 和 USB 2.0,DP 下面的是另外一个 USB 2.0,这样键鼠、移动硬盘、打印机这类常用外设都能直接接。再加上前后另外一个 Type-C 10Gbps,整体扩展能力对于一台小主机来说已经相当充裕。

网络为 2.5Gbps 网口,日常局域网内使用足以。另外比较少见的是,前后各安排了一个 3.5mm 音频接口,如果同时有麦克风和耳机需求,也不需要额外再接一个 USB 声卡或者扩展坞。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

拆掉顶盖后,内部还有一层大面积金属防尘网罩,下方可以看到散热风扇。它一方面负责过滤顶部进风中的灰尘和异物,另一方面也能保护内存、SSD 等内部元件,并配合风扇形成更完整的内部风道。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

继续拆掉网罩、风扇、导流罩以及散热板。就可以看到下方的两个 M.2 盘位了。其中一个是 1T 的 M.2 Nvme SSD,另外一个就是本篇介绍的独立 M.2 NPU 算力卡。这张算力卡单独配备了硅脂。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

二。办公实测

1. 扩容与监控

鉴于内置的 Ubuntu 24 系统,默认只给了 100G 左右的空间,我们需要通过下面的指令将剩余空间挂载到 LVM 卷上。

sudo lvextend -l +100%FREE -r /dev/ubuntu-vg/ubuntu-lv

接着我在本地搭了一套 NPU 驱动展板页面,专门用来看 NPU 的驱动状态、模型运行状态、小主机性能状态等数据。

单 index.html 页面,分享地址在这里,需要的自取。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

2. 模型

零刻直接提供了适配好的模型库,目前内置有 100 个模型,包含了 LLM、Whisper、OCR、嵌入、重排序、ASR 等等。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

具体的模型路径位置在 /opt/llama/models/ 下面,内置的是一个 qwen3.5_9b 模型,包含了 mmproj 文件,所以是支持视觉识别的。

因为 llama.cpp 本身是支持 router 模式的,所以我还配置了一个 models.ini 用来给 Agent 提供路由模型。

具体样式可以参考如下:

🔻 models.ini ,放在 /opt/llama/models 下

[qwen3.5-9b] model = /opt/llama/models/qwen3.5_9b/HiModel_xh2_qwen3.5_9b_256_256k_b1_1chip_2cores_v1.3.0_20260429.gguf mmproj = /opt/llama/models/qwen3.5_9b/mmproj_xh2_qwen3.5_9b_2cores_vit_448x448_v1.3.0_20260429.gguf parallel = 1 ctx-size = 65536 n-predict = 262144 jinja = true [qwen3.6-27b] m = /opt/llama/models/qwen3.6_27b/HiModel_xh2_qwen3.6_27b_256_128k_b1_1chip_2cores_v1.3.0_20260603.gguf mm = /opt/llama/models/qwen3.6_27b/mmproj_xh2_qwen3.6_27b_2cores_vit_448x448_v1.3.0_20260603.gguf c = 131072 np = 1 jinja = true [bge-0.5b-embedding] model = /opt/llama/models/embedding/bge-0.5b.gguf embedding = true pooling = last embd-normalize = 2 parallel = 4 ctx-size = 8192 [qwen3-reranker-8b] model = /opt/llama/models/rerank/qwen3-reranker-8b.gguf rerank = true pooling = rank parallel = 4 ctx-size = 8192 [qwen3-asr-1.7b] model = /opt/llama/models/qwen3_asr_1.7b_65536_1_1/HiModel_xh2_qwen3_asr_1.7b_1chip_2cores_v1.3.0_20260604.gguf mmproj = /opt/llama/models/qwen3_asr_1.7b_65536_1_1/mmproj_xh2_qwen3-asr_1.7b_2cores_v1.3.0_20260604.gguf parallel = 2 ctx-size = 4096

🔻systemctl service 服务

先创建:

sudo nano /etc/systemd/system/llama-XXX.service

写入:

[Unit] Description=Llama Router - M50 NPU Multi-Model After=network-online.target houmo-driver.service Wants=network-online.target [Service] Type=simple WorkingDirectory=/opt/llama ExecStart=/opt/llama/bin/llama-server     --port 8090     --models-preset /opt/llama/models/models.ini     --models-max 3     --models-autoload     --log-file /var/log/llama-router.log     --log-timestamps Restart=always RestartSec=10 Environment="LD_LIBRARY_PATH=/opt/llama/lib:/usr/local/houmo-sdk/hal/lib" Environment="HOUMO_SDK_PATH=/usr/local/houmo-sdk" Environment="LLAMA_ENABLE_LAZY_MODE=1" [Install] WantedBy=multi-user.target

这样子使用 Agent 工具就可以在一个 API 端点里直接获取所有的模型信息。

不过目前 M50 在多模型动态切换时仍存在一定稳定性问题,因此正式使用阶段我还是以主 LLM 常驻为主,Router 留待后续驱动和推理框架继续优化。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

3. 实测

零刻SEi13 AI 设备内预装了一个 OpenClaw 应用。首次使用我们需要重新配置一下模型信息,配置方案在零刻系统内的桌面上有一份指南,按着那个指南设置一下即可。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

然后我们就可以随时打开桌面上的 OpenClaw 应用进行对话。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

或者也可以通过内置的 LLama Web 服务,我们可以进行一些简单的 chat 对话,TG 输出可以来到 20tok/s。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

这一套 NPU 框架也同样适用于 Windows 系统,同样去零刻官方下载对应的推理框架和驱动即可。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

这里我还是以零刻 SEi13 AI 原生应用不变,采用外部的小主机安装 Cherry Studio 来测试一下实际的使用效果。

相比于 WorkBuddy 等流行 Agent,目前测试下来 Cherry Studio 这种自定义系统提示词的 Agent 框架更合适本地运行。因为 WB 提供了太多的系统提示词,很容易导致本地推理模型将时间和上下文浪费而超时。

而 Cherry Stuido 的 Agent 可以根据需求选择 Pi、CC、DSH 等不同 Harness 框架,并且搭配自己的系统提示词来进行工作。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑


小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

配置完成后,在默认思考模式开启下发了一个 hello。思考时长 28s,返回了我系统提示词里的 Agent 角色设定信息。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

在我自己做的前端界面里,9b 模型的平均 TG 为 22.7 tok/s,速度可以接受。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

我使用零刻SEi13 AI 在 Cherry Studio 做了一个贪吃蛇的游戏。总共消耗了 4m21s,产物在右侧可以看到,游戏过程无 BUG,也没有画面异常,一次成功。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

游戏制作过程中,首字 TTFT 延迟 154.92ms,TG 16.46 toks/s。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

再来看测试过程中的小主机自身性能占用情况。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

左上角是 NPU 实时负载、2个 Core 实时负载、平均负载的四个参数,可以看到都是跑满 100%的。

而右侧我也将小主机的 CPU、内存、硬盘信息放了进来。在 NPU 满载的同时,CPU、内存占用毫无波澜,甚至 CPU 平均一直在 2% 徘徊,这就是我之前说的零刻 SEi13 AI 这台设备的 “算、算分离” 所带来的优势。

AI 推理核心工作基本由 NPU 承担,CPU 独立进行 Agent 操作部署以及办公事项。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

最后

体验下来,我觉得零刻 SEi13 AI 最有意思的地方,还是前面一直提到的这套“算、算分离”。i7-13620H 和 32GB 系统内存负责系统运行、日常办公以及 Agent 的任务调度,独立 NPU 则专门负责模型推理,两套计算资源互不抢占。

而且在实际测试里,哪怕 NPU 长时间跑满,CPU 占用依旧可以维持在很低的水平,我可以继续浏览网页、看视频、办公或者进行其他 Agent 操作,这也是独立 NPU 相比传统小主机本地跑 AI 最大的体验区别。

虽然前面跑的是内置的 qwen3.5-9B 模型,但是实测下来完全是装得下 qwen3.6-35b-a3b 的,如果不需要 NPU 在空闲时候做 RAG 的,完全可以将 9b 升级到 35b MoE 架构,获得更好的体验。甚至测试里,35b MoE 的 TG 速度比 9b 模型还要快。

另外要说的就是软件层面。零刻 SEi13 AI 把 NPU 驱动、推理框架、龙虾都预装到了系统里,默认环境拿到手就可以直接使用,这对有 AI 离线办公需求,又不擅长部署的人真的非常友好。

而如果想进一步折腾,也可以和我一样自己配置模型、Router,然后再去提供局域网内的外部服务。

零刻 SEi13 AI 在我原本喜欢的小体积桌面形态下,又补上了一套可以独立运行的本地 AI 算力体系。既不需要重新回到 PC 台式机,也不需要额外挂一个显卡坞,这才是这台机器真正让我觉得有意思的地方。

小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑小米玄戒AI Cube之外,另一 NPU 主机,24G算力卡 tokens 免费跑

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
相关好价
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松