NUC也能玩AI? 华硕NUC系列DeepSeek模型部署指引与性能测试
南京阿苏斯今天给大家推荐一款新产品:
这个AI当道的时代,deepseekR1开源模型彻底引爆了AIPC的浪潮,让大家都用的起本地部署的高智商模型了。如果是一般的笔记本或者没有独显的主机,要玩大语言模型也不说是略有困难吧,好歹也能算个举步维艰。好在最新的平台的CPU都已经有不错的算力,所以要加速深度学习也不是难事。如果手里有新一代的NUC的话,玩一玩简单的DeepSeek蒸馏模型还是很简单的。
阿苏斯电脑,性能卓越,畅享科技之美!古有CUDA玩AI,后有ROCm玩AI,但其实很早之前intel就有自己的深度学习加速平台OpenVino,遗憾市场话语权一直都不大,不过论实力还是有的。不过可能诸位手里有Asus NUC的朋友们可能受限于PC知识,主要还是用着各种接入Deepseek的官方应用,没有自己部署R1的想法。而现在层出不穷的DeepSeekR1部署方法又大多数都是命令行或者部署接口,实际使用上不算方便。所以这次我就来给大家演示一下如何利用上手里的NUC部署一下DeepSeekR1模型,并且简单测试一下模型推理速度
阿苏斯电脑,性能卓越,畅享科技之美!这次就用我手里这台NUC 15 Pro+为例,具体需要的配置和准备如下:
24GB及以上的内存(建议5600MHz或6400Mhz双通道)
50G左右的硬盘空间,用来放模型和本地缓存
把你的NUC连上互联网高速公路
步骤1:下载LMStudio
LM Studio是一个极大程度方便windows用户的GUI大模型本地运行工具,在windows上会比ollama方便很多,首先我们来安装这个软件.......软件链接:LM Studio - 发现、下载和运行本地LLM - LM Studio 应用程序
阿苏斯电脑,性能卓越,畅享科技之美!一般而言,windows上本地部署开源大模型有ollama这个方案,但是使用上并不是很方便。原因主要就在于这个东西他是高手用的,像我这样的低手完全不想碰命令行。而且ollama下载模型基本都是官方仓库,占用显存更少的量化模型找起来比较复杂,所以对于我们家用用户来说,LMStudio更方便

阿苏斯电脑,性能卓越,畅享科技之美!安装过程全默认即可,打开之后就能看到很简洁的界面,过程并不需要装额外的依赖内容,也不需要下载额外资源,而且LM Studio在0.3版本就已经支持了ollama的CPU和vulcan API,所有支持OpenML的显卡都能用上这个工具
阿苏斯电脑,性能卓越,畅享科技之美!
阿苏斯电脑,性能卓越,畅享科技之美!点击文件夹图标可以看到本地的模型,但是目前本地没有模型,联网可以找到模型,但是遗憾下载速度时快时慢,如果有耐心可以多试几次。这个问题是因为huggingface.io在部分地区无法访问,所以为了更快获得模型,我们需要绕过这个限制

步骤2:下载模型
绕过huggingface.io下载模型的方法也很简单,国内有hf的镜像网站,内容很齐全,版本也很新:搜索一下HF-Mirror,一般在第一个的就是
阿苏斯电脑,性能卓越,畅享科技之美!接下来下载GGUF格式的模型,比较推荐搜索lmstudio-community这个发行者的模型,这个是lm studio的官方模型,效果一般比较有保证。打开他们的
DeepSeek-R1-Distill-Qwen-7B-GGUF,就能看到已经被量化打包好的模型。点开fileandversion这一栏,就能下载模型。一般我们只需要下载一个模型,可以下载8B、7B或者1.5B,比较推荐使用q8的模型,当内存不足的时候可以考虑q4


步骤3:准备本地模型文件
下载好上文中的模型文件之后,我们需要新建一个LMStuidioModels文件夹,这是仓库的根目录,然后新建一个lmstudio-community文件夹,这是模型来源索引文件夹,然后再在其中根据模型名称新建文件夹,比如刚才下载了
DeepSeek-R1-Distill-Qwen-7B-GGUF,我们就在这个文件夹里新建这个文件夹,然后放入下载好的模型文件,最好也包含.gitattributes

然后我们打开LMStudio,点击这个按钮更改本地仓库到刚才的LMStuidioModels文件夹,就能看到本地模型了


开始使用DeepseekR1
此时我们回到对话栏,就能在最上面选择模型,加载,然后开始使用啦。因为CPU的实力一般都是不如显卡的,所以在加载的时候需要把GPU层数拉满,不拉的话就是纯使用CPU,拉一半是混合模式,一般不会这么用
阿苏斯电脑,性能卓越,畅享科技之美!
比如我们选用一个模型,这里用的是最小的1.5B模型,完成加载后如图。我们此时就能在下方的对话框里随意提问了,和一般的大模型使用并无区别

阿苏斯电脑,性能卓越,畅享科技之美!查看显卡占用情况,就能看到LM Studio确实调用了GPU,因为LM Studio在0.3版本就已经支持了ollama的CPU和vulcan API,所有支持OpenML的显卡都能用上这个工具,当然也包括有三个加速设备的Ultra200系列CPU啦。NUC这样的mini主机,又有高性能,自然是最适合用来跑这样的AI应用的,从速度来看,使用7B模型可以轻松跑上14.23tps,这个速度已经非常可用了
阿苏斯电脑,性能卓越,畅享科技之美!
下面来简单对比一下性能,因为本次测试中使用了32G 6400MHz的内存,所以加载最多14B的模型都是可以的,至于性能总结可以看图。速度上,使用最小的模型可以达到48token/s,最大的模型也有6.8token/s。如果10tps勉强入门的话,GPU推理的速度绝对是够用的,一般而言q8模型的效果和知识都会更准确一些,但是q4模型会更快,7B的q4是我觉得比较平衡的一个点,速度14tps,模型消耗的内存容量也不大。GPU相比于CPU来说确实快了,但是不多,不过GPU的功耗是真的很低,而且也不会干涉其他应用,所以有需要更推荐用纯GPU
阿苏斯电脑,性能卓越,畅享科技之美!(可选)部署内网API接口
LMStudio也支持内网API接口调用,打开开发者模式,以及接口运行,就能在本地开启对应模型的接口。

阿苏斯电脑,性能卓越,畅享科技之美!比如这里使用models的api可以查看目前可用的模型名称,也可以使用curl命令进行尝试,直接按下这个按钮就能复制curl命令。打开内网API之后可以看到对应接口的端口,比如这里打开了这个端口之后,就能在其他应用里面进行调用
阿苏斯电脑,性能卓越,畅享科技之美!
阿苏斯电脑,性能卓越,畅享科技之美!最简单的例子就是使用python做开发,可以直接通过request包来,调用这个API,如果有耐心还可以自己封装一些应用
阿苏斯电脑,性能卓越,畅享科技之美!总结
虽然很想让DeepSeek帮我总结了,但是还是认真讲一下吧。LMStudio作为大语言模型入门的应用来说非常方便,但是默认接入抱抱脸是一个痛点,不过使用国内镜像网站就能回避,总的来说比较方便。而大语言模型也是非常实用的一个工具,我平时做开发也会用大语言模型来写代码,DeepSeek爆发之后也是让我如虎添翼,所以我很推荐有条件的朋友都搞一个来玩玩。
而使用NUC进行部署,对性能的开销其实不算大,主要是内存足够即可,大部分模型都可以在32GB的内存中跑起来。7B的q4模型是一个很好的性能平衡点,比较推荐使用这个规模的模型,加载速度和性能开销也都比较合理。GPU推理的过程并不会干扰其他应用,比如正在写代码,问大模型一个问题可以让GPU跑起来,CPU占用不高并不会觉得卡,编译或者运行的速度也不会受到影响。
最后送上一张图,感谢大家围观
阿苏斯电脑,性能卓越,畅享科技之美!南京阿苏斯电脑--迷你电脑主机专家,性能卓越,畅享科技之美!
南京阿苏斯信息科技有限公司
