榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型
llama.cpp:
一款纯 C/C++ 开发的开源大模型离线推理引擎,所有 AI 计算都在本地完成。

🚀 核心亮点
纯 C/C++ 实现:无需额外依赖,轻量高效。
跨平台支持:Linux、Windows、macOS,以及多种 GPU(CUDA、HIP、SYCL、Vulkan、WebGPU)。
灵活部署:可直接运行二进制文件、Docker 部署,或通过 Hugging Face 下载模型。
多种接口:CLI、OpenAI 兼容 API server、Web UI,满足不同使用场景。
社区活跃:GitHub 上有十多万 Star,贡献者众多,生态完善。
安装
Docker Compose(纯 CPU 推理)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server
container_name: llama
ports:
- 8080:8080
volumes:
- ./models:/models
command:
- "-m"
- "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
restart: always
Docker Compose(GPU 加速)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-vulkan
container_name: llama
ports:
- 8080:8080
volumes:
- ./models:/models
devices:
- /dev/dri:/dev/dri
command:
- "-m"
- "/models/Qwen3.5-0.8B-Q4_K_M.gguf"
restart: always
参数说明(更多参数建议去看文档)
/models(路径):存放模型
/dev/dri(硬件):透传核显功能
/models/Qwen3.5-0.8B-Q4_K_M.gguf(运行命令):根据实际情况,填写模型名称
TIP:llama.cpp 可以调节命令项很多,上面只给出了基础的参数。要想发挥设备全部性能,需要根据实际情况灵活配置。当然不管怎么样调节,提升性能效果都是有限的,最重要的还是硬件本身。
Docker Compose(根据设备情况特调)
services:
llama:
image: ghcr.io/ggml-org/llama.cpp:server-vulkan
container_name: llama
devices:
- /dev/dri:/dev/dri
ports:
- "8080:8080"
volumes:
- ./models:/models
command:
- "-m"
- "/models/Qwen3.5-4B-Q4_K_M.gguf"
- "--chat-template-kwargs"
- '{"enable_thinking": false}'
- "--gpu-layers"
- "99"
- "--threads"
- "4"
restart: unless-stopped
准备
第一步,准备模型文件(GGUF 格式)。国内用户直接去魔塔社区下载,速度快不用科学上网。
https://www.modelscope.cn/models
筛选格式为 GGUF 的,至于选什么模型就看个人喜好了

下面是评测用到的模型
https://www.modelscope.cn/models/unsloth/Qwen3.5-0.8B-GGUF
https://www.modelscope.cn/models/unsloth/Qwen3.5-2B-GGUF
https://www.modelscope.cn/models/unsloth/Qwen3.5-4B-GGUF
使用
浏览器中输入 http://NAS的IP:8080 就能看到界面

TIP:为了截图效果更好,切换成深色模式

右下角可以添加上传文件资料

右下角显示当前正在运行的模型,点它还能看参数详情

日常聊天如果是用 0.8B 的模型,回复速度非常快的达到 33.21 t/s

底下的小圆点指示上下文长度,点击能看到输入和输出的速度

点击模型,可以看到具体的参数设置信息

同时支持添加 MCP 服务,扩展各种功能

有兴趣的可以部署试试,有可视化操作界面挺不错的

TIP:兼容 OpenAI 的协议,按要求填写 URL ,密钥随便填就行

模型可以正常识别和加载

如果是其他工具调用,首次有可能会嵌入提示词,所以回复会慢一点

测试
测试目的很直接:对比纯 CPU 和核显加速的差距,看不同模型大小的表现。为公平起见,全部用默认参数,关掉了思考模式。

测试硬件:
处理器:12th Gen Intel(R) Core(TM) i5-1235U
内存:32GB DDR5 4800MHz
测试对象:
llama.cpp:server(纯 CPU 推理)
llama.cpp:server-vulkan(GPU 加速)
测试模型:
Qwen3.5-0.8B-Q4_K_M.gguf
Qwen3.5-2B-Q4_K_M.gguf
Qwen3.5-4B-Q4_K_M.gguf
测试问题:
我们为什么存在?



总结
llama.cpp 算得上是本地跑大模型最成熟的方案,纯 C/C++ 写的推理运行效率高。日常使用中多数设备核显长期闲置,刚好可以借助本地 AI 推理充分利用硬件性能。相较纯 CPU 运行,开启核显加速后推理速度普遍有明显提升,还能大幅削减 CPU 负载。受限于硬件性能,只能流畅运行轻量化小模型,但完全可以胜任数据脱敏、模型微调、离线私人助手等场景。
综合推荐:⭐⭐⭐⭐(推理速度快,可自由调参)
使用体验:⭐⭐⭐(可视化界面,使用简单)
部署难易:⭐(非常简单)︎
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
