榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

2026-08-08 13:22:26 0点赞 0收藏 0评论

llama.cpp:

一款纯 C/C++ 开发的开源大模型离线推理引擎,所有 AI 计算都在本地完成。

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

🚀 核心亮点

  • 纯 C/C++ 实现:无需额外依赖,轻量高效。

  • 跨平台支持:Linux、Windows、macOS,以及多种 GPU(CUDA、HIP、SYCL、Vulkan、WebGPU)。

  • 极致性能优化:支持 1.5–8 bit 量化,显著降低内存占用并加快推理速度。

  • 灵活部署:可直接运行二进制文件、Docker 部署,或通过 Hugging Face 下载模型。

  • 多种接口:CLI、OpenAI 兼容 API server、Web UI,满足不同使用场景。

  • 社区活跃:GitHub 上有十多万 Star,贡献者众多,生态完善。

安装

Docker Compose(纯 CPU 推理)

services: llama: image: ghcr.io/ggml-org/llama.cpp:server container_name: llama ports: - 8080:8080 volumes: - ./models:/models command: - "-m" - "/models/Qwen3.5-0.8B-Q4_K_M.gguf" restart: always

Docker Compose(GPU 加速)

services: llama: image: ghcr.io/ggml-org/llama.cpp:server-vulkan container_name: llama ports: - 8080:8080 volumes: - ./models:/models devices: - /dev/dri:/dev/dri command: - "-m" - "/models/Qwen3.5-0.8B-Q4_K_M.gguf" restart: always

参数说明(更多参数建议去看文档)

/models(路径):存放模型

/dev/dri(硬件):透传核显功能

/models/Qwen3.5-0.8B-Q4_K_M.gguf(运行命令):根据实际情况,填写模型名称

TIP:llama.cpp 可以调节命令项很多,上面只给出了基础的参数。要想发挥设备全部性能,需要根据实际情况灵活配置。当然不管怎么样调节,提升性能效果都是有限的,最重要的还是硬件本身。

Docker Compose(根据设备情况特调)

services: llama: image: ghcr.io/ggml-org/llama.cpp:server-vulkan container_name: llama devices: - /dev/dri:/dev/dri ports: - "8080:8080" volumes: - ./models:/models command: - "-m" - "/models/Qwen3.5-4B-Q4_K_M.gguf" - "--chat-template-kwargs" - '{"enable_thinking": false}' - "--gpu-layers" - "99" - "--threads" - "4" restart: unless-stopped

准备

第一步,准备模型文件(GGUF 格式)。国内用户直接去魔塔社区下载,速度快不用科学上网。

https://www.modelscope.cn/models榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

筛选格式为 GGUF 的,至于选什么模型就看个人喜好了

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

下面是评测用到的模型

https://www.modelscope.cn/models/unsloth/Qwen3.5-0.8B-GGUF https://www.modelscope.cn/models/unsloth/Qwen3.5-2B-GGUF https://www.modelscope.cn/models/unsloth/Qwen3.5-4B-GGUF榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

使用

浏览器中输入 http://NAS的IP:8080 就能看到界面

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

TIP:为了截图效果更好,切换成深色模式

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

右下角可以添加上传文件资料

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

右下角显示当前正在运行的模型,点它还能看参数详情

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

日常聊天如果是用 0.8B 的模型,回复速度非常快的达到 33.21 t/s

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

底下的小圆点指示上下文长度,点击能看到输入和输出的速度

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

点击模型,可以看到具体的参数设置信息

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

同时支持添加 MCP 服务,扩展各种功能

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

有兴趣的可以部署试试,有可视化操作界面挺不错的

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

TIP:兼容 OpenAI 的协议,按要求填写 URL ,密钥随便填就行

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

模型可以正常识别和加载

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

如果是其他工具调用,首次有可能会嵌入提示词,所以回复会慢一点

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

测试

测试目的很直接:对比纯 CPU 和核显加速的差距,看不同模型大小的表现。为公平起见,全部用默认参数,关掉了思考模式。

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

测试硬件:

  • 处理器:12th Gen Intel(R) Core(TM) i5-1235U

  • 内存:32GB DDR5 4800MHz

测试对象:

  • llama.cpp:server(纯 CPU 推理)

  • llama.cpp:server-vulkan(GPU 加速)

测试模型:

  • Qwen3.5-0.8B-Q4_K_M.gguf

  • Qwen3.5-2B-Q4_K_M.gguf

  • Qwen3.5-4B-Q4_K_M.gguf

测试问题:

  • 我们为什么存在?

榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型榨干 NAS 核显性能!本地部署 llama.cpp,流畅运行 Qwen3.5 模型

总结

llama.cpp 算得上是本地跑大模型最成熟的方案,纯 C/C++ 写的推理运行效率高。日常使用中多数设备核显长期闲置,刚好可以借助本地 AI 推理充分利用硬件性能。相较纯 CPU 运行,开启核显加速后推理速度普遍有明显提升,还能大幅削减 CPU 负载。受限于硬件性能,只能流畅运行轻量化小模型,但完全可以胜任数据脱敏、模型微调、离线私人助手等场景。

综合推荐:⭐⭐⭐⭐(推理速度快,可自由调参)

使用体验:⭐⭐⭐(可视化界面,使用简单)

部署难易:⭐(非常简单)

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松