跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s
llama-swap:
一个用 Go 编写的轻量级工具,专门用于在本地或容器环境中快速切换不同的 AI 模型服务器。它的核心目标是让你在同一套 API 接口下,灵活地在多个推理引擎之间切换,从而简化本地 AI 工作流的管理。

✨ 核心功能
一键部署:只需一个二进制文件和一个配置文件即可运行,无需额外依赖。
模型热切换:支持在本地 AI 服务器之间按需切换,例如 llama.cpp、vllm、stable-diffusion.cpp、audio.cpp、ComfyUI 等。
兼容性强:同时支持 OpenAI 和 Anthropic API 的常见端点(如 v1/completions、v1/chat/completions、v1/messages 等),还能扩展到图像生成、音频转录等任务。
自动交换逻辑:当请求到来时,llama-swap 会根据指定的模型 ID 自动加载或替换对应的推理服务器,这就是“swap”的核心机制。
并行运行:支持通过 DSL 定义“swap matrix”,让多个模型同时运行,灵活分配系统资源。
Web UI:内置实时界面,可查看 token 统计、请求响应、日志流,以及手动加载/卸载模型。
准备
第一步,准备模型文件(GGUF 格式)。国内用户直接去魔搭社区下载,速度快不用科学上网。
https://www.modelscope.cn/models
筛选格式为 GGUF 的,至于选什么模型就看个人喜好了

下载模型后,创建一个 models 文件夹存放

接下来就是创建 config.yaml 的配置文件

参考填写,主要是替换模型的名称(如果不清楚配置,替换名称后复制给 AI,它会帮你调整参数)
参考模板:
healthCheckTimeout: 300
models:
"模型名称":
cmd: llama-server --port ${PORT} --model /models/模型名称.gguf
ttl: 600
我实际填写:
healthCheckTimeout: 300
models:
"Qwen3-Embedding-0.6B-Q8_0":
cmd: llama-server --port ${PORT} --model /models/Qwen3-Embedding-0.6B-Q8_0.gguf --gpu-layers 999 --ctx-size 32768 --threads 4
ttl: 600
"Qwen3-0.6B-Q4_K_M":
cmd: llama-server --port ${PORT} --model /models/Qwen3-0.6B-Q4_K_M.gguf --gpu-layers 999 --ctx-size 32768 --threads 4 --chat-template-kwargs '{"enable_thinking":false}'
ttl: 600
安装
Docker Compose(核显加速)
services:
llm-swap:
image: ghcr.io/mostlygeek/llama-swap:vulkan
container_name: llm-swap
ports:
- 8080:8080
volumes:
- ./models:/models
- ./config.yaml:/app/config.yaml
devices:
- /dev/dri:/dev/dri
restart: always
参数说明(更多参数建议去看文档)
/models(路径):存放模型的目录
/app/config.yaml(映射文件):模型配置文件
使用
浏览器中输入 http://NAS的IP:8080 就能看到界面

TIP:为了展示效果更好,切换为深色模式

目前项目不支持中文,可以使用浏览器在线翻译

模型页面已经能看到配置的两个模型

硬件也能正确识别到处理器和核显

来到聊天页面,选择模型进行测试

输入对话内容,可以正常回复

性能监控页面,可以看到调用模型时资源占用情况

活动页面,能看到模型运行的生成速率。因为我这里调用的是 0.6b 的小模型, 40 tokens/s 的速度还是比较流畅的。

总结
llama-swap 是一个基于 llama.cpp 的模型热切换工具,在同一套 API 下按需加载/卸载多个推理引擎,切换模型不用再重启容器。实测部署核显加速识别正常,小模型对话流畅(约 40 tokens/s),Web UI 的实时监控和手动加载也很直观。不过配置文件需要自己写,模型文件要提前下载,有一定门槛。适合本地跑多个模型、追求灵活切换的 AI 玩家,纯新手建议先熟悉 llama.cpp 的基本用法再上手。
综合推荐:⭐⭐⭐⭐(模型热切换方便,本地 AI 工作流利器)
使用体验:⭐⭐⭐⭐(可视化操作,监控直观,功能齐全)
部署难易:⭐⭐(简单)︎
作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

samuellin1983
校验提示文案
samuellin1983
校验提示文案