跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

2026-08-29 18:50:25 0点赞 1收藏 1评论

llama-swap:

一个用 Go 编写的轻量级工具,专门用于在本地或容器环境中快速切换不同的 AI 模型服务器。它的核心目标是让你在同一套 API 接口下,灵活地在多个推理引擎之间切换,从而简化本地 AI 工作流的管理。

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

✨ 核心功能

  • 一键部署:只需一个二进制文件和一个配置文件即可运行,无需额外依赖。

  • 模型热切换:支持在本地 AI 服务器之间按需切换,例如 llama.cpp、vllm、stable-diffusion.cpp、audio.cpp、ComfyUI 等。

  • 兼容性强:同时支持 OpenAI 和 Anthropic API 的常见端点(如 v1/completions、v1/chat/completions、v1/messages 等),还能扩展到图像生成、音频转录等任务。

  • 自动交换逻辑:当请求到来时,llama-swap 会根据指定的模型 ID 自动加载或替换对应的推理服务器,这就是“swap”的核心机制。

  • 并行运行:支持通过 DSL 定义“swap matrix”,让多个模型同时运行,灵活分配系统资源。

  • Web UI:内置实时界面,可查看 token 统计、请求响应、日志流,以及手动加载/卸载模型。

准备

第一步,准备模型文件(GGUF 格式)。国内用户直接去魔搭社区下载,速度快不用科学上网。

https://www.modelscope.cn/models跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

筛选格式为 GGUF 的,至于选什么模型就看个人喜好了

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

下载模型后,创建一个 models 文件夹存放

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

接下来就是创建 config.yaml 的配置文件

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

参考填写,主要是替换模型的名称(如果不清楚配置,替换名称后复制给 AI,它会帮你调整参数)

参考模板: healthCheckTimeout: 300 models: "模型名称": cmd: llama-server --port ${PORT} --model /models/模型名称.gguf ttl: 600 我实际填写: healthCheckTimeout: 300 models: "Qwen3-Embedding-0.6B-Q8_0": cmd: llama-server --port ${PORT} --model /models/Qwen3-Embedding-0.6B-Q8_0.gguf --gpu-layers 999 --ctx-size 32768 --threads 4 ttl: 600 "Qwen3-0.6B-Q4_K_M": cmd: llama-server --port ${PORT} --model /models/Qwen3-0.6B-Q4_K_M.gguf --gpu-layers 999 --ctx-size 32768 --threads 4 --chat-template-kwargs '{"enable_thinking":false}' ttl: 600

安装

Docker Compose(核显加速)

services: llm-swap: image: ghcr.io/mostlygeek/llama-swap:vulkan container_name: llm-swap ports: - 8080:8080 volumes: - ./models:/models - ./config.yaml:/app/config.yaml devices: - /dev/dri:/dev/dri restart: always

参数说明(更多参数建议去看文档)

/models(路径):存放模型的目录

/app/config.yaml(映射文件):模型配置文件

使用

浏览器中输入 http://NAS的IP:8080 就能看到界面

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

TIP:为了展示效果更好,切换为深色模式

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

目前项目不支持中文,可以使用浏览器在线翻译

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

模型页面已经能看到配置的两个模型

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

硬件也能正确识别到处理器和核显

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

来到聊天页面,选择模型进行测试

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

输入对话内容,可以正常回复

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

性能监控页面,可以看到调用模型时资源占用情况

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

活动页面,能看到模型运行的生成速率。因为我这里调用的是 0.6b 的小模型, 40 tokens/s 的速度还是比较流畅的。

跑 AI 一定要独显?NAS 核显照样跑,实测 40 t/s

总结

llama-swap 是一个基于 llama.cpp 的模型热切换工具,在同一套 API 下按需加载/卸载多个推理引擎,切换模型不用再重启容器。实测部署核显加速识别正常,小模型对话流畅(约 40 tokens/s),Web UI 的实时监控和手动加载也很直观。不过配置文件需要自己写,模型文件要提前下载,有一定门槛。适合本地跑多个模型、追求灵活切换的 AI 玩家,纯新手建议先熟悉 llama.cpp 的基本用法再上手。

综合推荐:⭐⭐⭐⭐(模型热切换方便,本地 AI 工作流利器)

使用体验:⭐⭐⭐⭐(可视化操作,监控直观,功能齐全)

部署难易:⭐⭐(简单)

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
1评论

  • 精彩
  • 最新
  • 用啥核显跑 40t

    校验提示文案

    提交
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
1
扫一下,分享更方便,购买更轻松