4. 🚀Mac 本地部署大模型完整教程。本文适合完全没有命令行经验的新手,手把手教你从零开始,在 Mac 上跑起来本地大模型,彻底告别 Token 消耗。
📋 你需要准备什么
一台 Mac(Apple Silicon 的 M 系列芯片最佳,推理效率远高于 Intel)
足够的内存(8GB 只够跑 Qwen 的小版本,想跑 Gemma 4 至少需要 16GB,越大越好)
网络(第一次下载模型需要,之后完全本地运行)
🔍 第一步:先搞清楚你的机器能跑什么
很多人折腾本地模型失败,原因很简单:下了一个跑不动的模型。要么内存不够直接报错,要么勉强跑起来速度慢到没法用。
所以第一件事,先用 llmfit 扫一下你的硬件(仓库地址见评论区)。
这个工具会自动检测你的 RAM、CPU、GPU,然后从几百个模型里筛出哪些能跑、哪些太大,按适配度排好给你看。
打开「终端」(Spotlight 搜 Terminal),执行:
brew install llmfit
装好之后直接运行:
llmfit
会弹出一个交互界面,搜索你感兴趣的模型名(google/gemma4 或 qwen/qwen3.5),看一眼它标注的 Fit 一栏:Perfect 或 Good 都可以跑,Marginal 勉强,Too Tight 就别碰了。
图像
💡 没有 Homebrew 怎么办?先去 brew.sh 复制那行安装命令,在终端执行,装完再回来继续。
🦙 第二步:安装 Ollama
Ollama 负责模型的下载、加载和运行,还自带一个本地 API,是目前新手最省事的方案。
在终端执行:
brew install --cask ollama
图像
看到"🍺 ollama-app was successfully installed! " 表示安装成功。
安装完成后,菜单栏右上角会出现一个🦙图标,这就是 Ollama 在后台运行的标志。看到它,说明安装成功。
图像
⬇️ 第三步:选一个模型下载
目前值得推荐的两个选择是谷歌的 Gemma 4 和阿里的 Qwen3.5。
Gemma 4 是谷歌 DeepMind 在 2025 年发布的开源模型系列,最大亮点是原生支持多模态(文字+图片),上下文窗口达到 128K~256K,在同体量开源模型里综合表现靠前。
Qwen3.5 是阿里通义团队的最新开源版本,支持 201 种语言,中文理解和代码能力尤其突出,同时内置"思考模式",复杂问题可以先推理再回答。两个都是近期开源圈里最值得关注的选择。
根据你在 llmfit 里看到的结果,对照下面的表选版本。(部分模型可能搜索不到,以实际搜索结果为准,下图供参考)
图像
两个都想试的话,用哪个命令都行,Ollama 支持同时装多个模型,随时切换:
# 下载 Gemma 4(以 26b 为例)
ollama run gemma4:26b
# 下载 Qwen3.5(以 27b 为例)
ollama run qwen3.5:27b
Ollama 会自动开始下载,进度条会显示在终端里。模型文件比较大,下载时间取决于你的网速,给它一点时间,不用一直盯着。
✅ 第四步:验证跑起来了
下载完成后,Ollama 会自动切换到对话模式,终端会出现 >>> 提示符。
输入一句话测试一下:
>>> 你是谁?
模型能正常回答,说明部署完成了。
⚠️ 这一步不要跳过。 有时候因为网络原因下载中断,模型文件不完整,表面上看装好了,实际跑起来会报错。先验证一下再继续。
🖥️ 第五步(可选):用图形界面代替命令行
不习惯命令行的话,可以下载 Ollama 官方 app,有完整的聊天界面,支持文件拖拽,操作方式和网页版 AI 一样。
下载地址:ollama.com/download(选 macOS 版本)
用命令行下载的模型会自动出现在 app 的模型列表里,不需要重新下载。
💡 菜单栏的🦙图标是 Ollama 的服务管理入口,显示运行状态、可以开关服务,不是聊天界面。
图像
⚙️ 进阶:接入你现有的工具
Ollama 运行后会在本地开放一个 API 接口,默认地址是 localhost:11434。支持自定义 API endpoint 的工具都可以接入,比如:
Open WebUI:网页版对话界面,功能更完整
Cherry Studio:桌面客户端,支持多模型切换
Claude Code:命令行编程助手,可以指定本地模型
每个工具的配置方式不同,后续看大家反馈,有需要再写进阶篇再展开。
❓ 常见问题
Q:brew 命令执行报错怎么办?先检查 Homebrew 有没有装好,在终端输入 brew --version,能显示版本号说明没问题。如果提示 command not found,先去 brew.sh 重新安装。
Q:模型下载到一半断了怎么办?重新执行 ollama run 模型名 就可以,Ollama 支持断点续传,会接着上次的进度继续下载。
Q:跑起来速度特别慢,像在爬怎么回事?基本上是模型太大、内存不够用,导致系统开始用硬盘来补内存(swap)。回到 llmfit 看一下推荐结果,换一个更小的版本,速度会明显改善。
Q:关掉终端模型还在跑吗?菜单栏🦙图标还在的话,Ollama 就还在后台运行,API 接口也还开着。想彻底关掉,点图标选 Quit 即可。