如果你一直在关注"用 Ollama 跑本地大模型"这件事,本周的信号值得停下来看一眼:Ollama 不再只是"本地聊天框"了。v0.32.11 更新把 DeepSeek Harness 做成了官方集成——终端敲一句 `ollama launch dsh`,Ollama 会自动检测、安装 DeepSeek Harness 并连好模型。小红书几乎同一时间,OpenAI 把 Codex Harness 以 Apache-2.0 协议开源。微博同样能通过 Responses API 接 Ollama。B站上,"本地部署 DeepSeekHarness 加 Qwen3.8-27B,实现 token 自由"播放 4.1 万、收藏 1700+,"不用订会员!Ollama 接入 DeepSeekHarness"这类教程也在密集出现。哔哩哔哩
社区讨论的方向很明确:Ollama 正在变成 Coding Agent 的免费模型后端。但这句"AI 编程不充会员",没有教程里听起来那么香。把甜的部分和坑的部分拆开说清楚。
到底更新了什么:从"模型下载器"到"Agent 装机器"
先看 v0.32.11 的更新内容:
新增 DeepSeek Harness 集成:支持 `ollama launch dsh` 一键启动,支持 deepseek-harness 别名,自动检测并安装 @deepseek-ai/dsh;
Harness 可配置本地模型与云端模型;DeepSeek Harness 自动启用 Web Search(需要 Ollama Cloud 访问权限,且模型要支持工具调用);
新增 Muse Code 集成(`ollama launch muse`);
OpenAI 兼容 Responses API 支持 Web Search。小红书
这意味着 Ollama 的角色从"拉模型、聊聊天"变成了"AI 编程工具的一键安装入口"。知乎用户实测后总结:安装 Ollama、跑一句 `ollama launch dsh`,两步搞定,Harness 还没装的话 Ollama 会替你装好并连接模型;打开 Trajectory 选项卡,还能按时间线看 Agent 每一轮的上下文和工具调用。知乎上手门槛已经接近装一个手机 App。

这也解释了为什么本周教程集中爆发:一边是 DeepSeek 官方涨价,把一批编程用户推向替代方案;另一边 Ollama 把"零门槛接入"的路铺好了。小红书一边要省钱,一边给入口,热度自然起来了。
免费的真相:Agent 吃 token 比聊天凶得多
先泼一盆冷水:Agent 干的活和你手动跟模型聊天不是一个量级。一次 Harness 任务包含多轮规划、反复调用工具、读写文件、失败重试,token 消耗是成倍放大的。这就是为什么社区喊"token 自由"——按量计费很快肉疼,本地模型电费包干后等于白嫖。
但本地白嫖的代价是速度,而 Agent 场景会放大这个短板:
8GB 显存的笔记本跑 Qwen3.8-27B,每秒只有 0.26 token,功能全开也没法当生产力;租一张 4090 是 86.67 tok/s,差 300 倍。哔哩哔哩
M4 Max 128G 上的实测(nvfp4 量化 + MLX 后端 + MTP 投机解码):短上下文解码 63 tok/s,4K-16K 稳定在 42 左右,31K 断崖跌到 11.3 tok/s——而 Agent 的上下文,恰恰越用越长。哔哩哔哩
更有参考价值的案例来自一位 Mac mini M4 Pro 64G 用户:用 Ollama 调 qwen3.8:27b-mlx 分析论文,10 分钟分析不完半篇;换 MoE 结构的 qwen3.5:35b-a3b,全部分析完约 7 分钟。微博同一台机器、同一个 Ollama,换个模型,效率差好几倍。

所以第一个结论:本地 AI 编程,硬件门槛和模型选型比"装没装"重要得多。
不同硬件三条路,对号入座
结合近期各社区的实测信息,可以这样分:
1)无独显或内存 16GB 以下:别硬上大模型 Agent。27B 就算勉强装下,0.26 tok/s 也没法用。这一档适合跑 2B/4B/9B 级别的小模型,处理代码注释、简单重构这类轻任务;或者直接走云端额度。另外别迷信"全精度":有人把 Qwen3.8-27B 的 BF16、Q8、Q4、Q2 五个量化版本放同一场考试,Ollama 默认的 Q4_K_M(11GB 左右)质量并没有掉太多,反而是意外惊喜。哔哩哔哩
2)24-48GB 显存的台式机,或 64GB 以上统一内存的 Mac:本地 Agent 的甜区。优先 MoE 模型(35B-A3B 这类,激活参数只有 3B),速度明显快于同级稠密模型;跑 27B 就用量化版并开 MTP 加速。上下文设置保守一点,发现输出速度骤降,多半是上下文逼近临界点——重开会话,别硬撑。
3)混合党(大概率是多数人):日常小任务丢给本地模型,复杂长任务走云端。Responses API 这条路已经跑通,Harness 侧 API 地址加 v1、协议选 openai-responses 即可。小红书注意 Web Search 绑定 Ollama Cloud 权限,且需要支持工具调用的模型,本地模型开不了。

另外两个容易踩的雷
别把 11434 端口绑到 0.0.0.0 暴露公网。Ollama 默认无认证、无权限管控、无流量校验,设计上只适配本地私有场景,暴露出去等于把显卡对全网开放。知乎需要远程访问,走隧道或内网方案。
遇到 500 内部服务器错误或 CUDA 报错,先查显卡驱动版本和模型文件是否完整,重装模型再骂框架——社区里的翻车帖,大多栽在这两件事上。小红书
接下来值得盯的信号
`ollama launch` 的集成名单(目前是 dsh 和 muse)大概率会继续扩:Ollama 已经把"装 Agent"做成了平台能力,Codex Harness、OpenCode 这些工具的后续接入值得留意;Unsloth 桌面版本周也在向本地推理工具市场渗透。哔哩哔哩接下来的竞争会围绕"谁的模型管理和调优更顺手"展开。如果你已经装了 Ollama,本周试 `ollama launch dsh` 的成本几乎为零;还没装的,先对号入座确认自己的硬件档位,再决定要不要动——别为了"免费编程"先花一笔硬件钱,那是最贵的坑。