当前位置:
AIGC文章详情

一条命令接入 DeepSeek Harness:Ollama 正在变成 AI 编程的免费后端,但这三道坎比安装难十倍

源自97位全网作者

08:45

如果你一直在关注"用 Ollama 跑本地大模型"这件事,本周的信号值得停下来看一眼:Ollama 不再只是"本地聊天框"了。v0.32.11 更新把 DeepSeek Harness 做成了官方集成——终端敲一句 `ollama launch dsh`,Ollama 会自动检测、安装 DeepSeek Harness 并连好模型。小红书几乎同一时间,OpenAI 把 Codex Harness 以 Apache-2.0 协议开源。微博同样能通过 Responses API 接 Ollama。B站上,"本地部署 DeepSeekHarness 加 Qwen3.8-27B,实现 token 自由"播放 4.1 万、收藏 1700+,"不用订会员!Ollama 接入 DeepSeekHarness"这类教程也在密集出现。哔哩哔哩

社区讨论的方向很明确:Ollama 正在变成 Coding Agent 的免费模型后端。但这句"AI 编程不充会员",没有教程里听起来那么香。把甜的部分和坑的部分拆开说清楚。

到底更新了什么:从"模型下载器"到"Agent 装机器"

先看 v0.32.11 的更新内容:

  • 新增 DeepSeek Harness 集成:支持 `ollama launch dsh` 一键启动,支持 deepseek-harness 别名,自动检测并安装 @deepseek-ai/dsh;

  • Harness 可配置本地模型与云端模型;DeepSeek Harness 自动启用 Web Search(需要 Ollama Cloud 访问权限,且模型要支持工具调用);

  • 新增 Muse Code 集成(`ollama launch muse`);

  • OpenAI 兼容 Responses API 支持 Web Search。小红书

这意味着 Ollama 的角色从"拉模型、聊聊天"变成了"AI 编程工具的一键安装入口"。知乎用户实测后总结:安装 Ollama、跑一句 `ollama launch dsh`,两步搞定,Harness 还没装的话 Ollama 会替你装好并连接模型;打开 Trajectory 选项卡,还能按时间线看 Agent 每一轮的上下文和工具调用。知乎上手门槛已经接近装一个手机 App。

一条命令接入 DeepSeek Harness:Ollama 正在变成 AI 编程的免费后端,但这三道坎比安装难十倍

这也解释了为什么本周教程集中爆发:一边是 DeepSeek 官方涨价,把一批编程用户推向替代方案;另一边 Ollama 把"零门槛接入"的路铺好了。小红书一边要省钱,一边给入口,热度自然起来了。

免费的真相:Agent 吃 token 比聊天凶得多

先泼一盆冷水:Agent 干的活和你手动跟模型聊天不是一个量级。一次 Harness 任务包含多轮规划、反复调用工具、读写文件、失败重试,token 消耗是成倍放大的。这就是为什么社区喊"token 自由"——按量计费很快肉疼,本地模型电费包干后等于白嫖。

但本地白嫖的代价是速度,而 Agent 场景会放大这个短板:

  • 8GB 显存的笔记本跑 Qwen3.8-27B,每秒只有 0.26 token,功能全开也没法当生产力;租一张 4090 是 86.67 tok/s,差 300 倍。哔哩哔哩

  • M4 Max 128G 上的实测(nvfp4 量化 + MLX 后端 + MTP 投机解码):短上下文解码 63 tok/s,4K-16K 稳定在 42 左右,31K 断崖跌到 11.3 tok/s——而 Agent 的上下文,恰恰越用越长。哔哩哔哩

  • 更有参考价值的案例来自一位 Mac mini M4 Pro 64G 用户:用 Ollama 调 qwen3.8:27b-mlx 分析论文,10 分钟分析不完半篇;换 MoE 结构的 qwen3.5:35b-a3b,全部分析完约 7 分钟。微博同一台机器、同一个 Ollama,换个模型,效率差好几倍。

一条命令接入 DeepSeek Harness:Ollama 正在变成 AI 编程的免费后端,但这三道坎比安装难十倍

所以第一个结论:本地 AI 编程,硬件门槛和模型选型比"装没装"重要得多。

不同硬件三条路,对号入座

结合近期各社区的实测信息,可以这样分:

1)无独显或内存 16GB 以下:别硬上大模型 Agent。27B 就算勉强装下,0.26 tok/s 也没法用。这一档适合跑 2B/4B/9B 级别的小模型,处理代码注释、简单重构这类轻任务;或者直接走云端额度。另外别迷信"全精度":有人把 Qwen3.8-27B 的 BF16、Q8、Q4、Q2 五个量化版本放同一场考试,Ollama 默认的 Q4_K_M(11GB 左右)质量并没有掉太多,反而是意外惊喜。哔哩哔哩

2)24-48GB 显存的台式机,或 64GB 以上统一内存的 Mac:本地 Agent 的甜区。优先 MoE 模型(35B-A3B 这类,激活参数只有 3B),速度明显快于同级稠密模型;跑 27B 就用量化版并开 MTP 加速。上下文设置保守一点,发现输出速度骤降,多半是上下文逼近临界点——重开会话,别硬撑。

3)混合党(大概率是多数人):日常小任务丢给本地模型,复杂长任务走云端。Responses API 这条路已经跑通,Harness 侧 API 地址加 v1、协议选 openai-responses 即可。小红书注意 Web Search 绑定 Ollama Cloud 权限,且需要支持工具调用的模型,本地模型开不了。

一条命令接入 DeepSeek Harness:Ollama 正在变成 AI 编程的免费后端,但这三道坎比安装难十倍

另外两个容易踩的雷

  • 别把 11434 端口绑到 0.0.0.0 暴露公网。Ollama 默认无认证、无权限管控、无流量校验,设计上只适配本地私有场景,暴露出去等于把显卡对全网开放。知乎需要远程访问,走隧道或内网方案。

  • 遇到 500 内部服务器错误或 CUDA 报错,先查显卡驱动版本和模型文件是否完整,重装模型再骂框架——社区里的翻车帖,大多栽在这两件事上。小红书

接下来值得盯的信号

`ollama launch` 的集成名单(目前是 dsh 和 muse)大概率会继续扩:Ollama 已经把"装 Agent"做成了平台能力,Codex Harness、OpenCode 这些工具的后续接入值得留意;Unsloth 桌面版本周也在向本地推理工具市场渗透。哔哩哔哩接下来的竞争会围绕"谁的模型管理和调优更顺手"展开。如果你已经装了 Ollama,本周试 `ollama launch dsh` 的成本几乎为零;还没装的,先对号入座确认自己的硬件档位,再决定要不要动——别为了"免费编程"先花一笔硬件钱,那是最贵的坑。

内容由AI生成

精选参考来源

1. ollama v0.32.11更新:DeepSeek Harness、Muse Code 接入,Responses API 支持 Web Search

2. OpenAICodexHarness正式开源(Apache-2.0协议)!提供CLI、SDK、AppServer三层接口,支持CI/CD集成与持久会话。核心用Rust重写,确保性能与安全。关键突破:上下文压缩、延迟工具调用、审批机制,让Agent在复杂任务中不迷路。更开放的是,它基于ResponsesAPI标准,可接入Ollama、Nvidia等多方模型

3. 本地部署DeepSeekHarness加Qwen3.8-27B教程,实现token自由!我还发现“梁圣”在源码中的彩蛋!

4. DeepSeek Harness + Ollama = 新世界

5. Ollama Pro 用量参考

6. [中配]实测Qwen3.827B在8GB笔记本上的真实表现:所有功能可用但速度慢,租用4090后快300倍

7. Qwen3.8-27BMAC-M4本地实测

8. MacminiM4pro64G用ollama调用qwen3.8:27b-mlx还是太慢了,放在zoteroAIButler上10分钟都分析不完一篇论文的一半,qwen3.5:35b-a3b全部分析完都只需要7分钟左右。

9. [中配]我把Qwen3.8-27B从55GB压缩到11GB,并让所有版本参加同一场考试。29GB版本输给了17GB版本,最大惊喜来自Ollama默认

10. DeepSeek harness接入ollama pro

11. Ollama公网暴露实战检测:攻击面拆解、漏洞复现与全套加固方案

12. Ollama大坑❗CUDA报错直接崩溃😭本地部署踩坑实录

13. [中配]Unsloth桌面应用初体验:一站式替代LMStudio、Ollama与OpenWebUI

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章