如果你部署过大模型,第一装的软件多半是Ollama——一行命令`ollama run`,模型自动下载,直接开聊。但最近这个"新手教程第一课",口碑裂成了两半。
一边,是B站今春那条《为什么你应该放弃Ollama》的视频,四千多赞、一千多条评论,评论区怨气相当足。另一边,Ollama官方8月动作不断:能接管Claude Code了、能联网搜索了、0.32.13版本支持MTP加速,有实测生成速度直接翻倍。
到底怎么回事?该不该卸载?今天把两边的论据都捋一遍,最后给四类人四个出路。
社区到底在骂什么?帮你筛过了
"放弃"视频那一千多条评论,筛掉情绪,主要集中在四点:
第一,独占格式锁模型,这条是真的。 Ollama把模型存成自家的blob格式,视频评论区一条高赞留言说得很直接:"装好后没怎么用,几个月前卸载了。它那个文件格式只能自己用,LM Studio和Jan都用不了,白瞎了GGUF的便携性。"你下载几十GB的模型,换个工具就得重新下一遍,这是老玩家流失的硬伤。哔哩哔哩
第二,"套壳"的指控,得两说。 不少人骂Ollama"明明就是llama.cpp套壳,还非要把模型转个格式,多占一份硬盘"。但评论区也有人拿源码说话:Ollama的README里本来就写明是把llama.cpp当库用,"套壳"本身不算欺骗。真正的槽点是格式转换白占硬盘空间——骂可以,得骂对地方。
第三,上下文和显存的差距,有实测。 一位用户部署gemma4时遇到报错,转投llama.cpp后感慨:"原来Ollama最高开60k上下文的模型能直接开满128k,整体显存占用还少很多。"这类体验差,是进阶玩家迁走的另一个主因。哔哩哔哩
第四,强制装C盘、推云服务这类抱怨也有,属于体验扣分项。
但公平地说,留守阵营的理由同样成立:一键部署的门槛至今最低,生态最大,教程最多。有条评论很实在:"一年前我用Ollama部署确实更快。"问题不是它不能用,是老玩家的需求升级了。

Ollama在8月干了什么?
这是很多喊"放弃"的人没注意到的部分。最近一个月,Ollama悄悄完成了三个动作,方向非常一致:从"纯本地跑模型"转向"本地+云的混合中枢"。
动作一:变成Agent启动器。 社区最近发现,`ollama launch claude`可以直接拉起Claude Code,原理是注入环境变量,把流量导到Ollama自己的接口。知乎官方则把ollama launch定位为一条新命令,能一站式配置并运行Claude Code、OpenCode、Codex等编程工具,本地模型或云模型都能接,不用配置环境变量。Ollama官方博客它还能用上Ollama云端的免费模型额度,每周重置;`ollama launch dsh`则能一分钟接上DeepSeek Harness。知乎它的定位,正在从"跑模型"变成"管AI入口"。

动作二:给本地模型装了搜索框。 官方上线了全新的web_search API,让本地模型能联网查资料,补上知识过时的短板。Ollama官方博客但注意边界:搜索请求走的是ollama.com的云端接口,不是本机Ollama服务自己完成的,还要注册账号领API Key。知乎推理是本地的,搜索词和网页抓取是过官方服务器的。如果你查的内容涉及内部项目或敏感信息,别因为模型在本地,就默认全过程都在本机。

动作三:MTP加速落地。 今天刚有实测出炉:Ollama 0.32.13支持Qwen3.8的MTP版后,Mac上生成速度从每秒3.12个token提到6.11个,接近翻倍。知乎而且MTP版和普通版共享权重,只需多下约1GB的草稿头,对存量用户很友好。
争吵的本质:你要的和它想要的,已经不是一回事
把两边的论据摆完会发现,大家吵的根本不是同一个问题:
放弃派要的是一个纯粹、透明、全本地的推理工具。所以格式锁定、云端搜索、客户端闭源,条条都踩在红线上;
Ollama官方在做的,是扩生态、降门槛、把云服务混进来,让工具"更好用"。
这不是谁对谁错,是路线分叉。如果你玩本地部署图的就是隐私和断网可用,那Ollama的新功能会越来越多地膈应你;如果只是想要个顺手的本地AI助手,云端功能开着也无所谓,那8月的Ollama其实比以前更强了。
该不该卸载?四种人,四个出路
第一类:刚入门、图省事——留着,别折腾。 一键部署的门槛优势还在,MTP加速是实打实的红利。记住两条:敏感内容别开联网搜索;别把服务暴露公网。Ollama默认无认证、无权限管控、无流量校验,只适配本地私有场景。知乎今年已经有多起算力被"白嫖"的预警,局域网共享记得做好限制。哔哩哔哩
第二类:隐私敏感、要纯离线——迁llama.cpp或LM Studio。 llama.cpp在GitHub上有预编译版,解压即用,没有格式锁定,上下文和显存表现实测更好;想要图形界面就选LM Studio,易用性是同类里做得最好的。迁移的主要成本是重新下模型,GGUF格式通用,这步省不掉。

第三类:要跑服务、有并发需求——看vLLM。 社区的对比结论很明确:服务器端场景vLLM速度优势明显,还原生支持高并发。知乎Ollama的定位是个人设备,别硬扛生产负载。
第四类:深度用户、不想动——继续用,但做三件事。 一是下模型时留一份原始GGUF文件,别把家当全锁进blob;二是服务绑定localhost,不要开0.0.0.0,确需对外就做防火墙规则;三是云端模型和联网搜索,在隐私场景一律关掉。
最后说两句
工具之争背后是个大趋势:2026年,本地部署已经不是"跑个模型玩玩"的小众爱好,它正在变成Agent、知识库、代码助手的底座。工具的路线必然分化,争吵只会更多——这很正常,别让评论区的情绪替你做决定。
如果还是纠结,判断标准其实就一句话:你玩本地部署,图的是"隐私"还是"省事"? 图前者,趁早迁纯本地方案;图后者,8月的Ollama,值得继续用下去。