最近刷 B 站和知乎,总能撞见这类标题:「在 VS Code 里本地跑 AI 编程,免费、无云端」「0 token 白嫖,告别高昂订阅费」,配一段 Ollama 一键安装教程,看着特别香。尤其 Copilot 这波订阅调整之后,不少人账单实打实涨了,想找个不花钱的替代再正常不过。
但先别急着下载 Ollama。这事社区已经用真机器试得差不多了。6 月中旬 Hacker News 上有个帖子直接发问:有没有人真把 Claude 或 GPT 换成本地模型做日常编程主力,而不只是玩玩?底下聚了将近一千个赞、444 条评论。知乎把高赞翻完,结论其实很一致:能,但条件相当苛刻——而且卡住大多数人的,根本不是模型聪不聪明。
真正在用的人,机器都不普通
这是整场讨论里最扎心的一条:能真正把本地模型当日常主力的人,几乎人手至少 64GB 统一内存,Mac Studio 128G、AMD Strix Halo 128G、双路 Xeon 配 256G 内存都不稀奇。知乎这不是「显卡好一点」,是专门为跑模型置办的生产资料。
为什么这么吃内存?本地跑模型躲不开两件事:量化和 KV 缓存。模型要塞进内存通常得压到 Q4,这基本是代码质量的底线,再往下压到 Q2、Q3,模型连基本语法都记不住,开始瞎编变量名。而 agent 类编程工具干活,是一轮一轮把整个项目和对话历史反复塞进上下文,这部分 KV 缓存极吃内存。一旦内存不够开始向硬盘借(swap),生成速度会从丝滑的 30 token/秒直接摔到 1 token/秒的「PPT 级卡顿」。知乎所以社区里有句话被反复认同:本地 AI 编程的门槛,首先是硬件成本,其次才是模型能力。知乎

跑通了,到底什么体验
有位博主拿 16 寸 M5 Max、128G 统一内存的 MacBook Pro 做了实测:oMLX 起本地服务 + Qwen3.6-35B-A3B + cc Switch 切换,直接关掉 Wi-Fi,Claude Code 连着本机模型照常写代码,速度 87.8 token/秒,差不多是看代码速度的四五倍。知乎

真正让它跟手的是那 78% 的缓存命中率——那个 session 一共 32.5 万 prefill token,25.4 万直接命中缓存,近八成计算被省掉了。知乎他拿它干的也都是真活,结论是:日常开发七八成的活本地模型已经够用,敏感代码不出本机,这条对很多人比省钱还重要。 但复杂架构设计、超大项目的深度重构,跟顶级云端模型仍有肉眼可见的差距,该切云端还是得切。HN 上有个评价特别到位:完全离线的本地模型大约给你 5 倍效率,Claude Opus 能给 15 倍。知乎差的那一截,就是你为离线、隐私和零边际成本让渡的部分。
对号入座:先看手里这台机器
结合社区实测和硬件分档,大致能这么对:
128G 统一内存的 Mac 或大显存工作站:可以认真上本地 agentic。oMLX 或 LM Studio 起服务,配 Qwen3.6 这类 MoE 编程模型;编辑器端用 Continue、Kilo Code 这类 VS Code 插件,或者干脆让 Claude Code 指向本地模型。Kilo Code 本身就是 Cline 系里目前很活跃的一个开源 fork。知乎
一张 16–24G 显存的普通台式机:跑不动 35B 全家桶,但 Qwen3.6 的中档在 Q4 下十几 G 显存就能跑,一张 24G 卡被不少人称为「黄金平衡点」;只想要打字时的行内补全,Codestral 这类小而快的模型 16G 显存就能常驻。
只有 16G 轻薄本、没独显:本地 agentic 这条路基本能关了,更现实的是走带免费额度的云端插件配置,或者按需付费——把折腾环境的时间拿去写代码更划算。

什么时候,该老实付费
本地方案买的从来不是「更强」,而是「隐私 + 成本可控 + 离线」。如果代码能上云、追求的是极致产出和复杂重构,那订阅云端模型其实更省心,毕竟个人版订阅大多是补贴价,性价比本来就高。知乎反过来,代码不能出本机(合规、保密),或者每天都要跑大量 agent 循环、token 账单会失控,本地这套一次性固定成本才真正划算。
说到底,这波「本地跑 AI 编程」既不是智商税,也不是免费午餐,它是一道硬件门槛题。模型还在飞速迭代,Qwen、Gemma 几个月就一版,今天跑不动的活,半年后未必。要不要现在折腾,先看你的内存到没到那条线。你手上是什么配置、跑的什么模型?评论区报一下,给观望的朋友一个真实参考。