先说个真事。知乎上一个关于「Claude Code 增长熄火,老用户开始转投 Codex」的问题下,有位用户的吐槽戳中了很多人的痛点:一个任务卡了半个小时,一下子花掉 500 块,立马卸载,同样的任务换个便宜的模型跑半个小时只要十几块钱。知乎token 成本这个原本藏在「效率工具」叙事下面的痛点,这个 8 月被集中摆上了台面。
也就是从 7 月开始,全网冒出一波「把 Claude Code / Codex 接到本地大模型,零 token」的教程。B 站那条《保姆级教程:3步搞定 Claude Code、Codex 接入 LM Studio 本地模型》,一条视频被 290 多人收藏。哔哩哔哩
连 LM Studio 自己都下场了:7 月底发布独立应用 Bionic,内置 Work Mode 和 Code Mode,支持 MCP 集成,官方定位直接对着「替代 Claude Code」去。哔哩哔哩
对我们这种早就在 LM Studio 里折腾本地模型的人来说,这波热度等于把手里的玩具突然变成了省钱刚需。但先别急着配环境,我把四个平台的讨论和一份 400 多位开发者的实测反馈翻完了,结论值得你先花三分钟看完。
不是「平替」,是另一种工作方式
Hacker News 上有个帖子,问的就是「有没有人真把 Claude / GPT 换成本地模型,用作日常编程的主力工具,而不仅仅是玩玩」,聚集了将近 1000 个赞和 444 条评论。知乎有人把几百条高赞评论翻了一遍,结论是:能,但条件相当苛刻,而且体验的差别不是「差一点」,是工作方式的根本不同。
里面获得最多共鸣的一段类比是这样的:本地跑 Qwen3.6 35B 干 agentic 编程,对比 Claude Opus,就像一个有全领域知识的初级工程师,你需要随时指导,而 Opus 是跟你一起思考架构的高级搭档;Opus 能给 15 倍效率提升的话,本地完全离线的 Qwen 大概给 5 倍,但考虑到它完全免费,这本身已经很惊人。知乎5 倍对 15 倍,这是社区大规模实测后沉淀下来的共识区间,不是哪一家黑或哪一家吹。
还有个更直观的实测:有人打开 llama-server 自带的对话页,测了一个 1.7B 的小模型,「你好」只能换回一句模板式的问候。

模型越小,能力边界越明显。前面说的「5 倍」,是内存足够、模型尺寸够用的前提下才成立的故事。
硬件门槛排第一
这份开发者反馈里扎心的共同点是:真正把本地模型当日常编程主力的人,几乎都有至少 64GB 统一内存的机器。知乎Mac Studio 128GB、AMD Strix Halo 128GB、双路 Xeon 配 256GB 内存的老服务器,都在列。他们的主力模型也高度趋同:Qwen3.6 35B-A3B 这类 MoE 结构,总参数 35B 但每次推理只激活 3B,在 llama.cpp 上能跑 55–72 token/s。
有个 M5 Max 128G 的实测案例:Qwen3.6-35B-A3B 8bit 跑起来 87.8 tok/s,关掉 Wi-Fi 照常写代码。知乎
但作者自己点破了关键——真正让 agent 跟手的不是这个峰值速度,是 78% 的缓存命中率。知乎Claude Code 这类编程工具干活,是一轮一轮反复把同样的项目文件塞进上下文,缓存命中不了,本地模型直接卡成 PPT。以 oMLX 为例,它的缓存设置面板把缓存分成内存热缓存和 SSD 冷缓存两级,比例按自己机器的配置来定。

所以同一个模型,推理后端有没有多级缓存,体验差出几倍。
社区自己的总结很直白:本地 AI 编程的门槛,目前首先是硬件成本,其次才是模型能力。知乎
小机器也不是完全没戏
轻量方案的社区口径是:一般家用机器跑 7B 到 14B 的模型,日常写代码、改 bug、问问题够用;特别复杂的任务还是云端大模型更强。知乎就在上周,第三方 Empero AI 发布了基于 Qwen3.8 Max 蒸馏的 Qwen3.8-9B,单 GPU 就能部署,有博主第一时间放进 LM Studio 实测量化版,评价是「小巧却强大」。哔哩哔哩小机器值得蹲这类蒸馏模型的后续。
任务边界很清楚
那位 M5 Max 作者跑了几天真实开发任务后的结论是:日常开发七八成的活,本地模型已经够用了。知乎但复杂架构设计、超大项目深度重构,和顶级云端模型还有肉眼可见的差距,该切回云端就切回云端。
于是社区沉淀出两种典型用法:一类是「隐私优先型」——代码和数据根本不能出本机,宁可要一个稍弱但完全受控的工具,图的是安心;另一类是「策略型」——商业模型负责规划、架构这些高价值环节,本地模型负责大量重复的具体实现,token 花在刀刃上。知乎
还有一笔反直觉的账:有人拿 4000 多美元的 Mac Studio 128GB 对比 API 租用,同等算力用 Gemini 3 Flash 的价格,能用 8 年才花到同样的钱。知乎所以对轻度用户,「买硬件跑本地模型」根本不省钱,它真正划算的场景只有三个:重度 token 消耗、数据必须留在本地、离线或弱网环境。另外提醒一句,今年内存涨价正在推高整机价格,连苹果都因此全线调价。知乎想为这事专门买机器的,先算回本周期。
怎么接:三条路线,图省事就 LM Studio
路线一,LM Studio + CC Switch,新手首选。LM Studio 负责跑模型——记住一条:Windows 选 GGUF 格式,苹果芯片 Mac 选 MLX 格式。哔哩哔哩开源工具 CC Switch 负责把 Claude Code 的供应商配置一键切到本地服务,教程里连 Codex 的接入也演示了(注意 Codex 的接口要带 /v1 后缀),还能把本地模型通过局域网共享给全家设备。哔哩哔哩这条路的好处是 LM Studio 图形化、上手零门槛,同一个模型聊天、API 两用。
这是 CC Switch 的主界面:各家供应商以卡片形式排列,正在生效的标着「Currently Using」,余额用了多少、还剩多少一目了然,切到本地服务就是一下的事。

路线二,Ollama 直连,适合想更省事的人。从 v0.14.0 开始,Ollama 原生支持 Anthropic 的 Messages API,Claude Code 配几个环境变量就能用,不用中间层。知乎建议选上下文不少于 32K 的模型。
路线三,oMLX / llama.cpp 裸跑,给爱折腾的人。前面 87.8 tok/s、78% 缓存命中,就是 oMLX(基于苹果 MLX 框架,带内存+SSD 两级 KV 缓存)跑出来的。知乎上限最高,配置也最折腾。它自带的模型下载器很好用:直接搜 HuggingFace,模型卡片上标着文件体积和参数量,内存吃紧的型号还会给出 OOM 风险提示,一键下载。

顺带一提:如果你不一定执着于 Claude Code 这个壳,Bionic 值得放进观察清单——Work Mode 处理文档、Code Mode 写代码带实时预览,还带 MCP 集成和本地搜索,走的是「本地 AI 一站式工作台」路线。
决策清单:谁该接,谁别接
适合接的四类人:每天重度用编程 agent、token 账单常年高压的;公司代码或敏感数据不能出本地的;经常离线、弱网干活的;手里已经有 64GB 统一内存或大显存机器的——对你来说接入就是纯赚。
不适合接的三类人:一周用不了几次的轻度用户,API 租用比买硬件便宜得多;主要做复杂架构设计、整项目重构的,本地模型上限不够;纯粹为了省钱想从零买机器的,先算账再下单。
最稳的姿势是社区公认的「两条线」:装个 CC Switch 这类多供应商切换工具,日常量大的活走本地,硬活一键切回云端。不是告别 API,是给自己加一个不要钱的助手。
接下来值得盯的三个信号
一是 MoE 和蒸馏模型的下放速度。Qwen3.8-9B 这种「单卡能跑、功能保留」的蒸馏模型越多,中端机器够得着的门槛就越低。
二是 Bionic 的 Code Mode 迭代速度,看它能不能真接住「替代 Claude Code」这个定位。
三是云端定价。个人订阅现在是补贴价,社区普遍估计 Claude Code 的真实推理成本是定价的 3–5 倍,一旦涨价,本地方案的账会整个反过来。知乎
一句话总结:接本地模型这件事值得做,但它不是「告别 API」,而是「多雇一个不要钱的助手」——值不值得,取决于你的机器和任务里,有多少活是它真能干的。