「养虾破产」了才想起来切本地模型?我把20份虾民实测记录压成一张表:这三档显存才算数,其余先别动
“真是服了,昨晚为了跑任务,硬生生给我干了几千万token。你说养个小龙虾还能破产,这合理吗?”
这是今年4月一位教程作者寒山在文章开头的吐槽。今日头条如果你这半年玩过OpenClaw(社区叫它"龙虾"),大概率对这句话有体感:这东西干活是真干,烧token也是真烧。有程序员让它跑一天爬虫测试烧掉5000万token,有重度用户一天烧10亿、折合几千块人民币,猎豹CEO傅盛公开说自己每天在AI上的花费超过100美元。今日头条一位独立开发者晒出第一个月账单:光API就400多美元。知乎
于是"接个本地模型,账单归零"成了虾圈最近半年最热门的折腾方向。Ollama v0.15.4之后原生集成了OpenClaw,一条`ollama launch openclaw`就能拉起。今日头条 OpenClaw 3.12干脆把Ollama/vLLM做成了插件。今日头条门槛确实塌了。但我把全网微信、知乎、头条、小红书、抖音上20多份真实部署记录摆在一起看完,发现一个尴尬的事实:账单归零是真的,"本地模型跑龙虾"能跑成什么样,完全取决于你的显存落在哪一档——而且大部分劝退帖,坑根本不在模型。
这篇不教你装Ollama(那玩意儿三分钟的事),只回答三个问题:龙虾的钱到底花在哪、你的机器能不能喂饱它、以及切本地这笔账划不划算。
先想明白:龙虾不是聊天框,它每轮都在"重发整个工位"
很多人拿"我用免费云端AI聊天没花过钱"的直觉来判断龙虾的消耗,这是错觉的来源。知乎一位AI茶水间方向的作者把OpenClaw的单次请求拆成六个模块,数字很直观:
系统提示词:每次请求1250~6250 token,因为它要从AGENTS.md、SOUL.md等文件现场拼装,默认每个文件最多加载20000字符。知乎
工具定义:3000~5000 token,刚性开销。光一个browser(浏览器)工具的Schema就约800 token;
会话历史:越聊越贵。有实测统计,5轮对话的累计token消耗是单轮的13倍;
Memory Flush:压缩会话前还要先单独调一次大模型"整理记忆",等于再花一遍全量固定开销;
记忆检索结果、工具调用链:文件读进来、网页抓进来、shell输出,全部原样塞回上下文。
最扎心的例子来自一位知乎用户:让龙虾识别总结一张手机截图,一次任务烧掉40万token,“吓得我直接把百炼API关了”。知乎还有个配错心跳的独立开发者——拿Claude Opus跑每15分钟一次的定时检查,一天96次心跳、每次带1.5万token上下文,光打招呼一天就十几美元。知乎

所以"本地4B小模型免费陪聊"的经验,放到龙虾身上不成立:它不是问一句答一句,是每干一步活就把整个工作环境重新加载一遍。对模型的要求从"会聊天"变成了"扛得住大吞吐+会用工具"。这也解释了为什么虾圈集中抱怨"龙虾失忆"——上下文窗口里装的根本不是你的话,是它的工具列表和工作区文件。
20份部署记录拼出来的显存档位表:哪一档才算数
把各家实测按显存归档,边界比想象中清晰:
显存档 | 被验证能喂龙虾的配置 | 实测表现 | 适合谁 |
|---|---|---|---|
8G(4060级) | Qwen3.5:4B(占用5.2G);Nemotron-3-Nano-4B Q5_K_M(3.8G,原生128k上下文);Ollama默认推荐的glm-4.7-flash(19G)装不下 | 4B约45-50 token/s,日常对话、文件整理够用 | 老游戏卡用户:跑轻任务可以,复杂Agent流程别指望 |
12~16G | Qwen3.5:9B/14B;量化Qwen3.5-27B;Qwen3-Coder-30B-MoE(CPU卸载后可驱动框架) | 14B是"能干活"和"能玩"的分界线 | 5060Ti 16G这类新中端卡的甜点位 |
24G(4090级) | vLLM跑Qwen2.5-14B-AWQ(占用10-12G);27B~35B随便挑 | 实测90-130 token/s、首token延迟0.4-0.8秒,“完全够用” | 唯一能让本地龙虾接近云端体验的消费级档位 |
统一内存(DGX Spark/Mac) | DGX Spark 121.6G统一内存跑Ling-3.0-flash INT4(72G);Mac Studio跑27B聊天秒回 | 容量管够,带宽决定速度;64G Mac mini跑32B被实测吐槽"也很慢" | 买它不是为了省钱,是为了安静地24小时挂机 |
纯CPU老机 | 0.5B-1.8B量化模型 | 2-3字/秒,Agent流程必超时 | 只适合验证流程,别产生"能替代API"的幻觉 |

两个容易被忽略的细节:一是上下文不能设太小——OpenClaw有16k上下文的最小硬门槛,低于它会直接工具调用失败。知乎8G卡跑4B模型时"显存里给KV cache留多少"决定了你是流畅还是频繁爆显存。二是同一台机器可以按任务路由——有虾民的完整自动化系统里,盘中监控、图表生成走本地Qwen2.5-7B,盘后研报走35B,只有核心决策和写公众号走云端GLM,一天约1-3元、一个月50-90元把11个定时任务全跑下来,纯本地模式甚至直接0元。微信公众号
接上跑不通的,八成栽在这三个坑,都不是"模型不行"
我把各家踩坑帖去重之后,反复出现的其实就三条:
坑一:baseUrl手滑带了`/v1`。微信上两篇独立踩坑记录都指向这里:OpenClaw走Ollama时必须填`http://127.0.0.1:11434`,填OpenAI兼容的`/v1`地址会让工具调用直接坏掉——模型把原始JSON当纯文本吐出来,看起来就是"人工智障"。微信公众号走Ollama原生`/api/chat`接口才能流式输出和工具调用同时工作。
坑二:Agent流程没关,然后怪模型。头条一位只有一台12核CPU老机的玩家,在Ollama和LM Studio之间来回换了7B、4B、1.5B、0.5B一路降档,全部超时。真正的元凶是:本地小模型+CPU扛不住完整的Agent重推理流程,再加上上下文拉到32K、maxTokens设4096、没开内存锁——换什么模型都得跪。他最后的总结值得所有折腾党抄:"出问题就换模型,不找真正原因"是最贵的路径。今日头条
坑三:两端参数不一致+超时给短了。OpenClaw侧和Ollama/LM Studio侧的contextWindow要手动对齐(一边16384一边8192必报错);本地模型首次加载30-60秒,默认5分钟超时不够用,要把`timeoutMs`拉到900000;局域网互通记得放行11434端口。至于"token用率94%突然中断对话",是会话历史堆到模型窗口上限了——定期清理session文件,比换大模型便宜。微信公众号

那笔账到底怎么算:三条路线,对号入座
现在可以回答最初的问题了。我把虾民圈子的路线归成三条,各自有明确的适用人群:
路线A:继续云端,先把配置省到位。被验证降幅最大的一套操作:精简AGENTS.md(200行砍到60行)、MEMORY.md瘦身(光这一步省30-40%)、禁用browser/cron/canvas/nodes四个多数人用不上的工具(单次请求省1500-2000 token)、压缩阈值从88%调到70%、简单任务走便宜模型叠prompt缓存。那位月烧400美元的独立开发者靠这套组合拳加模型分层,成本压到20美元以内。知乎更省事的办法是订阅制:MiniMax 29元包月(5小时50次prompt)、GLM的Coding Plan这类"按次不按token"的套餐,直接消灭token焦虑——小红书一位开发者一周近半亿token靠1200次/5小时的套餐扛住了。小红书对大多数月账单在200元以内的虾民,这条路线的性价比其实打爆了本地部署。
路线B:全本地。边际成本归零,8小时/天的机器电费一个月60-90元。但回本账要算清楚:如果为了跑龙虾专门配一台5060Ti 16G整机(3月行情约9700元),而你原本月API账单只有100-200元,回本周期奔着四年去——四年后的你大概率在用更好的模型,而不是更便宜的电费。今日头条本地全跑真正划算的前提有二选一:你已经有12G以上显存的机器,或者你的任务里"数据不出本机/24小时挂机"本身就是需求(合同、客户资料、内部文档、量化监控)。医疗、法务、内网办公这类场景,隐私价值比省下的token费更先成立。
路线C:混合路由(老虾民的终局形态)。`primary`设本地模型、`fallbacks`挂云端模型,本地挂了自动切云端;简单整理走本地7B/14B,复杂规划和多代理协作走云端。前面那套月均50-90元的A股+自媒体自动化系统就是这条路线的完整样本。Ollama和LM Studio现在都支持向导式配置,这条路的操作成本已经很低了。
反过来,有两个人群我建议先别动:没有独立显卡、正冲动下单"省钱神机"的——CPU跑龙虾的体验,各帖差评高度一致;内容创作、复杂编码重度用户——一位把8B/14B本地模型接进OpenClaw做skill开发的玩家,任务做不出来,最后还是切回云端模型,本地留着只跑"听得懂话就行"的杂活。证据只能说到这:弱模型跑不了重Agent流程,是当前所有实测的共识,而27B以上档位能不能完全替代云端中端模型,各家说法还在打架。

接下来盯什么
这个方向的边界每个月都在挪,三个信号值得放进观察列表:MiniMax H3、Qwen新模型的低显存量化版本什么时候铺到8-12G档(决定8G卡用户的天花板);国内API涨价的尾巴——DeepSeek输出价从2元回到8元后还计划上调50%,多家厂商跟进,"云端永远便宜"的前提并不牢。今日头条以及Ollama/LM Studio与OpenClaw的集成版本更新——插件化之后,配置坑的清单本身也在变短。
养虾这件事,2026年的真相是:龙虾不是聊天工具,是雇了个按token计薪的全职员工。本地模型能不能替你发这份工资,取决于你的显存配不配得上它的工位数。先看清账单花在哪,再决定是动硬件还是动配置——顺序反了,省下的会员费,还不够交学费。