OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

源自475位全网作者

09-01 06:19

OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

今天(8 月 31 日)OpenClaw 2.0 发布,知乎上有人问"有哪些信息值得关注"。量子位两天前发的那篇复盘,标题更直白——《OpenClaw:红过,爱过,散了》:三个月冲到 33 万+ Star、华强北 Mac mini 一度缺货加价、499 上门装虾的生意卷到飞起,再到大家集体转头去研究 Claude Code、Codex 和 Harness——龙虾只用了半年就走完了一个网红的一生。知乎

但有意思的是:真正留下来养虾的人,这个八月还在把它更新回去。有人把 OpenClaw 架在跨公网的多台机器上做定时巡查,日常用得最多的,就是让它每天九点在 QQ 群里通报一遍巡查内容。知乎他这边也刚把 2.0 更上去,评价是"这回 2.0 还真是不太一样了"。而留在虾圈里讨论最凶的问题也变了——不再是怎么装,而是API 账单太疼,能不能给龙虾接个本地模型

这篇就写给这类人:虾还在养、账单在涨、正在认真考虑换本地模型的你。答案不是一句"值不值",因为跑聊天顺不顺,和跑 Agent 行不行,根本就是两套考核

一、评论区的悖论:同一台机器,聊天秒回,进虾身三分钟起步

B 站有一条 3.9 万播放的实测分析(《【问题分析】本地模型很快,但openclaw使用本地模型却很慢的原因分析》,赞 355、藏 961),UP 主原话很直白:“很多小伙伴在使用Openclaw的时候会感觉到反应很慢,但是单独使用本地模型的时候速度很快,这是因为在Openclaw有一个处理提示词的过程(processing prompt),有很多的token要处理。哔哩哔哩

评论区比视频更像大型对账现场:

  • “我本地跑3.5 9b基本上几秒钟就反应了,进入龙虾,3分钟起步。”

  • “我用qwen3.5-9b测试本地部署,不止慢,而且经常遇到错误。”(29 赞)

  • “我抓包看过,提示词组合起来单次调用有五万多字。哔哩哔哩

  • “重启openclaw、重启模型后的首次对话,是会一口气把记忆塞一塞进去的,所以首次回复是非常慢的,也必须消耗大量token。因为模型只是模型本身,所有的记忆都是外部的。”——模型自己不带记忆,记忆全在外部文件里,每轮都要重新加载。

也就是说:聊天窗口里,你发几十个字,模型答一千字;而龙虾每调用一次模型,都要背着一坨系统提示词 + 工具清单 + 记忆文件从头读一遍。生成一个字没变快或变慢,变的是"读题"的量级。

OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

二、认知增量:你盯着的 tokens/s 是生成速度,卡住你的是 prefill

参数表里的 tokens/s 基本都是 decode(吐字)速度。Agent 场景真正吃性能的是 prefill(读入长提示词)这一步——本地推理引擎在这一步普遍不强。哔哩哔哩那条"3 分钟起步"的评论里,大部分时间里龙虾的模型根本没在"思考怎么回答",而是在读题。

这也解释了为什么小红书上"龙虾账单"帖一个比一个夸张:「32 天 20 亿 token」「一个月烧了 6 亿 token」「养虾一天烧掉 1000 刀」。小红书小红书这些自报数字环境各异没法横比,但结构是共同的:Agent 的 token 大头在输入端反复读题,不在输出端。你想用"本地模型免费"来对冲账单,对冲的其实是这部分重复开销——能不能对冲,取决于你的加载器有没有前缀缓存,见下一节。

OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

三、锅不全在模型:Ollama、LM Studio 是"聊天时代"的加载器

评论区有人点破了关键:"这是LM studio、ollama等等这些加载和模型管理工具的问题,它们是老一代的加载器,不是为agent时代设计的。哔哩哔哩"Agent 每轮请求的前缀(系统提示词+工具表)几乎不变,能不能命中 KV 缓存,就是本地跑龙虾卡不卡的分水岭。

社区反馈和这个判断互相印证:

  • “目前ollama omlx lm全跪,vllm也没优势,只能期待graph memory这类插件能优化一下使用emb代替llm处理了。”

  • 有人已经在用 GitHub 上的冷门缓存项目截住重复提示词来减负。

  • 8 月 31 日刚发的一条 B 站实测:RTX5090 上,开源推理引擎 FreeToken 在 MoE 模型显存溢出时比 Ollama 快 3 倍。哔哩哔哩

结论:"本地跑龙虾慢"至少一半是工程问题,不是硬件死刑。一位 3060Ti 8G + 32G 内存配置的虾友,把 qwen3.6-35B-A3B 在 70K 上下文下跑到输入约 900 token/s、输出 30 token/s。哔哩哔哩他还特意把架构拆开了:龙虾不部署在这台机器上,放另外的笔记本跑,这台机器专职提供 token。折腾与不折腾,体验差出一个世代。

OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

四、第二道坎:工具调用是另一个物种,参数量说了不算

就算 prefill 解决了,本地模型还得过"干活"这一关。有位 2080Ti 22G + 32G 内存的虾友晒出的实战账本非常具体(97 赞):

  • Gemma 26B:能塞 120K 上下文,但"这个模型的工具调用能力一坨,而且莫名其妙,即使是让他直接调用skill都会失败,还莫名巧妙自己加戏,导致部署后,连个日报都弄不了";另一条评论补刀"gemma4早实锤了扔任何一个智能体跑都有大问题。哔哩哔哩"

  • Qwen3.5-27B:稠密模型,“工具调用比我的minimax还干净利索”,让它控本地 ComfyUI、搜索文档、部署 skill、改配置、测试一气呵成——但上下文只能给到 64K,一碰大网页就爆显存。

  • MoE 模型:“moe架构在长上下文中工具调用及其不稳定,qwen3.6特殊微调了”——不然 3.5 的 35B 就是"屎一坨",3.6 就好用了。

注意分寸:这些都是社区自报样本,版本、量化格式、推理引擎各不相同,只能说明"能跑聊天"的模型名单,接到 Agent 上会大幅缩水,具体到某个模型行不行,得看有没有人晒出同环境实测。这也是《本地部署大模型养龙虾是个坑》那条视频评论数(341)比点赞数(181)还多的原因——吵的就是这个。哔哩哔哩

五、名单时间:谁现在就换,谁再等等,谁别拿省钱当理由

先摆反方证据,别急着下单:评论区照样有人反驳"现在免费token渠道那么多,压根用不完,真没必要本地部署。哔哩哔哩"省钱这张牌,在 2026 年 8 月的行情下没那么硬。

建议现在折腾的三类人:

  1. 手里有闲置 16G+ 显存机器或 64G 统一内存 Mac 的虾友,且愿意碰 vLLM/llama.cpp/前缀缓存——按社区实测,32G 显存用 vLLM 跑 Qwen3.5-27B,“安装skill,部署Python库,整理文件,识别总结文档之类的小任务都很顺滑”,那位实测者的原话是"干零活儿我非常满意。哔哩哔哩"

  2. 准备搭"token 工厂"分离架构的垃圾佬:龙虾在你主力机上跑,旧机器专职出 token。多卡党已经在这么玩了——8 月 31 日刚有人发了《四卡5060ti部署qwen3.8-27b的心路历程》。哔哩哔哩

  3. 隐私刚需用户:病历、合同、公司文档不能上云的,本地部署买的是确定性,不是便宜。这部分人不需要看速度测评,只需要看工具调用测评。

建议再等等的三类人:

  1. 8–12G 显存、指望龙虾跑长上下文调研/多 Agent 任务的:社区里的翻车案例大多撞在同一堵墙上——题读得完,显存放不下。

  2. 只打算 Ollama 一键装、不碰任何配置的小白:先用免费额度把虾养起来,数清楚一个任务到底烧多少输入 token,再决定值不值得折腾缓存。

  3. 工作流重度依赖浏览器、Office、图文工具链的:本地模型工具调用成功率是这个场景的生死线,而它目前主要靠社区口碑,没有稳定官方评测。

OpenClaw 2.0今晚发布,养虾早过了追热点的年纪:本地模型聊天秒回、跑Agent却三分钟,谁该换、谁别换

接下来盯三个信号:Ollama/LM Studio 会不会正式加 Agent 向的前缀缓存;刚开源的 Qwen3.8-27B、GLM-5.3-Flash 这批新模型有没有人晒同环境 toolcall 实测("27b跑toolcall15是满分通过的"这类成绩单,评论区已经有人在传);API 这一轮涨价之后云端还便不便宜。这三个里任何一个变绿,本地虾的性价比判断就要重算一次。

你的配置是什么、龙虾接的哪个模型、一次任务烧多少 token?评论区报个数,正好把这份名单的证据池再滚大一点。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章