虾农们,这几天估计不太好过。
8月13日,DeepSeek 正式推出 V4-Pro 正式版(版本号 0813),新价格 8 月 17 日零点正式生效。今日头条 虾料里调得最狠的是 V4-Pro:高峰缓存命中输入从每百万 token 0.025 元涨到 0.30 元,整整 12 倍;缓存未命中输入 9 元、高峰输出 27 元每百万 token,低谷统一打对折。值得买社区 峰谷定价本身其实不是新东西——正式版官宣时就同步引入了峰谷定价机制,这次是在原价格表基础上的结构性上调。微信公众号

巧的是,8 月 14 日晚阿里正式开源了 Qwen3.8-27B,270 亿参数原生多模态稠密模型,Apache 2.0 协议,开放免费商用。今日头条 两件事一撞,养虾圈炸出一个问题:把虾料换成本地的 Qwen3.8-27B,行不行? 今天把这笔账算清楚。但算账之前,先说清楚一个底层问题——
为什么这轮涨价,最疼的是虾农
不是涨价多狠,而是 Agent 的 token 消耗结构,跟聊天根本不是一个物种。
普通聊天一轮问答不过万把 token,推理模型深度思考大概十万级,而 Agent 跑一个任务经常破百万,而且输入输出之比高达 15:1——你花的钱,大头不是龙虾的“回答”,是背景资料、工具调用和不断膨胀的上下文。今日头条 再看 3 月流传的那份养虾成本档位,就知道为什么账单会炸:轻度 70–210 元/月,中度 210–500 元/月,重度 24 小时挂机 500–1500 元/月——那还是旧价格、便宜虾料的账。抖音 Gartner 2026 年 3 月的分析确认,智能体每任务所需的 token 数量,比标准聊天机器人多 5-30 倍。今日头条 这也是本地方案吸引人的地方:本地推理服务的面板上,prefill、缓存命中的 token 一笔笔看得见,不是等到月底才揭晓的账单。

真正吞钱的,是那些“感觉没多少钱”的小动作:一次 heartbeat、一次工具输出、一段不断膨胀的上下文、一个高频定时任务,像漏水的阀门,平时听不见声音,月底才发现整桶预算见了底。微信公众号 养虾圈早就把这笔账总结成“不可能三角”:省钱、好用、安全,真心只能满足两个。微信公众号 换本地虾料,看起来是打破三角的解法,但真的是吗?
Qwen3.8-27B 能不能当虾料,先过能力关
先说能力,这次是真的冲着 Agent 来的:SWE-bench Pro 61.7,DeepSWE 42.2,CoWorkBench 70.7,多项成绩超越参数规模更大的 Qwen3.7-Plus,部分指标甚至超过 Claude Opus 4.6 Max。今日头条 官方测评口径:在 agent 方面超过了 qwen3.7-plus 和 opus4.6,编码方面与 opus4.6 打的有来有回。微信公众号

规格也是冲着本地来的:原生多模态,原生 262K 上下文,还可以通过 YaRN 扩展至 1M。今日头条 社区也用脚投了票:开源两天时间下载量破 100 万,社区自发贡献了约 500 个量化版本。值得买社区 但这里有个坑:能力过关 ≠ 你的硬件跑得动。
官方门槛写得很诱人:“单卡 16GB 显存即可部署”。但那只是最低加载门槛——模型跑起来之后,显存要装三样东西:权重本身、随对话长度增长的 KV cache,还有计算缓冲;有并发实测给出的活跃占用是 Q4 量化约 28G、Q3 约 24G、Q2_K 约 13G,24G 卡跑 Q4 也只是将将好。值得买社区

16G 显卡用户也不是没路,只是得走低量化路线:有人用 RTX 5070 Ti 16G 跑 UD-IQ3_XXS,生成速度 67.55 tokens/s,8K 上下文稳定运行。今日头条 但对 Agent 这种“输入怪兽”来说,8K 上下文基本不算能用。Mac 统一内存路线门槛低但速度慢,硬件要求是 32GB 以上内存的 Apple Silicon Mac,最好是 M4 Pro、64GB 内存以上,不然上下文一长就卡。微信公众号
三笔账,一笔一笔算
第一笔:你的云端虾料账单现在是多少。 这次新价格最狠的不是普涨,而是“结构性”:高峰缓存命中输入涨了 12 倍,打的是“稳定长上下文反复复用”的用法;缓存未命中输入和输出高峰 9 元、27 元,打的是“每次从零开始”的 Agent 用法。你的账单涨多少,取决于龙虾是反复吃同一份上下文的类型,还是每个任务都重新开始的类型,也取决于你白天跑还是错峰跑。多数白天挂机、缓存命中率不高的虾农,涨幅会非常明显——这也是为什么有人账单炸了、有人说还好。横向比,海外旗舰 API 更贵:Claude Opus 4.6 输出价格高达 75 美元/百万 Token,与国产模型价差近 40 倍,拿它当主力虾料,重度账单轻松四位数。值得买社区 降本空间也是真实存在的:有人只是换了默认模型,月费就从 1200 直接降到 360。微信公众号

第二笔:转本地的一次性投入。 如果你手上已经有 24G 显存的显卡机器,新增成本只有电费:旧电脑 24 小时开机,月电费约 30 元。今日头条 需要新购的,24G 显存档主机自己算价,而且现在显卡还在涨价周期里,不用急着冲。
第三笔:回本周期和隐形成本。 重度虾农月耗 500–1500 元,机器现成的话,转本地第一个月就能省下大头;需要新购硬件的,用硬件成本除以每月节省额自己估,一般一年上下。但两笔隐形成本要记上:一是能力差距,27B 和云端 1.6 万亿参数旗舰在困难任务上仍有明显距离,本地接日常、云端接困难,混合喂养是现阶段最优解;二是安全与维护成本,龙虾如果接 ClawHub 技能,13338 个技能里 12% 存在恶意行为——窃取 API 密钥、植入挖矿脚本、执行任意代码,跑本地模型的机器别放你的主力账号。今日头条
分层结论:谁该换,按顺序来
重度(月耗 5000 万 token 以上、24 小时挂机):已有 24G 显卡的直接换,Q4 量化;没机器的先算回本周期再动手;
中度(2000万–5000万/月):混合喂养,例行任务、心跳、定时任务走本地或错峰,困难任务留云端;
轻度(2000万/月以下):别换。先做“成本工程”——降 heartbeat 频率、压缩工具输出、收紧上下文、错峰调度,一套下来能省一大截,云还是比买硬件便宜;
16G 显卡用户:先上低量化版本试水,别为了虾料买新卡。
最后三个坑记一下:别给龙虾喂 8B 以下小模型,复杂任务工具链一长就犯错,返工更贵;别把“能跑”当“能用”,16G 可跑只是装得进去;Agent 场景默认切非思考模式或调低思考强度,省 token 还更快。
养虾的不可能三角,说到底不是选哪个模型的问题,而是你愿意用维护成本换饲料钱、用能力上限换数据安全。想清楚自己最在意哪个,这口虾料该不该换,答案自己就出来了。