九月底的本地推理圈,话题从“下哪个模型”变成了“晒月底账单”。把这一个月的云端价格动作按时间轴排开,本地党真正要回答的问题就浮出来了:这笔账到底怎么重算。
8 月 17 日,DeepSeek 上线 V4 Pro,同步上了峰谷计费:工作日白天高峰,未命中输入干到 9 块钱一百万 Token,输出从 6 块飙到 27 块,哪怕命中缓存,峰值单价也翻了好几倍,一个跑自动化 Agent 和长代码重构的团队直言周账单出来时差点以为后台被人刷了接口。知乎
9 月 9 日晚到 10 日,通知到了:缓存命中最高降 60%、未命中降 33.33%、输出降 11.11%,9 月 10 日 12 时起生效。 仔细看会发现这是两件事:V4.1 Flash 发布,而原来发给 V4 Pro 的请求全部路由到 Flash、按 Flash 单价计费——价是降了,模型也换了。知乎
9 月 24 日,OpenAI 给 GPT-6 家族补上 Sol 和 Luna 两款,API 标价相对 GPT-5.6 同档促销价直接砍半,还注明是长期定价、不是限时促销;最扎心的是 Luna:0.10 美元一百万输入 tokens,折人民币约七毛,已经能和 V4.1-Flash 正面开刚。36氪
9 月 25 日,融资爆料来了:DeepSeek 完成 75 亿美元融资,年化营收从不足 5 亿冲到 10 亿美元,哪怕 API 上调 2.3-4.5 倍、客户需求依然坚挺。 同日,DeepSeek Harness 桌面预览版在社区传开,装完就会发现它不是纯免费工具:初次进入若无额度,需要充值或绑定有效余额账户,还要实名认证。微博36氪
这条时间轴的另一头,本地党确实在“接得住”:8 月中旬开源的 Qwen3.8-27B,一个月里被跑进了各种机器。24G 档,今天刚有人整理出 7900XTX 单卡完整方案:24GB 显存配 Xeon E5 服务器 U 加 64G 内存,目标模型正是 Qwen3.8-27B 的 GGUF 量化版。 16G 档,B 站测评 UP 主给量化版的一句话判决是:它就是 16G 显卡最佳选择。 128G 档,有人在一台 AMD Strix Halo 统一内存机器上同时供着 5 个模型服务:两个 35B 级 GGUF、一个 PaddleOCR-VL、一个 ComfyUI 生图,外加一个 124GB 的专用引擎。知乎哔哩哔哩知乎
劝退的声音同样密集。小红书新手帖说得很直白:别让本地部署成为进入 AI 的门槛,新手先把用起来这件事搞定,再去想部署的事。 知乎上被反复引用的那句总结是:本地部署更像是自己买算力,也自己负责维护——偶尔用用的人买台高配,等于长期闲置。小红书知乎
两拨都对,但都只看见了一半。把两边的单价摆到一张桌子上,这轮账的第一个真相是:云端没有全线变贵,它裂成了高价、低价两条道。低价道现在的行情:V4.1 Flash 闲时未命中输入 1 块钱、缓存命中回到涨价前的 2 分钱、输出 4 块钱,还给 100 万上下文窗口;再往下,还有七毛进场的 Luna。知乎
这些低价不是白拿的,前提是活能挪、能等、能命中缓存——峰谷表里藏着的漏勺就值一笔钱:工作日 12 点到 14 点、18 点以后和周末全天全算闲时,直接打五折。知乎
国内同一条路上也不缺打手:百炼主力 Qwen-Plus 输入压到 8 毛钱一百万 Token,Batch 批量接口还能再五折;豆包通用档几毛进两块出,白天高峰也不给你报服务器繁忙。知乎
第二个真相比单价更结构性:价格战已经从“每 token 多少钱”卷到了“每完成一个任务多少钱”。GPT-6 Sol 在真实软件工程测试 DeepSWE 里 68.8%,只比 Claude Fable 5 低 1.1 个点,按 OpenAI 的估算单任务成本低约 80%。36氪
跨应用测试 AutomationBench 上它 0.27 美元一单,约为 Opus 5 max 档的十一分之一——云端把“单位有效任务”的价格越砸越低,而它自己改了缓存机制:对话中途调推理力度、开关工具,不再打断已有缓存复用。36氪
这对本地意味着什么,社区实测给了分层答案:重复性、模式化、单文件范围内的活,本地模型够用;需要跨文件推理和多步思考的活,差距还很明显。 换句话说,本地省下的 token 单价,很可能被更高的任务返工率部分收回去——这笔隐性账,买机器之前最容易被跳过。知乎
于是结论不是“本地赢”或“云端赢”,而是盈亏点对不同的人,正往相反方向移动。第一类:高频、白天、长链 Agent、重输出的活,确实被架在 27 块一百万上烤——一个用户的账单样本:同样 45 亿 token,涨价前约 90 美元,涨价后按峰谷落在 250 到 500 美元区间。 对这类人,混合架构已经不是概念,是有人真在跑的日常:八成脏活累活扔给固定成本的本地机器,剩下两成需要拔高上限的复杂推理,再走 API 调旗舰、顺手卡进闲时窗口。知乎知乎
第二类:轻度使用、能错峰、吃得进缓存的人——这轮涨价根本没伤到你,云低价道还在往下走,新手帖那句先用 API 入门、别急着买机器,对你依然成立。数据敏感则是第三本账:客户代码、内部文档不能出内网的用户,本地与否本来就不由账单决定。
便宜云的另一面也得看:涨价后冒出的一批三折五折“原厂渠道”Key,老用户提醒,十个有九个半是在网关后台偷偷做模型降级——你请求里写的是旗舰,路由到的是便宜小模型。知乎
接下来盯四件事:V4.1 Pro 上线后,V4 Pro 全部路由到 Flash、按 Flash 单价计费这个窗口期会不会收走;新上的桌面客户端会不会给本地模型开入口——桌面不等于本地,一键部署入口这类端侧路线和 Harness 这种 API 客户端是两条线,接下来会被继续搅在一起;128G 统一内存机器的行情,社区连 M5 Ultra 的 1.2TB/s 带宽能不能战 4090 的调研都开始了。 最后是下一刀会不会砍向订阅——毕竟 API 标价和订阅包价,现在是两套算法了。小红书
这轮变化杀死的不是一句“云端已死”或者“本地真香”,而是单一标尺:API 市场裂成高低两条道之后,本地推理的盈亏点随你把活放在哪条道而浮动。先看账单里 27 块是花在输出上、还是花在未命中输入上,再看显卡。当下最保值的不是最新权重,也不是某张显卡,而是你自己那份任务清单——知道哪些活能下放、哪些活必须上交的人,谁涨价都不亏。