DeepSeek峰谷价撞上Ollama Cloud改版:本地部署的「token自由」账本被重算了,三类人三种走法

源自47位全网作者

06:36

大半年里,很多人掏钱装显卡的理由就一句话:"API太贵,本地跑就token自由了。"然后8月17日DeepSeek把峰谷分时定价搬进了大模型API,8月31日Ollama Cloud把云套餐整个改版——“省钱"这张桌子的两条腿,前后脚被人抽走。知乎上那个"有必要自己把DeepSeek部署到本地吗"的问题下,双3090实跑半年的反调回答已经冲到两百万级播放,开篇一句就很扎心:本地部署不是省钱方案,是"可控性方案”。知乎小红书"被本地部署骗了"一系的帖子,评论永远比点赞多。这篇就把改价之后的新账本,按三类人摆开算一遍。

峰谷价先打中的不是聊天党,是Agent党

先拆DeepSeek这轮调价里最容易被读错的一条。8月17日起,V4系列首次把峰谷分时定价引入API:工作日9-12点、14-18点高峰执行高价,其余时段为谷价,媒体口径的最高涨幅是11倍(一财、每经同题表述),峰谷之间大约差一倍。第一财经微博官方新价目表里几个关键档位:V4 Pro高峰输出27元/百万token、空闲13.5元;V4 Flash高峰输出9元、空闲4.5元。

DeepSeek峰谷价撞上Ollama Cloud改版:本地部署的「token自由」账本被重算了,三类人三种走法

涨得最狠的一档其实不在输出,在缓存命中输入——社区有梳理称该档位最高涨幅达1100%(各家转述口径不完全一致,以官网账单为准)。微博为什么这条比输出涨价更疼?看看你账单里哪个字段最大:纯聊天用户一问一答,基本没有缓存消耗;Agent是上百次调用、每轮都带着整个上下文反复命中缓存——知乎里"大模型缓存命中如何降低token费用"的问题底下,cached_tokens就是Agent账单的主体。换句话说,这轮调价精准打在跑Agent的人身上,而高峰窗口9-12、14-18正好是你坐在工位上让coding agent干活的时段。调价当天微博就出现了"#你会为省钱半夜用AI吗#"的话题。微博有开发者的实测吐槽很典型:之前一天就用两三个点的套餐额度,现在一天就干了20%。微博

供给端也有个背景信号可以对照:本周末DeepSeek被曝敲定25.6亿美元、16万颗华为昇腾芯片的采购订单,全部用于推理。微博而日间算力挤兑不是营销话术,是真事。规则本身还在继续动:8月23日起,官方再度优化,周末全天不再区分峰谷、统一按低谷价执行。红星资本局"半夜干活党"之外,周末重度用户意外拿到了缓冲垫。至于网页端免费聊天用户,目前不在这次API涨价的影响范围里,但免费版限速的抱怨已经开始出现。

Ollama Cloud:官方讲"透明计价",161条评论讲了另一套

Ollama是装机量最大的本地模型运行工具,8月31日它的云服务彻底改版,官方口径很体面:按token透明计价、无服务费,Pro订阅20美元/月含60美元用量,能调20多个开源大模型——DeepSeek V4 Flash/Pro、GLM-5.3、Kimi K3、Qwen3.5 397B这些,全部支持工具调用,上下文最长1M token,提供OpenAI兼容API,Claude Code、Codex直接接入,命令行里一条ollama run本地云端无感切换。哔哩哔哩它甚至有个对中国用户友好的时差结构:官方高峰时段UTC 12-18点,中国白天调用正好赶上美国GPU闲置期,全天最快最稳。

DeepSeek峰谷价撞上Ollama Cloud改版:本地部署的「token自由」账本被重算了,三类人三种走法

然后是B站一条实测视频下面161条评论攒出来的另一半真相(按点赞数排序):

  • 速度是真的:有用户实测v4flash能跑到230 tok/s左右、GLM-5.3约100 tok/s(赞50);

  • 额度也是真的缩水:新版按token计费后,v4flash的可用量约等于老套餐的六分之一,周额度折合两千多次请求(赞39),另一位用户的说法是"比之前老套餐量少了70%",直接挂出避雷;横向一比更难看,社区流传的20美元档用量倍数是Ollama约3倍、别家6-7倍、GPT Plus名义20倍(按用户口径转述);

  • 模型不是满血:官渠V4 Flash输出上限384k,走Ollama渠道65535就截断;托管的ds4f有用户反复复现思考循环、工具调用循环,换回官方渠道就正常——“是不是量化了不知道,但智力上明显不是原版”;

  • 计费号称透明,实际不返回缓存字段,账单页只能看到请求次数;

  • 时差福利有个反面:UTC 12-18就是北京20点到凌晨2点——下班回家跑自己项目的那段,恰好是Ollama的峰价时段。哔哩哔哩

一句话小结:Ollama Cloud把"方便"做到位了,把"token自由"的承诺做没了。从涨价的订阅迁过去的人,发现自己在额度、长度、智力、时段四个地方被重新收费。

三类人,三种走法:账本重算

先把本地党的硬件门票钉清楚,这是双3090实跑半年那位答主给过的实测锚点:舒服跑27B级别FP8量化,48G显存是起步线,二手3090×2自攒整机约一万五;64G统一内存的Mac Mini约两万——他原话是"这个价格已经够买包年5-10年的plan了"。电费别漏算:双卡满载整机600-700W,民用电0.6元/度,每天8小时一个月七八十块,24小时不关机两百多。还有两个买卡前就该知道的事:其一,3090没有原生FP8算力,软件内核跑FP8只省显存、不提速,想要加速得40系起步;其二,硬件本身正在涨价——据21世纪经济报道,8月初华强北RTX 5060 Ti两周内从2350元飙到3400元,英伟达也向合作厂商下发了GPU套件涨价通知,"一万五上车"未必一直是稳的。微博另一边,8月25日发布的新款Mac Mini虽然6999元起,但那是入门内存档,离跑27B还差着配置钱。微博

DeepSeek峰谷价撞上Ollama Cloud改版:本地部署的「token自由」账本被重算了,三类人三种走法

A类·白天低频使用(每天几十轮问答、写作、总结):你的API账单本来就落在几十块钱/月的量级,网页版又不受这次涨价影响。拿"本地省API钱"的叙事套在自己头上,回本周期按十年算。结论:这张涨价跟你关系最小,别碰硬件;真在意的,把重活挪到谷时段和周末——8月23日之后周末全天都是谷价,先把高峰那几倍的差价躲掉。

B类·白天高频跑Agent/coding:这是被峰谷价正身打中的人群,月账单从几十上一百多的那批,回本账在这次调价之后反而比调价之前短了——因为你不离开工位,躲不开高峰。三条路摆开:本地(白天任意用、不看峰价,一次性投入+每月几十块电费)、Ollama Cloud(白天时段快且便宜,但截断和降级风险自己扛)、或者换没有峰谷价的渠道(社区已经在按"全天谷价"口径互相比价)。给犹豫者的判断线:月API账单没到三位数之前,先别急着装机,花两周把账单字段截出来,看清楚钱烧在输出还是烧在缓存命中——烧在缓存的才是这轮涨价的大头。

C类·24小时自动化流程(批量转写、内容流水线、定时任务):本地是明确赢家,而且这轮调价之后赢得更明确。9月6日知乎"token自由是不是真的"问题下的新答案说得很直白:能忍受它慢,本地就能实现token自由,让模型24小时跑定义好的流程,只要有需求,它就可以不间断工作。知乎双3090答主给过同款案例:几十个脚本的批量迁移,模型自己拆18步跑6分钟,走API一次几块钱、一天十几次就是一个月钱,本地跑电费不变。但注意前提:流程不赶时间的话,"能半夜跑"的批量任务走谷价API可能比硬件折旧便宜——这一类里到底谁省钱,取决于你能不能把任务挪出白天。

调价没改变本地的价值,只是把定位钉死了

整套账算下来,这轮两件事真正干掉的是一句老话:"本地部署是为了省钱。"活下来的定位是三句,全是实跑过的人给的,不是参数表推的:数据不能出门的人(体检报告、财务表格、项目文档,交给自己的机器才睡得着)、白天高频不可替代的人(不看峰谷价,是这次调价之后才显出来的新理由)、享受折腾本身的人(驱动、CUDA、编译依赖占掉一整个周末,对前者是折磨,对后者是乐趣)。反过来,只冲着token自由去的,Ollama Cloud评论区已经替你算完:20美元,也未必自由。

值得继续盯的信号有四个:DeepSeek网页免费版的限速会不会进一步收紧(它是很多普通人动心本地的真正起点);其他家跟不跟涨("豆包调价"已经在微博传开,智谱GLM-5.3-Flash、Qwen3.8-Flash的低价开源路线是反向变量);Ollama会不会回补额度、把缓存字段放回账单(161条评论的集中骂点);以及本地聚合这一头,英伟达PAIR已经能把家里多台RTX主机、DGX Spark、Mac拼成一个本地推理集群。微博它的控制台实测界面长下面这样,而搭载RTX Spark的Windows个人电脑已经官宣10月上市。还在纠结要不要加第二张显卡的,可以再等等。

DeepSeek峰谷价撞上Ollama Cloud改版:本地部署的「token自由」账本被重算了,三类人三种走法

内容由AI生成

精选参考来源

1. 有必要自己将deepseek部署到本地吗?(回答:本地部署不是省钱方案,是可控性方案)

2. 一财主播说|DeepSeek告别白菜价:API最高涨11倍

3. 深度观察:峰谷价落地,算力市场开始算账了

4. DeepSeek 8月17日正式执行调价方案:高峰输出上涨、缓存命中输入最高涨1100%

5. #你会为省钱半夜用AI吗# 要是涨价太多,我只能半夜干活了

6. DeepSeek涨价一算吓一跳:之前一天两三个点额度,现在一天干20%

7. DeepSeek敲定25.6亿美元订单部署16万颗华为昇腾芯片用于推理

8. 今天0点起DeepSeek优化峰谷计费:周末全天按低谷价

9. 最适合国内订阅的token plan——Ollama Cloud?

10. 显卡也发疯了:据21世纪经济报道华强北RTX5060Ti两周从2350元飙到3400元

11. 苹果上架新款Mac mini和Mac Studio:M6芯片6999元起

12. 很多人认为本地部署一个大模型就实现token自由,真的吗?(回答:不是重度使用API更便宜)

13. Nvidia推出Personal AI Router(PAIR):把家里多台电脑组织成本地AI推理集群

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章