8月对订阅党来说挺难熬的:智谱新套餐涨价,Kimi到今天还是没法新订阅,OpenCode的首月优惠没了,Ollama自家100美元的Max档也依然停售。知乎
于是一批被挤出来的 coding plan 用户,把目光投向了少数还能正常下单的选项——Ollama Cloud Pro,20美元一个月,折合人民币大概140到150元。小红书

小红书上有人实测一周后直接充了一年,评论区也有人说"被OpenCode的120刀养刁了,感觉额度还是有点紧"。同一个套餐,口碑为什么差这么多?我把近两个月知乎、小红书、微博上的实测数据归拢了一遍,结论先放这儿:关键不在额度多少,而在你拿它跑哪个模型。
官方没明说的规则:配额不是按token算的
很多人默认订阅就是买"每月多少token",Ollama Cloud还真不是这个玩法。它计费的是 Cloud Usage,本质是GPU时间。知乎

知乎上有个很硬核的实测:有人把6个模型挨个跑了一遍,记录每次消耗的配额百分比,再反推Pro档的总配额,结果差距大得离谱。知乎
deepseek-v4-flash:每月约 93亿~111亿 token
DeepSeek-V4-Pro:每月约 74亿~99亿 token
minimax-2.7:每月约 39亿~42亿 token
kimi-k2.6:每月约 19亿~23亿 token
GLM-5.1:每月约 13亿~20亿 token
同一份配额,跑flash能出约100亿token,跑GLM-5.1只剩约16亿,差了6倍。更能说明问题的是:差不多相同2700多万token,minimax-2.7吃掉的配额是flash的2.45倍——因为它推理慢,单个token占的GPU时间更长。你选什么模型,就等于买了多少配额。这也解释了社区里的分歧:有人觉得"20刀套餐里差不多装了240刀的GLM额度",也有人觉得紧。知乎
顺带说一个对照:智谱官方套餐跑GLM-5.1,推算每月约30亿token,比Ollama上的16亿多将近一倍,但智谱有高峰期三倍消耗的机制,如果你恰好只在高峰期用,30亿缩水到10亿左右,反而不如Ollama了。知乎
所以"哪家划算"这件事,答案取决于你的使用时间分布。
分档制度:官方文档里找不到的那张表
Ollama Cloud的模型按 Usage Level 分档。社区实测下来:deepseek-v4-flash 是 Level 2(Medium Usage),glm-5.2 是 Level 3(High Usage),DeepSeek V4 Pro 直接是 Extra High 级。麻烦的是,官方目前没有一份完整的"哪个模型属于哪一档"清单,有用户吐槽"一直没找到文档,只能靠AI搜,只有部分模型有分档说明"。
小红书那位包年用户的实测也能对上:他只跑 deepseek-v4-flash,月费150元左右,一周约20亿、一个月约100亿token,tps稳定在200左右——和知乎反推的上限基本吻合。小红书
而他的态度是"够用",前提是他压根不碰高档位模型。
我的建议很直接:订阅前先用Free档,拿你真实要用的模型跑几天,盯紧配额百分比的下降速度。这比任何攻略都准,因为分档表查不到,你的使用习惯也没人能替你算。
配额之外,这几个坑更要紧
额度提醒邮件,跑得比额度耗尽慢。官方说法是用到90%发邮件提醒,但有运维博主实测,等看到邮件时,API已经开始返回"no available usage"了。知乎
靠谱做法是自己定期去 ollama.com/settings 看用量,或者写个脚本每周查一次。
5小时session限制。连续跟模型聊满5小时,系统会重置。知乎
日常问答无所谓,但你要是挂着一个Agent跑长任务,中途断连真的烦。
速度和稳定性是要取舍的。云端模型部署在海外,低峰期首字也要2-3秒,个别模型还会偶发变慢;好处是flash档速度确实能打,实测200tps上下,微博上还有人晒出过311 token/s。微博

但整体稳定性不如各家官方API,这点要有预期。知乎
需要境外支付方式,Max至今停售。截至8月25日的最新对比信息:Pro可正常购买,100美元的Max仍然停售,做预算时别把它算进去。小红书
敏感数据别上云。官方承诺不记录、不训练,但含密码、密钥、内网映射的日志和配置,还是留在本地模型里跑更稳。知乎
到底值不值?分三种人
值得试的:本来就把Ollama当主力工具、有境外支付条件、主要用DeepSeek/GLM/Kimi这批开源模型、能接受稳定性的取舍。20美元买的是统一入口加模型聚合,只用flash系的话月产约100亿token,对比官方API按量计费是数量级的便宜。
别硬上的:没有境外支付方式,或者需要逐笔核算成本、对稳定性要求高。前者直接看国内可买的档位(智谱新套餐涨了但能买,阿里百炼Token Plan不限购),后者老老实实走官方API。
不用订的:只想跑本地开源模型的人。Ollama本体永远免费,别为"品牌入口"付这笔钱。
如果你决定要订,省钱的路子就三条:先用Free把真实工作流跑一周再付钱;简单任务留给本地小模型,云额度只留给长上下文和强推理;盯紧用量页面,别等邮件。
最后留三个值得继续盯的信号:Max什么时候恢复售卖、Kimi K3什么时候明确支持订阅(现在评论区还在吵"到底能不能用")、以及智谱峰谷倍率的走向。小红书
如果高峰期三倍消耗不取消,Ollama这份全天候额度的含金量还会继续涨。

你的订阅每月实际能跑多少量?评论区对一下账。