DeepSeek最高涨价1100%后,我把云端账单和本地电费放在一起算了算

源自15位全网作者

07:18

8月17日0时,DeepSeek新一轮API价格正式生效。界面新闻本地部署圈这两天刷屏的帖子分两种:一种在算账,一种在退订。微博上有人晒出账单,宣布转投ollama的月包。微博也有人反手取消了ollama订阅。微博同一次涨价,两个方向的迁移,说明这事不是情绪问题,是算术问题。今天就把这笔账算清楚。

这次涨价到底涨了什么

先看价格表。这次最大的变化是引入峰谷定价:高峰时段为北京时间9:00-12:00、14:00-18:00,其余闲时价格减半。界面新闻以旗舰V4-Pro为例,闲时每百万tokens缓存命中输入0.15元、缓存未命中输入4.5元、输出13.5元;到了高峰时段,三项全部翻倍。雷达财经

DeepSeek最高涨价1100%后,我把云端账单和本地电费放在一起算了算

涨幅要对照上一轮价格看,最刺眼的是缓存命中输入:高峰时段从每百万tokens 0.025元涨到0.3元,涨幅高达1100%;缓存未命中从3元涨到9元,输出从6元涨到27元。界面新闻换句话说,如果你跑的是长上下文agent,缓存前缀大、又只能在白天高峰期干活,这次涨价涨的恰好是你最疼的地方。

而且高峰时段就是国内的工作时间。DeepSeek官方划定的峰时换算成北京时间,正好覆盖上午9点到12点、下午2点到6点。36氪对白天重度用模型的团队来说,几乎没有躲的空间;对习惯晚上跑批的个人用户,这反而是一张错峰折扣表。

DeepSeek不是孤例。在它之前,腾讯云、阿里云、百度智能云都已上调API算力产品价格,智谱年内已经第三次提价。界面新闻摩根士丹利的研报则显示,今年二季度国产大模型API平均输入价格已升到每百万tokens 4.9元、输出21.9元,较2025年一季度分别上涨约48%和80%。雷达财经全行业的低价红利都在退潮,这是判断要不要转本地的大背景。

谁最疼:套餐党和重度Agent用户

反应最快的是订阅套餐。OpenCode披露过一次典型V4-Flash请求的结构:410个新增输入token、7.13万个缓存token、310个输出token,调价后峰时单次请求成本变为原来的4.62倍;社区流传的OpenCode Go套餐额度缩水94%的说法口径偏夸大,但按更严格口径测算也减少了约四分之三。36氪

做数据清洗、评论分析、信息抽取这类自动化项目的开发者感受最直接。知乎

但也不是所有人都在慌。知乎一条1300多赞的回答算得很冷静:agent里token消耗的大头是缓存命中输入,涨完之后这一项仍然相对便宜。知乎对照海外价格,涨完的V4-Pro高峰输出价也只有Claude旗舰模型的约1/13。雷达财经涨价真正挤压的,是不动脑子敞开用的那部分空间。

三笔账:云端账单、本地电费和性能折价

第一笔是云端账。有人把涨价后的V4 Pro账单逐请求拆了一遍:三类价格全部翻倍,同样的token构成放到闲时跑,正好省下一半。知乎

DeepSeek最高涨价1100%后,我把云端账单和本地电费放在一起算了算

这份实账还揭示了一个容易被忽略的细节:高峰时段输出token只有缓存命中的约1.12%,费用却反而略高。知乎所以省钱的方向很清楚:别只盯着输入长度,控制输出冗余、稳定可复用前缀提高缓存命中,再把能排队的任务挪到闲时。

第二笔是本地账。先立一个对照基准:以每月3000万未缓存输入token、750万输出token的场景,全部按V4-Pro高峰价计算,云端一个月约472.5元;本地也常被说成几块钱电费,实际按平均功耗100W、每天24小时运行算,一个月就是72度电,再往上还要叠加硬件折旧和维护时间。知乎

DeepSeek最高涨价1100%后,我把云端账单和本地电费放在一起算了算

第三笔是性能折价,也是最容易被跳过的一笔。本地量化27B和V4-Pro不是同级能力,前面那篇Apple Silicon实装文章的结论很清醒:工程上更合理的目标通常不是100%本地替代,而是混合路由——稳定重复的任务优先走本地,复杂和突发任务回退云端。

本地现在到底能跑成什么样

先打破一个刻板印象:2026年的本地部署早就不是勉强能用的水平。24G显存的7900 XTX上,有人把Qwen3.8-27B满血压榨到53TPS。哔哩哔哩小红书也有5090单卡的压测:本地vLLM跑Qwen3.8-27B High,76 tok/s,缓存命中92%。小红书

没有这种显卡,门槛也没想象中高,先记一条显存档位:9B量化版大概5-6GB,27B量化版大概18GB,72B量化版接近40GB。知乎24GB显存是跑27B比较舒服的起点,8GB以下建议先从9B小模型入手,别硬上。在DeepSeek大幅调价的当下,27B也被不少人视为目前最有性价比的端侧Agent模型。知乎

预算有限的话,老卡2080Ti魔改22G显存单卡跑27B,也能做到39.5 token/s。哔哩哔哩但要提醒一句:魔改卡品控没法和官方产线比,脱焊、掉驱动、BIOS报错都是现实风险,下手前得想清楚。知乎

Apple Silicon用户已经有一套现成的成熟方案:用MLX跑4-bit量化的27B生成模型,再用独立FastAPI服务提供Embedding和Rerank,整套服务可以常驻在一台48GB统一内存的机器上。知乎

DeepSeek最高涨价1100%后,我把云端账单和本地电费放在一起算了算

三类人,三条路

第一类,重度agent用户:别搬家,做路由。简单任务走小模型,复杂推理和代码生成才走大模型,一层简单路由就能把整体成本砍掉70%以上。知乎

第二类,数据采集、评论分析、信息抽取这类自动化项目:本地化最彻底。一次性硬件投入,之后每条数据的成本趋近于0,采集来的数据也没必要再过一遍第三方API。知乎

第三类,白天固定使用的中度用户:先别买硬件,挪时间。仓库索引、批量测试生成、文档生成、静态审查、多agent探索、可排队的重构迁移,都可以放到夜里跑;但线上故障、交互式调试、需要人工连续反馈、有明确时限的发布操作,别强行错峰。知乎

至于每天只聊几句、写点文案的轻度用户,真不用折腾:闲时缓存命中输入仍是0.15元每百万tokens,搬家省不回电费。倒是硬件端要留意,DDR5合约价格年初至今已上涨123%。36氪等着硬件降价再装机,未必是笔好买卖。

动手之前,值得盯住的三个信号

第一,算力缺口会不会继续扩大。今年一季度国内AI算力需求同比增长417%,有效供给增速只有128%,缺口还在拉大。雷达财经只要算力还紧,API价格短期就很难回头,这个值得跟踪两三个季度。

第二,便宜模型能不能接住agent场景。V4-Flash正式版上线后,分别以8.83万亿和11.2万亿token的周调用量连续登顶。雷达财经如果你的活儿用Flash加错峰就能覆盖,就不必急着买显卡。第三,硬件价格。社区网友已经在劝:真有意向买笔记本,现在赶快下手。36氪云端在涨价,本地硬件也在涨价,真正要算的是你手里用量结构下,哪边涨得更快。

最后给一个值买式的结论:这次涨价没有终结廉价大模型时代,它只是把方便和时间段分别标了价。对本地部署兴趣用户来说,这既不是恐慌性迁移的动员令,也不是云端的末日,而是一次把真实token构成摊开、对号入座的机会。实在算不清楚,就从最简单的一步开始:今晚把批量任务挪到12点以后跑,看看账单能便宜多少。

内容由AI生成

精选参考来源

1. DeepSeek API今起正式调价,最高涨幅达1100%

2. DeepSeek涨价,“价格屠夫”梁文锋“收刀”

3. 涨价是DeepSeek的原罪?

4. DeepSeek V4 Pro 2026-08-17峰谷计费实账:Cache Hit、Miss与Output Token成本拆解

5. Apple Silicon本地部署Qwen3.8-27B:MLX、FastAPI、KV Cache与RAG服务

6. DeepSeek 涨价后 Flash 调用量砍 94%?数据采集/自动化项目这样降本

7. 怎么看 DeepSeek 8 月17 日涨价后的价格,这个峰谷定价你接受吗?

8. 两天消费200块v4pro,明天不用了,转战ollama的20$月包

9. 取消了ollama的订阅,deepseek官方涨价之后,它也跟着涨,所以基本不可用了.

10. 【通义千问3.8】53TPS极速!7900XTX24G满血压榨!262K长上下文+KVCache+MTP本地部署保姆级教程

11. 39.5Token每秒!千问3.827B2080Ti22B单卡本地部署提速

12. 本地部署大模型需要什么配置?2026年

13. Qwen3.8-27B本地部署实测:很好但别用默认设置,社区优化后潜力很大,可稍晚入手!

14. Qwen3.8-27B+5090+DSHarness 无限续杯

15. 256G比5090还贵,内存一年暴涨3倍,全球为奥特曼豪赌买单

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章