8月17日0点,DeepSeek API 新价格正式生效。界面新闻这次调价不是简单的一刀切涨价,官方在8月13日的公告里明确了峰谷定价结构:高峰时段为北京时间9:00-12:00和14:00-18:00,其余为空闲时段,空闲时段价格为高峰时段的一半。对靠 DeepSeek API 吃饭的 AI 编程用户来说,这是一次必须重新算账的变化。
到底贵了多少
先看调价前的价格:V4-Pro 缓存命中输入0.025元/百万Tokens,未命中输入3元、输出6元;V4-Flash 对应是0.02元、1元和2元。界面新闻新价格下,旗舰模型 V4 Pro 受伤最重:高峰时段每百万 tokens 输入(缓存未命中)从3元涨到9元,涨幅200%;输出从6元涨到27元,涨幅350%;缓存命中输入从0.025元涨到0.3元,单项涨幅达1100%。界面新闻跑 Agent 任务的用户对此会更敏感:长会话里缓存命中输入才是计费大头,这1100%恰好涨在最常用的地方。
涨价并非毫无预兆,8月6日的官方开发者公告就已经把话说得很明白。界面新闻但新价格真正落地时,编程圈的震动还是超出预期,最先被波及的是 OpenCode Go 这类套壳 DeepSeek 的订阅制 agent 工具用户:DeepSeek一涨价,OpenCode Go 立刻下调了套餐内的调用额度。小红书
OpenCode 官方回应得很快:已经在上大规模GPU,CheepSeek 第一阶段近期上线,后面会逐步把 Flash 的体验和额度提上去。小红书8月18日,额度确实有回调,社区用户反馈可以接着用了。小红书8月19日,套餐里又新增 meta 的 muse-spark-1.2,社区实测每5小时4万多次请求,比之前 v4 flash 的三万多次还多,如果同意数据用于训练还能拿大折扣,折扣后价格低于 v4 flash 涨价前。小红书

路线一:留在官方,但要学会用空闲时段
如果用量不大、任务能错峰,官方 API 其实还能用。空闲时段 V4 Pro 每百万 tokens 输入(缓存未命中)4.5元,输出13.5元,缓存命中输入低至0.15元。界面新闻整体相当于打了对折,但问题在于,9:00-12:00 和 14:00-18:00 两个高峰恰好覆盖大多数人的工作时间:实时交互式编程基本躲不开高峰价,只有后台批处理、定时脚本、测试流水线这类任务能真正吃到空闲时段的低价。另外提醒一句,涨价之后打着低价 DeepSeek 旗号的中转平台会变多,付费前先看清计量单位和模型版本,不要一次性大额充值。
路线二:Ollama Pro,社区盯上的订阅选项
订阅制方案里,Ollama Pro 是这两天社区提得最多的名字。涨价生效当天的深夜,就有用户在盘完一圈后写下结论:目前比较推荐的只有 ollama pro 那个订阅,他们按照算力收费。小红书原帖还提到速度大概是 opencode go 的两倍,这属于个人体感,会随设备和模型浮动,别当成官方承诺。看实际用量,一位用了一周多的用户晒出了自己的用量页:一周内 deepseek-v4-flash 用了1498次,v4-pro 只用了44次,他的结论很直接,v4 flash 量充足,不要用 v4Pro。小红书这个用量结构其实很有代表性:编程场景里 flash 档模型承担了绝大多数请求,订阅前重点确认的也应该是 flash 的额度和速度。

对想顺便玩 DeepSeek Harness 的用户,Ollama 这边已经第一时间支持:一条命令 ollama launch dsh,就可以直接在自己的本地环境中运行 DeepSeek Harness。小红书这一版还内置了网页搜索能力,并加入了 Trajectory View,可以完整查看 Agent 调用了哪些工具、走了哪些步骤,对调试多步任务很实用。想把 agent 技术栈整体留在本地可控环境的用户,这是路线二的加分项。
路线三:本地自部署,硬件一次性投入
如果手里本来就有硬件,或者愿意一次性投入,本地部署是边际成本最低的路线:不按 token 计费,数据不出本机。但先泼一盆冷水,很多人判断电脑能不能跑本地 AI,只看模型文件能不能下载,这个判断少算了三块内存:系统占用、运行框架,以及 KV cache。小红书这也是下载了跑不动、跑起来就卡死这两个新手坑的根源。
社区整理过一份保守的内存对照档位:8GB 适合2B—4B的4-bit量化模型,主打摘要和分类;16GB 可以跑9B—12B,对应文档问答和轻量代码。小红书24GB 可以尝试20B—27B,32—48GB 跑26B—35B更从容,64GB 以上再考虑70B量化模型。对 AI 编程这种需求,想真正可用至少要从20B+档位起步,也就是24GB内存或显存是入场线,低于这个数,本地模型更容易变成玩具而不是生产力。

三个坑,部署前先知道
第一,上下文长度不够用。Ollama 默认上下文只有4K,跑 agent 工具调用会立刻捉襟见肘,建议手动调到至少16K,否则工具调用容易报错或被截断。第二,KV cache 吃内存。KV cache 是模型保存已读上下文的内存区域,对话越长,它占用越大。小红书模型支持长上下文不代表应该直接拉满,记得留20%—30%内存余量,出现交换内存激增、速度骤降就降模型档位。第三,端口别裸奔。Ollama 默认的11434端口没有鉴权,局域网自用没问题,千万别直接暴露到公网。
怎么选,按你的用量算账
最后给可以直接套用的判断。用量低、轻度使用:留在官方空闲时段,或者观望 OpenCode 调整后的套餐,不必急着迁移。重度使用、天天跑 agent:优先考虑 Ollama Pro 按月试水,确认常用模型的覆盖和速度后再谈长期方案;同时留意 muse-spark-1.2 的实际编程表现,社区刚上手测,样本还不够多。有大内存统一内存 Mac 或闲置显卡、又在意代码隐私:本地部署值得认真算一笔账,24GB 是入场线,电费是唯一持续成本。
后续值得盯三个信号:OpenCode CheepSeek 第一阶段的上线时间和额度结构、DeepSeek 峰谷定价是否还有下一轮调整、Ollama Pro 的模型覆盖更新。DeepSeek 低价时代的落幕大概率只是国产大模型 API 重新定价的开始,对写代码的人来说,骂涨价没有用,把自己的月调用量算清楚,组合出成本最低的路线才是正经事。