明天(8月23日)凌晨开始,DeepSeek 的 API 调用在周末全天按低谷价计费。知乎这是上周涨价之后,官方给出的第一个"安抚性"补丁。但周末便宜了,恰恰说明工作日高峰的 token 价格没有回来——对重度调用者来说,账单压力是真实存在的。也正因如此,一批习惯了低价"使劲蹬"的用户,开始重新打量一个之前嫌贵的选项:买台机器,本地部署。
零刻的新产品线恰好就卡在这个时间窗口上。这篇把两件事放一起算笔账:DeepSeek 到底涨了多少,零刻 SEi AI 系列卖的"本地推理"能不能接住这波需求,以及什么人买它划算、什么人纯属凑热闹。
这轮涨价有多狠:不是打折结束,是计价方式变了
8月17日零点起,DeepSeek 新定价正式生效,同时引入峰谷计费:每天 9:00–12:00、14:00–18:00 为高峰全价,其余 17 个小时半价。涨得最狠的是 V4 Pro 的缓存命中输入,从 0.025 元/百万 tokens 涨到 0.30 元,涨幅 1100%;输出从 6 元涨到 27 元,涨幅 350%。知乎专栏涨价前,V4 Pro 综合价格约 9 元/百万 tokens,是"全球最低之一",现在这个标签可以摘掉了。

落到个人账单上是什么概念?知乎有位用户拿自己上月的真实用量(v4-flash 为主,flash 与 pro 用量约 9:1)套了新价格,结论是涨幅在 2.06 倍到 4.11 倍之间,混合下来约 3 倍——他直言涨价后的费用"已经大大超出 99 元/月的 coding plan"。知乎专栏订阅侧的反应更直接:OpenCodeGo 把套餐内 DeepSeek V4 Flash 的调用额度从每 5 小时约 63,300 次砍到 3,800 次,缩水 94%。

而且这不是 DeepSeek 一家的动作。智谱年内三次调价累计涨 83%,腾讯混元单项涨幅 463%,Kimi K3 发布后输入涨超 3 倍。知乎摩根士丹利的数据显示,Q2 国产大模型 API 平均输入价已涨到 4.9 元/百万 tokens,输出 21.9 元,较去年 Q1 涨了 48% 和 80%。知乎专栏便宜 token 的时代,至少暂时结束了。这也是为什么"本地部署"这个前两年被嫌麻烦、嫌慢的方案,又被翻了出来。
零刻的答案:不动 CPU,外挂一张 160TOPS 的 NPU 卡
零刻在 7 月 29 日上市的 SEi13 AI 和 SEi14 AI,官方口号就是"为本地 AI 推理而生"。两台机器的思路一样:成熟的 x86 平台 + 一张独立 NPU 算力卡。微博
SEi13 AI:i7-13620H + 独立 NPU + 32G 内存 + 1T 固态,首发价 11,895 元;
SEi14 AI:Ultra 9 185H + 独立 NPU + 32G + 1T,首发价 13,988 元。
真正的看点不是 CPU——这两颗 U 都不算新——而是那张 NPU 卡:最高 160TOPS 物理算力,板载 24GB 192bit LPDDR5 专用推理内存,带宽 153.6GB/s。微博注意"专用"两个字:这 24GB 不占系统内存,x86 负责系统运行、NPU 负责 AI 推理,两边互不打架,推理时 CPU 和主内存完全解放。
8 月中旬的首发实测,作者标题直接写了"仅次 AI MAX 395"——背景是 AI Max 395 赶上内存和硬盘涨价,“价格直接上天起飞”。哔哩哔哩这也是零刻选这条路线的原因:把推理内存做成独立的、焊死在 NPU 卡上,绕开涨价最凶的通用内存市场。零售 16GB DDR5 内存条已经涨到 1,500 元一条,统一大内存方案越来越贵。知乎专栏

机身前后面板的接口布局,官方给的标注图里看得比较全,桌面周边和网络存储的扩展需求基本都能覆盖。
先泼冷水:本地跑不了 DeepSeek V4,这钱买的不是"免费版 DeepSeek"
决定买不买之前,有三件事必须想清楚,否则就是冲着幻觉下单。
第一,本地跑不了 DeepSeek V4 本体。V4 是集群级算力服务的超大模型,这次涨价的 API 和"本地部署"是两个世界。24GB 的 NPU 推理内存,能装下的是量化后体积合适的开源中小模型——千问系的 14B 到 30B 量化版、各类蒸馏小模型这类。你买到的不是"免费 DeepSeek",而是"开源中小模型的本地推理能力",用它去替代你账单里那些中低难度、高频次的调用,而不是替代旗舰模型本身。
第二,生成速度受带宽封顶。NPU 的 token 输出速度大致等于"显存带宽 ÷ 模型占用体积"。按 153.6GB/s 的带宽做理论估算:8B Q4 量化约 30 tokens/s,14B Q4 约 18 tokens/s,32B Q4 勉强装下、约 8 tokens/s——实际还要再扣掉软件开销。这个速度是"能用、能干活",不是"秒回",对交互式编码场景要有心理预期。
第三,160TOPS 是物理算力,能用多少看软件栈。B 站 8 月下旬那篇近 2 万播放的 SEi13 AI 深度实测,作者拿到机器时也觉得这配置"劝退",后来把 NPU 放进生产环境跑了一阵、又翻了厂商的底层软件栈才改观。哔哩哔哩NPU 的框架适配、算子支持目前还在早期,买这类硬件,某种程度上是在买它的路线图。
算账:回本拐点在"月账单 500 元 + 六成任务可替代"
把"继续用云"和"买本地"放到一张表上比。先界定成本口径:零刻自家不带 NPU 的 32G+1T 级别迷你主机,国补后大致在 4,000 元上下。知乎专栏所以 SEi13 AI 的 11,895 元里,NPU 溢价约 7,900 元——这就是要为"本地推理"额外付的钱。按 24 个月摊,每月约 330 元;迷你主机功耗是几十瓦量级,电费每月最多数十元,不影响量级。
省下的部分 = 月 token 账单 × 本地可替代比例。注意是"可替代比例":只有中小模型能胜任的任务(总结、初稿、简单代码、RAG 问答、常驻本地 Agent 这类)才算数,需要旗舰推理能力的任务还是得走云端。按这个模型估算:

月账单 100 元:哪怕替代七成,回本也要 9 年以上——别买,周末低谷价 + 每日 17 小时半价就够你用了;
月账单 300 元:回本 38–53 个月,超过多数人的换机周期,不值;
月账单 500 元、六七成任务可替代:回本约 23–32 个月,属于"可买可不买",除非你本来就想要一台 7×24 常驻的本地 AI 机器;
月账单 1,000 元以上:回本 11–16 个月,值得认真考虑;
月账单 2,000 元以上的高频用户:一年内回本,这台机器基本就是为你设计的。
两个额外提醒。一是云侧还有平价替代:99 元/月的各类 coding plan、Google Gemini 3.7 Flash 限时半价(到 2026 年底),先把这些用满再谈买硬件;DeepSeek 的网页版和 App 聊天目前仍然免费,轻度用户不用焦虑。二是本地侧的最大变数是内存价格——这波涨价还没结束,如果你需要的其实是能跑更大模型的大内存机器(而不是 24GB 的 NPU 路线),现在并不是最好的出手时机。
接下来值得盯的三个信号
明天开始的周末全天低谷价只是第一步,盯着 DeepSeek 后续会不会继续调价——云价格每松一分,本地方案的吸引力就降一分。
内存/固态的价格走势。它同时决定云厂商的成本和本地机器的定价,是这条赛道最大的变量。研报端的预期是摩根士丹利预计 Q3 成熟 DRAM 价格涨 50%、Q4 再涨 10%,这波涨价还没到头。知乎
零刻 NPU 软件栈的更新节奏:支持哪些推理框架、适配哪些模型,比 160TOPS 这个数字更决定这台机器两年后的价值。拆机视频里那张 NPU 卡是独立模块,后续会不会单卖、会不会出低配版,也可以留意。
一句话总结:DeepSeek 涨价确实把本地部署从"极客玩具"变成了"可以算账的选项",但账算下来,零刻这台 11,895 元的机器只救月账单 500 元以上、且大部分任务中小模型就能干的重度用户;其他人,先把峰谷价和平价订阅用明白。