近日,国产大模型公司深度求索(DeepSeek)宣布对其全系列API服务进行大幅降价,此举在人工智能行业内引发了广泛关注。本次价格调整的核心,是其“输入缓存命中”场景的价格,直接降至原有价格的十分之一,在叠加限时优惠后,部分模型价格创下新低。
此次降价并非普降,而是精准地瞄准了AI应用开发中的一个核心成本痛点——输入缓存。在许多实际应用场景中,例如多轮对话、基于RAG的知识库问答、AI智能体(Agent)的自动化工作流等,大量的重复信息,如系统提示词、历史对话记录、固定的背景知识文档等,会被反复作为输入提交给大模型。通过缓存技术,模型无需对这些重复内容进行重复计算,从而节约算力。DeepSeek此次正是将这部分被缓存命中的输入内容的价格进行了“骨折式”下调。

根据官方公告,经过此轮调整,DeepSeek-V4-Flash模型的输入缓存命中价格降至每百万Tokens(词元)0.02元。而其性能更强的DeepSeek-V4-Pro模型,在叠加截至5月初的限时2.5折优惠后,输入缓存命中价格更是低至每百万Tokens 0.025元。这一价格水平,在全球范围内的高性能大模型中也极具竞争力,显著低于许多海外主流模型。

这一降价策略被普遍认为是DeepSeek在技术和战略上的双重体现。技术上,降价的底气来源于其新发布的DeepSeek-V4模型。该模型采用了创新的架构,如混合稀疏注意力机制,能够在保证性能的同时,大幅降低长上下文处理时的计算量和显存占用,从而有效压低了推理成本。更具战略意义的是,DeepSeek V4模型已全面适配华为昇腾等国产AI芯片,并实现了高效能的推理部署。通过软硬件协同优化,摆脱了对单一海外高端芯片的依赖,为成本控制和供应链安全提供了坚实基础。

此次降价对整个AI生态产生了深远影响。对于广大开发者和企业用户而言,这意味着AI应用的开发和运营成本被大幅拉低。以往因高昂的Token消耗而难以规模化的项目,如高频交互的智能客服、长文档分析、复杂的AI Agent应用等,如今变得在商业上更具可行性。这无疑将激发中小企业和个人开发者的创新热情,加速AI应用的落地和普及,推动AI从“聊天”走向更广泛的“干活”阶段。

在市场层面,DeepSeek此举在行业算力成本普遍上涨的背景下逆势而行,被视为打响了新一轮的“价格战”,给国内外其他大模型厂商带来了竞争压力。这一策略可能促使整个行业重新审视定价体系,推动大模型服务向更普惠、更低成本的方向发展。数据显示,降价消息发布后,DeepSeek模型的API调用量在短时间内出现了数倍的增长,印证了市场对低成本、高性能模型的旺盛需求。
DeepSeek的输入缓存降价并非一次简单的市场促销,而是基于其技术进步和国产算力适配的一次战略性举措。它不仅直接惠及了广大的AI应用开发者,降低了技术使用门槛,也预示着大模型行业的竞争正从单纯的性能比拼,转向更注重成本效率和应用落地的综合性竞争,有望引领AI进入一个成本更低、应用更繁荣的新阶段。