2026年9月9日,DeepSeek开放平台发布重要公告宣布,在V4.1 Flash正式上线后至V4.1 Pro发布前,所有发往V4 Pro模型的API请求都将统一自动路由至新的V4.1 Flash,并直接按照V4.1 Flash更低廉的单价进行计费。由轻量级的Flash模型直接接管上一代旗舰Pro模型的全部流量,在大模型行业中引发了开发者与从业者的广泛关注与讨论。
官方做出这一决定的核心原因在于,经过内部与外部的多方测试,V4.1 Flash在综合性能、生成速度、总响应时间以及计算费用等核心指标上,已经全面超越了先前的V4 Pro模型。从技术层面来看,V4.1 Flash并非简单的参数微调,而是采用了全新的模型架构,并实现了原生多模态支持,能够直接处理图文混合输入。在生成速度方面,V4.1 Flash的实测输出速度达到了每秒300至400个Token,相较于此前V4 Pro每秒数十Token的响应表现有了数倍的提升。与此同时,DeepSeek还同步大幅下调了Flash系列的计费单价,使用户能够以更低的成本获得更高的推理效率。

这一决定也让上一代旗舰模型V4 Pro的处境显得有些尴尬。V4 Pro正式版于2026年8月13日推出,到9月9日被V4.1 Flash全面接管,其作为主力的时间不足一个月。回顾V4 Pro的上线历程,该模型在发布初期曾因特定框架下的泛化能力、对特定接口的依赖以及高峰期调价等问题引发过不少讨论。而此次新一代Flash模型在能力上的跨越,直接压缩了旧旗舰的生存空间,也反映出大模型技术迭代周期已缩短至以周为单位,模型研发的竞争节奏异常激烈的现状。
对于广大开发者和企业用户而言,官方统一路由的操作带来了不同的反响。积极的一面在于,大部分业务场景能够“无感”地享受到更快的响应速度、更强的多模态能力以及更低的账单成本,无需手动修改代码逻辑或重新适配API。但从产品体验与工程稳定的角度来看,这种直接接管流量的做法也引发了部分开发者的担忧。不同模型在推理习惯、代码生成风格以及特定任务的逻辑分支上存在差异,对于已经针对V4 Pro调校好稳定工作流和Prompt的项目来说,没有设置较长的并行过渡期可能会对现有业务的稳定性带来不确定性。

从技术战略和资源分配的角度分析,DeepSeek此举体现了极具针对性的算力调度逻辑。直接将原本支撑V4 Pro的服务算力释放出来,能够有效地将集群资源集中用于下一代V4.1 Pro的训练与研发。将已经在V4.1 Flash上验证成功的新型架构经验与原生多模态能力,进一步迁移并扩展到更大参数量的Pro模型上,才是后续技术突破的关键。这次统一路由不仅是DeepSeek对产品线的一次快速迭代,也向行业展示了在大模型演进过程中,性能与性价比对产品形态的重化与塑造。