DeepSeek正式推出了全新的 V4.1 Flash 模型。与以往简单增减参数规模的迭代不同,这次升级的核心在于底层架构的彻底重构。这款模型凭借全新的结构设计,不仅在推理速度和计算吞吐上实现了显著跃升,更在综合智能水平——特别是智能体(Agent)和编程场景中,展现出了超越自家上一代旗舰模型 V4 Pro 的表现。它的发布标志着大模型行业正从单纯拼杀参数规模,转向依靠架构创新追求极致性价比与实用落地。

在架构设计上,DeepSeek V4.1 Flash 采用了全新的因果编码器-解码器(CED)结构,模型主体包含5520亿参数,但在运行机制上做出了精妙的“非对称”设计。在智能体等实际应用场景中,大模型往往面临“读取上下文极长、生成回答较短”的负载特点。CED架构将40层神经网络拆分为前20层编码器与后20层解码器,在输入预填充阶段仅激活80亿参数,到了生成输出阶段才激活160亿参数。这种设计让模型在读取海量上下文时大幅减轻了计算负担,显著降低了服务器预填充开销。同时,它还外挂了1960亿参数的 Engram 条件记忆模块,并实现了原生多模态视觉理解,无需额外挂载视觉组件即可直接处理图文混合任务。
长期以来,超长上下文和多轮智能体任务最大的硬件瓶颈在于显存与存储的占用。V4.1 Flash 通过第二代压缩稀疏注意力机制(CSA2)、FP4低精度量化以及滑动窗口有限回放等技术,对键值缓存(KV Cache)进行了深度压缩。相较于初代模型,其单 Token 全局缓存体积缩减了437倍;与上一代相比,对高带宽内存(HBM)的需求缩减至四分之一,对固态硬盘(SSD)的存储需求更是降至八分之一。这种存储维度的优化,直接降低了百万 Token 级超长上下文在工业级生产中的部署门槛与硬件成本。
架构的重构带来了直观的性能与体验提升。在实际运行中,V4.1 Flash 的生成速度普遍可达每秒300至400个 Token,首字响应时间显著缩短。在衡量代码智能体和工程自动化任务解决能力的测试集(如 DeepSWE v1.1、Terminal-Bench 和 CyberGym)中,它展现出了极强的实际问题解决能力,部分跑分甚至赶超了行业内的顶尖闭源模型。不过客观来看,在 GPQA Diamond 等侧重高阶科学推理的学术测试中,它与国际顶尖的旗舰闭源模型相比仍存有一定差距,其优势主要集中于高频的编程、智能体以及工程落地场景。
随着底层算力与存储开销的大幅削减,DeepSeek 也随之调整了商业策略与计费方案。API 调用价格整体下调,并继续采用峰谷分时计费机制,空闲时段缓存命中输入单价降至每百万 Token 0.02元。由于 V4.1 Flash 在综合表现与性价比上已具备明显优势,DeepSeek 计划逐步下线 V4 Pro 模型,并将相关 API 请求路由至 V4.1 Flash 处理,按新单价计费。在面向普通用户的客户端,原有快速、专家、识图等多个对话模式也完成合并,统一由该模型提供支持。同时,新模型与自研智能体框架 DeepSeek Harness 进行了深度适配,并同步开源了模型权重,全量接入了合作方的开发者工具生态。

DeepSeek V4.1 Flash 的发布为大模型技术路线提供了一个极具参考价值的范式转换。它证明了通过巧妙的非对称网络设计、极致的存储压缩以及软硬件协同优化,轻量化激活的模型同样可以在复杂应用场景中实现越级表现。这种“高智能、高速度、平民价”的组合,不仅重塑了自身的产品矩阵,也极大地推动了长上下文智能体应用在商业化场景中的落地步伐。