DeepSeek V4的灰度更新并非简单迭代,而是通过架构创新实现了成本与性能的双重突破。其在长上下文处理、中文理解及编程专项上的优势,为行业提供了新的技术参照,尤其在高性价比推理场景下展现出独特价值。
智能速览
上下文窗口从128K扩展至1M Token,成本仅为竞品十分之一。
知识截止日期更新至2025年5月,静态知识时效性领先。
通过Engram系统实现记忆与计算解耦,显著降低推理成本。
编程与中文理解能力增强,在特定基准测试中表现突出。
对话风格调整,人格化倾向更自然,情感互动更丰富。
精华内容
本次更新的核心在于系统架构的底层重塑,它并非简单堆砌算力,而是通过技术创新解决了长上下文与高昂推理成本的行业痛点。
百万级上下文
上下文窗口从128K扩展至1M Token是本次最直观的提升,实测可一次性完整处理《三体》三部曲约90万字的内容。这一突破得益于DSA稀疏注意力机制,它动态屏蔽非关键计算,将长序列处理复杂度从O(n²)降至近似线性。
成本优势更为显著,处理百万Token输入的成本降至0.003美元,仅为GPT-4o的一半,更是Gemini 1.5 Pro长上下文模式的十分之一。这种价格差异并非补贴,而是源于架构对HBM带宽消耗的根本性优化。
架构级降本
成本优化的背后是mHC与Engram两大架构革新。mHC通过层级压缩减少深层网络中的冗余计算,在复杂推理任务中将首Token延迟降低了约23%。
更关键的是Engram记忆系统,它将高频复用的静态知识(如API签名、历史事件)从昂贵的HBM迁移至成本更低的DRAM存储。这如同将烹饪所需食材预先备好,极大降低了推理过程中的资源消耗,使得单位Token的边际成本随并发量增加而持续下降。
专项能力跃升
架构升级直接反映在专项任务表现上。在编程基准测试HumanEval中,得分提升至约90%,超越GPT-5.2和Claude 4.5,主要归功于Engram对高频编程知识的快速复用。
中文理解能力同样强化,在SuperGLUE中文子集得分91.3%。与GPT依赖中间翻译层不同,DeepSeek的原生中文训练语料避免了信息损失,在金融合规、法律审查等垂直场景的实测中,准确率显著高于竞品。
人格化探索
对话风格的调整是另一大变化。DeepSeek在RLHF阶段提升了共情权重,使其在多轮对话中表现出主动关怀和情绪确认的倾向。
与GPT的“高效冷漠”和Gemini的“情绪波动”不同,用户普遍反馈DeepSeek V4“热情但不越界”。这种人格化能力的提升,源于模型层面的显式权重调整,而非仅仅依赖表层提示词修饰,为用户提供了更自然的交互体验。
DeepSeek V4通过稀疏注意力和记忆解耦等架构创新,在长上下文成本、编程及中文领域建立了局部领先优势。它并非全能型选手,在多模态和英文复杂推理上尚有短板,但其工程化路径为行业指明了另辟蹊径实现高性价比AI服务的可能性,未来值得持续关注。