近日,DeepSeek公司发布了其v3.2系列的两个新模型:DeepSeek-V3.2和DeepSeek-V3.2-Speciale,引发了业界的广泛关注。此次更新不仅带来了模型性能的显著提升,更在底层技术架构和应用能力上实现了重要突破。
本次更新推出了两个定位不同的模型。DeepSeek-V3.2作为标准版,旨在平衡推理能力与运行效率,适合问答、通用智能体(Agent)任务等日常应用场景。据官方介绍,其在公开推理基准测试中的表现已达到一个非常高的水平,同时相比部分同类模型,V3.2的输出长度大幅降低,减少了用户的等待时间和计算开销。而DeepSeek-V3.2-Speciale则是一个“特长版”,作为长思考增强版本,专攻高难度任务。它结合了DeepSeek-Math-V2的定理证明能力,在数学证明、复杂逻辑验证和编程竞赛等领域表现突出,甚至在多项国际竞赛的模拟测试中斩获金牌。不过,Speciale版本在处理复杂任务时消耗的Tokens更多,成本也更高,目前主要以临时API形式开放给社区进行评测和研究,且暂不支持工具调用。
此次更新最大的技术亮点之一,是正式应用了自研的DeepSeek稀疏注意力机制(DeepSeek Sparse Attention, DSA)。传统注意力机制在处理长文本时,计算复杂度会随文本长度呈平方级增长,导致成本高、效率低。DSA通过引入细粒度的稀疏注意力,有效解决了这一瓶颈,可以将计算复杂度显著降低。这项技术在实验性版本中得到了验证,它能在几乎不影响模型性能的前提下,大幅提升长文本的训练和推理效率。这一架构层面的优化,直接促成了官方API价格超过50%的大幅下调,让大模型在长文本场景下的规模化应用变得更具可行性。

在模型能力方面,最核心的突破是实现了“思考融入工具调用”。以往的模型在思考和行动(调用工具)之间往往是割裂的,通常是先完成一系列思考规划,再执行工具调用。而DeepSeek-V3.2则实现了“边想边用”,模型可以在推理过程中动态调用工具(如搜索引擎、代码解释器),获取外部信息后继续思考和规划。这种模式更接近人类解决复杂问题的思维闭环,极大地增强了模型的Agent能力。为了实现这一能力,DeepSeek设计了一套大规模Agent训练数据合成方法,构造了超过1800个环境和85000多条复杂指令的强化学习任务,有效提升了模型在真实应用场景中的泛化能力。
此外,DeepSeek在后训练阶段的投入也值得关注。技术报告显示,其在强化学习(RL)上的计算投入超过了预训练成本的10%,这在开源模型中较为罕见。通过对GRPO(Group Relative Policy Optimization)等算法的改进,模型的高级推理能力得到了充分释放。
在开放生态方面,DeepSeek不仅开源了模型权重,还开源了研发过程中设计的GPU算子,包括TileLang和CUDA两种版本,并建议社区使用更易于调试的TileLang版本进行研究。同时,新模型也快速获得了华为昇腾、寒武纪等国产算力平台的支持与适配。
尽管取得了显著进展,DeepSeek也在技术报告中坦诚地指出了当前模型的局限性,例如由于总训练计算量相对较少,世界知识的广度仍有待提升;同时,模型的“Token效率”仍有优化空间,有时需要更长的思考链才能达到顶级闭源模型的效果。这些都将是其未来迭代的方向。