DeepSeek 发布了 V3.2-Exp 模型,引入了自研的稀疏注意力机制 DSA,在保持模型性能的同时,显著提升了长文本处理效率并降低了成本。此次更新不仅是技术上的探索,更伴随着 API 价格超过 50% 的大幅下调,对开发者和行业应用者来说,这是一个值得关注的高性价比选择。
智能速览
DeepSeek-V3.2-Exp模型发布,引入自研DSA稀疏注意力机制。
新机制在不影响质量的前提下,显著提升长文本推理效率。
官方API调用价格大幅下调超过50%,新价格立即生效。
模型已在Huggingface和ModelScope平台全面开源。
临时保留V3.1-Terminus接口,方便开发者对比测试。
精华内容
DeepSeek V3.2-Exp 的发布,不仅仅是一次常规的模型迭代。它通过引入稀疏注意力机制,探索了长文本处理的新路径,并用大幅降价策略验证了其成本优势。
核心技术探索
DeepSeek-V3.2-Exp 的核心在于其自主研发的 DeepSeek Sparse Attention (DSA) 稀疏注意力机制。该机制旨在解决长文本处理中的计算瓶颈,通过减少不必要的计算量,来提升训练和推理效率。
官方强调,V3.2-Exp 是迈向新一代架构的关键中间步骤。为了科学评估 DSA 的效果,其训练配置与上一代 V3.1-Terminus 模型严格保持一致,确保了对比的有效性。
性能与效率
在各项公开评测集上,DeepSeek-V3.2-Exp 的表现与 V3.1-Terminus 基本相当,证明了引入稀疏注意力机制后,模型质量并未受到影响。
这一结论至关重要,因为它意味着 DSA 在几乎不牺牲模型能力的前提下,成功实现了效率的优化。这种“降本不降效”的特性,使其在实际应用中具备了极高的潜在价值。
成本与价格
效率的提升直接转化为服务成本的下降。DeepSeek 宣布官方 API 价格大幅下调,降幅超过 50%,并且新价格已立即生效。这一举措显著降低了开发者使用先进大模型的门槛。
目前,官方的 App、网页端和小程序均已更新至 V3.2-Exp 版本,用户可以立即体验到新模型带来的变化。
开发者支持
为了鼓励社区研究和快速迭代,DeepSeek 采取了多项开发者友好的举措。首先,模型已在 Huggingface 和 ModelScope 平台全面开源,相关论文也已同步公开。
其次,官方临时保留了 V3.1-Terminus 版本的 API 接口,且调用价格与新模型相同,方便开发者进行直观的对比测试,该接口将保留至 2025 年 10 月 15 日。此外,研究中设计的 GPU 算子也已开源。
DeepSeek V3.2-Exp 的发布,是一次将前沿技术探索与实际商业策略紧密结合的范例。它不仅为长文本应用提供了更高效的解决方案,也通过激进的降价策略推动了行业普惠。未来,稀疏注意力能否成为大模型架构的主流方向,值得持续关注。