根据知情人士及多家媒体透露,由创始人梁文锋领导的深度求索(DeepSeek)公司,计划于4月下旬正式发布其新一代旗舰大模型——DeepSeek V4。这一消息在人工智能领域引发了广泛关注。
在正式发布前,DeepSeek的网页端已悄然进行了一些更新,被外界普遍视为V4能力的预演。用户发现,产品界面新增了“快速模式”与“专家模式”的分层设计。“快速模式”旨在提供即时响应,适合日常对话与简单查询;而“专家模式”则针对更复杂的逻辑推理和深度思考任务,官方回应也证实,“专家模式”正是V4版本更新的核心功能之一。此外,部分测试界面中还出现了“视觉模式”的选项,暗示新模型将具备原生的多模态处理能力,可以直接理解和分析图像内容。
综合各方信息,DeepSeek V4在技术层面有几个备受瞩目的潜在亮点。在模型规模上,据称V4将采用万亿级别的MoE(混合专家)架构。这种架构的特点是在保持模型庞大参数量的同时,于实际推理时仅激活一部分“专家”参数,从而在保证高性能的同时,大幅提升了计算效率和响应速度,并降低能耗。
V4预计将支持百万级别的超长上下文窗口。这意味着模型可以一次性处理和“记忆”相当于一整本书籍的信息量,这对于分析长篇报告、完整代码库或进行需要长期记忆的复杂对话等场景具有重要意义。为了解决长上下文中的“遗忘”问题,有技术论文和分析指出,DeepSeek可能采用了名为“Engram”(条件记忆)的新机制,通过将知识存储与动态推理分离,实现更高效、更准确的长文本信息检索。
更具战略意义的一点是,DeepSeek V4被报道首次实现了与华为昇腾等国产AI芯片的深度适配。这意味着该模型从训练到推理的全链路,可以在国产算力平台上高效运行,标志着中国AI产业在减少对海外硬件(如英伟达GPU及CUDA生态)依赖的道路上迈出了关键一步。据报道,为迎接V4的发布,国内多家科技巨头已开始预订新一代国产AI芯片,计划将其集成到自家的云服务和AI产品中。
在商业策略上,DeepSeek V4预计将延续其高性价比和开放的路线。有消息称,模型将以Apache 2.0开源协议发布,允许企业和开发者自由进行商业化部署。相较于国际上主流的闭源大模型,其API调用成本预计将保持极具竞争力的水平。
此次DeepSeek V4的发布,恰逢其主要竞争对手OpenAI也传出将有新模型发布的消息。因此,V4不仅被看作是一次技术上的重大迭代,更被视为代表了AI发展的一种新路径:即在追求顶尖性能的同时,通过架构创新和与国产硬件生态的结合,探索一条兼具成本效益与供应链自主可控的发展道路。届时,V4的实际表现及其对整个AI行业格局的影响,值得市场拭目以待。