张大妈

DeepSeek新模型曝光?

源自公众号:上海证券报

01-22 10:34

DeepSeek开源代码中意外曝光了新模型标识符“MODEL1”,此举引发业界对其下一代模型V4的广泛猜测。这不仅是一次简单的代码更新,更可能预示着新一轮技术竞赛的开启,其背后的技术布局和资金实力同样值得关注。

DeepSeek新模型曝光?智能速览

  • DeepSeek在开源代码中提及新模型“MODEL1”。

  • “MODEL1”被猜测是DeepSeek即将发布的下一代模型V4或R2。

  • 市场传闻V4模型的编程能力将超越GPT和Claude。

  • DeepSeek近期发布了两篇关于新训练方法和AI记忆模块的论文。

  • 创始人梁文锋旗下的幻方量化为其研发提供了强大的资金支持。

DeepSeek新模型曝光?精华内容

此次“MODEL1”的现身并非孤立事件,而是DeepSeek近期一系列密集动作中的一个缩影。从代码库更新到前沿论文发布,每一个信号都指向其在AI领域的持续深耕和未来布局。

新模型踪迹

在DeepSeek-R1模型发布一周年之际,DeepSeek官方于GitHub更新了FlashMLA代码库。在更新的114个文件中,数十处出现了此前未公开的“MODEL1”标识符。值得注意的是,该标识符在某些文件中与已知模型“V32”(即DeepSeek-V3.2)并列提及。这一发现引发行业高度关注,普遍认为“MODEL1”可能代表着一种新架构,正是DeepSeek未对外发布的下一代模型,可能是R2系列或V4系列。

技术前沿布局

除了新模型线索,DeepSeek在2025年1月动作频频,连续发布两篇重磅技术论文。其中一篇与北京大学合作,由梁文锋署名,提出了受生物学启发的“AI记忆模块”。该研究旨在解决Transformer架构缺乏原生知识查找机制的痛点,通过名为Engram的条件记忆模块,不仅优化了知识检索效率,还在一般推理和代码、数学等领域能力上取得了显著进步。另一篇论文则介绍了一种名为“优化残差连接”的新训练方法。

V4模型预期

市场早有传闻称,DeepSeek计划在2025年2月春节前后发布新一代AI模型DeepSeek V4。作为2024年12月发布的V3模型的迭代版,V4的核心亮点被普遍认为是其强大的编程能力。据DeepSeek内部初步测试数据显示,V4在编程基准上的表现超过了当前市场上的顶级模型,包括Anthropic的Claude和OpenAI的GPT系列。虽然最终发布时间可能视情况调整,但这无疑为行业注入了新的期待。

幕后资金支持

DeepSeek持续的研发投入离不开其雄厚的资金支持。创始人梁文锋旗下的私募机构幻方量化业绩表现突出。公开数据显示,幻方量化在2025年的收益均值高达56.55%,在中国管理规模超百亿的量化私募中排名第二,管理总规模已超700亿元。强大的盈利能力为DeepSeek在前沿AI技术的探索和人才吸引方面提供了坚实后盾。

从“MODEL1”的悄然现身到前沿论文的接连发布,DeepSeek正以清晰的技术路径和充足的资源储备,为下一阶段的AI竞争积蓄力量。这不仅预示着V4模型可能带来的技术突破,也为整个大模型领域的发展带来了新的想象空间。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章