DeepSeek在开源代码中意外曝光了新模型标识符“MODEL1”,此举引发业界对其下一代模型V4的广泛猜测。这不仅是一次简单的代码更新,更可能预示着新一轮技术竞赛的开启,其背后的技术布局和资金实力同样值得关注。
智能速览
DeepSeek在开源代码中提及新模型“MODEL1”。
“MODEL1”被猜测是DeepSeek即将发布的下一代模型V4或R2。
市场传闻V4模型的编程能力将超越GPT和Claude。
DeepSeek近期发布了两篇关于新训练方法和AI记忆模块的论文。
创始人梁文锋旗下的幻方量化为其研发提供了强大的资金支持。
精华内容
此次“MODEL1”的现身并非孤立事件,而是DeepSeek近期一系列密集动作中的一个缩影。从代码库更新到前沿论文发布,每一个信号都指向其在AI领域的持续深耕和未来布局。
新模型踪迹
在DeepSeek-R1模型发布一周年之际,DeepSeek官方于GitHub更新了FlashMLA代码库。在更新的114个文件中,数十处出现了此前未公开的“MODEL1”标识符。值得注意的是,该标识符在某些文件中与已知模型“V32”(即DeepSeek-V3.2)并列提及。这一发现引发行业高度关注,普遍认为“MODEL1”可能代表着一种新架构,正是DeepSeek未对外发布的下一代模型,可能是R2系列或V4系列。
技术前沿布局
除了新模型线索,DeepSeek在2025年1月动作频频,连续发布两篇重磅技术论文。其中一篇与北京大学合作,由梁文锋署名,提出了受生物学启发的“AI记忆模块”。该研究旨在解决Transformer架构缺乏原生知识查找机制的痛点,通过名为Engram的条件记忆模块,不仅优化了知识检索效率,还在一般推理和代码、数学等领域能力上取得了显著进步。另一篇论文则介绍了一种名为“优化残差连接”的新训练方法。
V4模型预期
市场早有传闻称,DeepSeek计划在2025年2月春节前后发布新一代AI模型DeepSeek V4。作为2024年12月发布的V3模型的迭代版,V4的核心亮点被普遍认为是其强大的编程能力。据DeepSeek内部初步测试数据显示,V4在编程基准上的表现超过了当前市场上的顶级模型,包括Anthropic的Claude和OpenAI的GPT系列。虽然最终发布时间可能视情况调整,但这无疑为行业注入了新的期待。
幕后资金支持
DeepSeek持续的研发投入离不开其雄厚的资金支持。创始人梁文锋旗下的私募机构幻方量化业绩表现突出。公开数据显示,幻方量化在2025年的收益均值高达56.55%,在中国管理规模超百亿的量化私募中排名第二,管理总规模已超700亿元。强大的盈利能力为DeepSeek在前沿AI技术的探索和人才吸引方面提供了坚实后盾。
从“MODEL1”的悄然现身到前沿论文的接连发布,DeepSeek正以清晰的技术路径和充足的资源储备,为下一阶段的AI竞争积蓄力量。这不仅预示着V4模型可能带来的技术突破,也为整个大模型领域的发展带来了新的想象空间。