张大妈

迟来,26年2月开源模型汇总!DeepSeek虚晃一枪,国内大模型狂卷~

源自知乎:刘聪NLP

03-05 11:45

DeepSeek开源举动引爆了国内大模型领域的竞争,2026年2月因此成为了一个关键的爆发期。众多厂商纷纷亮出自家最新的开源成果,从多模态到万亿参数,技术竞赛全面升级。这份汇总不仅是对当时热潮的记录,也为观察AI技术前沿发展提供了有价值的视角。

迟来,26年2月开源模型汇总!DeepSeek虚晃一枪,国内大模型狂卷~智能速览

  • DeepSeek的开源策略引发了国内大模型的密集发布潮。

  • 字节跳动的Seedance2.0模型被认为是2月份的亮点。

  • 蚂蚁集团连发多款模型,推出了万亿参数的思考模型。

  • 模型架构创新不断,稀疏注意力和MoE架构被广泛应用。

  • 厂商开始探索垂直领域,出现了专门的OCR和科学推理模型。

  • 千问Qwen3.5系列迈向原生多模态,视觉理解能力增强。

迟来,26年2月开源模型汇总!DeepSeek虚晃一枪,国内大模型狂卷~精华内容

在这场由技术驱动的竞赛中,各大厂商不仅追求参数量的突破,更在模型架构和应用场景上展开了深度探索,推动着AI能力边界不断向外延伸。

巨头入局竞争升级

2月的开源浪潮中,巨头们的动向尤为引人注目。字节跳动的Seedance 2.0模型凭借其综合表现,被普遍认为是当月的炸裂之作,展现了其在不开源模型领域的深厚积累。

蚂蚁集团则采取了集群式发布策略,连续开源了包括Ring-2.5-1T在内的多个模型,其中Ring-2.5-1T是全球首个基于混合线性注意力架构的万亿参数思考模型,其29T Tokens的训练数据量和63B的激活参数,在复杂推理任务上展现出明显优势。

千问系列则通过Qwen3.5-397B-A17B原生多模态模型,标志着其技术路线向多模态融合的坚定转向,视觉理解能力得到大幅提升。

架构创新效率为王

为应对日益增长的模型规模和计算成本,新的模型架构层出不穷。阶跃开源的Step 3.5 Flash模型采用了浅层Dense与深层MoE混合的架构,通过196B总参数和11B激活参数的设计,旨在平衡特征提取效率与推理成本。

面壁智能的MiniCPM-SALA模型则提出了线性-稀疏注意力混合架构(SALA),为解决长序列处理难题提供了新思路。

蚂蚁集团的LLaDA2.1扩散大语言模型,通过引入可纠错编辑机制,将推理速度提升至892 TPS,展示了在推理效率优化上的卓越成果。

场景深化专业突破

除了追求通用性能,厂商们也开始在垂直领域进行深度挖掘。智谱AI开源了仅0.9B大小的GLM-OCR模型,正式进军OCR赛道,为特定文档处理任务提供了轻量高效的解决方案。

上海人工智能实验室开源的多模态科学推理模型Intern-S1-Pro,拥有1T参数量,在AI4Science领域表现优异,体现了AI在助力科学发现方面的巨大潜力。

高德地图开源的FantasyWorld世界模型,也预示着AI技术在地理信息、自动驾驶等特定场景的融合应用正在加速。

端侧多模态并进

在模型部署和交互方式上,2月的开源成果也呈现出多样化趋势。腾讯混元开源了HY-1.8B-2Bit端侧量化模型,使得大模型在边缘设备上的无压力部署成为可能,进一步拓展了AI的应用边界。

面壁智能的全双工全模态模型MiniCPM-o 4.5,打破了传统对话的轮次概念,使模型能够主动发起交流,为人机交互带来了新体验。

小红书开源的FireRed-Image-Edit-1.0模型,在图像编辑部分效果上直逼闭源模型,展现了开源社区在创意工具领域的强大竞争力。

2026年2月的开源模型热潮,清晰地勾勒出国内AI技术竞争的激烈图景。从巨头到新秀,各家在参数、架构和场景上全面发力,推动着技术快速迭代。未来,随着这些开源模型的沉淀与应用,它们将如何重塑现有的AI生态,值得整个行业持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章