张大妈

1T MoE科学多模态大模型Intern-S1-Pro开源!

源自小红薯:书生大模型

02-07 11:51

上海人工智能实验室开源的Intern-S1-Pro模型,凭借1T参数的混合专家架构,在科学推理领域实现了显著突破。它不仅能处理高难度综合学科问题,其数理逻辑推理能力更可媲美奥赛金牌水平,为科研智能化带来了新的可能性。

1T MoE科学多模态大模型Intern-S1-Pro开源!智能速览

  • Intern-S1-Pro为1T参数的混合专家(MoE)模型。

  • 模型在综合学科评测中达到国际领先水平。

  • 其数理逻辑推理能力已达到奥赛金牌水平。

  • 底层架构通过傅里叶编码赋予模型“物理直觉”。

  • 高效路由机制攻克了万亿参数模型的训练瓶颈。

1T MoE科学多模态大模型Intern-S1-Pro开源!精华内容

Intern-S1-Pro的突破不仅在于其万亿参数的庞大规模,更在于其架构设计如何将这种规模转化为真实世界的科学问题解决能力。

核心架构

Intern-S1-Pro采用了混合专家(MoE)架构,总参数量高达1万亿(1T)。该模型共包含512个专家,但在每次推理调用时仅激活其中的8个专家,激活参数量约为22B。这种设计在保持模型能力的同时,极大地降低了推理计算成本。

目前该模型已在HuggingFace及魔搭ModelScope社区开源,方便开发者使用和研究。

科学能力

模型的核心优势体现在科学领域的处理能力上。在高难度综合学科评测中,其表现稳居AI for Science(AI4S)领域的国际领先水平。

特别值得一提的是,其复杂数理逻辑推理能力已经达到了国际奥赛金牌选手的水平,这表明其在解决尖端科学难题上具有巨大潜力。

底层创新

模型的底层架构实现了两大关键突破。首先,在SAGE基础模型层中,引入了傅里叶位置编码并重构了时序编码器,旨在赋予模型统一理解从微观到宏观物理现象的“物理直觉”。

其次,研发团队设计了一套高效路由机制,成功攻克了训练万亿参数MoE模型时面临的稳定性与算力效率瓶颈,为未来超大规模模型的训练铺平了道路。

Intern-S1-Pro的开源,为科研社区提供了一个强大的基础模型,有望加速科学发现的进程。它展示了通用能力与科学能力协同演进的可能性,未来能否在更多科研场景中落地应用,值得持续关注。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章