张大妈

全国首次!Nature发表!海淀新型研发机构智源研究院,发布大模型成果——

源自公众号:北京海淀

02-01 18:23

海淀区智源研究院的一项大模型成果登上国际顶级期刊《Nature》正刊,这是全国首次。其核心突破在于,仅凭“预测下一个词元”这一自回归技术,便实现了对文本、图像、视频的统一学习与处理,为构建更通用、可扩展的多模态智能系统提供了全新的技术范式。

全国首次!Nature发表!海淀新型研发机构智源研究院,发布大模型成果——智能速览

  • 智源Emu3成为首个登上《Nature》正刊的中国主导大模型成果。

  • 仅凭“预测下一个词元”技术,统一了文本、图像和视频的理解与生成。

  • 在文生图、视觉理解等任务上,性能媲美专业路线的扩散模型与组合方案。

  • 实现了纯自回归视频生成,并拓展至机器人操作与图文交错生成。

  • 该研究为构建可扩展的通用多模态智能系统开辟了新道路。

全国首次!Nature发表!海淀新型研发机构智源研究院,发布大模型成果——精华内容

Emu3的突破在于,它验证了一条通往通用人工智能的更简洁路径:自回归方法不仅能驾驭语言,也能统一处理图像与视频,这或将重塑多模态AI的技术版图。

统一的技术路径

传统上,语言模型采用预测下一个词元的自回归路线,而图像与视频生成则多依赖扩散模型等复杂技术。这种技术路线的割裂增加了多模态系统的复杂性。Emu3则另辟蹊径,将图像、文本和视频全部离散化为统一的词元序列,在一个单一的Transformer架构上进行联合训练。这种方法证明了仅靠自回归技术,就能统一处理多种模态,大大简化了模型架构。

性能比肩专业模型

Emu3在多项基准测试中展现了卓越性能。在文生图任务上,其生成效果达到了主流扩散模型的水平;在视觉语言理解方面,其能力可与结合CLIP和大语言模型的主流方案相媲美。视频生成是其另一大亮点,不同于Sora的扩散式方法,Emu3采用纯自回归方式逐词元生成视频,能够进行视频延展与未来预测,并生成高保真度的视频内容。

超越感知的生成力

Emu3的通用性不止于此,它还能拓展至更复杂的任务。例如,进行视觉语言交错生成,创建图文并茂的菜谱;或应用于视觉-语言-动作建模,控制机器人完成操作,展现了其在具身智能领域的潜力。其升级版悟界·Emu3.5更致力于从长视频中学习物理世界的演化规律,实现了从“预测下一个词元”到“预测下一个状态”的范式升级,向世界模型迈进。

一条原创之路

这一成果并非一蹴而就,而是智源研究院长期坚持原始创新的结果。自2022年启动多模态模型研发以来,Emu系列持续迭代:从2023年开源的Emu,到同年发布的Emu2,再到2024年的Emu3,每一代都在核心能力上实现实质性突破。此次登顶《Nature》,不仅是对智源团队的认可,更是对其坚持探索前沿、挑战关键难题的原创精神的肯定。

智源Emu3的研究意义深远,它不仅是一个性能卓越的模型,更是一条被验证的、通往通用多模态智能的更简洁技术路径。这项成果确立了自回归技术在生成式AI中的核心地位,为人工智能从数字世界迈向物理世界构建了关键的技术基座,未来可期。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐