张大妈

Neoverse:用单目视频也能训练4D世界模型

源自小红薯:Casper

01-22 20:19

4D世界模型的训练一直受困于高昂的数据采集成本。NeoVerse的出现打破了这一瓶颈,它创新性地利用互联网上海量的单目视频进行训练,无需复杂的相机位姿,极大地降低了4D内容生成的门槛,为通过海量数据驱动模型能力跃升提供了全新可能。

Neoverse:用单目视频也能训练4D世界模型智能速览

  • 数据采集的“贵族游戏”曾是4D模型发展的最大瓶颈。

  • NeoVerse可直接从单目视频重建动态4D场景,无需相机位姿。

  • 在线退化模拟技术让模型学会自我修正,生成高质量新视角。

  • 双向运动编码确保动态物体的时空变化捕捉更稳定细腻。

  • 该技术推动了4D世界模型从实验室走向互联网数据驱动的范式转移。

Neoverse:用单目视频也能训练4D世界模型精华内容

面对4D数据匮乏的困境,NeoVerse如何另辟蹊径,用最常见的单目视频撬动整个世界模型的研究范式?其核心技术路径揭示了一种新的可能性。

4D数据之困

传统的4D数据采集堪称“贵族游戏”,需要依赖昂贵且复杂的多相机系统,并对场景有静态要求。这种高门槛导致数据量难以规模化,极大地限制了4D世界模型的发展,使其无法像大型语言模型那样通过海量数据的投喂实现能力的涌现。数据,而非算力,成为了制约进步的关键。

无姿态重建

NeoVerse的核心突破在于实现了Pose-Free(无姿态)的4D生成。借助VGGT技术,它可以直接从互联网上随手可得的普通单目视频中重建出动态的4D高斯场。这意味着整个过程不再需要复杂的离线预处理来计算相机位姿,不仅训练速度大幅提升,也意味着海量的、结构杂乱的网络视频都能成为有效的训练数据。

自我修正机制

如何仅凭单视角就生成高质量的多视角视频?NeoVerse引入了“在线单目退化模拟”机制。在训练过程中,模型会主动模拟因视角变化可能产生的画面模糊与伪影,并学习如何修正这些缺陷。这种“脑补”式的训练,倒逼模型掌握了从有限视角推断完整场景的能力,从而生成清晰、稳定的新视角画面。

时空动态稳定

为了让场景中的动态物体在运动中不出现撕裂或形变,NeoVerse采用了双向运动编码。该技术将前向与后向的特征进行融合,让模型在分析当前帧时能同时参考过去和未来的运动信息。这确保了模型对物体时空变化的捕捉更为精细和连贯,生成的动态效果既真实又稳定。

NeoVerse的意义远不止于一个新模型,它预示着4D世界模型研究范式的转移。通过解锁互联网上无穷尽的视频数据,通往更强大、更通用世界模型的道路已被铺开,未来的数字世界或许就蕴藏在海量的视频之中。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章