传统4D建模依赖昂贵多视角设备,限制了其应用。NeoVerse提出新范式,仅需手机拍摄的单目视频,就能快速构建高精度、可自由漫游的4D动态场景。它在提升效率的同时,为数字内容创作与自动驾驶等领域带来新的可能性,显著降低了4D世界的构建门槛。

智能速览
解决了传统4D建模依赖昂贵多视角数据或繁琐预处理的痛点
采用双向运动建模和在线退化模拟,提升重建和生成质量
推理速度实现数量级飞跃,生成81帧视频最快约20秒
在多个评测维度上超越现有先进方法,生成视频更真实
可衍生出3D跟踪、视频编辑、超级防抖等多种下游应用
精华内容
NeoVerse的成功并非偶然,其背后是一套精巧的框架设计。它如何仅凭单目视频就实现如此高质量的4D重建与生成?其核心在于创新的“三板斧”。
重建提速的关键
NeoVerse首先对VGGT模型进行了改进,实现了从单目视频到4D高斯点云的前馈式快速重建。其核心创新在于引入双向运动建模,不仅预测高斯点到下一帧的运动,还预测到上一帧的运动。
这种设计让模型能更精确地理解瞬时运动,使得在时间维度上平滑插值高斯点位置变得高效自然,为生成慢动作或任意时间点的画面奠定了基础。每个高斯点都携带了双向线速度、角速度及生命周期参数,共同构建出一个动态的4D世界。在动态场景重建对比中,NeoVerse的结果更清晰,伪影显著减少。
智能模拟训练数据
最大的挑战在于如何用单目视频训练生成模型。NeoVerse通过在线退化模拟巧妙解决了这一难题。它设计了几种模拟真实世界中渲染缺陷的方法:一是基于可见性的高斯剔除,模拟新视角下的遮挡,生成带有“空洞”的退化图;二是平均几何滤波器,模拟深度估计在物体边缘的模糊倾向,生成边缘扭曲的退化图。
这些模拟出的“低质量渲染图-高质量原图”训练对,让生成模型学会了抑制伪影,并根据不完整的几何信息幻想出合理的细节,这是其生成质量高的关键。

生成效果与速度
在实验结果上,NeoVerse展现了卓越的性能。在VBench评测中,其在主观一致性、背景一致性、时间闪烁、运动平滑度及美学质量等多个维度上,均优于TrajectoryCrafter等先进方法。
更惊人的是推理速度,得益于稀疏关键帧重建和高效的条件注入,生成一段81帧的视频端到端最快仅需约20秒(重建2秒+生成18秒),相比之前动辄几分钟的方法,实现了数量级的飞跃。在具有大相机运动的“野外”视频中,NeoVerse也能保持精准的相机控制和高质量的生成效果。
总而言之,NeoVerse通过一套可扩展至海量单目视频的创新流程,为4D世界建模树立了新标杆。它不仅在技术上实现了突破,更显著降低了高质量4D内容的创作门槛,催生了丰富的下游应用。未来,当每个人都能用手机轻松创造可探索的虚拟空间时,我们的生活将发生怎样的改变?