当前视频生成模型虽能产出精美画面,却普遍缺乏三维几何理解,限制了其在具身智能等领域的应用。One4D框架的出现打破了这一局限,它用一个模型即可同步生成动态视频与精准几何信息,真正统一了4D世界的生成与重建任务,为构建下一代世界模型提供了实用基础能力。
智能速览
One4D是一个统一的4D生成与重建框架。
模型能同步输出RGB视频与Pointmap几何视频。
DLC技术解决了多模态训练中的跨模态干扰问题。
UMC技术让单一模型支持多种输入与任务形态。
在单图生4D和视频重建任务上,One4D效果显著优于基线模型。
精华内容
One4D的核心创新在于其算法设计,它如何在一个模型内优雅地处理生成与重建任务,并同时保证多模态输出的质量与对齐?关键在于两项核心技术。
同步多模态输出
One4D的创新之处在于其将动态4D场景表示为两种同步输出的模态:外观(RGB frames)和几何。几何信息以Pointmaps(XYZ)形式呈现,这是一种与RGB视频帧对齐的3通道几何视频,每个像素存储着XYZ坐标。这种几何视频可进一步导出深度图,并结合后处理技术估计相机轨迹,最终可视化为带有相机位姿的4D点云序列,为后续的3D应用提供了完整的数据基础。
解耦LoRA控制
在多模态联合建模中,直接拼接不同模态的数据流易引发严重的跨模态干扰,尤其在低资源微调时,会拖累底座模型的RGB生成质量。为解决此问题,One4D提出了解耦LoRA控制(DLC)。该技术为RGB和Pointmap分别挂载专属的LoRA,形成两条解耦的计算分支,确保它们能相对独立地学习。同时,通过少量零初始化的“控制连接”在对应层间建立通信,让两个模态从零开始逐步学会互相控制,从而实现精确的像素级对齐。
统一掩码条件
为了用同一个模型支持单图生成、稀疏帧补全与完整视频重建等多种任务,One4D设计了统一掩码条件(UMC)。该方法将不同类型的输入统一打包成一个条件视频,缺失的帧用0填充,并配合一个掩码张量来明确指定哪些帧需要模型生成。通过这种方式,模型无需改变结构,仅需根据输入帧的稀疏程度,即可在不同任务间平滑切换,大大提升了模型的通用性和实用性。
实验效果验证
实验结果表明,One4D的性能表现突出。在单图到4D生成任务中,其用户偏好度在一致性、动态性、美学等维度上全面超越4DNeX模型,VBench的动态性分数更是从25.6大幅提升至55.7。在视频重建任务上,One4D在Sintel等标准数据集上的表现优于MonST3R等专业重建方法,并接近专用重建模型Geo4D的水平,证明了其统一框架的有效性。
One4D的突破在于它让视频扩散模型从“能看”走向了“能用”,生成的4D世界具备了可交互的几何基础。它统一了生成与重建的范式,为具身智能、数字孪生等前沿领域铺平了道路。这会是通向真正世界模型的关键一步吗?