META的SAM3D技术仅需单张图像和遮罩即可重建高质量3D模型,其在生成式3D领域的突破令人瞩目。它不仅展示了惊人的效果,更通过创新的两阶段架构,为解决3D生成难题提供了新思路。本文将深入剖析其核心原理,探讨其对传统3D重建技术的潜在颠覆。
智能速览
SAM3D仅需图像和遮罩即可生成高质量3D模型。
采用两阶段生成,先构建稀疏结构再生成纹理。
混合DiT架构同时生成物体形状和姿态。
训练结合DPO,实现结果与人类偏好对齐。
生成式方法正快速超越传统3D重建技术。
精华内容
SAM3D的惊艳效果背后,是一套精密且高效的两阶段生成式架构。它如何将2D信息精准映射到3D空间?其核心在于一个混合DiT模型的巧妙设计。
两阶段生成流程
SAM3D采用两阶段生成模型,高效地将2D输入转化为3D资产。第一阶段以图像、目标Mask和由MoGe计算的PointMap作为条件,生成物体的稀疏结构,包括稠密体素栅格和目标姿态。其中PointMap虽为可选条件,但对模型准确遵循Mask区域至关重要,实测移除后效果会大打折扣。
第二阶段则使用图像和Mask作为条件,通过一个稀疏3D U-Net对稀疏噪声进行去噪,生成顶点的纹理特征。最终,该模型能通过不同的解码器输出高质量的Mesh(通过FlexiCube建模)或3D高斯泼溅(3DGS)表示。值得注意的是,两个阶段的去噪过程均可在仅5步内完成,生成效率极高。
混合DiT核心架构
第一阶段的核心是一个创新的混合DiT模型,它能够同时处理并生成两种不同模态的潜变量:描述物体几何形状的shape latent和描述物体姿态与尺度的layout latent。
为实现这一点,模型为两种模态的噪声token设置了不同的位置编码策略。Layout的各分量(如旋转、平移、缩放)采用可学习的嵌入,而shape token则使用基于坐标的正弦绝对位置编码。这种设计让DiT能清晰区分并处理来自不同模态的信息,从而在一个统一的框架内同时完成几何重建与位姿估计。
高效的训练策略
SAM3D的训练过程分为三个关键步骤。首先,在大规模合成数据上预训练基础组件;其次,在混合了真实背景的合成数据上进行监督微调,让模型学会从真实图像中重建物体;最后,通过直接偏好优化(DPO)进行对齐。
DPO阶段利用人类偏好数据集,指导模型生成更高质量的3D模型。其核心思想是,在被偏好的样本上让模型学得更好,减小速度误差,从而使其更有可能生成高质量结果。同时,引入参考模型约束,防止预测结果偏离过大,确保了训练的稳定性。
对传统重建的冲击
SAM3D的出现,标志着生成式3D模型在效果上已对传统三维重建方法形成压倒性优势。传统工程师需要精心调整参数、针对不同场景设计策略,而生成式模型仅需输入几张图像甚至一段视频,就能达到前所未有的效果。
尽管当前技术主要集中在物体级重建,但其发展速度预示着未来将攻克场景级重建。届时,仅凭一段视频即可生成包含静态场景、动态物体及运动轨迹的完整仿真世界,并能直接导入Blender或仿真引擎,为自动驾驶、机器人等领域带来变革性影响。
SAM3D不仅是技术上的重大突破,更预示着3D内容生成范式的转变。它证明生成式模型在特定任务上已能超越传统方法。未来,随着技术向场景级重建演进,一个仅需视频即可生成完整仿真世界的时代或许并不遥远,这将为数字世界创造带来无限可能。