机器人技术深度传感器虽普及,但深度数据表征学习长期被忽视。DeFM模型的出现填补了这一空白,作为首个专为深度图像设计的大规模自监督基础模型,它无需微调即可直接应用于多种机器人任务,展现出强大的泛化能力,为机器人感知带来了新的解决方案。
智能速览
深度数据表征学习长期被忽视,现有方法存在明显缺陷。
DeFM是首个专为深度图像设计的大规模自监督基础模型。
模型在6000万张深度图像上训练,学习了通用的几何和语义表征。
核心优势在于无需任务特定微调,可直接应用于下游任务。
在导航、操作等多项基准测试中,DeFM性能达到业界领先水平。
团队发布了所有预训练模型,便于研究者直接使用。
精华内容
DeFM的成功源于其针对性的设计,它不仅仅是一个模型,更是一套完整的深度感知解决方案。
现有困境
在机器人领域,深度传感器应用广泛,但深度模态的表征学习发展滞后。当前主流方法存在两大瓶颈:一是将预训练的RGB编码器直接用于深度数据,这会造成数据分布不匹配,损失关键的几何保真度;二是针对特定任务从头训练深度编码器,导致模型泛化能力差,难以跨任务、跨环境使用。
深度数据本身蕴含着对机器人至关重要的度量几何、自由空间和物理可供性等信息,但一直缺少一个能充分理解这些信息的通用预编码器。
模型设计
为解决上述问题,研究团队推出了DeFM。这是一个专为深度图像构建的大规模自监督基础模型。它借鉴DINO风格的自蒸馏目标,在包含6000万张深度图像的大型数据集上进行训练,旨在学习能够跨环境、跨任务、跨传感器泛化的几何与语义表征。
为确保模型在多个尺度上保持对距离和尺寸的准确感知,团队还引入了一种新颖的输入归一化策略。
轻量化部署
考虑到机器人系统资源通常受限,团队对最大的DeFM模型(ViT-L)进行了知识蒸馏,生成了一系列轻量级模型。这些模型的参数量从300万到3000万不等,覆盖了卷积网络(如ResNet)和紧凑型Transformer(如ViT-S)等多种主流架构。
这种设计让DeFM能够轻松部署到不同的机器人平台上,兼顾了性能与效率。
性能表现
DeFM在深度分类、语义分割、导航、移动和操作等多个机器人任务基准测试中,均取得了当前最先进的性能。与重新利用的RGB预训练编码器和从头训练的特定任务编码器相比,DeFM都展现出显著优势。
尤其是在机器人导航和操作任务中,DeFM提取的特征让机器人能更精准地理解环境结构,实现更稳定的控制,并验证了其从仿真到真实环境的强大迁移能力。
DeFM的发布降低了机器人深度感知技术的应用门槛,为研究者和开发者提供了强大的即用型工具。未来,这一基础模型能否催生出更多适应复杂真实世界的智能机器人应用,值得持续关注。