传统3D大模型照搬NLP的RoPE,常导致空间信息丢失和视觉token被忽略。C2RoPE通过引入空间坐标和切比雪夫因果掩码,有效提升了3D场景问答的准确性。
智能速览
传统RoPE在3D视觉中存在空间信息丢失和注意力衰减缺陷
C2RoPE引入三元组混合位置索引,保留行列空间连续性
采用切比雪夫因果掩码,以距离而非序列分配注意力权重
在3D场景问答核心指标上对比LLaVA-3D提升4.3%
精华内容
针对3D大模型中传统位置编码的固有缺陷,C2RoPE提出了全新的空间感知增强方案。
传统固有缺陷
传统3D-LLM直接沿用NLP领域的RoPE,将2D图像强压为一维序列处理。这种方式导致列相邻的像素被视为陌生人,丢失了关键的行列空间连续性。此外,由于只关注序列先后顺序,随着序列增长,前期的视觉信息往往被模型忽视,导致多视图3D场景理解失效,容易产生幻觉。
空间坐标索引
C2RoPE创新性地提出了三元组混合位置索引。该方案不再单一依赖一维的时间序号,而是为每个token附加了xy空间坐标。通过精准锁定每个token在图像中的具体位置,该方法有效保留了行与列的空间连续性,从根本上解决了空间信息丢失的问题。
注意力重分配
摒弃了“先来后到”的注意力分配规则,C2RoPE引入了切比雪夫因果掩码。该机制以图像中心为原点,根据空间距离分配注意力权重。无论视觉信息出现在序列的哪个位置,只要距离关键区域较近,都能被模型有效捕捉,从而彻底解决了token忽视和注意力衰减现象。
性能显著提升
实验数据显示,C2RoPE在3D场景问答任务中表现优异。与主流基线LLaVA-3D相比,其核心精准匹配指标提升了4.3%。在复杂的3D场景推理中,各项指标均实现上涨,模型能够精准识别空间特征并给出正确推理结果,显著降低了幻觉率。
C2RoPE为3D大模型和具身智能提供了新的技术思路,有效解决了空间感知难题。这一改进对于机器人视觉和导航领域的研究具有重要参考价值。