张大妈

JanusVLN: 双重隐式记忆革新视觉语言导航

源自小红薯:一只哔mer

03-04 17:09

视觉语言导航模型在处理复杂长程任务时,常面临空间信息丢失与计算效率低下的双重瓶颈。JanusVLN框架通过模拟人脑双重记忆机制,巧妙分离语义与空间信息,为高效、精准的三维导航提供了全新解决思路。

JanusVLN: 双重隐式记忆革新视觉语言导航智能速览

  • 当前导航模型普遍存在空间信息丢失、计算内存爆炸和2D/3D理解矛盾三大难题。

  • JanusVLN设计了视觉语义与空间几何两条独立记忆通路,分别负责识别物体与感知位置。

  • 通过将历史信息提炼为固定尺寸的神经表征,从根本上解决了长期导航的内存爆炸问题。

  • 采用增量更新机制,模型推理效率大幅提升,为实时导航应用奠定基础。

  • 在VLN-CE基准测试中,仅凭单目RGB输入便超越了依赖多模态输入的复杂方法。

JanusVLN: 双重隐式记忆革新视觉语言导航精华内容

面对视觉语言导航的核心挑战,JanusVLN如何通过解耦与记忆革新,实现性能与效率的双重飞跃?

导航瓶颈

现有视觉语言导航模型虽能力强大,但在执行长时间、复杂任务时暴露出明显短板。首先是空间信息丢失,模型过度依赖文本构建认知地图或记忆原始视觉画面,导致对“左边”、“后面”等复杂空间关系的理解能力不足。

其次,每走一步都要“复习”全部历史画面,造成计算量和内存随导航时间爆炸式增长,决策速度越来越慢。

最后,导航本质是三维交互,但多数模型使用为2D图像设计的视觉编码器,对深度和结构等三维信息的理解存在先天缺陷。

双路解耦

JanusVLN的灵感源于人脑左右半球的分工模式,提出了一个名为双重隐式神经记忆的创新框架。该框架的核心是两条完全解耦的记忆通路:一条是视觉语义记忆,专注于理解“这是什么”,负责识别场景中的桌子、椅子等物体;另一条是空间几何记忆,专注于理解“它在哪里”,负责感知物体的远近、朝向和相互布局。

这两条通路互为补充,让模型在理解物体语义的同时,也能精准把握其空间关系。

高效记忆

为了解决内存爆炸问题,JanusVLN摒弃了存储原始历史图像的传统做法,转而将历史信息提炼成紧凑、固定尺寸的神经表征,类似于KV Caches。这种方式如同人脑的记忆机制,存储的是经过处理的精华而非原始录像,从根本上控制了内存占用。

同时,模型采用“初始窗口”与“滑动窗口”相结合的缓存机制,在每一步只需处理当前帧并融合历史记忆,避免了重复计算,使得推理效率得到大幅提升。

性能实测

在实际测试中,JanusVLN展现了卓越的性能。在权威的VLN-CE基准测试上,其综合指标达到了当前最佳水平(SOTA)。

尤为值得注意的是,该模型仅使用单目RGB摄像头作为输入,其成功率就已超越了许多依赖全景图像、深度图等多模态输入的复杂模型。这一结果不仅证明了其框架的有效性,也为在资源受限的机器人上部署高性能导航系统提供了可能。

JanusVLN通过巧妙的解耦设计与记忆革新,为具身智能的导航能力带来了实质性突破。未来,这种双重记忆机制能否启发更多领域,值得期待。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章