张大妈

ICLR2026 janusVLN:双重隐式记忆

源自小红薯:创模灵感栈

01-31 13:23

当前的AI导航模型在长时间、复杂任务中普遍面临空间信息丢失和内存爆炸等瓶颈。一个名为JanusVLN的新框架受大脑启发,通过双重隐式神经记忆,将语义理解与空间感知解耦,并高效压缩历史信息,显著提升了导航效率与精度,为更可靠的机器人导航和AI智能体铺平了道路。

ICLR2026 janusVLN:双重隐式记忆智能速览

  • 现有导航大模型普遍面临空间信息丢失、计算内存爆炸的瓶颈。

  • JanusVLN借鉴人脑分工,设计了语义与空间双路解耦的记忆通路。

  • 固定尺寸的隐式神经记忆,从根本上解决了导航过程中的内存爆炸问题。

  • 通过增量更新机制,模型推理效率大幅提升,满足实时应用需求。

  • 在权威基准测试VLN-CE上,JanusVLN仅用单目RGB即达到SOTA性能。

ICLR2026 janusVLN:双重隐式记忆精华内容

JanusVLN的精妙之处在于它模仿了人脑处理信息的方式。通过构建两条独立的记忆通路,它让AI智能体在复杂环境中不仅能‘认路’,更能‘懂路’。

导航AI的困境

当前主流的导航大模型在执行长期任务时存在三大难题。首先是空间信息丢失,模型依赖文本构建记忆地图或直接记忆画面,难以精确理解“左边”、“后面”等复杂空间关系。其次是计算与内存爆炸,每一步都要重审所有历史画面,导致资源消耗随时间剧增。最后是2D与3D的矛盾,导航本质是三维交互,但模型多使用2D视觉编码器,对深度和结构信息理解先天不足。

双路解耦记忆

针对上述问题,JanusVLN提出了双重隐式神经记忆框架,其核心是双路解耦设计。模型被赋予两条独立的记忆通路:视觉语义记忆负责理解“这是什么”,例如识别环境中的桌椅;空间几何记忆则负责理解“它在哪里”,感知物体的远近、朝向和布局。这种设计让模型既懂语义,又懂空间,二者互为补充,协同决策。

高效记忆机制

为了解决内存爆炸问题,JanusVLN不再存储原始的历史图像,而是将其提炼为紧凑、固定大小的神经表征(KV Caches)。这好比人脑记忆,是经过提炼的精华而非录像带。同时,模型采用“初始窗口”+“滑动窗口”的缓存机制,每一步只需处理当前帧并融合历史记忆,无需重复计算,推理效率因此大幅提升。

性能实现超越

在权威的VLN-CE基准测试中,JanusVLN的综合性能达到了SOTA(State-of-the-Art)。一个突出的亮点是,该方法仅使用单目RGB输入,其成功率就超越了众多依赖全景图像、深度图等多模态输入的复杂方法。这充分证明了其双重记忆架构在信息提取与利用上的高效性,用更简单的输入实现了更强的性能。

JanusVLN为视觉语言导航的长期挑战提供了优雅解法。通过解耦语义与空间信息,并采用高效记忆管理,它显著提升了性能与效率。这种双重记忆范式或将启发未来更类人化的AI系统,让能真正理解复杂环境的智能体离现实更近一步。它将如何改变未来的机器人与虚拟助手?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐