当前语言驱动的自动驾驶系统常因视觉理解不足和模型庞大而受限。VLDrive提出了一种新范式,通过增强视觉表征,大幅精简模型尺寸,同时显著提升驾驶性能。这项探索为高效、可靠的自动驾驶落地提供了全新思路,展示了轻量化模型的巨大潜力。
智能速览
视觉局限是语言驱动驾驶的主要瓶颈
VLDrive通过视觉增强策略赋能轻量级语言模型
提出循环一致动态视觉剪枝等技术压缩视觉表征
参数量锐减81%,驾驶分数反而显著提升
精华内容
VLDrive的核心在于打破“模型越大越好”的常规思维,转而通过精妙的视觉增强技术,让轻量级模型也能实现卓越的驾驶表现。
问题洞察
研究发现,现有语言驱动自动驾驶方法的核心瓶颈并非语言模型本身,而是视觉理解的局限性。这导致系统在复杂路况下频繁发生碰撞和阻塞。同时,动辄数十亿参数的大模型带来了巨大的部署成本和计算开销,阻碍了其在现实世界中的应用。这表明,单纯扩大语言模型尺寸并不能线性提升驾驶性能,优化视觉表征才是关键突破口。
视觉增强
为解决上述难题,VLDrive框架引入了三大核心技术。首先是循环一致动态视觉剪枝(CCDP),它能自适应地筛选出最关键的视觉信号,大幅减少冗余信息。其次是记忆增强特征聚合(MEFA),用于有效整合连续的时序视觉信息,形成更全面的环境理解。这两项技术共同作用,实现了紧凑而高效的视觉表征。
指令对齐
为了让轻量级模型能精准理解并遵循导航指令,VLDrive设计了距离解耦指令注意力(DDIA)机制。该机制专门针对长距离视觉表征进行了优化,加强了视觉信息与语言指令之间的对齐。通过这种方式,模型即使在远距离导航场景下,也能准确做出符合指令的驾驶决策,显著提升了指令遵循的稳健性。
性能实测
在CARLA模拟器的闭环评估中,VLDrive的表现十分突出。与主流的7B参数模型相比,VLDrive仅用1.3B参数,即实现了81%的参数量削减。更重要的是,其驾驶分数不降反升:在极短、短、长距离场景下,分别带来了15.4%、16.8%和7.6%的显著提升。这充分证明了VLDrive在性能与效率之间取得了卓越平衡。
VLDrive的成功为自动驾驶领域开辟了新路径,证明通过优化视觉感知,轻量模型同样能实现高性能。这不仅降低了技术落地门槛,也为未来更智能、更高效的出行方案指明了方向。当大模型不再是唯一选择,自动驾驶的想象力是否将更加广阔?