张大妈

上交:面向VLA时序感知双层级视觉token剪枝

源自小红薯:每日ComputerScience

03-02 12:12

VLA模型虽强大,但实时部署受限于高昂计算成本。VLA-Pruner方法直面此挑战,通过一种创新的双层级剪枝策略,在不重新训练模型的前提下,显著提升推理速度,为边缘侧具身智能应用铺平了道路。

上交:面向VLA时序感知双层级视觉token剪枝智能速览

  • VLA-Pruner是一种无需训练、即插即用的VLA模型推理加速方法。

  • 该方法显式区分语义理解与动作执行两阶段,提升剪枝精度。

  • 结合语义与动作双重注意力指标,协同筛选关键视觉信息。

  • 采用时间平滑估计动作注意力,实现在线可用的实时剪枝。

  • 实现了最高1.99倍的推理加速,同时保持或提升了任务成功率。

上交:面向VLA时序感知双层级视觉token剪枝精华内容

VLA-Pruner的精妙之处在于它如何精准识别并保留对机器人操作至关重要的视觉信息,同时大幅削减计算负担。

双系统建模

传统的视觉剪枝方法主要依赖语义注意力,但VLA模型在执行任务时,存在“语义理解”和“动作执行”两个截然不同的阶段。研究分析发现,这两个阶段的注意力Top-K视觉patch重叠率仅约50%,这意味着单纯依赖语义信息会忽略大量对执行动作至关重要的视觉区域。VLA-Pruner首次显式地建模了这种差异性,为后续的精准剪枝奠定了理论基础。

双重筛选机制

基于双系统特性,VLA-Pruner引入了双目标重要性准则。它不再仅使用vision-language prefill阶段的注意力,而是同时引入action-to-vision decode阶段的注意力作为第二重指标。这种语义与动作并重的筛选方式,确保了被保留的视觉token既有助于模型理解场景,又服务于精确的动作控制,避免了因过度剪枝导致的性能下降。

时序平滑预测

在实际机器人操作中,获取未来的动作注意力是不可行的。VLA-Pruner巧妙地利用了机器人动作的时序连续性,采用衰减窗口平均(窗口大小w=3,衰减因子γ=0.8)的方法,基于历史信息来预测当前的动作注意力。这一设计使得该方法能够在线实时运行,无需依赖未来信息,极大地提升了实用性和部署便捷性。

即插即用优势

VLA-Pruner的另一个核心优势是其训练无关的特性。它直接在Transformer模型的第3层进行剪枝,不修改主干网络结构,因此可以无缝适配于OpenVLA、π0等多种主流VLA架构。这种即插即用的设计让开发者能以极低的成本将其集成到现有系统中,轻松实现显著的性能加速。在实测中,该方法取得了最高1.99倍的推理加速比,同时任务成功率得以保持甚至提升。

VLA-Pruner为VLA模型的轻量化与高效部署提供了极具价值的思路。它证明了通过深入理解模型内部工作机制,可以实现性能与效率的双赢。随着这类技术的成熟,具身智能机器人离真正的实时交互与大规模应用还有多远?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐