张大妈

动作感知量化,VLA模型轻量部署

源自小红薯:具身智识局

02-12 14:07

针对视觉-语言-动作(VLA)模型量化后性能暴跌的难题,上海交通大学团队提出了QVLA框架。它通过创新的动作感知量化策略,实现了模型的高效压缩与实时部署,为资源受限的机器人应用提供了切实可行的解决方案,显著提升了模型部署的效率与实用性。

动作感知量化,VLA模型轻量部署智能速览

  • VLA模型传统量化后性能会急剧下降。

  • QVLA框架通过量化动作敏感性高的通道来保护性能。

  • 该框架统一了剪枝与量化,为不同通道分配最优位宽。

  • 量化后模型显存占用降至29.2%,性能仍保持98.9%。

  • 真实机械臂任务中,实现了1.28倍加速且成功率不变。

动作感知量化,VLA模型轻量部署精华内容

QVLA框架的创新之处在于,它摒弃了传统均匀量化思维,转而聚焦于对机器人动作至关重要的核心信息。

传统量化困境

大规模视觉-语言-动作模型在具身智能领域展现出巨大潜力,但其庞大的参数量给部署带来了严峻挑战。传统的均匀量化方法,如借鉴自大语言模型的方案,会不加区分地压缩模型所有部分。这在VLA模型中会导致灾难性后果,因为微小的权重误差可能在动作决策中被逐级放大,最终使机器人无法完成物理交互任务,导致性能急剧下降。

动作敏感性分析

QVLA框架的核心突破在于引入了通道级的动作敏感性分析。该方法能够精准评估每个通道在量化到不同位宽后,对最终机器人动作输出产生的具体影响。通过这种分析,框架可以识别出哪些通道对动作决策至关重要,哪些则相对次要,从而实现了对模型内部不同模块和通道的差异化、精细化量化,为后续的资源分配提供了科学依据。

贪心算法优化

基于敏感性分析的结果,QVLA采用全局贪心降级算法,为每个通道动态分配最优的位宽,范围从0位(即剪枝)到16位不等。这种设计巧妙地将模型剪枝与量化统一在一个框架内,在满足预设的内存或计算预算约束下,能够以最小的动作性能损失为目标,进行全局最优的位宽分配,极大地提升了资源利用效率。

性能实测表现

在LIBERO模拟基准测试中,OpenVLA模型经过QVLA量化后,显存占用仅为原模型的29.2%,却依然保持了高达98.9%的任务成功率,推理速度提升1.49倍。与SmoothQuant等先进方法相比,其性能优势达到22.6%。在更具挑战的真实世界双机械臂操作任务中,采用W8A16量化设置时,模型不仅实现了1.28倍的推理加速,其63.3%的任务成功率也与原模型持平,验证了该方案的实用价值。

QVLA框架为解决具身智能大模型部署瓶颈提供了新思路,其动作感知的量化策略兼顾了效率与性能。随着这一技术的成熟,未来将有更强大的机器人模型走出实验室,在各类资源受限的设备上实现实时、可靠的交互,加速具身智能技术的落地应用。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐