先进的视觉-语言-动作模型π₀-FAST已成功集成至LeRobot平台。这次整合不仅带来了PyTorch版本的实现,更通过FAST分词和KV缓存等技术,将动作预测训练与推理速度提升约5倍,为具身智能研究注入了新的活力。
智能速览
π₀-FAST已用PyTorch重构并集成至LeRobot。
FAST分词器将连续动作转为离散词元,实现高效训练。
下一词元预测训练方式比传统方法快约5倍。
引入KV缓存机制,使自回归解码速度提升约5倍。
在LIBERO基准测试中,成功率从40%大幅提升至82.5%。
精华内容
此次技术整合的核心在于,通过架构创新与推理优化,显著提升了模型处理和预测动作的效率,为后续研究铺平了道路。
PyTorch重构
原本基于JAX的π₀-FAST模型现已完全使用PyTorch进行重构,并成功集成至LeRobot技术栈。这一工作不仅让更多PyTorch生态的开发者能够便捷使用,还完整复现了包括交叉熵损失目标、FAST分词方案在内的核心功能,为后续的优化和扩展奠定了坚实的代码基础。
训练加速5倍
模型的核心创新在于引入了FAST动作分词器,它能将连续的机器人动作序列压缩成离散的词元。借助这种编码方式,π₀-FAST可以采用类似大语言模型的“下一词元预测”方式进行训练。该方法的训练效率远超传统的扩散模型或流匹配,实测速度提升约5倍。
解码再提速
除了训练加速,推理阶段的性能也得到显著优化。通过在系统中引入大语言模型风格的KV缓存机制,模型在自回归解码过程中无需重复计算,使得解码速度再次提升约5倍。这意味着机器人在实际执行任务时的响应延迟将大幅降低。
基准测试飞跃
技术的进步最终在实际性能上得到了体现。在具身智能领域的标准LIBERO基准测试中,集成π₀-FAST的LeRobot系统成功率从移植初期的40%跃升至82.5%。这一巨大飞跃充分证明了该整合方案的有效性和实用性,验证步骤为4万步。
π₀-FAST的成功集成,标志着LeRobot平台在高效模型架构上迈出了重要一步。它不仅验证了自回归方案在具身智能领域的巨大潜力,也为未来探索混合训练与知识隔离等技术方向打开了大门。具身智能的下一个突破点会在哪里?