当前视觉-语言-动作模型在执行复杂任务时面临高昂的计算成本。LaST₀模型提出了一种创新方案,通过在潜在空间中进行推理,大幅提升了机器人在动态环境中理解和执行指令的效率,为具身智能的发展提供了新思路。
智能速览
LaST₀是一种新型VLA模型,旨在通过自然语言指令控制机器人执行复杂任务。
核心创新在于潜在时空思维链,将显式推理转移到低成本的潜在空间。
模型整合了2D视觉、3D几何和机器人本体感受三类多模态信息。
采用三阶段训练流程,依次进行大规模预训练、推理专家和动作专家的微调。
精华内容
LaST₀究竟如何实现高效推理?其设计的潜在时空思维链与双系统架构,是理解其性能提升的关键。
设计目标
LaST₀的首要目标,是解决现有VLA模型在执行长时程、复杂任务时,因显式生成中间步骤而产生的巨大计算开销。它旨在让模型在紧凑的潜在空间中,隐式地建模未来的多模态动态,从而在不牺牲物理世界关键信息覆盖的前提下,大幅提升推理效率,使机器人能更流畅地响应动态环境变化。
时空思维链
LaST₀的核心是“潜在时空思维链”。该技术为每个未来时间步提取三类特征:通过SigLIP-Large编码器获取的2D视觉语义特征、通过Uni3D编码器获取的3D几何空间占用信息,以及机器人自身状态的本体感受特征。这些特征被压缩后,按视觉→几何→本体感受的因果顺序交错排列,形成一个紧凑的推理序列。
三阶段训练
为确保推理与动作生成的协同,LaST₀采用三阶段训练流程。首先,基于Janus-Pro在40万条机器人轨迹上进行大规模预训练,建立共享表征空间。接着,冻结动作专家,用真实潜在嵌入监督推理专家学习物理动态。最后,冻结推理专家,在异构频率下微调动作专家,实现部署时的自适应效率切换。
LaST₀模型通过潜在推理的方式,为机器人高效执行复杂任务提供了有效路径。它不仅降低了计算成本,更展示了隐式建模物理世界的巨大潜力。未来,这种思路能否催生出更通用、更智能的机器人,值得期待。