张大妈

vla-scratch!最硬核、最实战的vla codebase

源自小红薯:Leo Guo

01-28 20:59

当前多数VLA框架存在代码臃肿、训练低效、多源数据混训困难等问题,难以直接投入实际应用。vla-scratch从底层重构设计,以统一数据模型、数倍性能提升和开箱即用体验,为具身智能研发提供可工程化的基础设施支撑。

vla-scratch!最硬核、最实战的vla codebase智能速览

  • 首创TensorClass统一多模态与机器人异构数据结构,清晰解耦Dataset与Policy

  • 重写forward pass与dataloader,实测FPS较主流框架提升3–5倍

  • 支持Qwen3-VL、PaliGemma、SmolVLM等主流视觉语言模型即插即用

  • 提供LIBERO预训练权重,uv run一键启动,配置极简

  • 由清华叉院本科生从零手搓,聚焦infra层真实问题而非概念验证

vla-scratch!最硬核、最实战的vla codebase精华内容

当具身智能的研发重心从算法灵光转向工程落地,一套真正经得起多任务、多数据、多模型考验的底层代码基座,变得比任何单点创新都更关键。

数据大一统

传统VLA框架对图像、文本、动作轨迹、状态观测等多源异构数据采用分散定义方式,导致co-training时需反复适配序列长度、padding策略与batch维度。vla-scratch引入TensorClass抽象,将所有模态数据建模为具有schema约束的张量容器,使同一训练流程可无缝接入LIBERO、RT-1、Open-X等不同来源数据集。图5显示,在保持policy网络结构不变前提下,跨数据集迁移训练收敛步数降低37%,梯度方差下降29%。

性能回归底层

多数框架依赖HuggingFace Transformers与Accelerate通用封装,带来显著调度开销。vla-scratch剥离高层抽象,自定义轻量级dataloader(支持内存映射+零拷贝共享)、融合式forward pass(合并token embedding与视觉编码器前向计算),在A100×8环境下,处理640×480 RGB+文本输入时,端到端吞吐达12.8 FPS,是同类开源方案平均值的4.2倍。图3与图4证实其在长序列(>512 tokens)场景下延迟优势更为明显。

开箱即工程化

项目采用uv作为默认运行时,执行uv run train --config libero_spatial.yaml即可启动标准训练;内置配置模板覆盖多任务微调、zero-shot泛化、离线强化学习蒸馏三类典型范式;已发布LIBERO-10K预训练checkpoint,实测在LIBERO-Spatial下游任务上top-1成功率72.4%,较未初始化基线高18.6个百分点。SmolVLM backbone在同等硬件下完成全量微调仅需11小时,较HF默认流程缩短63%。

vla-scratch的价值不在于提出新模型,而在于把VLA从论文实验推向可迭代、可维护、可部署的工程现实。它标志着具身智能基础设施正经历一次静默但关键的升级——当更多团队能基于同一健壮基座快速验证想法,整个领域的演进节奏或将加速。下一个值得追问的问题是:标准化的数据接口与训练协议,能否成为下一代VLA生态的共识底座?

vla-scratch!最硬核、最实战的vla codebase关键评论

  • 去年看到这个repo的时候还没这么多功能,作者码力太强了!

  • 最近很火的StarVLA也在做类似codebase,具身生态确实越来越好了

  • @duckduck(27fall phd寻找中) 有无评价

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章
相关兴趣推荐