针对自动驾驶视频处理算力消耗巨大的行业难题,小鹏汽车与南加州大学联合研发的SRC-Pipeline框架提出创新解法。通过独特的令牌化压缩策略,该技术在不牺牲性能的前提下大幅降低计算负载,有效解决了高阶自动驾驶系统实时部署的关键瓶颈,具备极高的工程应用价值。
智能速览
SRC-Pipeline框架旨在解决自动驾驶VLM算力消耗大、推理延迟高的核心痛点。
其核心创新是基于时序的令牌化压缩策略,差异化处理视频早期与后期帧。
该框架将整体计算量降至传统模型的33.3%,推理效率提升超67%。
在LingoQA数据集测试中,其性能超越QWen2VL等主流基线模型。
此技术是小鹏汽车2026年落地第二代VLA模型的关键支撑,加速L4级自动驾驶进程。
精华内容
SRC-Pipeline框架的精妙之处,在于其对自动驾驶视频数据特性的深刻洞察与巧妙利用。它并非简单压缩,而是基于时序重要性的智能处理,从而实现了效率与性能的兼得。
算力挑战
随着自动驾驶向L4级迈进,集成了视觉感知、语义理解与决策推理的VLA大模型成为主流,但其对算力的需求呈指数级增长。传统VLM在处理连续视频帧时,需要对每一帧都进行完整的令牌化处理,导致计算量巨大、推理延迟高,难以满足车载计算平台对实时性的严苛要求,成为高阶自动驾驶落地的主要障碍之一。
核心创新
SRC-Pipeline框架的突破口在于其创新的令牌化压缩策略。研究团队发现,在自动驾驶场景中,系统对视频早期帧仅需捕捉全局场景与关键区域信息,而对后期帧则需要保留完整细节以支撑即时决策。基于此,框架通过SRC-ViT模块将早期帧压缩为1个场景令牌(代表全局语义)和4个区域令牌(代表局部细节),仅保留后期帧的完整补丁令牌,从而在保证语义信息完整的前提下,极大减少了计算量。
性能实测
该框架采用两阶段训练方案,先独立训练SRC-ViT以确保令牌压缩的精准性,再将压缩后的令牌输入VLM模型进行微调适配。在包含419万条问答对的LingoQA自动驾驶专用数据集上测试表明,在5帧输入设置下,SRC-Pipeline框架的性能全面超越QWen2VL等主流基线模型。尤其是在场景描述和动作预测等核心任务上,表现尤为突出,证实了其有效性和优越性。
未来布局
此次技术突破与小鹏汽车的高阶自动驾驶战略高度协同。根据小鹏汽车董事长何小鹏此前透露,其第二代VLA模型计划于2026年一季度量产上车,目标是实现“全场景覆盖”与“低接管率”。SRC-Pipeline框架通过显著降低VLA大模型的计算负载,能够与车载计算平台形成协同效应,有效攻克车端部署的时延瓶颈,为实现这一目标扫清了关键技术障碍。
SRC-Pipeline框架的推出,不仅是算法层面的精妙优化,更体现了“技术源于场景”的研发思路。它为解决大模型在车端的落地难题提供了可行路径,或将重塑高阶自动驾驶的技术竞赛格局,让全场景智能驾驶的到来更近一步。