CARLA 0.9.16新版本集成了NVIDIA Cosmos大模型,为自动驾驶仿真带来了场景风格迁移的新能力。这项技术能将基础的CARLA仿真场景,通过提示词转化为更真实、可控的全新环境。这里将深入探讨其工作原理,分享本地部署的实操过程,并指出脚本中存在的bug与解决方法,为高阶玩家提供一份参考。
智能速览
CARLA 0.9.16集成NVIDIA Cosmos,支持仿真场景风格迁移。
工作流程分为生成基础视频和通过Cosmos服务进行推理两步。
官方视频导出脚本存在时长限制bug,需手动修改帧数。
功能推理对硬件要求高,推荐使用H100或同级别显存GPU。
CARLA 0.9.16正式版仍基于UE4,而非最新的UE5.5分支。
精华内容
这项新功能的工作流程其实并不复杂,但其背后的部署与实操细节,尤其是本地化部署,对许多开发者而言充满了挑战与机遇。下面将逐步拆解。
核心工作流
CARLA 0.9.16与NVIDIA Cosmos的结合,其工作流主要分为两个阶段。首先是数据准备阶段,需要利用CARLA生成一组包含多种传感器信息的视频流,这通常包括RGB视频、深度图、分割图以及通过基础模型生成的边缘图。
第二阶段是风格迁移推理,用户需要部署一个Cosmos Transfer服务(支持云端或本地Docker部署),并通过Gradio web接口将准备好的视频和提示词一同提交。服务端接收请求后,利用模型进行推理,并将生成的风格化视频输出到指定位置。
部署与修复
对于希望本地体验的用户,可以通过Docker部署Cosmos Transfer服务,但这对硬件有较高要求。在实操过程中,发现CARLA 0.9.16官方提供的视频生成脚本存在一个明显的bug。
该脚本在使用ffmpeg导出视频时,将总帧数硬编码为120帧,导致在24fps的设置下,视频时长被强制限制在5秒。要解决这个问题,只需修改脚本,将帧数参数调整为根据实际视频时长动态计算,例如设置为 `duration * 24`,即可生成任意长度的视频。
硬件与版本
根据官方文档,Cosmos Transfer的推理过程推荐使用8张NVIDIA H100 GPU以确保性能。虽然如此,对于个人用户或资源有限的开发者,也可以尝试使用如A100(80G显存)等其他具备大显存的GPU,可能同样能够运行。
另外需要注意的是,CARLA项目的版本管理。当前最新的0.9.16正式Release版本是基于虚幻引擎4(UE4)构建的,而基于UE5.5的代码仍在开发分支中。因此,在下载和部署时,需明确选择UE4版本的0.9.16,以避免兼容性问题。
CARLA与NVIDIA Cosmos的结合,为高保真仿真环境生成开辟了新路径。虽然当前对硬件要求不低,但随着技术普及和模型优化,未来有望让更多开发者轻松创建无限接近现实的虚拟测试场景。