当前位置:
AIGC文章详情

张大妈

浙大&港大:为什么自动驾驶大模型仍不安全

源自小红薯:每日ComputerScience

02-05 03:47

当前自动驾驶大模型的评测体系过于侧重感知能力,忽视了安全决策的核心环节,导致“看得准”不等于“做得对”。浙大与港大联合推出的AutoDriDM评测基准,正是为了弥补这一缺陷。它以决策为中心,通过系统性分析,揭示了模型从感知到行动的真实能力边界,为提升AI驾驶安全提供了全新视角。

浙大&港大:为什么自动驾驶大模型仍不安全智能速览

  • AutoDriDM是一个以决策为中心的自动驾驶VLM评测基准。

  • 构建了Object–Scene–Decision三层渐进评测体系,而非独立指标拼接。

  • 覆盖6650道基于真实数据集的驾驶问答,并引入五级风险标注。

  • 通过相似场景测试,检验模型决策是否基于因果语义而非视觉线索。

  • 训练了7B级Analyzer模型,可实现对VLM推理链的自动错误分析。

浙大&港大:为什么自动驾驶大模型仍不安全精华内容

现有的自动驾驶模型评测,往往只关心模型“看”得对不对,却忽略了其驾驶决策是否安全合理。这导致了评估结果与实际安全表现脱节。一种全新的评测思路应运而生,旨在穿透表象,直击决策安全的本质。

评测新范式

传统的评测方法常将感知与决策作为独立任务进行评估,忽略了两者间关键的因果链条。AutoDriDM提出了一套三层渐进式评测体系,从Object(物体识别)、Scene(场景理解)到Decision(驾驶决策),明确了“感知→理解→决策”的依赖路径。

这种设计不再是简单罗列指标,而是系统性地刻画模型能力的递进关系,能够更真实地反映自动驾驶系统在复杂环境下的综合表现,从而找出从“看懂”到“做对”之间的关键断点。

数据与风险

为全面模拟现实挑战,该基准基于nuScenes、KITTI、BDD100K三大主流公开数据集,构建了包含6650道问答的评测题库,覆盖了多国家、多道路类型及复杂交通环境。

更关键的是,它引入了独特的五级驾驶风险标注,并单独划分出高风险场景(4级及以上)。这使得评测能够重点考察模型在安全关键情境下的决策能力与泛化水平,直接回应了公众对自动驾驶安全性的核心关切。

深度剖析

为了量化感知与决策间的关系,研究团队通过Pearson相关系数分析了Object、Scene、Decision各任务间的耦合度,数据清晰地揭示了“看懂不等于决策正确”的现实。

此外,基准还建立了一套包含9类错误的可解释性分类体系,覆盖了逻辑错误、语义遗漏、幻觉、空间关系误判等关键失效模式。这种精细化的诊断,为模型的迭代优化提供了精准的改进方向。

自动化分析

面对海量的评测数据,手动分析模型错误链路效率低下。为此,团队专门训练了一个7B参数级别的Analyzer模型,用于对VLM的推理过程进行大规模自动错误标注。

测试结果显示,这个专门模型的错误分析准确率优于GPT-4.1等通用大模型。这不仅大幅提升了评测效率,也证明了专用模型在特定分析任务上的巨大潜力,为AI安全研究提供了新的工具。

AutoDriDM的出现,为自动驾驶大模型的安全评估树立了新标杆,它推动行业从单纯追求感知精度,转向关注决策的可靠性与安全性。未来,随着这类评测体系的完善,自动驾驶技术能否真正走向成熟可靠?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章