极端场景过了,就代表智驾"够强"了?

2026-04-28 17:38:32 0点赞 0收藏 0评论

极端场景测试测的不是能力,是数据覆盖率。

暴雨、逆光、行人横穿、施工改道,四个条件叠在一起,智驾稳稳通过。台下掌声雷动,弹幕刷”太强了”。

但等一下,这个”强”是谁定义的?

1988年,机器人学家斯·莫拉维克发现一个反直觉的规律:让计算机下国际象棋很容易,但让它像一岁小孩那样感知世界却极难。高级认知任务对 AI 反而简单,基础感知反而难。→ 能力越高级的任务,规则越明确,AI 越容易学。

粗暴点说,AI 觉得下棋是小菜一碟,识别路边的塑料袋才是地狱难度。

映射到智驾:极端场景虽然复杂,但规则边界是相对清晰的,比如”暴雨中绕开障碍物通过路口”。而日常驾驶中的模糊场景才真正考验 AI,比如”对面司机在挥手是让我先走还是让我停下?”→ 边界越模糊,AI越容易犯蠢。

极端场景过了,就代表智驾"够强"了?

直白一点,工程师关心的”边界条件”(boundary condition),听着高大上,其实就是”这条规则管到哪条线为止”。极端场景的线画得很清楚,日常驾驶的线根本画不出来。

你以为的极端,在 AI 眼里未必真的极端。这,跟直觉完全反着来,对吧?

人类觉得难的事情,AI 可能觉得简单。人类觉得简单的事情,AI 反而觉得难。

这篇聊三个事:

  1. “极端场景崇拜”怎么来的

  2. 方法论上为什么测不了通用能力

  3. 知道”不会做”比证明”会做”更重要

车企都在秀极端场景,图啥?

测极端场景就像只考选择题,考不出真理解。

打开任何一家车企的智驾发布会,核心demo几乎都是极端场景。你方唱罢我登场,一家比一家”极限”。

各家秀的东西都差不多:暴雨夜路、无保护左转、复杂路口穿行。评测机构也把”极端工况通过率”列为核心指标。

逻辑看起来很硬:极端场景是能力天花板,天花板够高说明地基扎实。很有道理对吧?但先别急着点头。

这个推理有一个致命的前提假设:通过极端场景的方式不重要,只看结果。就像考试得了高分,但不知道是”真会”还是”背过答案”。(是不是有点像上学时候那些平时成绩一般、期末突然满分的同学?PS)

极端场景过了,就代表智驾"够强"了?

行业其实在转向了。2026年多家评测机构的智驾评测体系已从单一”极端场景通过率”扩展到多维矩阵:功能场景覆盖度、系统鲁棒性、安全信任、成本效率。连评测机构自己都不再只用一个指标衡量能力了。

问题出在哪?

象棋大师的记忆力,和你想的不一样

专家的超能力只在熟悉的赛道上生效,换个赛道就是普通人。

极端场景过了,就代表智驾"够强"了?

认知心理学有个经典实验。(又是心理学,别走,这次真有意思

给象棋大师和普通人看一个真实棋局5秒,然后让他们凭记忆复原。大师能记住几乎所有棋子的位置,普通人只能记四五个。

大师的记忆力碾压普通人,对吧?记住这个”看起来”。“看起来”是因为他只是在调数据库,通俗点讲,不是脑子好,是题做得多。

接下来研究者做了一个关键实验:把棋子随机摆放

结果呢?大师的记忆力立刻掉到和普通人一模一样。说好的超强记忆力呢?

同样的视觉信息量,真实棋局大师碾压,随机棋盘大师消失。结论只有一个:

大师靠的不是”记性好”,而是”见过太多模式”。

这说明什么?大师的”超强记忆力”不是通用能力,而是领域锁定的模式识别(pattern recognition)。说白了,模式识别就是”见过太多类似的东西,一眼就能归类”。

他不是”记性好”,是”见过太多棋局模式,一眼就能匹配”。简单说,大师脑子里有个巨大的棋局数据库,看到真实棋局直接调取,看到随机排列,数据库帮不上忙,那就和普通人一样了。

有人做过一个元分析,综合了大量研究后得出结论:远迁移(far transfer)基本不存在。远迁移,听着很学术?说白了就是”在A领域练出来的能力,能不能搬到B领域去用”。

答案是:大概率不能。练棋不会让你数学更好,练钢琴不会让你记忆力更强,练工作记忆不会让你更聪明。(此处省略一万字关于”赢在起跑线”教育焦虑的吐槽)

映射到智驾:在已知极端场景上的表现是”模式匹配”,就像象棋大师在真实棋局上的记忆。这不是推理能力,是”我见过这种模式”的快速匹配。简单说就是”背答案”,而不是”会解题”。

换一套没背过的题,”能力”瞬间归零。

有个做端到端智驾的CEO说得直白:端到端模型”一旦遭遇训练数据未曾覆盖的盲区,模型往往缺乏举一反三的泛化能力”。翻译成人话:没见过的就不会,就这么简单?

端到端模型的参数量通常只有几千万到几亿,像一个做了大量驾考题的小学生。题库覆盖了就满分,没见过的题就懵了。而 VLA 模型(Vision-Language-Action,视觉语言行动模型)理论上更接近”真正理解交通规则”的司机,但车端算力目前还跑不满。这就意味着,”背答案”的阶段至少还得持续一阵子。

还有,研究发现,资深医生面对不典型症状时,反而比年轻医生更容易误诊。原因叫锚定效应(anchoring bias),就是大脑的模式匹配太快,一下就”锚”到一个已知疾病模板上,来不及管那些对不上的线索。嗯,老医生脑子里全是”套路”,碰到不像套路的病人,套路反而害了他。

经验越多,模式匹配越强,在分布外的错误越离谱。(PS:所以老司机可能比新手更容易在陌生城市迷路?好像有点道理) 一旦跳出”经验圈”,专家比新手摔得更惨。

这不只是个别领域的问题,是关于”能力本质”的通用规律。专家在自己的领域里是无敌的,出了领域就是普通人。

高分≠高能,考试理论早说透了

分数稳定只说明会考试,不代表真有那个能力。

教育测量学有一个核心区分:信度(reliability)和效度(validity)。一个看”稳不稳”,一个看”准不准”。

信度是”结果稳定不稳定”。同一个场景反复测,系统每次都能通过,信度很高。就是”每次考的分数差不多”。

效度是”测的是不是想测的东西”。极端场景通过率这个指标,测的是”训练数据覆盖率”,不是”通用驾驶能力”。“考的是背功,不是脑子”。

极端场景过了,就代表智驾"够强"了?

雅思考试的信度系数常年0.85以上,分数很稳定。但教育学界从不认为雅思高分等于英语能力强,因为应试技巧可以大幅拉高分数。分数高只说明”会考试”,不说明”真会用”。

极端场景通过率就是智驾的”雅思分数”,高信度,低效度。记住这个类比,后面会用到。是不是觉得”高信度低效度”这种说法很绕?那就记住一句话:分数稳定,但测的东西不对。

2026年《国际人工智能安全报告》明确指出:”基准测试通常无法预测在现实世界的表现。”。原因是数据污染(data contamination),意思是模型在训练时已经”见过”测试题了。

这跟学生提前拿到考试答案一个道理。分数虚高,不代表真懂。数据污染让”测试结果”失去了”预测能力”。

有团队对283个AI评测基准做了分析,结论也证实:AI评测存在三大问题,数据污染、文化偏见、静态评测局限。

知道自己不会什么,比证明会什么更重要

美军特种部队(海豹突击队)的单兵作战能力远超常规军。但五角大楼从不用特种部队执行常规阵地防御。

不是因为做不到,而是因为”知道自己的角色边界”比”证明自己什么都能做”更重要。就是,”别逞能”。

智驾系统的安全性,也不是由”能通过多少极端场景”决定的。能过极端场景不等于能过日常场景,就像特种兵能打不一定能守。

极端场景过了,就代表智驾"够强"了?

真正重要的,我觉得是三个东西:

  1. OOD泛化

    :没见过的场景能不能搞定。就是训练数据没覆盖的情况,系统还能不能做出合理反应。

  2. 元认知

    :知道自己什么时候不行。大多数AI系统压根没有这个能力。

  3. 优雅降级

    :不行了能安全退出。而不是硬撑着往前冲,最后搞出事故。

极端场景测试,都没测这三个。

安全的底线不是”什么都能搞定”,而是”知道自己什么时候该停下来”。

ODD(Operational Design Domain,运行设计域)框架是行业评估智驾系统的标准方法。名字很长,意思很简单:划一块地盘告诉系统”你只能在这块地盘里干活”。系统的”能力边界”是人为画定的,不是系统自己感知的。它的核心是”系统知道自己不能做什么”,而不是”系统能做什么”。

当ODD条件不满足时,自动驾驶系统应该触发优雅降级(说白了就是”不行了就体面退出”):安全停车,而不是硬撑。“知道自己不行了就乖乖靠边停”,比”硬撑着往前冲”安全一万倍。

1939年,心理学家韦克斯勒做了一件事:把IQ测试从单一”智力年龄”分数,拆成四个维度,言语理解、知觉推理、工作记忆、加工速度。因为他发现,用一个数字衡量一个人的认知能力,根本说不清楚。记住这个名字,韦克斯勒。他把”一个分数”拆成”多个维度”,这个思路正在被智驾行业复制。从”考一门课”变成”考四门课”。

智驾正在经历同样的”韦克斯勒时刻”。从单一极端场景通过率,转向多维能力矩阵。一旦评估维度变多,那些靠”刷分”刷出来的成绩就藏不住了。

毕竟,真正安全的车,不是”什么场景都能搞定的车”,而是”知道自己什么时候该停下来的车”。这句话放人身上好像也成立。

收个尾

评估方法不升级,能力再强消费者也看不出来。

智驾的能力评估,正从”秀极限操作”走向”看全面表现”。下次看发布会,别只盯极端场景,多关注系统在模糊地带的表现。那才是区分”背答案”和”真理解”的分水岭。是不是觉得看发布会的姿势都得升级了?

极端场景过了,就代表智驾"够强"了?

如果也在关注智驾能力评估,欢迎在评论区聊聊看法。

安全评价基于公开测试数据,不构成购买依据本文数据来源于公开渠道,仅供参考对比评价基于个人体验和公开数据,存在主观成分

本文内容基于公开信息和个人体验撰写,仅供参考。如有疏漏,欢迎指正。

作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松