极端场景过了,就代表智驾"够强"了?
极端场景测试测的不是能力,是数据覆盖率。
暴雨、逆光、行人横穿、施工改道,四个条件叠在一起,智驾稳稳通过。台下掌声雷动,弹幕刷”太强了”。
但等一下,这个”强”是谁定义的?
1988年,机器人学家汉斯·莫拉维克发现一个反直觉的规律:让计算机下国际象棋很容易,但让它像一岁小孩那样感知世界却极难。高级认知任务对 AI 反而简单,基础感知反而难。→ 能力越高级的任务,规则越明确,AI 越容易学。
粗暴点说,AI 觉得下棋是小菜一碟,识别路边的塑料袋才是地狱难度。
映射到智驾:极端场景虽然复杂,但规则边界是相对清晰的,比如”暴雨中绕开障碍物通过路口”。而日常驾驶中的模糊场景才真正考验 AI,比如”对面司机在挥手是让我先走还是让我停下?”→ 边界越模糊,AI越容易犯蠢。

直白一点,工程师关心的”边界条件”(boundary condition),听着高大上,其实就是”这条规则管到哪条线为止”。极端场景的线画得很清楚,日常驾驶的线根本画不出来。
你以为的极端,在 AI 眼里未必真的极端。这,跟直觉完全反着来,对吧?
人类觉得难的事情,AI 可能觉得简单。人类觉得简单的事情,AI 反而觉得难。
这篇聊三个事:
“极端场景崇拜”怎么来的
方法论上为什么测不了通用能力
知道”不会做”比证明”会做”更重要
车企都在秀极端场景,图啥?
测极端场景就像只考选择题,考不出真理解。
打开任何一家车企的智驾发布会,核心demo几乎都是极端场景。你方唱罢我登场,一家比一家”极限”。
各家秀的东西都差不多:暴雨夜路、无保护左转、复杂路口穿行。评测机构也把”极端工况通过率”列为核心指标。
逻辑看起来很硬:极端场景是能力天花板,天花板够高说明地基扎实。很有道理对吧?但先别急着点头。
这个推理有一个致命的前提假设:通过极端场景的方式不重要,只看结果。就像考试得了高分,但不知道是”真会”还是”背过答案”。(是不是有点像上学时候那些平时成绩一般、期末突然满分的同学?PS)

行业其实在转向了。2026年多家评测机构的智驾评测体系已从单一”极端场景通过率”扩展到多维矩阵:功能场景覆盖度、系统鲁棒性、安全信任、成本效率。连评测机构自己都不再只用一个指标衡量能力了。
问题出在哪?
象棋大师的记忆力,和你想的不一样
专家的超能力只在熟悉的赛道上生效,换个赛道就是普通人。

认知心理学有个经典实验。(又是心理学,别走,这次真有意思)
给象棋大师和普通人看一个真实棋局5秒,然后让他们凭记忆复原。大师能记住几乎所有棋子的位置,普通人只能记四五个。
大师的记忆力碾压普通人,对吧?记住这个”看起来”。“看起来”是因为他只是在调数据库,通俗点讲,不是脑子好,是题做得多。
接下来研究者做了一个关键实验:把棋子随机摆放。
结果呢?大师的记忆力立刻掉到和普通人一模一样。说好的超强记忆力呢?
同样的视觉信息量,真实棋局大师碾压,随机棋盘大师消失。结论只有一个:
大师靠的不是”记性好”,而是”见过太多模式”。
这说明什么?大师的”超强记忆力”不是通用能力,而是领域锁定的模式识别(pattern recognition)。说白了,模式识别就是”见过太多类似的东西,一眼就能归类”。
他不是”记性好”,是”见过太多棋局模式,一眼就能匹配”。简单说,大师脑子里有个巨大的棋局数据库,看到真实棋局直接调取,看到随机排列,数据库帮不上忙,那就和普通人一样了。
有人做过一个元分析,综合了大量研究后得出结论:远迁移(far transfer)基本不存在。远迁移,听着很学术?说白了就是”在A领域练出来的能力,能不能搬到B领域去用”。
答案是:大概率不能。练棋不会让你数学更好,练钢琴不会让你记忆力更强,练工作记忆不会让你更聪明。(此处省略一万字关于”赢在起跑线”教育焦虑的吐槽)
映射到智驾:在已知极端场景上的表现是”模式匹配”,就像象棋大师在真实棋局上的记忆。这不是推理能力,是”我见过这种模式”的快速匹配。简单说就是”背答案”,而不是”会解题”。
换一套没背过的题,”能力”瞬间归零。
有个做端到端智驾的CEO说得直白:端到端模型”一旦遭遇训练数据未曾覆盖的盲区,模型往往缺乏举一反三的泛化能力”。翻译成人话:没见过的就不会,就这么简单?
端到端模型的参数量通常只有几千万到几亿,像一个做了大量驾考题的小学生。题库覆盖了就满分,没见过的题就懵了。而 VLA 模型(Vision-Language-Action,视觉语言行动模型)理论上更接近”真正理解交通规则”的司机,但车端算力目前还跑不满。这就意味着,”背答案”的阶段至少还得持续一阵子。
还有,研究发现,资深医生面对不典型症状时,反而比年轻医生更容易误诊。原因叫锚定效应(anchoring bias),就是大脑的模式匹配太快,一下就”锚”到一个已知疾病模板上,来不及管那些对不上的线索。嗯,老医生脑子里全是”套路”,碰到不像套路的病人,套路反而害了他。
经验越多,模式匹配越强,在分布外的错误越离谱。(PS:所以老司机可能比新手更容易在陌生城市迷路?好像有点道理) 一旦跳出”经验圈”,专家比新手摔得更惨。
这不只是个别领域的问题,是关于”能力本质”的通用规律。专家在自己的领域里是无敌的,出了领域就是普通人。
高分≠高能,考试理论早说透了
分数稳定只说明会考试,不代表真有那个能力。
教育测量学有一个核心区分:信度(reliability)和效度(validity)。一个看”稳不稳”,一个看”准不准”。
信度是”结果稳定不稳定”。同一个场景反复测,系统每次都能通过,信度很高。就是”每次考的分数差不多”。
效度是”测的是不是想测的东西”。极端场景通过率这个指标,测的是”训练数据覆盖率”,不是”通用驾驶能力”。“考的是背功,不是脑子”。

雅思考试的信度系数常年0.85以上,分数很稳定。但教育学界从不认为雅思高分等于英语能力强,因为应试技巧可以大幅拉高分数。分数高只说明”会考试”,不说明”真会用”。
极端场景通过率就是智驾的”雅思分数”,高信度,低效度。记住这个类比,后面会用到。是不是觉得”高信度低效度”这种说法很绕?那就记住一句话:分数稳定,但测的东西不对。
2026年《国际人工智能安全报告》明确指出:”基准测试通常无法预测在现实世界的表现。”。原因是数据污染(data contamination),意思是模型在训练时已经”见过”测试题了。
这跟学生提前拿到考试答案一个道理。分数虚高,不代表真懂。数据污染让”测试结果”失去了”预测能力”。
有团队对283个AI评测基准做了分析,结论也证实:AI评测存在三大问题,数据污染、文化偏见、静态评测局限。
知道自己不会什么,比证明会什么更重要
美军特种部队(海豹突击队)的单兵作战能力远超常规军。但五角大楼从不用特种部队执行常规阵地防御。
不是因为做不到,而是因为”知道自己的角色边界”比”证明自己什么都能做”更重要。就是,”别逞能”。
智驾系统的安全性,也不是由”能通过多少极端场景”决定的。能过极端场景不等于能过日常场景,就像特种兵能打不一定能守。

真正重要的,我觉得是三个东西:
OOD泛化
:没见过的场景能不能搞定。就是训练数据没覆盖的情况,系统还能不能做出合理反应。
元认知
:知道自己什么时候不行。大多数AI系统压根没有这个能力。
优雅降级
:不行了能安全退出。而不是硬撑着往前冲,最后搞出事故。
极端场景测试,都没测这三个。
安全的底线不是”什么都能搞定”,而是”知道自己什么时候该停下来”。
ODD(Operational Design Domain,运行设计域)框架是行业评估智驾系统的标准方法。名字很长,意思很简单:划一块地盘告诉系统”你只能在这块地盘里干活”。系统的”能力边界”是人为画定的,不是系统自己感知的。它的核心是”系统知道自己不能做什么”,而不是”系统能做什么”。
当ODD条件不满足时,自动驾驶系统应该触发优雅降级(说白了就是”不行了就体面退出”):安全停车,而不是硬撑。“知道自己不行了就乖乖靠边停”,比”硬撑着往前冲”安全一万倍。
1939年,心理学家韦克斯勒做了一件事:把IQ测试从单一”智力年龄”分数,拆成四个维度,言语理解、知觉推理、工作记忆、加工速度。因为他发现,用一个数字衡量一个人的认知能力,根本说不清楚。记住这个名字,韦克斯勒。他把”一个分数”拆成”多个维度”,这个思路正在被智驾行业复制。从”考一门课”变成”考四门课”。
智驾正在经历同样的”韦克斯勒时刻”。从单一极端场景通过率,转向多维能力矩阵。一旦评估维度变多,那些靠”刷分”刷出来的成绩就藏不住了。
毕竟,真正安全的车,不是”什么场景都能搞定的车”,而是”知道自己什么时候该停下来的车”。这句话放人身上好像也成立。
收个尾
评估方法不升级,能力再强消费者也看不出来。
智驾的能力评估,正从”秀极限操作”走向”看全面表现”。下次看发布会,别只盯极端场景,多关注系统在模糊地带的表现。那才是区分”背答案”和”真理解”的分水岭。是不是觉得看发布会的姿势都得升级了?

如果也在关注智驾能力评估,欢迎在评论区聊聊看法。
安全评价基于公开测试数据,不构成购买依据本文数据来源于公开渠道,仅供参考对比评价基于个人体验和公开数据,存在主观成分
本文内容基于公开信息和个人体验撰写,仅供参考。如有疏漏,欢迎指正。
作者提示含AI生成内容。作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~
