理想OTA 8.3引入强化学习,推动VLA司机能力进化。实测一小时零接管,展现了其在复杂城区路况下的处理逻辑与技术突破。
智能速览
理想VLA司机引入行为强化学习,实现技术跨越
嘉兴晚高峰实测一小时,达成零接管成绩
闭环训练让AI学会在动态变化中进行连续调整
通过奖励函数博弈,平衡安全、舒适与通勤效率
细节处理优化,如红灯前缓慢蠕行不刹停
精华内容
技术演进犹如AlphaGo,强化学习让智能驾驶从模仿人类转向自我进化。
技术底层逻辑
智能驾驶的发展从规则驱动到端到端模仿人类,如今迈入了强化学习阶段。类似AlphaGo Zero,系统不再仅依赖人类数据,而是通过在世界模型中设定目标,利用海量仿真和真实数据进行闭环训练。
核心在于奖励函数的博弈,AI需要在保证安全底线的前提下,平衡变道顿挫少带来的舒适感,以及通勤高效带来的加分项。这种试错机制让VLA司机逐渐学会了更拟人的驾驶策略。
晚高峰实测表现
在嘉兴城区的雨天晚高峰测试中,车辆展现出了极高的拟人化程度。红灯前,车辆能够缓慢向前挪动而不将速度降为零,待绿灯亮起时顺势加速,这种跟车逻辑极大地提升了通行效率与乘坐舒适度。
面对汇入主路、避让临停公交车及穿插电动车等复杂场景,系统处理得丝滑果断。特别是闭环训练的应用,使得AI在变道过程中能根据车身位置变化实时调整轨迹,不再死板地执行既定路线。
细节场景处理
针对闪烁绿灯变黄灯的场景,系统能够提前预判并平稳刹停。在非对称无保护左转时,面对对向来车,它会耐心等待时机,并在通过路口后迅速回归车道。
不过测试中也发现了一些瑕疵。在360度大弯道时,车辆压线过于偏向弯心,需反馈数据优化。面对临时施工路段,虽有交警指挥,但未识别待转区,显示其在特殊路况下仍有提升空间。
记忆与持续进化
理想的记忆功能允许用户记录特定路段的限速信息,例如将限速30的路段设定为55,让系统越用越懂用户习惯。这种手动记录结合后台不断的强化学习训练,构成了双重进化机制。
虽然目前在斑马线掉头等细节上仍存在“脏数据”影响,但随着新一轮行为强化学习训练的开展,未来的VLA司机有望变得更像一位专业的专车司机。
行为强化学习让智能驾驶进入了深水区,尽管细节仍需打磨,但其展现的进化速度令人期待,未来驾驶体验值得畅想。