这篇文章通过一位在特斯拉Optimus团队工作过的博士后的亲身经历,深入探讨了当前机器人控制领域的技术路线之争。它揭示了在模型预测控制(MPC)和强化学习(RL)的较量中,前者在实践中的困境,以及RL带来的颠覆性突破。这不仅是技术选择的反思,更是对知识价值和研究方向的深刻思考,为关注人工智能和机器人学发展的人提供了独特的内部视角。
智能速览
在人形机器人全身控制上,强化学习(RL)已被证明优于模型预测控制(MPC)。
作者博士期间钻研的数值优化等“屠龙之技”,在RL面前显得无用。
切换到RL技术后,仅用一个月便实现了让机器人跑步上山的效果。
过去坚持可解释的、基于物理公式的控制器,导致了错失技术浪潮。
回顾职业生涯,多次错过参与强化学习早期开创性工作的机会。
精华内容
技术的更迭有时冷酷而迅猛。一位博士后的亲身经历,揭示了在通往通用人工智能的道路上,固守的理论如何撞上现实的南墙。
MPC的困境
2024年,在人形机器人学界,关于全身行走运动控制应采用模型预测控制(MPC)还是强化学习(RL)的争论愈演愈烈。在特斯拉Optimus团队,一位拥有博士学位的工程师投入了巨大精力,试图将MPC技术应用于全尺寸人形机器人。经过一整年的努力,动用平生所学,最终的结果却不尽人意,实践证明MPC方案的表现远不如RL方案,这一结果给研究者带来了巨大冲击。
屠龙之技的失落
这位工程师在博士期间花费了整整两年时间,深入研究数值优化,手动推导KKT条件,应用ADMM算法,甚至钻研Eigen底层代码,编写稀疏矩阵的分块求解器。这些在传统控制领域被视为高深且极具价值的技能,在RL的浪潮面前却显得毫无用处。痛定思痛后,他转向了强化学习技术,结果仅用了一个多月的时间,就成功调出一个神经网络控制器,让机器人实现了跑步上山,其效果和效率之高令人震惊。
错过的浪潮
追溯过往,这种错失并非偶然。2017年,曾拿到伯克利博士的offer但未选择前往;2021年在英伟达实习时,参与了Isaac Gym和Isaac Lab的早期开发,但也没有投身RL。这一切选择源于一个根深蒂固的科研理念:坚信机器人控制器应该是全面可解释、可控制的,其行为应由物理学规律和数学公式详细推导,而非由神经网络的隐变量决定。正是这份对理论纯粹性的坚持,让他在机器人学突破性进展的时期,与最前沿的工作擦肩而过。
这位博士的经历是技术发展浪潮中的一个缩影,它提醒我们,在科研和工程领域,坚持与变通同样重要。当一条路走不通时,勇于拥抱变化或许是更明智的选择。未来,AI技术将如何融合可解释性与强大能力,值得每一位从业者深思。
关键评论
有评论认为,在Optimus项目中未能取得成果,说明数学功底和学术嗅觉同样关键,不应完全否定一种技术路径。
有网友感慨,坚持个人信念在技术发展中未必能换来满意结果,过程或许会更加曲折。
有观点指出,学者与工程师的关注点不同,前者追求方法可解释,后者注重工程实效,这种差异导致了路径选择的分歧。
有评论将其经历类比为“the bitter lesson”(苦涩的教训),指出了计算能力增长往往会压倒人类试图赋予计算机的显式规则。