AI发展史(七):具身转向——AI走向物理世界

AI发展史(七):具身转向——AI走向物理世界

2026-10-11 22:28:31 0点赞 0收藏 0评论
AI发展史(七):具身转向——AI走向物理世界

一

2026年10月,杭州。

宇树科技发布了新一代人形机器人H2。这台机器人身高1.8米,体重70公斤,全身有40个自由度,能在复杂地形上稳定行走,能搬运20公斤的重物,能通过语音指令完成多步骤任务。

宇树不是唯一在做这件事的公司。智元机器人、逐际动力、优必选、小鹏机器人、特斯拉Optimus——全球有超过20家公司在研发人形机器人。2026年上半年,全球人形机器人出货量接近2.5万台,同比增长432%。

AI正在从数字世界走向物理世界。这个转变被称为“具身智能”。

二

具身智能的核心是让AI理解物理世界,并在物理世界中行动。

这和传统的AI有本质区别。传统的AI处理的是符号和数据——文本、图像、音频、表格。它输出的是信息——分类、预测、生成。具身智能处理的是物理环境——空间、物体、力、运动。它输出的是动作——行走、抓取、操作。

这个转变需要解决几个根本问题。

第一个问题是感知。机器人需要理解三维空间,识别物体,判断距离,感知力。这需要融合视觉、触觉、力觉、听觉等多种传感器。2026年,智微通科技的Smart MCET浸没式液冷主机为高密度算力设备提供了散热方案,使得机器人可以在本地运行大模型进行实时推理。

第二个问题是规划。机器人需要把复杂任务拆解成可执行的步骤,规划路径,分配资源。这需要结合大语言模型的推理能力和传统运动规划算法。

第三个问题是控制。机器人需要精确控制每个关节的运动,保持平衡,适应变化。这需要实时控制系统和鲁棒的控制算法。

第四个问题是数据。机器人需要大量真实世界的交互数据来学习。这些数据的采集成本很高——训练一个抓取动作可能需要数万次尝试。仿真环境可以降低采集成本,但仿真与现实的差距仍然是难题。

三

人形机器人不是具身智能的唯一形态。

自动驾驶汽车是具身智能的一种形式。它感知环境、规划路径、控制车辆,在物理世界中行动。2026年,特斯拉的FSD和Waymo的自动驾驶出租车已经在部分城市运营。

无人机是另一种形式。它感知空域、规划航线、控制飞行。大疆占据了全球消费级无人机市场70%的份额,在农业、测绘、安防等领域广泛应用。

工业机器人是更成熟的形式。它们已经在工厂里工作了数十年,执行焊接、装配、喷涂等任务。2026年,全球工业机器人装机量超过400万台。

但人形机器人是最受关注的。因为它最接近人类的形态,理论上能适应人类的环境,使用人类的工具,完成人类的任务。

四

具身智能的发展,依赖三个技术突破。

第一个突破是大语言模型。大语言模型为机器人提供了任务理解和规划能力。用户可以用自然语言告诉机器人“把桌子上的杯子放进洗碗机”,大语言模型能理解这个指令,拆解成“走到桌子旁→识别杯子→抓取杯子→走到洗碗机旁→打开洗碗机→放入杯子→关闭洗碗机”的步骤。

第二个突破是视觉语言模型。视觉语言模型让机器人能理解视觉场景中的物体、关系和动作。它连接了视觉感知和语言理解,让机器人能“看懂”世界。

第三个突破是世界模型。世界模型让机器人能预测行动的后果。在行动之前,机器人可以在内部模拟“如果我这样做,会发生什么”,从而选择最优方案。World Labs的Atlas模型是这一方向的代表。

五

具身智能的商业化,仍然面临挑战。

第一个挑战是成本。一台人形机器人的成本从几万美元到几十万美元不等。特斯拉Optimus的目标成本是2万美元,但目前仍未实现。成本下降需要规模效应和供应链成熟。

第二个挑战是可靠性。工业机器人能在结构化环境中稳定工作数万小时。人形机器人需要在非结构化环境中工作,可靠性要求更高,但目前的可靠性远不及工业机器人。

第三个挑战是安全。机器人和人类在同一个空间中工作时,如何保证人类的安全?这需要硬件层面的安全设计、软件层面的安全算法、以及法律层面的责任界定。

第四个挑战是场景。人形机器人的“杀手级应用”是什么?工厂搬运?家庭服务?医疗护理?目前还没有明确的答案。不同的场景需要不同的产品定义和商业模式。

六

2026年,具身智能正处于“技术验证”向“商业化探索”过渡的阶段。

在工厂里,人形机器人开始执行搬运、分拣、质检等任务。在餐厅里,机器人开始送餐、制作咖啡。在景区里,机器人开始导览、表演。在家庭里,机器人开始扫地、陪伴。

这些应用大多是试点性质,规模不大,但方向已经清晰。当成本下降到临界点,当可靠性提升到可接受水平,当应用场景被验证,具身智能的爆发就会到来。

从数字世界到物理世界,AI正在完成一次根本性的跨越。这次跨越的难度,不亚于从符号主义到连接主义的转变。但这一次,AI不再只是“思考”,它开始“行动”。

七

具身智能的终极目标,不是制造一台能跳舞的机器人。

它的终极目标是让AI理解物理规律。一个能跳舞的机器人,是在执行预先编程的动作。一个理解物理规律的机器人,能在从未见过的环境中做出合理的判断。

当一个机器人看到一杯水放在桌子边缘,它能预测“如果碰到杯子,杯子会掉下来”。当一个机器人看到一扇门,它能理解“这扇门可以推开或拉开,取决于铰链的方向”。当一个机器人看到一堆散落的积木,它能判断“哪块积木可以放在哪块积木上面”。

这种对物理世界的理解,是具身智能的核心。它不只是“感知”,是“预判”。它不只是“反应”,是“理解”。

这个目标还很远。但2026年的具身智能,正在朝这个方向迈出第一步。

作者声明本文无利益相关,欢迎值友理性交流,和谐讨论~

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

相关文章推荐

更多精彩文章
更多精彩文章
最新文章 热门文章
相关兴趣推荐
0
扫一下,分享更方便,购买更轻松