17. 2026-184,#每日学习卡##具身智能#
开始学习《具身智能机器人系统》
1、行业面临的5个主要问题:(1)应用场景的不确定性,选择何种场景进行技术突破时一个重大挑战,这主要是机器人需要操作的任务类型极为多样且复杂所致。且任务的多样性和复杂性对机器人的算法设计提出了高要求,特别是在环境适应性、动态决策制定及精确控制等方面。(2)产业链成本高企,核心挑战在于具身智能机器人尚未实现规模化应用。(3)系统集成难度较大,主要源于缺乏具体应用场景和技术的不成熟,如在大脑、小脑和肢体的关键技术开发上还是孤立的技术点,并未形成有效的技术联动。(4)数据瓶颈,高质量、大规模且多样化的数据是机器人学习与决策能力提升的核心,数据的精确性直接影响机器人执行精密任务的性能。而实际环境中的机器人测试和数据采集成本高、耗时长,且缺乏数据共享,不同机构在相似项目上重复投入资源,造成了劳动和资源的浪费。(5)伦理规范,机器人的自主性和交互性会带来一系列伦理问题,如保护人类的个人隐私和自由、复杂的社会活动中不会有悖伦理等。
2、具身智能的传统技术方向:
(1)基于行为的人工智能,强调通过简单行为的层叠来创建复杂动作,重视与物理世界的互动。这种方法反对需要复杂内部模型或大量计算,提出智能可以从简单行为生成模块的互动中产生。
(2)受神经生物学启发的人工智能,即从生物大脑的实际结构和过程中汲取灵感,核心观点有:情感的普遍性,认为机器人理论上也能具备情感;情感的神经基础,强调神经调节现象对理解情感的形成、维持及其与其他行为和认知过程的相互作用的重要性;情感的功能角色,情感的主要功能是实现信息的多级交流;情感与机器人的实现,认为理解情感的功能和机制将有助于在机器人技术中模拟和应用情感,以提高机器人的适应性和互动性。
(3)认知发展机器人学习,侧重于机器人如何以模仿人类发展心理学的方式从环境中学习,认为认知是即时事件、认知嵌入在物理世界中、认知是非静态系统、多模态感知、探索与社会互动等。
(4)进化机器人学,将机器人视为在与环境的密切互动中自主发展技能的人工生物,无需人类干预,它大量借鉴生物学和行为学的理论,使用神经网络、遗传算法、动态系统和生物形态工程等工具,首先随机创建一个初始的人工染色体群体,每个染色体编码一个机器人的控制系统,并将其放入环境中。每个机器人根据其遗传指定的控制器自由行动(移动、观察、操纵),同时自动评估其在各种任务上的表现。表现最佳的机器人通过交换遗传物质并伴随少量随机变异“繁殖”。此过程重复进行,直到“诞生”一个满足性能标准的机器人。
(5)物理体现与互动,强调人工智能的物理形态及其与环境的互动在认知过程中的作用,认为认知过程深深植根于身体与其周围环境的互动中。具体观点有:具身与思维,我们能够形成的思维类型基于我们的具身性,即我们的形态和身体的物质属性;通过构建来理解,即如果我们知道如何设计和构建智能系统,就能更好地理解智能的本质;具身智能的意义,通过认识到思维与身体的密切关系,我们可以从新的角度理解智能的工作机制和发展潜能。
3、赋能具身智能机器人的基础大模型分类
(1)视觉基础模型VFM,如ResNet、VGG和Inception等,通过强大的特征提取能力改善机器人对复杂环境的识别效率,但它们依赖大量标注数据,在未见过的环境中泛化能力有限。
(2)视觉内容生成模型VGM,如GAN和VAE(变分自编码器),能生成新的视觉内容,帮助机器人系统进行模拟训练或增强现有训练集,但生成图像可能存在偏差,训练过程复杂且资源消耗大。
(3)大语言模型,如GPT-4、BERT和Transformer,增强了机器人的语言处理能力,使其能更流畅地与用户进行自然语言交互,但需要海量文本数据进行训练,需要庞大的计算资源。
(4)视觉语言模型VLM,如CLIP和DALL-E,结合了视觉与语言的处理能力,使机器人能更全面地理解环境中的视觉及语言信息,带来了更好的环境适应性,但对数据的质量和多样性要求极高。
(5)大型多模态模型LMM,如Perceiver IO和Multimodal Transformers,通过整合多种传感信息,提升了机器人对环境的总和理解能力,但模型结构的复杂性和对数据一致性的高要求是其挑战所在。