受鸽子多光谱视觉启发,一项前沿研究将多模态传感与大语言模型结合,赋予机器人触觉“理解与描述”的能力。通过新型传感器SuperTac与语言模型DOVE,机器人首次能像人一样解读触觉信息,标志着具身智能感知能力的重大突破。
智能速览
灵感源自鸽子多光谱视觉与磁感知能力。
集成多光谱、摩擦电、IMU三大模态的超薄传感器SuperTac。
8.5B参数的DOVE语言模型,可将触觉信号转为自然语言描述。
系统具备物体材质识别、功能推断与对比分析能力。
预测速度低于6毫秒,满足实时交互需求。
精华内容
这项技术突破的核心,在于硬件与软件的协同进化。硬件层面,传感器如何超越人类感知极限?软件层面,大模型又如何解读复杂信号?
仿生鸽眼设计
该研究的核心灵感源于鸽子的视觉系统。鸽子不仅拥有对紫外光敏感的锥细胞,还具备能感知地球磁场的视网膜分子,能够综合处理复杂环境信息。基于此,研究团队提出了“多模态融合 + 光谱扩展”的设计思路,旨在打破传统视觉触觉传感器的光谱局限,让机器人获得更丰富的环境感知能力。
超薄多模态皮肤
为实现设计思路,团队开发了名为SuperTac的触觉传感器。其传感皮肤仅1mm厚,集成了四层功能结构,兼顾灵活性与高性能。传感系统整合了四大模块:多光谱成像模块,覆盖紫外(390nm)到中红外(5.5-14μm)四个波段,分别用于滑动检测、颜色识别、纹理力传感和温度测量;摩擦电采集模块,以1kHz频率采样,识别物体材质;IMU模块,捕捉3D姿态与加速度;以及用于辅助检测的照明模块。
触觉语言模型
与传感器协同的是DOVE触觉语言模型,这是一个拥有8.5B参数的大模型,基于Vicuna和CLIP编码器构建。它能够接收摩擦电、温度、颜色、纹理等多模态信号,并将其融合生成精准的自然语言描述,例如“黄色、室温、金属质地、表面有均匀凸起纹理”。更进一步,该模型还能对比两个物体的触觉差异,并结合语义知识推断物体用途,如识别出PET材质的黄色瓶子。其单次预测速度小于等于6ms,满足实时交互需求。
该研究通过“硬件多模态融合”与“软件大模型赋能”的创新结合,成功让机器人触觉迈入认知层面。未来,这项技术或将深度融入精密制造、医疗手术及服务机器人中,人机协作的边界在哪里?