针对低空无人机视觉在复杂环境下成像退化、跨模态语义鸿沟及小目标检测等核心痛点,东南大学朱鹏飞教授团队提供了一系列系统性解决方案。其研究深度融合任务驱动学习与生成式大模型,构建了VisDrone等国际权威数据集,显著提升了智能无人系统的全天候感知精度与自动化水平,为行业提供了极具价值的研究视角与技术路径。
智能速览
构建了VisDrone、DroneVehicle等具有国际影响力的大规模基准数据集。
提出不确定性感知学习,有效解决低光照等极端条件下的跨模态检测难题。
开创检测驱动融合范式,使图像融合更好地服务于下游目标检测任务。
引入混合专家与适配器技术,实现了动态、自适应的通用图像融合。
利用扩散模型与掩码提示,推动了图像融合向可控、可交互方向演进。
研究成果有效应对了亮度波动、图像退化等实际应用中的挑战。
精华内容
低空复杂环境下的视觉感知是智能无人系统的核心难题。该团队通过一系列创新研究,系统性地探索了如何利用多模态信息融合与生成式技术,来突破成像质量、跨模态对齐与任务适应性的瓶颈。
数据基座构建
为推动无人机视觉算法发展,团队首先在基础数据建设上取得突破。其发布的VisDrone数据集是当时全球最大规模的无人机目标检测与跟踪数据集,涵盖中国14个不同城市的多种城市场景,吸引了全球超过100个团队参与相关挑战赛。随后,团队针对低光照车辆检测难题,构建了包含28,439对RGB-红外图像的DroneVehicle数据集,为跨模态感知研究提供了宝贵资源,并提出了不确定性感知跨模态检测方法UA-CMDet,有效提升了复杂光照下的检测性能。
任务驱动融合
团队意识到图像融合的最终意义在于服务于下游任务,由此提出了检测驱动融合网络DetFusion。该方法将目标检测网络的损失与特征反向引导至融合过程,使融合图像更有利于检测任务。在此基础上,团队进一步探索动态与通用融合机制。MoE-Fusion模型通过局部与全局混合专家网络,实现了样本自适应的图像融合。而TC-MoA框架则利用任务定制的混合适配器,在单一模型中成功统一了多模态、多曝光、多聚焦等多种融合任务,展现出卓越的泛化能力。
鲁棒性挑战
针对现实世界中亮度波动、图像退化等干扰因素,团队研发了多项鲁棒融合技术。BA-Fusion框架通过亮度自适应门控模块,动态调整特征选择,有效抵抗了环境亮度变化对融合图像质量的影响。CCF框架则另辟蹊径,将去噪扩散模型与自适应融合条件结合,实现了无需训练即可部署的条件可控融合。TG-ECNet模型则采用任务门控多专家协作网络,专门处理含噪、模糊、雾霾等退化情况下的多模态图像融合,显著提升了模型在恶劣环境中的鲁棒性。
语义交互前沿
研究的前沿转向了对语义信息的保留与用户的交互控制。TEDFuse网络引入任务驱动的等变一致性分解,确保融合图像在几何变换下保持语义一致,并直接提升了下游分割与检测任务的性能。最新的CtrlFuse框架则实现了更高维度的交互式控制,它通过掩码提示直接引导融合过程,允许用户动态指定感兴趣的语义区域进行融合优化。实验表明,该方法在融合可控性与任务精度上均达到领先水平,为未来人机协同的智能感知系统开辟了新路径。
东南大学该团队的研究从基础数据集构建,到任务驱动融合,再到鲁棒性与可控性的探索,形成了一套完整的技术体系。这些成果不仅为无人机视觉领域的理论发展贡献了诸多创新思路,更为智慧城市、自动驾驶、灾害救援等实际应用提供了坚实的技术支撑。未来,这些技术将如何重塑低空经济的应用生态,值得持续关注。