这份梳理横跨2021至2025年,深入分析了计算机视觉领域的核心演进脉络。它清晰地揭示了技术从萌芽、爆发到走向实用的全过程,帮助准研究生和从业者快速锁定如多模态大模型、3D生成、高效架构等关键研究方向,把握学术前沿动态。
智能速览
多模态大模型正从感知向推理与执行能力深度演进。
3D Gaussian Splatting已成为新一代3D重建与生成的标准表示。
以Mamba为代表的高效架构正在挑战Transformer的统治地位。
自动驾驶感知范式成熟,并与生成式世界模型结合,追求预测能力。
2022年被视为“AIGC元年”,扩散模型成为图像生成主流。
2023年以GPT-4V为代表,视觉语言模型能力实现重大突破。
精华内容
回顾近年计算机视觉的发展,可以清晰地看到一条从基础理论创新到应用场景深化的路径。技术浪潮如何一年年更迭,并最终塑造了当下的研究格局?
AI生成元年
2021年是扩散模型爆发的奠基之年,为后续的AIGC浪潮埋下伏笔,同时自监督学习成为探索通用视觉表示的核心方向。
到了2022年,技术正式迎来爆发,被称为“AIGC元年”。扩散模型彻底确立了在图像生成领域的主流地位,而CLIP的成功则催生了大量多模态理解的研究。同期,神经辐射场技术热度达到顶峰,出现了大量加速与优化工作。
多模态与3D革新
2023年,以GPT-4V的出现为标志,视觉语言模型的能力边界被极大拓宽,展现出惊人的理解与交互能力。这一年,AIGC全面爆发,扩散模型的应用从图像延伸至视频和3D领域。
在3D视觉方面,NeRF与新兴的显式表示方法——3D Gaussian Splatting的结合成为研究热点,为更高效、高质量的3D重建开辟了新路径。
技术走向实用
2024年的研究重点从“有没有”转向“好不好用”,技术开始深度结合具体场景。多模态大模型的追求目标变为更强的推理、泛化和专业领域能力。
3D Gaussian Splatting成为新的显式3D表示标准,并与扩散模型等生成技术紧密结合,催生了丰富的应用。在自动驾驶领域,以鸟瞰图和占据网络为核心的感知范式成为主流,并开始与生成式世界模型结合以提升预测能力。
智能新纪元
进入2025年,研究前沿进一步向“具身智能”演进。大模型不再满足于“能看会说”,而是追求“能推理、能执行”,以解决复杂任务。
在架构层面,以Mamba为代表的状态空间模型开始在视觉各领域全面开花,其高效的序列建模能力对Transformer的统治地位发起了挑战。感知任务也进一步与世界模型、生成模型融合,追求更高层次的场景理解与预测。
纵观这五年的发展,计算机视觉领域经历了从底层架构创新到上层应用智能的深刻变革。掌握这些关键脉络,不仅能帮助理解当前的技术热点,更能启发对未来方向的思考。当生成、感知与推理能力进一步融合,下一个技术奇点将在何处出现?