张大妈

LLaVA模型演进:从图像到全场景

源自知乎:GuiltyBlack

01-15 18:43

本文系统梳理了LLaVA模型系列从LLaVA-NeXT到LLaVA-OneVision的关键演进。它不仅揭示了模型如何将能力从静态图像拓展至视频、多图乃至3D数据,更深入剖析了背后的技术方案与训练策略。对于想了解多模态大模型最新进展的读者,此文提供了清晰的技术路径和深度洞见。

LLaVA模型演进:从图像到全场景智能速览

  • LLaVA-NeXT通过AnyRes算法,将其能力从图像理解拓展至视频领域。

  • 消融实验表明,大规模数据清洗与处理对模型性能至关重要。

  • LLaVA-NeXT-Interleave实现了对多图、视频和3D数据的统一处理。

  • LLaVA-OneVision作为集大成者,整合了前期技术并使用了更高质量的数据。

  • 研究发现,混合多样的训练策略往往能获得更优的模型效果。

LLaVA模型演进:从图像到全场景精华内容

LLaVA系列的演进并非简单的模型堆叠,而是围绕数据、训练策略和模型架构的系统性优化。下面将深入剖析其关键节点。

迈向视频理解

LLaVA-NeXT最初为图像设计,但其核心架构AnyRes算法被巧妙地应用于视频理解,实现了零样本视频处理能力。

具体方案是将视频均匀抽取N帧,每帧调整尺寸后拼接成一个{1xN}的图像网格,模型便能像处理多图一样处理视频帧序列。假设每帧生成24x24个视觉Token,N帧视频的总Token数即为24x24*N。

为应对大语言模型4096的Token长度上限,研究者采用了空间池化(如2x2池化)来压缩每帧的Token数至12x12。实验表明,使用压缩后的Token处理16帧视频,能在性能和效率间取得较好平衡。

数据之外的影响

一项针对LLaVA-NeXT的消融实验研究,探索了数据之外影响视觉指令调优的因素。

该研究指出,尽管在大模型时代无法对每条数据进行精细化处理,但大规模噪声数据的清洗、过滤和伪标签生成等方案,对模型效果的提升依然直接且显著。

这强调了算法工程师在关注模型技术迭代的同时,必须同步提升对数据的敏感度和处理能力,利用工具高效提升数据质量是关键竞争力。

统一多模态输入

为解决LLaVA系列在多图、图文交错对话及3D理解上的短板,LLaVA-NeXT-Interleave被提出。

其核心创新在于将多图像、视频、3D及单图像数据统一表示为一种交错对话的训练格式,并为此构建了包含117.7万样本、覆盖14个任务的高质量数据集。

训练中的一个重要发现是,在完成第二阶段指令微调的模型基础上进行多图SFT,效果远优于直接在第一阶段预训练模型上进行,这再次印证了LLaVA第二阶段训练的重要性。

OneVision的整合

LLaVA-OneVision作为LLaVA系列的阶段性集大成之作,并未提出颠覆性的新技术架构。

它的成功在于系统性地整合了前述工作的技术方案,包括视频理解、多图处理等能力,并收集了规模更庞大、质量更高的训练数据。

这种“集成化+数据驱动”的思路,使得LLaVA-OneVision在多个视觉任务上实现了强大的任务迁移能力,展现了技术成熟后的收敛效应。

LLaVA系列的演进清晰地展示了多模态大模型从单一图像理解向全场景感知发展的技术路径。其成功不仅源于架构创新,更依赖于对数据和训练策略的持续深耕。未来,这种集大成与数据驱动的模式,是否会成为通用人工智能模型的主流范式?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章