张大妈

JoVA: 基于统一多模态学习的联合视频-音频生成

源自公众号:VisualAI

01-21 13:14

现有视听生成模型普遍存在架构冗余或唇形同步不佳的问题。JoVA框架提出了一种创新的统一学习方案,通过联合自注意力机制实现视频与音频Token的直接交互,并引入嘴部区域特定损失强化监督。这一设计不仅简化了模型结构,更在关键指标上实现了超越,为高保真视听内容生成提供了新思路。

JoVA: 基于统一多模态学习的联合视频-音频生成智能速览

  • 现有方法依赖额外模块且缺乏语音生成能力。

  • JoVA采用联合自注意力机制,实现跨模态直接交互。

  • 引入嘴部区域特定损失,精准解决唇形同步难题。

  • 在人像基准测试中,口型同步准确性(LSE-C)显著优于竞品。

  • 小规模JoVA-1.6B模型表现超越更大规模的现有模型。

JoVA: 基于统一多模态学习的联合视频-音频生成精华内容

深入探究JoVA的实现细节,其核心优势在于架构的简洁性与监督的精准性。从联合注意力机制到嘴部区域损失,每一项设计都直指当前多模态生成的痛点。

统一架构设计

传统方法通常为视频和音频设计独立的数据流,再通过交叉注意力等融合模块进行对齐,导致架构复杂且信息交互不畅。JoVA摒弃了这种设计,将视频、音频及文本条件Token直接拼接,输入到共享的Joint Self-Attention层中。这种机制允许不同模态的信息在Transformer的每一层都进行直接、双向的交互,无需额外的对齐模块,显著简化了模型结构并提升了信息流动效率。

精准唇形同步

在视听生成中,实现高精度的唇形同步是一大挑战。嘴部区域在画面中占比小(约2.3%),而对应的音频特征在时间上很短暂,全局注意力难以捕捉这种细微关联。为此,JoVA提出嘴部区域特定损失。该方法通过面部关键点检测定位嘴部区域,在训练时对该区域的VAE潜在空间表示施加额外的加权监督,从而强力引导模型学习唇动与语音的精确对齐,且不增加推理时的计算开销。

性能实测对比

实验数据充分证明了JoVA的优越性。在UniAvatar-Bench人像场景测试中,JoVA的口型同步指标LSE-C得分高达6.64,远超Universe-1的1.62和OVI的6.41;同时,其语音识别错误率WER仅为0.18,表明生成的语音清晰度极高。在更通用的Verse-Bench上,JoVA的LSE-C与SOTA模型相当,同时在音频分布一致性和视频美学上保持领先,证明了其全面的生成能力。

小模型大潜力

JoVA的架构优势在低资源场景下尤为突出。实验显示,一个仅3.2B参数的JoVA-1.6B模型,在仅使用190万训练样本的情况下,LSE-C得分便达到6.20。这一成绩显著优于参数量7.1B、训练数据640万的Universe-1,并能媲美10.9B参数的OVI模型。随着模型规模扩展至24B参数,各项性能指标进一步提升,展现了极佳的扩展性与落地潜力。

关键设计验证

通过消融研究,JoVA验证了其核心设计的必要性。实验表明,若不使用嘴部区域监督,模型的LSE-C会骤降至1.39,几乎无法同步。此外,对比发现,传统的交叉注意力融合机制(即使加入线性适配层)在LSE-C指标上(1.63)也远逊于JoVA的联合自注意力(6.64),证明了后者的信息交互效率更高,是实现高精度对齐的关键。

JoVA的工作验证了通过精简架构实现高效多模态对齐的可行性。其联合自注意力机制与嘴部感知监督策略,为后续研究提供了宝贵的新范式。这种追求简洁与高效的思路,或将推动生成式AI向着更通用、更易部署的方向发展,未来可期。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章