长期以来,视频到音频、文本到音频等任务被不同模型割裂,导致部署复杂且效果受限。Omni2Sound模型首次在单一框架内统一解决这三大任务,不仅在多项指标上达到顶尖水平,更提出了从数据、模型到训练的完整方法论,为高质量多模态音频生成开辟了新路径。
智能速览
Omni2Sound是首个在单一模型内统一V2A、T2A、VT2A三任务并达到SOTA的模型。
提出47万规模的SoundAtlas数据集,缓解音频歧义与跨模态语义冲突。
设计Agentic标注流水线,在成本下降约5倍的同时生成优于人类专家的音频描述。
采用语义与时间分支解耦注入的统一模型架构,灵活支持多任务无需结构切换。
三阶段渐进式训练策略,将任务间的零和竞争转化为协同优化。
构建VGGSound-Omni评测基准,全面检验模型在音质、语义与时序上的表现。
精华内容
要实现多模态音频生成的统一,核心挑战在于高质量数据稀缺与多任务间的训练竞争。Omni2Sound正是围绕这两大难题,提供了一套系统性解决方案。
数据难题的破解
高质量的多模态数据是统一模型训练的基石。为此,研究团队构建了名为SoundAtlas的大规模数据集,其规模达到47万,并覆盖了VGGSound与AudioSet等主流数据集。该数据集通过严格的视觉-音频一致性路由,有效缓解了音频生成中的歧义问题与跨模态语义冲突,为模型提供了高质量的学习素材。
更值得关注的是其标注流程。研究团队引入了一种多轮智能体接力标注流水线,通过“视觉到语言压缩”、“初级/高级Agent接力”以及“事后过滤验证”,实现了自动化标注。这一流程不仅将标注成本降低了约5倍,其生成的音频描述在语义准确性和时序对齐方面甚至优于人类专家,确保了数据集的卓越质量。
解耦的统一架构
在模型设计上,Omni2Sound基于标准的DiT扩散模型骨干,创新性地采用了双分支解耦注入架构。具体来说,模型设置了语义分支和时间分支。
语义分支通过跨注意力机制负责处理文本和视频的语义信息,而时间分支则利用AdaLN(自适应层归一化)和Synchformer结构,精确捕捉视频中的时序动态,保证生成音频与画面的同步。这种设计使得同一套模型结构可以灵活适配T2A、V2A和VT2A三种任务,无需针对不同任务切换网络结构,简化了部署流程。
三阶段训练策略
为解决统一训练下多任务相互干扰的难题,Omni2Sound提出了三阶段渐进式训练范式。第一阶段,模型首先进行大规模的T2A预训练,目的是建立一个稳健的音频生成先验知识。
第二阶段是关键,采用多任务交错训练。研究团队创新性地引入高质量的VT2A任务作为“语义桥梁”,巧妙地将V2A和T2A之间原本的零和竞争关系,转化为相互促进的协同优化过程。最后,第三阶段进行鲁棒性训练,通过Text Dropout(文本丢弃)和Off-screen Synthesis(画外音合成)等技术,消除模型对单一模态的依赖,增强其泛化能力。
全面评测与SOTA表现
为了公平、全面地评估模型性能,研究团队还构建了首个同时支持T2A、V2A和VT2A的统一评测基准VGGSound-Omni。该基准不仅包含常规任务,还额外增加了“画外音”和“背景音乐”等更具挑战性的子任务,用以系统检验模型的鲁棒性。
实证结果显示,Omni2Sound在VGGSound-Omni、Kling-Audio-Eval、AudioCaps等多个权威基准测试中,全面超越了现有的统一模型和专用模型。无论是在音质、分布匹配、语义一致性,还是时序同步等关键指标上,均取得了领先的SOTA(State-of-the-Art)表现,证明了其方法的有效性和优越性。
Omni2Sound不仅是技术上的突破,更提供了一套从数据构建到模型训练、再到评测的完整范式,展现了极强的工程落地价值。它的成功预示着多模态生成领域正走向更高程度的统一与高效,未来的AIGC工具是否会因此变得更加简洁与强大?