在多模态大模型领域,如何高效融合语音与文本仍是一大挑战。新国立大学提出的MoST模型,通过其创新的MAMoE架构,利用模态特定与共享专家混合策略,实现了语音和文本的无缝集成。该模型在多项基准测试中展现出超越同参数量模型的性能,为处理口语问答、语音识别等复杂任务提供了新思路,其技术架构与实现路径值得深入探讨。
智能速览
MoST模型核心为MAMoE架构,专为语音文本融合设计。
采用模态特定与跨模态共享专家混合策略。
在TTS和口语问答等多项基准测试中性能领先。
直接处理连续音频波形,保留更丰富的声学信息。
训练管线包含LLM后训练与混合指令微调两个阶段。
精华内容
MoST的卓越性能源于其独特的架构设计。MAMoE如何精准调配专家资源,实现模态间的协同与互补?其训练管线又如何确保模型能力的全面与稳定?
模态感知专家混合
MoST模型的核心是其提出的MAMoE架构,这是一种专为语音和文本集成设计的多模态MoE架构。它通过模态指示符将输入标记导向特定专家组,而非标准MoE的模态无关路由。
该架构包含两个互补组件:模态特定专家组和跨模态共享专家组。前者专注于捕获各自模态(语音或文本)的内在模式,后者则作为信息桥梁,促进跨模态任务的知识转移与对齐。
连续音频波形处理
与依赖离散音频标记化的方法不同,MoST直接处理连续的音频波形,这有助于保留更丰富的声学细节信息。
输入的音频波形会通过一个冻结的HuBERT编码器,被编码成连续的特征并投影到模型的维度。文本输入则经过标准的标记化和嵌入处理。最终,这两种不同模态的嵌入会被组合成一个统一的输入序列供模型处理。
高效两阶段训练
MoST的训练管线设计得十分高效,主要分为两个阶段。首先是从预训练的MoE LLM进行初始化,并进行目标交叉模态后训练,利用大型ASR和TTS开放数据集来启动模型能力。
随后是混合指令微调阶段,使用精心策划的语音-文本指令数据集进行训练,同时混入大量ASR/TTS数据,以防止模型对基础语音处理能力的灾难性遗忘。
智能路由决策
MAMoE的核心在于其模态感知路由机制。该机制会根据每个标记的内容和模态指示符,动态地将其导向最合适的专家。
具体步骤包括:首先计算原始门控分数,然后创建模态特定掩码,应用该掩码调整分数,最后选择Top-K专家并计算加权的专家输出,从而实现了计算资源的高效、精准分配。
基准性能验证
MoST模型在多个基准测试上均表现出色,性能超越了现有的同参数量模型。在TTS任务上,MoST在LS-Clean、VoxPopuli-V1.0-en和Common Voice 15-en数据集上取得了最先进性能,其WER/CER指标分别达到了6.0%、10.1%和11.5%。
在更具挑战性的口语问答任务上,MoST在Llama Q任务上达到了74.8%的得分,展现了其强大的泛化与理解能力。
MoST模型通过MAMoE架构,为多模态大模型的语音文本融合提供了高效且性能优越的解决方案。其对连续音频的直接处理和创新的训练管线,也为后续研究开辟了新路径。未来,这种专家混合的思想能否被拓展到更多模态,或在更大规模参数上展现出更强的潜力,值得期待。