端到端语音对话模型长期受制于成本高、音质与语义难兼顾、文本能力遗忘等瓶颈。阿里巴巴通义团队提出的Fun-Audio-Chat,通过一系列架构与训练范式创新,在不依赖大规模预训练的前提下,实现了高质量、低成本的语音对话,为新一代语音大模型的工程化落地提供了新思路。
智能速览
Fun-Audio-Chat通过5Hz低帧率推理,训练GPU小时数减少约50%。
双分辨率语音表示兼顾了5Hz高效推理与25Hz高保真合成。
Core-Cocktail训练范式有效缓解了多模态训练中的文本LLM遗忘问题。
多任务DPO后训练显著提升了真实交互场景下的指令跟随与共情能力。
全双工交互模式支持自然打断与轮换对话,体验更接近真人交流。
精华内容
语音大模型如何在压缩成本的同时不牺牲性能,甚至实现更自然的交互?阿里通义团队的Fun-Audio-Chat给出了系统性答案,其架构与训练范式创新值得关注。
压缩推理成本
为解决语音与文本时间分辨率不匹配及计算成本高昂的问题,Fun-Audio-Chat创新性地提出了双分辨率语音表示(DRSR)。该方法通过语音token grouping技术,将原本25Hz的语音流压缩至5Hz,再输入共享的LLM主干进行推理,序列长度大幅缩减。
这一设计使得训练所需的GPU小时数相比主流12.5-25Hz方案减少了约50%,显著降低了推理延迟与部署成本。同时,在生成阶段,模型会通过Speech Refined Head(SRH)模块恢复25Hz的细粒度语音,确保了输出音质的保真度,实现了效率与音质的兼顾。
攻克遗忘难题
多模态训练常常导致文本LLM出现灾难性遗忘。为此,团队设计了Core-Cocktail训练范式。该范式采用两阶段策略:第一阶段使用高学习率对模型进行音频任务的快速适配,然后将多个中间模型进行合并。
最关键的是,它会将第一阶段训练好的模型与原始的文本LLM按特定比例进行融合,最后再以低学习率进行精修。这种“融合-精修”的思路,有效保留了LLM原有的强大文本理解与生成能力,同时成功赋予了其语音交互能力。
提升交互体验
为了更好地对齐人类偏好,Fun-Audio-Chat在监督微调后引入了多任务DPO(直接偏好优化)进行后训练。这项任务覆盖了真实场景下的语音鲁棒性、语音指令跟随、音频理解以及语音共情等多个维度,显著提升了模型在复杂环境下的交互表现。
此外,其全双工模式允许用户与模型同时说话,实现了接近人类的自然打断与对话轮换,摆脱了传统一问一答的僵化模式,使交互过程更加流畅和智能。
统一建模架构
在底层架构上,Fun-Audio-Chat采用了并行的语音-文本联合模型。在模型的assistant端,它会同时对语音流和文本流进行建模,并通过统一的自回归方式生成输出。
这种设计使得模型能够实现语音与文本的同步输出,有效避免了传统级联系统中因信息传递造成的损失,为高质量、一体化的语音对话体验奠定了坚实的技术基础。
总的来说,阿里通义的Fun-Audio-Chat通过一系列精巧的设计,系统性地攻克了语音对话大模型的核心痛点,在计算效率、性能表现和交互体验之间找到了一个出色的平衡点。它代表了一种务实且高效的工程化路径,预示着更智能、更自然的语音助手将加速到来。