语音驱动数字人技术虽已成熟,但复杂微表情的生成仍是行业难题。MoEE研究巧妙运用混合专家模型,通过解耦基础情绪并灵活融合,成功实现了对复合情绪的精准合成。这一突破不仅显著提升了数字人的表现力,也为更自然的虚拟交互提供了全新技术路径。
智能速览
当前数字人模型普遍难以表达“又惊又喜”等复合情绪。
MoEE模型构建6个情绪专家,让每个模块专注一种基础情绪。
柔性门控机制能动态融合不同情绪特征,生成自然过渡的复合表情。
支持通过文字、语音情感和面部动作单元等多种方式灵活控制表情。
研究团队发布了包含150小时高清视频的新数据集,填补了行业空白。
在FID、FVD等关键指标上,MoEE全面超越AniPortrait等主流模型。
精华内容
那么,MoEE具体是如何解决这一行业痛点的?其核心框架设计、创新的数据集贡献,以及最终的生成效果,都值得我们深入探究。
表情生成瓶颈
当前主流的语音驱动数字人模型,虽然在嘴型同步上已做得相当出色,但在面部表情的细腻度上存在明显短板。它们往往只能生成单一的“开心”或“悲伤”,一旦遇到“又惊又喜”或“愤怒中带着厌恶”这类复合情绪,结果要么表情平淡,要么直接崩坏。
这背后的原因主要有两点:一是模型试图用一个网络“死记硬背”所有情绪,难以解耦不同情感的特征;二是行业内严重缺乏带有细粒度情绪标注的高质量数据集,限制了模型的学习能力。
专家分工协作
MoEE模型的核心思路是“让专人做专事”。它没有采用一个庞大的网络处理所有情绪,而是在内部训练了6个不同的专家模块,每个模块分别精通快乐、悲伤、愤怒、厌恶、恐惧、惊讶这六种基础情绪之一。
为了解决复合情绪问题,模型设计了一个关键的柔性门控网络。当输入“惊喜”这类信号时,门控网络会同时激活“快乐专家”和“惊讶专家”,并根据输入动态分配融合权重,从而生成非常自然的过渡表情。此外,其多模态对齐模块将文本、音频情感和AU标签映射到同一空间,实现了用文字、语音哭腔或直接调节参数的精细化控制。
数据与性能
为支撑模型训练与行业研究,该工作构建并计划开源一个名为DH-FaceEmoVid-150的数据集。这个数据集包含了150小时的1080P高清视频,不仅涵盖了6种基础情绪,还专门收录了“悲伤地恐惧”等4种复合情绪,有效填补了高清多情绪数据的空白。
在生成效果的量化评估中,MoEE模型展现了强大的实力。在FID(Fréchet Inception Distance)和FVD(Fréchet Video Distance)等衡量生成质量的关键指标上,其表现全面优于AniPortrait、Hallo、Echomimic等当前的主流模型,确立了新的技术标杆。
MoEE模型的提出,为数字人从“形似”走向“神似”迈出了关键一步。它不仅提供了行之有效的技术方案,更通过开源高质量数据集推动了整个领域的发展。未来,我们能否期待看到拥有更细腻情感、能与人类进行深度情感交流的虚拟助手呢?