张大妈

上交:一个模型搞定情绪与风格说话人脸

源自小红薯:每日ComputerScience

01-18 21:14

ESGaussianFace这项新研究,解决了音频驱动说话人脸技术中的一大难题:如何让生成的面孔不仅能口型同步,还能表达丰富情绪和特定艺术风格,同时保持3D视角的稳定和实时渲染。它提供了一个统一的解决方案,对数字人发展有重要价值。

上交:一个模型搞定情绪与风格说话人脸智能速览

  • 基于3D高斯溅射,首次统一情绪与风格控制。

  • 提出ESAM机制,实现语音与情绪的精细化解耦。

  • 采用双高斯形变预测器,避免控制信号相互干扰。

  • 多阶段训练策略,确保身份稳定与表情自然。

  • 推理速度达70FPS,是首个支持情绪、风格与多视角的方案。

上交:一个模型搞定情绪与风格说话人脸精华内容

传统方法在情绪、风格和多视角一致性上难以兼顾,ESGaussianFace通过一套创新框架,在单一模型内实现了这些特性的高效协同,展现了技术上的重大突破。

核心挑战与框架

音频驱动的说话人脸生成技术长期面临一个核心矛盾:如何在保证唇音同步和多视角一致性的基础上,实现可控的情绪表达与艺术风格迁移。现有方案往往顾此失彼。ESGaussianFace基于3D高斯溅射(3DGS)技术,构建了ADFA(Artistic and emotional stylization for Drivable Faces)框架。这是一个统一的解决方案,首次在单一模型中整合了对情绪、风格、多视角一致性和实时渲染的全部需求,为解决该领域的根本性问题提供了新思路。

关键技术解析

为了实现精细控制,该框架引入了情绪-音频引导的空间注意力机制(ESAM)。该机制通过音频信号引导注意力集中于口部区域,确保口型同步的精准性;同时,利用情绪信号引导注意力控制眼睛、眉毛等表情敏感区域。这种设计实现了语音与情绪在空间上的解耦与协同。此外,还设计了双高斯形变预测器,分别独立预测情绪形变和风格形变,从根本上避免了两种不同控制信号间的相互干扰,显著提升了表情的准确性和风格的可表达性。

分阶段训练策略

为避免端到端训练容易导致的表情塌陷、身份信息漂移和风格细节失真等问题,ESGaussianFace采用了创新的分阶段训练策略。该策略将训练过程分解为三个循序渐进的阶段:首先,模型在中性状态下学习基础的唇部运动;接着,引入情绪数据,学习生成带有情绪的微表情;最后,再加入艺术风格数据,学习特定风格的形变。这种逐步增加任务复杂度的方法,有效保障了最终生成效果的稳定性和高质量。

性能与效果实测

在性能方面,ESGaussianFace表现卓越。基于显式的3D高斯点表示,其推理速度可达约70FPS,远超传统的NeRF系列方法,完全满足实时交互需求。在MEAD与RAVDESS等权威数据集上测试,其PSNR、SSIM、FID、LPIPS以及情绪准确率等关键指标全面领先于现有技术。更重要的是,它是目前唯一能够同时支持情绪表达、风格迁移和多视角渲染的方案,且在多视角切换下保持了稳定的3D结构,无明显抖动或漂移。

ESGaussianFace为更生动、个性化的数字人应用铺平了道路。它证明了通过巧妙的框架设计,可以攻克复杂的多模态协同问题。未来,这项技术能否在影视、虚拟主播等领域掀起变革?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章