当前位置:
转载文章详情

科大讯飞语音合成技术升级,赋予AI声音以“上下文情商”

2025-10-28 19:38:13

技术越发达,越要小心温柔。现在AI连呼吸节奏都能模仿,可真正的交流,或许不在于听上去多真,而在于对方是否真的在听。医院里陪诊的老人要是听见这声音,怕是要愣住——太像了,也太危险了

科大讯飞语音合成技术升级,赋予AI声音以“上下文情商”
AI为你总结

全文概述

科大讯飞语音合成技术升级,通过三阶段层次化语音建模框架和上下文感知系统,实现了声音复刻与超拟人合成。新技术不仅精准还原发音特征,还能根据对话情境调整语气,赋予AI声音以‘上下文情商’,提升自然度和情感表达。

语音合成技术突破

科大讯飞的全新语音合成技术包括一句话声音复刻和超拟人合成两大核心能力。通过星火底座大模型捕捉发音规律,并在音色恢复阶段解耦声学特征,最终通过高精度声码器生成高保真波形。该技术显著提升了语义LLM的建模稳定性。

三阶段层次化语音建模框架

科大讯飞构建了三阶段层次化语音建模框架:首先,通过星火底座大模型精确捕捉发音规律;其次,在音色恢复阶段解耦并重构声学特征;最后,通过高精度声码器恢复高保真波形。这种结构实现了发音内容与音色特征的可控分离。

上下文感知语音生成系统

科大讯飞开发了上下文感知的语音生成系统,融合历史文本及对应音频特征,通过跨模态编码器分析上下文,使AI声音能敏锐响应情绪转变和话题转换。在多轮对话测试中,合成声音的语气会实时调整,给出恰如其分的情感回应,整体自然度接近真人水平。

未来展望

科大讯飞研究院院长刘聪表示,希望声音不仅能作为工具,更成为承载情感与个性的新维度,赋能更多场景行业。随着技术进步,AI声音的多元化、情感化时代正加速驶入现实。

展开 收起
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

今日晴朗呀

Ta还没有介绍自己

关注
作者其他文章
最新文章 热门文章
0
扫一下,分享更方便,购买更轻松