针对数字人直播中AI回复书面化、缺乏真实感的问题,一种基于真人ASR数据的拟人化训练方案被提出。该方法通过构建高质量数据对训练改写模型,并结合强化学习,使模型能直接生成自然口语化的回复。实验证明,在保持高准确性的同时,显著提升了交互的真实感与用户体验。
智能速览
数字人直播的AI回复普遍存在书面化、AI感强的问题。
通过构建
数据对,可训练出专用的拟人化改写模型。 结合GRPO强化学习,能训练出直接生成拟人化回复的端到端模型。
严格的ASR数据清洗流程,是保证训练数据质量的关键环节。
实验表明,新模型在保持92.0%准确率的同时,显著提升了交互自然度。
精华内容
要让数字人说话更像真人,关键在于训练数据。通过从真实直播语音中提炼并清洗数据,结合特定的模型训练策略,可以有效去除回复中的“AI感”,实现更自然的交互。
问题根源
当前数字人直播的互动模型,虽然能通过RAG、SFT等技术保证回答的准确性,但其回复风格普遍书面化、AI感强。这主要是因为大模型的训练数据本身带有书面语风格,导致生成的文本通过TTS转化后,听起来“一眼假”。业界尝试的提示词工程等方法,虽然有一定改善,但难以从根本上解决问题,用户体验依然受影响。
数据构建
拟人化效果的核心在于高质量的训练数据。研究团队创新性地从真人直播的ASR(语音识别)数据入手,但原始ASR数据存在大量噪声,如逻辑不通顺、重复和内容幻觉。为此,设计了一套自动化数据清洗流水线,包含ASR质量判定与修复、内容一致性对齐等多个环节。最终从3万条ASR数据中筛选并构建了3000多对高质量的
两阶段训练
训练分为两个阶段。第一阶段,基于清洗后的高质量数据对,微调Qwen2.5-7B模型,得到一个拟人化改写模型。该模型能将AI感强的书面化回复改写为自然口语化的表达。然而,这增加了请求延迟。为优化链路,第二阶段引入了强化学习。团队利用改写模型的推理结果训练了一个拟人化判定模型,并将其作为奖励信号加入到GRPO训练框架中。最终训练出的生成模型能够一步到位,直接产出准确、有帮助且高度拟人化的回复。
效果验证
实验结果验证了该方法的有效性。与旧版模型相比,优化后的模型在语序优化、重点卖点强调和书面化用语去除方面表现突出,回复更像真人主播。例如,在推荐商品时,会用“姐妹们看好了啊”等口语化表达拉近距离。量化评估显示,新模型在测试集上的准确率达到92.0%,帮助性达到97.0%。经过人工评估,85.5%的测试用例音频效果优于现有线上系统,成功实现了拟人化表现与任务能力的平衡。
这项探索成功从真人直播数据中提炼出“人情味”,让数字人交互不再冰冷。通过精细的数据清洗和创新的模型训练,显著提升了回复的真实感。未来,如何更精细地定义和量化“拟人化”,并将此方法应用于更复杂的场景,是值得持续探索的方向。