张大妈

【淘宝直播数字人互动LLM】告别AI感:基于真人ASR数据的拟人化探索

源自公众号:大淘宝技术

02-01 12:20

针对数字人直播中AI回复书面化、缺乏真实感的问题,一种基于真人ASR数据的拟人化训练方案被提出。该方法通过构建高质量数据对训练改写模型,并结合强化学习,使模型能直接生成自然口语化的回复。实验证明,在保持高准确性的同时,显著提升了交互的真实感与用户体验。

【淘宝直播数字人互动LLM】告别AI感:基于真人ASR数据的拟人化探索智能速览

  • 数字人直播的AI回复普遍存在书面化、AI感强的问题。

  • 通过构建数据对,可训练出专用的拟人化改写模型。

  • 结合GRPO强化学习,能训练出直接生成拟人化回复的端到端模型。

  • 严格的ASR数据清洗流程,是保证训练数据质量的关键环节。

  • 实验表明,新模型在保持92.0%准确率的同时,显著提升了交互自然度。

【淘宝直播数字人互动LLM】告别AI感:基于真人ASR数据的拟人化探索精华内容

要让数字人说话更像真人,关键在于训练数据。通过从真实直播语音中提炼并清洗数据,结合特定的模型训练策略,可以有效去除回复中的“AI感”,实现更自然的交互。

问题根源

当前数字人直播的互动模型,虽然能通过RAG、SFT等技术保证回答的准确性,但其回复风格普遍书面化、AI感强。这主要是因为大模型的训练数据本身带有书面语风格,导致生成的文本通过TTS转化后,听起来“一眼假”。业界尝试的提示词工程等方法,虽然有一定改善,但难以从根本上解决问题,用户体验依然受影响。

数据构建

拟人化效果的核心在于高质量的训练数据。研究团队创新性地从真人直播的ASR(语音识别)数据入手,但原始ASR数据存在大量噪声,如逻辑不通顺、重复和内容幻觉。为此,设计了一套自动化数据清洗流水线,包含ASR质量判定与修复、内容一致性对齐等多个环节。最终从3万条ASR数据中筛选并构建了3000多对高质量的训练数据,为模型学习提供了可靠的“教材”。

两阶段训练

训练分为两个阶段。第一阶段,基于清洗后的高质量数据对,微调Qwen2.5-7B模型,得到一个拟人化改写模型。该模型能将AI感强的书面化回复改写为自然口语化的表达。然而,这增加了请求延迟。为优化链路,第二阶段引入了强化学习。团队利用改写模型的推理结果训练了一个拟人化判定模型,并将其作为奖励信号加入到GRPO训练框架中。最终训练出的生成模型能够一步到位,直接产出准确、有帮助且高度拟人化的回复。

效果验证

实验结果验证了该方法的有效性。与旧版模型相比,优化后的模型在语序优化、重点卖点强调和书面化用语去除方面表现突出,回复更像真人主播。例如,在推荐商品时,会用“姐妹们看好了啊”等口语化表达拉近距离。量化评估显示,新模型在测试集上的准确率达到92.0%,帮助性达到97.0%。经过人工评估,85.5%的测试用例音频效果优于现有线上系统,成功实现了拟人化表现与任务能力的平衡。

这项探索成功从真人直播数据中提炼出“人情味”,让数字人交互不再冰冷。通过精细的数据清洗和创新的模型训练,显著提升了回复的真实感。未来,如何更精细地定义和量化“拟人化”,并将此方法应用于更复杂的场景,是值得持续探索的方向。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章