清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型

源自公众号:AI科技评论

01-19 14:39

大语言模型的幻觉问题是阻碍其落地应用的关键难题。清华大学孙茂松团队与深言科技联合提出的FaithLens模型,开创性地将“解释”作为训练信号,让模型不仅判断内容真伪,更能说明依据。这一方法使一个8B参数规模的开源模型,在多项幻觉检测任务中性能超越GPT-4o等闭源大模型,为构建更可靠、低成本的AI系统提供了全新思路。

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型智能速览

  • FaithLens模型将幻觉检测提升为对推理过程与证据一致性的评估。

  • 仅8B参数的FaithLens在12项跨领域任务中超越多款闭源大模型。

  • 研究采用监督微调与强化学习结合的框架,并通过三重过滤机制保障数据质量。

  • 模型生成的解释能有效帮助其他模型做出正确判断,提升了透明度。

  • 该方案在保证精度的同时,大幅降低了推理成本,更利于大规模部署。

清华孙茂松团队 × 深言科技:以解释作为训练信号,让 8B 模型在幻觉检测上反超闭源大模型精华内容

这项研究的突破并非偶然,其背后是一套精心设计的训练框架,将可解释性从副产品变为核心驱动力。

性能反超

FaithLens 的核心实验结果令人瞩目。在一个覆盖 12 个跨领域数据集的综合性评测中,该模型以 8B 的参数规模,在忠实性幻觉检测的整体性能上超越了包括 GPT-4.1、GPT-4o、o3 和 Claude 3.7 Sonnet 在内的所有对比闭源大模型。

这些任务涵盖了新闻摘要、检索增强问答、事实核查等广泛场景,具有高度代表性。特别是在需要综合多个证据进行推理的 HoVer 任务上,FaithLens 的领先幅度更为显著,表明其具备结构化推理能力,而非简单的浅层模式匹配。与 AlignScore、FactCG 等专用检测系统相比,FaithLens 不仅表现更优,且性能方差最低,证明了其强大的鲁棒性与泛化能力。

巧用数据

高质量训练数据是模型成功的基石。研究团队并未采用昂贵的人工标注,而是利用强大的推理模型生成包含推理链条、自然语言解释和标签的合成数据。

为保证数据质量,团队设计了一套三层过滤机制。第一层过滤标签正确性,确保学习样本的准确无误。第二层过滤则关注解释的实用性,通过检验“解释能否降低模型预测的困惑度”来剔除冗余或误导性信息。第三层过滤通过句向量聚类来保障数据的多样性,防止模型过拟合于简单样本,使其充分学习各类幻觉模式。

强化解释

在监督微调之后,研究进入更关键的强化学习阶段。此阶段的目标是让模型主动优化解释质量,而非简单模仿。团队采用 GRPO 算法,通过一组候选输出的相对表现来更新模型,无需训练额外的奖励模型,效率更高。

奖励设计的创新是核心。除了奖励预测正确和格式完整外,最关键的是“解释质量奖励”。团队引入一个较弱的新手模型作为裁判,如果 FaithLens 生成的解释能帮助这个新手模型更容易做出正确判断,就给予奖励。这种“以教促学”的方式,成功引导模型生成对他人真正有用的解释,而不仅仅是自我感觉良好的描述。

范式转变

这项工作的意义超越了单纯的性能提升,它标志着幻觉检测从“黑箱判别”向“透明可解释”的范式转变。以往的检测工具仅输出对错,用户无从知晓判断依据,也无法复核。FaithLens 则清晰地指出错误所在、推理断层,使系统变得可审查、可信赖。

这一突破有效解决了先进闭源模型性能强但成本高、开源模型成本低但性能不足的现实矛盾。它证明了通过创新训练方法,中等规模模型完全可以在关键任务上实现性能与成本的双重优势,极大地提升了可信AI技术落地应用的可能性。

FaithLens的研究证明,将可解释性作为核心优化目标,是攻克大模型幻觉难题的有效路径。它不仅为构建低成本、高可靠性的AI系统提供了范例,更重要的是树立了新的行业标准:未来的智能系统,答案与可追溯的依据缺一不可。这种“解释即能力”的思想,会否成为下一代可信AI的基石?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章