张大妈

这方法让AI学会自我纠错,推理能力提升14%

源自小红薯:代码熊大模型论文分享

01-29 20:06

传统强化学习在训练AI推理时存在“信用分配”难题。一种名为“干预训练”的新范式通过让AI自我检查并修正错误步骤,有效解决了这一问题,显著提升了模型的推理准确率。

这方法让AI学会自我纠错,推理能力提升14%智能速览

  • 传统强化学习存在“信用分配”缺陷,无法精准定位推理错误。

  • “干预训练”让模型自我检查并生成精准的修正步骤。

  • 该方法仅对错误步骤进行修正,高效且成本低。

  • 经InT训练的模型在数学推理基准上准确率提升近14%。

  • InT为后续的强化学习训练提供了更优质的初始模型。

这方法让AI学会自我纠错,推理能力提升14%精华内容

“干预训练”如何精准解决AI的推理难题?其核心在于赋予模型自我审视和修正的能力。

RL的困境

传统强化学习在训练AI推理时面临一个核心困境,即“信用分配”难题。它只根据最终答案的对错来评判整个推理过程,这就像一个学生即使解题步骤全对,却因最后笔误而被判错分。反之,一个靠猜测得到正确答案的过程也可能被全盘肯定。这种粗糙的评判机制,让AI无法识别推理链中真正出错或正确的步骤,从而限制了其推理能力的提升。

精准干预

为解决此难题,研究团队提出了“干预训练”范式。其核心是利用模型自身能力进行验证和修正。模型首先生成一个推理过程,然后通过与参考答案对比,定位到第一个错误步骤。接着,模型会针对这一步提出一个精准的“干预”或替代方案。随后,通过监督微调,模型会学习强化这一修正步骤及之前正确的部分,同时降低错误步骤出现的概率。这种方法无需复杂的价值函数,训练效率很高。

效果显著

实验证明,InT的效果十分突出。在高难度的国际数学奥林匹克竞赛基准IMO-AnswerBench上,经过InT训练的模型相较于40亿参数的基线,准确率提升了近14%。这一提升幅度甚至超过了一些规模更大的开源模型。更重要的是,经过InT训练的模型能为后续的强化学习提供更好的起点,展现出强大的潜力。

“干预训练”通过精细化的自我修正机制,为大语言模型的推理能力提升开辟了新路径。这种方法不仅高效,还为模型的持续进化奠定了基础。未来,这种自我纠错的思路能否在更多领域带来惊喜?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章