传统强化学习在训练AI推理时存在“信用分配”难题。一种名为“干预训练”的新范式通过让AI自我检查并修正错误步骤,有效解决了这一问题,显著提升了模型的推理准确率。
智能速览
传统强化学习存在“信用分配”缺陷,无法精准定位推理错误。
“干预训练”让模型自我检查并生成精准的修正步骤。
该方法仅对错误步骤进行修正,高效且成本低。
经InT训练的模型在数学推理基准上准确率提升近14%。
InT为后续的强化学习训练提供了更优质的初始模型。
精华内容
“干预训练”如何精准解决AI的推理难题?其核心在于赋予模型自我审视和修正的能力。
RL的困境
传统强化学习在训练AI推理时面临一个核心困境,即“信用分配”难题。它只根据最终答案的对错来评判整个推理过程,这就像一个学生即使解题步骤全对,却因最后笔误而被判错分。反之,一个靠猜测得到正确答案的过程也可能被全盘肯定。这种粗糙的评判机制,让AI无法识别推理链中真正出错或正确的步骤,从而限制了其推理能力的提升。
精准干预
为解决此难题,研究团队提出了“干预训练”范式。其核心是利用模型自身能力进行验证和修正。模型首先生成一个推理过程,然后通过与参考答案对比,定位到第一个错误步骤。接着,模型会针对这一步提出一个精准的“干预”或替代方案。随后,通过监督微调,模型会学习强化这一修正步骤及之前正确的部分,同时降低错误步骤出现的概率。这种方法无需复杂的价值函数,训练效率很高。
效果显著
实验证明,InT的效果十分突出。在高难度的国际数学奥林匹克竞赛基准IMO-AnswerBench上,经过InT训练的模型相较于40亿参数的基线,准确率提升了近14%。这一提升幅度甚至超过了一些规模更大的开源模型。更重要的是,经过InT训练的模型能为后续的强化学习提供更好的起点,展现出强大的潜力。
“干预训练”通过精细化的自我修正机制,为大语言模型的推理能力提升开辟了新路径。这种方法不仅高效,还为模型的持续进化奠定了基础。未来,这种自我纠错的思路能否在更多领域带来惊喜?