当前大型语言模型的训练依赖人工标注数据,这在规模化上遇到了瓶颈。腾讯混元团队提出的新范式RLPT,巧妙地将强化学习直接应用于海量预训练数据,通过自监督机制提升模型的深层推理能力,为探索LLM的能力边界提供了全新视角。
智能速览
RLPT是一种在预训练数据上进行强化学习的新训练范式。
它旨在解决监督学习和传统强化学习难以规模化的问题。
其核心是将token级监督转为语义片段级的强化学习。
通过自监督的生成式奖励模型,摆脱了对人工标注的依赖。
实验证明RLPT能稳定提升模型在通用及数学推理任务上的性能。
模型性能随计算量投入呈幂律增长,显示其可扩展潜力。
精华内容
RLPT的核心创新在于其自监督的强化学习框架,它如何构建数据、定义任务并设计独特的奖励机制,从而在不依赖外部标注的情况下,有效提升模型的推理能力,以下是详细解读。
核心机制
RLPT将传统基于token级别的监督学习,升级为基于语义片段(如句子)级别的强化学习。其训练数据被构造成特定的三元组格式:上文、目标预测片段和下文。
基于此,框架设计了两个互补任务:自回归片段预测(ASR)和掩码片段重建(MSR)。ASR任务要求模型根据上文预测紧接着的语义片段,锻炼其前向生成能力。MSR任务则同时利用上文和下文,要求模型补全中间缺失的片段,增强模型的双向理解和整合能力。这两个任务在训练中交错进行,共同优化模型的推理与生成质量。
自监督奖励
RLPT的自监督特性源于其独特的奖励机制,它不依赖外部标注,而是通过一个生成式奖励模型来评估模型预测与真实文本的语义一致性。
该模型接收预测片段和真实片段,并判断两者语义是否等价。一个关键设计是“前缀奖励”机制,即不要求预测与单个真实片段完全匹配,而是判断预测是否为后续多个真实片段序列的语义有效前缀。这比“严格奖励”更稳定,能有效鼓励模型生成更长、更完整的推理链条,从而最大化训练效益。
性能验证
为验证RLPT的有效性,研究团队在Llama3和Qwen3系列的多个模型上进行了广泛实验。结果显示,在MMLU、GPQA-Diamond等多个通用领域基准测试中,RLPT带来了稳定且显著的性能提升。
尤其在极具挑战性的数学推理任务上,应用RLPT的模型表现出色,其Pass@1和Pass@8指标均有明显增长,表明该方法同时增强了模型的“利用”和“探索”能力。研究还发现,RLPT的性能与训练计算量之间呈现出幂律关系,证明了其作为一种可扩展训练范式的巨大潜力。
为何有效
RLPT之所以能带来深层推理能力的提升,是因为模型在复杂的RL环境中自主学习到了类似“思维链”的内在推理模式。
在面对“下一片段推理”任务时,模型并非直接给出答案,而是展现出一种结构化的多步骤思考过程,先定义问题,再进行推导,最后得出结论。这种在探索中为了最大化奖励而自发形成的策略,是RLPT超越传统监督学习、挖掘数据深层逻辑结构的关键所在。
RLPT为大型语言模型的训练时扩展提供了创新思路。它证明了通过在数据自身中构建奖励信号,强化学习能够有效解锁预训练数据的深层价值,培养出能力更强的语言模型。这种范式是否将成为未来大模型训练的主流方向,值得持续关注。