AI训练中,随着模型能力增强,大量简单题目因被完全掌握而失去训练价值,导致效率下降。Composition-RL方法通过智能组合现有题目,生成更高难度的复合问题,有效破解了这一瓶颈,显著提升了模型的推理能力与跨领域泛化能力。
智能速览
AI训练面临“漏水桶”困境,简单题目失去训练价值。
Composition-RL通过组合简单问题,自动生成高难度复合题。
该技术在4B至30B模型上均显著提升了推理能力。
课程学习策略,即逐步增加题目难度,可进一步增强训练效果。
该方法具备跨领域泛化潜力,优于常规混合训练。
精华内容
面对AI训练中数据利用率下降的瓶颈,Composition-RL另辟蹊径,其核心在于如何将“旧知识”转化为“新挑战”,从而推动模型能力持续突破。
漏水桶困境
随着大型语言模型能力的快速提升,训练集中越来越多的简单问题被完全掌握,通过率达到100%。这些被完全解决的问题无法再为模型提供有效的学习梯度,导致训练效率严重下降。这一现象被形象地称为“漏水桶问题”,即宝贵训练数据中的有效信息正在不断流失,使得模型训练陷入停滞,难以继续进步。
积木式出题法
Composition-RL的核心思想并非寻找全新数据,而是将AI已经掌握的简单问题进行智能组合。它通过设定变量,将多个独立问题串联起来,构建出逻辑链条更长、难度更高的新题目。例如,将第一个问题的答案设为变量X,再将X代入第二个问题中,迫使AI必须分步解决才能得出最终答案,从而将“舒适区”的旧题转化为具备挑战性的新题。
实测性能飞跃
实验数据证实了该方法的有效性。在30B参数规模的大型模型上,应用Composition-RL后,其在高难度的MATH数学竞赛基准测试中性能实现了21.4%的巨大提升。此外,这种效果具有普适性,从4B到30B不同规模的模型均能从中受益,且模型规模越大,性能增益也越显著,从3.3%提升至10.5%。
课程学习策略
为进一步优化训练效果,研究者引入了课程学习策略。该方法类似于人类的教学过程,先让模型解决简单的单步组合问题,待其掌握后再逐步增加问题的复合深度,挑战两步、三步甚至更复杂的题目。实验显示,每当问题的组合深度增加一个层级,模型的性能就会迎来一次新的突破,呈现出稳步上升的趋势。
两大理论支撑
Composition-RL的成功背后有两大理论支撑。其一是“组合泛化”,即通过解决复合问题,AI学会了如何灵活地组合和运用已有的单一技能。其二是“隐式过程监督”,由于复合问题的步骤环环相扣,AI必须确保每一步都正确才能得到最终答案,这相当于在无人监督的情况下,自我约束并学习了正确的解题过程。
这揭示了一个核心观点:在AI训练中,数据的质量与结构有时比其数量更为关键。这不禁让人思考,在我们看似已被榨干的数据海洋中,还隐藏着多少等待被巧妙发掘的宝藏,以引领下一次AI能力的飞跃?