大模型推理能力的提升,正从依赖构造数据的SFT转向更为高效的RL。本文深入探讨了这一趋势背后的原因,揭示了RL在激发模型内在潜力、形成自主思考模式上的独特价值,为理解当前AI技术前沿提供了关键视角。
智能速览
SFT虽有效但主要用于冷启动,其上限需要RL来突破。
RL的核心价值在于激发模型潜力,让其形成自主思考模式。
人工设计的思考模式可作为辅助,但不应是训练主力。
RL的成功依赖于longCoT、干净数据与稳定算法等多重条件。
预训练模型本身已具备强大能力,关键在于如何通过后训练有效激发。
精华内容
理解RL与SFT的本质差异,是把握大模型推理能力提升路径的关键。下面将从多个维度展开分析。
SFT的定位与瓶颈
监督微调(SFT)在模型训练的初期阶段扮演着不可或缺的角色,它为模型提供了基础的能力框架,是一种高效的冷启动手段。然而,SFT的上限相对明确,其效果高度依赖于训练数据的质量和覆盖范围。
当模型面对更复杂的推理任务时,SFT单独作用的效果会受限,数据间的相互干扰也可能影响模型的稳定性。因此,SFT虽重要,但要实现推理能力的质变,还需要更进一步的训练方法。
RL的核心价值
强化学习(RL)之所以成为提升推理能力的关键,在于它能够激发模型蕴藏的深层潜力。不同于SFT的直接模仿,RL通过奖励机制引导模型自主探索和优化其思考过程。
实践表明,让模型的思考模式自由发展至关重要,人工设计的思考链可以作为辅助,但不应成为主力。这种自由发展使得模型能够形成更高效、更符合逻辑的推理路径,有时甚至在解题效率上超越人类。
RL成功的条件
RL的强大威力并非总能轻易显现,它的成功依赖于多个关键条件的协同作用。首先,需要像longCoT(长思维链)这样的技术来支持模型的深度思考。
其次,广泛而干净的数据是保障训练质量的基础。最后,稳定的训练算法确保了整个过程的可控性和收敛性。只有当这些条件同时具备时,RL才能有效激发模型能力,否则其神奇效果便难以观察。
激发而非创造
一个常见的困惑是,为何一个看似“智障”的模型能通过RL训练后发生质变?答案在于,预训练模型并非真的能力不足,而是其强大能力处于被抑制的状态。
它们在海量数据学习中已经内化了复杂的知识,后训练(尤其是RL)的核心任务是找到正确的“钥匙”来解锁这些能力,而非从零开始创造。这解释了为何RL能带来如此显著的提升,它激活了模型已有的潜能。
综上,从SFT到RL的转变,标志着大模型训练进入了一个更注重激发内在潜力的新阶段。未来,如何更好地设计和引导模型的自主思考,将是推动AI实现更高层次智能的核心课题。探索最优的训练范式,仍然充满挑战与机遇。
关键评论
有观点认为,人工设计的思考链未必有害,Gemini 3 Pro的成功案例值得深入探究其对最终效果的影响。
部分读者认为,“模型解题进步比人快”的说法略显夸张,但对RL的整体价值表示认同。