大模型微调别纠结SFT还是RL了!MIT用数学证明数据分布才是关键
源自56位全网作者
05:37
精选参考来源
1
刚看到一个有意思的论述,在大模型的后训练中sft和rl两种方式会有一些差异,sft后的模型在微调目标领域表现更好但是其他未知领域能力出现下降,但是rl却能较好的保持更方面的能力,我好奇他们的数据是一样的训练的目标也相同,为什么会出现这样的情况[黑薯问号R],带着这个问题请教ai,利用数学公式能得到一些结论,总结下来就是两个方法的训练过程,策略的更新过程是不一样的,sft方法为了让微调目标的输出token logits 更大,会压低其他领域的logits,而RL的方式在策略更新的时候加上了KL散度正则化约束,会让更新的策略和上一次的参考策略整体输出分布不得差异过大,因此较好的保留了整体的性能(虽然应该其他领域还是有下降只是不是很多,见fig 3)
2
后训练杂谈系列 2 - RL vs SFT机制探讨(上篇)
全部
来源
来源
内容由AI生成
0
0
0评论
当前文章无评论,是时候发表评论了
提示信息
取消
确认
评论举报
已收藏
去我的收藏夹