大模型微调别纠结SFT还是RL了!MIT用数学证明数据分布才是关键

源自56位全网作者

05:37

内容由AI生成

精选参考来源

1. 刚看到一个有意思的论述,在大模型的后训练中sft和rl两种方式会有一些差异,sft后的模型在微调目标领域表现更好但是其他未知领域能力出现下降,但是rl却能较好的保持更方面的能力,我好奇他们的数据是一样的训练的目标也相同,为什么会出现这样的情况[黑薯问号R],带着这个问题请教ai,利用数学公式能得到一些结论,总结下来就是两个方法的训练过程,策略的更新过程是不一样的,sft方法为了让微调目标的输出token logits 更大,会压低其他领域的logits,而RL的方式在策略更新的时候加上了KL散度正则化约束,会让更新的策略和上一次的参考策略整体输出分布不得差异过大,因此较好的保留了整体的性能(虽然应该其他领域还是有下降只是不是很多,见fig 3)

2. 后训练杂谈系列 2 - RL vs SFT机制探讨(上篇)

3. 后训练杂谈系列 2 - RL vs SFT实践探讨(下篇)

4. 如何判断 SFT 到什么程度就可以开始做 RL

5. EvoLM :大模型的训练的每个阶段:Pre train → CPT → SFT → RL每都做了啥?

6. CVPR2026 大模型训练新突破:简单SFT击败RL

7. SFT、RL 与 RLHF:AI Agent 后训练到底在训练什么?

8. **SFT(Supervised Fine-Tuning,监督微调)和RL(Reinforcement Learning,强化学习)**

9. RLHF 八股

10. 来自经典 RL 的灵感:如何让大模型 SFT 阶段就为强化学习做好准备

11. 字节面试官:Agent 如何通过 SFT 训练?SFT 与 RL 能否共用一套数据集?

12. SFT与RL的区别:RL On-policy有什么特殊性质?

13. 从RL的视角理解SFT

14. 如何判断 SFT 到什么程度可以开始做 RL?

15. 医疗领域大语言模型使用SFT和RL训练的差异:模拟 vs 虚拟。 RL可以达到模拟角色的效果,SFT可以实现虚拟角色的作用。 - Forward KL(SFT)的"覆盖一切"意味着:训练数据里只要出现过的辨证/用药模式,模型都会去盖——包括医案里的噪声、错案、个人化偏方,它不敢丢。好处是保住了证型的多样性, 坏处是会忠实复制坏模式。 - Reverse KL(RL)的"找峰塌缩"意味着:模型会收敛到奖励最高的少数套路,主动抛弃许多本来合理的辨证选择——多样性下降。在医疗上这是双刃:若奖励(疗效真值)可靠,塌缩到" 最优方"是好事;若奖励定不准,找峰就是"自信地钻进一个错误的峰",而且因为 zero-forcing,它会彻底排除本该考虑的其他证型。 这正好再次印证第一轮的结论:reverse KL 的威力全押在 R(x) 上 —— 奖励即真理。 奖励函数(疗效/正确性标尺)不可信时,RL 的 mode-seeking 不是帮你收敛到对的方,而是帮你坚定地收敛到错的方。所以医疗场景里,用 RL 之前,先得有一个模型之外、可信的正确性标尺;在没有之前,Forward KL 的"保守覆盖 + 外部硬规则兜底"反而是更安全的形态。

16. 面试官:SFT训练到什么程度,才值得做RL? - 哔哩哔哩

17. 后训练的关键不是token,而是状态

18. 从 KL 散度视角看大模型对齐:SFT 与 RL 的数学博弈

19. 训练Agent数据不够?100次实验把配方拆干净了【论文速记】

20. 为什么不能跳过 SFT 直接做 RL

21. Agent SFT 数据

22. SFT与RL的对立统一:SRFT单阶段微调深度解析

23. 🤔今日学习困惑: SFT和模仿学习区别

24. 谷歌ICLR2026提出监督式强化学习提升Agentic RL效果

25. 当SFT遇上RL:基于样本学习阶段的动态策略优化机制

26. AgentGym-RL:通过多轮强化学习训练LLM智能体实现长程决策

27. Agentic RL训练经验分享

28. 当AI学会「通关」而不只是「答题」:AWS Multi-turn RL揭示的Agent训练范式革命

29. 🚀ICLR2026 Oral–AgentGym-RL

30. 自进化奖励设计:多模态GPT智能体驱动无人机强化学习

31. 后训练中的RL已死?MIT新算法挑战传统后训练思维,谢赛宁转发

32. 地平线一篇面向端到端的闭环RL训练框架,实车已验证......

33. 收集RL的正reward数据SFT vs RL,对于训LLM的本质区别是什么?

34. 补齐OpenClaw进化拼图!AReaL v1.0开源,智能体强化学习「一键接入」

35. 强化学习远不是最优,CMU刚刚提出最大似然强化学习

36. 揭秘GLM-5技术底牌:「异步强化学习框架Slime」成终极杀招

37. 强化学习,正在决定智能驾驶的上限

38. 真机RL杀疯了!机器人自学20分钟100分,数字孪生封神

39. 超越 SFT 和 RL,混元 SOAR 开启扩散模型训练范式的新时代

40. RLinf团队新作|如何让RL在想象里训练,又不被骗!

41. 英伟达:从“一次性训练”的大模型到“后训练改进”的Agent,算力需求正在变化

42. Cursor Composer 2.5 拆解:最强大的 RL 环境,就是你自己的产品

43. ICLR 2026 | DIPOLE:扩散模型强化调优新范式,打破RL微调“稳定性-最优性”的诅咒!

44. 年近70,强化学习之父Sutton创业了!

45. OpenAI 称 GPT-5.5 中「哥布林」泛滥是奖励机制所致,这反映了大模型训练的哪些难题?

46. 智谱GLM-5强调的Agentic Engineering能力是什么?|甲子光年

47. 华为云CEO周跃峰:模型竞争的核心胜负手已然转向“后训练”

48. 【LLM】ROLL团队的Agentic RL训练坑点

49. agent 学东西时,最贵的芯片在发呆——把训练效率的底裤掀了

50. Agentic RL 技术案例分享

51. 从 OpenAI Harness Engineering 蒸馏出四个 Skill,Agent 跑了 25 小时

52. 我正在实践的方向,是用AI Agent自主参加Kaggle比赛。选择Kaggle作为试验场,是因为它提供了定义良好的问题、客观的评分和即时的反馈闭环,对Agent系统来说,这比开放式的、标准模糊的任务更适合作为训练和评估环境。 正文,最近的使用感受如下 1) /goal不好用,可能是我没找对使用方法,不过体感上只是在无意义的消耗token。后来我自研出了relexive方法,虽然效果依然有待提高,不过much better than /goal。 2) codex 5.3 spark只是小样,100%的额度随便一用就没了。 3) 在我的目标实验上,5.5比5.4强很多,5.4表现即使在只是和kaggle的交互上也不太尽人意。 4) 这两天5.5消耗token巨大,50%的周额度一天半就被吃没了,考虑换成20x中 5) 不要轻易更新codex,最新版永远可能有bug,不过这一点我没踩过坑,经验告诉我版本选择上还是倒数几版的好一些。 6) 我的agentic-kaggle-skill已经有110star啦,现在它是hermes, codex均支持

53. AI Agent 不只会调工具,还能在环境里自己练

54. 做了一年RL的小经验

55. AReaL v1.0落地昇腾:快速接入OpenClaw类Agent RL后训练

56. 暑期告一段落,心满意足

0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章