模型确实开始按你教的方式说话了,但随手一测就发现不对:以前会答的题现在不会了,以前有的常识现在丢了,语气被微调数据带得越来越不像原模型。这不是玄学,也不是你的数据有问题——灾难性遗忘是神经网络最根深蒂固的毛病之一,切换到一个新游戏,模型在前一游戏的得分就会掉到随机水平。微博微调场景里的遗忘更隐蔽:下游数据通常很窄,全量微调很容易把预训练阶段学到的广泛先验拉向少量示范里的局部模式。知乎模型在训练分布内变强,一出分布提问,旧能力立刻现出原形。

为什么一定会遗忘:这是目标函数写好的
微调不是把模型"弄坏"了,它只是忠实地优化了你给的目标。在同一组共享参数上,训练目标从"保持旧任务"切换成"只优化新任务",旧的损失直接从目标函数里被删掉了,预训练权重只能决定从哪出发,约束不了最终走到哪。知乎

新任务的梯度会沿着旧函数敏感的方向移动参数,训练时又根本见不到旧数据,没有任何力量把模型往旧解的方向拉。表征是共享的,一次参数更新会同时影响大量旧输入,当许多样本的分类间隔一起越过决策边界,性能不是缓慢下滑,而是突然崩塌——这就是"灾难性"三个字的由来。

从损失曲面看,这个矛盾更直白:同一条参数轨迹,对新任务是下坡,对旧任务就是上坡。你让模型变得更"专业"的每一步,对旧能力都是一次失血。
圈内真正在用的,是急救包而不是新论文
翻一圈社区讨论会发现,生产环境真正依赖的办法出奇地保守。感觉生产环境最稳的还是那些传统办法:lora,小lr,weight decay,replay,之类的。知乎这里面最常被点名的就是 LoRA:它的防遗忘逻辑最直接——不动大部分参数,只学一小块低秩增量,参数变化量有界,破坏半径就有界。LoRA 论文也验证过,低秩矩阵合并进原权重后不引入额外推理时延,省显存不牺牲线上性能。

但要清楚:LoRA 不是遗忘疫苗。它只是用更小的改动半径降低了遗忘概率,学习率开太大、轮数跑太多、数据太偏,LoRA 照样会忘。
最便宜的保险:给数据掺点"沙子"
经验回放是最老的想法:微调数据里掺一部分通用数据,让模型学新任务时持续见到"旧世界"的样本。实操项目里,通用数据掺沙子配合课程学习,已经是解决微调遗忘的成熟路数。知乎掺多少有实测参照:NeurIPS 2025 oral 论文 EvoLM 用上百个从头训练的模型做控制变量实验,发现纯领域 CPT 会导致通用能力急剧遗忘,混入 5% 通用回放数据可完美缓解,该实验找到的最优配比是 8B 通用加 42B 领域 token。知乎两个结论值得记住:
掺沙子不是随手撒的偏方,配比是需要认真调的超参数;
没有放之四海皆准的比例,5% 是特定设置下的测量值,你的掺沙起点要结合自己的数据规模去摸。
RL 后训练也会忘,而且忘得更隐蔽
RL 阶段的遗忘不像"不会了",更像"只会一种解法"。为什么许多经过 RL 微调的模型,虽然 Pass@1 提升了,但在允许多次尝试时,Pass@k 反而下降了?36氪模型更擅长一次押中正确答案,却丢掉了原本丰富的解题路径。

罪魁祸首是大家都习以为常的散度项。反向 KL 本质上是 mode-seeking 的,会推着策略向少数高概率模式收缩。被 ICLR 2026 接收的 DPH-RL 工作给出的思路是:缓解多样性崩塌与遗忘,未必需要复杂化奖励设计,先把 divergence 项选对。
前沿正在攻"零遗忘"
MIT 提出的 SDFT(自蒸馏微调)让模型自己当自己的老师:一个模型扮演教师和学生两个角色,把专家示范转化成策略内的学习信号,在持续学习多项新技能的同时,实现了几乎"零遗忘"的能力积累。36氪

连 LoRA 这种被认为更安全的路线也有了专门研究:OPLoRA 用正交投影,在参数高效微调中防止灾难性遗忘。知乎"用了 LoRA 就不会忘"这条经验本身,也正在被改写。
动手训练前,先过四道检查
先试 LoRA/QLoRA,效果不够先加大 rank,再考虑全参微调;
领域继续预训练要混入通用回放数据,从 5% 起步调配比,纯领域数据直冲是最危险的开法;
学习率开小、轮数控住,过拟合的多轮训练是记忆效应和遗忘的主要来源;
给旧能力留一组回归测试:训练前测一遍通用能力,训练后复测;RL 阶段别只看 Pass@1,Pass@k 一起看。
遗忘不是运气差,是目标函数在照章办事。把防御做进训练配方里,永远比训完再发现模型"变笨"要便宜。