越训越差?5万条脏数据喂出的LoRA,为什么反而不如基座——微调社区这两周的答案正在收敛
8月26日,知乎上出现一个提问:「做模型微调时,数据清洗一般占整个项目周期的多少比例?」提问者晒了自己的翻车现场。知乎不到24小时,第二个几乎同款的问题也跟了上来,提问者自述5万条带噪声的业务数据训出来,效果反而比基座模型还差。知乎下面的回答给了一个扎心的区间:微调项目里,数据清洗通常占整个周期的一半到七成,宁可要2万干净样本也不要5万脏数据。知乎
一周之内两个同款提问,不是一个人搬运。我把这一周知乎、B站、小红书、微博上关于「微调」的讨论翻了一遍,结论是:2026年玩大模型微调的人,卡点已经变了。
一、权重拿不到的时代过去了,摔在效果上的人变多了
先看背景。8月29日智谱官宣开源GLM-5.3权重,明确支持本地运行与个性化定制。微博8月31日,DeepSeek又把V4-Flash-Vision-Exp的权重直接传上了HuggingFace,MIT协议、无商业限制。微博微博上一条「国产大模型开源节奏加快、中小企业可以基于开源基座做行业微调」的话题拿了2013个赞。微博
工具端也在同步削门槛:Unsloth官方宣布支持Qwen3.8-27B微调,成了独立开发者口里的单卡福音。小红书甚至有人把8B模型的训练、评测、导出塞进了4GB显存。知乎
换句话说,「拿不到权重、训不动」的问题基本消失了。但社区的另一半声音立刻涌了上来——训是训起来了,效果呢?微博
二、四个争论簇:大家以为自己在吵参数,其实吵的是数据
超参簇。 「LoRA超参调优:rank、alpha、target modules与学习率怎么设」这类教程供给充足,共识是LoRA微调效果不好,先查rank、alpha、target modules而不是换更大的模型;LoRA学习率一般要比全参微调高一个量级,先拿小批量在1e-5到1e-3之间扫。哔哩哔哩但这类内容的播放量大多停在几百到一千的量级——看的人有,急的人不多。
显存簇。 「LoRA显存悖论:只训1%参数,为什么显存没等比例下降」是个反直觉的好问题;知乎那篇「做模型微调时,为什么显存规划比盲目堆GPU更重要」给出的共识是:容易卡住的往往不是卡不够多,而是显存、并行策略和软件环境没匹配好。知乎
遗忘簇。 「为什么大模型在微调后,就失去了通用能力?」这个知乎问题累计浏览1.7万+,是所有微调疑问里浏览量最高的之一;B站的「灾难性遗忘的五种缓解方法」收藏比点赞还高。知乎
数据簇。 真正跑出热度的是它:B站8月21日那条《震惊!90%的人LoRA训练失败,竟然不是参数问题?》播放12543、收藏481。哔哩哔哩小红书8月26日有人直接放话:应用效果不达预期,九成问题根本没到需要微调的程度。小红书
热度分布本身就是信号:讲超参、讲显存的内容有人看,喊「你训炸是因为数据」的内容在被抢收藏。那个1.2万播放的视频评论区里,被认真讨论的也是数据集太小时低秩适配器的对齐空间不够、还是得自己找数据集这类问题。哔哩哔哩
三、为什么脏数据能把模型训得「不如不训」
这里有个反直觉的点,值得掰开说。全量微调时代,大家默认脏数据的问题是「学不好」;但在LoRA这种只训千分之几参数的玩法里,问题升级成了「学歪了」。知乎低秩适配器容量小,5万条噪声喂进去,它不会平均吸收,而是优先拟合最显著的分布——如果脏数据里格式错误、标注冲突、模板错位占比不低,模型学到的恰恰是这些错误模式,输出自然比基座还差。开头那位提问者的现象(5万条不如基座、2万条反超)不是玄学,是小容量适配器被噪声分布劫持的典型样本。
同样的逻辑换个马甲出现在强化学习微调里。小红书8月26日有人晒了自己的GRPO炼丹现场:用一个数学推理数据集微调大模型,格式和正确率都越学越差。小红书评论区几乎没人在讨论超参,方向都指向奖励函数、回复长度失控、先用SFT把格式冷启动稳住。「越训越差」的第一嫌疑永远是数据和奖励信号,不是rank。
还有一个更贵的对照组:微博7月底传开的FermiSense案例,用500美元GPU成本微调一个9B开放权重模型,在特定电商任务上准确率87.3%,反超GPT-5.5,成本还低了40到340倍。微博能打的从来不是「我也微调了」,而是「我的数据只覆盖这个任务、且足够干净」。
四、下次训练之前,先做这笔时间账
把上面的社区经验翻成可执行的自查,按顺序过一遍:
基线对照。 拿基座模型直接跑你的评测集。如果微调后不如基线,先停——这不是超参问题,大概率是数据或模板问题。
格式体检。 Chat template对不对、instruction/response字段有没有错位、截断有没有吃掉答案尾部。LoRA对模板错位的容忍度极低,错位等于给模型发假标签。成熟教程里「数据构建」从来都是排在调参之前的独立环节。知乎
去重与冲突检测。 同一问题两种答案,模型会两头不讨好。「2万干净样本强于5万脏数据」是社区反复验证的经验值,不是鸡汤。
难例抽样。 随机抽50条输出人工看,错误集中在格式、事实还是风格,决定你下一步该补哪类数据,而不是先调学习率。
预算倒挂检查。 如果你的项目里「准备数据」只占一两天、训练排期却有两三周,时间分配是反的。从业者的一致经验是清洗占周期的一半到七成——注意,这是社区经验,不是统计抽样,不同项目会浮动,但倒挂本身就是危险信号。
人群上也分开说:跟着教程跑的入门玩家,先用现成高质量数据集把流程跑通,别急着喂自己的脏数据;手上有业务数据的独立开发者和小团队,数据清洗才是你相对大厂基座的唯一护城河;想上GRPO/RL的,先把SFT格式关过了再说;企业私有化场景,省级政务云大模型私有化部署这波已经在从概念走向实操。知乎能借的思路是:数据治理预算要显式列出来,别全押在算力上。
五、留个边界
这篇能证明的是:近两周微调社区的讨论重心,确实在从「怎么训」向「拿什么训」转移,且知乎、B站、小红书、微博四个平台的从业者在大方向上收敛。它不能证明的是:所有微调失败都是数据问题。如果你的任务本身定义就不清楚,换一百份干净数据也救不回来——那种情况,先回去想清楚评测集到底在量什么。
开源基座还会继续变便宜,MIT权重还会继续往外甩。等到哪天「微调」像装机一样普遍,比拼的就是谁的脏数据洗得干净了。你现在的项目里,数据和训练的时间配比是多少?欢迎晒一下。