DeepSeek-R1之后,GRPO几乎成了炼丹圈的"出厂标配":工具链一年之内全部补齐——Unsloth把GRPO塞进了消费级显卡,LLaMA-Factory、VeRL、EasyR1把门槛压到零代码,6月刚开源的RL-Kernel专门解决训练显存爆炸。 门槛没了,但新的问题浮出来:能跑通的人和能跑得起的人,中间隔着一张账单。微信
恰好,中科大与上海人工智能实验室那篇RL后训练Scaling Law研究(《Scaling Behaviors of LLM Reinforcement Learning Post-Training》)被ACL 2026收录,研究团队基于Qwen2.5全系列0.5B到72B做了66组控制变量实验,把"预算到底该花在哪"量化成了一条幂律公式。 把论文、开源RL项目和社区踩坑帖摊在一起看,会发现三个反直觉结论——每一个都直接对应一次容易白烧机器的决策。知乎微信
账目一:算力受限时,"上更大的模型"是性价比最差的一笔
实验里最值钱的一条发现是那个叫k(N)的学习效率项:RL学习效率确实随模型规模上涨,但论文拟合显示,效率增益在32B之后开始明显缩水,渐近逼近一个理论上限。

这直接改写了预算逻辑。粗算一笔账:同样的批大小和序列长度,每步训练成本大致随稠密参数量线性上涨,72B每步约是32B的2.25倍;而算力总量固定的前提下,选72B意味着步数直接砍掉一半还多。落到成绩上,论文附录Table 4里RL后的Qwen2.5-32B与72B在其held-out测试集上只差了约2.7个百分点(0.590 vs 0.617)——多花一倍的钱买2.7个点,这就是效率饱和的真实价格。论文的结论与此一致:算力受限场景下,选32B这种"能训够步数的适中规模",很可能比把72B训个半吊子拿到更低的Test Loss;只有算力充裕、支撑得起足够步数时,大模型的效率优势才兑现得出来。 注意适用边界:这是数学推理任务、GRPO算法、Qwen2.5一代模型上的结论,它给的不是"别训大模型",而是一个排序原则——预算先买步数,再买参数。微信
账目二:该花的不是"更多独特题",而是"贴着能力边界的总步数"
66组实验给出的第二条规律:RL后训练的Test Loss与计算量、数据量之间呈对数线性关系,并且可以总结为一条统一的幂律公式——用小模型训几次,就能外推大模型的损失曲线。知乎
更省钱的是数据侧:固定总训练量、把数据复用因子τ从1拉到几十,各条τ曲线在同步数下几乎并行收敛,直到复用次数极高(比如100轮)才开始因过拟合拉开差距——数据受限时,性能主要取决于总优化步数,而非样本独特性。 换句话说,"题库买得不够多"大概率不是你的瓶颈,"题不够贴模型边界"才是。微信

论文的训练集配置就是示范:从guru-RL-92K里取约5万道数学题,先按Qwen2.5-7B的通过率做去重和难度排序;他们的held-out评测集有多难?GPT-OSS-120B在该测试集上的通过率也仅有66%,一半以上的外部对比模型不到50%——题目能"卡住模型",每一步更新才有信号。微信
同样的方向在别处反复出现:Prime Intellect训INTELLECT-2(基于QwQ-32B)时,训练集就是28.5万个可验证数学与编码任务,并且专门做了离线过滤,预先剔除对基模型过易或过难的题。 CMU那篇分离预训练、中期训练与RL因果贡献的可控实验,结论也是同一句话——RL只有当预训练留足提升空间、且RL数据针对能力边界上的任务时,才产生真正的能力增益。今日头条小红书
所以小预算的正确姿势是:把买更多题的钱,先换成给现有题做通过率过滤和分桶的脚本。
账目三:显存杀手经常不是模型大小,是你自己设的G
GRPO靠"组内PK"砍掉了PPO的Critic,四个模型变三个,显存理论上省一半——但很多人身不由己地OOM,凶手是采样组大小G。RL-Kernel项目方披露的计算路径:GRPO的logprob计算要临时分配[G×SeqLen×Vocab]的中间张量,以Llama-3-8B为例,词表128,256,G开到128时这一步就要额外吃掉62GB,直接把A100 80GB打满;他们自报的实测里TRL在G=64就崩了,PyTorch原生实现G=256崩。 数字出自项目方自己的仓库,方向却足够明确:G对显存是线性放大,而且乘的还是词表这个十万级的因子。知乎

同一个视角下还有两个更隐蔽的坑。其一是静态账没算对:7B模型全参数训练,参数14GB+梯度14GB+优化器状态84GB(Adam的FP32副本+动量+方差),仅静态显存就需要112GB,单张A100直接OOM——这就是ZeRO优先切优化器状态的原因,优先级高于折腾模型并行。 其二是框架口径差:多篇实战帖都遇到"明明sync=1、数据应该全新鲜,却有大量样本被重要性采样裁剪,且裁剪比例随训练上升",根因是vLLM/SGLang算出的logprob和HuggingFace不完全一致——不是RL算法玄学,是训推两套实现没对齐。MoE基座也别想当然:“激活参数少"不等于"占显存少”,30B-A3B加载后A100只剩约23GB可用(项目自报),RL-Kernel的实测为此把可用训练配置扩了6倍。知乎知乎
三条账之外:先确认你的任务配不配得上GRPO
最后一条不算预算,算止损线。GRPO的奖励必须"规则可验证",数学和代码是它的主场;一旦任务偏主观研判——分析报告、策略建议、审美向写作——社区的翻车样本已经够多:Rubric会被Goodhart定律刷分(规定"提到某词加分",模型就无脑堆词),把整体行文拆成得分点本身就是有损投影,再挂一个32B模型当Judge,微小的误判在成千上万步迭代里会被累积放大。有垂直领域开发者复盘后给的建议很直接:纯客观、强规则的任务上GRPO无可替代,偏经验、审美、策略的抽象研判直接用DPO做偏好对齐容错率更高。知乎
还有一个容易忽略的"能力倾斜":前述Scaling Law研究在8个评测域上的泛化测试发现,RL后训练能可靠强化域内推理,但向域外任务的迁移相当有限——专精与广度之间要付取舍费。 RL不是给模型"补课",更像"偏科手术",你花预算强化的那一科,可能要别的科目来买单。arXiv

一页决策表:把实测数据折进你的训练清单
你在纠结的事 | 实测数据给的方向 |
|---|---|
要不要换更大的基座 | k(N)效率渐近饱和,32B→72B只差2.7个点;算力受限先买步数、再买参数 |
要不要再买一批训练题 | 固定总步数下τ=100才开始露衰;先做通过率过滤、贴能力边界 |
OOM了要不要换大显存卡 | 先查G×SeqLen×Vocab中间张量和优化器状态,再考虑加卡 |
主观任务要不要上GRPO | 奖励可规则验证才上;否则DPO起步更稳 |
训完会不会"偏科" | 留出域外评测(代码/逻辑/指令),盯住非目标任务的回退 |
继续盯三件事:那篇ACL 2026研究的代码仓库已经放了实验图表与拟合结果,后续是否补全更大规模的复现值得跟踪;RL-Kernel这类专修GRPO显存曲线的基础设施迭代到什么程度;Kimi K3、GLM-5.3这一代旗舰的后续技术报告里,RL阶段的预算口径会不会披露——榜单最近反复展示"更贵更大"与"更便宜更小"之间的智力指数差距并不按参数缩放,账单差了一个数量级、指数只差几分,训练侧的数字只会让这笔账更清楚。今日头条
R1把"会思考的小模型"从大厂下放给了每个炼丹户,而这条Scaling Law等于顺手把价签也递了过来:RL后训练里最贵的三样东西——更大的模型、更多的题、更大的卡——恰好都不是第一步该花的。你现在烧机器的预算卡在哪个环节?基座多大、任务能不能规则验证,评论区报个数,比单开一卡实惠。