强化学习究竟在数学层面做什么?从马尔可夫决策过程到DeepSeek R1的GRPO算法,通过数学公式揭示RL从寻找最优策略到推动大模型推理能力突破的核心机制。
智能速览
强化学习本质是在MDP框架下寻找使累积期望回报最大的策略函数
贝尔曼方程将无穷序列预测转化为局部迭代问题,是RL算法的核心
从Q-Learning到Policy Gradient的转变解决了高维状态空间挑战
PPO通过截断操作限制策略变化幅度,成为大模型RLHF的基石
DeepSeek的GRPO创新性地用统计方法替代Critic模型,大幅降低成本
RL让模型从拟合分布转向逻辑搜索,产生超越人类教导的涌现行为
精华内容
强化学习在数学上,就是在马尔可夫决策过程的框架下,通过随机梯度上升去优化策略函数,使得该策略产生的轨迹能够获得最大的累积期望回报。
MDP基础框架
强化学习的数学起点是马尔可夫决策过程,一个包含状态空间S、动作空间A、状态转移概率P、奖励函数R和折扣因子γ的五元组。
核心在于寻找一个策略π(a|s),这个条件概率分布要解决的根本问题是:最大化策略产生的轨迹的累计回报期望值。
难点在于环境与策略的随机性,需要在充满不确定性的概率空间中寻找通往最高收益的确定性路径。
贝尔曼方程核心
贝尔曼方程是强化学习的真理,它将状态价值V(s)定义为即时奖励加上打折后的未来状态价值:V(s) = R(s) + γΣP(s’|s,a)V(s’)。
这个方程的革命性在于把无穷序列预测转化为局部迭代问题。在Q-Learning时代,我们通过填表进行不动点迭代,只要满足压缩映射原理,迭代必定收敛到最优解。
但深度学习时代状态空间大到无法存表,必须引入函数近似,用神经网络拟合Q函数或V函数。
策略梯度演进
2015年后风向转变,从估算Q值转向Policy Gradient。其数学目标是通过最大化目标函数J(θ)来调整策略参数。
关键在于对数导数技巧:∇θJ(θ) = E[∇θlogπ(a|s)A(s,a)]。直觉是:如果动作带来正向优势,就增加其概率;如果结果不好,就减少概率。
PPO算法通过截断操作限制新旧策略的KL散度,解决策略更新过猛的问题。这在数学上就是带约束的置信域优化的简化版。
GRPO创新突破
DeepSeek R1使用的GRPO算法做出了漂亮简化:直接抛弃Critic模型。
核心逻辑是:对同一个Prompt生成多个输出(如8个),计算这组奖励的均值和标准差进行标准化:A = (r - μ)/σ。组内高于平均分的为正优势,低于的为负优势。
基线不再由复杂神经网络预测,而是通过统计特征计算。这大大降低了梯度方差,省掉了一个70B级别的巨无霸网络,是成本大幅下降的核心原因。
RL vs SFT对比
监督微调(SFT)做极大似然估计,上限是数据集质量,60分的数据最多学到60分。
强化学习优化的是累积期望回报,没有标准答案束缚,只要结果正确,过程可自由探索。
这允许模型在高维参数空间找到人类未教导的路径。DeepSeek R1中模型学会长思维链、多语言混合思考、特殊Tag辅助推理等,都是数学优化过程中的涌现。
从数学看,SFT是背解题步骤,RL是给答案让模型自己悟解法。
强化学习为神经网络提供了进化方向,让大模型从预测下一个词转向推导最终答案。它不是神话,而是数学的力量,通过优化压力在复杂系统中产生低熵结构,这或许就是通向更强AI的关键路径。