张大妈

从数学的角度来说,强化学习究竟是在干什么?

源自知乎:Soulflare

01-18 14:26

强化学习究竟在数学层面做什么?从马尔可夫决策过程到DeepSeek R1的GRPO算法,通过数学公式揭示RL从寻找最优策略到推动大模型推理能力突破的核心机制。

从数学的角度来说,强化学习究竟是在干什么?智能速览

  • 强化学习本质是在MDP框架下寻找使累积期望回报最大的策略函数

  • 贝尔曼方程将无穷序列预测转化为局部迭代问题,是RL算法的核心

  • 从Q-Learning到Policy Gradient的转变解决了高维状态空间挑战

  • PPO通过截断操作限制策略变化幅度,成为大模型RLHF的基石

  • DeepSeek的GRPO创新性地用统计方法替代Critic模型,大幅降低成本

  • RL让模型从拟合分布转向逻辑搜索,产生超越人类教导的涌现行为

从数学的角度来说,强化学习究竟是在干什么?精华内容

强化学习在数学上,就是在马尔可夫决策过程的框架下,通过随机梯度上升去优化策略函数,使得该策略产生的轨迹能够获得最大的累积期望回报。

MDP基础框架

强化学习的数学起点是马尔可夫决策过程,一个包含状态空间S、动作空间A、状态转移概率P、奖励函数R和折扣因子γ的五元组。

核心在于寻找一个策略π(a|s),这个条件概率分布要解决的根本问题是:最大化策略产生的轨迹的累计回报期望值。

难点在于环境与策略的随机性,需要在充满不确定性的概率空间中寻找通往最高收益的确定性路径。

贝尔曼方程核心

贝尔曼方程是强化学习的真理,它将状态价值V(s)定义为即时奖励加上打折后的未来状态价值:V(s) = R(s) + γΣP(s’|s,a)V(s’)。

这个方程的革命性在于把无穷序列预测转化为局部迭代问题。在Q-Learning时代,我们通过填表进行不动点迭代,只要满足压缩映射原理,迭代必定收敛到最优解。

但深度学习时代状态空间大到无法存表,必须引入函数近似,用神经网络拟合Q函数或V函数。

策略梯度演进

2015年后风向转变,从估算Q值转向Policy Gradient。其数学目标是通过最大化目标函数J(θ)来调整策略参数。

关键在于对数导数技巧:∇θJ(θ) = E[∇θlogπ(a|s)A(s,a)]。直觉是:如果动作带来正向优势,就增加其概率;如果结果不好,就减少概率。

PPO算法通过截断操作限制新旧策略的KL散度,解决策略更新过猛的问题。这在数学上就是带约束的置信域优化的简化版。

GRPO创新突破

DeepSeek R1使用的GRPO算法做出了漂亮简化:直接抛弃Critic模型。

核心逻辑是:对同一个Prompt生成多个输出(如8个),计算这组奖励的均值和标准差进行标准化:A = (r - μ)/σ。组内高于平均分的为正优势,低于的为负优势。

基线不再由复杂神经网络预测,而是通过统计特征计算。这大大降低了梯度方差,省掉了一个70B级别的巨无霸网络,是成本大幅下降的核心原因。

RL vs SFT对比

监督微调(SFT)做极大似然估计,上限是数据集质量,60分的数据最多学到60分。

强化学习优化的是累积期望回报,没有标准答案束缚,只要结果正确,过程可自由探索。

这允许模型在高维参数空间找到人类未教导的路径。DeepSeek R1中模型学会长思维链、多语言混合思考、特殊Tag辅助推理等,都是数学优化过程中的涌现。

从数学看,SFT是背解题步骤,RL是给答案让模型自己悟解法。

强化学习为神经网络提供了进化方向,让大模型从预测下一个词转向推导最终答案。它不是神话,而是数学的力量,通过优化压力在复杂系统中产生低熵结构,这或许就是通向更强AI的关键路径。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章