DeepSeek R1技术报告更新至86页,首次系统揭示了纯强化学习即可驱动模型推理能力进化。这份开源可复现的报告,以仅29.4万美元的成本,实现了与顶尖闭源模型相媲美的性能,为AI推理能力的探索划定了新的里程碑。
智能速览
纯强化学习驱动R1-Zero实现自我进化,在数学竞赛中超越人类均值。
仅用29.4万美元训练成本,性能比肩OpenAI o1,性价比极高。
蒸馏技术让小模型(1.5B-70B)推理能力全面跃升,能力可迁移。
模型反思词汇量激增5-7倍,展现智能涌现的核心证据。
附10页安全报告,详解风险控制与多语言评估体系。
复盘失败经验:强大的基础模型与可靠的验证器是RL成功的关键。
精华内容
DeepSeek R1的成功不仅是性能的跃升,更是方法论上的突破。它验证了纯强化学习在强大基础模型上激发深度推理潜能的有效性,为整个领域提供了宝贵的实证。
纯RL的自我进化
DeepSeek-R1-Zero的实验证明了纯强化学习的巨大潜力。模型仅使用64×8张H800 GPU,训练198小时,成本约29.4万美元,便在AIME数学竞赛上超越了人类平均水平,在Codeforces编程竞赛中表现超过了93.6%的参赛者。这一成果表明,在强大的基础模型之上,无需复杂的SFT数据,仅通过RL就能激发出卓越的推理能力,大幅降低了训练门槛。
推理能力的迁移
一个关键问题是,大模型的推理能力能否迁移给小模型。DeepSeek通过蒸馏技术给出了肯定答案。它将R1作为“教师”模型,生成高质量的推理轨迹数据,用于微调从1.5B到70B不同规模的“学生”模型。结果显示,蒸馏后的小模型在推理能力上获得了全面提升,证明了这种高级认知能力并非大模型独有,可以通过有效的数据传递进行复制。
反思行为的涌现
在训练过程中,模型展现了惊人的自我进化特征。研究发现,模型使用的反思性词汇(如wait、mistake、retry、check)频率相比训练初期增加了5到7倍。这种反思行为并非随机出现,例如「wait」策略在训练后期才涌现并成为主要模式。这标志着模型学会了在生成答案过程中进行自我审视和修正,是智能涌现的直接证据。
安全边界与失败复盘
报告同样包含了对安全性的深入探讨,提供了10页的安全评估,涵盖了风险控制、多语言测试和越狱攻击防御。此外,DeepSeek也坦诚分享了失败尝试,例如过程奖励模型(PRM)效果不佳。核心结论是:强大的基础模型是RL成功的先决条件,而可靠的验证器则是防止模型“钻空子”的关键。这些经验对社区具有极高的参考价值。
DeepSeek R1的86页技术报告,不只是一次性能展示,更是一套完整的开源方法论。它降低了顶级推理模型的训练门槛,为社区发展提供了新动力。这种纯强化学习的路径,会否引领下一代模型训练的范式?