DeepSeek-R1模型的第二版论文突然更新,页数从22页暴增至86页,将AI训练的算法细节、成本构成乃至失败尝试全部公开。这种前所未有的透明度,不仅揭示了顶尖大模型低成本训练的可能性,更可能推动整个行业从技术保密转向开源协作的新阶段。

智能速览
DeepSeek-R1论文更新至86页,首次全面公开训练细节与成本。
推出GRPO新算法,在关键任务上性能超越主流PPO且成本更低。
模型增量训练成本仅29.4万美元,打破行业千万美元门槛的认知。
四阶段训练法揭示,复杂推理能力可通过强化学习自然涌现。
实验证明,对中小模型而言,从大模型蒸馏的效果优于强化学习。
精华内容
DeepSeek-R1的论文不仅是一份技术文档,更像是一本详尽的“AI训练日记”,它坦诚地记录了从算法创新到成本控制的全过程,为行业带来了前所未有的透明度。
GRPO算法革新
DeepSeek-R1最核心的创新是GRPO算法,它直面了主流PPO算法的两大痛点:高昂的计算成本和长文本推理时的失准问题。PPO需要训练一个与主模型规模相当的独立价值模型,导致资源消耗巨大。而GRPO另辟蹊径,放弃了价值预测,采用“组内比较”策略:针对同一问题生成16个答案,依据奖励分数排序并归一化后直接更新模型。
这种设计不仅省去了训练价值模型的巨额开销,也完美避开了跨时间步预测的难题。在MATH数据集的测试中,未经精细调优的GRPO表现甚至超过了精心优化的PPO,尤其在处理长链推理任务时优势更为显著。其背后支撑的分布式训练架构,通过模块化拆解与显存动态卸载技术,确保了训练过程的稳定性。
百万美元成本真相
论文中最引人注目的部分莫过于训练成本的公开。DeepSeek-R1的增量训练成本仅为29.4万美元,远低于业界普遍认知的千万美元级别。这笔开销明细清晰:使用648块H800GPU运行198小时,花费20.2万美元;数据准备与后续优化分别耗费1万美元和8.2万美元。
其核心模型DeepSeek-V3-Base的总成本也仅为556.6万美元。实现如此低成本的关键在于其高效的四阶段训练流水线。该流程并非一蹴而就,而是通过反复试错与调整,找到了资源投入与模型性能之间的最优平衡点,彻底颠覆了“大模型必须天价训练”的传统观念。
推理能力的涌现
训练过程展示了模型智能涌现的奇妙历程。第一阶段R1-Zero仅依靠强化学习进行探索,在训练约8000步时,模型自发地学会了自我反思,开始频繁使用“wait”、“mistake”等词语,其问题解答的正确率也随之大幅提升。这表明复杂推理能力可以在没有明确指令的情况下涌现。
然而,当第二阶段引入监督微调(SFT)以提升语言流畅度时,模型的推理能力却出现了轻微下降。团队随即通过拒绝采样生成80万条高质量数据进行补偿,最终在第四阶段融合规则奖励与偏好模型,才将性能打磨至最佳状态。整个过程如同一场精密的科学实验。
中小模型的捷径
对于资源有限的团队而言,论文中关于中小模型的研究极具参考价值。对比实验显示,一个32B参数的模型经过1万步强化学习训练后,在AIME竞赛上的正确率仅为47%。而通过从DeepSeek-R1进行知识蒸馏,同等规模的模型正确率却能飙升至72.6%。
这清晰地表明,对于中小模型,追赶大模型的最佳路径并非死磕昂贵的强化学习,而是高效地从已成型的大模型中汲取知识。同时,论文也坦率分享了其失败尝试,如因标注成本过高且易导致模型“奖励作弊”的过程奖励模型(PRM),以及因搜索空间爆炸而无法实施的蒙特卡洛树搜索(MCTS)。
DeepSeek-R1的86页论文最大的价值,在于它开启了AI领域技术透明化的先河。它证明了顶尖AI能力并非只能靠无限制的资金和资源堆砌,通过创新的算法和科学的训练流程,同样可以实现高性价比的突破。这种开放姿态将如何催化下一代AI技术的发展,值得整个行业深思。