张大妈

大模型4种训练方法以及典型流程

源自公众号:大语言模型

02-04 13:01

训练一个大模型就像培养一个学生,需要经历从自学知识到掌握品味的多个阶段。这篇内容深入剖析了预训练(PT)、有监督微调(SFT)、强化学习(RLHF)和直接偏好优化(DPO)这四种核心方法,阐明了各自的作用与成本,为希望低成本构建专属模型的企业提供了清晰的路径图。

大模型4种训练方法以及典型流程智能速览

  • 预训练(PT)让模型学习基础语言知识,成为博学的“普通人”。

  • 有监督微调(SFT)教会模型按指令完成具体任务,变得有用。

  • RLHF通过人类反馈调教模型,使其回答更安全、更符合人类喜好。

  • DPO是RLHF的简化版,效果相近但成本更低,是企业高性价比之选。

  • 企业私有化训练应基于开源基座模型,重点投入SFT和DPO。

大模型4种训练方法以及典型流程精华内容

想要理解大模型如何从海量数据中成长为可靠的智能助手,就需要深入了解其关键的训练流程。这四个阶段环环相扣,共同塑造了模型的能力。

自学成才:预训练

预训练是模型成长的起点,目标是让模型掌握人类的基础语言与常识。该阶段让模型在海量的互联网文本中进行“完形填空”式的学习,通过预测下一个词语来逐渐理解语法、事实和逻辑。训练完成后得到一个基座模型,它知识广博但缺乏重点,回答可能不着边际,就像一个识字但未受专业训练的大学生。

拜师学艺:有监督微调

为了让基座模型变得有用,有监督微调(SFT)环节必不可少。此阶段,模型会学习由人类精心编写的高质量问答对,相当于学习一本《任务标准作业手册》。通过模仿这些“标准答案”,模型学会了如何遵循指令、按照特定格式和风格进行回答。此时的模型如同一个经过岗前培训的新员工,能处理标准任务,但面对歧义或未见过的问题时,表现可能不佳。

市场考验:强化学习

基于人类反馈的强化学习(RLHF)旨在让模型不仅完成任务,更要完成得让人满意。过程分两步:首先,通过人类对模型不同回答的偏好对比(如A比B好),训练一个AI“裁判”(奖励模型);然后,模型通过强化学习自我生成答案,并由这个AI裁判打分,目标是获得高分。

这一步能让模型回答得更贴心、安全,但流程极其复杂,需要训练三个模型,成本高昂,如同员工经过复杂KPI考核打磨成明星。

开卷考试:直接偏好优化

直接偏好优化(DPO)是实现与RLHF同样目标的“捷径”。它无需训练独立的奖励模型,而是直接向模型展示针对同一问题的“好答案”与“坏答案”,让其通过对比学习人类的偏好标准。这种“开卷考试”式的方法效果与RLHF相近,但过程更简单、稳定,计算成本与SFT相当甚至更低。这好比通过研究优秀和失败案例来快速提升,是企业当前性价比最高的选择。

实践路径与成本考量

对于企业而言,从零开始预训练(PT)成本天文数字,完全不可取。正确做法是选用开源基座模型(如LLaMA、Qwen),将核心资源投入到SFT环节,用高质量私有数据(如文档、代码)让模型精通业务。

若想更进一步,采用DPO方法,用少量专家标注的偏好数据,即可让模型输出更符合公司规范。模型训练的总计算量 ≈ 6 × N × D,SFT和DPO的计算量远低于PT和RLHF,是当前私有化部署性价比最高的组合。

大模型的训练是一个从广博到精深,再到贴合人心的过程。掌握PT、SFT、RLHF和DPO的精髓,尤其是善用开源与DPO,是企业构建专属智能体的关键。随着技术演进,未来的训练方法是否会变得更加高效和人性化?

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章