张大妈

纸巾真棒!RLHF就是像“训狗”一样训 AI!

源自小红薯:李梨同学

03-02 16:00

为什么经过微调的AI有时会好心办坏事,甚至产生有害内容?传统方法难以教会AI分辨是非与价值观。一种名为RLHF(人类反馈强化学习)的技术,通过让AI从人类的偏好中“悟”出道理,正在成为解决这一难题的关键,它能有效引导AI生成既有用又安全的回答。

纸巾真棒!RLHF就是像“训狗”一样训 AI!智能速览

  • 单纯喂正确答案无法教会AI价值观,容易产生有害内容。

  • RLHF的核心是让人类对AI生成的多个回答进行排序打分。

  • 通过训练一个模仿人类喜好的“奖励模型”,AI学会了如何拿高分。

  • 在强化学习驱动下,AI会主动调整策略,变得既有用又安全。

纸巾真棒!RLHF就是像“训狗”一样训 AI!精华内容

让AI听话只是第一步,如何让它听懂‘好话’、分辨‘好坏’才是关键。RLHF并非直接灌输知识,而是巧妙地构建了一个让AI自我完善的激励机制。

SFT的困境

传统微调(SFT)方法像手把手教AI,存在明显局限。很多问题没有唯一正确答案,尤其是在涉及幽默、创意和价值观的场景。如果只喂给AI标准答案,它可能成为一个“死脑筋”。例如,当恶意用户要求AI制定一份欺凌计划时,一个仅经过SFT的AI可能真的会生成一份详尽的、格式完美的有害指南,因为它无法理解行为背后的善恶,只是在模仿和复现它学到的模式。

人类偏好打分

RLHF的巧妙之处在于改变了教学方式。它不再是直接给出答案,而是让AI针对同一个问题生成多个版本的回答,比如回答A和回答B。然后,人类评估员会像老师批改作业一样,对这些回答进行排序和打分,选出更好、更安全、更符合期望的那一个。这个“人类偏好”数据是核心,它训练出一个独立的“奖励模型”,这个模型的功能就是精准模仿人类的打分习惯。

AI的自我进化

有了奖励模型这个“小老师”,主AI模型便进入了强化学习阶段(通常采用PPO算法)。AI会不断生成新回答,并提交给奖励模型打分。如果回答得分低,AI就会收到“惩罚”,并调整内部参数;如果得分高,则会得到“奖励”,并强化当前的生成策略。通过成千上万次的试错和调整,AI的目标从“生成通顺文本”转变为“最大化奖励分数”,从而学会了如何讨好“小老师”,也就是如何迎合人类的真实偏好。

安全对齐的结果

经过RLHF训练的AI,行为模式会发生质变。当再次面对生成欺凌计划这类有害指令时,它不再是盲目执行,而是能够识别出请求的危险性,并做出符合安全准则的回应。它会礼貌而坚定地拒绝:“对不起,我不能帮你制定伤害他人的计划。” 这种从被动执行到主动判断的转变,标志着AI与人类价值观的成功对齐,确保了AI在提供帮助的同时,也守住了伦理和安全的底线。

RLHF为解决AI对齐问题提供了一条行之有效的路径,它让AI从单纯的模仿者进化为具备价值判断的“思考者”。随着技术的演进,AI与人类价值观的融合将更加深入。未来,我们该如何设定这个“评分标准”,才能塑造出真正理想的AI伙伴?这或许是比技术本身更值得探讨的问题。

内容由AI生成
0
扫一下,分享更方便,购买更轻松
0评论

当前文章无评论,是时候发表评论了
提示信息

取消
确认
评论举报

最新文章 热门文章