top of page

什么是基于人类反馈的强化学习(RLHF)?

6月5日
讀畢需時 4 分鐘

RLHF 强化学习人类反馈是将大型语言模型从流畅但不可靠的文本生成器转变为遵循指令的助手的方法。它通过收集模型输出的评分、训练单独的模型来预测这些评分,然后使用强化学习推动原始模型生成更高评分的响应来实现。

这种方法在 OpenAI 用它创建 ChatGPT 后广为人知。没有 RLHF,早期的模型常常生成语法正确但不相关、重复或不安全的内容。加入人类反馈后,开发者有了一种实用的方式来使模型行为符合用户期望。

关键要点

  • RLHF 是一个三步流程,从监督微调开始,加入基于人类评分训练的奖励模型,最后通过 PPO 进行强化学习。

  • 人类评分者是唯一的真实来源;奖励模型只是学习模仿他们的偏好。

  • 最后的优化阶段在无需更多标注文本数据的情况下提升了响应质量。

  • RLHF 有局限:它可能编码评分者的偏见,并且无法保证事实准确性。

  • 任何使用大型模型的人都应该理解这些步骤,因为大多数公开聊天系统现在都依赖它们。

准备好看看流程如何组合了吗?

RLHF 强化学习人类反馈定义

RLHF 强化学习人类反馈是一种使语言模型输出与人类判断保持一致的训练技术。它结合了对演示数据的监督学习,以及由根据人类偏好对响应进行评分的奖励模型引导的强化学习(Ouyang et al., 2022)。该方法由三个要素定义。首先,它需要一个已经能够生成文本的初始模型。其次,它需要一个单独的奖励模型,该模型基于人类对输出的排序进行训练。第三,它使用强化学习算法(最常见的是 PPO(Schulman et al., 2017))来更新原始模型,使其输出获得更高的奖励分数。

该方法不同于标准监督微调,因为它优化的是学习到的偏好函数而非固定标签。它也不同于纯强化学习,因为奖励信号来自人类数据而非工程化的环境。

RLHF 强化学习人类反馈的工作原理

该过程遵循三个顺序阶段。每个阶段都建立在前一个阶段的基础上。

阶段 1:演示数据的监督微调

在 InstructGPT 论文中,40 名标注者编写了 12,000 个演示响应。然后使用标准监督学习在该新数据集上微调基础模型。结果是该模型生成的文本比原始预训练版本更连贯且更能遵循指令。Anthropic 的 Constitutional AI 通过 AI 生成的批评扩展了这一阶段,以减少对人类编写演示的依赖。

阶段 2:训练奖励模型

微调后的模型为同一提示生成多个候选响应。人类评分者将这些响应从最好到最差进行排序。这些排序成为第二个模型的训练数据,该模型的唯一任务是预测人类会偏好哪个响应。奖励模型不生成文本;它只输出一个标量分数。

阶段 3:使用 PPO 进行强化学习

在将奖励模型作为反馈来源的同时,使用 PPO 更新原始模型。在每一轮中,模型采样响应,奖励模型对其评分,PPO 调整模型权重以增加高分输出的概率。KL 惩罚项防止模型偏离其监督起点太远。

这一最后阶段是大多数对齐改进发生的地方。它允许模型探索演示数据中从未明确展示过的响应风格。

RLHF 强化学习人类反馈与仅监督微调的比较

训练信号

  • RLHF:使用学习到的奖励模型对新响应进行评分。

  • 监督微调:仅使用固定的人类编写标签。

数据效率

  • RLHF:可以使用排名数据提升质量,这些数据比完整演示更易收集。

  • 监督微调:需要为每个提示提供完整的正确响应。

过度优化的风险

  • RLHF:如果奖励模型较弱,可能会过拟合评分者偏好。

  • 监督微调:仅限于标注集中存在的模式。

何时选择每种方法

当高质量演示数据充足时使用监督微调。当需要模型泛化到所提供示例之外,并且收集成对排名比编写完整答案更快时,切换到 RLHF。

人类排序和奖励分数的示例

提示:“向 10 岁儿童解释量子计算。”

响应 A:“量子计算使用可以同时处于两种状态的微小粒子,就像旋转的硬币。”(评分者排名:1;奖励模型分数:0.92)

响应 B:“它是一种基于量子力学原理(包括叠加)的计算机。”(评分者排名:2;奖励模型分数:0.71)

响应 C:“量子比特比普通比特更适合计算。”(评分者排名:3;奖励模型分数:0.45)

RLHF 中的常见失效模式

奖励黑客攻击发生在模型利用奖励模型的缺陷时,例如生成冗长但空洞的答案,而评分者最初对此打分较高。当 PPO 训练导致模型在不相关的提示中重复相同的高分措辞时,就会出现模式崩溃,从而降低输出多样性。

实际应用

客户支持团队使用经过 RLHF 训练的模型生成符合公司语气指南的回复。研究人员将同一流程应用于科学写作助手,以便摘要尊重领域专家表达的引用准确性偏好。模型提供商的安全团队依靠 RLHF,通过在违反政策与符合政策的成对数据上训练奖励模型来减少有毒或有偏见的输出。

关于 RLHF 强化学习人类反馈的常见问题

Q: RLHF 能保证事实准确的答案吗?

A: 不能。奖励模型只学习人类对风格、帮助性和安全性的偏好。除非评分者明确惩罚不准确内容,否则它不会验证事实。

Q: 需要多少人类数据?

A: 奖励模型阶段通常需要数万次排名比较。确切数量取决于响应多样性和评分者一致性。

Q: RLHF 能消除所有有害输出吗?

A: 它减少了 undesired 响应的频率,但无法完全消除它们。评分者分歧和奖励模型错误会留下残余风险。

Q: PPO 是唯一使用的算法吗?

A: 大多数公开系统使用 PPO,但研究人员已测试了跳过单独奖励模型的 DPO 等替代方案。PPO 仍是默认选择,因为它稳定且广为人知。

Q: RLHF 会永久改变模型权重吗?

A: 是的。发布给用户的最终模型包含 PPO 阶段更新的权重。推理时不会运行外部奖励模型。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page