top of page

Anthropic 的 Constitutional AI 详解:Claude 对齐背后的方法

Anthropic 于 2022 年底发布了一篇描述 Constitutional AI 的论文 Constitutional AI: Harmlessness from AI Feedback. 该方法用一小部分书面规则取代了大部分人类反馈,这些规则由模型应用于其自身输出。

该论文解释了该系统的工作原理,以及团队选择此路线而非标准人类反馈强化学习的原因。

Constitutional AI 流程的工作原理

Constitutional AI 从正常的监督微调开始。在该步骤之后,模型根据一组固定的原则对其答案进行批评和修改。

这些原则来自公开文件,例如《世界人权宣言》以及 AI 实验室的声明。列表保持简短,以便工程师检查每条规则。

在第一阶段,模型对其草稿响应进行批评。然后生成一个新响应,尝试解决发现的问题。

然后第二个模型将修改后的答案与原始答案进行比较,并决定哪个版本更符合这些原则。这种比较无需额外的人类标签即可创建训练数据。

这个循环运行数千次。结果是一个学会在许多主题上一致应用相同规则的模型。

与标准 RLHF 的比较

标准 RLHF 依赖人类评分员每周对数千个模型输出进行评分。这些评分训练一个奖励模型,以指导进一步的更新。

Constitutional AI 改变了奖励信号的来源。研究人员编写的原则取代了大部分人类评分。

这一变化降低了成本,并消除了不同评分员带来的一些差异。

主要差异出现在数据生成步骤。 RLHF 需要为每个新行为提供新的人类标签。Constitutional AI 为每次更新重复使用相同的书面原则。

Anthropic 发布该方法的原因

Anthropic 表示,分享该方法将允许其他团体对其进行测试和改进。该论文包含了确切的原则和训练步骤。

该发布发生在公司准备向更多用户推出 Claude 之际。对安全方法的公开讨论作为已完成工作的发布前证据。

外部研究人员迅速开始使用已发布的代码和原则进行自己的实验。正如 Anthropic 研究员 Amanda Askell 所指出的,“我们希望这项工作对从事 AI 对齐和安全的其他研究人员有用。”

对 Claude 响应的影响

用户注意到 Claude 比早期模型更频繁地拒绝有害内容的请求。拒绝语言往往保持礼貌,并引用相关原则。

同样的规则也促使模型在证据不足时避免过于自信的陈述。开发人员报告称,Claude 在技术答案中捏造细节的情况较少。

这些模式直接源于书面原则,而不是针对单个提示的临时人类反馈。

使用 Claude 进行构建的开发人员应了解的事项

开发人员接收相同的模型权重和安全层。这些原则在训练时保持固定,无法通过提示更改。

提示工程仍可用于风格和格式。它不会覆盖阻止不允许内容的的核心规则。

依赖 Claude 构建面向客户工具的团队应尽早测试边缘情况。即使提示试图重新构建请求,模型仍会继续拒绝某些类别。

AI 对齐中的剩余问题

已发布的原则涵盖了伤害和公平等广泛类别。它们在深度伪造创建或代理行为等较新主题上留有解释空间。

批评者指出,这些原则是由 Anthropic 员工选择的。其他组织可能更喜欢不同的起始列表。

从长远来看,研究人员希望了解一小部分规则是否可以扩展到自主执行多步操作的模型。

接下来值得关注的事项

Anthropic 计划定期更新 Claude 版本。每次更新都将包括关于原则违规的新测试结果。

其他实验室已开始发布类似方法,包括斯坦福大学基础模型研究中心等团体在独立分析中引用的比较。拒绝率和帮助性分数的直接比较将变得可用。

关于 AI 安全报告的监管讨论可能会将这些公共方法作为一种可能的标准进行引用。

跟踪测试结果的开发人员将看到所述原则与实际模型行为之间的差距如何随时间变化。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page