AnthropicのConstitutional AIの解説:Claudeのアライメントの背後にある手法
- Aisha Washington

- 6月5日
- 読了時間: 4分
Anthropicは2022年末にConstitutional AIを説明する論文を公開しました Constitutional AI: Harmlessness from AI Feedback. この手法は、人間からのフィードバックの大部分を、モデルが自らの出力に適用する短い書面のルールリストに置き換えます。
この論文では、システムの仕組みと、チームが標準的なRLHFではなくこの手法を選んだ理由を説明しています。
How the Constitutional AI Process Works
Constitutional AIは通常の教師ありファインチューンから始まります。その後、モデルは固定された一連の原則に基づいて自身の回答を批評・修正します。
原則は世界人権宣言やAIラボの声明などの公開文書から来ています。リストは短く保たれているため、エンジニアはすべてのルールを検査できます。
最初の段階で、モデルはドラフト回答の批評を書きます。その後、見つかった問題を修正しようとする新しい回答を生成します。
2つ目のモデルが修正版と元の回答を比較し、どちらが原則により忠実かを判断します。この比較により、追加の人手ラベルなしで学習データが作成されます。
このループは数千回実行されます。その結果、同じルールを多くのトピックに一貫して適用することを学習したモデルが得られます。
Comparison with Standard RLHF
標準的なRLHFは、人間の評価者が毎週数千のモデル出力をスコアリングすることに依存しています。評価は報酬モデルを訓練し、さらなる更新を導きます。
Constitutional AIは報酬信号の源を変えます。研究者によって書かれた原則が、ほとんどの人間評価に取って代わります。
この変更によりコストが削減され、評価者ごとのばらつきの一部が除去されます。
主な違いはデータ生成ステップに現れます。 RLHFは新しい行動ごとに新しい人間ラベルを必要とします。Constitutional AIはすべての更新で同じ書かれた原則を再利用します。
Why Anthropic Published the Method
Anthropicは、この手法を共有することで他のグループがテストや改善を行えるようになると述べています。論文には正確な原則と訓練手順が含まれています。
この公開は、Claudeをより多くのユーザーに提供する準備を進めている最中に行われました。安全手法に関するオープンな議論は、完了した作業の事前証拠となりました。
外部の研究者はすぐに公開されたコードと原則を使って独自の実験を開始しました。Anthropicの研究者Amanda Askellは、「この研究がAIアライメントと安全に取り組む他の研究者にとって役立つことを期待しています」と述べています。
Impact on Claude Responses
ユーザーは、Claudeが以前のモデルよりも有害なコンテンツのリクエストをより頻繁に拒否することに気づきます。拒否の表現は丁寧に保たれ、関連する原則を引用する傾向があります。
同じルールはまた、証拠が薄い場合にモデルが過度に自信のある発言を避けるよう促します。開発者は、Claudeが技術的な回答で詳細を捏造するケースが減少したと報告しています。
これらのパターンは、個々のプロンプトに対するアドホックな人間フィードバックではなく、書かれた原則に直接由来します。
What Developers Building on Claude Should Know
開発者は同じモデル重みと安全レイヤーを受け取ります。原則は訓練時に固定されており、プロンプトを通じて変更することはできません。
プロンプトエンジニアリングはスタイルや形式には依然として有効です。ただし、禁止コンテンツをブロックするコアルールを上書きすることはできません。
顧客向けツールにClaudeを利用するチームは、早い段階でエッジケースをテストすべきです。モデルは、プロンプトがリクエストを言い換えようとしても、特定の分類を拒否し続けます。
Remaining Questions in AI Alignment
公開された原則は危害や公平性などの広い分類をカバーしています。ディープフェイク作成やエージェント的行動などの新しいトピックについては解釈の余地を残しています。
批評家は、原則がAnthropicのスタッフによって選ばれた点を指摘しています。他の組織は異なる開始リストを好むかもしれません。
長期的には、研究者は少数のルールセットが多くのステップにわたって自律的に行動するモデルにスケールするかどうかを理解したいと考えています。
What to Watch Next
AnthropicはClaudeのバージョンを定期的に更新する予定です。各更新には原則違反に関する新しいテスト結果が含まれます。
他のラボも、Stanford's Center for Research on Foundation Modelsなどのグループによる独立した分析で参照される比較を含む類似のアプローチを公開し始めています。拒否率と有用性スコアの直接比較が利用可能になるでしょう。
AI安全報告に関する規制議論は、これらの公開手法を1つの可能な標準として参照するかもしれません。
テスト結果を追跡する開発者は、表明された原則と実際のモデル行動の間のギャップが時間とともにどのように変化するかを確認できるでしょう。


