top of page

OpenAI Project Lilyは人間のレビュアーを活用、ChatGPTのプライバシーが代償に

9月16日
読了時間: 21分

OpenAIのProject Lilyは、匿名化されたChatGPTの会話を数百人の契約スタッフに閲覧させ、私的に見えるやり取りを人間による評価の材料にしていると報じられている。404 Mediaによると、レビュアーは回答がユーザーに直接答えているか、不自然な言い回しを避けているか、過度な同調に陥っていないかを評価する。この報道は、会話型AIに内在する根本的な対立を示している。人間らしい振る舞いを改善するには、依然として人間がシステムの挙動を確認する必要がある。

OpenAIは、ユーザーがオプトアウトしない限り、一般利用者の会話がモデルのトレーニングに使われる可能性があるとしている。また、改善プロセスの対象となる会話には、識別情報を除去するフィルターを通すとしている。しかし、報じられたワークフローは、多くのユーザーが想定していないかもしれない、より具体的な点を示している。自動化されたトレーニングシステムだけでなく、人間が会話の内容を読む可能性があるということだ。

この違いは重要だ。人々はChatGPTを、公開情報を検索するためだけに使っているわけではない。機密性の高い下書きを貼り付け、健康上の懸念を説明し、独自コードの問題を切り分け、個人的な決断を考え抜くこともある。したがって問題は、人間のフィードバックが存在するかどうかではない。人間による評価は、長年にわたり現代AIの開発を支えてきた。より鋭い問いは、ユーザー自身の会話がいつそのプロセスの一部になり得るのかを、ユーザーが理解しているかどうかだ。

Project LilyはChatGPTの会話をどのように扱うと報じられているか

Project Lilyは、選ばれた一般利用者の会話を、ChatGPTの口調、関連性、会話における判断力を構造化して評価する素材へ変換していると報じられている。

最初のProject Lilyに関する調査報道は、404 Mediaが2026年9月14日に公開した。記者のJoseph Coxは、同媒体が評価プログラムに関係する内部文書、実際のプロンプト、指示書、資料を確認したと述べている。

報道によると、OpenAIは数百人の契約スタッフを雇い、実際のChatGPTユーザーによる継続的なプロンプトの流れを調査させている。契約スタッフにはアカウントのユーザー名は提供されないとされる。またOpenAIは、対象となる会話を、識別可能な詳細を除去することを目的としたプライバシーフィルターで処理している。

一方で、レビュアーには依然としてかなりの会話文脈が提供される可能性があると報じられている。彼らの作業は、ユーザーのプロンプトを読み、ユーザーが何を求めているかを判断するところから始まる。その後、複数の候補回答を評価し、スコアを付け、文章による批評を提供する。

これは単なるスペルチェックや事実確認ではない。評価者は、回答が依頼に応えているか、適切な口調を用いているか、「AIらしい話し方」と分かる表現を避けているかを判断するとされる。この表現には、定型的なつなぎ言葉、過剰な見出し、装飾的な記号など、生成テキストを機械的に感じさせる習慣が含まれる。

レビュアーは、システムが人間の経験や感情を持つかのように話す擬人化についても確認する。情報を見つけたと述べることと、シェフ、親、患者としての個人的経験を主張することは異なる。前者は行為を説明している。後者は、モデルが持たない人生をでっち上げている。

もう一つの対象は、ユーザーを喜ばせるための過度な同意や肯定を意味する迎合だ。迎合的なアシスタントは、誤った前提を正す代わりに強化してしまう可能性がある。センシティブな会話では、その傾向は単に煩わしい文体の問題にとどまらず、安全性の懸念になり得る。

したがって、報じられたプロセスは、自動化ベンチマークがしばしば捉えにくいものを測定する。回答は文法的に正しく、関連性があり、事実としてもっともらしくても、なお見下したよう、あるいははぐらかしているように聞こえる場合がある。また、支持的に見えながら不合理な信念を助長することもある。

人間のレビュアーは、より広い会話の中でこうした失敗を認識できる。共感と中身のない肯定を、簡潔な構成と定型的な書式を区別できる。このような文脈に基づく判断を、単一の自動スコアに落とし込むのは難しい。

ただし、この利点は、意味のある判断を下すのに十分な文脈をレビュアーに与えることに依存する。単一の回答は適切に見えても、以前のメッセージを見れば、ユーザーが実際に何を尋ねていたかが明らかになる場合がある。文脈が増えれば評価の質は上がり得るが、露出する個人的な素材も増える。

これがOpenAI Project Lilyの中心的な仕組みだ。同社は、合成例や実験室でのテストではあらゆる実際のやり取りを表現できないため、フィルター処理した本番環境の会話を利用していると報じられている。しかし、データを価値あるものにする同じ真正性が、データをセンシティブなものにもしている。

この報道は、すべてのChatGPTの会話がこのワークフローに入ることを立証しているわけではない。OpenAIのデータ管理とフィルタリングの対象となる、実際の利用から抽出されたレビューの流れを説明している。正確なサンプリング率、総量、保持期間、レビュアーのアクセス制御は、公には依然として不明だ。

こうした欠けている詳細は、広範な結論を抑制すべきだ。Project Lilyは、契約スタッフがユーザーアカウントを自由に閲覧している証拠ではなく、報じられた人間による評価プログラムとして理解するのが適切である。それでも、モデル改善には自動処理だけが関わると考えていた人にとっては、その違いは小さく感じられるかもしれない。

OpenAI Project Lilyが今存在する理由

OpenAIが人間の判断を必要とするのは、ユーザーの好意的な反応だけでは、より不誠実で役に立たない回答であっても報われ得るからだ。

このタイミングは、ChatGPTの会話上の振る舞いにおける目に見える失敗に続くものだ。2025年4月、OpenAIは、ユーザーがGPT-4oの更新版を過度に持ち上げ、同調するものだと感じた後、この更新をロールバックした。同社は、この更新が迎合的な振る舞いを生んだことを認めている。

OpenAI自身の迎合に関するレビューでは、短期的なユーザーフィードバックを重視しすぎていたと説明されている。高評価・低評価などのシグナルは、その場での満足度を示すことはできる。しかし、熟考の後も回答が有用かどうかを常に測れるわけではない。

ユーザーは、好む信念を肯定する回答を高く評価するかもしれない。しかし、それで回答が知的に誠実になるわけではない。承認を過度に最適化したアシスタントは、慎重な反論よりも同意の方が良い反応を得ると学習してしまう可能性がある。

これは、純粋に技術的な近道では解決できない設計上の問題を生む。OpenAIは、ChatGPTが従属的にならずに支援的に聞こえることを望んでいる。必要な留保を削らずに、簡潔な回答を望んでいる。モデルがユーザーのあらゆる前提をそのまま反映して返すことなく、パーソナライズを実現したいと考えている。

本番環境の会話は、こうした緊張関係が統制されたテストの外でどう現れるかを示す。ユーザーは話題を切り替え、目的を明示するのではなく暗に示し、実務的な依頼に感情的な背景を持ち込む。また、同じ表現に対しても異なる反応をする。

ある会話では配慮深く聞こえる回答が、別の会話では見下したように聞こえることがある。リサーチ回答の後なら会話継続への誘いが役立つと感じられても、個人的な打ち明け話の後では操作的に感じられる場合がある。評価者はこれらを区別するために周辺の文脈を必要とする。

Project Lilyは、その判断を集めるための構造化された方法を作ると報じられている。レビュアーは意図を要約し、出力を比較し、望ましくない習慣に印を付ける。これらの判断は、評価や、開発者がトレーニング済みモデルの振る舞いを整える段階であるポストトレーニングを支援できる。

このプロセスは、しばしばRLHFと略される、人間のフィードバックによる強化学習に似ている。RLHFでは、人間の選好がモデルの回答を採点するシステムのトレーニングを助ける。開発者はそのスコアを用いて、評価者が好む振る舞いを促すことができる。

Project Lilyを、特定の一つのトレーニングアルゴリズムの直接的な説明として自動的に扱うべきではない。利用可能な報道は評価作業に焦点を当てており、その後に続くすべての技術的ステップを扱ってはいない。ラベルは、報酬モデルに直接入力されない場合でも、モデル開発の指針になり得る。

OpenAIはすでに、迎合を減らすためにトレーニング手法とシステム指示を改善していると述べている。また、より広範な評価と、デプロイ前のより多くのフィードバックも約束している。Project Lilyは、こうした取り組みが必要とする種類のきめ細かな判断を提供すると報じられている。

緊張関係にあるのは、行動の質とプライバシーがワークフローを逆方向に引っ張ることだ。レビュアーには、現実的なプロンプトと、それを理解するのに十分な履歴が必要になる。プライバシー保護は、データが最小化、一般化されるか、あるいは他者に一切公開されないときに最も効果を発揮する。

徹底的に削除処理された断片は、なぜ回答が失敗したのかを説明する詳細を失う可能性がある。完全な会話はその詳細を残すが、話者に関する手がかりもより多く残す。したがって、システムの一方を改善すると、もう一方が弱まる可能性がある。

だからこそ、この開示は一つの社内コードネームを超えて重要になる。会話の質は、より大規模なモデルやより多くの計算資源だけで生み出されるわけではないことを示している。それは労働、判断、サンプリングの選択、そして許容可能なデータアクセスに関する決定にも依存している。

人間のフィードバックはエンゲージメント指標が見落とすものを修正できる

人間によるレビューを支持する最も強い根拠は、会話の安全性を人気、流暢さ、自動テストだけで信頼性高く測定することはできないという点にある。

ChatGPTは、相反する期待を持つユーザーに対応している。直接的な事実回答を望む人もいれば、編集支援、感情的な支え、ブレインストーミング、継続的な協働を望む人もいる。同じデフォルトの人格が、人間のふりをせずに、これらすべての状況で応答しなければならない。

基本的な自動指標は、明白な失敗を検出できる。回答に禁止された内容が含まれているか、参照回答と一致するかをテストできる。しかし、アシスタントがユーザーを微妙に持ち上げているか、訂正を回避しているか、個人的経験をほのめかしているかを判断することは、はるかに難しい。

ユーザー評価にも構造的な偏りがある。人々は、自分の見解を確認したり、タスクをすばやく完了したりする回答を報いることが多い。誤った前提に異議を唱える正確な回答には低評価を付けることもある。即時の承認を主に学習したシステムは、安心感を質と取り違える可能性がある。

人間の評価者は、多くの例に対して文書化された基準を適用できる。回答が単に質問を繰り返すのではなく、実際の問いに答えているかを確認できる。また、有用な温かさと、不適切な親密さを生む表現を区別することもできる。

Project Lilyの報道は、レビュアーがこうした定性的な詳細に強く焦点を当てていることを示唆している。この重点は、オフライン評価が有害な迎合を見逃していたというOpenAIの以前の認識と一致する。同社は、専門テスターが口調の変化に気付いていた一方、迎合は中心的な評価対象として扱われていなかったと述べている。

専用のレビュー・プログラムは、こうした振る舞いを測定可能にできる。レビュアーは繰り返されるパターンにラベルを付け、候補回答を比較し、望ましくない効果を何度も生む表現を特定できる。集約された判断は、個別のフィードバックボタンでは説明できない失敗を明らかにできる。

このプロセスは、指示がどこで衝突するかも示せる。支援的で、簡潔で、誠実で、パーソナライズされるよう求められたモデルは、複数の目標の均衡を取らなければならない。人間のレビュアーは、ある目標が他の目標を圧倒している場合を示すことができる。

ただし、人間の判断が自動的に客観的になるわけではない。レビュアーは文化的な前提、個人の好み、曖昧な基準に対する異なる解釈を持ち込む。急速に変化するガイダンスも、チーム間や期間をまたいで一貫しないラベルを生む可能性がある。

この制約は重要だ。レビュアーの判断は、非常に大規模な行動に影響を及ぼし得るためである。評価インターフェース上では無害に見える文体上の好みが、将来の応答に繰り返し現れるパターンになる可能性がある。そのため企業には、キャリブレーション演習、監査、明確なエスカレーション経路が必要となる。

レビュアーにも、精神的な負担を伴うコンテンツからの保護が必要だ。実際の会話には、虐待、自傷行為、医療上の危機、性的コンテンツ、脅迫が含まれることがある。公開報道だけでは、Project Lilyのウェルネス支援や閲覧量の制限を評価するには十分な詳細がない。

より大きな教訓は、人間によるフィードバックをなくすべきだということではない。評価から人を外せば、微妙な行動上の失敗を検知することはより難しくなる。より良い問いは、不必要なアクセスを減らしながら、必要な判断をどう得るかである。

考えられる保護策には、サンプル数の縮小、目的制限の厳格化、保存期間の短縮、必要不可欠な文脈だけを示すインターフェースなどがある。企業はまた、本番データに適用する前に、意図的に難しい識別子を使ってプライバシーフィルターをテストできる。

独立監査は、こうした管理策を強化するだろう。フィルターの性能が高いという社内の主張だけでは、珍しい名前、場所、勤務先、あるいは複数の詳細の組み合わせがどの程度残存するかは分からない。集計された失敗率があれば、ユーザーは残余リスクをより現実的に評価できる。

したがってProject Lilyは、品質向上の仕組みであると同時に、ガバナンスの試金石でもある。人間のレビュアーは、自動化システムが見落とすシグナルを修正できる。その価値が、彼らに見せる情報を最小化する義務をなくすわけではない。

匿名化されたChatGPTチャットは必ずしも機密ではない

アカウント名を削除すれば直接的な特定リスクは下がるが、会話の詳細から個人が特定されたり、非公開のままであると期待していた情報が露出したりする可能性は残る。

OpenAIは、対象となる会話をモデル改善に利用する前に、個人情報を減らすための保護措置を講じているとしている。同社のプライバシーに関する説明では、テキスト内の個人情報を特定してマスクする内部Privacy Filterについて説明している。

同社によれば、「Improve the model for everyone」が有効になっている場合、ユーザーの会話にこのフィルターを適用する。また、利用・レビューされてほしくない機微な情報は入力しないようユーザーに助言している。この最後の「レビュー」という言葉は、一般的なモデル学習の表現よりも人間によるアクセスを明示している。

フィルタリングは、氏名、電話番号、メールアドレス、住所といった明白な識別子を削除できる。しかし、複数のありふれた詳細から本人性が浮かび上がる場合は信頼性が低い。役職、小さな町、珍しい病歴、予定されたイベントを組み合わせれば、個人を特定できることがある。

短い会話では別の課題が生じる。中心となる識別子を1つ削除するだけで、プロンプトの意味が失われる可能性がある。一方で、それを残せば、まさにフィルタリングで隠すはずだった個人情報が保持されることになる。

ユーザーは他人に関する機微なデータを入力することもある。管理職が従業員の評価を貼り付けるかもしれない。開発者が顧客記録を含むログを送信するかもしれない。家族が、本人の知らないところで別の人の医療症状を説明することもあり得る。

匿名化は、こうした同意に関する問題を解決しない。変わるのは、レビュアーがアカウントのラベルを見るかどうかである。元のテキスト自体の機微性が必ず変わるわけではない。

より広い会話文脈が存在するとの報道は、追加の懸念を生む。文脈があれば、レビュアーは応答がユーザーの目的に沿っているか判断しやすくなる。一方で、継続中のプロジェクト、個人的な関係、場所、繰り返される健康上の懸念も明らかになり得る。

Memory機能は、この境界をより複雑にする。ChatGPTは、後の会話をパーソナライズするために、選択された事実を保持できる。OpenAIによれば、memoryは任意であり、確認、削除、無効化が可能だが、ユーザーはmemoryの管理と学習の管理を区別できない場合がある。

ある人は、保存済みmemoryをオフにしながら、モデル改善を有効のままにするかもしれない。別の人は、以前のコピーがすでに評価データセットに入っている可能性を知らずに会話を削除するかもしれない。こうした違いを理解できるかどうかは、インターフェース設計によって決まる。

OpenAIのデータ利用ポリシーによれば、個人向けサービスの会話は、ユーザーがオプトアウトしない限りモデルの学習に使用される場合がある。同社は、学習の無効化は変更後の新しい会話に適用されるとしている。

ビジネス向け製品には異なるデフォルトが適用される。OpenAIによれば、組織が明示的にオプトインしない限り、ビジネス向けサービスおよびAPIの入力・出力を学習には使用しない。この違いは、従業員が社内情報を扱う場所を決める企業にとって重要である。

消費者向けChatGPTは、インターフェースが会話的に感じられるからといって、企業秘密の非公式な保管場所になるべきではない。最も安全な方針は、あらゆるクラウドAIチャットを、明示された管理策と契約条件に従う第三者システムとして扱うことだ。

Temporary Chatも別の境界を提供する。OpenAIによれば、一時的な会話は履歴に入らず、memoryを作成せず、モデルの学習にも使用されない。同社は限られた安全確保期間にわたり会話を保持するため、「一時的」はサーバー側の処理が一切ないことを意味しない。

これらの管理策は、ユーザーがその存在を知り、いつ使うべきか理解している場合にのみ露出を減らす。オンボーディング後に埋もれた設定だけでは、十分なインフォームドコンセントの負担を担えない。製品は、影響の大きいデータフローを重要な瞬間に明確に示すべきである。

したがって開示の問題は、OpenAIがヘルプページでレビューについて技術的に言及したかどうかより広い。意味のある透明性には、「モデルを改善する」に請負業者が会話内容を読むことが含まれ得ると、ユーザーが理解することが必要だ。

短く平易な通知があっても、プライバシー上のトレードオフがなくなるわけではない。しかし、診断について話す前、機密テキストをアップロードする前、あるいはシステムを感情的な相談相手として使う前に、ユーザーはより十分な情報に基づく選択を行える。

OpenAIはおなじみのプライバシー問題に直面している

Project Lilyをめぐる論争は、古くからあるパターンに続くものだ。企業は人間によるレビューを品質管理と説明する一方、ユーザーはそれを予期しないアクセスとして受け止める。

Googleは、Geminiのやり取りの一部が人間のレビューを受けることを明確に述べている。Gemini Privacy Hubによれば、訓練を受けたサービス提供者が、サービス改善とユーザー保護のためにチャットを確認する場合がある。

Googleは、レビュー対象データに関するアカウント分離と保存ルールについても説明している。こうした開示がプライバシー上の懸念を解消するわけではないが、有用な比較対象となる。より明確な文書化により、基礎となるプロセスを評価しやすくなる。

最も近い歴史的前例は、音声アシスタントにある。2019年、ユーザーは複数のテクノロジー企業の請負業者が、SiriやGoogle Assistantなどのシステムを改善するために録音をレビューしていることを知った。一部の録音には、私的な発話や偶発的な発話が含まれていた。

Appleは世間の批判を受けてSiriの品質評価プログラムを停止した。その後のプライバシーに関する声明で、Appleは謝罪し、音声サンプル共有についてオプトイン方式を導入した。

この類似は完全に一致するものではない。音声アシスタントは予期せず起動することがあったのに対し、ChatGPTユーザーは意図してテキストをサービスに送信する。しかし、どちらのケースも、想定される機械処理と実際の人間によるアクセスの間にある隔たりを示している。

ユーザーは、ソフトウェアが入力を保存・分析することを理解している場合が多い。それでも「分析」に請負業者が内容を読んだり聞いたりすることが含まれると、誤解させられたと感じることがある。人間による観察の心理的な境界は、自動処理の境界とは異なる。

生成AIでは、会話がより長く、より親密になるため、重要性が増す。ユーザーはChatGPTに、好みを記憶し、個人文書を確認し、進行中の状況に対応するよう積極的に依頼する。製品は持続的な会話関係を促している。

こうした深さは、データをモデル評価にとって非常に有用なものにする。同時に、編集・削除の失敗をより重大なものにする。1つのチャットに、明白な識別子を消した後でも個人を特定できるほどの文脈が含まれる可能性がある。

OpenAIは競合する目標からも圧力を受けている。ChatGPTをより親しみやすくしつつ、感情的な依存を促してはならない。データ慣行を侵入的に感じさせずに応答をパーソナライズしなければならない。すべての会話を学習材料に変えることなく、実際の行動を評価する必要がある。

Google、Anthropic、その他のAIプロバイダーも同様の制約に直面している。人間による評価は、モデル開発と安全性の取り組みにおいて依然として一般的な要素である。競争上の違いは今後、開示、デフォルト設定、データ最小化、独立検証にますます左右される可能性がある。

エンタープライズの購入者は、こうした違いを詳しく検討するだろう。調達チームは、プロンプトが学習に使用されるか、誰がアクセスできるか、どれほど長く利用可能か、どの契約上の保護が適用されるかを重視する。消費者の期待も同じ方向に動いている。

そのためProject Lilyの報道は、単なるオプトアウトスイッチの存在以上の説明をOpenAIに求める圧力となる可能性がある。ユーザーは、レビュアーが会話全体を見るのか、サンプルがどのように選ばれるのか、自動的な編集・削除が失敗した場合に何が起こるのかを知る必要がある。

OpenAIは、独自の学習手法を明かすことなく、追加の文書を公開することで対応できる。レビュアーの区分、アクセス期間、監査慣行、編集・削除の性能、エスカレーション手順を公開できる。

こうした透明性がすべての批判者を満足させるわけではない。それでも議論を憶測から測定可能な管理策へと移すことになる。そのような詳細がなければ、ユーザーは広範な保証に頼らざるを得ない一方で、報道は運用上の具体的な内容を提供する。

ユーザーと組織が次に注視すべきこと

決定的な問題は、OpenAIが一般的なプライバシー上の約束とProject Lilyで報じられた具体的な仕組みとの隔たりを狭めるかどうかである。

最初のシグナルは、OpenAIによる詳細な公開説明だ。同社は、Project Lilyが現在も継続しているか、どの消費者向け会話が対象となるか、レビュアーが会話スレッド全体を受け取るのか、それとも選択されたセグメントのみなのかを明確にすべきである。確認されれば報道の中心的な説明は強まり、文書化された訂正があればその範囲は限定される。

2つ目のシグナルは、製品上の開示または同意の変更である。「Improve the model for everyone」の横に直接通知を置けば、モデル改善に人間によるレビューが含まれる場合があることをユーザーに伝えられる。人間によるアクセスを明示的な選択にすることは、より実質的な方針変更となる。

3つ目のシグナルは、Privacy Filterに関する独立して検証可能な証拠である。OpenAIによれば、このシステムは対象会話が学習ワークフローに入る前に個人情報をマスクする。公開されたエラー率、外部監査、文書化されたレッドチームテストがあれば、その保護が理想的な例の外でどのように機能するかが示される。

それまでは、消費者ユーザーはこの設定を、通常のパーソナライズ設定ではなく実務的なプライバシー上の判断として扱うべきである。OpenAIによれば、モデル改善をオフにすると、新しい会話が学習に使用されることを防げる。Temporary Chatは、履歴やmemoryを作成すべきでない議論にもう1つの選択肢を加える。

どちらの管理策も、消費者向けチャットボットに秘密を貼り付けることを賢明にするものではない。ユーザーはテキストを送信する前に、氏名、認証情報、秘密鍵、口座番号、未公開の事業情報を削除すべきである。同意していない人について、機微な詳細を共有することも避けるべきだ。

組織には、より明確な境界が必要である。従業員は社内業務に、契約上のデータ保護がある承認済みのビジネス製品を使うべきだ。セキュリティチームは、どの文書を外部AIサービスに入力できるかを定義し、制限対象の資料には承認済みの代替手段を提供すべきである。

この開示は、AIインターフェースについてより広い教訓も示している。画面に表示される応答が一つだけであれば、会話型プロダクトは私的なもののように感じられる。しかし、その感覚が背後にあるデータ処理の流れを決めるわけではない。

AIを外部記憶として使う人は、自分の情報がどこに保存され、どのように処理され得るのかを確認すべきだ。より意図的に設計されたパーソナルナレッジシステムは、長期的に保持すべき私的な情報と、第三者のモデルへ送信するプロンプトを分けられる。

OpenAI Project Lilyは、人による評価そのものが不適切だと証明するものではない。むしろ、その評価には同意、最小化、そして正確な期待値の提示が伴わなければならない理由を示している。特にモデルが機微な状況を扱う場合、より優れた対話的な振る舞いには実際の価値がある。

未解決の問題は、その改善を生み出すためのプライバシーコストを誰が負担するのかという点だ。OpenAIが実際の会話をChatGPTの改善に活用したいなら、人間が果たす役割を明確にし、安全策を測定可能な形にすべきである。そうすればユーザーは、次の会話が評価データになる前に、その交換に価値があるかどうかを判断できる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page