判事、NYT法廷闘争でOpenAI ChatGPTログの開示を命令
- Aisha Washington

- 6月6日
- 読了時間: 11分
更新日:6月17日

OpenAIは、ニューヨーク・タイムズとの高リスクな著作権訴訟において、重要な手続き上の戦いに敗れました。連邦治安判事は、AI大手に対し、大量のトレーニングデータとユーザーインタラクションの提出を命じました。この判決により、同社は、モデルのトレーニング方法、そして特に情報の出力方法に関して、厳重に非公開にしようと努めてきた内部記録を開示することを余儀なくされました。
この開示紛争の中心にあるのは、OpenAI ChatGPTのログであり、ニューヨーク・タイムズの法務チームは、AIモデルが著作権で保護されたコンテンツを違法に繰り返したことを証明するために不可欠であると主張しています。法的な駆け引きは知的財産に焦点を当てていますが、この決定はユーザーのプライバシーに副次的な損害を与えます。これまで比較的プライベートであるか、少なくともOpenAI内部のものであると想定されていた何百万ものインタラクションが、現在、法的な開示プロセスに入っています。
実践的なステップ:OpenAI ChatGPTログでのプライバシー保護

法的な議論を詳細に検討する前に、これらのツールを使用するすべての人にとっての当面の現実に対処する必要があります。最近の裁判所の命令は、「クラウド」とはしばしば「他人のコンピュータ」を意味するだけであり、この場合、そのコンピュータは現在、召喚令状の対象となっていることを思い出させてくれます。
将来の法的な開示プロセスで会話が表面化することや、不十分な匿名化について心配している場合は、LLMとの対話方法を直ちにに変更する必要があります。これは、OpenAI ChatGPTログの現在の脆弱性を考慮して、機密データを処理するための戦略です。
「ビルボード」メンタルモデルを採用する
あなた自身を守る最も効果的な方法は、技術的なものではなく、心理的なものです。ChatGPTのすべてのテキストボックスは、タイムズスクエアのデジタルサイネージに直接入力しているかのように扱ってください。競合他社、弁護士、または隣人に読まれたくないのであれば、入力しないでください。
ここには医師と患者の守秘義務はありません。弁護士と依頼人の特権もありません。クラウドホストされたモデルに入力すると、そのデータは第三者に送信されます。この判決で見たように、第三者はそのデータを共有するよう強制される可能性があります。
機密性の高い作業にはローカルLLMを使用する
ワークフローに独自のコード、財務データ、または機密性の高い社内文書が含まれる場合は、標準のWebインターフェイスの使用を中止してください。データが "OpenAI ChatGPTのログ" から除外されることを保証する唯一の方法は、これらのタスクについてはOpenAIを完全にバイパスすることです。OpenAI ChatGPTのログは、OpenAIを完全にバイパスすることです。
ローカルモデルの実行に切り替えてください。OllamaやLM Studioのようなツールを使用すると、強力なモデル(Llama 3やMistralなど)をラップトップまたは安全なオンプレミスサーバーで直接実行できます。データはハードウェアから離れないため、カリフォルニア州またはニューヨーク州の著作権訴訟の開示命令で収集されることはありません。
入力を手動でサニタイズする
GPT-4oのようなモデルの優れた推論能力を使用する必要がある場合は、まずデータを削除する必要があります。モデルがあなたが伝えたことを「忘れる」ことに依存しないでください。
個人情報(PII)を削除する:名前、住所、電話番号を絶対に入力しないでください。
エンティティの難読化:会社名を「Company A」に、製品名を「Product X」に置き換えてください。
チェーンの切断:読者があなたの身元を特定できるような、連続した文脈を提供しないでください。匿名性は、名前そのものではなく、特定の役職、特定の場所、特定の問題の組み合わせによって破られることがよくあります。
裁判所の判決:OpenAI ChatGPTのログがもはや秘密ではない理由

この決定は、ニューヨーク州南部地区連邦地方裁判所のオナ・ウォン判事によって下されました。この紛争は技術的なものでしたが、重要でした。ニューヨーク・タイムズ紙は、ChatGPTが同紙の記事を記憶していることを証明するために、「再トレーニング」データとインタラクションログを要求しました。OpenAIは、このデータの生成は不当に負担が大きく、技術的に困難であると主張して抵抗しました。
ウォン判事は、「難しすぎる」という弁護を受け入れませんでした。命令は、OpenAIが保護しようとした2つの異なる情報セットを提供するよう要求しています。
第一に、モデルのトレーニングに使用されたデータセットを提供しなければなりません。第二に、より論争の的となるのは、サブセットを引き渡さなければならないということです。OpenAI ChatGPTログ関連する事柄。裁判官は会社に遵守するための厳しい期限を与えた。これは、米国の法律における「ディスカバリー」プロセスの一部であり、両当事者が相手方の証拠を検討できるが、その規模は前例のないものである。我々は、専有的な企業秘密から法的証拠へと移行する可能性のある数百万のデータポイントについて話している。
「不当な負担」の抗弁の失敗
OpenAIの法務チームは、このデータの収集、無害化、引き渡しには数百時間のエンジニアリング時間が必要になると主張しようとした。彼らは、モデルの進化の履歴をふるいにかけることは不可能な作業だと示唆した。
裁判所は本質的に、これをOpenAI自身の問題と見なした。インターネット全体を取り込み、それを何百万人ものユーザーに提供するシステムを構築した場合、訴えられたときに監査するにはアーキテクチャが複雑すぎると主張することはできない。この判決は先例となる:テクノロジー企業は、自社のインフラストラクチャの複雑さを盾にして法的調査を回避することはできない。
OpenAI ChatGPTログにおける個人識別情報の削除リスク
この判決で一般ユーザーにとって最も懸念されるのは、著作権法ではなく、プライバシーへの影響です。OpenAIは、開示する前に「匿名化」または個人情報を削除すると述べています。OpenAI ChatGPTのログしかし、セキュリティ専門家やデータプライバシー擁護者は、削除が十分であることは稀であることを知っています。
「AOL検索」の警告
歴史は、これがなぜ危険なのかを暗く示唆しています。2006年、AOLは研究目的で数百万件の「匿名化」された検索クエリを公開しました。彼らはユーザー名をランダムなID番号に置き換えました。
ジャーナリストやデータ探偵は、わずか数日で特定の個人を特定しました。 "4417749"という名前だけで知られる一人のユーザーは、検索語の組み合わせを分析するだけで、ジョージア州に住む62歳の未亡人であることが特定されました。彼女の名前ではなく、特定の犬種、町、病気に関する検索によって特定されたのです。
文脈が識別子となる
同じ原則は、OpenAI ChatGPTのログにも当てはまります。名前を削除したとしても、プロンプトのログにはあなたの思考プロセスが含まれています。
ログに、オハイオ州の中堅物流会社の特定の部署向けの特定のレポートを自動化するためのPythonスクリプトを要求し、その後、非常に具体的な人事に関する苦情についてのメールの下書きを続けるユーザーが表示された場合、「匿名性」は失われます。職業上の文脈、地理的なマーカー、文章のスタイルの組み合わせが、指紋を作成します。
これらのログを、たとえ限られた弁護士や専門家グループにであっても、開示を強制することで、「再識別」のリスクが高まります。弁護士はパターンを探します。ニューヨーク・タイムズが著作権侵害の証拠を探している場合、彼らはこれらのログを精査して、ユーザーがNYTのコンテンツを再現するようにモデルにどのようにプロンプトしたかを確認するでしょう。その過程で、彼らは機械と話していると信じていたユーザーの、プライベートで飾らない思考を必然的に読むことになるでしょう。
OpenAI ChatGPTログに隠されたプライバシー侵害
懸念されるのは、データが元の会社の安全な環境を離れると、管理が失われることです。裁判所の命令には保護命令(つまり、NYTの弁護士がログをインターネットに公開できないことを意味する)が含まれている可能性が高いですが、データ侵害は発生します。法務チームはハッカーの標的です。
さらに、「個人識別情報」(PII)の定義は、企業によって狭く解釈されることがよくあります。彼らはメールアドレスを削除するかもしれませんが、日記のエントリーや機密のビジネス戦略の本文を残すかもしれません。これらのログによく見られる独特の声と親密な詳細は、データの有用性自体を破壊することなく、真の匿名化を数学的に不可能にします。
ニューヨーク・タイムズの著作権訴訟の背景

なぜニューヨーク・タイムズはこれらのログをそれほど欲しがっているのでしょうか?彼らはあなたの個人的な秘密に興味があるわけではありません。彼らはAIとジャーナリズムの未来に関する画期的な訴訟で勝とうとしています。
ニューヨーク・タイムズの著作権訴訟は「記憶」という概念にかかっています。NYTは、OpenAIが文法や事実を理解するために彼らの記事から学習しただけではないと主張しています。from彼らの記事を丸ごと飲み込み、NYTのペイウォールを回避して、そのまま再現できると主張しています。
ログによる侵害の証明
これを証明するために、タイムズは「OpenAI ChatGPTのログ」を見る必要があります。彼らは、モデルが特定のデータコーパスでトレーニングされた証拠を探しています。しかし、より重要なのは、モデルが他のユーザーにNYTの記事を繰り返し出力した履歴があるかどうかを確認したいということです。
ログから、ユーザーが元の著作物とほとんど変わらない要約を頻繁に要求し、受け取っていることが示されれば、NYTの主張は強化されます。彼らは「フェアユース」の抗弁を覆そうとしています。OpenAIは、インターネット上での学習は、作品を変換するためフェアユースであると主張しています。ログが、作品が変換されず、単にコピー&ペーストされていることを示せば、OpenAIは敗訴します。
AI学習のより大きな全体像
この発見段階は、大規模言語モデル(LLM)が実際にどのように構築されているのかを明らかにしています。長年にわたり、OpenAIのような企業は、学習データに関してますます秘密主義になってきました。GPT-2はオープンでしたが、GPT-4はブラックボックスです。
この訴訟は、その箱を開けさせようとしています。裁判所が「 OpenAI ChatGPTのログ」を要求することで、これらのモデルの入力と出力は、盗難の疑いをかけられている場合、営業秘密ではないと判断しています。これは、すべてのAI企業の運営方法に変化を強いる可能性があります。すべてのチャットログが著作権訴訟の潜在的な証拠となりうる場合、企業は履歴の保存を完全にやめるか、著作物との類似性を防ぐために出力を積極的にフィルタリングするようになり、モデルの有用性は低下するものの、法的にはより安全になるかもしれません。
将来の見通し:プライベートAI会話の終わり?
王判事によるこの判決は、おそらく始まりに過ぎません。著者からミュージシャン、コードリポジトリまで、より多くのコンテンツクリエイターがAI企業を訴えるにつれて、透明性への要求は高まるでしょう。
私たちは、AIの「ブラックボックス」が法制度の顎によってこじ開けられる時代に向かっています。直接的な犠牲者は、プライバシーの幻想です。ユーザーはChatGPTを告白の場やプライベートなワークスペースのように扱ってきました。現実は、それが法の支配下にある企業のデータベースであるということです。
のOpenAI ChatGPTのログはもはや静的なアーカイブではなく、アクティブな証拠となります。ユーザーにとっては、これはデジタル衛生の必要性を強化します。生成AI時代におけるプライバシーへの期待は縮小しており、法廷で匿名性を守るために企業に依存することは、失敗する運命にある戦略です。
よくある質問
裁判官はなぜOpenAIにチャットログの公開を命じたのですか?
Ona Wang判事は、ログがニューヨーク・タイムズの主張に関する関連証拠であると裁定しました。タイムズは、OpenAIのモデルが著作権で保護されたコンテンツを記憶し、再現していることを証明するためにログを分析する必要があり、裁判官はこの必要性がデータの提供の困難さに関するOpenAIの異議を上回ると判断しました。
私の個人的なChatGPTの履歴は公開されますか?
すぐにはされません。裁判所の命令は、ログをニューヨーク・タイムズの法務チームに引き渡すことを要求しており、おそらく公開を禁止する保護命令の下で行われます。しかし、データが外部の法務チームに移管されると、漏洩や偶発的な暴露のリスクが増加し、絶対的なプライバシーはもはや保証されなくなります。
OpenAIはトレーニングデータを効果的に匿名化できますか?
それは非常に困難です。OpenAIは名前やメールアドレスのような明示的な識別子を削除できますが、文脈を通じて「再識別」が可能です。場所、職業、特定の執筆習慣のユニークな組み合わせが、OpenAI ChatGPT logs特定の個人につながる可能性があり、これはAOLの検索データスキャンダルが展開されたのと似ています。
ニューヨーク・タイムズの著作権訴訟の主な目的は何ですか?
ニューヨーク・タイムズは、OpenAIが同紙の記事を無断でAIモデルのトレーニングに使用することを停止するために訴訟を起こしています。彼らは、これはフェアユースではなく著作権侵害であり、ChatGPTは同紙の報道の詳細な要約や抜粋を提供することで、新聞と直接競合していると主張しています。
OpenAIのサーバーから自分のデータを削除するにはどうすればよいですか?
アカウントを削除できますが、継続的な使用については、設定で「チャット履歴とトレーニング」をオフにすることができます。これにより、新しい会話が将来のモデルのトレーニングに使用されるのを防ぎますが、バックアップアーカイブやすでに現在の法的保留下にあるデータセットから過去のやり取りが必ずしも削除されるわけではありません。


