top of page

法官下令在 NYT 法律战中释放 OpenAI ChatGPT 日志

6月6日
讀畢需時 8 分鐘

已更新:6月17日

Judge Orders Release of OpenAI ChatGPT Logs in NYT Legal Battle

OpenAI 在与 The New York Times 的高风险版权之争中,刚刚输掉了一场重大的程序性交锋。一名联邦法官已命令这家 AI 巨头移交大量的训练数据和用户交互记录。这一裁决迫使该公司公开其极力想要保密的内部记录,特别是关于模型如何训练以及关键的模型如何输出信息的内容。

这场证据开示争议的核心是 OpenAI ChatGPT logs,The New York Times 的法律团队认为,这些日志对于证明该 AI 模型非法复制受版权保护的内容至关重要。虽然法律博弈集中在知识产权上,但这一决定对用户隐私造成了附带损害。数以百万计的交互记录——此前被认为相对私密或至少属于 OpenAI 内部数据——现在正进入法律证据开示程序。

实践步骤:保护 OpenAI ChatGPT logs 中的个人隐私

Practical Steps: Protecting Your Privacy in OpenAI ChatGPT Logs

在剖析法律论点之前,我们需要解决任何使用这些工具的人所面临的现实问题。最近的法院命令提醒我们,“云端”通常只意味着“别人的计算机”,而在这种情况下,那台计算机现在正面临传票强制调取。

如果你担心自己的对话在未来的法律证据开示程序中出现,或者担心匿名化处理不够彻底,你需要立即改变与 LLM 交互的方式。鉴于目前 OpenAI ChatGPT logs 的脆弱性,以下是处理敏感数据的策略。

采取“广告牌”思维模型

最有效的自我保护方式是心理上的,而非技术上的。请将 ChatGPT 中的每一个文本框都视为纽约时代广场上的数字广告牌。如果你不希望竞争对手、律师或邻居看到这些内容,就不要输入。

这里不存在医患保密协议,也不存在律师-客户特权。当你向云端托管模型输入内容时,你正在将数据发送给第三方。正如我们从这项裁决中所看到的,第三方可能会被强制共享这些数据。

在处理敏感工作时使用本地 LLM

如果你的工作流程涉及专利代码、财务数据或敏感内部文档,请停止使用标准 Web 界面。确保数据不进入 OpenAI ChatGPT 日志 的唯一方法,就是在处理这些任务时完全绕过 OpenAI。

切换到运行本地模型。像 Ollama 或 LM Studio 这样的工具允许你在笔记本电脑或安全的本地服务器上直接运行强大的模型(如 Llama 3 或 Mistral)。由于数据从未离开你的硬件,它就不会被卷入加利福尼亚州或纽约州的版权诉讼证据开示令中。

手动脱敏输入内容

如果你必须使用 GPT-4o 等模型更强大的推理能力,你需要先对数据进行脱敏处理。不要指望模型会“忘记”你告诉它的内容。

  • 删除 PII: 切勿输入姓名、地址或电话号码。

  • 模糊化实体: 将您的公司名称替换为 "Company A",将您的产品替换为 "Product X"。

  • 打破关联链: 不要提供连续的上下文流,以免读者能够推断出您的身份。匿名性往往不是被姓名破坏的,而是被特定的职位、特定的地点和特定的问题组合所破坏的。

法院裁决:为什么 OpenAI ChatGPT 日志不再是秘密

The Court Ruling: Why OpenAI ChatGPT Logs Are No Longer Secret

这项裁决由纽约南区美国地方法院的治安法官 Ona Wang 作出。争议虽然涉及技术层面,但意义重大。《纽约时报》要求获取“再训练”数据和交互日志,以证明 ChatGPT 记住了其文章。OpenAI 予以拒绝,声称生成这些数据将造成过重的负担,且在技术上难以实现。

Wang 法官没有接受“过于困难”的辩护。该命令要求 OpenAI 提供他们试图屏蔽的两组不同的信息。

首先,他们必须提供用于训练模型的数据库。其次,更具争议的是,他们必须移交一部分 OpenAI ChatGPT 日志 与案件相关。法官要求该公司在严格的截止日期前完成合规。这是美国法律中“证据开示”(discovery)程序的标准环节——即双方都有权审查对方的证据——但此处的规模是前所未有的。我们讨论的是数以百万计的数据点,它们正从受保护的商业机密转变为法律证据。

“过度负担”辩护策略的失败

OpenAI 的法律团队试图辩称,收集、清理并移交这些数据将耗费数百个工程小时。他们暗示,筛选其模型演进的历史是一项不可能完成的任务。

法院基本上认为这是 OpenAI 自身造成的问题。如果你构建了一个摄取整个互联网并将其反馈给数百万用户的系统,那么当你被起诉时,你不能声称其架构过于复杂而无法接受审计。该裁决确立了一个先例:科技公司不能躲在自身基础设施的复杂性背后,以逃避法律审查。

OpenAI ChatGPT 日志中的去标识化风险

对于普通用户来说,这项裁决最令人担忧的方面不是版权法,而是隐私影响。OpenAI 表示,在移交 OpenAI ChatGPT 日志 之前,他们将对其中的个人信息进行“匿名化”或脱敏处理。然而,安全专家和数据隐私倡导者深知,脱敏处理往往是不够的。

“AOL 搜索”的前车之鉴

历史为我们提供了一个关于为何这很危险的严峻预演。2006 年,AOL 出于研究目的发布了数百万条“匿名化”的搜索查询。他们用随机 ID 数字替换了用户名。

记者和数据侦探仅用了几天时间就识别出了特定个人。一名仅被称为“4417749”的用户,仅通过分析其搜索词的组合,就被确认为佐治亚州的一位 62 岁遗孀。识别她的依据并非姓名,而是她搜索的特定犬种、居住城镇以及她的医疗状况。

语境即标识符

同样的原理也适用于 OpenAI ChatGPT 日志。你可能会删除自己的名字,但提示词日志中包含了你的思维过程。

如果日志显示一名用户请求编写一个 Python 脚本,为俄亥俄州一家中型物流公司的特定部门自动生成特定报告,随后又跟进了一封关于非常具体的 HR 投诉的邮件草稿,那么“匿名性”就烟消云散了。职业背景、地理标记和写作风格的结合创造了一个指纹。

通过强制释放这些日志(即使仅限于少数律师和专家),“重新识别”的风险也会增加。律师会寻找模式。如果 New York Times 正在寻找侵犯版权的证据,他们将梳理这些日志,查看用户如何引导模型复制 NYT 的内容。在此过程中,他们将不可避免地读到那些以为自己在与机器交谈的用户的私人、不加掩饰的想法。

隐藏在 OpenAI ChatGPT 日志中的隐私侵犯

令人担忧的是,一旦数据离开原公司的安全环境,控制权就会丧失。虽然法院命令可能包含保护令(意味着 NYT 的律师不能直接在互联网上发布日志),但数据泄露时有发生。法律团队本身就是黑客的目标。

此外,“个人身份信息”(PII)的定义通常被公司狭隘地解释。他们可能会清除电子邮件地址,但保留日记条目或机密商业策略的正文。这些日志中独特的语气和私密细节,使得在不破坏数据本身效用的情况下,实现真正的去标识化在数学上是不可能的。

《纽约时报》版权诉讼背景

The New York Times Copyright Lawsuit Context

为什么《纽约时报》如此迫切地想要这些日志?他们对你的个人秘密不感兴趣。他们是试图在一场关乎 AI 和新闻业未来的里程碑式案件中获胜。

《纽约时报》版权诉讼案的核心在于“记忆”这一概念。《纽约时报》指控 OpenAI 不仅仅是其文章中学习语法和事实;他们指控该模型完整地吞噬了这些文章,并能逐字逐句地复现它们,从而绕过《纽约时报》的付费墙。

通过日志证明侵权

为了证明这一点,该报需要查看 OpenAI ChatGPT logs。他们正在寻找该模型曾使用其特定语料库进行训练的证据。但更重要的是,他们想看看该模型是否有向其他用户输出《纽约时报》文章的历史记录。

如果日志显示用户频繁请求并获得了与受版权保护的原作几乎无异的摘要,那么《纽约时报》的胜算就会增加。他们正试图瓦解“合理使用”这一辩护理由。OpenAI 主张在互联网上进行训练属于合理使用,因为这属于对作品的转化。如果日志显示作品并未被转化,而只是简单的复制粘贴,OpenAI 就会败诉。

AI 训练的大局观

这一取证阶段正在揭开大语言模型(LLMs)实际构建过程的神秘面纱。多年来,像 OpenAI 这样的公司对其训练数据变得越来越保密。GPT-2 是开放的;而 GPT-4 则是一个黑盒。

这场诉讼迫使这个黑盒被打开。通过索取 OpenAI ChatGPT 日志,法院判定,当这些模型被指控盗窃时,其输入和输出不属于商业机密。这可能会迫使所有 AI 公司的运作方式发生改变。如果每条聊天日志都可能成为版权诉讼中的证据,公司可能会完全停止存储历史记录,或者可能会激进地过滤输出,以防止与受版权保护的内容产生任何相似之处,这会使模型变得不那么好用,但在法律上更安全。

未来展望:私人 AI 对话的终结?

王法官的这项裁决可能仅仅是个开始。随着越来越多的内容创作者——从作家到音乐家再到代码库——起诉 AI 公司,对透明度的需求将会增长。

我们正走向一个 AI “黑盒”被法律体系强行撬开的时代。最直接的代价就是隐私幻觉的破灭。用户一直将 ChatGPT 视为忏悔室或私人工作空间。而现实是,它是一个受国家法律约束的企业数据库。

OpenAI ChatGPT logs不再是静态的存档,而是活跃的证据。对于用户而言,这强化了进行数字卫生管理的必要性。在生成式 AI 时代,隐私预期正在萎缩,而依靠公司在法庭上为你争取匿名权,注定是一种会失败的策略。

常见问题解答

法官为何命令 OpenAI 公布聊天日志?

Ona Wang 法官裁定,这些日志是与 New York Times 的主张相关的证据。New York Times 需要分析这些日志,以证明 OpenAI 的模型正在记忆并复制受版权保护的内容。法官判定,这种必要性超过了 OpenAI 关于提取数据难度的异议。

我的个人 ChatGPT 历史记录会被公开吗?

不会立即公开。法院命令要求将日志移交给 New York Times 的法律团队,通常会受到保护令的约束以防止公开。然而,一旦数据转移到外部法律团队,泄露或意外暴露的风险就会增加,绝对的隐私将不再得到保证。

OpenAI 能有效地对训练数据进行匿名化处理吗?

这极其困难。虽然 OpenAI 可以删除姓名和电子邮件等显性标识符,但通过上下文进行“重新识别”是可能的。地理位置、职业和特定写作习惯的独特组合,都存在于 OpenAI ChatGPT logs 通常可以追溯到特定的个人,类似于 AOL 搜索数据丑闻的演变过程。

New York Times 版权诉讼案的主要目标是什么?

New York Times 正在起诉 OpenAI,要求其停止在未支付费用的情况下使用其文章来训练 AI 模型。他们认为这属于版权侵权,而非合理使用,并且 ChatGPT 通过提供其报道的详细摘要和摘录,直接与该报纸形成了竞争关系。

我该如何从 OpenAI 的服务器中删除我的数据?

你可以注销账号,但对于持续使用的情况,你可以在设置中关闭 “Chat History & Training”。这将防止你的新对话被用于训练未来的模型,但这并不一定能从备份存档或已处于当前法律保留状态的数据集中清除你过去的交互记录。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page