OpenAI 网络抓取暴露了一场微软无法继续私下掩盖的冲突
OpenAI 网络抓取如今正面临来自其最亲密企业合作伙伴内部的严重矛盾。据报道,一名微软高管称这种做法是“人类历史上规模最大的劳动窃取”。
这番话并非出自一位在 AI 行业外抗议的批评者。据报道,微软应用科学总监 Brent Hecht 在 2023 年 1 月的一份内部备忘录中写下了这句话。微软已投资 OpenAI,并将其模型整合进包括 Copilot 在内的多款产品。
一宗版权诉讼中被解封的材料,如今让这一私下警告进入公众视野。这些文件表明,微软和 OpenAI 的员工明白,AI 产品可能削弱那些提供训练材料的出版商。
这些证据并不能决定模型训练是否符合美国版权法中的合理使用原则。但它确实凸显了 OpenAI 和微软面临的核心冲突:两家公司将训练描述为具有转化性,而据报道,其内部员工却担心由此产生的产品会取代新闻业并破坏其经济基础。
已解封文件称发生了什么
这一新进展不只是又一项关于 OpenAI 复制文章的指控。它表明,两家公司内部的人士已意识到由此产生的冲突。
相关材料来自《纽约时报》及其他出版商参与的合并版权诉讼。《纽约时报》最初于 2023 年 12 月在联邦法院起诉微软和 OpenAI。
出版商指控两家公司复制受版权保护的文章,以建立训练数据集和商业 AI 产品。OpenAI 和微软则坚持认为,其使用行为具有转化性,且受合理使用原则保护。
最新公开的文件为这场分歧补充了内部通信、证词以及据报道的数据集规模。不过,一个重要限制依然存在:大量信息似乎来自出版商的简易判决陈述,而部分基础证据仍处于密封状态。
这意味着,读者看到的是诉讼活跃进行期间由一方挑选并呈现的引述。这些陈述意义重大,但其完整的上下文讨论并非总能获得。
根据一份OpenAI 抓取报道,Hecht 警告称,大型模型正以前所未有的规模吸纳人类劳动。其他报道指出,他将其描述为“规模惊人的、史无前例的窃取”。
据报道,Hecht 写道,数百万人会将模型“鲸吞”其作品视为盗窃。随后,他称这种做法可能是“人类历史上规模最大的劳动窃取”。
这一说法有意采用了宏大的措辞,也在历史上存在争议。它在此处的重要性,来自据报道使用这一表述的人是谁,而非接受这种比较是一项经过审慎衡量的历史判断。
Hecht 任职于微软,而微软正是 OpenAI 最重要的技术与商业合作伙伴。他的警告表明,道德与经济层面的反对意见并不局限于出版商、作者或外部研究人员。
微软试图与这一结论保持距离。一名公司发言人告诉 AFP,Hecht 的评论代表一名员工的个人观点,而非微软的立场。
文件据称描述了超过 1,000 万篇被抓取的新闻文章。根据一篇基于 AFP 报道的文章复制报道,其中近三分之一据称来自《纽约时报》。
另一组数字涉及训练中期数据集,即模型在初始开发完成后用于继续训练的资料集合。据报道,这些数据集包含《纽约时报》、《每日新闻》和调查报道中心作品的 91,692 份副本。
一个源自 Common Crawl 的数据集据称包含超过 200 万份来自 nytimes.com 的文档。Common Crawl 是一个定期收集大规模公开网络内容的非营利档案机构。
出版商还称,微软通过名为 Project Taxi 和 Project Mango 的项目向 OpenAI 提供材料。据称,Project Mango 生成的数据集包含至少 160,903 件由参与诉讼的新闻机构拥有的独特作品。
这些指控不止涉及收集公开可访问的页面。据报道,文件援引了一名 OpenAI 员工,他描述了一种绕过《纽约时报》付费墙的方法。据称,OpenAI 总裁 Greg Brockman 回应称:“ah nice。”
这一交流将受到密切审视,因为访问限制会影响法律和事实分析。复制一个公开可见的页面,与绕过付费墙并非引发完全相同的问题。
文件还指控,部分数据集准备过程在信息传递给模型之前移除了版权声明。OpenAI 尚未承认这些做法构成侵权,而被引用的交流也需要结合完整语境理解。
不过,这些细节改变了争议的性质。案件不再仅仅被描述为出版商推断其作品如何进入 ChatGPT。
这些文件呈现了据报道的内部认知、技术获取方法和商业层面的担忧。这些议题可能影响法院对使用目的、市场影响以及各方叙事可信度的评估。
为何 OpenAI 网络抓取成为合理使用的考验
OpenAI 网络抓取在法律上之所以重要,是因为相关内容据称帮助构建了能够回答用户问题、却无需将用户引回出版商的网站的产品。
合理使用允许对受版权保护作品进行某些未经授权的使用。法院通常会考察使用目的、原作品的性质、复制的数量,以及对其潜在市场的影响。
没有任何单一因素能决定每个案件。分析取决于具体作品、复制方式、输出结果和市场情况。
OpenAI 辩称,模型训练会将源材料转化为用于生成新回复的统计表征。它还称,新闻报道中包含的事实不受版权保护。
出版商则回应称,其诉讼针对的是受保护的表达,而非对事实的所有权。他们认为,OpenAI 大规模复制完整文章,并构建了与其争夺同一批读者的产品。
近期的 AI 版权裁决为开发者提供了有意义的支持。加州法院已将某些用于模型训练的图书使用认定为具有转化性,尽管案件事实和剩余主张各不相同。
OpenAI 已在辩护中援引这些裁决。《纽约时报》则认为,由于 ChatGPT 和 Copilot 能够提供类似出版商输出的及时信息,其争议呈现出更强的市场替代证据。
这种差异使内部陈述尤其重要。据报道,OpenAI 的 ChatGPT 负责人 Nick Turley 写道,该公司的产品“在很大程度上具有替代性”。
据称,他预测随着产品质量提升,它们将变得更具替代性。据报道,Turley 还将 AI 产品称为对出版商的“生存性威胁”。
据报道,微软 CEO Satya Nadella 在证词中承认,聊天机器人对话已取代部分对底层网站的访问。这并不会自动证明法律上可认定的市场损害,但它支持了出版商的事实理论。
微软的内部测量数据可能更具意义。文件据称表示,与传统 Bing 搜索相比,其 Copilot 答案引擎使通往《纽约时报》域名的点击率最高下降了 93%。
点击率衡量用户点击显示链接的频率。点击率下降可能减少广告展示、订阅、品牌发现机会,以及建立直接读者关系的能力。
这一数字需要谨慎对待。它来自诉讼材料,其方法论尚未经过充分的公开检验。它可能反映的是特定查询、界面设计或测量周期,而非所有 Copilot 流量。
即便如此,它仍指向案件的核心问题:AI 答案是在创造一种新工具,还是在取代用于产出该答案的报道市场?
据报道,微软的一份内部演示将这一情况描述为“厄运循环”。如果 AI 答案减少出版商流量,出版商收入就会下降。收入下降继而意味着更少的记者和更少的原创文章。
这会让未来模型可吸收的可靠材料减少。因此,AI 服务可能削弱其质量所依赖的信息供给。
对于需要昂贵人力投入的报道,这一担忧尤为突出。调查报道、法庭报道、海外报道和地方政府新闻,无法仅凭既有文本生成。
必须有人出席听证会、核实文件、采访消息来源,并为发布承担责任。模型可以在这些工作发表后加以压缩,但压缩并不能为其创作提供资金。
当各方要求美国地区法官 Sidney Stein 通过简易判决解决争议时,案件进入了决定性阶段。若不存在需要陪审团裁决的重大事实争议,简易判决允许法院在不经审判的情况下裁定主张。
一篇AI 版权案件评析报道称,预计 Stein 将裁定主要部分是否应继续进入审判程序。最终决定预计不会立即作出。
美国司法部支持 OpenAI 在训练问题上的立场,强调科学进步、经济增长和国家安全。这一介入表明,争议的影响已远超一家出版商。
对模型开发者作出广泛不利裁决,可能提高组建训练语料库的成本。对开发者作出广泛有利裁决,则可能大幅削弱出版商对商业模型如何使用其档案的控制权。
微软和 OpenAI 面对自身的言论
核心冲突在于:一边是公开的合理使用辩护,另一边则是私下警告,称 AI 系统可能取代其不可或缺的内容供应商。
OpenAI 和微软不必证明其技术不会触及任何既有市场。具有转化性的产品往往会改变行业,而市场扰动本身并不构成版权侵权。
它们更棘手的问题更为具体。据报道,内部陈述预见了替代效应、引流流量下降、出版商经济受损,以及未来内容质量下降。
这些担忧与出版商案件中的要素相似。它们也使两家公司更难将有害的市场影响描述为推测性或遥远的风险。
据报道,微软的一份文件指出,最终产品很少会威胁其关键供应商的经济基础。随后,该文件称,微软恰恰为支撑大型语言模型的内容供应链制造了这种局面。
大型语言模型,即 LLM,会根据训练期间习得的模式预测和生成文本。其“内容供应链”包括那些产出被纳入数据集或检索系统材料的个人和机构。
这种表述将新闻业视为 AI 开发的投入要素。它也承认,这种投入不会自动出现。
出版机构雇佣记者、摄影师、编辑、设计师、律师和技术团队。他们为信息公开申请、差旅、信源开发、事实核查和更正提供资金。
ChatGPT 可以将信息从其所在的出版体验中剥离出来。用户会收到综合性回答,却未必能看到报道流程、广告、订阅邀请或来源关系。
对读者而言,这种便利就是产品。对出版商而言,同样的便利可能抹去报道创造经济价值的关键时刻。
当付费墙后的内容进入训练数据时,矛盾会更加尖锐。据报道,Nadella 曾作证称,任何将付费信息用于 grounding 或训练的人都应获得许可。
Grounding 指向模型提供外部信息以支持其回答。它与训练不同,因为相关信息可以在用户提问时被检索。
据报道,Nadella 表示,如果他知道 OpenAI 使用付费墙后的材料进行训练,他会行使 Microsoft 要求重新训练的权利。这一表态并不能证明他知道这种复制确实发生过。
但它揭示了 Microsoft 首席执行官认为重要的一项区别。受到付费和访问控制保护的材料,对获得许可的商业使用有着更明确的预期。
自 ChatGPT 推出以来,OpenAI 已与众多出版商达成授权协议。美联社、Axel Springer、News Corp 等机构均已宣布不同形式的内容合作安排。
这些协议支持两种相互对立的解读。OpenAI 可以主张,授权反映的是建立可持续合作关系的前瞻性努力,而非对过去行为的承认。
出版商则可以主张,这些协议证明授权市场确实存在。如果同类内容具有可授权的价值,未经授权的复制看起来就不再只是一个抽象的技术过程。
行业尚未形成统一做法。一些出版商授权其档案内容,一些屏蔽 AI 爬虫,另一些则提起诉讼。还有一些在不同产品和时期同时采用这三种策略。
由此形成的市场更有利于具备议价能力的公司。大型国际出版商可以就补偿、产品展示位置和署名条款进行谈判。
小型地方新闻编辑部的筹码则更少。它们的报道仍可能包含对答案引擎颇具价值的独特事实,尤其是在紧急事件或地方政治争议期间。
这种失衡有助于解释为何诉讼已不止于 Times。更广泛的原告群体包括全国性、专业性、调查性和地方新闻机构。
一名联邦法官在 2025 年允许核心版权主张继续推进。一项较早的法院裁决驳回了部分主张,但保留了围绕复制和模型开发的主要争议。
OpenAI 对被驳回的主张表示欢迎,并称其以基于合理使用原则的方式,利用公开可得的数据构建模型。Microsoft 拒绝就该裁决置评。
公开可得与获得许可之间的区别仍未解决。作品可在线阅读,并不必然意味着任何形式的复制都合法。
与此同时,版权并不赋予出版商控制事实或普通学习的权力。法院必须裁定,计算式训练在这些既有原则之间处于何种位置。
这些文件具有破坏性,但并非裁决
内部措辞强化了出版商的叙事,但并不能独立决定侵权、赔偿或合理使用。
最戏剧性的引述来自一名 Microsoft 员工,而非司法认定。在内部备忘录中将某项活动称为“盗窃”,并不能决定其是否满足版权侵权的法律构成要件。
员工常会使用不同于法律分析的道德性、战略性或修辞性语言。法院将审查行为和证据,而不会将某个人的措辞视为具有决定性的法律依据。
Microsoft 已通过将 Hecht 的评论描述为个人观点来强调这一点。该公司还可以主张,内部辩论体现的是负责任的风险分析,而非公司明知存在不当行为。
公司通常要求员工识别最坏情形。风险备忘录之所以可能包含直白警告,恰恰是因为决策者希望潜在危害得到清晰陈述。
因此,完整证据附件至关重要。若没有前后的信息、收件人和回应,读者无法知道高管是否接受、否决或调查了每一项警告。
出版商的法律陈述也具有倡导功能。其律师选择了有利于动议的证据,并围绕其法律理论组织这些证据。
OpenAI 和 Microsoft 将对同一记录作出不同解读。它们可以质疑引述的含义、流量数据的代表性,以及 AI 回答与出版商损失之间的因果关联。
它们还可以主张,不应将训练和产品输出视为同一行为。模型可以在不向用户复制某部作品的情况下,基于该作品进行训练。
反过来,产品也可以利用获得授权、属于公有领域或另行检索的信息,生成具有替代性的回答。法院可能需要分别评估不同的数据集、模型和功能。
据报道的一千万篇文章这一数字同样需要精确理解。文章存在于某个数据集中,并不能说明它在多大程度上影响了模型行为。
被复制的文件也未必会以已存储文章的形式保留下来、供人检索。模型通常编码的是学习到的统计关系,而不是充当普通的可搜索档案库。
但记忆化确实可能发生。模型有时会复现可辨识的段落,特别是在材料反复出现在训练数据中,或提示词被专门设计为诱导其输出时。
出版商主张,这类输出暴露了复制行为,并与原作形成竞争。OpenAI 则主张,非典型提示和孤立案例并不能代表正常的产品使用。
这一事实争议很重要,因为市场替代并不只是某人是否更偏好 ChatGPT 的问题。法院将审查受质疑的使用是否损害了受版权保护的现有市场,或合理潜在市场。
据报道的点击率下降 93% 看似相关,但仅凭这一数字无法回答该问题。比较必须考虑查询类型、结果呈现方式、引用以及用户意图。
针对某篇特定 Times 文章的导航型搜索,与笼统请求天气摘要不同。前者是在寻找出版商本身,后者则是在寻找许多来源都可提供的信息。
“最大规模的劳动盗窃”这一表述也可能分散人们对法律问题的注意力。其历史规模会引发一种情绪化论证,而双方赢得案件其实都不需要依赖这种论证。
更有用的追问是:复制了什么、在何种访问条件下、用于什么商业目的,以及产生了何种可衡量的影响。这些问题将技术过程与版权法理联系起来。
读者还应将 OpenAI 的网页抓取与所有形式的 AI 辅助搜索区分开来。训练、实时检索、索引、缓存、摘要和逐字复制是不同的操作。
每一种操作都可能涉及不同的许可和产品选择。将它们视作一种无差别的做法,会使可行规则更难被识别。
对知识工作者而言,这场争议带来了一项实际警示。放到网上的材料可能会流入日后难以审计的数据集、索引和答案系统。
维护可追溯的个人知识库无法阻止外部抓取。但当 AI 生成的摘要模糊信息来源时,它可以保留来源、作者身份和上下文。
同样的纪律在公司内部也很重要。采用 AI 工具的团队应记录哪些来源支撑了生成的主张,以及哪些许可适用于这些来源。
这项要求不仅是为了避免诉讼。来源溯源有助于用户区分原始证据与模型生成的综合内容。
OpenAI 抓取案接下来会发生什么
三个信号将显示,这些披露是否会改变法律结果、授权市场或 AI 答案产品的设计。
第一个信号是 Stein 法官的简易判决决定。该裁决将决定哪些问题现在可以裁定,哪些需要审判。
如果法院接受出版商论点的主要部分,关于替代效应和付费墙的内部证据将变得更具决定性。审判可能会让更多证据附件和证词暴露在公众审视之下。
如果法院给予 OpenAI 和 Microsoft 广泛保护,这些披露将继续造成声誉损害,却不会带来出版商所希望的法律转变。这一结果将强化其他模型开发者的合理使用立场。
分拆式裁决同样有可能。法官可能会区分:对可访问页面的训练、绕过付费墙、特定输出,或 Microsoft 的特定数据项目。
这些区别将比简单的胜负标签更重要。它们可能为收集、训练、检索和生成回答确立不同规则。
第二个信号是,在最终判决前授权实践将如何变化。OpenAI 已表明,在某些情况下它愿意与出版商谈判。
关注协议是否开始涵盖历史训练、实时检索、模型引用、收入分成,或四者兼有。每一项条款都针对冲突的不同部分。
历史训练许可将为过去的数据集使用赋予价值。检索协议将规范回答需要最新信息时的当前访问方式。
引用条款将决定用户能在多大程度上看到原始来源。收入安排则将处理:当出版商报道支撑商业回答时,出版商是否能参与收益分配。
关键问题是,较小媒体是否能进入类似市场。若授权体系只服务于最大的出版商,底层的供给问题仍将无法解决。
集体授权或标准化的机器可读条款可以扩大参与范围。然而,这些体系仍需要透明的核算机制,以及识别哪些内容影响了哪些服务的方法。
第三个信号是产品行为。Microsoft 和 OpenAI 无需等待法院裁决,就可以通过改变答案系统如何引导用户注意力来作出回应。
仅有显眼链接未必能解决问题。据报道,一名 OpenAI 工程师曾承认,无论链接放在何处,用户都可能不会点击。
更好的检验标准是可衡量的导流质量。出版商需要的是会参与互动、订阅或认识到来源的读者,而不是完整替代性回答下方的一条引用。
当查询意在获取特定受保护文章时,AI 公司可以限制摘要。它们还可以在界面中区分获得授权的检索内容与一般模型知识。
与此同时,出版商将继续测试技术壁垒和法律主张。预计会出现更多围绕爬虫控制、付费墙、缓存页面以及通过搜索索引提供的内容的争议。
更广泛的行业必须决定,原创报道究竟只是另一种原始输入,还是一项需要持续投资的服务。Microsoft 内部关于“doom loop”的警告,使这一选择更难被忽视。
对开发者而言,此案现在就应影响数据治理。技术上可访问的文件,并不自动免于合同、版权或声誉风险。
对于企业采购方而言,溯源应成为一项产品要求。应询问供应商:答案是来自训练记忆、实时检索、授权数据库,还是由客户控制的文档。
对于出版商而言,等待最终裁决本身也有代价。他们需要证据来说明 AI 界面如何改变引流、订阅和读者行为。
对于用户而言,便利性依然真实存在。聊天机器人能够迅速整合信息,并让复杂主题更容易理解。
负责任的做法,不是装作信息综合本身就能产生证据。当准确性、付费或问责至关重要时,读者应查阅一手来源。
OpenAI 网页抓取已不再只是关于某个模型如何获取文本的争议。它如今正在检验:AI 公司能否依赖新闻业,同时又分流支撑新闻业融资的注意力。
法院将裁定法律诉求。出版商、开发者和用户则将决定,支撑这些系统的信息经济能否在其成功之下存续。
下次当 AI 回答取代一次来源访问时,不妨问一个实际的问题:最初报道由谁资助,而那个机构今后是否仍有能力资助下一篇报道?



