OpenAI 版权诉讼揭开 AI 经济中的末日循环
一份解封文件披露了有关其技术经济基础的内部警告,使 OpenAI 面临更尖锐的冲突。OpenAI 版权诉讼如今包含了关于“窃取”、替代效应、引流流量崩塌,以及 AI 驱动的“末日循环”的讨论。
这些表述出现在寻求对 OpenAI 和 Microsoft 作出简易判决的出版商所引用的材料中。当关键事实不存在实质性争议时,简易判决允许法院无需审判便裁定相关主张。这份文件并不能证明任一公司实施了版权侵权。
但它确实让两家公司的公开辩护变得更复杂。OpenAI 和 Microsoft 主张,模型训练会对源材料进行转换,因此构成合理使用。出版商则认为,相关产品复制了它们的作品、与之竞争,并削弱了支撑未来新闻业的市场。
这场冲突不止关乎训练数据。内部讨论描述了一个依赖人类出版内容、却将注意力从内容生产者身上引开的系统。如果这一机制持续存在,模型及其信息供给可能会一同恶化。
OpenAI 版权诉讼刚刚获得新的案卷记录
最重要的变化不是出现了新的指控,而是此前被遮盖的内部证据如今得以公开。
新闻机构于 2026 年 9 月 17 日提交了部分解封的材料。该材料属于纽约南区联邦地区法院 Sidney H. Stein 法官审理的合并诉讼的一部分。
诉讼合并审理了 The New York Times 及其他出版商对 OpenAI 和 Microsoft 提出的主张。出版商认为,两家公司在获取、训练、检索及生成输出的过程中复制了受保护的文章。
新近可见的内容包括内部文件、信息往来和证词。它们呈现了两家公司内部围绕同意、补偿、市场替代以及在线信息未来供给的分歧。
一份 Microsoft 文件预测,数以百万计的人会将大型模型吸收其作品视为一种极其严重的劳动成果窃取。据报道,Microsoft 应用科学家 Brent Hecht 将其描述为可能是人类历史上规模最大的劳动窃取。
这一表述需要谨慎界定。它来自个别员工或内部分析,并非司法裁定,也不是公司正式承认侵权。Microsoft 表示,聘用 Hecht 的部分原因是为了提出非传统及相反的观点。
不过,这份解封文件仍然重要,因为它记录了构建和分发这些系统的机构内部存在的担忧。这些担忧与出版商公开提出的论点高度相似。
OpenAI 高管也讨论过其产品取代用户访问原始来源的风险。据报道,负责 ChatGPT 产品开发的 Nick Turley 在 2023 年写道,AI 对出版商构成生存性威胁。
据报道,Turley 在随后的一则信息中称,OpenAI 的产品已经在很大程度上具有替代性。他预计,随着产品改进,这种替代效应会进一步增强。
根据该文件,Microsoft CEO Satya Nadella 也曾就聊天机器人对出版商访问量的替代作用作证。Microsoft 主张,他对消费方式变化的宏观观察并不能决定法院面前的版权问题。
该文件还描述了据称获取或交换大规模在线材料集合的技术尝试。根据法律报道,Microsoft 的 Project Taxi 向 OpenAI 提供了一个由 Bing 收集、包含数十亿网页的资料集合。
另一项名为 Project Mango 的工作,据称涉及 OpenAI 付费让 Microsoft 运行网络爬虫。爬虫是一种自动访问网页并复制其内容以供索引或处理的软件。
出版商将这些安排描述为大规模工业化获取和分发的证据。被告方则反驳出版商的法律结论,并坚持认为训练具有转换性。
法院必须将具有煽动性的内部表述,与满足版权法各项构成要件的证据区分开来。这项任务将涉及复制了什么、为何复制,以及相关产品是否损害了相关市场。
不过,这些措辞改变了公众对争议的理解。它表明,替代效应和对出版商的损害并不只是外部批评;接近产品开发的人也在审视同样的可能性。
为什么 Bing 流量数据提高了风险
流量证据将抽象的版权争议转化为一个可量化的问题:谁获得了在线报道创造的价值。
出版商提交的文件援引 Microsoft 数据称,Times 和 Daily News 内容的点击率下降了 83% 至 93%。据报道,Ziff Davis 旗下域名的降幅介于 51% 至 94%。
点击率衡量的是用户看到结果后进入其来源页面的频率。较低的点击率并不能自动证明版权侵权、因果关系或营收损失。但它们确实揭示了答案式界面如何改变受众行为。
传统搜索形成了一种交换关系。出版商允许页面被索引,搜索引擎展示摘要,用户访问原始网站。出版商随后可以销售订阅、广告、会员服务、活动或其他服务。
当生成式搜索在来源链接之前呈现综合答案时,这种交换关系便会发生变化。用户可能已从界面获取足够信息,不再继续搜索。更突出地展示引用,也无法保证用户会访问。
据报道,一名 OpenAI 工程师承认,无论链接多么显眼,用户都可能不会点击。这一观察比对模型训练的一般性批评更直接地支持了出版商的替代理论。
这种区别很重要。训练关乎什么内容进入模型,而替代关乎模型与原始读者争夺时发生的情况。法院可能会在版权法下以不同方式评估这两种使用。
合理使用的第四项因素考察的是对受版权保护作品市场的潜在影响。它并非唯一因素,但直接替代的证据可能会在这一分析中具有很大分量。
该文件还描述了一种据称绕过 The New York Times 付费墙的内部“技巧”。据报道,在讨论这一方法时,Greg Brockman 作出了认可回应。
这一说法值得谨慎对待,因为其法律重要性取决于具体背景。关键在于,该方法是否访问了受保护文本、是否支持测试、是否影响了产品,或仅是一次短暂的实验。
OpenAI 也指责 Times 使用人为设计的提示词,以生成异常相似的输出。该公司认为,普通用户与 ChatGPT 的互动方式并非如此。
这些相互竞争的说法形成了核心证据问题。法院必须判断,替代效应究竟是为诉讼制造的边缘案例,还是可预见的产品能力。
流量数据或许能提供更广泛的信号,因为它涉及受众行为,而非经过挑选的提示词。不过,所引用的百分比本身并未披露所有相关基线、查询类型、界面变化或测量周期。
Microsoft 表示,Copilot 并不是出版商新闻内容的替代品。其发言人还称,Nadella 对信息消费的观察与公司的法律立场一致。
这一辩护将经济变化与法律责任区分开来。一项技术即使降低了引流量,也未必构成版权侵权,正如合法竞争者可以从既有企业手中夺取市场份额。
出版商回应称,这种竞争并不独立。它们称,被告复制了同样的新闻内容,而其产品又对这些内容进行概述、复现,并借此留住读者。
这正是 Bing 数据的重要性超出单一出版商的原因。它们表明,用户注意力可能正从源网站转移到使用这些来源的平台。
对于独立出版物、地方新闻编辑部和专业网站而言,大幅引流下降可能影响招聘和报道决策,也可能减少未来模型可获得的原创材料数量。
OpenAI 的末日循环将出版商变成无偿供应商
内部的末日循环分析指出了一种结构性矛盾:AI 产品需要权威内容,却在削弱为其创作提供资金的企业。
所引述的 Microsoft 文件描述了一种威胁其关键供应商经济基础的最终产品。文件将这些出版商称为 LLM 内容供应链的一部分。
大型语言模型,即 LLM,会在学习大量文本集合中的统计关系后预测并生成语言。其有用性部分取决于这些集合的相关性、多样性和可靠性。
新闻机构生产的是一种独特的源材料。记者出席事件、进行采访、查阅记录、核实说法并纠正错误。这些工作创造了此前并不存在于网络上的信息。
AI 系统可以在数秒内概述最终文章,却无法事后完成产生底层事实所需的报道工作。
当 AI 产品摄取或检索这些报道时,末日循环便开始了。随后,它们通过独立界面呈现其中最有价值的信息。
读者无需访问原始出版商即可获得答案。出版商则失去注意力、收入、行为数据,以及与潜在订阅者建立关系的机会。
收入减少可能导致记者人数下降、报道范围收缩。这会给搜索引擎、聊天机器人和未来的训练工作留下更少的原创来源。
模型可能因此日益依赖衍生摘要、重复报道、宣传材料或合成文本。随着独立核实信息的供给缩减,准确性和多样性可能下降。
这不只是传统媒体与新技术之间的争议。问题在于,信息市场究竟是奖励发现事实,还是只奖励分发。
平台在分发方面拥有显著优势。它们控制界面、推荐系统、模型和用户关系。出版商通常承担生产该环境中展示事实的成本。
授权提供了一种可能的修正方式。OpenAI 已与多家出版商签订内容协议,并主张 AI 可以帮助新闻编辑部触达受众、开发新产品。
授权同样带来棘手问题。大型出版商的谈判地位强于地方媒体、自由职业者或小型专业网站。私下协议可能无法解决更广泛市场中的失衡。
退出机制则是另一种选择。OpenAI 表示,出版商可以控制其爬虫是否访问内容,用于训练或搜索功能。
不过,当 AI 界面成为主要信息发现渠道时,退出可能在商业上代价高昂。出版商或许不得不在放弃内容访问权与从重要分发系统中消失之间作出选择。
这一选择类似于早期出版商与搜索平台之间的关系,但生成式回答提高了风险。传统搜索会将用户引向外部,而聊天界面旨在在内部完成信息任务。
这一循环同样影响企业用户。企业日益依赖 AI 生成的法规、市场、竞争对手和技术发展的摘要。来源溯源薄弱会使这些摘要更难审计。
管理得当的 AI 知识库 可以在组织内部保留来源语境。但它无法修复原创报道更广泛的经济困境。
因此,这个问题已从版权延伸至信息基础设施。如果网络上的一手来源减少,每个检索系统可获取的可靠材料都会变少。
这份内部警告之所以引人注目,是因为它将出版商的健康状况视为模型性能的依赖因素。它不只是将新闻业视为内容,更视为 AI 的上游基础设施。
这种表述挑战了一个假设:在线信息是取之不尽的原材料。其供给必须由具备调查现实世界资源的人和机构持续更新。
内部警告并不构成对盗窃的法律承认
这份提交材料揭示了严重担忧,但法院会依据证据和法定测试来裁定版权责任,而非内部信息中的戏剧化描述。
将这些材料称为承认盗窃,混淆了几个不同的问题。版权侵权属于民事法律主张,而盗窃通常是指在另一套法律框架下非法取得财产。
员工使用的比喻并不会自动约束公司。对于公众观感的预测,也无法证明特定复制行为不属于合理使用。
出版商仍须证明其对受保护内容拥有所有权、存在可追责的复制行为,以及每名被告的相关行为。OpenAI 和 Microsoft 随后可以针对具体阶段和用途提出抗辩。
合理使用考量使用目的、原作性质、使用数量以及市场影响。法院会综合权衡这些因素,而非套用单一机械规则。
OpenAI 辩称,模型训练识别的是模式,并产生具备新功能的系统。它还表示,相关防护措施会抑制内容复现,且模型能带来广泛的公共利益。
OpenAI 在其诉讼回应中表示,加州两项联邦判决曾将其他案件中的训练用途视为高度转换性使用。但这些裁决并未解决这起纽约诉讼。
不同数据集、获取方式、输出内容和市场中的事实可能有所不同。将书籍转化为模型参数的使用,仍可能面临关于盗版获取或竞争性输出的独立问题。
出版商强调,这些系统并非仅在训练阶段运作。它们可以检索当前文章、对其进行摘要、复现段落,并回答原本会引导读者前往出版商的问题。
这一区别可能将合法学习与被指有害的部署行为区分开来。法院可能会将获取、训练、检索支撑和输出生成视为不同的行为。
Microsoft 也对 Hecht 文件所被赋予的分量提出异议。该公司表示,他是一名没有决策权的学术研究人员,其职责是提出不对称的观点。
这一解释并未抹去他的分析,但确实限制了这些文件代表 Microsoft 最终立场的说法。
同样,OpenAI 高管对出版商被替代的担忧,可能是在描述商业风险,而非承认侵权。替代性与合理使用相关,但并不能单独决定所有因素。
被告方还获得了联邦政府的支持。司法部认为,模型训练能够服务重大公共利益,并敦促法院拒绝一种一概认定侵权的理论。
根据政府提交文件,该部门警告称,广泛的不利裁决可能阻碍科学和经济进步。这一干预加强了支持 OpenAI 立场的政策论据。
然而,公共利益并不会带来无限制的版权豁免。法院必须确定现行法律如何适用于具体行为,包括被指从未经授权来源获取内容的行为。
该案在程序上也尚未完结。简易判决动议仅呈现一方提出的事实和法律结论。答辩、反陈述、证据材料和司法认定都可能实质性改变整体图景。
一些细节仍处于密封状态,另一些则缺乏足够的上下文,难以作出有把握的解读。将每句话都视为企业自白的标题,可能夸大现有记录实际证明的内容。
更准确的结论依然意义重大。内部参与者认识到,AI 产品可能替代出版商、减少导流,并削弱其自身的信息供给。
这些公司可能在法律上胜诉,同时这一经济警告仍然成立。合理使用决定的是法律许可,而不是由此形成的市场结构是否支持一个健康的网络。
真正的冲突是 AI 替代与可持续网络之间的较量
核心竞争在于无摩擦的 AI 回答,与为这些回答所依赖的人类工作持续提供资金之间的平衡。
OpenAI 将生成式 AI 描述为具有广泛益处的变革性工具。其模型帮助用户分析信息、编写软件、学习复杂主题和完成知识工作。
出版商并不主张每一种此类用途都应消失。他们的诉讼针对的是系统如何获取受保护材料,以及其输出是否与原作构成竞争。
新披露的文件将这两个层面联系在一起。它们表明,OpenAI 和 Microsoft 内部人员理解,替代性是产品改进所追求或不可避免的特征。
更好的聊天机器人应当能完整回答更多问题。从用户的角度看,这种改进降低了打开更多页面的必要性。
从平台的角度看,将互动留在自身界面内会增强留存。从出版商的角度看,同样的成功却减少了获得收入的机会。
因此,即使引用准确,激励仍然并不一致。一份完美署名的回答,依然可能在用户点击前就满足其需求。
这种冲突存在于整个 AI 行业。Google 将生成式摘要整合进搜索,而其他问答引擎则将网页内容综合为直接回答。
Anthropic 和其他模型开发商也面临关于训练材料与输出的类似问题。不同公司使用不同的数据集、许可证、爬虫和产品防护措施。
这种比较并不能为任何被告的行为开脱。它表明,最终的法律规则将影响整个市场,而不只是某一项合作关系。
如果法院广泛保护训练、但限制替代性输出,AI 公司可能会更大力投资于检索控制和授权许可。它们也可能更清晰地区分模型开发与内容交付。
如果法院同时保护训练和回答生成,出版商将需要在版权诉讼之外获得更强的商业筹码。可能的应对措施包括集体授权、访问控制、直接订阅和立法干预。
如果出版商在多项理论上胜诉,模型开发商可能面临赔偿、更受限的数据集或新的许可要求。经济影响将取决于补救措施如何处理已训练的模型。
诉讼还暴露了数据质量问题。模型开发商有动力获取大量文本,但不一定有动力维持每一家生产这些文本的机构。
授权协议可以在一定程度上协调这些激励。与实际使用挂钩的收入分成可以让双方更紧密地对齐,尽管衡量和归因在技术上仍很困难。
出版商还需要了解其材料何时为回答提供了信息。模型提供商则需要建立追踪来源的系统,同时不暴露私人数据或专有基础设施。
内部“内容供应链”的表述提供了一个有用的起点。供应链通常涉及合同、质量标准、可追溯性和付款。
公共网络的大部分发展遵循的是更宽松的规范。任何人都可以链接、在法律限度内引用并索引页面,同时将读者导回来源。
生成式界面改变了这种平衡,因为它们可以将许多页面的价值重构为一个回答。输出之所以便捷,恰恰是因为它减少了读者旅程中的步骤。
便利是一项真正的社会利益,竞争、研究获取和新的创意工具也是如此。问题在于,谁来承担生产可靠来源材料的成本。
一个可持续的答案不能完全依赖用户在获得所需一切后,自愿点击引用链接。它必须将产品成功与对上游知识的持续投资联系起来。
OpenAI 的末日循环为这一问题赋予了一个令人印象深刻的名称。其背后的机制比这个说法本身更重要。
三个信号将显示末日循环是否正在加深
下一阶段将揭示,法院、产品和商业协议能否重新将 AI 使用与创造其价值的来源连接起来。
第一个信号是 Stein 法官如何处理简易判决动议。裁决可能缩小案件范围、解决具体问题,或将重大事实争议送往审判。
其推理将比简单判断谁胜谁负更重要。读者应关注法院是否将获取、训练、检索和输出视为法律上不同的活动。
若裁决只聚焦于转换性训练,替代性问题将基本悬而未决。若裁决强调市场损害,则会加大对授权和产品调整的压力。
第二个信号是 AI 搜索产品中的导流表现。Microsoft 报告的点击率下降幅度很大,但其底层测量仍需要更完整的背景信息。
应关注平台是否发布涵盖引用、点击、查询类型和出版商类别的可比数据。独立测量将至关重要,因为各方都有动机以不同方式描述流量。
点击率的提升将削弱末日循环论最强的版本。持续下降则会表明,仅有来源链接并不能恢复这种经济交换。
第三个信号是 AI 公司是否让授权机制更加系统化。单独的协议表明出版商内容具有商业价值,但零散交易无法形成持久市场。
更强的模式应包括透明的准入条件、使用报告、署名标准,以及让小型出版商也能获得的补偿。它应将新鲜报道视为可再生基础设施,而非免费库存。
OpenAI 还可以通过明确爬虫控制,并将训练许可与搜索可见性分开,来减轻压力。出版商不应为了拒绝不相关的模型用途,就不得不从发现渠道中消失。
OpenAI 版权诉讼中披露的证据,并不能证明网络已经注定毁灭。但它确实表明,内部人士在这一反馈循环成为公开法律论点之前便已识别出它。
这一认知提高了行业回应的标准。企业在围绕完整、自成一体的回答设计产品时,已无法可信地将对出版商的伤害视为无法预见的副作用。
开发者和企业采购方应追问 AI 答案的来源、原始信息是否仍可访问,以及服务提供商如何处理存在争议的内容。知识工作者应保存一手文件,而不是依赖脱离原文的摘要。
出版商应要求采用能够将答案与来源使用情况及经济价值关联起来的衡量方式。读者也可以支持那些原创报道为随后在网络上传播的事实提供来源的媒体。
核心问题已不再是生成式 AI 能否总结新闻报道。显然,它可以。问题在于,这种便利是否会为下一次调查报道提供资金,还是会让它更难发生。
关注法院作出的法律区分、平台的引流数据,以及授权项目的覆盖范围。这些信号将共同表明,OpenAI 的“末日循环”究竟正在被纠正,还是正成为网络默认的商业模式。



