top of page

Microsoft OpenAI 版权之争升级:《西雅图时报》和 Newsday 提起诉讼

9月6日
讀畢需時 13 分鐘

尽管多年来资助了旨在帮助地方新闻机构采用人工智能的试验项目,Microsoft 和 OpenAI 如今仍面临又一起出版商诉讼。《西雅图时报》和 Newsday 于 2026 年 9 月 4 日提起此案。两家媒体指控,这些公司未经许可复制其新闻报道,用于构建和运营商业 AI 产品。

该诉状的矛头不止指向模型训练。它称,ChatGPT、Microsoft Copilot 和 Bing 的相关功能能够复现或高度改写受保护的报道内容。据称,这些回答与出版商争夺读者、广告、订阅和授权收入。

这使得 Microsoft 与 OpenAI 的这场争端,比科技公司与版权持有人之间常见的纠纷更加复杂。两家出版商都曾参与由被告资助的 AI fellowship。它们并非完全拒绝 AI,而是主张,合作并不意味着授权无偿复制,或允许开发可替代其报道的产品。

此案也正值更广泛版权冲突的关键阶段。《纽约时报》和其他出版商已在曼哈顿就相关主张展开诉讼。与此同时,美国司法部支持针对 AI 训练的广泛合理使用抗辩。因此,新原告必须区分用于训练模型的涉嫌复制行为,与可能向用户暴露受保护表达内容的输出结果。

这起诉讼瞄准训练、检索与 AI 回答

出版商正在挑战整个内容链条,从网站抓取到向用户展示的回答。

Seattle Times Company 和 Newsday LLC 向纽约南区联邦地区法院提交了这份长达 38 页的诉状。被告包括 Microsoft,以及 OpenAI 公司架构下的多个实体。

出版商称,自动化系统复制了数十万篇文章。根据诉状,其中部分内容位于旨在限制非订阅用户访问的付费墙之后。被告尚未承认这些指控,法院也尚未认定相关复制如诉状所述确实发生。

诉状列举了这些材料的多项涉嫌用途。它称,复制内容被纳入用于训练和微调大语言模型的数据集。诉状还指控,相关内容被存储用于检索增强生成,即通常所称的 RAG。该过程会在用户提出问题时检索外部材料,并在生成回答时将其提供给模型。

这一区别很重要,因为训练和检索涉及不同的事实问题。训练是通过让模型接触大型数据集合中的模式来改变其参数。检索则可能在用户提交相关查询时,将特定文档带入生成过程。

出版商还指控这些公司删除或修改版权管理信息。这类信息可能包括标题、作者姓名和版权声明。其主张不仅涉及直接版权侵权,也涵盖相关的联邦和州法律理论,包括商标淡化。

最具体的指控涉及模型输出。诉状列举了一些例子,称 ChatGPT 返回了与出版商作品相似的段落。据报道,一项测试在输入文章标题和网址后,生成了《西雅图时报》关于 Boeing 737 MAX、曾获 Pulitzer 奖的报道中一段长达 88 个词的内容。

这一例子并不能说明类似输出出现的频率。它确实表明,为何此案不能被简化为关于机器学习统计模式的抽象争论。出版商将具体的输出行为,与其关于上游复制的主张并列提出。

因此,所请求的救济范围也很广。两家报纸寻求损害赔偿,并要求禁止继续侵权的禁令。根据已提交的版权诉状,它们还要求销毁未经授权的复制内容、受影响的训练数据集,以及纳入其作品的模型。

销毁令将带来重大的技术和法律问题。现代模型反映的是对庞大数据集的训练,而不是保存一个可直接阅读文章的简单资料库。在考虑此类救济前,法院需要证据将特定作品、数据集、模型版本和涉嫌侵权的使用行为联系起来。

目前,所有核心陈述仍属指控。被告尚未提交详细答辩,也没有法官裁定出版商作品被非法纳入相关产品。这份诉状通过确立一宗新案件改变了争端格局,而非解决有争议的事实。

Microsoft OpenAI 的抗辩面临地方新闻考验

核心冲突在于,AI 训练究竟创造了一种新的分析工具,还是利用与其竞争的新闻报道打造出替代品。

OpenAI 表示,其模型基于公开可得的数据训练,该做法以合理使用为依据。合理使用是一项法律原则,在考量目的、转换性、市场影响及其他因素后,允许某些未经许可的使用。

Microsoft 在诉讼公开时未提出详细的法律抗辩。一位公司发言人称,Microsoft 对此案的提起感到意外,且仍愿意讨论可能的解决方案。这一回应尚未解答诉状中的技术指控,因为案件仍处于早期阶段。

出版商以不同方式界定同一活动。它们称,被告复制了具有表达性的作品,以创建能够回答这些作品原本旨在回答的问题的服务。按其说法,ChatGPT 和 Copilot 不只是分析新闻报道;它们还能提供信息,使读者失去访问原始出版物的理由。

这种被指控的替代效应很重要,因为市场损害是合理使用分析的一部分。法院可能将模型训练、模型输出和检索系统视为不同的使用行为。在某一阶段被认定具有转换性的活动,并不会自动保护所有下游输出。

司法部在相关诉讼中曾主张这种区分。在 2026 年 9 月提交的一份文件中,政府将 LLM 训练描述为高度具有转换性。它将这一过程比作利用既有材料构建一个能够识别关系并回应新信息的系统。

不过,政府的合理使用意见书也区分了训练与重建、传播受保护作品的输出。它主张,对可能侵权的输出应逐项评估,而不应以此决定整体训练行为的合法性。

这一立场为双方都提供了论据。OpenAI 和 Microsoft 可以主张,训练的目的不同于发布新闻。报纸则可以聚焦检索、记忆化、重复段落,以及据称取代文章访问的回答。

举证责任将十分关键。原告需要将已登记的作品与特定复制行为或可诉输出联系起来。被告则可以质疑,经提示生成的复现内容究竟代表正常产品行为、特殊测试,还是旨在诱导受保护文本的尝试。

新案件还提出了地方新闻这一维度。全国性出版商拥有更多元的受众和订阅业务,尽管它们同样面临引流压力。区域性机构则更依赖那些寻求地方政府、交通、学校、天气和公共安全信息的读者。

这些查询很适合由摘要式回答来处理。用户可能向助手询问交通中断情况,并在不打开报道文章的前提下获得关键信息。当该回答源自原创地方报道时,出版商承担了报道成本,而另一个界面则掌控了与受众的关系。

诉状援引行业数据称,2024 年 12 月至 2025 年 12 月期间,中型区域和都市出版商获得的搜索引流下降了 47%。它将这一数字与大型全国性出版商 22% 的降幅进行比较。

这些数字提供了背景,但并不能证明本案中的因果关系。引流量变化有多种原因,包括搜索排名更新、消费者行为、平台设计以及出版商之间的竞争。原告仍需提出更具体的证据,证明其损失与被告产品之间的关联。

因此,法律问题比 AI 是否影响新闻业更为狭窄。它关乎被告是否进行了受法律保护的使用、是否产生了侵权输出,或是否损害了版权法所承认的市场。这一区分将决定此案是否成为有关训练的先例,还是聚焦于特定内容链条的案件。

AI 资助并未解决许可问题

最显著的反转在于,两家报纸一边接受 AI 开发支持,一边坚持采用 AI 并不等同于同意授权。

2024 年,Microsoft 和 OpenAI 支持了由 Lenfest Institute for Journalism 组织的一项 AI 协作计划。两家公司分别承诺提供直接资金和软件额度。该项目总价值最高达 1,000 万美元,涵盖八家独立的大都市新闻机构。

《西雅图时报》和 Newsday 都是参与者。该计划旨在帮助地方出版商测试 AI 支持的产品,并探索更可持续的商业模式。它将 AI 视为新闻机构能够使用的工具,而不只是必须阻止的威胁。

《西雅图时报》计划探索广告、销售培训和分析。Newsday 计划为其新闻编辑部、读者和企业客户开发公共数据摘要工具。已发布的fellowship 计划显示,两家机构都参与了行业对生成式 AI 的探索。

《西雅图时报》还表示,其新闻编辑部在风险审查后允许有限使用 AI。这些用途可以包括转录和数据分析。该机构称,不使用 AI 生成已发布的报道,并会在适当情况下标注重要使用情形。

这段历史削弱了将该诉讼简单描述为抗拒新技术的说法。原告正在划定一条界线:使用获得许可的工具,不等于授权其新闻报道被用于训练、检索或竞争性输出。

这也为 Microsoft 和 OpenAI 提出了一个令人不安的问题。它们对地方新闻的投资将 AI 宣传为实现可持续发展的路径。该诉讼则主张,同样的公司通过无偿使用报道内容,破坏了这一目标。

Seattle Times 总裁兼 CEO Alan Fisco 告诉员工,提起此案很困难。他表示,该机构每年投入数百万美元制作内容,必须保护这些内容免受未经批准、未获补偿的使用。

Fisco 还表示,诉讼并非旨在阻碍 AI 创新。他所表达的关切是,创新不应以牺牲报纸的商业模式为代价。这一立场将冲突引向授权和市场设计,而非全面禁止 AI。

工会的回应又增加了一层复杂性。代表160多名员工的 Seattle Times Union 支持这起版权诉讼,同时批评出版社在合同谈判中拒绝保证 AI 不会取代新闻编辑室中非报道岗位的员工。

工会的立场揭示了第二条边界。出版社可以捍卫自身知识产权,同时仍会因其如何对待自家员工部署 AI 而受到审视。这起诉讼并未解决新闻编辑室采用 AI 是否能保障就业、提升生产率,或将工作从员工手中转移出去的问题。

对于知识工作者而言,这场争议说明了信息溯源为何重要。溯源意味着了解信息来自何处,以及其使用受哪些许可约束。AI 给出的答案可能看似有用,却掩盖了使该答案成为可能的报道、文件和人类劳动。

正在构建 AI knowledge base 的组织也面临类似的运营问题。它们需要制定规则,明确哪些内容可以进入系统、哪些用户能够访问,以及生成的答案是否保留了来源语境。

这场冲突并非合作与诉讼之间的对立,而是获得许可的合作与被指未获补偿的攫取之间的对立。资助、产品许可或创新计划,并不必然授予对无关用途的版权许可。

这一区别的影响将超出新闻业。企业正日益将供应商模型与内部文件、授权数据库和公开网络材料结合使用。采购方需要就训练权利、检索来源、署名、数据保留以及生成内容责任获得明确的合同答复。

授权协议让市场损害论点更难忽视

现有的出版商协议表明,新闻内容已形成 AI 授权市场,但并不能自动证明所有未经授权的使用都属违法。

OpenAI 已与选择谈判而非诉讼的出版商达成协议。这些安排有助于证明,历史新闻资料和最新新闻材料对 AI 开发者具有商业价值。

Associated Press 宣布了一项协议,允许 OpenAI 授权使用其部分文字档案。双方还计划探索生成式 AI 在新闻产品中的潜在应用。该档案协议并未披露完整的商业条款。

News Corp 随后宣布了一项多年合作伙伴关系,涵盖其在多个市场运营的出版物中的当前及历史内容。OpenAI 获准在其产品中展示相关材料,而 News Corp 则围绕此类使用建立了正式的商业合作关系。

这项出版商合作伙伴关系展示了一条可行的授权路径。它也加强了原告的论点:未经授权的复制可能绕过一个其他出版商能够获得补偿的市场。

不过,许可的存在并不能决定是否构成合理使用。版权被告常常主张,权利人不能仅仅通过提供许可,就将每一种转换性使用都变成受其控制的市场。否则,出售许可的决定可能预先决定许可在法律上是否必需。

报纸方必须证明的不仅是假设性的许可费损失。它们必须说明,被质疑的使用如何影响其作品已经建立或可合理预期的市场。有关授权谈判、产品替代、引流损失和订阅者行为的证据将变得重要。

OpenAI 和 Microsoft 很可能会强调,自愿商业安排与法律义务之间存在区别。它们可以主张,一些公司为改进产品、获取可靠信息源或展示带署名的材料而授权内容,即使训练本身仍属于合理使用。

与训练副本是否存在相比,关于输出的指控可能再次被证明更具决定性。一个利用从新闻报道中学到的模式的模型,提出的是一种市场问题;一个返回可辨识段落、概述付费墙调查报道,或错误地为虚构材料署名的服务,则是另一种问题。

错误署名也使争议超出点击量损失。起诉书称,生成内容曾被关联至 The Seattle Times 或 Newsday,即使这些出版商并未创作这些内容。这种被指控的行为会威胁品牌信任,而地方新闻机构正是通过准确性和问责制建立这种信任。

Microsoft 的角色将受到特别关注。该公司并非只是外部投资者。它已将 OpenAI 模型整合进 Copilot 和 Bing 产品,提供基础设施,并在双方合作中维持了重大经济利益。

起诉书称,Microsoft 自2019年起向 OpenAI 投入约130亿美元。起诉书还援引两家公司在2025年10月的公告称,Microsoft 持有价值约1350亿美元的投资,按完全摊薄口径计算约占27%。

这些数字来自原告的诉状及其援引的公司披露信息。它们解释了 Microsoft 为何被列为被告,但投资本身并不能证明责任成立。出版商必须根据每一项法律理论,将 Microsoft 与被指控的复制、控制、产品运营或侵权输出联系起来。

原告试图将 Microsoft 与 OpenAI 的产品描绘为一个相互连接的商业系统。Microsoft 可以通过区分公司实体、技术责任和特定产品行为来反驳这一描述。证据开示应能澄清谁组建了数据集、谁控制了网络抓取,以及哪些系统生成了被援引的回复。

这些证据也将影响任何救济措施。销毁一篇已存储的文章,比从训练模型中移除其影响要简单得多。如果涉及多个数据集、模型代际和产品层级,原告必须明确哪些资产包含可追究的副本,以及为何更有限的控制措施不足以提供救济。

因此,授权格局具有双重作用。它支持新闻内容具有可衡量商业价值的论点,同时也凸显了必须逐项分析每一种使用,而不能将所有访问已发布材料的行为视为法律上完全相同。

三个信号将显示此案是否改变 AI 出版业

下一阶段将取决于案件合并、技术证据,以及法院如何区分训练与面向用户的输出。

第一个信号是,这起诉讼是否会并入涉及 The New York Times 和其他出版商的现有多地区诉讼程序。相关案件此前已在曼哈顿由美国地区法院法官 Sidney Stein 协调审理。

合并审理可以减少重复的证据开示和相互矛盾的裁决。它也可能让新原告加入一场已经成熟的争议,双方均已围绕数据集、输出、合理使用和市场损害形成论点。

协调审理将强化这样一种看法:这是全行业法律争端的一部分。单独审理则会为区域性出版商、付费墙、地方新闻经济,以及 Microsoft 与其总部所在地报纸之间的关系保留更多针对性事实空间。

第二个信号是证据开示对内容溯源的揭示。起诉书称,Seattle Times 的材料曾出现在早期 OpenAI 数据集所使用的主要域名中。它还主张,后续模型通过网络数据集、搜索索引和其他来源吸收了两家出版商的作品。

OpenAI 对早期模型数据集披露的信息,比其对近期系统披露的更多。这种不透明性使得仅凭公开材料很难建立内容溯源。内部记录可能显示出版商文章是否进入特定数据集、副本如何被处理,以及后续系统是否直接检索这些文章。

证据开示也可能检验88词示例的重要性。各方将审查普通提示是否会生成类似段落、防护措施是否能防止重复,以及该输出是来自被记忆的训练数据还是被检索的内容。

频繁且易于生成的复现将加强出版商关于替代效应的论点。通过异常针对性的提示才出现的罕见输出,则会支持辩方的主张:例外行为不应决定整项技术的合法性。

第三个信号是法院如何将输入复制与公开输出区分开来。Justice Department 的立场倾向于为训练提供强有力的合理使用保护,同时为涉及重构作品的主张留下空间。若裁决采纳这种划分,将缩小出版商的路径,但不会完全排除其诉求。

这样的结果将把注意力转向输出过滤、检索许可、来源署名以及对展示内容的补偿。它也可能促使开发者在模型训练与获取或引用实时文件的系统之间维持更明确的边界。

如果裁决将训练和竞争性输出视为一个相互连接的商业过程,AI 公司将面临更大风险。这也会加强寻求对历史数据和持续访问均获得许可的出版商的地位。

销毁要求仍是风险最高的救济措施。法院通常会针对已被证实的违法行为量身定制禁令。要求移除完整模型,将需要证明较为有限的措施无法提供充分救济。

这使得在案件初期立即停运的可能性不大。更现实的短期结果包括有争议的证据开示、产品层面的防护措施、授权讨论,或针对可识别副本和输出的命令。最终救济取决于尚未公开的事实。

开发者应关注此案是否会为来源追踪带来更明确的标准。企业采购方应询问供应商,受保护内容如何进入生成答案。出版商应分别就训练、检索、引用、署名和引流流量进行谈判,而非将它们视作一种许可。

知识工作者可以采用一个更简单的测试。当 AI 答案取代来源时,用户是否仍能识别并评估其背后的报道?如果不能,便利性就移除了判断准确性、所有权和语境所需的信息。

如果 Microsoft OpenAI 诉讼迫使法院为这些阶段划定可执行的边界,它的意义将最为重大。在此之前,无论是宽泛的“盗窃”主张,还是宽泛的合理使用主张,都无法回答所有问题。

未来三个月请关注法院案卷、证据开示记录以及任何授权谈判。这些信号将共同显示,此案是否会改变 AI 训练规则,还是将责任集中于特定输出。读者也应在 AI 系统概述重要地方新闻时,继续打开并评估原始报道。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page