Naver AI 版权诉讼的关键,在于其新闻合同实际允许了什么
尽管三家广播公司称其文章未经许可便被使用,Naver 在法庭上为其 AI 训练做法辩护。这起 Naver AI 版权诉讼如今聚焦于:较早签订的新闻共享合同是否授权了出版商称自己从未知情同意的用途。
KBS、MBC 和 SBS 于 2025 年 1 月起诉 Naver,指控其涉嫌使用相关材料训练 HyperCLOVA 和 HyperCLOVA X。三方寻求赔偿,并要求法院下令停止继续使用其新闻内容进行训练。
Naver 向首尔中央地方法院表示,合同中涵盖研究、服务开发和句子提取的条款允许其使用相关内容。根据 9 月 8 日的报道,该公司坚称,这些协议使其免受广播公司相关主张的约束。
这一辩护使争议比“机器学习是否构成合理使用”这一常见论点更加尖锐。法院还必须裁定,在生成式 AI 成为明确的商业类别之前,双方究竟授权了哪些用途。
广播公司表示,授权通过 Naver 分发新闻,并不等于允许其构建商业语言模型。Naver 则认为,合同预见了更广泛的技术处理,即使其中并未点名大语言模型。
这一区别的影响超出韩国的一桩诉讼。科技公司往往持有多年积累的授权材料,而相关协议签订时,当下的 AI 系统尚未出现。如果宽泛的开发条款涵盖模型训练,这些合同将成为有价值的抗辩依据。如果需要知情同意,企业则将面临新的授权成本和可能的限制。
Naver 称其合同涵盖 AI 训练
眼下的变化并非一项新诉讼,而是在数月法庭审查后,Naver 提出了更完善的合同抗辩。
MLex 于 2026 年 9 月 8 日报道称,Naver 再次向韩国法院表示,其使用行为符合内容共享合同。此次听证会紧随 8 月的一场重要庭审,该庭审重点审查了这些协议的谈判过程。
诉讼始于 KBS、MBC 和 SBS 指控 Naver 使用其新闻文章训练 HyperCLOVA 和 HyperCLOVA X。三家广播公司在首尔中央地方法院提出了版权、不正当竞争及相关主张。
据韩国媒体报道,广播公司最初分别索赔 2 亿韩元,合计 6 亿韩元。其请求的救济还包括禁止利用争议材料进行训练的禁令。
这些金额并未体现该案全部的商业重要性。禁令或限制性解释可能影响已经纳入 Naver 模型开发流程的数据。
三家广播公司代表韩国三大地面电视网络。代表 39 家广播公司的韩国广播协会支持此次行动,并曾要求就 AI 报酬单独展开讨论。
根据最初的起诉文件,该协会于 2023 年 12 月向 Naver、Kakao 和 Google Korea 通报了其立场。协会表示,将新闻内容用于 AI 学习需要取得单独许可并支付报酬。
该协会的工作组随后要求了解 Naver 的数据来源、训练材料和获取方式。协会称,Naver 未作出明确披露。
Naver 最初表示,在提出详细立场前需要审阅起诉状。此后,其在法庭上的辩护变得更加具体。
Naver 指向其协议中有关研究、新服务开发和技术处理的条款。它还援引合同中关于 AI 平台和句子提取的表述。
句子提取可以指从更大篇幅的文档中抽取单独段落,用于索引、分析或其他计算处理。Naver 认为,该术语反映了与机器学习相关的数据处理。
广播公司不接受这一解释。它们表示,为现有新闻服务提取文本,不同于将文章复制进模型训练语料库。
这一差异构成了核心合同问题。获得处理内容的许可,并不自动回答双方接受了哪些处理目的。
Naver 还主张,根据韩国法律,某些事实性新闻报道并不具备完整版权保护资格。该公司要求广播公司指出其主张所依据的受保护表达和具体作品。
广播公司回应称,其文章具有经济价值,并包含受保护的选择、结构和表达。它们将 Naver 涉嫌复制的行为描述为系统性的商业使用,而不是对孤立事实的附带引用。
尚无最终裁决确定哪一种解释适用。9 月的听证会延续了一场仍在进行的争议,而非解决 Naver 的责任问题。
Naver AI 版权诉讼令双方承压
广播公司需要证明,普通新闻分发权在模型训练之前止步;而 Naver 则必须为对旧合同的更宽泛解读提供正当依据。
对 Naver 而言,直接压力落在其韩语 AI 项目所依赖的法律基础上。HyperCLOVA X 依赖大量韩语、英语和代码材料。
Naver 尚未公开指出其训练语料库中哪些文章存在争议。其已发布的模型文档以更高层级描述了数据类别。
该公司 2024 年的技术报告称,HyperCLOVA X 使用了经过平衡混合的韩语、英语和代码数据。报告并未公开列出该混合数据中包含的每一家出版物。
这一披露缺口给广播公司带来实际难题。它们必须在无法完整获取 Naver 训练记录的情况下识别侵权行为。
据报道,它们提交了 HyperCLOVA X 生成的回答,作为广播公司内容曾被使用的证据。Naver 对此方法提出质疑,因为语言模型可能就自身训练情况生成不可靠的陈述。
模型关于其数据来源的回答并不是可靠的审计记录。大语言模型生成的是可能性较高的文本,而非检索其训练文档的经核实清单。
因此,法院除了要处理法律争议,还面临取证挑战。法院必须确定,当被告控制相关数据记录时,原告如何识别被复制的作品。
Naver 辩称,广播公司未充分明确哪些作品遭到侵权。广播公司则表示,AI 训练异常庞大的规模和不透明性,使得更具体的指认变得困难。
这不只是程序上的分歧。掌控训练记录的一方,在法院下令披露之前可能拥有决定性的证据优势。
广播公司自身同样面临压力。多年来,它们通过 Naver 分发内容,并接受了允许超出简单展示范围的技术用途的协议。
法院可能认定,宽泛的开发措辞涵盖了合同签订时已有的机器学习。届时,广播公司将需要另一种法律理论,将生成式训练与获授权的平台开发区分开来。
它们的立场还要求区分不同类型的新闻。韩国版权法将仅由简单事实传递构成的某些时事报道排除在保护范围之外。
这一排除并不意味着每篇新闻文章都不受保护。报道可以包含原创表达、分析、组织、摄影及其他创作元素。
Naver 通过要求原告指出受保护材料来强调这一区别。这种做法可以将大规模主张缩小为逐篇文章的问题。
广播公司则强调汇集语料库的商业价值。其主张将数据集视为由新闻编辑室投入所构建的资源,而不只是公开事实的列表。
结果是,双方都面临提供尚未完全公开证据的压力。Naver 需要将合同措辞与具体训练活动联系起来。广播公司则需要将受保护作品与相关模型联系起来。
旧合同面对一种新的商业用途
本案的关键在于,宽泛的技术许可能否从改进新闻平台延伸至训练可复用的生成式模型。
相关协议并非诞生于 ChatGPT 时代。证词审查了 2017 年至 2020 年间谈判达成的条款和特别约定。
Naver 表示,合同中提及 Clova、AI 平台、研究和句子提取,已使广播公司有所知悉。它主张,在双方协商这些条款时,机器学习已经广为人知。
一名在 2016 年至 2023 年间参与新闻合作事务的 Naver 员工在第六次庭审中作证。该员工称,相关讨论通过电子邮件、会议和电话进行。
证人坚持认为,Naver 已充分说明其 AI 平台的特殊性质。证人还表示,广播公司的法务团队仔细审阅了合同措辞,并在条款不明确时提出问题。
广播公司质疑这些讨论是否涵盖生成式模型训练。它们强调,大语言模型和生成式 AI 等术语并未出现在协议中。
8 月的庭审记录描述了一项 2020 年条款,该条款允许 Naver 将信息用于研究、服务改进和新服务开发。媒体机构反对其过于宽泛,Naver 后来增加了事先同意要求。
这一修订使双方的叙事都变得更为复杂。Naver 可以指出,围绕技术使用已经存在既定的合同程序。广播公司则可以主张,后来的同意要求表明无限制使用并不可接受。
据报道,Naver 还主张,更广泛的权利为广播公司带来了更高付款。在此前的一次庭审中,该公司称付款提高了 50%,五年间达到数亿韩元。
这些数字仍属于 Naver 在法庭上的立场,而非关于这些付款购买了何种权利的司法认定。除非合同或谈判记录将两者联系起来,较高付款并不能证明取得了 AI 同意。
广播公司将重点放在技术与商业背景上。它们称,2020 年前的讨论发生在 ChatGPT 让通用生成式系统成为可辨识市场之前。
当时机器学习当然已经成熟。然而,对文章进行分类或改善搜索,在经济层面不同于训练可在众多服务中生成新文本的模型。
这是本案的核心权衡。合同措辞必须足够灵活,以涵盖正常技术发展;同时也必须足够具体,以保留有意义的限制。
一份逐一列出未来所有计算方法的协议会很快过时。无限制的开发条款同样可能在出版商不了解交换条件的情况下转让不可预见的权利。
法院通常根据合同文本、目的、谈判历史和双方行为解释合同。Naver 争议将这四项审查都集中于一种市场角色迅速变化的技术。
Naver将这些合同与 Clova 及既有 AI 工作联系起来。广播公司则将其与新闻分发和服务改进相联系,而非通用模型开发。
法院在8月的意见增加了 Naver 面临的不确定性。听取证词后,法官表示,生成式 AI 训练可能并未被专门向广播公司说明。
这一观察并非最终裁决。但它仍削弱了“合同已明确解决该问题”这一简单主张。
Naver 在9月的抗辩似乎旨在让书面协议继续处于核心位置。Naver 坚持认为,即使未详细解释每一种未来模型架构,合同授权依然可以成立。
广播公司则需要法院采纳更狭窄的界限。他们的案件取决于模型训练是否足够不同,以至于需要单独且知情的许可。
著作权抗辩与合同抗辩发挥不同作用
即使 Naver 在合同论点上败诉,它仍可对著作权保护、复制、合理使用及不正当竞争提出抗辩。
公众讨论往往将 AI 著作权案件压缩为一个问题:训练是否属于合理使用?本案包含多个彼此独立运作的问题。
首先,法院必须确定广播公司是否拥有其所指认作品的著作权。纯事实和基础时事报道,与具有独创性表达的报道受到不同对待。
其次,广播公司必须证明受保护材料进入了 Naver 的训练流程。这一问题取决于有关数据集、预处理、留存和模型开发的证据。
第三,法院必须解释内容共享合同。若这些协议授权了相关使用,则著作权侵权主张可能无需就 AI 训练作出广泛裁决便会失败。
第四,法院可以审查合理使用等法定限制。韩国的合理使用条款会考量使用目的、作品性质、使用数量和市场影响。
这些因素使得答案无法一概而论。训练可能将文本转化为统计模型参数,但数据准备和计算过程中也需要复制材料。
商业目的并不会自动否定合理使用。但当其与大规模复制及对许可市场的损害相结合时,可能对被告不利。
广播公司很可能会强调替代效应和丧失的许可机会。他们称,AI 开发者应就获取新闻编辑部产出另行协商补偿。
Naver 可以主张,训练产出的是通用语言模型,而不是用于提供文章副本的数据库。它还可以区分功能性处理与发布源作品之间的差异。
输出行为仍然相关。一个会再现受保护段落的系统,与一个使用材料却不返回可辨识表达的系统,面临的风险不同。
公开记录并未表明 HyperCLOVA X 再现广播公司文章的频率,也未披露据称被纳入的材料数量。
这种不确定性限制了关于市场损害的强有力结论。它也解释了为何合同解释已成为 Naver 如此有吸引力的抗辩。
合同可能提供一条比为整项技术界定合理使用更清晰的路径。法院可以基于这些当事方之间的协议作出狭窄裁决。
不过,即使是狭窄的合同裁决,也会影响其他谈判。平台和出版商会审视类似条款中有关研究、提取、服务开发和机器学习的表述。
Naver 自身也承认该诉讼具有实质风险。其2026年发行通函列明了广播公司的诉讼,并称结果仍不确定。
该文件称,原告指控其未经授权将新闻内容用于生成式 AI 训练,并记载了原告提出金钱赔偿和禁令救济的请求。
Naver 还警告投资者,不利的知识产权裁决可能导致赔偿、许可义务、业务实践改变或服务终止。这一表述是一般性风险披露,并非对本案结果的预测。
但这仍与“合同抗辩已消除风险敞口”的印象相矛盾。Naver 已提出抗辩,广播公司也正在积极挑战该抗辩。
出版商正在检验许可权力,而不只是所有权
更大的争夺关乎:在多年平台分发之后,谁有权为高价值训练数据设定条件。
KBS、MBC 和 SBS 既是内容所有者,也是 Naver 新闻平台的长期参与者。这层关系使本争议不同于涉及从开放网络收集材料的案件。
广播公司并非只是偶然在无关服务上发现自己的文章。他们签有规范内容交付、展示、技术处理及报酬的合同。
这些协议赋予 Naver 合法获取内容的权利。尚未解决的问题是,为一种目的而合法获取内容,是否也构成对另一种用途的授权。
只要科技公司与内容方存在深度合作,这一模式就会反复出现。搜索引擎、聚合平台、云服务商和企业平台往往拥有依据旧条款收集的授权档案。
生成式 AI 提升了这些档案的价值。风格一致、经过专业编辑的语言可以支持训练、检索系统、评估和产品开发。
出版商如今希望将这些用途与常规分发区分开来。他们的谈判目标并不限于针对过去复制行为的赔偿。
若裁决要求就 AI 获得明确许可,将强化对新许可协议的要求。它也会推动制定涵盖训练、微调、检索、评估、留存和生成输出的详细条款。
若裁决支持 Naver,则会为平台提供另一条路径。当条款及其周边谈判支持相应解释时,公司可以依赖宽泛的研究或服务开发条款。
无论哪种结果,都不会形成普遍规则。合同措辞、付款安排和合作方之间的沟通各不相同。
本案还与韩国持续推动明确 AI 著作权政策的工作相交织。政府工作已考虑文本与数据挖掘规则、训练数据披露以及识别权利信息的系统。
2026年2月,文化体育观光部发布了涉及生成式 AI 训练中合理使用的指导意见。指导意见可以梳理分析框架,但法院仍需决定法条如何适用于存在争议的事实。
这场韩国争议也具有国际对应案例。新闻机构已在美国起诉 OpenAI 和 Microsoft,另一些出版商则与 AI 公司签署了许可协议。
这些策略通过不同路径追逐同一种稀缺资产。诉讼试图在被指控使用后确立控制权,而许可则将访问权转化为经协商达成的商业关系。
Naver 的立场不同寻常,因为它称谈判早已完成。广播公司的回应是,当初交易从未包含如今争议中的用途。
这一分歧使签约过程与最终措辞同样重要。有关演示材料、电子邮件、修订版本、提问和付款的证据,能够表明双方各自合理理解的内容。
法院此前拒绝传唤广播公司请求的一名 Naver 高管。法院转而听取了一名参与新闻合作工作的员工的证词。
在8月听证会上,法院表示,广播公司可以基于“生成式模型训练未被专门说明”这一前提继续推进。法院仍保留从参与2020年 SBS 协议的员工处获取更多证词的可能性。
这一程序性选择使焦点保持狭窄。法官似乎更关注签约团队之间沟通了什么,而非有关 AI 的宽泛公开表述。
Naver 称,广播公司长期关注技术发展,并在 AlphaGo 2016年比赛后理解了机器学习日益增长的重要性。广播公司则称,对 AI 的一般认知不能替代许可。
其中差异至关重要。知道合作方正在开发 AI,并不必然意味着已授权其使用内容进行训练。
反过来也同样如此。一项合同不会仅因后来的技术更成功地商业化了预期中的技术用途,就变得无效。
法院必须在这两个极端之间安置事实。这项任务使本案成为一宗带有著作权后果的合同案件,而不只是又一次对 AI 的全民表决。
三个信号将显示哪一方论点占上风
下一阶段应会揭示,法院是优先考虑合同文本、知情同意,还是 Naver 实际训练流程的证据。
第一个信号是来自2020年合同谈判的补充证词或书面证据。法院此前曾提出,可能听取两名参与该流程的 SBS 员工的证词。
若电子邮件或草案明确将研究条款与模型训练相联系,将强化 Naver 的抗辩。若记录显示并无此类讨论,则会支持广播公司更狭窄的解释。
第二个信号是法院是否会要求或收到更详细的训练数据证据。原告需要在其受保护作品与具体 Naver 模型之间建立可信联系。
数据集清单、预处理记录或内部使用说明,比模型对自身训练情况的回答更具分量。缺少这类证据将保留 Naver 对广播公司举证的挑战空间。
第三个信号是法官如何安排合同解释与合理使用的审理顺序。基于合同的裁决可能无需确立一般性的 AI 训练规则,就能解决争议的大部分内容。
更广泛的合理使用分析将对没有内容共享协议的公司具有意义。它也会影响考虑向其他技术提供商提出主张的韩国出版商。
读者不应将 Naver 9月的立场视为胜利。该公司称其合同提供了授权,但法院尚未接受这一结论。
8月的程序暴露出 Naver 叙事中的一处弱点。法官似乎并不相信,在协议达成时,生成式 AI 训练曾被专门说明。
这一弱点并不会自动使宽泛的合同许可失效。但它确实使谈判历史和确切措辞更为重要。
如果法院将访问权与授权区分开来,Naver AI 著作权诉讼将变得尤为重要。一家公司可以合法接收内容,却超出被允许的用途来使用它。
开发者和企业买家应在自己的数据协议中关注这种区分。分析数据或改进服务的一般权利,未必能明确涵盖基础模型训练。
出版商也应在假定自己保留了所有 AI 相关权利之前审查同样的条款。既有定义、技术附表、修订协议和付款条件都可能改变分析结果。
实际应对之道是谨慎保留记录。团队需要可追溯的数据集、记录在案的许可、明确界定的用途,以及遵守后续限制的流程。
对于评估 AI 系统的任何人而言,最终问题很具体:提供方能否说明其训练权利从何而来,以及这些权利实际允许什么?Naver 称答案在于多年前签署的合同。广播公司则称,这些协议从未授权目前呈交法院审理的商业用途。文件、谈判记录和训练证据将决定哪一种说法成立。



