Google因用于训练AI的语音数据面临法律诉讼
- Olivia Johnson

- 4天前
- 讀畢需時 15 分鐘
Google正面临一项拟议集体诉讼,原告称其未经说话者许可,使用数千小时录制语音训练语音AI。近期Google新闻报道聚焦的这场争议,将AI训练之争从书籍和图像延伸至语音领域。案件提出的问题是:当模型提取出使声音可被识别的特征时,一段公开录音是否会成为私人生物识别数据。
原告包括记者、播客主持人和有声书旁白者,他们的生计在一定程度上依赖于可辨识的声音。他们指控Google从互联网收集专业录音,并将其用于与Google Assistant、Gemini Live及其他语音产品相关的系统。
Google尚未公开证实原告的录音被纳入任何特定模型。这些指控尚未经检验,原告需要证明的不仅是录音可在线获取。他们还必须证明这些录音与Google的训练流程有关,并说明该流程违反了起诉书中援引的法律。
这一证据缺口构成了核心冲突。科技公司一直将可公开访问的媒体视为潜在训练材料。语音专业人士则认为,录音承载的不只是信息,还包括身份,而这种身份的使用需要获得同意。
Google新闻诉讼实际指控了什么
本案的关键在于,训练语音模型是否会将普通录音转化为受监管的生物识别信息。
2026年5月,一批获奖记者、播客主持人和有声书旁白者在伊利诺伊州联邦法院起诉Google及其母公司Alphabet。这项拟议集体诉讼指控两家公司在开发商业AI系统时滥用录制语音。
语音训练诉讼中点名的原告包括芝加哥记者Carol Marin,以及普利策奖得主Yohance Lacour和Alison Flowers。根据起诉书,他们的作品提供了大量干净、适合机器学习的长时段录音。
起诉书将相关材料描述为长篇、单一说话者、录音室级质量且专业制作的内容。这些特质很重要,因为语音模型需要的不只是孤立词语。它们会学习涉及节奏、发音、音调、时序和声音质感的模式。
原告称,Google未经说话者许可,从开放互联网抓取录音。其后,他们指控Google利用这些录音开发用于Google Assistant、Gemini Live及相关服务的AI语音。
这些只是指控,并非已确立的事实。Google具体使用的训练数据集在很大程度上仍未向外界公开。公开可获得的技术资料可以解释某类模型的工作方式,却不必披露其开发过程中使用的每一段录音。
原告要求金钱赔偿,但最初的Reuters报道并未说明具体金额。他们还将争议置于公开权和伊利诺伊州生物识别隐私保护框架之下,而非仅仅依赖版权法。
这一选择使本案区别于许多早期的AI训练诉讼。版权保护固定于作品中的创造性表达。生物识别主张则聚焦于与个人相关联的可测量特征。
一段语音录音可能同时涉及两者。文字、报道或表演可受到版权保护,而说话者的声音则可能带有可识别的生理和行为特征。
这一区别为原告提供了另一条法律路径。即使公司主张训练行为在版权法下具有转换性,这一论点也不会自动解决生物识别法规项下的同意要求。
该诉讼还带来了一个棘手的边界问题。人们经常发布供公众收听的访谈、播客、广播和有声书。争议在于,允许他人收听这些材料,是否也意味着允许公司将其中的说话者作为模型输入进行分析。
案件首次被报道时,Google预期会提出的抗辩尚未被公开详述。可能存在争议的问题包括Google是否持有这些录音、是否生成了声纹,以及原告是否遭受了法律认可的损害。
法院必须根据证据而非对AI公司通常如何训练模型的假设来处理这些问题。在证据开示披露更多信息之前,双方都无法完整公开说明哪些内容进入了Google的系统。
为什么伊利诺伊州改变了语音AI的论证
伊利诺伊州法律为原告提供了一项同意理论,并不完全依赖于证明对创造性表达的未经授权复制。
《伊利诺伊州生物识别信息隐私法案》(Illinois Biometric Information Privacy Act,通常称为BIPA)对某些生物识别标识符和生物识别信息进行监管。该法律明确提及声纹,以及指纹和面部几何扫描等标识符。
声纹是对声音特征的数学表征,用于识别或区分说话者。它不一定等同于音频文件。这一区别将处于诉讼的核心位置。
伊利诺伊州生物识别法要求受约束的私人实体在收集相关生物识别标识符或信息前提供书面通知。该法律还要求取得书面同意,但须符合其法定定义和例外规定。
因此,原告必须证明Google被指控的处理行为涉及声纹或受覆盖的生物识别信息。仅仅下载音频文件未必能够解决这一问题。
现代语音系统可以出于多种目的处理录音。自动语音识别将语音转换为文本。说话者识别用于确认是谁在说话。文本转语音模型根据书面输入生成语音音频。语音克隆系统则试图复现与特定说话者相关的特征。
这些类别在技术上可能重叠,但法律后果不必相同。一个模型可能学习通用语音模式,而不会保留用于识别任何源说话者的模板。相反,系统也可能编码出足够详细的特征,以重建或识别该个人。
如果原告能够证明Google提取了持续存在、与个人相关联的声音特征,其主张将更有力。如果Google的流程仅利用录音改进通用语音生成,且未创建可识别模板,其立场则更有力。
BIPA诉讼通常聚焦于数据如何被收集、存储、披露以及与个人关联。AI训练又增加了一层复杂性,因为模型的内部参数并不像传统数据库条目。
神经模型将所学习的关系分布在大量数值权重中。这种架构使持有和删除问题更为复杂。删除原始文件不一定能识别或逆转该文件在训练期间产生的所有影响。
不过,技术复杂性并不能消除法律义务。公司不能仅因将数据嵌入一个难以处理的系统,就规避同意规则。它仍可就受监管的数据是否最初存在提出异议。
语音案件还检验了伊利诺伊州保护措施的地域适用范围。原告需要确立事实,证明被指控的收集或处理与该州及受其法律保护的人群存在联系。
Google在全美乃至全球运营,而在线录音可以瞬间跨越国界。当爬虫、存储系统和模型训练集群分布在不同地点时,法院可能需要决定生物识别信息收集发生在何处。
这使本案的影响超越了对单一数据集的争议。如果原告的解释获得支持,AI开发者在使用从公开来源收集的可识别语音前,可能面临因州而异的同意义务。
这一结果将促使公司记录录音来源、随附的许可,以及哪些模型接收了这些录音。它也会鼓励更多许可授权,而非不加区分地收集。
九起诉讼将一份起诉书变成行业考验
Google面对的并非孤立反对意见,因为相关诉讼覆盖了商业语音AI供应链的大部分环节。
更广泛的行动包括在芝加哥联邦法院提起的九项拟议集体诉讼。这些案件的被告包括Amazon、Adobe、Apple、Microsoft、Samsung、Meta、ElevenLabs、Nvidia、Google和Alphabet。
这些案件未必涉及相同的技术或数据集。一些被告开发消费者助手,另一些则提供模型、软件、芯片或语音生成服务。每家公司都可以根据自身行为提出抗辩。
不过,协调提交的诉讼形成了一个共同理论。原告认为,科技公司在未通知或征得同意的情况下获取专业语音,随后将其转化为商业AI的输入材料。
Reuters将这些诉讼描述为对伊利诺伊州生物识别隐私制度的新应用。其行业整体报道称,相关文件长达数百页,针对多家最大的科技公司。
其中一份起诉书指控,说话者从未被告知其声音将用于训练Amazon的商业语音AI。原告在其他诉讼中提出了类似的同意主张,尽管证据仍须分别评估。
被告群体显示出语音数据的重要性有多广泛。消费者助手需要自然的对话表达。会议产品需要准确转录。媒体工具需要旁白。无障碍应用则依赖可靠的合成语音。
公司还在延迟、情感表现范围、多语言表达和自然轮流对话等方面展开竞争。高质量录音可帮助研究人员在这些维度上训练和评估系统。
专业录制的语音尤其具有吸引力,因为其中的背景噪音更少,声音连续性更清晰。有声书、播客和广播档案可提供同一说话者的数小时录音。
便利性也正是冲突所在。为听众制作的材料,恰好也满足模型开发者的重要技术要求。公开发行渠道可能变成非正式的训练资料库。
被告承受着双重压力。他们需要大量且多样化的数据集来提升语音质量,同时也需要能够站得住脚的记录,证明这些数据集是如何获得的。
对每一段录音都进行授权许可的公司,可能面临更高的开发成本和更窄的数据覆盖范围。依赖大规模抓取的公司,则可能面临诉讼、声誉损害以及重新训练模型的要求。
这些诉讼还让模型供应商和产品公司面临不同形式的审查。一家开发商可能训练底层系统,而另一家公司则将其整合进消费者产品。
合同可以在这些当事方之间分配财务责任。但它们并不总能消除录音据称进入该流程的人所提出的索赔。
因此,购买第三方语音模型的企业会提出更严格的问题。他们会要求提供数据集文档、同意声明、审计权、删除流程和赔偿条款。
即便法院尚未作出最终判决,这场争议也可能影响采购决策。企业买家无需等到责任认定明确后,才将缺乏文档支持的训练材料视为风险。
这种反应将有利于拥有可追溯、获授权语音数据集的开发者。即使模型表现出色,无法解释数据来源链路的团队也可能处于不利地位。
公开语音不等于自动获得许可
最有力的辩护叙事是,公开发布支持分析;而原告最有力的论点则是,访问权限从未转移个人身份权利。
长期以来,互联网一直允许搜索引擎索引公开材料。研究人员也会分析已发布的文本、图像和音频,以寻找规律。AI 开发者则通过在海量集合上训练模型来延续这些做法。
Google 可以主张,在线发布的录音本就是有意向公众传播的内容。它也可以质疑,一般模型训练是否会产生具有法律意义的复制件、身份模板,或原说话人的替代品。
原告划出的界线更窄。听众获得的是为预定目的收听录音的许可。这并不必然授权一家无关公司为商业系统提取其中的声纹特征。
双方立场都取决于实际处理方式。训练通用语音识别模型,与生成模仿某位旁白者可辨识表达方式的产品,并不相同。
这些起诉状似乎旨在避免这一差异坍缩为简单的公开与私密之争。它们聚焦于声纹,追问的是 Google 提取了什么,而不仅是 Google 从何处获得这些内容。
这场争议也暴露了常见线上同意模式的弱点。网站条款通常规范平台与账户持有人之间的关系,但不会自动约束上传内容中出现声音的每一位人士。
播客制作人或许拥有某期节目的版权。出版商可能控制有声书录音。但旁白者仍可主张与身份、公开权或生物识别处理相关的独立权利。
取得某一层面的许可,并不总能清除其他层面的权利障碍。AI 公司必须确认谁拥有录音、谁控制表演,以及是否依法需要生物识别同意。
这会带来运营负担,但并非前所未有。电影、广告和音乐项目早已在剧本、表演、录音和肖像等多个权利层面进行管理。
语音 AI 公司可能需要建立类似的权利清理体系。同意内容需要明确涵盖训练、模型评估、合成输出、产品分发、再许可,以及获准使用的期限。
如果说话者并不了解其录音可能被用于支持高度逼真的合成语音,即使获得了宽泛授权,也仍可能面临审查。当最终技术听起来极具个人特征时,透明的表述尤为重要。
风险并不止于直接冒充。模型可以吸收数千个来源的说话风格,而无需精确复现其中任何一个人。原告可能主张,这种汇总式使用仍依赖于未经同意的生物识别处理。
被告可以回应,统计学习不会保留或暴露任何个人身份。他们还可以质疑,原告能否将某项具体输出或模型行为追溯至其录音。
这种可追溯性问题至关重要。一段精致的合成语音,并不能证明某位记者或旁白者的录音参与了其训练。
相似性也可能有多种原因。说话者可能拥有相同的口音、语速节奏、年龄相关特征或专业表达风格。人类听众可能会感知到相似之处,而并不存在技术上的身份关联。
原告需要比熟悉的声音更有力的证据。训练清单、内部沟通、数据索引、模型评估和工程记录,将比主观比较更为重要。
对于管理敏感来源材料的组织而言,这些记录应存入可检索的 AI knowledge base。清晰的文档可以将每个数据集与其来源、许可、用途、保留规则及下游模型关联起来。
最棘手的问题是模型保留了什么
不能把训练完成的模型视为完美档案库,或视为毫无记忆的机器,来解决这些诉讼。
AI 模型从示例中学习数值关系。它们通常不会以普通、可直接检索的文件形式存储每一项训练数据。然而,模型有时能够复现具有辨识度的短语、图像或声学模式。
因此,保留与否是事实问题,而非一句口号。原告不能假定 Google 的产品保留了其录音的完整副本。Google 也不能仅凭模型的分布式架构,就证明没有捕捉到任何身份信息。
研究人员和法院需要区分训练影响、记忆、识别和模仿。这些概念彼此交叠,但描述的是不同结果。
训练影响意味着某个示例对模型习得的行为产生了贡献。记忆意味着系统保留了足够细节,能够异常接近地复现材料。识别是将数据与某个人关联起来。模仿则是生成与该人相似的输出。
一段录音可以影响模型,却不具备识别能力。模型可以模仿广泛的播音风格,而不记住任何具体播报。反过来,若系统接受过某位旁白者大量材料的训练,便可能保留高度独特的特征。
法律标准将取决于诉讼主张和法条措辞,而不只是工程术语。不过,技术测试可以澄清系统实际做了什么。
专家可能比较模型在定向提示前后的输出。他们可能检查说话人嵌入——即语音特征的数值表示——或评估系统是否持续重现独特特征。
获取相关材料将充满争议。模型权重、训练数据和内部评估都是极具价值的商业秘密。被告很可能寻求限制披露的保护措施。
与此同时,原告需要获得足够的访问权限以检验其主张。如果一方面要求案件证明隐藏的训练行为,另一方面又阻止对该行为进行有意义的证据开示,这样的案件无法获得公平审理。
法院经常通过保护令管理保密商业证据。更困难的问题在于,如何界定一种技术上可靠的审查方式,使其不会演变为对专有系统的无限制检查。
数据删除提出了另一个悬而未决的问题。如果原始录音存放在数据集中,工程师可以找到并将其移除。但如果已完成训练的模型从该录音中学习,移除其影响可能需要重新训练,或采用专门的机器遗忘技术。
机器遗忘旨在降低某个训练示例的影响,而无需重建整个模型。其有效性取决于系统、训练过程和所需的保证程度。
法院可以判赔,但不要求修改模型。它也可能考虑限制未来收集或使用的措施。适当的救济将取决于已证实的行为和法律主张。
这种不确定性对开发者而言已具有即时影响。团队需要的是训练前形成的记录,而不是诉讼后重建的解释。
一套可辩护的流程应识别每个数据集合、其来源、适用许可、同意状态、拟用于的模型和删除路径。它还应记录数据是否支持转写、说话人识别、语音合成或声音克隆。
这些类别会同时影响风险和用户预期。某人同意参与转写研究,并不意味着其同意用于商业语音生成器。
当前的 Google News 新闻周期,可能会让这场争议看起来只是又一场围绕 AI 抓取的广泛斗争。但它真正的贡献更为具体:它迫使法院审视语音模型从语音中推导出了什么,以及这种推导是否需要个人同意。
语音权利正超越版权范畴
行业的下一套规则将从版权、公开权、生物识别隐私、合同以及新的语音专项立法等相互交叠的体系中产生。
语音争议早于生成式 AI 出现。表演者长期以来一直依据公开权和不正当竞争法,对广告和娱乐领域未经授权的模仿提起诉讼。
生成式系统改变了规模。模型可以生成大量语句,支持交互式产品,并在无需让原说话者重返录音室的情况下创作新的表演。
这种能力推动了立法行动。田纳西州颁布了《确保肖像、声音和形象安全法案》(Ensuring Likeness, Voice, and Image Security Act),即 ELVIS Act,以扩大对某些 AI 赋能滥用行为中声音和肖像的保护。
ELVIS Act protections 将注意力聚焦于未经授权的合成复制品。伊利诺伊州 BIPA 则采取不同路径,规制生物识别标识符和信息的收集与处理。
Google 诉讼之所以重要,是因为它瞄准了更早的阶段。所称不当行为并不仅限于发布明显的克隆声音。原告挑战的是获取和训练过程本身。
这一差异会影响公司如何管理风险。输出过滤器可以阻止模仿名人的请求,但无法回答底层训练数据是否被合法收集。
某个系统可能永远不会生成可辨识的 Carol Marin 克隆声音,却仍可能面临这样的主张:她的声纹未经同意就进入了训练过程。该理论能否成立,取决于证据和法条解释。
Lovo 诉讼提供了一个更狭窄的比较案例。配音演员指控这家 AI 配音公司将录音用于超出其授权目的的用途。据 Reuters Legal 报道,一名联邦法官允许该争议的重要部分继续推进,详见 voice actor ruling。
在这类案件中,合同范围更为突出。如果表演者受聘录制材料,问题就在于协议允许什么,以及后续模型使用是否超出了其范围。
伊利诺伊州的诉状涉及得更远,因为原告称自己从未被征询过同意。他们的理论挑战的是从公开媒体收集数据,而非对直接录音合同存在争议的解释。
这些案件可以得出不同结果,而不相互矛盾。一家法院可能认定合同未授权克隆;另一家法院可能认定一般模型训练并未形成受规制的声纹。
开发者不应假定,一项有利的版权裁决就能解决所有语音问题。适用的主张会随原告、司法辖区、数据来源和产品设计而变化。
同样的复杂性也适用于创作者。旁白者可能拥有公开权,却不拥有有声书版权。出版商可能控制录音,却无权批准将其用于无关 AI 开发的生物识别处理。
未来的协议很可能会明确处理这些层面。它们可能包括对特定模型类型的同意、对身份模仿的限制、收益条款、审计机制和撤回程序。
集体谈判也可以塑造市场。工会和专业团体能够比法院历经多年诉讼后作出裁决更快地确立标准。
最可能出现的结果,并不是一项全国性统一规则同时落地。企业将面对由成文法、合同、法院判决和采购预期组成的复杂拼图。
这种拼图更有利于重视数据来源的企业,也会惩罚那些无法区分授权录音与仅因可访问而收集的材料的开发者。
三个信号将决定接下来会发生什么
证据开示、司法定义与授权行为,将决定这些诉讼是重塑语音 AI,还是仍仅限于特定事实争议。
第一个信号是原告能在证据开示中获得什么。训练清单或内部数据集记录,可能将特定录音与 Google 的模型联系起来。若缺乏此类证据,核心指控将被削弱。
证据开示还可能显示工程师在内部如何描述这些数据。涉及说话人身份、声音克隆或声纹的表述,与仅聚焦通用语音识别的记录相比,可能带来不同的法律含义。
第二个信号是法院如何界定生物识别信息处理。广义解释可能将提取出的语音特征视为受规制的信息,即使模型在正常使用中并不识别说话人身份。
较狭义的解释,则可能要求存在用于识别个人的持久性模板。这一区别将影响伊利诺伊州协调案件中针对每一名被告提出的主张。
针对驳回动议或简易判决的早期裁定,将比任何一方的言辞更重要。它们会揭示哪些事实指控符合法律要求,以及原告必须提交何种证据。
第三个信号是市场行为。语音 AI 开发者可能扩大授权数据收集、公布更严格的数据集披露,或在法院作出最终裁决前引入同意管理机制。
这些变化将表明,诉讼风险已经在改变开发实践。若变化有限,则可能意味着企业认为现有流程和抗辩仍然足够。
企业采购也可能加速这一转变。采购方可能要求供应商说明训练数据来源,并保证说话人已授权模型使用其声音。
保险公司和投资者也可施加类似压力。无法证明其数据权利的公司,可能承担直到产品成功后才暴露的隐性责任。
Google 的回应将尤其具有影响力,因为其语音产品覆盖众多用户和开发团队。详细披露可能成为行业参考点,而持续保密则会使争议继续聚焦于证据开示。
公众还应关注,立法者是否会将普通语音建模与身份复制区分开来。涵盖所有录音语音使用的规则,与聚焦识别或克隆的规则,所产生的影响将截然不同。
研究人员需要获取多样化的语音数据,包括不同口音和代表性不足语言的语音。过于宽泛的限制可能减少模型覆盖范围,并使部分群体的使用体验和性能进一步恶化。
保护不足则会带来相反风险。说话者可能失去对具有商业价值的声音身份的控制权,而开发者则获取其中的利益。
这正是法院必须面对的权衡。更好的语音系统需要具有代表性的数据,但公开可获得并不能解决同意、报酬或身份权利问题。
对于关注 google news 的读者而言,下一项真正重要的更新不会是又一次指控,而是能够显示 Google 收集了什么、其模型保留了什么,以及法官如何界定这一过程的证据。
开发者现在就应审查语音数据集。企业采购方应向供应商索要来源和同意记录。创作者则应审查合同是否分别涵盖 AI 训练、合成和再授权。
这场争斗已不再只是关于 AI 是否“听过”某人的声音。它关乎系统从一个人的声音中学到了什么,谁授权了这种学习,以及谁控制最终结果。


