top of page

Amazon 与 Google 的 AI 竞赛蔓延至 Twitch,直播内容默认用于训练模型

Amazon 已确认,Amazon 与 Google 的 AI 竞赛出现了一个颇具争议的新战场:Twitch 频道内容默认可用于训练其生成式 AI 模型。

该设置涵盖参与频道关联的内容,可能包括直播、录播、剪辑、图片、频道元数据和聊天记录。创作者可以关闭这一选项,但 Twitch 将其设为退出机制。这意味着,除非创作者找到该设置并将其关闭,否则符合条件的频道内容仍将可供使用。

这一披露之所以重要,是因为直播是异常丰富的训练材料。一场直播可汇集语音、视频、游戏画面、面部表情、观众反应、俚语,以及快速变化的上下文。Amazon 可通过其自有平台获取这些材料,而 Google 和其他竞争对手则必须在其他地方拼凑可比的多模态数据集。

因此,核心冲突远不止于一项隐私设置。Amazon 希望为与 Google、OpenAI、Meta 和 Anthropic 竞争的模型获得独特数据。Twitch 创作者则希望对自己的作品拥有实质性控制权——这些作品之所以存在,是因为他们创作了内容并建设了周边社区。

Twitch 确认默认设置允许的用途

眼下的变化不只是 Amazon 可以研究 Twitch 内容,而是 Twitch 现在提供了一项默认开启的生成式 AI 训练控制选项。

该设置位于 Twitch 账户安全与隐私控制项下。其说明允许频道内容用于训练 Amazon 的生成式 AI 内容模型。根据 Twitch 的说法,关闭该选项会停止这一特定用途,但并不能阻止整项服务中的所有机器学习分析形式。

这一区别很重要。Twitch 已依赖自动化系统提供推荐、审核、广告、安全和创作者发现等功能。这些系统可以分析行为或内容,而不一定是在训练通用生成式模型。

生成式训练的目标更广泛。它让模型学会识别或生成文本、图像、音频和视频中的模式。由此产生的模型,可能支持远超原始 Twitch 体验的产品。

Twitch 首席产品官 Mike Minton 在一场公司直播中回应了默认设置。被问及为何采用退出制而非加入制时,他给出了直白的回答:“如果是加入制,就没人会加入。”

这番表态将一次技术披露变成了同意权争议。默认设置并非被描述为中立的可用性决定。Twitch 明白创作者很少会自愿提供自己的内容,随后便围绕“不作为”来设计参与机制。

Minton 还表示,Amazon 不会将收集到的材料转售给其他公司。这一保证限制了一种潜在担忧,但并未说明 Amazon 如何在内部处理、保留、组合或应用这些数据。

据报道,Twitch 社区负责人 Mary Kish 表示,由于其社区的担忧,她自己已关闭该设置。她同时认为,Twitch 无法在完全没有某些形式 AI 的情况下运营。这两种立场可以同时成立,因为平台自动化与基础模型训练是不同的活动。

当一场直播中出现多位人员时,范围会变得更复杂。频道所有者可以控制频道设置,但嘉宾未必拥有相同偏好。聊天参与者可能在未查看主播训练选择的情况下,贡献消息、笑话、表情和反应。

据报道,Minton 承认,混合同意情形下的直播确实提出了一个合理问题。Twitch 并未宣布提供一个醒目的频道标签,用以向观众显示某场直播是否会为生成式 AI 训练提供数据。

这一缺口使该控制项不像起初看上去那样属于个人层面。观众可以通过自己的频道避免训练,却可能进入一个已启用该选项的频道,并为其实时对话作出贡献。频道级默认设置支配着一个集体创作空间。

Twitch 更广泛的用户内容条款已允许公司为提供和改进服务而缓存或存储个别内容。不过,一般性服务许可并不能消除运营平台与构建可复用生成式模型之间在实践上的差异。

新设置让这种差异变得可见。它也向创作者发出了明确信号:Amazon 将 Twitch 视为不止是一个视频分发业务。

为什么直播在 Amazon 与 Google 的 AI 竞赛中如此重要

Twitch 为 Amazon 提供了每个模型开发者都想要的东西:人们说话、行动、观看和回应的同步实时样本。

大多数大型语言模型起步于海量文本集合。下一阶段的竞争越来越依赖多模态模型,即在同一系统中处理多种媒体类型的模型。视频尤其有价值,因为它将语言与动作、时序、物体、环境和人类反应联系起来。

一场 Twitch 直播可以包含口头解说、屏幕文字、游戏画面、音乐、摄像头视频、频道信息以及观众对话。这些元素是同步展开的,而不是作为孤立文件出现。

这种同步性可帮助模型将语言与事件关联起来。当主播描述游戏机制、对意外结果作出反应,或回答观众问题时,周围的视频和聊天内容会提供上下文。

这些材料还具有对话性。直播语言包含打断、不完整句子、地域表达、幽默、错误、情绪变化,以及依赖先前时刻的指代。这些特质很难通过精心制作的企业视频或合成对话来复现。

聊天又增加了一层信息。它展示群体如何对实时事件作出反应、哪些表达会传播,以及含义如何在特定社区内发生变化。表情可以携带普通文本数据集所遗漏的上下文。

这并不意味着每一场 Twitch 直播都会自动改善每一个 Amazon 模型。训练数据必须经过选择、筛选、标注、去重,并与目标能力相匹配。低质量或重复数据可能浪费计算资源,或扭曲模型行为。

Amazon 自身的训练披露称,其生成式服务可使用获得许可的、专有的、合成的、开源的和公开可用的数据集。这些集合可包括文本、图像、音频、视频、代码,以及个人或汇总消费者信息。

该披露还称,数据集规模因模型或服务而异,从数千到数万亿个数据点不等。根据该公司说法,Amazon 会采用自动质量评分、人工标注、偏好排序和去重等流程。

Twitch 可以在这一更大数据组合中为 Amazon 提供专有组成部分。Google 拥有 YouTube,Meta 运营着主要社交平台,而 Microsoft 与 OpenAI 保持密切联系。每家公司都控制着无法通过普通网络爬取获得的内容来源。

这正是 Amazon Google 成为有意义的竞争关键词、而非任意比较的原因。Google 可以从 YouTube 庞大的视频目录及相关元数据中获得技术优势。Amazon 拥有规模较小的视频平台,但 Twitch 专注于直播和互动行为。

差异不只是内容库规模。YouTube 包含直播、录播、教程、娱乐内容和短视频。Twitch 则更集中于具有持续观众参与的长时段直播。

Amazon 还可以将模型开发与 AWS 连接起来,后者销售计算基础设施和托管 AI 服务。更强的内部模型可增强 Amazon Bedrock 产品、购物功能、广告工具、Alexa 服务、媒体系统和未来的智能体。

不过,Twitch 尚未说明哪些具体模型会接收频道内容。它也没有说明这些数据是用于 Nova 模型、专门的视频系统、广告模型,还是多个内部项目。

这种遗漏很重要,因为风险取决于用途。训练审核分类器,与训练能够生成声音、人格或视频的模型并不相同。对“Amazon 的生成式 AI 内容模型”的宽泛表述,未能向创作者提供这一层面的细节。

Amazon 还面临战略压力。7 月的一份AI 战略报告称,该公司正在逐步淘汰数个旗舰 Nova 模型,同时将资源投入一项新的前沿模型计划。

Amazon 对其将放弃 Nova 的说法提出异议。一名发言人表示,公司仍在支持客户使用的模型,同时投资于下一代前沿研究。

无论哪种说法,都指向优先级调整。Amazon 正在决定,专有数据、研究人员和计算能力应投向何处,才能形成可防御的优势。Twitch 的实时多模态内容库,符合这种寻求差异化的需求。

真正的权衡是能力与同意

Amazon 的数据优势依赖于许多创作者在相同条件下不会主动提供的材料。

Twitch 的默认设置以异常清晰的方式呈现了这种权衡。如果几乎没人会选择加入,平台就只能将沉默视为许可,才能最大化参与规模。

默认设置往往决定用户行为,因为用户不会检查每一项设置。一些创作者永远不会知道该控制项的存在。另一些人可能误解其范围、推迟决定,或认为自己最初的隐私选择仍然适用。

这种行为效应并非技术意外。Minton 的解释表明,预期参与率塑造了这一设计。Twitch 选择了一个服务于 Amazon 数据需求的默认设置,同时为知情创作者提供退出路径。

当退出机制清晰可见、稳定、易于理解,并在处理开始前生效时,它仍可以提供真实控制。问题在于 Twitch 是否满足这些条件。

首先,该公司尚未公开详述新控制项出现前发生了什么。围绕此次公告的报道显示,Amazon 此前已使用 Twitch 材料进行 AI 开发。因此,该设置可能规范未来的数据处理,却不会撤销已经完成的训练。

机器遗忘旨在从训练模型中移除某个数据主体的影响,但其技术难度依然很高。删除源文件并不会自动逆转由该文件产生的模型更新。

其次,频道级设计无法完美代表每位参与者。一名主播可能邀请嘉宾、展示合作创作者、朗读观众消息,或转播获得授权的材料。频道所有者不一定对每个元素都拥有不受限制的 AI 训练权利。

Twitch 的条款要求用户拥有分发内容所需的权利。然而,获得作品直播许可并不总等同于获得将其用于模型训练的许可。音乐、游戏、艺术作品、表演和嘉宾出镜都可能受到独立的合同或法律限制。

第三,Twitch 尚未说明数据保留政策。创作者需要了解,关闭该设置会阻止新的数据收集、未来的训练运行、评估数据集,还是三者都会被阻止。他们还需要明确缓存副本以及已传输至 Amazon 系统的数据将如何处理。

第四,这项控制机制并未说明,训练完成的模型是否能够复现可识别的创作者特征。Twitch 内容可能包含个人的声音、面容、行为习惯、常用语,以及与观众之间的关系。

模型可以学习通用的语音或视频模式,而不复制某位特定主播的内容。不过,创作者有充分理由希望看到相关测试,用于衡量记忆化、声音模仿、身份信息泄露,以及受版权保护素材的复现情况。

Amazon 表示,其采用了保护措施以限制个人数据风险,并会对训练材料进行去重。这些做法具有价值,但除非有针对具体模型的文档或独立评估支持,否则它们仍只是公司的说法。

报酬问题同样存在不确定性。Twitch 创作者制作了使该数据集与众不同的录制内容和社交语境。Amazon 可能会利用这些材料改进商业系统,但该设置并未承诺向创作者提供报酬、署名或模型访问权。

广泛训练的支持者可以认为,平台需要大型数据集才能构建有用的系统。若要求就每一项公开内容逐一协商,可能会拖慢研究、偏向既有巨头,并使某些形式的机器学习变得不切实际。

但这一论点并不能解决默认设置的问题。Twitch 与创作者之间本就存在直接关系。与爬取未知公开网页的公司相比,它能更容易地与创作者沟通、展示条款并设计激励机制。

自愿加入的项目可以为创作者提供具体益处。Twitch 可以提供增强型发现工具、模型驱动的编辑功能、收益分成或绩效分析访问权。这样,参与就会成为一种交换,而非隐藏的默认假设。

Minton 的评论表明,Twitch 并不认为当前的方案本身足以说服创作者。该平台转而依赖默认加入。

对于管理合同、剪辑、赞助备注和政策变化的创作者而言,追踪这些细节也会成为知识管理问题。可搜索的 AI 知识库 可帮助团队保存通知、同意决定和不断变化的平台条款。

Google、YouTube 与竞争对手面临同样的数据问题

Amazon 并非唯一寻求平台数据的公司,但 Twitch 的承认,为竞争对手和监管机构提供了一个清晰的检验案例。

Google 之所以进入这一比较,是因为 YouTube 为其提供了直接接触各种视频形式的渠道,规模几乎无可匹敌。Google 还开发了能够处理文本、音频、图像和视频的 Gemini 模型。

因此,YouTube 与创作者之间的关系带来了类似的战略可能性,也带来了相似的信任问题。平台运营方可以利用内容改进推荐、检测滥用行为、生成字幕,或开发更广泛的 AI 系统。用户并不总能区分这些用途。

Meta 在 Facebook 和 Instagram 上也面临同样的张力。公开帖子对于需要文化、视觉和对话知识的模型可能很有用。Meta 也曾因用户如何反对 AI 训练而遭遇质疑。

Reddit 采取了更明确的商业化路径,通过授权方式开放对平台内容的访问。这种方式承认数据是一种资产,尽管个人贡献者仍可能质疑平台层面的协议是否反映了他们的利益。

OpenAI 和 Anthropic 缺少可相比拟的消费者视频平台。它们更依赖合作伙伴关系、授权内容集合、公开来源、合成数据,以及通过产品提交的材料。当竞争对手掌控持续更新的媒体网络时,这可能使它们处于不利地位。

竞争促使每一位平台所有者将现有服务重新诠释为训练基础设施。搜索查询变成语言反馈,照片变成视觉数据,视频变成多模态示例,对话变成人类偏好的演示。

Amazon 与 Google 之间的竞争加剧了这种动机,因为两家公司都经营云业务、消费者服务、广告系统和 AI 模型产品组合。一个有用的模型可以同时强化多个业务部门。

然而,拥有平台并不意味着对其中发生的一切拥有无限权利。一场直播可以在同一个画面中包含主播的原创作品、游戏发行商的资产、授权音乐、嘉宾发言、观众聊天以及品牌材料。

这种多层次的权利结构,使直播视频在法律和运营层面都比干净的内部数据集更复杂。过滤明显侵权内容,并不能回答其余所有材料是否都具备适当的训练依据。

监管机构还会审查平台对处理目的的说明是否足够清晰。在将同意作为法律依据的司法辖区内,同意必须是知情且具体的。隐藏在默认设置中的同意,比显眼且自愿的选择更可能受到严格审查。

Twitch 最有力的辩护将是提供详尽透明的信息。公司可以说明模型系列、数据类别、地理范围、保留期限、截止日期、评估方法,以及退出后的影响。

它还可以将创作者、嘉宾和聊天参与者区分开来。频道徽章可以标明是否启用了生成式训练。观众便能在发送消息前决定是否参与。

Twitch 尚未宣布此类标识。没有它,观众很难知道自己的贡献是否会进入启用该设置频道的训练池。

独立审计将提供另一项有用的检验。审计人员可以测试退出机制是否在 Amazon 各系统间得到落实、被排除的内容是否出现在后续数据集中,以及模型是否复现受保护或个人材料。

竞争并不要求每家公司都采用最弱的同意标准。Google、Amazon、Meta 及其他平台所有者,既可以在模型性能上竞争,也可以在数据实践的可信度上竞争。

Twitch 现在有机会证明其控制机制确实有效。如果公司反而将这一开关视为充分披露,反弹将持续,因为尚未回答的问题关乎数据处理,而非界面设计。

创作者和 AI 买家接下来应关注什么

接下来的三个信号将表明,Twitch 的设置代表真正的控制权,还是仅仅是对公众压力的有限回应。

第一个信号是针对具体模型的透明度通知。Amazon 应说明使用 Twitch 内容的模型系列或产品类别。它还应解释训练是否在该设置出现前就已开始,以及此前处理的数据将如何处置。

这类披露将强化 Amazon 关于创作者拥有有意义选择权的主张。持续含糊不清则会表明,公司更重视灵活性,而非知情参与。

第二个信号是 Twitch 如何处理同意状态不一致的直播。平台需要针对嘉宾、联合直播者和聊天参与者制定明确规则,因为他们的偏好可能与频道所有者的设置不同。

可见的训练状态徽章无法解决所有权利问题,但能改善告知。适用于个人聊天贡献的控制机制,或许能提供更精确的选择。

关注 Twitch 是否会在接下来的几次产品更新中推出其中任一功能。沉默将使频道所有者继续成为社区生成数据集的唯一决策者。

第三个信号是监管或合同压力。创作者团体、游戏发行商、表演者或隐私监管机构可能要求 Twitch 记录其法律依据和权利链条。正式调查将迫使公司给出比一次公司直播更具体的回答。

AI 买家应与创作者一样重视此事。企业越来越多地评估模型数据来自何处、相关人员是否能够反对,以及许可是否覆盖商业部署。不清晰的数据来源可能演变为采购、合规或声誉风险。

开发者也不应假设更多数据总能带来更好的模型。Twitch 材料包含噪声、重复内容、受版权保护的媒体、协同行为的聊天内容以及高度本地化的语言。高质量筛选与规模同样重要。

创作者现在可以通过网页版审查 Twitch 的安全与隐私设置。他们应记录自己的选择,在政策更新后重新检查,并告知合作伙伴频道是如何配置的。

他们还应盘点涉及第三方权利的内容。关闭训练并不能替代音乐、游戏、赞助或嘉宾协议,但能减少一条不确定的再利用路径。

观众拥有的直接控制较少,因为频道设置塑造了所处环境。在聊天中分享敏感细节前,他们应假定消息可能被存储、分析,并与周围直播内容关联。

对于更广泛的 Amazon 与 Google AI 竞赛而言,关键问题不在于哪家公司拥有更多视频,而在于专有平台能否在不削弱这些社区赖以珍贵的信任基础的情况下,将社区转化为模型基础设施。

Amazon 已获得一种不同寻常的多模态资源。Twitch 也暴露了这一优势的代价。其产品负责人承认,自愿参与的比例会很低,随后又为一套以默认同意为核心的系统辩护。

这一承认,为创作者、监管机构和企业客户评判下一步回应提供了具体标准。关注是否会出现明确点名的模型、可执行的排除机制、可见的频道状态,以及独立测试。

如果这些措施到位,Twitch 可以将反弹转化为更可信的数据协议。若没有,Amazon 与 Google 的竞争将再次产生一种熟悉的结果:获得数据更容易了,但人们对其获取方式的信心更少。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page