top of page

监督委员会称,Meta AI 深度伪造规则未能应对两起骚扰案件

1天前
讀畢需時 15 分鐘

根据 9 月 17 日公布的裁决,Meta 的 AI 深度伪造规则在两起涉及女性成为合成视频攻击目标的 Facebook 案件中失效。监督委员会推翻了 Meta 允许两条帖子继续留在平台上的决定,并称该公司的保护措施“持续且根本性地不足”。

其中一段视频冒充一名苏格兰工党议员,将有关难民的煽动性言论伪造为出自她口中。另一段视频则把对一名年轻穆斯林健康倡导者的采访改造成虚构表演,用于嘲弄她的外貌和工作。

这些案件揭示了 Meta 偏好保留存在争议的言论,与合成骚扰现实之间更大的冲突。当逼真的伪造内容从未经过人工审核时,标签、举报表单和自动分流机制提供的保护十分有限。

这正是核心问题。Meta 制定了针对仇恨行为、霸凌、错误信息和篡改媒体的规则。然而,即使用户已作出举报,这两条帖子仍从这些政策之间的漏洞中漏过。

监督委员会希望 Meta 将疑似 AI 篡改视为加快审查的理由。其建议包括优先安排人工审核被举报的合成内容,并扩大对非自愿篡改图像的保护。

Meta AI 深度伪造规则遗漏了两种不同形式的伤害

这些裁决表明,Meta 的问题并非单一政策存在缺陷,而是当 AI 成为骚扰工具时,多项政策未能协同发挥作用。

这起政治案件涉及一则于 2025 年 11 月发布的 Facebook 相册。其中包含一段逼真的合成视频,画面显示一名苏格兰工党议员谈论难民和性暴力。

视频中,这名议员似乎表示,即便难民强奸女性,他们依然受到欢迎,因为白人也会犯下同样的罪行。她从未说过这番话。

该相册还包含第二段经过篡改的视频,以及一张真实照片,照片中标识了数名参与反极右翼抗议活动的女性。其说明文字还包含一项未经证实的指控,称该议员曾逃税。

用户没有披露使用了 AI。Facebook 也未添加说明性标签,告知该画面很可能是被创建或篡改的。

两名用户根据 Meta 的霸凌与骚扰规则举报了该帖子。两次举报均未获得优先人工审核,用户提出申诉后情况也同样如此。

监督委员会描述该案件时,这条帖子的反应和评论不足 50 条,分享次数也不足 50 次。有限的互动量成为 Meta 为不处理该帖子所作辩护的一部分。

Meta 起初认定该帖子并未违反其标准。该公司认为这名议员是成年公众人物,因此不适用于一项针对非自愿篡改图像的保护规则。

公司还将该视频视为讽刺作品。根据监督委员会此前的案件说明,Meta 认为它不太可能在重要议题上实质性地误导公众。

Meta 没有应用高风险 AI 标签。该公司称,相关内容不涉及选举或危机,且互动量很低。

监督委员会得出了不同结论。其认定,该帖子应依据 Meta 的仇恨行为规则被删除。

多数成员认为,这一伪造内容将犯罪和性掠夺行为归咎于作为群体的难民。这一区别很重要,因为 Meta 将该说法解释为只针对部分难民。

监督委员会还表示,该视频应当获得高风险 AI 标签。此类标签表明逼真内容经过数字化创建或修改,并存在较高的欺骗风险。

第二起案件涉及一名年轻穆斯林女性,她曾为改善女性健康教育的活动担任志愿者。她的原始采访讨论了影响少数族裔社区女性和女孩的健康问题。

经篡改的视频却将她描绘为自称担任官方健康职务、进行荒诞锻炼、提供健身建议并食用垃圾食品。她从未说过这些话,也从未做过这些动作。

这一伪造内容将她的健康倡导转变为针对其外貌的视觉攻击。帖子下方的评论嘲笑她的体重和头巾。

监督委员会选定该帖子时,这条 Facebook 帖子的观看量已超过 5,000 次,获得超过 200 次反应和 50 多条评论。据报道,相关的篡改视频和图像在多个平台触达了规模大得多的受众。

一名用户以霸凌和骚扰为由举报了这条 Facebook 帖子。Meta 的自动流程没有优先安排该举报或后续申诉的人工审核。

该帖子仍在线上,且没有 AI 标签。根据监督委员会的倡导者案件记录,Meta 起初认定不存在明确攻击该女性外貌的表述。

Meta 还表示,其非自愿篡改图像规则涵盖对一个人外貌的修改,但不涵盖对该人言行的虚构描绘。

这种区别使核心手法游离于规则之外。该视频利用真实肖像虚构行为并引发嘲弄,而非仅仅改变目标的脸部或身体。

在监督委员会受理案件并向公司提出问题后,Meta 最终以霸凌为由删除了该帖子。这一修正处理了一段视频,却没有修复遗漏该内容的举报系统。

因此,这两项决定涉及不同形式的伤害。一项将合成冒充与仇恨反难民信息结合,另一项则利用虚构行为持续实施基于外貌的骚扰。

两者都走向同一个程序性死胡同:举报已提交,申诉也随之提出,但始终没有及时的人工审核。

自动分流正在成为真正的审核政策

当系统从不将相关举报提交给能够适用规则的人员时,书面规则几乎无法提供保护。

Meta 在一个使自动化不可避免的规模上审核内容。分类器会估计一条帖子是否可能违反规则、是否造成严重伤害,或是否值得人工关注。

这使得优先级排序成为一项实质性决定。被自动关闭的举报并非只是等待更久才得到审核。实际上,平台已判定所称伤害不值得审查。

这两起新案件都展现了这种失效。用户指出了疑似 AI 篡改和骚扰,但这些信号并未在申诉提交至监督委员会之前促成人工审核。

因此,监督委员会要求 Meta 在现有信号表明内容可能由 AI 生成时,优先处理被举报的内容。这项建议针对的是执法的入口,而不仅仅是政策措辞。

这是 Meta AI 深度伪造规则争论中的一个重要转变。此前的讨论往往集中于伪造媒体应被删除还是被标注。

这些案件提出了一个更早的问题:Meta 是否会识别出内容是合成的,并且会审查投诉本身?

政治深度伪造案说明,为何互动量不能作为主要的风险测试。一则伪造言论可以在大规模传播之前威胁或损害其目标的声誉。

低互动量也可能只是暂时的。推荐系统、转发、经编辑的副本,以及其他平台上的活动,都可能使合成媒体远远超出其原始受众范围。

倡导者案件则显示了另一项弱点。一条帖子按平台标准看似规模有限,却可能属于一场规模更大的跨平台骚扰行动。

只审查孤立帖子的审核人员或许会看到一则笨拙的恶搞。掌握背景的人则会看到被篡改的采访画面、基于外貌的嘲弄,以及针对真实人物的协同关注。

自动化难以处理这类背景。它必须将合成表演、评论、原始采访、目标的角色和更广泛的行动联系起来。

Meta 此前曾宣传,较新的 AI 系统能够改善内容执法和用户支持。今年 3 月,监督委员会指出 Meta 声称此类系统可覆盖在线使用语言中的 98%。

监督委员会还警告,这种做法存在风险。更好的语言覆盖并不会自动带来对讽刺、定向虐待、政治背景或被篡改身份的更准确判断。

最新案件为这些说法提供了具体检验。Meta 的系统不需要自动解决每一个困难问题。

它们只需识别出足够的风险,将举报提交给经过培训的审核人员。这项更有限的任务仍然失败了。

优先处理疑似合成媒体并不意味着自动删除。它会将可能的 AI 篡改视为升级处理信号,类似于病毒式传播或可信威胁。

这种区别保护了表达自由。讽刺、恶搞和合法的政治批评在经过背景审核后仍可留在网上,而逼真的冒充内容则会得到更仔细的审查。

这也会降低受害者必须选择完美举报类别的重要性。用户不能被期望理解哪一项内部规则适用于虚构行为、视觉篡改或欺骗性音频。

举报流程应根据所提供的证据分流投诉,而不应让补救措施取决于处于痛苦中的用户能否正确区分霸凌与错误信息。

Meta 当前的结构将同一有害内容分割到多项政策中。一则深度伪造内容可能具有欺骗性、仇恨性、骚扰性、性虐待性或欺诈性,有时会同时具备这些特征。

系统必须一并评估这些维度。否则,每项政策都可能拒绝承担责任,而内容仍留在线上。

这正是监督委员会的建议超越两个边缘案件的原因。它挑战了决定哪些投诉能得到有意义考量的运行逻辑。

Meta 的标签策略无法承担全部负担

标签对于存在争议或带有讽刺意味的言论仍然有用,但当合成内容违反其他规则时,它们不能取代执法。

Meta 在 2024 年一项涉及经篡改的美国总统乔·拜登视频的监督委员会决定后,调整了其篡改媒体处理方式。该公司转而为更多合成内容添加标签,而不是仅因内容被篡改就将其删除。

这一方向回应了真实的表达自由担忧。删除每一张经过编辑或由 AI 生成的图像,会波及恶搞、艺术、政治评论和无害的创意作品。

修订后的做法原本应覆盖更多格式,包括通过行业指标检测到或由上传者披露的视频、音频和图像。

监督委员会最初欢迎这些标签调整。标签能够为观众提供有用背景,同时将删除措施保留给违反其他标准的内容。

新裁决并未否定这一模式。它们展示了当其配套系统过于狭窄时会发生什么。

在监督委员会介入之前,两段存在争议的视频均未获得说明性 AI 标签。其中一段不符合 Meta 的高风险测试,另一段则同时逃过了标签要求和及时的骚扰执法。

一则简短的“AI 信息”提示也只能解决问题的一部分。它向观看者说明内容来源及被修改方式等溯源信息。

但它无法回答一则帖子是否针对某个人、是否将仇恨言论归于该人,或是否构成持续骚扰的一部分。

委员会针对这段政治视频提出的建议更进一步。据报道,其中包括扩大高风险 AI 标签的适用范围,并降低带有此类标签内容的分发量。

委员会还建议,在观看高风险合成媒体前设置需要额外操作才能继续的警告页面。此类阻力可以减缓随手转发,而无需实施全面禁止。

另一项提议是加重对反复传播误导性 AI 内容账户的处罚。这种做法关注行为模式,而非孤立地评判每一则帖子。

委员会希望 Meta 能更透明地说明其何时使用 AI 标签。若没有数据,外部观察者便无法判断这些标签是否在不同语言、格式、地区或政治敏感议题中得到一致应用。

标签也依赖于检测。文件经过编辑、屏幕录制、压缩或在不同服务之间传输时,元数据可能会消失。

包括 C2PA 标准在内的内容凭证,可以保留有关文件来源和编辑历史的签名信息。它们仍只是信号,而非判定真相的完整依据。

一段合法录制的视频即使带有有效凭证,也可能配有虚假标题。一个有害的合成视频即使缺少凭证,也不能据此证明其说法是捏造的。

这意味着,溯源技术必须服务于语境化审核,不能取代它。

委员会此前已将这一原则应用于性化冒充案件。在 2026 年 6 月的一项深度伪造裁决中,委员会推翻了 Meta 将一段 AI 生成视频保留在线上的决定。

该案涉及一名非公众女性被置于带有性化意味的虚构场景中。Meta 的自动系统检测到了潜在伤害,但并未将该内容列为优先审核对象。

委员会认定,AI 生成的性化冒充应被视为未获同意的信号。它还敦促 Meta 允许指定的可信账户代表受害者举报此类侵害。

当前裁决将相同逻辑扩展到露骨性图像以外。AI 生成内容可以作为证据,表明目标并未同意被捏造的言论或行为。

但这并不意味着每一则未经授权的恶搞都应被删除。公众人物仍应成为尖锐批评、喜剧和政治评论的正当对象。

然而,合成媒体改变了攻击方式。它可以让一个可被识别的人看似亲自说出了攻击其本人的那句话。

这一机制值得得到政策层面的认可。受害者不应仅因攻击者捏造了其行为、而非篡改其身体,就失去保护。

这起活动人士案件直接揭示了这一差异。Meta 的规则将视觉篡改视为可能可采取行动的情形,却排除了使用同一人肖像捏造表演的情况。

对于目标及其受众而言,两者的差异可能毫无意义。两种技术都会围绕真实个人制造虚假证据。

因此,Meta 的标签策略需要配套规则,以覆盖捏造行为、虚假归因和骚扰。否则,溯源提示就会成为平台面对本应删除行为时给出的回应。

最棘手的问题是:讽刺止于何处,定向欺骗始于何时

Meta 无法通过删除所有冒充内容来解决深度伪造骚扰问题,但保护讽刺并不意味着要无视可预见且具有针对性的伤害。

这起政治案件呈现了更尖锐的言论自由冲突。它涉及一名公职人员、移民政策、抗议活动,以及可能被理解为怪诞政治讽刺的语言。

据报道,一名委员会成员不同意删除分析,认为该帖子作为政治言论应获得更强保护。这一担忧不应被轻易忽视。

公职人员必须容忍激烈批评。平台不应仅因恶搞将夸张立场归于政治人物,便赋予其广泛权力删除相关内容。

讽刺往往通过明显失实的呈现发挥作用。其含义可能取决于受众是否意识到,说话者绝不会讲出那句捏造的话。

AI 使这一惯例变得复杂,因为呈现形式与信息内容可能指向不同方向。荒谬的表述或许暗示这是恶搞,而逼真的视频和同步语音却暗示其真实性。

语境也会在传播过程中消失。一则在某个政治群体内部被理解为讽刺的帖子,可能会以貌似真实录音的形式传播给另一群受众。

委员会表示,这段议员视频看起来很逼真,尽管不完美的同步效果提供了被操纵的证据。Meta 仍将该内容视为讽刺且低风险。

多数意见认为,该帖子不只是批评一名政治人物。它传递了一项主张,将难民作为群体与强奸和掠夺性行为联系起来。

这一仇恨行为分析将注意力从被冒充的议员转向另一个目标。伪造内容将歧视性前提塞进了一名假定对手的所谓发言中。

因此,该案不能被简化为真实与虚假的对立。它关乎欺骗性形式、政治批评和基于群体的敌意如何相互作用。

活动人士案件的模糊性较小。她并非公职人员,而这段视频的影响力来自一场真实的女性健康采访。

捏造场景将那次出镜变成了嘲弄素材。围绕其体重和头巾的评论,使嘲笑的指向更为明确。

Meta 最初的分析是在寻找一项明确声明,即宣称她因外貌而低人一等。委员会则认为,视频及其周边语境已足以构成霸凌。

这一分歧揭示了反复出现的审核难题。骚扰往往通过暗示、剪辑、重复传播和受众参与来实施,而不是靠一句被禁止的话。

生成式视频让这些手法更容易被包装。攻击者可以设计一场引导他人施虐的表演,同时避免直接的文字侮辱。

参与公共讨论的女性尤其容易暴露于此类风险。委员会联合主席 Pamela San Martin 表示,深度伪造正日益被用来骚扰和噤声女性,从政治人物到普通公众皆然。

这一模式之所以重要,是因为伤害不止于名誉纠正。当每一次采访或每一张照片都可能成为捏造行为的原料时,目标可能会减少公共参与。

平台仍须避免假定所有冒犯性的合成媒体都会令目标噤声。一些帖子可能是粗俗玩笑、批评或受保护的评论,尚不足以构成删除依据。

可行的系统需要分级响应。这些措施可以包括 AI 标签、降低推荐、警告页面、人工审核、账户处罚,或依据其他政策删除。

响应措施应与可识别的伤害相匹配。关于公共事务的逼真欺骗,应与在明显喜剧场景中分享的夸张漫画区别对待。

反复发布同样重要。当同一账户持续传播针对某个具名个人的大量合成攻击时,一则模糊的恶搞会呈现出不同性质。

受众行为提供了另一项信号。评论、标题和转发措辞可以显示,用户究竟将其理解为讽刺,还是把捏造言论当作真实内容。

这些信号没有一个能带来完美决定。以 Meta 的规模进行审核必然会出错,增加审核也可能使系统不堪重负,或压制合法言论。

这是反对简单升级处理每一则疑似 AI 帖子的最有力理由。攻击者也可能谎称批评内容为合成内容,以触发延迟或降低分发。

Meta 需要防范此类滥用。优先处理应意味着及时的语境化审核,而不是自动假定被举报内容违反政策。

委员会的要求仍然合理,因为现有平衡在更早阶段就已失效。两则原始举报均未进入需要考量讽刺、语境或伤害的人工判断环节。

公司无法通过一个阻止细致判断进入决策过程的流程,来为复杂规则辩护。

Meta 现在有三项考验需要通过

下一阶段将揭示,Meta 是将这些裁决视为孤立的纠正,还是重新设计那些反复失效的系统。

第一个信号是 Meta 的正式回应。该公司有 60 天时间回应委员会的建议,尽管政策建议并不具有约束力。

案件裁决本身具有更强效力。在明确的安全例外条件限制下,监督委员会可以要求 Meta 推翻针对被审查帖子的内容决定。

一份详细回应应说明,Meta 是否会优先处理显示出可信 AI 信号的被举报内容,也应明确哪些信号会触发审核。

这些信号可能包括用户披露、嵌入式凭证、视听伪影、匹配的合成副本、账户行为、标题,以及来自可信组织的举报。

Meta 还必须说明将如何防止恶意举报。缺乏保障措施的优先渠道,可能会成为压制政治讽刺或不便证据的工具。

第二个信号是对不受欢迎的操纵图像作出更广泛定义。在活动人士裁决之后,当前“篡改外貌”与“捏造行为”之间的区分已很难辩护。

修订后的定义应涵盖对私人个体的逼真呈现,即让他们看似说过或做过实际上从未说过或做过的事。它不应完全取决于被针对者本人是否提出举报。

受害者可能不使用 Facebook,可能已关闭账户,或无法监控在群组和主页之间传播的副本。

可信代表需要有渠道代为举报。Meta 也应允许审核人员运用未获同意的语境证据。

性化深度伪造裁决已确立了有益先例。AI 冒充本身可以帮助证明亲密内容未经同意。

非性化骚扰需要更谨慎的测试,但底层原则依然适用。当某人的肖像成为施虐的传递机制时,捏造行为就是相关证据。

第三个信号是分发控制。在数月申诉后删除一则帖子,无法解决重复内容、推荐系统,或反复发布误导性媒体的账户问题。

据报道,委员会提议降低高风险 AI 内容的推荐权重,并在观看前设置警告页面。Meta 应披露这些措施是否在 Facebook 和 Instagram 上得到一致应用。

它还应发布有意义的数据。实用指标包括 AI 标签的应用数量、升级处理的举报数量、已审核的申诉数量,以及被降权或删除的帖子数量。

在隐私许可的情况下,这些指标应按内容类型、语言和地区分别公布。汇总总数可能掩盖资源较少市场中的重大缺口。

Meta 还应报告审核速度。一项在骚扰活动达到高峰后才作出的正确决定,对目标提供的保护有限。

公司还需要建立针对重复违规者的框架。反复传播未标注误导性媒体的账户,与分享一则存在争议恶搞内容的用户,所带来的风险不同。

更严厉的处罚可包括降低推荐、临时发帖限制、取消变现资格或账户制裁。Meta 需要设定明确门槛和有意义的申诉渠道。

初始报道出现时,该公司尚未公开回应置评请求。其最终答复应正面回应委员会对系统性问题的批评,而不应只谈两则帖子的事实。

监督委员会同样面临信誉考验。其建议可以发现漏洞,但一再认定落实不力,最终只会让建议的边际效益递减。

委员会应追踪 Meta 是否落实每项建议,以及执法结果是否发生变化。仅凭政策文本,无法证明被举报的深度伪造内容能够送达具备资质的审核人员。

研究人员和公民社会团体应留意转移效应。Facebook 更积极的执法,可能会将合成式骚扰推向私密群组、加密频道或竞争对手的服务。

这并不是为不作为开脱。它意味着,成功应以传播范围缩小、干预更迅速以及受害者获得更好补救来衡量,而非宣称已将问题彻底消除。

对用户而言,眼前的教训令人不安。举报疑似深度伪造内容,并不能保证会有人亲自审核,即使在申诉之后也是如此。

遭受合成媒体攻击的人应保存链接、截图、日期、说明文字及相关副本。这些证据有助于证明内容遭到操纵、厘清背景,并记录重复发生的行为。

引用存在争议视频的记者和机构,应清楚说明其核实状态。即使是为了反驳而重复传播捏造的指控,也可能扩大其影响范围。

员工会公开发声的组织,也应在事件发生前建立升级处理流程。合成式骚扰的传播速度,比临时应对更快。

更广泛的科技行业应将这些裁决视为一项产品设计警示。生成式媒体安全不能止步于模型过滤机制或显眼的水印。

一旦合成内容进入平台,举报、检测、审核、分发和补救措施将共同决定其影响。任何一个环节的薄弱,都可能抵消其他环节的保障。

Meta 接下来的行动将显示,其系统是否认识到这条链条。一次狭窄的标签更新,无法触及主要失误。

决定性的改变,应是建立一套将可信 AI 信号视为需要判断的背景信息的举报流程。该流程必须保护政治言论,同时迅速应对针对性滥用。

Meta 的 AI 深度伪造规则如今面临的是实际考验,而不是又一场概念辩论。公司能否在一段捏造的表演变成针对其目标的持久证据之前,将其政策环节衔接起来?

关注 Meta 的 60 天回应、其是否扩大对篡改图像的保护,以及首批关于 AI 优先处理举报的透明度数据。这些信号将表明,最新裁决是否会改变执法,还是仅仅记录下又一次失败。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page