top of page

Meta AI 广告检测瞄准隐藏的滥用链接,但信任鸿沟依然存在

19小时前
讀畢需時 14 分鐘

在调查人员发现付费广告借看似普通的创意内容隐藏通往儿童性虐待材料链接后,Meta 扩大了 Meta AI 广告检测范围。

10 月 7 日推出的措施,瞄准了审核中的一个棘手缺口:广告表面上可能无害,却会将用户引向其他在线渠道中的非法材料、有害应用或虐待活动。Meta 表示,其新系统会在广告主大规模投放前分析这些隐藏信号。

这一转变至关重要,因为此前的保障措施未能阻止 Facebook、Instagram、Messenger、Threads 以及 Meta 更广泛广告网络上反复出现的相关活动。即使 Meta 称已引入改进的检测机制,研究人员仍持续发现滥用广告。如今的核心矛盾已十分明确:Meta 正在增加自动化手段,而对手也在不断学习如何规避这些手段。

Meta 的新系统不止审查广告本身

最重要的变化是,Meta 的审核流程如今会检查广告将用户带往何处,而不只关注广告内部呈现的内容。

Meta 在其 10 月 7 日的公告中介绍了五项新增措施。它们共同涵盖语言、跳转目的地、历史内容、防御性测试以及屡次违规者。该公司将其描述为对其所谓对抗性广告方案的协调应对。

第一项新增措施,是专门用于检测“引导指向”的大型语言模型。Meta 用这一术语描述那些看似无害、却暗中将用户引向儿童性剥削材料或相关有害活动的内容。

引导指向带来了分类难题。单独看时,可见的图像或文字可能并不违反政策。只有结合跳转目的地、广告主行为和其他周边信号,才能看出其真正含义。

而这正是 LLM 可以发挥作用的场景。大型语言模型会分析词语、符号、指令和对话线索之间的关系,识别更简单的关键词过滤器可能遗漏的模式。

Meta 的第二项变化,是让其系统获得关于广告跳转目的地的更多信息。该公司表示,这使其能够屏蔽违规网站,并对负责将用户导向这些网站的账户采取行动。

这显著扩大了审核范围。广告不再被视为孤立的创意资产;落地页以及广告与该页面之间的跳转路径,也成为安全决策的一部分。

Meta 还针对现有广告内容推出了额外的 AI 驱动扫描。这些搜索旨在发现早期系统漏掉的材料。随着调查人员发现新的规避模式,这些扫描所使用的信号也将不断扩展。

第四项工具充当自动化攻击者。Meta 将其称为红队 AI 代理,即在犯罪分子能够大规模利用漏洞之前,主动探测防御体系薄弱环节的 AI 系统。

该代理旨在模仿对抗性策略,并暴露 Meta 安全措施中的缺口。这使红队测试从周期性演练转变为一种可能持续进行的测试过程。

最后,Meta 表示其加强了对重复违规行为的检测。这些系统试图识别那些在先前账户被移除后,又通过新账户卷土重来的广告主。

整套方案瞄准滥用活动的不同阶段:检测环节审查广告,目的地分析检查跳转路径,扫描寻找遗漏内容,红队测试寻找漏洞,而重复违规控制则锁定回归的运营者。

因此,Meta 的新保障措施不仅仅是又一个图像分类器。它们试图对围绕广告展开的整场活动进行建模。

这一区别至关重要。传统过滤器会询问某个特定上传内容是否违规;Meta 的新方法则询问多个看似无害的元素组合起来,是否构成了一条滥用路径。

然而,Meta 尚未公布这些工具的召回率、误报率或独立测试结果。该公司已说明其组成部分,但外部人士目前仍无法衡量其有效性。

为什么 Meta AI 广告检测如今追踪跳转目的地

Meta AI 广告检测正在向下游延伸,因为不法行为者可以将意图隐藏在 Meta 最初审核内容之外。

一则看似普通的广告,可能是更长转化路径中的第一步。创意内容获得 Meta 受众的触达机会,而外部页面或应用则提供有害材料。

这种分离有助于广告主规避简单的审核规则。展示给 Meta 系统的广告,可能与用户最终看到的内容不同。重定向还可能根据地点、设备、账户历史或时间而变化。

这种技术类似于伪装,即向审核人员和目标用户展示不同内容。Meta 已经使用 AI 调查诈骗广告中的伪装行为。儿童剥削活动则构成了同一技术问题更为紧迫的版本。

具备目的地感知能力的系统可以跟踪重定向、对落地页分类,并将其与广告中的承诺进行比较。它还可以寻找重复出现的域名、应用标识符、支付关系或账户集群。

不过,目的地分析也存在局限。运营者可以轮换域名、延后有害行为,或在最终目的地前先放置一个表面合规的页面。移动应用也可能在通过商店审核后改变其行为。

Meta 表示,会屏蔽托管或创建违禁材料的外部网站。一旦链接被屏蔽,该公司就会搜索包含该地址的广告、帖子和评论。

该公司还表示,包含已屏蔽链接的广告应在上传时被拒绝。在识别出某一域名后,这就形成了有用的遏制机制。

更棘手的问题在于未知目的地。系统必须在用户接触之前,判断一个陌生链接是否危险。这需要依赖上下文推断、行为分析,或两者兼具。

Meta 的专用模型似乎正是为填补这一缺口而设计。它可以检查那些单独看并不构成违禁内容的引导指向信号;随后,目的地分析可以测试这些信号是否对应一条有害路径。

Meta 自 2011 年起就在其各款应用中使用 PhotoDNA 和相关匹配技术。哈希匹配会将上传媒体与已知滥用材料的数字指纹进行比对。

这种方法对于已知文件及几乎相同的副本仍然很有价值。但当广告在视觉上无害、内容为新生成、仅短暂展示滥用内容,或将用户导向其他地方时,它的作用就不那么直接。

因此,这些新工具是对哈希匹配的补充,而非替代。它们关注意图、路径和协同行为,而不是只匹配已知媒体。

Meta 还通过 Tech Coalition 的 Lantern 项目共享某些违规信号。参与公司可以利用这些信号,检测跨服务出现的滥用账户和行为。

跨平台合作十分重要,因为违法者很少依赖单一公司。一则广告可以从 Meta 开始,导向应用商店,最终抵达私营网站或消息服务。

Meta 在其较早的儿童安全工作中概述了这一更广泛的方法。10 月推出的工具为该战略增加了更明确的对抗性层面。

这一转变也给 Meta 之外的各方带来压力。Apple 和 Google 运营着应用商店,其中曾托管通过被调查广告推广的一些产品。域名提供商、支付服务和其他平台也可能出现在传播链条中。

没有任何单一审核系统能够控制整条链路。Meta 可以拒绝广告主接触其受众,但要移除底层服务,则需要其他中介机构采取行动。

这使目的地分析既有必要,也并不完整。它可以减少 Meta 作为获客渠道所发挥的作用,却无法从更广泛的互联网中消除有害产品。

此次推出措施之前已有数百起失效报告

Meta 的公告是对已有记录的审核失效作出的回应,而不是在问题浮现之前采取的预防措施。

Tech Transparency Project,即 TTP,调查了出现在 Meta 各项服务中的广告。其研究人员报告称,自 2025 年末以来发现了 350 多条滥用视频广告。

据报道,在第一批广告于 2026 年 8 月引起公众关注后,又有 250 多条广告投放。其中一些重复使用了 Meta 已经移除的材料。

这些广告出现在 Facebook、Instagram、Messenger、Threads 以及 Meta 的广告网络中。研究人员称,许多广告推广了能够生成未经同意私密图像的 AI 图像或视频应用。

一些广告据称以未成年人的普通照片开头,随后短视频会将这些图像转变为露骨的性场景。

研究人员确认了涉及四名未成年人的图像在现实世界中的来源,其中包括公开社交媒体照片、图库图片,以及一名欧洲王室成员的官方照片。

这一区别很重要。合成输出并不意味着伤害与现实中的人脱离关系。生成式系统可以将真实儿童的普通照片转化为犯罪图像。

根据这项9 月调查,这些广告在欧盟触达了超过 29,000 个账户,在英国触达约 7,000 个账户。

现有广告数据并未提供所有市场可比较的展示量总数。研究人员确认,美国出现了 250 多条广告,澳大利亚有 120 条,印度有 80 条。

Meta 表示,大多数广告的展示量不足 200 次。该公司还称,从研究人员识别出的这批广告中获得的收入不足 5,000 美元。

这些数字并不能消除根本性的安全疑问。问题在于,付费分发是否让有害内容得以通过一个在发布前审核广告的系统获得传播路径。

Meta 的广告标准禁止儿童性剥削、虐待和裸体内容。该公司还禁止旨在制作未经同意私密图像的服务。

付费广告通过审核,比普通帖子逃过审核带来更尖锐的问责问题。广告是一种受控制的商业产品,Meta 接受付费以进行分发。

TTP 研究人员称,一些被举报的广告最长可见长达一周。在此期间,这些广告获得了更多浏览量。

Meta 反驳了其容忍此类材料的任何说法。一名公司发言人表示,Meta 正在积极打击儿童剥削行为,并且已经移除了许多被识别出的广告。

该公司还称,一些视频难以分类,因为未成年人的图像仅短暂出现或经过模糊处理。这一解释暴露出一个弱点,而对手可以故意加以利用。

9 月,旧金山市检察官 David Chiu 向 Meta 发出停止并终止函。该办公室要求获得有关审核失效、重复广告主、升级处理程序以及向儿童安全机构报告情况的信息。

这座城市提出的质疑聚焦于 Meta 的政策与违禁广告反复投放之间的落差。Meta 质疑该办公室是否拥有管辖权,因为现有数据并未显示这些广告触达了旧金山。

其他主管部门也开始调查此事。密歇根州和佛罗里达州官员表示,他们正在审查相关广告的举报;澳大利亚 eSafety 监管机构则向 Meta 索取信息。

印度成为另一个重要的施压点。9 月,在有关该公司平台存在儿童剥削材料的指控出现后,印度儿童权利机构传唤了 Meta India 高管。

Meta 表示,2026 年上半年,其在印度的 Facebook 和 Instagram 上处置了 530 万条儿童性剥削内容。该公司称,其中超过 98% 是主动识别的。

这些数字显示出庞大的执法处置规模,却无法说明广告系统在发现隐蔽链接、惯犯或新生成媒体方面究竟有多有效。

这正是此次部署面临的信任鸿沟。Meta 可以记录数百万次下架行动,而研究人员仍能在一个经过商业审核的界面中发现持续存在的失效问题。

AI 审核面对不断变化的对手

核心权衡在于速度与确定性:Meta 需要大规模自动化执法,但每一项自动化决定都会带来新的错误和规避机会。

Meta 审核着海量内容和广告。仅靠人工审核,无法实时检查每一个创意素材、跳转链接、落地页、账户关联和行为信号。

因此,自动化不可避免。模型可以扫描更多材料,关联相距甚远的信号,并比人工调查团队更快作出反应。

但规模并不保证准确性。为激进下架而优化的检测器可能误封合法账户;为减少误报而调整的检测器则可能让更多有害材料漏网。

儿童安全执法会同时提高两方面的代价。漏报可能让用户接触非法材料,并延长受害者遭受伤害的时间;误报则可能错误处罚广告主或用户。

Meta 尚未披露其新模型背后的决策阈值,也未说明人工审核员会以多高频率检查最高风险案件。

独立证据依然尤为重要,因为 Meta 控制着审核系统、执法数据和广告资料库。研究人员能够观察到仍然可见的失效问题,却无法统计每一次成功拦截。

Meta 的红队代理是对这种不对称情况的一种有趣回应。它可以比人工团队手动创建变体更快地生成或测试各种变化。

该代理可能测试修改过的措辞、模糊图像、跳转序列和新账户模式,进而暴露那些能够通过一道防线、却会在另一道防线失效的组合。

不过,内部红队仍在 Meta 所选择的假设框架内运作。它可能遗漏设计者未曾预见的策略,或测试环境中不存在的数据模式。

犯罪运营者同样会获得反馈。如果一则广告被接受、拒绝或下架,他们就能了解平台控制措施的一些信息,随后可以修改内容并再次尝试。

累犯检测通过将新账户与此前被封禁的运营者关联起来,应对这一循环。相关信号可能包括基础设施、支付关系、管理行为或反复出现的创意模式。

Meta 尚未详细说明其使用哪些信号。出于安全考虑,这种保留可以理解,因为完全公开可能帮助攻击者;但这也使独立评估变得困难。

AI 生成剥削材料的广泛增加进一步凸显了紧迫性。NCMEC 表示,在 2023 年 1 月至 2025 年 12 月期间,其将超过 15.8 万张提交的图像和视频归类为 AI 生成内容。

NCMEC 还记录到涉及生成式 AI 的举报数量急剧上升。其 生成式 AI 指引警告称,合成图像仍可能剥削可识别的儿童,并为其他虐待行为提供支持。

不断增长的举报量会给调查人员和平台都带来压力。更好的检测会产生更多举报,但这些举报必须包含足够信息,才能让主管部门采取行动。

质量与数量同样重要。一个用分类不佳的材料淹没调查人员的系统,可能消耗资源,却无法改善受害者识别工作。

Meta 表示,在法律要求的情况下,其会向 NCMEC 举报明显的儿童剥削材料。该公司还宣布,将印度儿童安全案件直接报告至该国的 National Cyber Crime Reporting Portal。

这种报告衔接很重要,但下架和举报服务于不同目的。下架广告可以限制传播;详细报告则有助于调查人员识别受害者、广告主或关联网络。

因此,Meta 的 AI 广告检测必须支持多种结果:拒绝有害广告、停用协同账户、保留有价值的证据、屏蔽目标地址,并将可信举报转交主管部门。

一个在单项任务上表现优异的模型,仍可能使整个系统失效。如果同一运营者立即通过另一个账户和域名回归,屏蔽单一创意素材意义不大。

核心考验在于持续性。Meta 必须证明,其系统能够减少整个滥用网络,而不只是移除研究人员已经识别出的单条广告。

Meta 的安全声明如今面临可衡量的检验

新控制措施只有在外部调查人员发现之前减少重复投放活动时,才具有意义。

Meta 提出了一套分层防御体系,结合内容分析、目标地址检查、追溯式扫描、对抗测试、链接屏蔽和惯犯检测。

这一设计契合威胁的结构。有害广告很少只是一张图片,它通常涉及广告主、创意资产、投放规则、链接、应用、域名和替代账户。

该公司还拥有外部研究人员无法获得的信号,可以检查账户历史、支付工具、管理关联、设备信息和先前的执法事件。

这种优势本应让 Meta 从被动下架转向网络层面的瓦解。该公司表示,前 FBI 调查员已经在对掠夺性账户网络开展人工调查。

令人担忧的是执行情况。研究人员在此前的保障措施宣布后,仍反复识别出相关广告。一些投放活动重复使用图像,或通过关联产品和账户持续存在。

这段历史使 10 月的部署成为一项可检验的主张。Meta 应能显示出更少的成功上传、更短的暴露时间,以及被移除广告主更低的回归率。

公开透明度将决定外界能否评估这一主张。Meta 目前发布执法统计数据,但宽泛的内容总量无法回答有关广告失效的问题。

一份有用的报告应区分发布前被拦截的广告和投放后被移除的广告,还应展示中位暴露时间以及曾试图回归的广告主比例。

目标地址执法也值得单独报告。Meta 可以披露被屏蔽的域名或应用数量、跳转链接变更的频率,以及被停用的关联账户数量。

该公司还应区分已知媒体匹配与语境检测。这种划分将显示 LLM 和目标地址工具是否确实捕捉到了不同类型的威胁。

误报同样需要关注。一个值得信赖的系统需要为被错误拦截的广告主提供申诉流程,并为高影响决定提供有意义的人工审核。

Meta 不应公开会帮助规避检测的技术细节,但仍可发布汇总性能数据、独立审计结果,以及每个执法类别的明确定义。

该公司在印度的直接报告安排提供了另一个可衡量领域。主管部门可以评估报告是否更快送达、是否包含更好的证据,以及是否促成更多可执行的调查。

无论 Meta 披露什么,外部审查都将持续进行。记者、民间社会研究人员、监管机构和应用商店调查人员都可以追踪类似广告是否仍然可见。

最初的 10 月报道将这些工具描述为对隐藏有害目标地址广告的回应。这种表述将重点放在结果上,而非模型描述。

Meta 无需证明没有任何有害广告会通过审核。没有任何审核系统能够可信地保证,对适应性对手实现完美预防。

但它确实需要证明,已知策略会可靠地失效。使用熟悉内容、关联账户或先前识别目标地址的重复广告,应当变得越来越罕见。

在这些结果出现之前,此次部署仍是一套颇具前景的防御架构,却附着于一份尚未解决的执法失效记录。

三个信号将显示这些工具是否有效

下一批证据应依次来自惯犯比例、独立发现和监管回应。

第一个信号是此前被移除的广告主及关联运营者是否会回归。Meta 强化后的累犯控制措施,应当减少与共同基础设施或行为相关的重复投放活动。

若出现明显下降,将支持 Meta 关于其正在瓦解网络而非删除孤立广告的说法。若重复现象持续,则会削弱新系统的说服力。

第二个信号是独立研究人员在未来数月中的发现。TTP 和其他调查人员可以测试,在 10 月部署后,受禁止的广告是否仍然出现。

最具揭示性的发现将涉及熟悉的策略,包括看似无害的创意素材、短暂出现的虐待画面、跳转链接、轮换域名,以及以新品牌重新出现的应用。

更低的发现率并不能证明实现了完全预防,但仍能提供有用证据,表明攻击面已经缩小。

研究人员应记录每则广告首次出现的时间、被举报的时间,以及 Meta 移除它的时间。这条时间线可以区分主动执法与被动清理。

第三个信号是监管机构如何回应。旧金山要求 Meta 解释其系统,而其他司法辖区的主管部门也开始了各自的审查。

监管机构可能要求审计、详细报告、保留广告主记录,或调整人工审核流程。他们还可能审查应用商店及其他中介机构所扮演的角色。

若监管结论显示 Meta 一再忽视已知模式,将削弱其安全叙事;更快行动和更完善报告的证据则会增强这一叙事。

读者也应关注 Meta 自身的透明度披露。与广告暴露、重复行为和主动检测相关的广告专项指标,会比宽泛的下架总量更具信息价值。

Meta 的 AI 广告检测如今有了明确的技术目标:即使第一步看起来正常,也要识别有害路径。更难的任务是,在用户或研究人员遇到失效情况之前证明它确实有效。

这种证明需要公司公告以外的证据。应关注重复广告主是否消失、独立调查是否发现更少的滥用投放活动,以及监管机构是否看到可衡量的改善。

对于任何评估 AI 审核的人来说,问题已不再是模型能否扫描广告,而是平台能否足够快地关联微弱信号,从而阻止一个适应性网络。关注接下来的独立审计和执法披露,再将其与 Meta 的说法进行比较。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page