Meta 的广告系统批准 AI 生成的儿童虐待图像后登上 Hacker News
- Ethan Carter

- 3天前
- 讀畢需時 16 分鐘
根据 WIRED 审阅的证据,Meta 批准了 50 多条含有涉嫌由 AI 生成的儿童性虐待图像的广告。该报道很快登上 Hacker News,读者聚焦于一个令人不安的矛盾:Meta 曾公开承诺加强防范同类技术驱动的虐待行为,但据报道,其广告系统却允许这些内容在多个主要平台上传播。
Tech Transparency Project(TTP)的研究人员在 Meta 的公开广告库中发现了这些广告。据称,其中一些将用户引向“nudify”服务,这类服务利用 AI 从普通照片生成未经同意的性化图像。另一些广告则被指将未成年人图像与带有性暗示的文字并置。
这一据称的失误,比有害内容混入普通社交信息流更为严重。广告主将这些广告提交给一个会在分发前进行审核的商业系统。随后,Meta 在 Facebook、Instagram、Messenger 或 Threads 上展示获批广告活动,同时收取广告收入。
Meta 的公开回应强调,公司已移除被识别出的广告、禁用相关账户,并正在调查是否发生了执行失误。这些措施处理了眼前的广告活动,却无法解释为何多名广告主据称能在九个月内通过审核,其中一些还使用了密切相关的创意素材。
这一缺口构成了核心矛盾。Meta 表示,公司已针对 nudify 服务开发专门的检测系统、广告主控制措施以及跨公司情报共享机制。被报道的广告表明,意图明确的广告主仍能反复找到绕过这些控制措施的路径。
因此,这一事件检验的不只是一次审核决定,而是 Meta 的广告安全系统能否在付费分发将虐待内容变成商品之前识别并阻止它。
超过 50 条广告通过了 Meta 的商业系统
关键变化在于,涉嫌含有虐待图像的内容出现在付费广告活动中,而不只是用户上传的帖子里。
根据原始调查报道,TTP 研究人员在 Meta 广告库中识别出 50 多条违规图片和视频广告。据报道,这些广告活动持续了九个月,部分广告在报道发布当周仍处于活跃状态。
广告库显示,这些广告投放于 Facebook、Instagram、Messenger 或 Threads。报道称,单个广告活动有时触达数千个账户,其地理定向覆盖美国、英国以及十多个欧洲国家。
这项报道并未证明每张图像都包含真实儿童的照片。部分素材据称由生成式 AI 创建或修改。这一区别对取证分类很重要,但并不能消除潜在伤害。
AI 生成的儿童性虐待材料,通常缩写为 AI CSAM,既可能包括完全合成的图像,也可能包括基于真人制作的篡改图像。nudify 服务可以在未经当事人同意的情况下,将普通照片转换为性化图像。
一些被识别出的广告据称正是在推广这类服务。TTP 还报告了这样的案例:广告先用儿童图像吸引注意,随后呈现性材料或将观看者引导至其他页面。
原报道避免复现这些素材,本文分析也同样如此。相关事实在于其系统路径:广告主创建广告活动、提交审核、通过审核并获得分发。
付费投放改变了责任评估。平台若在发布前审查每一条自然上传内容,可能造成严重的隐私、言论和运营问题;而广告本身已通过独立的审批和付费流程运作。
Meta 告知广告主,广告会依据其标准接受审核。平台还会收集账户详情、创意文件、目标链接、定向选择和计费信息。这些信号提供的检测机会多于一条孤立的公开帖子。
因此,被报道的广告活动暴露出多个层面的控制失效。图像审核显然遗漏了部分内容;文本分析未能始终拦截随附文字;目标页面筛查据称也允许了与脱衣服务相关的链接。
账户和网络执法同样未能阻止重复出现。据报道,即使相关广告活动已受到审查,相似或相同的广告仍然可以被发现。
这正是该报道引发 Hacker News 共鸣的原因。核心问题并非自动审核会不会犯一次错误——任何大型审核系统都会产生错误。
更棘手的问题是,Meta 是否识别出一种反复出现的商业模式,并阻止其再次出现。即使研究人员没有捕获所有广告活动,已识别的 50 多条广告也表明存在更广泛的执法问题。
Meta 在 WIRED 联系公司后移除了这些素材。这一回应限制了进一步传播。然而,被动移除并不等同于阻止广告主为违规内容购买触达量。
Meta 自己的安全承诺提高了事件的严重性
Meta 此前已将 nudify 广告视为一种对抗性威胁,并公开介绍过旨在阻止它的工具。
2025 年 6 月,Meta 对一家据称在多次执法后仍持续推广 nudify 应用的公司采取法律行动。其nudify 执法计划描述了广告主如何利用无害图像、新域名及其他手段规避检测。
Meta 表示,公司已开发出可识别这类广告活动的技术,即便广告本身不含裸体内容。公司还扩展了作为执法信号使用的术语、短语和表情符号。
匹配系统本应更快识别仿冒广告。专业调查人员则将针对协调式虚假行为开发的方法用于运营这些广告活动的网络。Meta 表示,这些调查在 2025 年上半年瓦解了四个广告主网络。
该公司还开始通过 Tech Coalition 的 Lantern 项目,与其他科技企业共享目标 URL。Meta 报告称,自该计划启动以来已提供超过 3,800 个独特 URL。
这些细节使得最新指控难以被视为一种全新的威胁。Meta 已经了解其商业模式、广告主激励、规避技术以及潜在受害者。
公司知道,一些广告主会使用看似无害的创意素材来避开裸体检测;也知道被封禁的运营者能够迅速轮换域名;还知道单条广告应被视为网络的一部分,而不是孤立的提交内容。
Meta 还加入了旨在防止生成式 AI 助长儿童剥削的行业原则。其AI 安全原则涵盖训练数据、模型安全措施、滥用报告,以及有关儿童安全保护的透明度。
被报道的广告造成了承诺与执行之间的冲突。Meta 可以指向政策、诉讼、检测研究和情报共享;TTP 则可以指向据称仍保留在公司自身广告档案中的广告活动。
这一冲突令 Meta 的广告完整性团队面临压力。他们必须证明,在广告获得分发前,执法系统能够关联视觉、文本、账户、支付和目标页面信号。
Meta 的 AI 透明度计划又增加了一层因素。公司开始为主要由其内部生成式工具创建或编辑的广告添加标签。到 2026 年,公司将检测范围扩展至使用第三方 AI 产品制作的广告。
根据 Meta 的AI 广告标签,被检测到的内容可在统一的广告信息面板中获得“AI info”披露。这类标签有助于人们了解广告的来源。
然而,标签不能替代安全执法。对于无害的合成背景或虚拟模特,披露可能是恰当的;涉及儿童的违规性化内容则需要拒绝和调查,而不是补充背景说明。
两者的区别是根本性的。透明度回答的是广告如何制作;审核决定的是平台是否应当分发它。
Meta 曾将标签描述为更广泛防护机制中的一个组成部分。这些被指控的广告活动检验了:当外部广告主将生成图像、暗示性文字、规避性网站和轮换账户结合使用时,这些防护措施是否有效。
因此,所需的回应不应止于移除已识别的广告。Meta 需要说明是哪一层执法机制失效、存在多少相关广告活动,以及广告主是否为成功展示支付了费用。
公司还必须确定其系统是否为调查人员保留了证据。账户身份、计费工具、目标域名和广告活动之间的关系,都可能有助于识别协调运营者。
如果没有这样的说明,公众无法区分这是一次可控的审核错误,还是 Meta 广告业务中持续存在的弱点。
Hacker News 的讨论聚焦于批准,而非生成
Hacker News 的讨论聚焦于一个直接的矛盾:Meta 审核并从其自身规则禁止的内容中获利。
根据提供的文章摘要,该提交获得了 219 分和 183 条评论。读者讨论了自动审核、企业激励、法律责任,以及大规模检测对抗性图像的难度。
社区评论并非经过验证的证据。它们有助于识别哪些技术和治理问题受到知情读者关注,但不应替代新闻报道或官方记录。
一个反复出现的担忧涉及托管与批准之间的差异。有害的用户内容可以通过数十亿次不可预测的行为到达平台;广告则通过一个为商业利益而运行的结构化流程进入平台。
这一流程让 Meta 在分发前就掌握信息。公司会收到创意素材、广告活动元数据、目标地址、受众设置、广告主历史记录和支付方式。
每项信号单独来看都不完美,但结合起来可以实现分层风险评分。
视觉分类器可以标记图中人物的表观年龄,或合成篡改的迹象。文本模型可以识别涉及未成年人的性化表述。域名情报则可以将落地页与已知的 nudify 服务关联起来。
行为分析可以检测快速创建账户、重复使用的计费工具、重复的创意文件和域名轮换。匹配技术可以识别此前违反政策的素材经过修改后的副本。
当相似广告反复通过审核时,相关指控就变得更为严重。单次漏判可能反映模型阈值上的不确定性;来自关联实体的相关广告则表明,执法系统未能有效积累并运用已有知识。
Meta 表示,恶意广告主会主动测试其防御机制。这一说法可信。犯罪和剥削性运营者经常更换图片、文字、账户和域名,以寻找审核系统中的漏洞。
对抗性行为并不能免除平台责任。它界定了广告系统必须能够承受的环境条件。
银行不能因为犯罪分子会适应变化,就将反复发生的欺诈视为不可预见。电子邮件服务商也不能因为发件人更换域名,就忽视不断演变的钓鱼攻击。当商业化分发创造了可预见的滥用机会时,广告平台同样面临这样的期待。
一些评论者质疑,生成式 AI 本身是否才是主要问题。这种框架过于狭窄。
AI 让滥用性图像的生成、修改和定制成本更低。但眼下的治理失效涉及的是分发环节。广告主需要借助 Meta 的覆盖范围、定向投放基础设施和商业审核系统,才能将其广告活动展示给用户。
这一区别有助于避免围绕技术是否可能做到绝对安全展开无益争论。运营层面的问题更具体:应设置哪些控制措施,防止广告主反复为已知类别的剥削性内容购买分发?
答案不会来自单一分类器。它需要纵深防御,即通过多项相互独立的检查,降低一次失效演变为成功广告活动的概率。
初始素材审核只是第一层。Meta 可以扫描落地页、跟踪重定向、检查域名历史,并在广告发布后重新评估。它还可以将广告主与此前被停用的网络进行比对。
平台也可以限制新广告主或高风险广告主,直到其建立良好的记录。当出现多个风险信号时,敏感类别可接受人工审核。
没有任何系统能够消除所有漏判。真正有意义的衡量标准是,失效是否仍然罕见、短暂且难以重复。
据报道长达九个月的窗口期则指向相反的结论。这表明,滥用性广告主可能能够发现有效组合、重复使用,并持续购买曝光。
AI 生成的滥用内容扩张速度快于现有控制措施
Meta 的广告失效发生在更广泛的转变之中:从粗糙的合成图像,转向更易获取、更逼真且具备完整动态画面的滥用性素材。
互联网观察基金会(Internet Watch Foundation,简称 IWF)在 2025 年评估认定了 8,029 张 AI 生成图像和视频属于逼真的儿童性虐待材料。其 2026 年滥用报告发现,在所评估的非法 AI 生成图像中,97% 出现了女孩。
该机构在 2025 年发现了 3,443 段 AI 生成的儿童性虐待视频。该数字高于 2024 年的 13 段,报告称增幅达 26,385%。
其中,2,233 段视频根据英国分类体系被归为 A 类。A 类涵盖最严重形式的材料,占所发现 AI 生成视频的 65%。
这些数字需要结合背景来看。IWF 表示,AI 材料在其处理的非法内容中仍只占相对较小的比例。检测方法和报告做法也会影响记录总量。
分析人员有时仅在来源或元数据表明内容由合成方式制作时,才将其归类为 AI 生成。随着生成材料变得更加逼真,实际数量可能高于记录数量。
不过,其发展方向已十分明确。生成视频在短时间内从明显不稳定的片段,发展为逼真的完整动态画面素材。工具也开始在更简单的界面中整合图像、视频和音频制作能力。
这种技术融合降低了制作滥用内容所需的专业门槛,也增加了运营者可用于测试广告过滤器的变体数量。
传统哈希匹配对已知文件效果良好。加密哈希或感知哈希能够表征一张图像,使平台无需反复将其展示给审核人员,也能识别副本。
生成式系统削弱了这一优势,因为犯罪者可以制作无穷无尽的变体。裁剪、合成、换脸、动态生成和风格变化,都可能降低精确匹配率,同时保留滥用目的。
因此,平台需要能够识别语义和上下文的模型,而不只是识别先前已归档的文件。这些模型必须跨图像、视频、文本和落地页评估年龄、性语境、篡改情况和意图。
这在技术上困难重重,也涉及法律敏感性。自动年龄估计可能并不确定。无辜的家庭照片可能包含类似风险信号的视觉元素。过度激进的拦截可能对合法用户造成有害的错误指控。
解决办法不能是不加区分地降低阈值。平台需要设置升级处理路径,将机器检测与受过训练的人工评估和专业支持相结合。
广告是实施更严格控制的一个实际切入点,因为付费分发是可选的。在不确定的风险信号得到解决前,Meta 无需立即向每一位广告主授予访问权限。
平台可以延迟投放广告,而不必对其创作者作出最终法律判断。它可以要求身份验证、检查目标服务,并要求人工批准。
这与移除个人私人账户或向执法部门举报是不同的干预措施。审核系统应保留这些区别。
该行业还面临日益增加的运营负担。合成材料会占用调查人员的时间,增加识别受害者的难度,并可能掩盖涉及真实儿童的图像。
据报道,部分生成材料使用现有虐待图像作为训练或转换输入。另一些内容则将真实儿童的面孔置入虚构场景。因此,“合成”并不意味着没有受害者。
IWF 拒绝接受 AI 生成的虐待内容天然危害较小的说法。其分析人员指出,这会造成再次受害、性暴力常态化,并加大儿童保护系统的压力。
Meta 的广告控制措施必须考虑到这一不断变化的供给环境。围绕已知图像和明显裸露内容设计的规则,将无法拦截由修改媒体、暗语和表面干净的落地页构成的广告活动。
相关的军备竞赛并非 Meta 与某一款应用之间的较量,而是安全基础设施与不断扩大的自动化性剥削商业市场之间的较量。
发现后移除并不能衡量预防效果
Meta 的立即下架很重要,但尚未解决的问题是:在外部研究人员介入前,该公司的系统让广告主运营了多久。
据报道,Meta 移除了 WIRED 发现的广告,并停用了相关账户。该公司表示正在调查这些事件,并坚持认为这些广告活动违反了其政策。
这一回应并未就这些材料是否应出现在 Meta 服务上产生分歧。争议在于系统表现和问责机制。
外部研究人员通过 Meta 的广告资料库发现了这些广告,该资料库保留广告活动的信息。它很有价值,因为它让记者和监督机构获得普通用户所没有的可见性。
然而,资料库并不是完整的问责机制。研究人员可能无法看到每一则定向广告、已停止的广告活动或执法决定。可获得的覆盖范围估算也可能较为宽泛。
Meta 掌握着丰富得多的内部数据。它知道广告何时提交、如何分类、自动系统是否提出疑虑,以及是否有人工审核员进行检查。
该公司可以确定每项广告活动获得了多少展示量、广告主花费了多少。它可以追踪账户、管理员、支付工具、IP 模式、域名以及此前的执法记录。
一项可信的审查应披露这些记录中的汇总发现,并说明已识别广告之间是否存在共同弱点。
Meta 还应澄清是否有任何广告活动获得 AI 标签。如果其系统检测到合成制作却漏掉了被禁止的内容,这将暴露出透明度分类器与安全分类器之间的脱节。
如果两个系统都未检测到这些图像,问题可能出在媒体分析或缺少来源信号。如果模型提出了疑虑但仍批准广告,则应审查审核阈值和升级程序。
落地页行为带来了另一项不确定性。一些恶意广告主向审核人员展示无害页面,随后将普通用户重定向至被禁止的服务。这种被称为“伪装”(cloaking)的技术,会根据访问者身份提供不同体验。
Meta 表示,广告主会使用规避性域名和看似无害的创意素材。有效调查应检验,伪装或快速更换目标地址是否促成了这些广告活动。
公司还需要检查重复内容的处理方式。据报道,TTP 在这些广告中发现了完全相同或密切相关的材料。如果 Meta 认定某项广告活动违反政策,匹配系统理应拦截后续副本。
反复获批可能意味着移除决定未产生持久的执法信号,也可能说明细微改动就能绕过匹配。
仅凭公开证据无法确认任何一种可能。Meta 的内部审查至关重要,但由一家公司调查自己的收入系统,显然存在问责局限。
监管机构和独立审计人员可能会要求查阅基础广告活动记录。他们的访问将有助于确定 Meta 的公开说明是否与技术证据一致。
法律问题同样复杂。即使不存在真实未成年人,美国法律也可能涵盖淫秽的计算机生成描绘。具体处理取决于图像、司法管辖区、意图和适用法规。
执法部门已处理过涉及 AI 生成性虐待图像的案件。一篇 Associated Press 分析介绍了联邦起诉案例,以及受保护的虚拟表达与淫秽描绘之间的法律区别。
本文无法判定特定广告主是否实施了具体犯罪行为。它可以指出,平台为何应保存记录,并在法律要求时作出适当报告。
持怀疑态度的观点认为,一些预防要求可能超出现有技术能力。合成内容可能模糊不清,对手适应迅速,而更严格的审核可能会拦截无辜广告。
这些限制确实存在。但它们无法完全解释,为何数十项涉嫌滥用的广告活动会在数月内出现在多个服务中。
公平的检验标准不是完美,而是 Meta 是否学习得足够快,让一项被发现的广告活动使下一次相关尝试更难成功。
三个信号将显示 Meta 是否修复了这一失效
下一项检验是:在研究人员发现另一批类似广告前,Meta 是否能带来可衡量的执法变化。
第一个信号是详细的执法核算。Meta 应报告,在审查 TTP 的发现后,它识别出多少相关广告、账户、域名和广告主网络。
该核算应包括汇总覆盖范围和广告活动持续时间。它还应区分在分发前被拦截的广告,以及仅在发布后才被移除的广告。
如果 Meta 通过自身记录识别出更大的网络,这将表明调查人员能够重建该运营活动,也将证实最初的发现只是更广泛模式的一部分。
如果公司只就违反政策发表笼统声明,不确定性仍将存在。缺乏可衡量的调查结果,用户便无法判断执法范围是否超出了记者提供的案例。
第二个信号是对重复内容和落地页筛查的技术升级。Meta 已表示,其使用匹配技术,并与其他平台共享违规 URL。
下一次更新应说明,这些系统如何处理经过编辑的创意素材文件、重定向落地页、新域名,以及关联的广告主账户。敏感的实现细节可以不公开,但 Meta 仍应披露成效结果。
有参考价值的指标包括:在发布前被拦截的违规“去衣化”广告占比、关闭关联广告活动所需时间,以及移除某一广告主网络后的复发率。
重复获批情况若有所下降,将增强 Meta 关于该事件已带来持久修复的说法。若出现使用相似图像或落地页的另一组广告,则会削弱这一说法。
第三个信号是外部审查。监管机构、儿童安全组织和独立审计机构可能会寻求有关 Meta 审核流程及报告义务的证据。
正式调查将检验该公司是否保留了广告活动记录,以及是否恰当地升级处理了可能违法的内容。独立访问也可能揭示内部摘要所遗漏的漏洞。
更广泛的科技行业应密切关注这些信号。广告平台、应用商店、托管服务商、支付公司和模型开发者,都处在同一条商业链条上。
一项“去衣”服务依赖的不只是图像生成软件。它还需要被发现、获客、托管、交易,以及让用户反复访问。
每个中介环节都可以提高运营者的成本。共享域名情报可以阻止其在多个平台进行推广。支付限制可以中断收入。托管执法可以缩短落地网站的存续时间。
Meta 参与 Lantern,体现了对这种网络化方法的认可。情报共享的成效取决于速度、数据质量,以及每一位接收方采取的行动。
来自 Hacker News 的读者不应将此案简单视为人工审核与自动审核之间的较量。两者都不可或缺;若没有一个将其决策连接起来的系统,两者也都可能失效。
机器提供规模、相似性分析和持续扫描。人工专家负责解读模糊情况、评估语境并调查关联行为。治理机制决定这些发现是否会影响后续审批。
最重要的指标是组织记忆。一旦 Meta 发现某种滥用性的广告主策略,这一知识就应改变分类器、审核规则、网络调查和落地页控制措施。
对开发者而言,教训关乎架构。安全不能只是产品建成后加上的最后一道过滤器。它必须影响身份控制、日志记录、升级处置、证据留存和滥用监控。
企业采购方在评估 AI 服务时也应提出类似问题。政策文件表达的是意图。可审计性则揭示服务能否识别失败、追溯原因并防止重演。
跟踪快速变化事件的知识工作者,同样需要可靠地分离信息来源。将原始报道、公司声明、独立数据和社区反应区分开来,能够避免一项指控演变为缺乏依据的确定结论。结构化的 AI knowledge base 能够在不混淆相互矛盾证据的情况下,支持这种严谨做法。
Meta 已移除报道中指出的广告活动。该公司如今面临更艰巨的任务:证明这次移除改变了此前批准这些广告的系统。
未来一至三个月应能揭示,Meta 是否会公布具体调查结果、加强对重复违规者的识别,或面临监管机构要求其提供广告记录。若再次出现独立发现,则表明被动执法依然落后于预防。
Hacker News 的关注最终会转向另一个故事。Meta 的责任不会。真正有意义的结果在于:下一位滥用型广告主是否会遇到一个记得这里发生过什么、能够关联现有预警信号,并拒绝为其提供分发渠道的系统。


