top of page

La detección de anuncios con IA de Meta apunta a enlaces ocultos de abuso, pero persiste la brecha de confianza

hace 18 horas
15 min de lectura

Meta ha ampliado la detección de anuncios con IA de Meta después de que investigadores descubrieran anuncios pagados que ocultaban enlaces a material de abuso sexual infantil tras creatividades aparentemente normales.

El despliegue del 7 de octubre apunta a una difícil brecha de moderación. Un anuncio puede parecer inofensivo y, aun así, dirigir a los usuarios hacia material ilegal, aplicaciones dañinas o actividades abusivas en otros lugares de internet. Meta afirma que sus nuevos sistemas analizan esas señales ocultas antes de que los anunciantes puedan ampliarlas.

Este cambio importa porque las salvaguardas anteriores no lograron detener campañas reiteradas en Facebook, Instagram, Messenger, Threads y la red publicitaria más amplia de Meta. Los investigadores siguieron encontrando anuncios abusivos después de que Meta dijera que había introducido una detección mejorada. El conflicto central ahora está claro: Meta añade más automatización, mientras los adversarios siguen aprendiendo a eludirla.

El nuevo sistema de Meta mira más allá del anuncio

El cambio más importante es que el proceso de revisión de Meta ahora examina adónde lleva un anuncio, no solo lo que aparece dentro de él.

Meta describió cinco incorporaciones en su anuncio del 7 de octubre. En conjunto, abarcan lenguaje, destinos, contenido histórico, pruebas defensivas y reincidentes. La empresa las presenta como una respuesta coordinada a lo que denomina un esquema publicitario adversarial.

La primera incorporación es un modelo de lenguaje de gran tamaño dedicado a detectar el “signposting”. Meta utiliza ese término para referirse a contenido aparentemente inofensivo que dirige de forma encubierta a los usuarios hacia material de explotación sexual infantil o actividad dañina relacionada.

El signposting plantea un problema de clasificación. La imagen o el texto visible podrían no infringir una política cuando se consideran por separado. Su significado solo se hace evidente tras tener en cuenta el destino, el comportamiento del anunciante y otras señales del contexto.

Ahí es donde un LLM puede ayudar. Un modelo de lenguaje de gran tamaño analiza relaciones entre palabras, símbolos, instrucciones y señales conversacionales. Puede identificar patrones que filtros de palabras clave más simples podrían pasar por alto.

El segundo cambio de Meta proporciona a sus sistemas más información sobre el destino de un anuncio. La empresa afirma que esto le permite bloquear sitios web infractores y actuar contra las cuentas responsables de enviar a los usuarios allí.

Se trata de una ampliación significativa de la superficie de revisión. Un anuncio ya no se trata como una creatividad aislada. La página de destino y la ruta entre el anuncio y esa página pasan a formar parte de la decisión de seguridad.

Meta también introdujo barridos adicionales basados en IA sobre el contenido publicitario existente. Estas búsquedas están destinadas a detectar material que los sistemas anteriores no identificaron. Las señales usadas en esos barridos se ampliarán a medida que los investigadores descubran nuevos patrones de evasión.

Una cuarta herramienta funciona como un atacante automatizado. Meta la denomina agente de IA de red teaming, es decir, un sistema de IA que sondea las defensas en busca de debilidades antes de que los delincuentes puedan explotarlas a gran escala.

Se supone que el agente imita tácticas adversariales y expone brechas en las salvaguardas de Meta. Eso transforma el red teaming de un ejercicio periódico en un proceso de pruebas potencialmente continuo.

Por último, Meta afirma que reforzó la detección de reincidencia. Estos sistemas intentan reconocer a anunciantes que regresan con cuentas nuevas después de que sus cuentas anteriores fueran eliminadas.

El paquete completo apunta a distintas etapas de una campaña abusiva. La detección examina el anuncio, el análisis de destino comprueba la ruta de salida, los barridos buscan omisiones, el red teaming busca brechas y los controles de reincidencia apuntan a los operadores que regresan.

Las nuevas salvaguardas de Meta representan, por tanto, más que otro clasificador de imágenes. Intentan modelar la campaña que rodea a un anuncio.

Esta distinción es esencial. Un filtro convencional pregunta si una carga concreta infringe una norma. El enfoque más reciente de Meta pregunta si varios elementos aparentemente inofensivos forman colectivamente una ruta abusiva.

Sin embargo, Meta no ha publicado tasas de recuperación, tasas de falsos positivos ni resultados de pruebas independientes para estas herramientas. La empresa ha descrito los componentes, pero los observadores externos aún no pueden medir su eficacia.

Por qué la detección de anuncios con IA de Meta ahora sigue el destino

La detección de anuncios con IA de Meta se está desplazando hacia las etapas posteriores porque los actores maliciosos pueden ocultar su intención fuera del contenido que Meta revisa inicialmente.

Un anuncio de apariencia normal puede funcionar como el primer paso de una ruta de conversión más larga. La creatividad obtiene acceso a la audiencia de Meta, mientras que una página o aplicación externa entrega el material dañino.

Esta separación ayuda a un anunciante a evitar reglas de moderación simples. El anuncio mostrado a los sistemas de Meta puede diferir de lo que finalmente encuentra un usuario. Las redirecciones también pueden cambiar según la ubicación, el dispositivo, el historial de la cuenta o el momento.

La técnica se parece al cloaking, que muestra contenido distinto a los revisores y a los objetivos previstos. Meta ya utiliza IA para investigar el cloaking en la publicidad de estafas. Las campañas de explotación infantil plantean una versión más urgente del mismo problema técnico.

Un sistema consciente del destino puede seguir redirecciones, clasificar páginas de destino y compararlas con la promesa hecha en un anuncio. También puede buscar dominios repetidos, identificadores de aplicaciones, relaciones de pago o grupos de cuentas.

Sin embargo, el análisis de destinos tiene límites. Los operadores pueden rotar dominios, retrasar el comportamiento dañino o colocar una página aparentemente conforme antes del destino final. Las aplicaciones móviles también pueden cambiar su comportamiento después de superar la revisión de la tienda.

Meta afirma que bloquea sitios web externos que alojan o crean material prohibido. Una vez bloqueado un enlace, la empresa busca anuncios, publicaciones y comentarios que contengan esa dirección.

La empresa también afirma que los anuncios que contienen un enlace bloqueado deberían rechazarse durante la carga. Esto crea un mecanismo de contención útil una vez que se ha identificado un dominio.

El problema más difícil implica destinos desconocidos. Un sistema debe decidir si un enlace desconocido es peligroso antes de que los usuarios lo encuentren. Eso requiere inferencia contextual, análisis de comportamiento o ambos.

El modelo especializado de Meta parece diseñado para cubrir esta brecha. Puede examinar señales de signposting que, por sí solas, no se califican como contenido prohibido. El análisis de destino puede entonces comprobar si esas señales se corresponden con una ruta dañina.

Meta utiliza PhotoDNA y tecnología de coincidencia relacionada en sus aplicaciones desde 2011. La coincidencia de hashes compara medios cargados con huellas digitales de material de abuso conocido.

Este enfoque sigue siendo valioso para archivos conocidos y copias casi idénticas. Funciona de manera menos directa cuando un anuncio es visualmente inofensivo, se genera recientemente, muestra brevemente contenido abusivo o dirige a los usuarios a otro lugar.

Por lo tanto, las nuevas herramientas complementan la coincidencia de hashes en lugar de reemplazarla. Se centran en la intención, las rutas y el comportamiento coordinado, en vez de limitarse a cotejar medios conocidos.

Meta también comparte determinadas señales infractoras a través del programa Lantern de la Tech Coalition. Las empresas participantes pueden utilizar esas señales para detectar cuentas y comportamientos abusivos en distintos servicios.

La cooperación entre plataformas importa porque los infractores rara vez dependen de una sola empresa. Un anuncio puede comenzar en Meta, llevar a una tienda de aplicaciones y terminar en un sitio web o servicio de mensajería operado de forma privada.

Meta expuso este enfoque más amplio en su anterior trabajo sobre seguridad infantil. Las herramientas de octubre añaden una capa adversarial más explícita a esa estrategia.

El cambio ejerce presión más allá de Meta. Apple y Google operan las tiendas de aplicaciones que alojaron algunos productos promocionados mediante los anuncios investigados. Los proveedores de dominios, los servicios de pago y otras plataformas también pueden aparecer en la cadena de distribución.

Ningún sistema único de moderación puede controlar toda esa cadena. Meta puede negar a los anunciantes el acceso a su audiencia, pero eliminar el servicio subyacente requiere la actuación de otros intermediarios.

Esto hace que el análisis de destino sea a la vez necesario e incompleto. Puede reducir el papel de Meta como canal de adquisición, pero no puede eliminar productos dañinos de internet en general.

El despliegue sigue a cientos de fallos reportados

El anuncio de Meta responde a fallos de moderación documentados, no es una medida de precaución introducida antes de que surgiera el problema.

El Tech Transparency Project, o TTP, investigó anuncios aparecidos en los servicios de Meta. Sus investigadores informaron haber encontrado más de 350 anuncios de vídeo abusivos desde finales de 2025.

Según los informes, más de 250 anuncios adicionales se difundieron después de que el primer grupo atrajera atención pública en agosto de 2026. Algunos repetían material que Meta ya había eliminado.

Los anuncios aparecieron en Facebook, Instagram, Messenger, Threads y la red publicitaria de Meta. Los investigadores afirmaron que muchos promocionaban aplicaciones de imágenes o vídeos con IA capaces de producir imágenes íntimas no consentidas.

Algunos anuncios supuestamente comenzaban con fotografías normales de menores. Después, vídeos cortos transformaban esas imágenes en escenas sexuales explícitas.

Los investigadores identificaron las fuentes reales de imágenes en las que aparecían cuatro menores. Incluían fotos públicas de redes sociales, imágenes de stock y una fotografía oficial de un miembro de una familia real europea.

Esta distinción es importante. La producción sintética no significa que el daño esté desvinculado de personas reales. Los sistemas generativos pueden transformar la fotografía cotidiana de un niño real en imágenes delictivas.

Según la investigación de septiembre, los anuncios llegaron a más de 29.000 cuentas en la Unión Europea. Llegaron a unas 7.000 cuentas en el Reino Unido.

Los datos publicitarios disponibles no proporcionaron totales comparables de impresiones para todos los mercados. Los investigadores identificaron más de 250 anuncios aparecidos en Estados Unidos, 120 en Australia y 80 en India.

Meta afirmó que la mayoría de los anuncios recibieron menos de 200 impresiones. También indicó que recaudó menos de 5.000 dólares del grupo identificado por los investigadores.

Estas cifras no resuelven la cuestión subyacente de seguridad. El asunto es si la distribución pagada concedió al contenido dañino una vía a través de un sistema que revisa los anuncios antes de su publicación.

Las normas publicitarias de Meta prohíben la explotación sexual infantil, el abuso y la desnudez. La empresa también prohíbe servicios diseñados para crear imágenes íntimas no consentidas.

Que un anuncio pagado supere la revisión genera un problema de rendición de cuentas más grave que el de una publicación ordinaria que evade la moderación. La publicidad es un producto comercial controlado, y Meta acepta dinero para distribuirla.

Los investigadores de TTP afirmaron que algunos anuncios reportados permanecieron visibles durante hasta una semana. Durante ese período, los anuncios acumularon visualizaciones adicionales.

Meta cuestionó cualquier sugerencia de que tolera este material. Un portavoz de la empresa afirmó que Meta trabaja agresivamente contra la explotación infantil y que ya había eliminado muchos anuncios identificados.

La empresa también afirmó que algunos vídeos eran difíciles de clasificar porque las imágenes de menores aparecían brevemente o estaban difuminadas. Esa explicación revela una debilidad que los adversarios pueden explotar intencionadamente.

En septiembre, el fiscal municipal de San Francisco, David Chiu, envió a Meta una carta de cese y desistimiento. La oficina exigió información sobre los fallos de revisión, los anunciantes reincidentes, los procedimientos de escalamiento y los informes a las autoridades de seguridad infantil.

La impugnación de la ciudad se centró en la brecha entre las políticas de Meta y la entrega reiterada de anuncios prohibidos. Meta cuestionó si la oficina tenía jurisdicción porque los datos disponibles no mostraban que esos anuncios hubieran llegado a San Francisco.

Otras autoridades también comenzaron a examinar el asunto. Funcionarios de Michigan y Florida indicaron que estaban investigando los anuncios denunciados, mientras que el regulador eSafety de Australia solicitó información a Meta.

India se convirtió en otro importante foco de presión. La autoridad de derechos de la infancia del país citó a ejecutivos de Meta India en septiembre tras acusaciones relacionadas con material de explotación infantil en las plataformas de la empresa.

Meta afirma que tomó medidas contra 5,3 millones de piezas de contenido de explotación sexual infantil en Facebook e Instagram en India durante la primera mitad de 2026. La empresa afirma que más del 98 por ciento fue identificado de forma proactiva.

Estas cifras reflejan un enorme volumen de aplicación de medidas. No revelan con qué eficacia el sistema publicitario detecta enlaces encubiertos, infractores reincidentes o contenido multimedia recién generado.

Esa es la brecha de confianza que rodea al lanzamiento. Meta puede documentar millones de eliminaciones, mientras los investigadores aún pueden descubrir fallos persistentes en una superficie sometida a revisión comercial.

La moderación con IA se enfrenta a un adversario que no deja de cambiar

La principal disyuntiva es la velocidad frente a la certeza: Meta necesita aplicar medidas automatizadas a gran escala, pero cada decisión automatizada crea nuevos errores y oportunidades de evasión.

Meta revisa un flujo inmenso de contenido y publicidad. La revisión humana por sí sola no puede inspeccionar en tiempo real cada creativo, redirección, página de destino, conexión entre cuentas y señal de comportamiento.

Por ello, la automatización es inevitable. Los modelos pueden analizar más material, conectar señales distantes y reaccionar más rápido que un equipo de investigación manual.

Sin embargo, la escala no garantiza precisión. Un detector optimizado para eliminaciones agresivas puede bloquear cuentas legítimas. Un detector ajustado para reducir falsas alarmas puede dejar pasar más material dañino.

La aplicación de medidas de seguridad infantil eleva ambos costes. Un falso negativo puede exponer a usuarios a material ilegal y prolongar el daño a las víctimas. Un falso positivo puede penalizar injustamente a un anunciante o usuario.

Meta no ha revelado los umbrales de decisión detrás de sus nuevos modelos. Tampoco ha explicado con qué frecuencia un revisor humano verifica los casos de mayor riesgo.

La evidencia independiente sigue siendo especialmente importante porque Meta controla el sistema de revisión, los datos de aplicación de medidas y la biblioteca de anuncios. Los investigadores pueden observar fallos que permanecen visibles, pero no pueden contar cada bloqueo exitoso.

El agente de red teaming de Meta es una respuesta interesante a esta asimetría. Puede generar o probar variaciones más rápido de lo que un equipo humano puede crearlas manualmente.

El agente podría sondear redacciones modificadas, imágenes borrosas, secuencias de redirección y nuevos patrones de cuentas. Después podría revelar combinaciones que superan una salvaguarda pero fallan ante otra.

Sin embargo, un equipo rojo interno sigue operando dentro de los supuestos elegidos por Meta. Puede pasar por alto tácticas que sus diseñadores no anticiparon o patrones de datos ausentes de su entorno de pruebas.

Los operadores criminales también reciben información de retorno. Si un anuncio es aceptado, rechazado o eliminado, aprenden algo sobre los controles de la plataforma. Luego pueden modificar el contenido y volver a intentarlo.

La detección de reincidencia aborda este ciclo conectando nuevas cuentas con operadores previamente vetados. Las señales podrían incluir infraestructura, relaciones de pago, comportamiento administrativo o patrones creativos recurrentes.

Meta no ha detallado qué señales utiliza. Esa omisión es comprensible porque una divulgación completa podría ayudar a los atacantes. También dificulta la evaluación independiente.

El aumento más amplio del material de explotación generado por IA añade urgencia. NCMEC afirma que clasificó más de 158.000 imágenes y vídeos enviados como generados por IA entre enero de 2023 y diciembre de 2025.

NCMEC también registró un aumento drástico de denuncias relacionadas con la IA generativa. Su guía sobre IA generativa advierte que las imágenes sintéticas aún pueden explotar a menores identificables y respaldar otras conductas abusivas.

El creciente volumen de denuncias puede tensionar tanto a los investigadores como a las plataformas. Una mejor detección genera más denuncias, pero estas deben contener suficiente información para que las autoridades puedan actuar.

La calidad importa junto con la cantidad. Un sistema que inunda a los investigadores con material mal categorizado puede consumir recursos sin mejorar la identificación de víctimas.

Meta afirma que denuncia ante NCMEC el aparente material de explotación infantil cuando así lo exige la ley. También anunció la denuncia directa de casos indios de seguridad infantil ante el National Cyber Crime Reporting Portal del país.

Esa conexión para denunciar es importante, pero la eliminación y la denuncia cumplen propósitos distintos. Eliminar un anuncio limita su distribución. Una denuncia detallada puede ayudar a los investigadores a identificar víctimas, anunciantes o redes conectadas.

Por tanto, la detección de anuncios con IA de Meta debe respaldar varios resultados. Debe rechazar anuncios dañinos, desactivar cuentas coordinadas, conservar pruebas útiles, bloquear destinos y canalizar denuncias creíbles hacia las autoridades.

Un modelo que realiza bien una tarea aún puede fallar en el sistema más amplio. Bloquear un solo creativo sirve de poco si el mismo operador regresa inmediatamente con otra cuenta y dominio.

La prueba central es la persistencia. Meta debe demostrar que sus sistemas reducen redes abusivas completas, no solo los anuncios individuales que los investigadores ya identificaron.

Las afirmaciones de seguridad de Meta se enfrentan ahora a una prueba medible

Los nuevos controles solo importarán si reducen las campañas repetidas antes de que investigadores externos las descubran.

Meta ha presentado una defensa por capas. Combina análisis de contenido, inspección de destinos, revisiones retrospectivas, pruebas adversariales, bloqueo de enlaces y detección de reincidentes.

Ese diseño coincide con la estructura de la amenaza. La publicidad dañina rara vez es solo una imagen. Involucra a un anunciante, activos creativos, reglas de entrega, enlaces, aplicaciones, dominios y cuentas de sustitución.

La empresa también tiene acceso a señales no disponibles para investigadores externos. Puede inspeccionar historiales de cuentas, instrumentos de pago, conexiones administrativas, información de dispositivos y eventos previos de aplicación de medidas.

Esta ventaja debería permitir a Meta pasar de eliminaciones reactivas a la interrupción a nivel de red. La empresa afirma que antiguos investigadores del FBI ya realizan investigaciones manuales sobre redes de cuentas depredadoras.

La preocupación está en la ejecución. Los investigadores identificaron repetidamente anuncios después de que se anunciaran salvaguardas anteriores. Algunas campañas reutilizaron imágenes o continuaron a través de productos y cuentas relacionadas.

Ese historial convierte el lanzamiento de octubre en una afirmación comprobable. Meta debería poder demostrar menos cargas exitosas, periodos de exposición más cortos y tasas de retorno más bajas entre los anunciantes eliminados.

La transparencia pública determinará si terceros pueden evaluar esa afirmación. Meta publica actualmente estadísticas de aplicación de medidas, pero los totales amplios de contenido no responden a preguntas sobre fallos publicitarios.

Un informe útil separaría los anuncios bloqueados antes de publicarse de los eliminados tras su difusión. También mostraría el tiempo medio de exposición y el porcentaje de anunciantes que intentaron regresar.

La aplicación de medidas sobre destinos merece sus propios informes. Meta podría revelar cuántos dominios o aplicaciones fueron bloqueados, con qué frecuencia cambiaron las redirecciones y cuántas cuentas asociadas fueron desactivadas.

La empresa también debería distinguir entre la coincidencia de material conocido y la detección contextual. Esa separación mostraría si el LLM y las herramientas de destino están detectando amenazas realmente distintas.

Los falsos positivos también requieren atención. Un sistema fiable necesita un proceso de apelación para anunciantes bloqueados incorrectamente y una revisión humana significativa para decisiones de gran impacto.

Meta no debería publicar detalles técnicos que permitan la evasión. Aun así, puede divulgar datos agregados de rendimiento, resultados de auditorías independientes y definiciones claras para cada categoría de aplicación de medidas.

El acuerdo de denuncia directa de la empresa en India ofrece otra área medible. Las autoridades pueden evaluar si las denuncias llegan más rápido, incluyen mejores pruebas y generan investigaciones más accionables.

El escrutinio externo continuará independientemente de las divulgaciones de Meta. Periodistas, investigadores de la sociedad civil, reguladores e investigadores de tiendas de aplicaciones pueden rastrear si siguen disponibles anuncios similares.

El informe original de octubre presentó las herramientas como respuesta a anuncios que ocultan destinos dañinos. Ese enfoque sitúa la carga en los resultados, no en las descripciones de los modelos.

Meta no necesita demostrar que ningún anuncio dañino superará jamás la revisión. Ningún sistema de moderación puede garantizar de forma creíble una prevención perfecta frente a adversarios adaptativos.

Sí necesita demostrar que las tácticas conocidas dejan de funcionar de forma fiable. Los anuncios repetidos que utilizan contenido conocido, cuentas conectadas o destinos previamente identificados deberían volverse cada vez más raros.

Hasta que aparezcan esos resultados, el lanzamiento sigue siendo una arquitectura defensiva prometedora vinculada a un historial sin resolver de fallos en la aplicación de medidas.

Tres señales mostrarán si las herramientas funcionan

La siguiente evidencia debería provenir de las tasas de reincidencia, los hallazgos independientes y las respuestas regulatorias, en ese orden.

La primera señal es si los anunciantes eliminados anteriormente y los operadores relacionados regresan. Los controles reforzados de reincidencia de Meta deberían reducir las campañas repetidas vinculadas a infraestructura o comportamientos comunes.

Una disminución visible respaldaría la afirmación de Meta de que está interrumpiendo redes en lugar de eliminar anuncios aislados. La repetición continuada debilitaría el argumento a favor del nuevo sistema.

La segunda señal es lo que encuentren los investigadores independientes durante los próximos meses. TTP y otros investigadores pueden comprobar si los anuncios prohibidos siguen apareciendo tras el lanzamiento de octubre.

Los descubrimientos más reveladores involucrarían tácticas conocidas. Entre ellas se incluyen creativos de apariencia inocua, breves fotogramas abusivos, redirecciones, dominios rotativos y aplicaciones que reaparecen con una nueva marca.

Una tasa de descubrimiento menor no demostraría una prevención completa. Aun así, proporcionaría evidencia útil de que la superficie de ataque se ha reducido.

Los investigadores deberían documentar cuándo apareció por primera vez cada anuncio, cuándo se denunció y cuándo Meta lo eliminó. Esa cronología puede distinguir la aplicación proactiva de medidas de la limpieza reactiva.

La tercera señal es cómo responden los reguladores. San Francisco solicitó una explicación de los sistemas de Meta, mientras que autoridades de otras jurisdicciones iniciaron sus propias revisiones.

Los reguladores podrían exigir auditorías, informes detallados, preservación de registros de anunciantes o cambios en la revisión humana. También podrían examinar las funciones de las tiendas de aplicaciones y otros intermediarios.

Una conclusión regulatoria de que Meta ignoró repetidamente patrones conocidos socavaría su narrativa de seguridad. La evidencia de acciones más rápidas y mejores denuncias la reforzaría.

Los lectores también deberían vigilar las propias divulgaciones de transparencia de Meta. Los totales amplios de eliminaciones serán menos informativos que las métricas específicas de publicidad vinculadas a exposición, comportamiento repetido y detección proactiva.

La detección de anuncios con IA de Meta tiene ahora un objetivo técnico definido: identificar la ruta dañina incluso cuando el primer paso parece normal. La tarea más difícil es demostrar que funciona antes de que los usuarios o investigadores encuentren el fallo.

Esa demostración requerirá evidencia más allá de un anuncio de la empresa. Observe si desaparecen los anunciantes reincidentes, si las investigaciones independientes encuentran menos campañas abusivas y si los reguladores detectan una mejora medible.

Para quien evalúe la moderación con IA, la pregunta ya no es si los modelos pueden analizar anuncios. Es si una plataforma puede conectar señales débiles con la rapidez suficiente para detener una red adaptativa. Siga las próximas auditorías independientes y divulgaciones sobre aplicación de medidas, y compárelas con las afirmaciones de Meta.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page