top of page

Cloudflare Disallow AI Training separa la visibilidad en búsquedas del entrenamiento de modelos

hace 1 día
16 min de lectura

Cloudflare ha lanzado Disallow AI Training, un nuevo control diseñado para preservar la indexación en buscadores mientras rechaza el entrenamiento de modelos por parte del mismo rastreador. Hasta ahora, los editores solían enfrentarse a una elección tajante al tratar con bots de uso mixto: aceptar ambos fines o bloquear por completo al rastreador.

El cambio abarca Applebot, Googlebot y Bingbot, que Cloudflare clasifica como rastreadores de uso mixto porque cada uno puede servir para búsquedas y usos relacionados con la IA. Cloudflare ahora denomina “Accountable” a estos bots cuando sus operadores proporcionan controles, informes y garantías de que excluirse del entrenamiento no reducirá la visibilidad en las búsquedas tradicionales.

Esta designación establece un modelo operativo compartido entre Cloudflare, Apple, Google y Microsoft. Sin embargo, no crea un estándar técnico vinculante. El nuevo sistema combina controles en el panel, instrucciones en robots.txt, compromisos empresariales y la aplicación de Cloudflare contra otros rastreadores de entrenamiento.

Este es el equilibrio central. Los editores obtienen una forma más sencilla de expresar su consentimiento sin desaparecer de las búsquedas, pero gran parte de la protección sigue dependiendo de que los operadores de rastreadores respeten esa decisión.

Cloudflare Disallow AI Training cambia la opción predeterminada

Cloudflare está convirtiendo una única decisión de bloqueo sobrecargada en opciones separadas para búsqueda, entrenamiento y agentes dirigidos por usuarios.

Los controles de rastreadores de IA de Cloudflare clasifican la actividad automatizada según su comportamiento, en lugar de tratar de igual manera cada solicitud relacionada con IA. Los rastreadores de búsqueda crean índices, los rastreadores de entrenamiento recopilan material para el desarrollo de modelos y los agentes recuperan páginas mientras actúan en nombre de un usuario.

Estas categorías importan porque los efectos económicos son distintos. Un motor de búsqueda normalmente muestra enlaces que pueden llevar a una persona al sitio web original. Un proceso de entrenamiento puede absorber información sin generar una visita inmediata. Un agente podría recuperar una página y entregar su contenido sin que el usuario llegue a abrirla.

Un rastreador puede pertenecer a más de una categoría. Googlebot, Applebot y Bingbot son ejemplos importantes porque sus funciones de búsqueda dificultan que los editores los bloqueen. Eliminar su acceso puede afectar con el tiempo a la indexación, la actualización y la capacidad de descubrimiento.

Los controles anteriores de Cloudflare contemplaban este problema al excluir a los rastreadores de uso mixto de algunos bloqueos de entrenamiento. Eso protegía la visibilidad en búsquedas, pero también dejaba a los editores sin una forma directa de rechazar el componente de entrenamiento mediante la misma configuración.

El nuevo modelo de control de rastreadores introduce Disallow AI Training como opción intermedia. Publica una preferencia de no entrenamiento mediante robots.txt, mantiene disponibles para la búsqueda a los rastreadores de uso mixto Accountable y bloquea otros rastreadores asociados al entrenamiento.

Cloudflare afirma que los rastreadores exclusivos de entrenamiento operados por Amazon, Anthropic, Meta y OpenAI pueden bloquearse sin afectar a sus rastreadores de búsqueda independientes. Estas empresas utilizan bots distintos para fines distintos, lo que hace que la aplicación sea más directa a nivel de red.

Cloudflare también está cambiando el significado de sus configuraciones más estrictas. “Block” y “Block on pages with ads” ahora se aplican a rastreadores de uso mixto, incluidos Googlebot, Applebot y Bingbot. Por lo tanto, seleccionar cualquiera de estas opciones puede afectar tanto a las búsquedas como al entrenamiento.

Esta distinción hace que la configuración tenga consecuencias más importantes. Disallow AI Training comunica una preferencia limitada mientras preserva el acceso para búsquedas. Block deniega el acceso al rastreador en sí, independientemente de que una solicitud concreta sirva para búsqueda o entrenamiento.

Las configuraciones existentes están migrando hacia los nuevos controles. Un dominio que anteriormente utilizaba una opción general de bloqueo de IA normalmente conservará el acceso para búsquedas mientras traslada su preferencia de entrenamiento a Disallow AI Training. Los dominios con políticas detalladas existentes también mantendrán sus selecciones prácticas.

Para los nuevos dominios financiados con publicidad, Cloudflare recomienda permitir la búsqueda, rechazar el entrenamiento y bloquear agentes en las páginas donde aparecen anuncios. Los nuevos dominios sin publicidad reciben una recomendación menos restrictiva que permite las tres categorías.

Estas configuraciones preestablecidas son recomendaciones, no reglas permanentes. Los propietarios de sitios pueden modificarlas durante la incorporación o posteriormente mediante Security Settings. Los controles están disponibles en todos los planes de Cloudflare y operan a nivel de dominio.

El resultado es un árbol de decisiones más claro. Un editor puede permitir la indexación convencional, rechazar el entrenamiento y escoger una política independiente para los agentes. Esta estructura refleja mejor cómo los sistemas automatizados interactúan actualmente con los sitios web.

También facilita diagnosticar una configuración incorrecta. Si un editor selecciona Block y posteriormente pierde el acceso de los rastreadores, la consecuencia se deriva directamente de la configuración elegida. Disallow AI Training está pensado para el objetivo más limitado de conservar la búsqueda mientras se rechaza el uso para el desarrollo de modelos.

No se trata simplemente de un interruptor de bots renombrado. Cambia la unidad de control, que deja de basarse únicamente en la identidad del rastreador para considerar la combinación de identidad, propósito declarado y comportamiento del operador.

Por qué los rastreadores de uso mixto presionan a los editores

El conflicto existe porque un rastreador que aporta valioso tráfico de búsqueda también puede recopilar material para un propósito comercial completamente diferente.

El intercambio tradicional de la web abierta era relativamente fácil de entender. Los editores permitían que los motores de búsqueda rastrearan sus páginas, y los motores de búsqueda devolvían enlaces, extractos y posibles visitantes. La publicidad, las suscripciones, las ventas y las relaciones con los lectores dependían de que algunos de esos usuarios llegaran al sitio.

La IA generativa complica ese intercambio. Un modelo puede utilizar material recopilado durante el entrenamiento, mientras que una respuesta de IA puede satisfacer una consulta antes de que el lector visite cualquier fuente citada. La búsqueda, el desarrollo de modelos y la generación de respuestas crean, por tanto, formas de valor distintas.

Las propias mediciones de Cloudflare ilustran por qué los editores están preocupados. La empresa informó que el entrenamiento representó el 80 por ciento del rastreo de IA clasificado durante un período de 12 meses. En la siguiente perspectiva de seis meses, la proporción del entrenamiento aumentó al 82 por ciento, mientras que la búsqueda representó el 15 por ciento y las acciones de usuarios el 3 por ciento.

Estas cifras describen el tráfico observado y clasificado por Cloudflare, no toda la web. Aun así, muestran que la actividad de entrenamiento puede dominar la demanda automatizada que llega a los proveedores de contenido.

Un editor que bloquea un rastreador exclusivo de entrenamiento afronta un cálculo manejable. El bloqueo puede detener la recopilación no deseada sin eliminar un importante indexador de búsqueda. Bots diferenciados como GPTBot y OAI-SearchBot facilitan separar esos propósitos.

Los rastreadores de uso mixto crean un problema más difícil. Si el mismo rastreador sirve para búsqueda y entrenamiento, un bloqueo a nivel de infraestructura no puede determinar qué ocurrirá después de que el contenido llegue a su operador. Bloquear el acceso protege el material, pero también elimina la función de búsqueda.

Permitir el acceso preserva el descubrimiento, pero exige otro mecanismo para restringir el uso posterior. Esa es la brecha que intenta cerrar la configuración Cloudflare Disallow AI Training.

Cloudflare comenzó a abordar esta brecha con Content Signals, un vocabulario propuesto incluido en robots.txt. La política de señales de contenido distingue tres usos declarados: search, ai-input y ai-train.

La señal de búsqueda abarca la indexación y los resultados de búsqueda tradicionales. No incluye resúmenes generados por IA. La señal ai-input se refiere al uso en tiempo real por sistemas de IA, incluida la recuperación y la fundamentación. La señal ai-train aborda el entrenamiento y el ajuste fino de modelos.

Por tanto, un sitio puede publicar search=yes y ai-train=no. Puede dejar ai-input sin especificar si su propietario aún no ha decidido cómo deberían utilizar el contenido las respuestas generativas.

Esta separación es importante porque la ausencia de una preferencia no debe interpretarse como permiso o rechazo. La política de Cloudflare trata una señal omitida como neutral, en lugar de suponer lo que pretendía el editor.

Sin embargo, Content Signals son expresiones de preferencia. No son barreras que impidan físicamente a un scraper descargar una página. Cloudflare ha aconsejado anteriormente a los editores combinar estas señales con controles de bots o reglas de firewall cuando se requiera aplicación técnica.

La nueva designación Accountable intenta conectar esas capas. Identifica a operadores de rastreadores que, según Cloudflare, proporcionan o se han comprometido a proporcionar controles y transparencia específicos. Los requisitos incluyen la exclusión del entrenamiento, la exclusión de resúmenes de IA, visibilidad a nivel de URL y protección para la clasificación en búsquedas tradicionales.

Apple, Google y Microsoft cumplen ese umbral mediante distintas combinaciones de funciones actuales y compromisos con plazos definidos. La designación no significa que sus implementaciones sean idénticas. Significa que Cloudflare considera que cada operador ha aceptado las mismas responsabilidades básicas.

Esto genera presión sobre otros operadores de rastreadores. Una empresa que desee un acceso amplio ahora puede compararse con una referencia publicada de consentimiento, inspección y neutralidad en búsquedas. Separar las identidades de los bots sigue siendo una forma de cumplir esa referencia, pero ya no es la única vía.

Los editores también afrontan una nueva responsabilidad operativa. La visibilidad en búsquedas, el entrenamiento de IA, la generación de respuestas y el acceso de agentes ahora requieren políticas independientes. Una única decisión de “bloquear IA” ya no resume las compensaciones comerciales.

Un sitio de noticias financiado por páginas vistas podría rechazar tanto el entrenamiento como el acceso de agentes en páginas con publicidad. Un minorista podría valorar las referencias cualificadas de IA incluso si su volumen es menor. Un sitio de documentación podría aceptar la recuperación de IA en tiempo real mientras rechaza el entrenamiento de modelos a largo plazo.

La pregunta relevante ya no es si los bots de IA son buenos o malos. Es qué uso justifica el acceso, qué valor devuelve al editor y si ese uso puede verificarse.

Apple, Google y Microsoft comparten un modelo, no una implementación única

Las tres empresas respaldan el mismo principio, pero sus controles siguen siendo técnicamente desiguales y llegan en calendarios distintos.

Apple ya permite a los editores abordar el entrenamiento mediante Applebot-Extended. Un propietario de sitio puede rechazar ese agente de usuario en robots.txt mientras sigue permitiendo las funciones de búsqueda habituales de Applebot.

La documentación de Apple indica que la preferencia Applebot-Extended no afecta a cómo aparece un sitio en los resultados de búsqueda. También admite mecanismos a nivel de página relacionados con la salida generativa, incluidos nosnippet y etiquetas para material protegido por muro de pago.

Estas herramientas aún no proporcionan todos los elementos del marco Accountable de Cloudflare. Cloudflare afirma que Apple carece de inspección a nivel de URL para este propósito. Según los informes, Apple ha compartido detalles de una solución en desarrollo prevista para el próximo año.

Los actuales controles de Applebot proporcionan, por tanto, una separación funcional entre búsqueda y entrenamiento, pero una visibilidad incompleta sobre lo que ocurrió después del acceso. Cloudflare está aceptando el compromiso de cerrar esa brecha.

Google utiliza un modelo de extensión similar. Los editores pueden bloquear Google-Extended sin bloquear Googlebot. Google-Extended es un token de control que regula determinados usos de IA generativa, en lugar de un rastreador independiente que siempre realiza sus propias solicitudes.

Este detalle importa. Googlebot aún puede recuperar el contenido para la búsqueda, mientras Google utiliza la preferencia Google-Extended para determinar si el material puede servir a sistemas de IA cubiertos. El editor controla el uso posterior mediante políticas, no mediante una identidad de red separada.

Google afirma que excluirse mediante Google-Extended no afecta la inclusión ni la clasificación en Google Search. Su guía para excluirse del entrenamiento documenta la relación entre Googlebot y Google-Extended.

Google también proporciona informes sobre el rendimiento de búsqueda y controles relacionados con las experiencias de búsqueda generadas. Cloudflare afirma que Google está trabajando en transparencia adicional a nivel de URL asociada con Google-Extended, cuyo lanzamiento se espera en las próximas semanas.

Microsoft es el menos completo de los tres bajo este mecanismo específico. Bing admite controles granulares para webmasters, y los editores pueden utilizar la metaetiqueta NOARCHIVE para limitar ciertos usos de contenido almacenado en caché o mostrado.

Microsoft afirma que NOARCHIVE no elimina una página de la clasificación de búsqueda. Los propietarios de sitios también pueden utilizar Bing Webmaster Tools para la eliminación de contenido y la gestión de URL.

Sin embargo, Bingbot todavía no respeta automáticamente la preferencia de Cloudflare de no usar contenido para entrenamiento a nivel de dominio mediante robots.txt. Cloudflare afirma que Microsoft está desarrollando esa capacidad para principios de 2027.

Hasta entonces, seleccionar Disallow AI Training no comunica automáticamente la restricción prevista a Bing mediante el nuevo flujo de trabajo. Los editores que busquen una restricción inmediata en Bing aún deberán utilizar las herramientas existentes de Microsoft y metadatos a nivel de página.

Microsoft ha descrito sus opciones de control de IA como una forma de preservar el descubrimiento en búsquedas mientras se limita cómo aparece el contenido en experiencias generativas. Sin embargo, el interruptor unificado de Cloudflare no está totalmente conectado hoy a esos controles.

Esta brecha de implementación es la salvedad más importante del lanzamiento. Cloudflare presenta Applebot, Googlebot y Bingbot bajo una única etiqueta de Accountable, pero solo Apple y Google exponen actualmente la ruta específica de agente de usuario extendido para las preferencias de entrenamiento.

La inclusión de Microsoft se apoya en parte en un compromiso anterior. Eso puede ser razonable para establecer un estándar cooperativo, pero los editores deben comprender la diferencia entre la aplicación disponible y la compatibilidad prometida.

El modelo compartido también depende de la interpretación que cada operador haga del entrenamiento. Preentrenar un nuevo modelo, ajustar un sistema existente, fundamentar una respuesta en tiempo real y generar un resumen de búsqueda son actividades distintas. Una elección de “sin entrenamiento” no rechaza necesariamente todos los usos mediados por IA.

Cloudflare trata explícitamente la entrada para IA y los resúmenes de IA como cuestiones diferentes. Eso evita que una preferencia cubra silenciosamente usos no relacionados, pero también implica que el nuevo control es más limitado de lo que podría sugerir su sencilla etiqueta en el panel.

Un editor puede rechazar el entrenamiento de modelos y seguir siendo elegible para resúmenes de búsqueda generados por IA. Otro editor puede utilizar controles de resumen específicos de cada operador mientras permite el entrenamiento. Estas decisiones pueden producir resultados distintos en tráfico y atribución.

Por tanto, el marco Accountable se entiende mejor como un contrato mínimo. Pide a los operadores separar propósitos, respetar preferencias, proporcionar inspección y evitar penalizar el rechazo al entrenamiento en la búsqueda tradicional.

No hace que Apple, Google y Microsoft sean técnicamente intercambiables. Tampoco garantiza que todas las funciones de IA ofrecidas por esas empresas estén incluidas en la misma exclusión voluntaria.

El valor inmediato procede de la consolidación. Los clientes de Cloudflare reciben un único lugar para expresar una preferencia común, mientras los operadores asignan esa preferencia a sus controles existentes o futuros.

El valor a largo plazo depende de si esas asignaciones se vuelven lo bastante transparentes como para que un editor pueda auditarlas a nivel de URL.

La configuración es una señal de consentimiento, no una prueba de cumplimiento

Cloudflare ha simplificado la instrucción, pero no puede demostrar que todo uso posterior se haya detenido simplemente porque un sitio publicó esa instrucción.

Esta limitación comienza con robots.txt. El archivo se diseñó como un protocolo voluntario para rastreadores, no como un sistema de control de acceso. Los rastreadores que cumplen lo leen y ajustan su comportamiento. Un operador que lo ignore puede seguir solicitando páginas disponibles públicamente, salvo que otro control bloquee el tráfico.

Cloudflare puede aplicar decisiones en el borde de su red cuando reconoce un rastreador. Eso hace que el bloqueo sea más sólido que una señal de preferencia. Sin embargo, la aplicación depende de una identificación fiable, y las cadenas de agente de usuario pueden ser copiadas por bots no relacionados.

Los programas de bots verificados reducen ese riesgo al comprobar las fuentes de las solicitudes frente a la información proporcionada por los operadores. La autenticación criptográfica podría ofrecer una prueba más sólida, pero su adopción sigue siendo incompleta en el mercado de rastreadores.

Incluso una solicitud verificada revela quién recuperó una página, no necesariamente todos los usos posteriores de su contenido. Un operador de rastreo debe mantener una separación interna entre la indexación de búsqueda, el entrenamiento de modelos, la generación de respuestas y otros procesamientos.

Los requisitos Accountable de Cloudflare abordan esa brecha de confianza mediante informes y compromisos. La visibilidad a nivel de URL debería ayudar a los editores a ver qué páginas quedaron disponibles para el entrenamiento y cómo apareció el contenido en las búsquedas.

La palabra clave es “debería”. El sistema de inspección de Apple sigue en desarrollo, las herramientas adicionales de Google están por llegar y el soporte de Microsoft para robots.txt a nivel de dominio está previsto para principios de 2027.

Por lo tanto, la designación combina capacidades actuales con promesas futuras. Cloudflare no afirma que los cuatro requisitos tengan hoy implementaciones idénticas en producción.

Los editores también deben evitar interpretar “Disallow AI Training” como una resolución legal universal. Las excepciones de copyright, los términos contractuales, las diferencias jurisdiccionales y la recopilación pasada siguen siendo cuestiones independientes. Una nueva preferencia no puede eliminar retroactivamente material de un modelo existente.

La configuración rige el comportamiento futuro de los rastreadores según lo implementen los operadores participantes y Cloudflare. No confirma que se hayan eliminado las copias recopiladas previamente. Tampoco establece cómo un modelo entrenado podría conservar o reproducir información.

Otra incertidumbre se refiere a la clasificación. Cloudflare asigna comportamientos de Search, Training y Agent basándose en parte en las divulgaciones de los operadores y en otra información observada. El propósito declarado de un rastreador puede cambiar, y un servicio puede dar soporte a varios productos.

Cuando las clasificaciones se retrasan respecto a los cambios de producto, una política podría permitir más actividad de la que espera un editor. Los registros transparentes de cambios y la supervisión independiente importarán tanto como el diseño inicial del panel.

Los resúmenes de IA exponen una brecha aún mayor. El entrenamiento determina si el contenido contribuye al desarrollo de modelos. Los resúmenes determinan si el contenido actual se transforma en una respuesta que puede reducir la necesidad de visitar una página.

Cloudflare cita investigaciones que muestran que los resúmenes de IA ya son frecuentes en el comportamiento de búsqueda. Un estudio sobre el comportamiento de búsqueda concluyó que los usuarios tenían menos probabilidades de hacer clic en enlaces de resultados cuando aparecía un resumen de IA.

No es el mismo problema que el entrenamiento. Un editor podría rechazar con éxito el entrenamiento y, aun así, perder visitas cuando un producto de búsqueda resume material indexado recientemente.

Cloudflare afirma que los operadores Accountable deben ofrecer una exclusión de los resúmenes de IA directamente y, con el tiempo, a través de Cloudflare. Su próximo objetivo es lograr un control más granular sobre cuánto contenido puede incluir un resumen.

Ese plan reconoce una debilidad del consentimiento binario. Permitir una cita breve con un enlace claro es diferente de permitir una respuesta detallada que sustituya a la fuente. Ambos podrían contar técnicamente como uso en resumen.

Los modelos de negocio también modifican el equilibrio aceptable. Un editor financiado con publicidad necesita volumen de visitas porque las impresiones sostienen los ingresos. Un minorista podría aceptar menos visitas si las referencias de IA generan más compras. Un editor de suscripción podría valorar más la atribución y el reconocimiento de los lectores que los clics en bruto.

Cloudflare ha citado estimaciones de terceros que sugieren que las referencias de IA pueden convertir a tasas más altas que las referencias de búsqueda tradicionales. Esas cifras varían según el conjunto de datos y la metodología, por lo que no deben tratarse como una compensación universal por el tráfico perdido.

El verdadero problema de medición es causal. Un editor debe saber qué rastreador accedió a una URL, qué producto la utilizó, si apareció un resumen, cuánto contenido mostró y si la interacción produjo una visita.

La mayoría de las organizaciones carecen hoy de esa cadena completa. Los registros del servidor revelan solicitudes, mientras que las consolas de búsqueda revelan impresiones y clics. Ninguno de los dos, por sí solo, establece cómo fluyó el contenido a través de un producto de IA.

Los nuevos controles mejoran la capacidad de decisión antes de proporcionar plena rendición de cuentas. Permiten a los editores declarar una política más limitada y aplicar bloqueos más sólidos a los rastreadores que no califican para la excepción Accountable.

No eliminan la necesidad de supervisión. Los editores deben inspeccionar la cobertura de búsqueda, los registros de rastreadores, los patrones de referencia y las salidas públicas de los principales productos de IA después de modificar su configuración.

Para los equipos que mantienen investigación, documentación o memoria institucional, la política de rastreadores es solo una capa de la gobernanza de la información. Una base de conocimientos con capacidad de búsqueda puede preservar internamente el contexto de las fuentes incluso cuando las plataformas externas resumen la versión pública.

La conclusión escéptica es sencilla. Cloudflare ha creado una superficie de control creíble, pero el cumplimiento sigue siendo un sistema de aplicación técnica, estándares voluntarios, políticas de los operadores y transparencia futura.

Llamar Accountable a un rastreador eleva el estándar esperado. No hace desaparecer el problema de confianza subyacente.

Tres señales mostrarán si el nuevo modelo funciona

La próxima prueba será si la política compartida de Cloudflare produce comportamientos medibles, no si más empresas respaldan su lenguaje.

La primera señal es el soporte prometido por Microsoft para una preferencia de no entrenamiento a nivel de dominio en robots.txt. Cloudflare afirma que esa capacidad está prevista para principios de 2027.

Una implementación funcional cerraría la mayor brecha actual entre los tres operadores de rastreadores de uso mixto. Permitiría que la misma configuración de Cloudflare comunicara un rechazo al entrenamiento a Bing sin requerir un despliegue independiente de NOARCHIVE ni un flujo de trabajo de eliminación.

Un retraso debilitaría la designación Accountable porque uno de sus participantes más importantes seguiría dependiendo de alternativas manuales o a nivel de página. La implementación también debería aclarar qué usos de IA de Microsoft se incluyen en “entrenamiento” y cuáles continúan regidos por controles independientes.

La segunda señal son los informes a nivel de URL de Apple y Google. Los editores necesitan más que una confirmación de que existe una preferencia de dominio. Necesitan saber a qué páginas se accedió, qué usos se permitieron y si la preferencia modificó el procesamiento posterior.

Las incorporaciones prometidas por Google relacionadas con Google-Extended proporcionan una prueba temprana. La capacidad de inspección prevista por Apple ofrece una prueba más prolongada. Los informes útiles deberían ser lo bastante específicos como para comparar el acceso de los rastreadores con el rendimiento de búsqueda y la visibilidad de IA.

Un recuento genérico en un panel ofrecería una rendición de cuentas limitada. Los registros a nivel de página, las etiquetas de propósito comprensibles y los datos históricos estables reforzarían la afirmación de Cloudflare de que los editores pueden tomar decisiones informadas.

La tercera señal es el trabajo de Cloudflare sobre los controles de resúmenes de IA. Las exclusiones del entrenamiento resuelven solo una parte del conflicto de los editores. Las respuestas generadas por búsquedas pueden afectar al tráfico incluso cuando no existe permiso para el entrenamiento de modelos.

El control previsto por Cloudflare sobre cuánto contenido aparece en un resumen es más ambicioso que una simple exclusión. Requeriría que los operadores interpreten una preferencia compartida de forma coherente y expongan suficientes datos para que los editores evalúen el resultado.

El éxito reforzaría el principio más amplio detrás de Cloudflare Disallow AI Training: el acceso debe tener un propósito específico, ser medible y poder modificarse por el propietario del contenido. El fracaso dejaría a los editores gestionando controles distintos para cada proveedor de búsqueda e IA.

La respuesta práctica hoy es considerar el lanzamiento como una mejora de políticas, no como una garantía que se configura una vez y se olvida. Los propietarios de sitios deben revisar la configuración migrada de cada dominio, especialmente si antes habilitaron una opción amplia de bloqueo de IA.

Deben confirmar si Search sigue permitido y si Training ahora muestra Disallow AI Training en lugar de Block. Seleccionar Block por completo puede detener Applebot, Googlebot y Bingbot, lo que genera un resultado distinto de publicar una preferencia de no entrenamiento.

Los equipos también deben documentar por qué se permite o rechaza cada categoría. La búsqueda, el entrenamiento y los agentes tienen propósitos diferentes, por lo que la política debe reflejar el modelo de ingresos del sitio y su relación con la audiencia.

Después de cualquier cambio, supervise las respuestas de los rastreadores y la indexación. Una caída en la cobertura de búsqueda podría indicar que se seleccionó la configuración equivocada o que otra regla del firewall está anulando la preferencia.

La misma revisión debe cubrir los subdominios importantes. La documentación, los centros de soporte, los blogs y las páginas de aplicaciones pueden estar detrás de configuraciones diferentes aunque compartan una marca matriz.

El lanzamiento de Cloudflare importa porque sustituye una dicotomía artificial por una opción más realista. Un sitio no debería tener que ceder material para el desarrollo de modelos simplemente para seguir siendo visible en un índice de búsqueda convencional.

Aun así, la credibilidad del sistema dependerá de resultados verificables. Microsoft debe completar su integración, Apple y Google deben ofrecer herramientas de inspección útiles, y Cloudflare debe convertir el control resumido en algo que los editores puedan medir.

Por ahora, Cloudflare Disallow AI Training ofrece a los propietarios de sitios web una instrucción más clara y una vía intermedia más segura. La siguiente pregunta es si los mayores operadores de rastreadores harán que esa instrucción sea lo bastante observable como para confiar en ella.

Revise las tres políticas de rastreadores de su dominio, registre el resultado previsto y observe la cobertura de búsqueda después de cualquier cambio. Si el tráfico se mantiene estable mientras disminuye el acceso para entrenamiento, el modelo compartido habrá superado su primera prueba práctica.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page