top of page

Las exclusiones del entrenamiento de chatbots aún dejan brechas de privacidad para los usuarios

12 ago
15 min de lectura

Google News ha puesto de relieve una nueva advertencia para millones de usuarios de chatbots: desactivar el entrenamiento de modelos no elimina necesariamente las conversaciones ya recopiladas. La cobertura más reciente explica cómo los consumidores pueden cambiar la configuración de entrenamiento en ChatGPT, Gemini, Claude, Copilot y Grok. Sin embargo, esos controles varían considerablemente en alcance, momento de aplicación y visibilidad.

La acción inmediata suele ser sencilla. Los usuarios encuentran un menú de privacidad y desactivan una opción llamada “Improve the model”, “Model Improvement” o algo similar. La pregunta más difícil es qué cambia realmente ese interruptor.

La mayoría de los controles se aplican a conversaciones futuras, no a cada prompt ya almacenado o incorporado a un proceso de entrenamiento. Los modos de chat temporal pueden reducir la exposición, pero no siempre garantizan la eliminación inmediata de los sistemas de la empresa. La retención por motivos de seguridad, prevención de abusos o cumplimiento legal puede continuar.

Esta distinción convierte una sencilla guía de privacidad para chatbots en una historia más amplia sobre la industria. Las empresas de IA para consumidores prometen asistentes personalizados mientras dependen de los datos de interacción para evaluar, proteger y, en ocasiones, mejorar sus modelos.

Los usuarios quieren las ventajas de un contexto persistente sin contribuir silenciosamente con material personal a sistemas futuros. Las empresas quieren comentarios útiles sin debilitar la confianza. Los controles de privacidad se sitúan ahora directamente en el centro de ese conflicto.

Qué cambió en la conversación sobre la privacidad de los chatbots

La configuración de privacidad se ha convertido en una función del producto, pero aún no opera como un botón universal de retirada.

La actual oleada de atención no está vinculada a una única filtración recién descubierta. Refleja una creciente comprensión de que la IA conversacional recopila una clase de información distinta a la de los cuadros de búsqueda convencionales.

Las personas piden a los chatbots que reescriban mensajes médicos, interpreten contratos, resuman reuniones, depuren código propietario y evalúen decisiones profesionales. Suben fotografías, hojas de cálculo, grabaciones y documentos internos. Un prompt puede exponer tanto a su autor como a personas que nunca aceptaron interactuar con el servicio.

La actividad de búsqueda suele consistir en fragmentos. Las conversaciones con chatbots pueden contener narrativas completas, archivos adjuntos, correcciones y preguntas de seguimiento. Ese contexto más rico hace que los datos sean valiosos para mejorar las respuestas, evaluar sistemas de seguridad y estudiar el comportamiento de los usuarios.

También hace que los errores tengan consecuencias más graves.

Los principales proveedores de chatbots ofrecen ahora alguna combinación de controles de entrenamiento, eliminación del historial, exportación de datos y sesiones temporales. Sus interfaces sugieren que los consumidores cuentan con opciones significativas. Sin embargo, esas opciones no comparten una única definición.

Desactivar el entrenamiento normalmente indica a un proveedor que no use conversaciones futuras que cumplan los requisitos para la mejora general del modelo. Eliminar el historial borra las conversaciones visibles de una cuenta, aunque la retención en backend puede continuar durante un período limitado. El chat temporal suele evitar que una conversación aparezca en el historial o influya en la memoria.

Son acciones distintas. Un usuario que solo realiza una puede asumir protecciones que corresponden a otra.

OpenAI, por ejemplo, separa el historial visible de chats de su preferencia de entrenamiento. Sus controles de privacidad indican que desactivar “Improve the model for everyone” evita que las nuevas conversaciones se utilicen para entrenar ChatGPT. Esas conversaciones aún pueden permanecer en el historial del usuario.

OpenAI también afirma que los Temporary Chats no aparecen en el historial, no crean memorias ni mejoran sus modelos. La empresa puede conservar una copia durante un período limitado por motivos de seguridad. Esa es una promesa más limitada que la desaparición inmediata de todo el sistema.

Este es el cambio central detrás de la atención de Google News. La privacidad ya no es una única página de políticas que la mayoría de los usuarios nunca lee. Se ha convertido en un conjunto de decisiones de producto que afectan al historial, la personalización, la memoria, la revisión humana y el entrenamiento.

Los controles están mejorando, pero el vocabulario sigue siendo inconsistente. “Activity”, “history”, “memory” y “model improvement” pueden describir procesos relacionados sin significar lo mismo.

Esa ambigüedad traslada la carga a los usuarios. Deben entender no solo qué interruptor existe, sino qué flujo de datos controla.

Google News pone de relieve un conflicto dentro de Gemini

Gemini muestra por qué una aparente exclusión del entrenamiento puede conllevar un coste de usabilidad independiente.

La experiencia de IA para consumidores de Google combina varias funciones que otras empresas suelen separar. Gemini puede conservar conversaciones, personalizar respuestas, conectarse con los servicios de Google y utilizar la actividad para mejorar productos. Por tanto, una configuración puede afectar a más de un resultado.

El actual Gemini Privacy Hub de Google indica que la actividad guardada puede ayudar a proporcionar, desarrollar y mejorar sus servicios. Ese trabajo incluye el entrenamiento de modelos de IA generativa y puede implicar a revisores humanos.

La política advierte a los usuarios que no introduzcan información que no querrían que un revisor viera o que Google utilizara. Google afirma que las conversaciones seleccionadas para revisión se desconectan de la cuenta antes de enviarse a proveedores de servicios. Sin embargo, eliminar un identificador de cuenta no es lo mismo que eliminar cada dato identificable escrito dentro de un prompt.

Una conversación puede mencionar a un empleador, cliente, condición médica, ubicación o transacción pendiente. El texto en sí puede seguir siendo revelador incluso después de separar los datos directos de la cuenta.

Google ha estado cambiando la interfaz en torno a estas opciones. “Gemini Apps Activity” ha ido cambiando hacia la etiqueta más clara “Keep Activity”. Google también ofrece Temporary Chat, que mantiene una conversación fuera de los chats recientes e impide que se utilice para entrenar sus modelos de IA.

Estos cambios mejoran la facilidad para encontrar las opciones. No eliminan la disyuntiva subyacente entre el historial guardado y un menor uso de datos.

Cuando la actividad está desactivada, Google aún puede conservar brevemente las conversaciones para prestar el servicio, procesar comentarios y proteger a los usuarios. Algunas funciones conectadas también pueden tener sus propios controles. El audio, el vídeo, el uso compartido de pantalla, las extensiones y otros productos de Google pueden seguir configuraciones distintas de la opción principal de conversaciones de Gemini.

La lección práctica no es que Gemini carezca de controles de privacidad. Es que un único control no puede describir toda la relación de datos.

La cobertura de Google News presenta esa complejidad ante una amplia audiencia en un momento importante. Gemini está cada vez más conectado a información personal almacenada en correos electrónicos, documentos, calendarios y dispositivos móviles. A medida que los asistentes ganan contexto, una suposición vaga sobre la privacidad se vuelve más peligrosa.

Los usuarios deben distinguir tres preguntas.

Primero, ¿guardará la empresa la conversación en el historial de la cuenta? Segundo, ¿utilizará el material para la mejora general del modelo? Tercero, ¿puede el asistente reutilizar esa información para personalizar respuestas futuras?

Un usuario puede razonablemente querer un historial guardado mientras rechaza el entrenamiento general. Otro podría permitir la personalización, pero evitar la revisión humana. Las interfaces de producto rara vez presentan estas preferencias como un conjunto claro de decisiones independientes.

Ese problema de diseño presiona a Google porque el valor de su asistente procede cada vez más de la conexión. Cuanto más pueda ver Gemini, más útil puede llegar a ser. Ese mismo acceso hace más importantes el consentimiento informado y unos controles comprensibles.

La presión también se extiende más allá de Google. Cada desarrollador de asistentes debe explicar por qué un producto personalizado necesita determinados datos, cuánto tiempo los conserva y qué usos siguen siendo opcionales.

Un interruptor oculto ya no resuelve esa obligación.

ChatGPT, Claude, Copilot y Grok trazan límites distintos

No existe un estándar del sector sobre lo que cubre la exclusión, cuándo comienza o qué tipos de cuenta reciben protección de forma predeterminada.

OpenAI ofrece a los usuarios consumidores un interruptor general de mejora del modelo mientras mantiene disponible el historial de chats. Esa separación hace que la elección sea relativamente comprensible. Temporary Chat añade una segunda opción para conversaciones que no deberían entrar en el historial ni en la memoria.

Los productos empresariales operan bajo condiciones diferentes. OpenAI afirma que el contenido de su API y de sus ofertas empresariales no se utiliza para entrenamiento de forma predeterminada, salvo que una organización dé su consentimiento explícito. Esa diferencia importa porque una cuenta de consumidor de pago no equivale automáticamente a un espacio de trabajo empresarial.

Anthropic también distingue entre el uso para consumidores y los servicios comerciales. Los usuarios de Claude pueden controlar la mejora del modelo mediante la configuración de privacidad, mientras que las conversaciones de incógnito ofrecen un modo más temporal.

Anthropic afirma que los chats de incógnito no aparecen en el historial de chats ni en la memoria de Claude. La empresa también indica que no se utilizan para mejorar Claude, incluso cuando la mejora del modelo está activada en otras circunstancias.

Sin embargo, una etiqueta de incógnito no debe interpretarse como la promesa de que no existe ningún registro operativo en ningún lugar. Los proveedores pueden conservar información limitada para aplicar normas, investigar abusos o cumplir obligaciones legales. El tratamiento exacto depende de las condiciones del servicio y del motivo de la retención.

Microsoft presenta un panorama más fragmentado porque Copilot aparece en productos para consumidores, el trabajo, el desarrollo y la productividad. Las normas aplicables dependen de qué Copilot utiliza una persona y qué cuenta autentica la sesión.

Las preguntas frecuentes sobre privacidad de Copilot de Microsoft indican que los usuarios consumidores con sesión iniciada pueden controlar si la actividad de conversación entrena los modelos de IA generativa de Microsoft. La exclusión impide que las conversaciones futuras se utilicen con ese fin.

La misma página señala varias excepciones. Las cuentas organizativas y algunos contextos de Microsoft 365 reciben un tratamiento distinto. Microsoft también afirma que las conversaciones de usuarios sin sesión iniciada no se utilizan para el entrenamiento de modelos.

Este enfoque producto por producto puede ser defendible porque los datos del lugar de trabajo merecen protecciones predeterminadas más estrictas. Aun así, puede confundir a alguien que ve una misma marca Copilot en Windows, la web y Microsoft 365.

Grok presenta otra versión del mismo problema. Opera a través de los servicios dedicados de xAI y de X, donde las políticas independientes de la plataforma pueden ser relevantes.

Los controles para consumidores de xAI indican que los usuarios pueden elegir si su contenido entrena Grok. En su aplicación móvil, la ruta pasa por Settings, Data Controls e “Improve the model”.

La existencia de un interruptor es solo la primera capa. Los usuarios también deben considerar las publicaciones públicas de X, las conversaciones privadas de Grok, los enlaces de conversaciones compartidas, los medios subidos y las interacciones realizadas a través de interfaces diferentes.

Un control en una superficie puede no regir otra superficie propiedad del mismo grupo corporativo. El historial de la cuenta también puede permanecer separado del permiso de entrenamiento del modelo.

Estas diferencias exponen al principal adversario del sector: la promesa de control del usuario frente a la realidad de sistemas de datos fragmentados.

Los proveedores no hacen promesas idénticas y sus servicios no recopilan entradas idénticas. Aun así, los consumidores encuentran patrones de marca similares y esperan razonablemente opciones de privacidad comparables.

En cambio, cada empresa define los límites por sí misma. Un proveedor separa el entrenamiento del historial. Otro vincula funciones importantes al almacenamiento de actividad. Un tercero cambia la política según la cuenta o la aplicación.

Por ello, los usuarios deberían rechazar la idea de que «excluirse» tenga un único significado transferible. Es un estado específico de cada servicio que debe verificarse cada vez que cambia un producto, una cuenta o una política.

Los equipos que manejan información confidencial necesitan una regla aún más estricta. No deberían considerar un interruptor de consumo como sustituto de términos empresariales aprobados, controles de acceso, políticas de retención y compromisos contractuales.

Un sistema de conocimiento personal puede reducir la copia innecesaria al mantener organizado el material fuente antes de que llegue a un chatbot. Esa es una de las razones por las que importan los flujos de trabajo local-first y una base de conocimiento personal controlada. Permiten a los usuarios decidir qué fragmentos necesita realmente un modelo.

Recuperar los datos no es lo mismo que revertir el entrenamiento

Los usuarios pueden detener algunos usos futuros, pero por lo general no pueden extraer una contribución de un modelo que ya ha sido entrenado.

Este es el límite más importante de la expresión «recuperar tus datos». Un control de privacidad puede modificar el procesamiento futuro. No necesariamente puede deshacer cada paso de procesamiento anterior.

El entrenamiento de modelos no funciona como si se colocaran transcripciones completas de chats en una carpeta con función de búsqueda. Los desarrolladores procesan grandes conjuntos de datos, dividen el texto en unidades más pequeñas, ajustan los parámetros del modelo y prueban el sistema resultante. Una vez que una ejecución de entrenamiento incorpora datos, eliminar la influencia de una sola persona puede volverse técnicamente difícil.

Eso no significa que los modelos memoricen perfectamente cada entrada. La mayor parte del entrenamiento busca aprender patrones estadísticos, no conservar una copia recuperable de cada conversación. Sin embargo, los investigadores han demostrado que los modelos de lenguaje a veces pueden reproducir material poco común o distintivo en determinadas condiciones.

El riesgo depende de los datos, de su repetición, del proceso de entrenamiento y de las protecciones aplicadas por el desarrollador. Un secreto único escrito una vez es diferente de un texto público repetido ampliamente. Ninguno debería introducirse en un chatbot de consumo sin una razón clara.

Por lo tanto, la eliminación tiene al menos tres significados posibles.

Un proveedor puede eliminar una conversación del historial visible para el usuario. Puede programar copias almacenadas para su eliminación de los sistemas activos. También puede excluir material que cumpla los requisitos de futuros conjuntos de datos de entrenamiento.

Estas acciones no eliminan automáticamente los efectos de un modelo cuyo entrenamiento ya ha terminado. Las empresas deberían expresar ese límite con claridad, y los usuarios deberían ajustar sus expectativas en consecuencia.

El momento también importa por la misma razón. Si alguien desactiva hoy el entrenamiento, el cambio suele regir las conversaciones nuevas. Un proveedor también podría excluir material anterior que todavía no haya entrado en una canalización de entrenamiento, pero los usuarios no deberían asumir ese resultado sin una promesa explícita.

Enviar comentarios puede crear otra excepción. Una acción de pulgar arriba o pulgar abajo puede enviar la conversación asociada a un proceso de evaluación independiente. Algunos servicios advierten que los comentarios pueden revisarse incluso cuando está desactivada una preferencia general de entrenamiento.

Los sistemas de seguridad añaden más complejidad. Un proveedor puede conservar o analizar conversaciones marcadas por fraude, abuso, autolesión, malware o infracciones de políticas. Estos usos pueden permanecer fuera de la configuración general de mejora del modelo.

La memoria introduce una categoría distinta. Un chatbot podría guardar una preferencia o un dato personal para que las conversaciones futuras resulten más relevantes. Desactivar el entrenamiento no elimina necesariamente esos recuerdos guardados. Eliminar una conversación visible podría no borrar un recuerdo extraído de ella.

Los usuarios deben revisar por separado los controles de memoria y comprobar qué ha almacenado el asistente. También deberían distinguir entre la personalización basada en el historial de chats y una función formal de memoria.

Las exportaciones de datos pueden revelar lo que sigue visible en una cuenta, pero no son un mapa completo de los sistemas de backend. Una exportación ayuda a los usuarios a auditar conversaciones, archivos adjuntos e información de la cuenta antes de eliminarlos. No certifica que cada copia operativa aparezca en el paquete.

La medida práctica más sólida es la prevención. No pegues contraseñas, claves privadas, tokens de autenticación, historiales médicos completos, resultados financieros no publicados ni material confidencial de clientes en un asistente de consumo.

La redacción también ayuda. Sustituye nombres, números de cuenta, direcciones e identificadores únicos por etiquetas neutras. Proporciona el fragmento mínimo necesario para la tarea en lugar de subir un archivo completo.

Para tareas puntuales sensibles, utiliza una conversación temporal o de incógnito después de comprobar la política vigente. Para trabajo profesional recurrente, utiliza un producto empresarial aprobado con compromisos de datos por escrito.

Las personas también deberían eliminar las conversaciones antiguas que ya no necesitan. La eliminación no revertirá un entrenamiento completado, pero puede reducir la exposición de la cuenta, limitar la personalización e iniciar el proceso de eliminación del proveedor.

Aquí es donde la gestión de la información personal se convierte en una práctica de privacidad. Una biblioteca de fuentes bien organizada facilita el intercambio selectivo. Los usuarios pueden recuperar el párrafo necesario en lugar de entregar a un asistente una carpeta completa.

El punto escéptico más amplio se mantiene: los proveedores describen estos controles mediante sus propias interfaces y políticas. Los usuarios independientes no pueden observar todas las canalizaciones de backend. Un interruptor es significativo porque crea un compromiso declarado, pero la confianza sigue dependiendo del cumplimiento, las auditorías y la aplicación de las normas.

La verdadera disyuntiva es personalización frente a minimización de datos

El asistente que lo recuerda todo es también el asistente que requiere los límites más claros sobre recopilación, retención y reutilización.

Los desarrolladores de chatbots avanzan hacia asistentes persistentes que entienden preferencias, proyectos, relaciones y patrones de trabajo. Estas funciones compiten directamente con la minimización de datos, el principio de recopilar únicamente lo que necesita un servicio.

La personalización puede ahorrar tiempo. Un asistente que recuerda un estilo de redacción o un proyecto recurrente no necesita las mismas instrucciones en cada sesión. Los servicios conectados pueden recuperar un documento, encontrar una reunión o resumir un hilo de correo electrónico.

Sin embargo, el contexto persistente amplía las consecuencias de una cuenta expuesta, un permiso incorrecto o una política de entrenamiento demasiado amplia. También hace menos creíble el consentimiento casual, porque los usuarios no pueden predecir fácilmente cada uso futuro de los datos acumulados.

Por eso el principal conflicto no es el de los consumidores contra una empresa de IA. Es la promesa de la industria de una inteligencia individualizada frente a la realidad de que la personalización depende de un acceso sostenido al contexto privado.

Las empresas pueden reducir ese conflicto separando los controles.

El historial debería regir si los usuarios pueden volver a consultar las conversaciones. La memoria debería regir qué detalles reutiliza el asistente. El entrenamiento general debería regir si las conversaciones mejoran los modelos para otros usuarios. La revisión humana debería tener una explicación clara y un alcance limitado.

La eliminación debería explicar qué desaparece de inmediato, qué entra en una cola de eliminación y qué debe conservarse temporalmente. Los productos empresariales deberían identificar sus protecciones sin depender de que los consumidores las infieran a partir de la marca.

Los valores predeterminados importan tanto como los menús. Un control de exclusión exige que los usuarios detecten el problema, encuentren la configuración, entiendan el lenguaje y actúen. Un enfoque de inclusión exige que el proveedor explique el beneficio antes de recopilar el permiso adicional.

El debate se centrará cada vez más en si el entrenamiento es necesario para prestar el servicio solicitado. Generar la respuesta de un chatbot y utilizar esa conversación para mejorar un modelo futuro son finalidades relacionadas, pero no idénticas.

Los reguladores pueden examinar si las empresas comunican esa diferencia de manera justa. También pueden comprobar si los usuarios reciben opciones significativas, en lugar de una configuración de privacidad vinculada a la pérdida de funcionalidades no relacionadas.

La investigación independiente seguirá siendo importante. Un análisis reciente de las políticas de privacidad de modelos frontier detectó variaciones sustanciales entre los principales desarrolladores y planteó preguntas sobre cómo se describen los datos de chats de consumo. Las comparaciones de políticas no pueden demostrar qué ocurre dentro de cada sistema, pero revelan dónde los compromisos siguen siendo vagos.

La competencia por la privacidad también puede convertirse en un diferenciador de producto. Los proveedores que ofrezcan configuraciones granulares pueden atraer a usuarios que quieren historial y personalización sin entrenamiento general. Quienes agrupen todas las funciones detrás de un único interruptor de actividad corren el riesgo de parecer coercitivos.

Los compradores empresariales ya exigen límites contractuales más sólidos porque entienden el valor de los datos internos. Los usuarios de consumo esperan cada vez más una claridad similar, incluso cuando los términos operativos difieren.

Los trabajadores del conocimiento deberían tratar los permisos de los chatbots como permisos para compartir en la nube. Revísalos al abrir una cuenta, después de una actualización importante del producto y cada vez que el asistente obtenga acceso a otro servicio.

También deberían elaborar un breve inventario de datos. ¿Qué chatbot contiene conversaciones personales? ¿Cuál contiene archivos de trabajo? ¿Qué asistente tiene activada la memoria? ¿Qué servicios pueden acceder al correo electrónico, al almacenamiento o a los calendarios?

Ese inventario hace que los cambios de política sean accionables. Sin él, los usuarios pueden desactivar un interruptor visible y olvidar varias rutas de datos conectadas.

Qué vigilar cuando se disipe la atención de Google News

La próxima prueba será determinar si los proveedores de chatbots separan con mayor claridad las opciones de privacidad o siguen pidiendo a los usuarios que descifren excepciones específicas de cada producto.

La primera señal es el diseño de los controles. Observa si Google separa por completo el historial guardado, la personalización, el entrenamiento de modelos y la revisión humana en Gemini. Una interfaz más granular reforzaría el argumento de que los usuarios pueden tomar decisiones informadas sin sacrificar funciones no relacionadas.

Si esas funciones siguen agrupadas, la disyuntiva de privacidad persistirá. Temporary Chat ofrece una vía de escape útil, pero no sustituye un control duradero sobre las conversaciones ordinarias.

La segunda señal es la aplicación de las políticas. Los reguladores y los tribunales seguirán examinando si los amplios usos de datos de IA coinciden con el consentimiento que los usuarios proporcionaron originalmente. Las decisiones relativas a publicaciones públicas, chats de consumo o servicios conectados pueden impulsar a las empresas hacia avisos más claros y valores predeterminados más estrictos.

La aplicación de las normas reforzaría el control de los usuarios si produce obligaciones específicas en torno a la finalidad, la retención y la eliminación. Los acuerdos vagos sin cambios medibles dejarían el sistema actual prácticamente intacto.

La tercera señal es la competencia en torno a la IA privada. Los proveedores pueden diferenciarse mediante procesamiento en el dispositivo, valores predeterminados de nivel empresarial, almacenamiento local y prácticas de datos auditadas de forma independiente. Una empresa que haga comprensible la privacidad puede obligar a sus rivales a simplificar sus propios controles.

Los usuarios no deberían esperar a que termine esa competencia. Ya pueden actuar desactivando la mejora de modelos no deseada, revisando la memoria, eliminando conversaciones antiguas y utilizando modos temporales para trabajos sensibles.

Deberían repetir la revisión después de actualizaciones importantes. Las etiquetas de la interfaz cambian, aparecen nuevas integraciones y los servicios pueden revisar la forma en que la actividad respalda la personalización o el desarrollo de modelos.

Google News pasará a otro titular, pero el problema subyacente permanecerá. Los chatbots se están convirtiendo en lugares donde las personas piensan en voz alta, y pensar en voz alta produce datos inusualmente reveladores.

Antes del siguiente prompt, decide si la tarea requiere nombres reales, documentos completos o historial persistente. Comprueba qué cuenta y qué producto estás utilizando. Después, comparte solo el contexto necesario para obtener la respuesta.

La mejor configuración de privacidad no puede recuperar un secreto después de que haya entrado en un proceso de entrenamiento completado. La estrategia más fiable combina opciones de exclusión claras con decisiones disciplinadas sobre los datos introducidos.

Revisa hoy la configuración de tu chatbot y luego hazte una pregunta más difícil: si esta conversación apareciera fuera de tu cuenta, ¿seguirías sintiéndote cómodo enviándola?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page