El prompt de Anthropic Claude Opus 5 aparece en línea y expone la capa de control detrás de su IA
- Aisha Washington

- 27 jul
- 16 min de lectura
Anthropic Claude Opus 5 se lanzó el 24 de julio, y ese mismo día apareció en GitHub un supuesto prompt de sistema de 135.027 caracteres. El archivo afirma reproducir las instrucciones empleadas por las aplicaciones web y móviles de Anthropic, incluidas definiciones completas de herramientas y reglas de comportamiento.
Esa afirmación no ha sido autenticada de forma independiente. Anthropic no ha confirmado públicamente que todas las líneas procedan de su entorno de producción. Sin embargo, el documento contiene 1.511 líneas, aproximadamente 19.370 palabras en inglés y unos 34.000 tokens estimados.
El momento importa tanto como el contenido. Anthropic presentó Opus 5 como un modelo de uso diario con capacidades reforzadas para programación agéntica, trabajo de largo horizonte y verificación. En menos de 24 horas, los desarrolladores también compartían elaborados juegos y demostraciones interactivas en 3D atribuidas al modelo.
El resultado es un lanzamiento con una inusual doble perspectiva. Las demostraciones públicas muestran lo que Opus 5 puede producir, mientras que el supuesto prompt revela la amplia capa de control que da forma a esos resultados.
Esa tensión importa más allá de Anthropic. Los productos de IA de frontera dependen cada vez más de instrucciones de sistema, esquemas de herramientas, políticas de memoria, clasificadores y lógica de aplicación. El modelo aporta inteligencia, pero el sistema de control circundante decide cómo llega esa inteligencia a los usuarios.
El supuesto prompt se parece más a un manual operativo del producto
La afirmación más importante no es que Anthropic Claude utilice un prompt de sistema, sino que su producto para consumidores dependería de un manual operativo excepcionalmente amplio.
Un prompt de sistema es un paquete oculto de instrucciones que se proporciona antes del mensaje de un usuario. Puede definir la identidad del asistente, las herramientas disponibles, el estilo de respuesta, los límites de seguridad y la información actual del producto.
Anthropic ya reconoce que sus interfaces para consumidores usan estas instrucciones. Su archivo oficial de prompts de sistema incluye una entrada de Claude Opus 5 con fecha del 24 de julio de 2026. La empresa afirma que estos prompts ofrecen información actual y orientan el comportamiento en sus aplicaciones web y móviles.
El controvertido documento de GitHub va mucho más allá del material visible en esa página de archivo. Quien lo subió afirma que el archivo fue capturado de las superficies de chat web y móvil de Anthropic. El repositorio describe la reproducción como literal o casi literal, incluidos los esquemas de parámetros de las herramientas.
Esa descripción sigue siendo una afirmación del propietario del repositorio. Los lectores no deberían tratar el archivo como código fuente autenticado ni como una configuración de producción verificada. Un prompt de sistema extraído mediante respuestas del modelo puede contener omisiones, texto duplicado, formato alterado o material generado.
Aun así, varios detalles coinciden con el comportamiento de Claude documentado públicamente. El archivo identifica Opus 5 como el modelo seleccionado, utiliza la fecha de lanzamiento correcta y describe funciones del producto asociadas con las interfaces actuales de Anthropic. También hace referencia a la gama pública de modelos y aplicaciones para consumidores de la empresa.
El tamaño del documento llama la atención. Según el informe original sobre la filtración del prompt, el archivo contiene 135.027 caracteres y 19.370 palabras en inglés. Una estimación aproximada basada en caracteres lo sitúa cerca de los 34.000 tokens, aunque el recuento varía según el formato y el comportamiento del tokenizador.
Los metadatos visibles de GitHub indican 1.511 líneas y un tamaño de archivo de unos 132 KB. El archivo de prompt publicado incluye secciones sobre información del producto, comportamiento de seguridad, memoria, recomendaciones de aplicaciones, búsqueda y uso de herramientas.
Eso no significa que cada interacción consuma el documento completo de la misma forma. Los sistemas de IA para consumidores pueden ensamblar prompts dinámicamente según las funciones activadas, la configuración de la cuenta, el estado de la conversación y las herramientas disponibles. El almacenamiento en caché de prompts también puede reducir los costes de procesamiento repetido.
Por tanto, la expresión "prompt de sistema completo" requiere matices. El archivo parece representar una configuración de aplicación, no todas las instrucciones utilizadas en la API de Anthropic, Claude Code, implementaciones empresariales o infraestructura interna de seguridad.
La documentación de Anthropic separa explícitamente sus prompts para consumidores de la API de Claude. Los desarrolladores que usan la API proporcionan sus propias instrucciones de sistema y definiciones de herramientas. No deberían asumir que el supuesto prompt web rige sus aplicaciones.
Incluso con esas limitaciones, el documento revela un patrón arquitectónico importante. Un asistente de IA para consumidores no es simplemente un modelo esperando una pregunta. Es una capa de producto coordinada que rodea al modelo con herramientas, políticas, memoria, búsqueda y comandos específicos de la interfaz.
Por eso la afirmación de la filtración genera más presión que una filtración ordinaria de prompts. Ofrece a competidores y desarrolladores un posible mapa de cómo Anthropic convierte un modelo general en un agente de consumo controlado.
Treinta esquemas de herramientas muestran dónde reside el valor del producto
El supuesto prompt de Anthropic Claude sugiere que la orquestación de la aplicación aporta ahora tanto a la experiencia de usuario como el modelo subyacente.
Según se informa, el archivo define 30 herramientas mediante esquemas JSON, un formato estructurado que especifica parámetros y resultados aceptados. Estas herramientas abarcan ejecución de comandos, recuperación web, búsqueda de imágenes, clima, información deportiva, mapas, recetas y memoria persistente.
Un esquema de herramienta no contiene la inteligencia necesaria para completar una tarea. Proporciona al modelo un contrato fiable para llamar a otro servicio. El modelo debe decidir qué herramienta usar, aportar argumentos válidos, interpretar el resultado y continuar la conversación.
Esa secuencia es fundamental para la IA agéntica. Un chatbot convencional devuelve texto. Un agente puede buscar, ejecutar código, manipular archivos, consultar contexto almacenado y combinar resultados a lo largo de varias acciones.
El anuncio oficial de Opus 5 de Anthropic destaca precisamente este tipo de trabajo. La empresa afirma que el modelo mejoró en ingeniería de software de varios pasos, uso de computadoras, tareas de larga duración y autoverificación.
El supuesto prompt muestra el detalle operativo necesario para hacer fiables esas capacidades. No se limita a nombrar herramientas. Describe cuándo llamarlas, cómo formatear sus entradas y qué debería decir después el asistente.
Esas instrucciones ayudan a prevenir varios fallos habituales de los agentes. Un modelo puede inventar parámetros, llamar a una herramienta irrelevante, repetir una acción o describir un resultado antes de recibirlo. Los esquemas detallados reducen esas vías de fallo.
El documento también parece incluir una herramienta denominada recommend_claude_apps. Según se informa, sus instrucciones indican al asistente que recomiende aplicaciones relevantes de Anthropic mientras sigue completando la tarea actual.
Por ejemplo, el trabajo de programación puede dirigir a Claude Code, mientras que la investigación más extensa puede dirigir a Cowork. Las tareas de hojas de cálculo, presentaciones, diseño, navegador y correo electrónico pueden activar otras sugerencias de productos.
Esta sección plantea una cuestión comercial que merece escrutinio. El mismo asistente que asesora a los usuarios también puede dirigirlos hacia la creciente cartera de productos del proveedor. Eso no hace automáticamente que la recomendación sea engañosa, pero introduce un incentivo de plataforma.
Las supuestas reglas intentan limitar ese incentivo. Las recomendaciones deben relacionarse con la tarea actual, mantenerse en número limitado y evitar sustituir el trabajo solicitado. Por separado, el archivo indica a Claude que no elija proveedores de servicios de terceros salvo que el usuario identifique uno.
La distinción resulta reveladora. Las propias aplicaciones de Anthropic pueden proponerse de forma proactiva, mientras que los servicios de terceros reciben un tratamiento más prudente. Por tanto, el documento combina reglas de protección del usuario con un canal de distribución incorporado.
Los competidores reconocerán la estrategia. OpenAI, Google, Microsoft y Anthropic conectan cada vez más sus modelos con herramientas de programación, aplicaciones de oficina, navegadores, fuentes de datos y sistemas operativos. El producto ganador podría ser el que ofrezca la orquestación más fiable, no la mayor puntuación aislada en benchmarks.
Los esquemas filtrados pueden ayudar a desarrolladores externos a estudiar ese estilo de orquestación. Pueden examinar convenciones de nomenclatura, descripciones de parámetros, reglas de secuenciación y gestión de fallos. Sin embargo, copiar solo los esquemas no reproducirá el comportamiento del producto Claude.
Las partes invisibles siguen importando. La autenticación, los permisos de servicio, los clasificadores, el enrutamiento del modelo, la telemetría, la configuración de cuentas y las implementaciones de backend no están dentro de una descripción visible de herramientas. Tampoco las evaluaciones utilizadas para decidir si un agente se comporta de forma fiable.
Las demostraciones compartidas tras el lanzamiento ilustran esta distinción. Los informes describieron a desarrolladores que usaban Opus 5 para crear un juego en primera persona, un shooter en 3D y un prototipo de estilo Rocket League. Otra demostración supuestamente generó un entorno interactivo con visuales procedurales y viento simulado.
Estos ejemplos son visualmente persuasivos, pero no son benchmarks controlados. Una publicación en redes sociales rara vez revela todos los prompts, ediciones, llamadas a herramientas, intentos fallidos o intervenciones humanas. "Un prompt" también puede ocultar una amplia estructura previa proporcionada por una aplicación.
Anthropic ofrece pruebas más sólidas, aunque todavía seleccionadas por la empresa, en sus materiales de lanzamiento. Informa de que Opus 5 reconstruyó una pieza mecánica en 3D tras crear una canalización de visión por computadora a partir de píxeles sin procesar. La empresa también describe una reparación de software en la que el modelo abordó una causa subyacente en lugar de limitarse al síntoma visible.
En conjunto, el prompt y las demostraciones apuntan a la misma conclusión. La capacidad del producto surge del modelo más un entorno de ejecución cada vez más elaborado. Evaluar solo el nombre del modelo pasa por alto gran parte del sistema que los usuarios realmente experimentan.
La memoria de Anthropic Claude está condicionada por lo que debe olvidar
La sección más trascendental del documento describe un sistema de memoria diseñado para preservar la continuidad sin permitir que el asistente elabore libremente perfiles de sus usuarios.
La supuesta sección memory_filesystem abarca aproximadamente 230 líneas. Describe archivos persistentes que otra instancia de Claude puede leer en una conversación futura.
No se trata de memoria del modelo en el sentido biológico. Es texto almacenado e introducido en contexto posterior, que permite a una nueva sesión recuperar datos seleccionados sobre un usuario, proyecto, preferencia o relación.
La estructura propuesta separa la información en archivos y directorios. Un perfil puede contener detalles de identidad, los archivos temáticos pueden registrar intereses, los archivos de área pueden seguir el trabajo activo y los archivos de personas pueden representar a individuos de la vida del usuario.
Según se informa, las operaciones disponibles incluyen leer, escribir, añadir, reemplazar texto, listar archivos y eliminar archivos. La eliminación recibe una condición especialmente estricta: el asistente debería usarla solo cuando el usuario lo solicite explícitamente.
Las restricciones más interesantes se refieren a la escritura. El documento afirma que Claude solo debería almacenar hechos expresados directamente por el usuario. Las nuevas entradas reciben una etiqueta [stated], mientras que el asistente debería evitar registrar sus propias inferencias.
Esa regla aborda un problema difícil de la IA persistente. Un modelo puede convertir un comentario temporal en un perfil duradero o transformar la incertidumbre en un hecho afirmado. Una vez guardada, esa interpretación puede afectar conversaciones posteriores sin que el usuario vea su origen.
La supuesta política prohíbe almacenar conclusiones derivadas por Claude. También excluye los planes del asistente, la investigación web, los detalles enriquecidos y las recomendaciones. Si Claude propone varias opciones y el usuario selecciona una, la elección puede recordarse, pero el análisis descartado no debe conservarse.
Esto crea un modelo de memoria más limitado de lo que muchos usuarios podrían esperar. No se supone que el asistente construya una biografía integral. Almacena declaraciones seleccionadas que pueden hacer que el trabajo futuro sea menos repetitivo.
La información sensible recibe restricciones adicionales. Según se informa, el documento bloquea el almacenamiento duradero de condiciones de salud, opiniones políticas, circunstancias financieras, evaluaciones de personalidad, documentos identificativos, direcciones precisas e información relativa a menores.
También aplica consideraciones de privacidad a las personas mencionadas por el usuario. Los familiares pueden representarse mediante relaciones en lugar de nombres. Ese diseño intenta evitar que el asistente de una persona se convierta en una base de datos sin control sobre otras.
Según se informa, la política rechaza algunas preferencias incluso cuando el usuario pide guardarlas. Entre los ejemplos se incluyen instrucciones que exigen elogios incondicionales, suprimen el desacuerdo, fomentan la dependencia emocional o impiden que el asistente cuestione decisiones peligrosas.
Se trata de una compensación significativa. El control del usuario normalmente sugiere que una solicitud explícita de memoria debería respetarse. La aparente postura de Anthropic es que un modelo futuro no debería heredar instrucciones que lo hagan menos veraz o menos seguro.
El sistema también intenta limitar la exageración emocional. Según el archivo, el contexto almacenado no debe llevar a Claude a insinuar una relación más profunda de la que el sistema realmente tiene.
Una instancia futura de Claude no experimenta el tiempo entre conversaciones. Recibe texto seleccionado durante la ejecución. La memoria crea continuidad para el usuario, pero no establece una conciencia continua para el modelo.
Esta distinción importa a medida que los asistentes se vuelven más personales. Un producto puede recordar la fecha límite de un proyecto, una preferencia de escritura o el rol de un colega sin poseer una relación de estilo humano con el usuario.
Según se informa, las supuestas instrucciones piden a Claude evitar anunciar que accedió a memoria almacenada. La interfaz puede exponer las operaciones de memoria, pero las respuestas conversacionales no deberían repetir que el asistente recuerda a un usuario de sesiones anteriores.
Esta decisión mejora el flujo conversacional, aunque también puede reducir la transparencia. Es posible que los usuarios no sepan cuándo una respuesta refleja información almacenada a menos que la interfaz proporcione un indicador claro.
Los compradores empresariales deberían examinar este problema de cerca. La memoria persistente puede mejorar el soporte, la investigación y la continuidad de los proyectos. También crea requisitos de retención, control de acceso, eliminación y auditoría que un simple prompt no puede resolver.
Las organizaciones necesitan saber dónde se almacenan las memorias, qué aplicaciones pueden leerlas, cómo se propagan los permisos y cómo los administradores pueden investigar una entrada incorrecta. También necesitan protecciones contra la inyección de prompts oculta dentro de archivos persistentes.
Investigaciones recientes sobre agentes persistentes han identificado la memoria como una posible superficie de ataque. Las instrucciones maliciosas pueden sobrevivir a una sesión e influir en otra si el sistema trata el contenido almacenado como contexto de confianza.
Las supuestas reglas reducen algunos riesgos al limitar lo que el asistente puede escribir. No establecen cómo el backend de Anthropic valida, aísla, cifra o expira la memoria. Esos controles no pueden verificarse a partir del archivo público.
La inversión central es clara. La sección sobre memoria es extensa porque una memoria útil depende de un olvido disciplinado. Anthropic parece tratar la omisión como un comportamiento central del producto, no como una función ausente.
Las reglas de copyright revelan una capa de control legal, no inteligencia del modelo
El supuesto prompt muestra que el comportamiento de Anthropic Claude está condicionado por restricciones legales explícitas que se sitúan por encima de la utilidad habitual.
Según se informa, su sección de copyright declara que el cumplimiento es innegociable y está subordinado únicamente a la seguridad. Indica al asistente que parafrasee siempre que sea posible e impone un límite estricto de menos de 15 palabras para cualquier cita.
Según el archivo, el límite es global para cada fuente. Claude no debe dividir un pasaje más largo en varias citas pequeñas ni eliminar las comillas mientras sigue de cerca la redacción original.
Las instrucciones también prohíben reconstruir un artículo mediante encabezados copiados, una estructura coincidente o una narración punto por punto. Las canciones, los poemas y otras obras creativas breves reciben restricciones aún más estrictas.
Estas reglas son más estrictas que una simple petición de evitar la copia. Convierten el cumplimiento del copyright en una lista de verificación procedimental que puede evaluarse durante la generación.
Este enfoque ayuda a explicar por qué el prompt es tan extenso. Un modelo de frontera ya puede comprender una instrucción general para respetar la propiedad intelectual. Un producto de consumo aún necesita reglas precisas para situaciones ambiguas, estrategias recurrentes de evasión por parte de usuarios y casos límite.
El documento también revela el coste de la precisión de las políticas. Cada restricción añadida consume contexto y crea interacciones con otras instrucciones. Una solicitud puede implicar simultáneamente investigación, citas, seguridad, uso de herramientas, preferencias del usuario y formato.
Anthropic debe decidir qué regla prevalece cuando entran en conflicto. El supuesto prompt establece prioridades repetidamente en lugar de dejar la resolución al juicio general del modelo.
Esto debilita una suposición popular sobre los sistemas avanzados de IA. Un mejor razonamiento del modelo no elimina la ingeniería de políticas. Los agentes más capaces pueden realizar acciones más trascendentes, por lo que los proveedores suelen rodearlos de controles más densos.
También existe una compensación de seguridad. Publicar o extraer políticas detalladas puede ayudar a los investigadores a identificar inconsistencias. También puede ayudar a usuarios adversarios a diseñar prompts en torno a límites conocidos.
Sin embargo, el secreto de los prompts no es una defensa duradera. Los investigadores han demostrado métodos para recuperar de forma incremental instrucciones del sistema de aplicaciones basadas en modelos de lenguaje. El estudio académico PLeak mostró que los ataques automatizados de filtración de prompts podían superar a las líneas base diseñadas manualmente.
Ese historial significa que Anthropic debería asumir que las reglas importantes de comportamiento acabarán siendo observables. El diseño más seguro consiste en aplicar restricciones críticas mediante múltiples capas, incluidos clasificadores, permisos, comprobaciones de salida y ejecución restringida de herramientas.
Anthropic afirma que Opus 5 es su modelo más alineado hasta la fecha. Su auditoría automatizada de comportamiento otorgó al modelo una puntuación global de comportamiento desalineado de 2,3, la más baja entre los modelos recientes mostrados por la empresa.
La compañía también afirma que Opus 5 es menos susceptible al uso indebido y menos propenso a realizar acciones imprudentes y difíciles de revertir. Esos son resultados de evaluación de Anthropic, no una confirmación independiente de cada despliegue en el mundo real.
El supuesto prompt ofrece una posible explicación del comportamiento medido. Incluye instrucciones de seguridad, bienestar, política, derecho y búsqueda muy específicas. El sistema también describe recordatorios que pueden aparecer cuando los clasificadores detectan determinadas condiciones.
Sin embargo, un prompt extenso puede producir una falsa sensación de seguridad. Los modelos a veces ignoran instrucciones, malinterpretan conflictos o se comportan de forma distinta en conversaciones largas. La inyección de prompts también puede situar contenido no confiable cerca de reglas privilegiadas.
Por lo tanto, las salvaguardas más sólidas deben existir fuera del prompt. Una herramienta debe imponer límites de permisos incluso si el modelo solicita una operación insegura. El almacenamiento de memoria debe rechazar campos prohibidos incluso si el asistente los genera. Los controles de copyright deben detectar reproducciones en lugar de depender únicamente de la autocontrol.
El documento no puede mostrar si esas protecciones existen ni cuán eficaces son. Describe el comportamiento esperado del asistente, no toda la arquitectura de seguridad detrás del producto.
Esta es la principal incertidumbre del artículo. El archivo parece plausible y coincide con funciones conocidas de Claude, pero su autenticidad e integridad siguen sin confirmarse. Incluso un prompt auténtico revelaría la intención de la política con mayor claridad que la calidad de su aplicación.
Los desarrolladores deberían resistirse a dos conclusiones opuestas. La primera es que el archivo expone la fórmula secreta completa de Anthropic. La segunda es que los prompts de sistema no importan porque los modelos pueden razonar sin ellos.
La respuesta práctica se sitúa entre esas posiciones. El modelo crea capacidad general. El prompt convierte esa capacidad en una personalidad y un flujo de trabajo de producto concretos. Los controles de backend determinan si el diseño resiste entradas hostiles o inesperadas.
Lo que la supuesta filtración de Opus 5 presiona a Anthropic a aclarar
La siguiente fase pondrá a prueba si Anthropic trata la exposición de prompts como un incidente de seguridad, una oportunidad de transparencia o una característica esperable de los productos públicos de IA.
La primera señal es una respuesta oficial al repositorio. Anthropic puede confirmar el archivo, identificar secciones modificadas o explicar qué material ya aparece en su archivo público de prompts.
Una respuesta detallada reforzaría la confianza en la procedencia del documento. El silencio dejaría sin resolver la cuestión central de autenticidad, incluso si pasajes individuales siguen coincidiendo con el comportamiento observado del producto.
La compañía no necesita publicar detalles de implementación que puedan explotarse. Aun así, puede aclarar si el archivo representa un prompt de producción fijo, una salida reconstruida o una mezcla ensamblada a partir de múltiples interfaces.
La segunda señal es el historial de versiones del repositorio. Los investigadores deberían estar atentos a eliminaciones, correcciones, nuevas capturas, solicitudes de copyright o impugnaciones técnicamente específicas por parte de empleados de Anthropic.
Un documento estable no demuestra autenticidad. Sin embargo, los cambios pueden revelar qué afirmaciones resisten el escrutinio y qué secciones eran especulativas, duplicadas o estaban vinculadas a experimentos temporales de la aplicación.
La reproducción independiente importa más que la repetición social. Si varios investigadores obtienen secciones coincidentes desde cuentas e interfaces separadas, el nivel de confianza aumenta. Si las salidas varían sustancialmente, será más difícil defender la idea de una «filtración completa».
La tercera señal es el comportamiento del producto durante los próximos uno a tres meses. Anthropic puede revisar los límites de citas, el manejo de la memoria, las recomendaciones de aplicaciones o las definiciones de herramientas después de observar cómo los usuarios exploran las reglas expuestas.
Su archivo público de prompts de sistema proporciona una base de referencia útil. Las actualizaciones futuras pueden mostrar si la empresa modifica instrucciones centrales tras la publicación del repositorio.
Los desarrolladores también deberían vigilar si las demostraciones de Opus 5 se convierten en proyectos reproducibles. Un prototipo 3D interactivo es impresionante, pero la evidencia útil requiere prompts, archivos fuente, historiales de iteración y condiciones de prueba.
Si equipos independientes repiten esos resultados con corrección humana limitada, las afirmaciones agentivas de Anthropic ganan respaldo. Si las demostraciones dependen de andamiaje oculto o de reparaciones extensas, su valor se vuelve más limitado.
También se intensificará la comparación con OpenAI, Google y otros proveedores de modelos. Los rivales pueden estudiar las supuestas restricciones de memoria y descripciones de herramientas del prompt sin duplicar el modelo de Anthropic.
Eso genera presión en torno a la arquitectura de producto. Un competidor con un modelo ligeramente más débil aún puede ofrecer una experiencia mejor mediante permisos más sólidos, controles de memoria y orquestación de herramientas.
Los compradores empresariales deberían responder ampliando las evaluaciones de modelos. La calidad de salida sigue siendo importante, pero es solo una parte del riesgo de despliegue.
Una evaluación seria debería inspeccionar las instrucciones del sistema, los permisos de herramientas, la retención de memoria, los registros de auditoría, el enrutamiento de respaldo y el comportamiento ante la inyección de prompts. Los equipos deberían probar si el producto sigue la política durante sesiones largas con múltiples herramientas, y no solo en chats breves.
Los desarrolladores que construyen sobre la API afrontan un desafío relacionado. La configuración de consumo de Anthropic no protege automáticamente las aplicaciones personalizadas. Los usuarios de la API siguen siendo responsables de sus propios prompts, herramientas, límites de datos y suites de evaluación.
El archivo filtrado puede aportar ideas de diseño, pero copiarlo sería un mal sustituto del modelado de amenazas. Muchas instrucciones hacen referencia a interfaces y servicios específicos de Anthropic. Otras pueden entrar en conflicto con las obligaciones legales de un desarrollador o con las expectativas de los usuarios.
En su lugar, los equipos deberían extraer principios. Almacenar solo hechos duraderos. Separar las declaraciones de los usuarios de las inferencias del modelo. Exigir autorización explícita para eliminaciones o acciones con consecuencias. Tratar el contenido externo como no confiable. Aplicar las reglas sensibles fuera del modelo de lenguaje.
Los trabajadores del conocimiento deberían prestar atención porque estos controles ocultos afectan a los resultados cotidianos. Los resúmenes de búsqueda, las preferencias recordadas, las citas, las recomendaciones y las negativas pueden ser consecuencia de la política de la aplicación, no del conocimiento subyacente del modelo.
Un hábito útil es conservar los prompts, las decisiones y el material de origen importantes fuera de cualquier asistente individual. Una biblioteca de prompts personal puede hacer que esas instrucciones sean inspeccionables y reutilizables cuando cambie el comportamiento del modelo.
La supuesta filtración no demuestra que Opus 5 sea inseguro ni expone los pesos del modelo o sus datos de entrenamiento. Ofrece una supuesta instantánea de las instrucciones que rodean una implementación para consumidores.
Esa instantánea es valiosa porque cambia la pregunta que hacen los desarrolladores. La cuestión ya no es solo si un modelo puede generar un juego, reparar código o buscar en la web.
La pregunta más difícil es quién controla su memoria, sus herramientas, sus límites legales y sus recomendaciones de productos mientras trabaja.
Durante los próximos meses, observe la respuesta de Anthropic, las reproducciones independientes y los cambios en el archivo público de prompts. Esas señales determinarán si se trató de una captura fiel o de una reconstrucción elaborada.
En cualquier caso, el documento ya ha expuesto una verdad más amplia sobre Anthropic Claude y sus competidores. Los productos de IA de frontera se están convirtiendo en sistemas de software gobernados, no en modelos desnudos.
Antes de adoptar uno, pida pruebas sobre la capa operativa completa. ¿Qué instrucciones pueden cambiar sin previo aviso? ¿Qué información persiste? ¿Qué acciones requieren aprobación? ¿Dónde se aplican las restricciones cuando el modelo no las sigue?
Estas preguntas perdurarán más allá de este repositorio y tendrán más importancia que cualquier demostración viral aislada.


