top of page

Las señales de escritura de Claude Opus 5.5 cambiaron, pero no desaparecieron

hace 6 días
13 min de lectura

Las señales de escritura de Claude Opus 5.5 sobrevivieron a la revisión de estilo de Anthropic, pese a una reducción del 99% en el uso de rayas largas por parte del modelo. La señal más fuerte ahora es «fiable», que apareció 23 veces más en artículos escritos por el modelo que en trabajos humanos comparables.

Ese hallazgo procede del análisis de Graphite sobre artículos que cubrían 9.974 temas emparejados. Los investigadores identificaron 2.548 palabras, frases y patrones de oraciones que Opus 5.5 utilizó al menos el doble de veces que los escritores humanos.

El resultado complica la afirmación de Anthropic de que Opus 5.5 se comunica de forma más natural. Su vocabulario se acercó de manera medible a la escritura humana, pero persistieron miles de diferencias estadísticas. El modelo no perdió su huella lingüística. Sustituyó varios hábitos conocidos por una nueva colección de preferencias.

GPT-6 Astra de OpenAI produjo otro patrón distintivo. Matizó las afirmaciones con mayor frecuencia y se apoyó en marcos correctivos, mientras que Opus favoreció los superlativos y las declaraciones de importancia. La comparación convierte la detección de escritura con IA en un problema de objetivo móvil. Cada versión del modelo modifica las pruebas que editores, docentes y lectores creen reconocer.

Una preferencia 23 veces mayor reveló el nuevo patrón de Opus

Las señales más recientes de escritura de Claude Opus 5.5 son palabras comunes que se vuelven inusuales por la repetición.

Graphite publicó su actualización sobre Opus 5.5 después de que Anthropic lanzara el modelo el 22 de septiembre de 2026. La investigación amplió un análisis anterior realizado sobre diez modelos de IA y una colección de control humana.

Los investigadores utilizaron 9.974 temas para los que cada modelo y el corpus humano contaban con un artículo correspondiente. Los artículos humanos se publicaron antes del lanzamiento de ChatGPT, lo que redujo la posibilidad de que esas muestras contuvieran contenido de IA generativa sin identificar.

Cada modelo recibió un resumen y generó un nuevo artículo sobre el mismo tema. Este enfoque redujo las diferencias temáticas, aunque no pudo eliminar todos los efectos provocados por las instrucciones o la selección de fuentes.

Después, los investigadores compararon frecuencias de palabras y frases normalizadas por longitud. También estudiaron marcos, que son patrones lingüísticos recurrentes con espacios que pueden contener hasta tres palabras.

Según la definición de Graphite, una señal aparece al menos el doble de veces en la escritura con IA que en la colección humana. Los filtros de frecuencia excluyen expresiones que aparecen solo en un puñado de documentos.

El estudio sobre escritura con IA resultante encontró 2.548 señales de Opus 5.5. Esa cifra fue solo un 4% inferior a las 2.666 registradas para Opus 5.

«Fiable» encabezó los adjetivos valorativos del modelo, con una frecuencia 23 veces superior a la humana. «Estable» apareció 11 veces más, mientras que «reflexivo» apareció nueve veces más. «Significativo» alcanzó ocho veces la frecuencia humana.

Esas palabras no son artificiales por naturaleza. Un escritor humano puede calificar razonablemente un servicio de fiable o describir una respuesta como reflexiva. Su valor reside en el comportamiento agregado, no en apariciones aisladas.

El lenguaje de transición también fue distintivo. «De cara al futuro, el» apareció con una frecuencia 40 veces superior a la humana. «Añade otra capa» alcanzó 27 veces, y «lo que viene después» llegó a 24 veces.

Opus 5.5 también mantuvo una preferencia por el contraste. El patrón «es más que un _ que» apareció 98 veces más que en artículos humanos. «En lugar de simplemente» apareció con una frecuencia 32 veces superior a la humana.

Su categoría más fuerte implicaba señalar importancia. «Esto importa» apareció 116 veces más que en la colección humana. «Por qué _ importa» apareció 92 veces más.

Estas cifras no significan que todos los artículos de Opus contengan esas frases. Describen la frecuencia relativa en un corpus grande y controlado. Una frase poco frecuente puede producir una proporción elevada cuando los humanos casi nunca la utilizan.

Esa distinción importa para cualquiera que se sienta tentado a tratar una expresión aislada como prueba. El estudio traza hábitos a nivel poblacional. No ofrece un veredicto fiable de autoría para un párrafo, correo electrónico o ensayo estudiantil.

La conclusión más defendible es más limitada. Opus 5.5 recurre repetidamente a determinadas frases valorativas y organizativas cuando convierte resúmenes en artículos. Esas preferencias siguen siendo visibles incluso después de una importante revisión de estilo.

Las señales conocidas de escritura con IA ya están obsoletas

La raya larga dejó de ser un atajo útil porque el comportamiento de los modelos cambió más rápido que los consejos populares de detección.

Durante varios años, los lectores trataron las rayas largas como una marca informal de texto generado. Esta puntuación se asoció con Claude porque las versiones anteriores la utilizaban con frecuencia.

Opus 5.5 abandonó en gran medida ese hábito. Graphite midió 0,015 rayas largas por cada 1.000 palabras, frente a 2,92 en Opus 5. Eso representa una caída de aproximadamente el 99%.

Una evaluación independiente produjo un resultado similar en la misma dirección. Un investigador de Arize generó 57.000 palabras con Opus 5.5 y encontró solo dos rayas largas. Su muestra de Opus 5 produjo 12,9 por cada 1.000 palabras.

Esa prueba independiente de escritura de menor escala utilizó 20 encargos fijos en cinco géneros y cinco áreas temáticas. El investigador marcó manualmente 153 ejemplos antes de crear un evaluador automatizado.

El conjunto de datos era mucho menor que el corpus de Graphite, pero comparó directamente el modelo revisado de Anthropic con su predecesor. Descubrió que otros «Claudismos» reconocibles se redujeron aproximadamente a la mitad, en vez de desaparecer.

El cambio genera una inversión incómoda. Los escritores humanos ahora corren el riesgo de despertar sospechas por una puntuación que los modelos de frontera actuales rara vez utilizan.

Un desarrollador de modelos puede suprimir un hábito evidente mediante posentrenamiento, instrucciones de sistema o preferencias de salida generada. Los usuarios también pueden solicitar una puntuación distinta con una sola frase en una instrucción.

Eso vuelve frágiles las pistas superficiales. «Profundizar», las rayas largas, listas ordenadas de tres partes y conclusiones pulidas pueden describir un estilo. Ninguna demuestra la autoría.

El mismo problema afecta a los detectores comerciales de IA. Un clasificador entrenado con los modelos de ayer puede perder precisión después de que un proveedor modifique el comportamiento de salida. El modelo subyacente puede conservar el mismo nombre mientras su estilo cambia mediante una actualización.

Los falsos positivos tienen consecuencias reales. Un docente podría acusar a un estudiante que escribe naturalmente en prosa formal. Un editor podría aplanar la puntuación distintiva de un colaborador para evitar sospechas automatizadas.

Los falsos negativos son igual de fáciles de producir. Un usuario puede solicitar longitudes de oración irregulares, eliminar frases preferidas o pedir a un segundo modelo que reescriba la primera salida. La edición humana puede borrar patrones evidentes sin cambiar el origen del texto.

La respuesta práctica consiste en evaluar conjuntamente la procedencia, el respaldo factual y el historial de revisiones. La evidencia estilística puede impulsar una revisión más minuciosa, pero no debería decidir el caso por sí sola.

Para los equipos profesionales, eso implica conservar notas de fuentes y borradores. Una base de conocimiento personal con capacidad de búsqueda puede ayudar a conectar las afirmaciones con sus pruebas y registrar cómo se desarrolló un documento.

Ese flujo de trabajo aborda el riesgo real de calidad. El uso no revelado de IA puede importar, pero las afirmaciones sin respaldo y la falta de responsabilidad suelen crear el mayor problema operativo.

Por tanto, los hallazgos de Graphite debilitan el argumento a favor de reglas de detección simples. Refuerzan el argumento a favor de evidencia de proceso, revisión editorial y políticas transparentes.

Anthropic mejoró el estilo sin borrar la huella

Opus 5.5 se acercó estadísticamente a la escritura humana y, al mismo tiempo, conservó casi tantas señales medibles como Opus 5.

Anthropic presentó Opus 5.5 con una afirmación directa sobre comunicación. La empresa dijo que el modelo escribe de forma más natural, coloca primero la información importante y evita más jerga y formulaciones idiosincráticas.

Según se informó, los primeros evaluadores encontraron la prosa más clara y fácil de seguir. Anthropic también presentó una mejor comunicación como un beneficio de seguridad, ya que los lectores podían examinar el trabajo del modelo con mayor facilidad.

Los resultados de Graphite respaldan parcialmente esa posición. Los investigadores midieron la divergencia de distribución de palabras mediante la divergencia de Jensen-Shannon, una estadística que compara dos distribuciones de probabilidad.

Una puntuación de cero indicaría un uso idéntico de palabras. Una puntuación de uno indicaría que no hay solapamiento.

Opus 5 obtuvo 0,064 frente a la escritura humana. Opus 5.5 descendió a 0,052, una reducción del 19%. Eso significa que su distribución general de palabras se acercó al corpus humano.

El modelo también mejoró en «prosa afectada», que Anthropic define como lenguaje que sustituye las afirmaciones directas por florituras o metáforas. Graphite informó de una puntuación de 10,57 para Opus 5.5, un 37% menos que los 16,75 de Opus 5.

Los artículos humanos obtuvieron 6,65. GPT-6 Astra obtuvo 7,91. Por tanto, Opus mejoró sustancialmente, aunque siguió siendo más afectado que cualquiera de los dos grupos de comparación.

El resultado sobre prosa afectada requiere una interpretación cuidadosa. Graphite utilizó Claude Opus 5 para puntuar una submuestra de 1.000 temas emparejados en una escala de cero a 100.

El evaluador no sabía qué modelo había producido cada artículo. Aun así, su juicio refleja la interpretación de otro modelo, no una medición mecánica.

El recuento de señales crea la tensión central. Opus 5.5 presentó una mejor similitud general de vocabulario, pero sus 2.548 señales fueron solo un 4% menos que el total de Opus 5.

Esos resultados miden propiedades distintas. La similitud distribucional pregunta cómo se compara todo el vocabulario con la escritura humana. Un recuento de señales pregunta cuántos patrones específicos superan un umbral de frecuencia.

Un modelo puede mejorar en la primera medida sin eliminar la segunda. Las elecciones amplias de vocabulario pueden volverse más humanas mientras los hábitos específicos permanecen muy concentrados.

El anuncio de Opus 5.5 de Anthropic también destacó un rendimiento más sólido en trabajo de conocimiento. En una tarea de investigación interna, 16 de 18 informes superaron un umbral estricto de calidad en distintos ajustes de esfuerzo.

Anthropic afirmó que un número o una cita inventados harían que un informe fracasara. Según la empresa, los modelos anteriores Opus y Fable no superaron ese umbral en ningún intento.

Esos resultados internos son relevantes porque la prosa natural y la investigación fiable son dimensiones separadas. Una frase repetitiva no hace que un informe sea factualmente incorrecto. Un lenguaje que suena humano no hace que una afirmación sea precisa.

El argumento más amplio de la empresa se refiere a la usabilidad. Una escritura más clara puede reducir el tiempo de revisión incluso cuando un editor todavía puede identificar patrones estilísticos recurrentes.

La investigación de Graphite no refuta esa mejora. Le pone un límite. Opus 5.5 parece más humano en conjunto, pero «más humano» no equivale a indistinguible.

Opus y Astra dejan huellas lingüísticas diferentes

La competencia importante no enfrenta la prosa humana con un estilo fijo de IA, sino las huellas cambiantes de los modelos con supuestos estables de detección.

GPT-6 Astra no se limitó a rendir mejor o peor que Opus 5.5. Mostró una colección diferente de hábitos.

Astra matizó las afirmaciones con mayor frecuencia. «Puede proporcionar» apareció 18 veces más en Astra que en Opus 5.5. «No necesariamente» apareció 17 veces más.

La frase «no establece» mostró una diferencia aún mayor, al alcanzar 275 veces la frecuencia de Opus 5.5. Estos patrones sugieren que Astra suele proteger una afirmación con límites explícitos.

Opus 5.5 se apoyó más en los superlativos. En comparación con Astra, utilizó «el más popular» 45 veces más y «el más potente» 24 veces más.

«Quizá el más» apareció 29 veces más. El marco «una de las mejores _ sobre» alcanzó 79 veces la frecuencia de Astra.

Ese contraste afecta al tono. Astra puede sonar cauteloso o correctivo. Opus puede sonar más evaluativo y seguro, especialmente al asignar importancia.

Ethan Smith, CEO de Graphite, describió el patrón como una diferencia, no como un progreso constante. Cada nuevo modelo puede mejorar en una dimensión mientras desarrolla otra cadencia reconocible.

La cobertura sectorial citada llegó a la misma conclusión. Una comparación de modelos señaló que el estudio evaluó diez modelos sobre los mismos 9.974 temas.

La distribución de palabras de Opus 5.5 se acercó a la de los humanos. Astra se alejó de ella, pasando de 0,101 en GPT-5.6 Sol a 0,109.

Sin embargo, Astra produjo una prosa menos afectada que Opus. Eso impide una clasificación simple basada en una sola puntuación.

Un usuario podría preferir la franqueza de Astra y, al mismo tiempo, rechazar sus matices excesivos. Otro podría preferir la fluidez de Opus y eliminar superlativos innecesarios durante la edición.

Los hallazgos también complican la atribución de modelos. Un pasaje puede contener rasgos asociados a varios sistemas porque los usuarios combinan herramientas en un mismo flujo de trabajo.

Un modelo podría investigar, otro redactar y un tercero editar. Después, una persona podría revisar el resultado antes de su publicación.

Los prompts añaden otra capa. Prohibir explícitamente una frase puede alterar su frecuencia. Pedir un lenguaje científico cauteloso puede hacer que Opus se parezca a Astra en una dimensión.

Los sistemas ajustados y las instrucciones a nivel de aplicación generan más variación. El resultado que ve un usuario puede reflejar el modelo del proveedor, el prompt de sistema de la aplicación y la solicitud del usuario.

Por eso, la expresión «estilo de IA» se ha vuelto demasiado amplia. Los modelos de frontera ya no comparten una voz estable, incluso cuando repiten algunas estructuras conocidas.

La presión competitiva recae tanto sobre los laboratorios de modelos como sobre los proveedores de detección de IA. Los laboratorios buscan una prosa que se adapte a la intención del usuario. Los proveedores de detección necesitan sistemas que resistan cambios rápidos en los modelos.

Los editores afrontan otra presión. Deben distinguir entre la repetición estilística inocua y los defectos que perjudican la precisión, la claridad o la confianza.

Una frase que dice «esto importa» puede ser tediosa, pero no es automáticamente falsa. Una frase elegante con una fuente inventada es mucho más grave.

La lección útil no es buscar una única señal sustitutiva. Es reconocer que la prosa generada presenta firmas estadísticas cambiantes, ninguna de las cuales debe sustituir el criterio editorial.

El estudio no puede identificar quién escribió un pasaje concreto

Graphite midió diferencias a nivel de corpus, no una prueba forense para documentos o autores individuales.

La escala del estudio hace persuasivos sus hallazgos agregados. Su diseño también impone límites a la forma en que deben utilizarse esos hallazgos.

En primer lugar, el experimento se centró en la generación de artículos a partir de resúmenes. No describe automáticamente correos electrónicos, ficción, análisis jurídico, ensayos académicos ni conversaciones informales.

Las distintas tareas cambian el lenguaje de un modelo. Un informe técnico puede incluir de forma natural más matices. Un texto de marketing puede contener de forma natural más superlativos.

En segundo lugar, los artículos de control humanos eran anteriores a ChatGPT. Eso protege la línea de base frente a una contaminación evidente, pero introduce una diferencia temporal.

Las convenciones editoriales cambian. La optimización para buscadores cambia. Los editores modifican las estructuras de los titulares, la longitud de los párrafos y la puntuación preferida.

Algunas diferencias atribuidas a los modelos podrían reflejar en parte el entorno de escritura contemporáneo. El diseño de temas emparejados de Graphite reduce el sesgo de contenido, pero no puede eliminar todas las diferencias históricas.

En tercer lugar, las proporciones de frecuencia pueden exagerar comportamientos poco comunes. Si los humanos casi nunca usan una frase, un número modesto de usos por parte de un modelo puede generar un múltiplo llamativo.

Los investigadores aplicaron requisitos de frecuencia mínima para abordar ese problema. Las palabras debían aparecer en al menos 500 artículos de modelos para una de las clasificaciones, mientras que otros análisis utilizaron sus propios umbrales.

Incluso con esos filtros, una proporción necesita su tasa base. «Esto importa» a 116 veces la tasa humana parece concluyente, pero no muestra cuántas veces apareció la frase por artículo.

En cuarto lugar, los resultados reflejan versiones específicas de los modelos y configuraciones experimentales. Las actualizaciones de los proveedores, los ajustes de inferencia, los prompts de sistema y las instrucciones de los usuarios pueden cambiar el resultado.

En quinto lugar, el estudio procedía de Graphite, una empresa de marketing y crecimiento, no de un laboratorio académico independiente. Sus investigadores publicaron los datos subyacentes sobre las señales y los artículos sin procesar, lo que facilita el escrutinio externo.

La replicación independiente sigue siendo valiosa. Los investigadores deberían probar otros géneros, idiomas, diseños de prompts y líneas de base humanas. También deberían informar de frecuencias absolutas junto a proporciones relativas.

La prueba inicial de Arize ofrece una comparación útil. Respaldó la fuerte reducción de los guiones largos, al tiempo que concluyó que persistían hábitos estilísticos más amplios.

Aun así, sus 20 briefs no pueden validar todos los resultados de casi 10.000 temas alineados. Los dos proyectos utilizaron diseños diferentes y respondieron preguntas distintas.

La cobertura externa más sólida ha mantenido visibles esos límites. La cobertura original sobre señales de escritura describió los hábitos del modelo sin afirmar que ninguna frase pruebe la autoría de IA.

Los lectores deberían aplicar la misma cautela. Una frase sospechosa puede motivar una pregunta. No puede responderla por sí sola.

Para los editores, una revisión más fiable pregunta si las afirmaciones tienen fuentes, si las citas coinciden con los originales y si las conclusiones se derivan de la evidencia. También pregunta quién asume la responsabilidad por el texto final.

Para los centros educativos, las políticas de autoría deberían definir la asistencia aceptable antes de que surjan disputas. El historial de borradores, las citas y el seguimiento oral aportan pruebas más sólidas que la puntuación o el vocabulario por sí solos.

Para las empresas, las normas de divulgación deberían ajustarse al riesgo. Un resumen interno rutinario no requiere los mismos controles que una orientación médica, un análisis financiero o una información pública.

El estudio revela tendencias, no culpabilidad. Tratarlo como un detector convertiría una investigación descriptiva cuidadosa en una herramienta de aplicación poco fiable.

Tres señales mostrarán si las nuevas características perduran

La próxima prueba es determinar si la huella actual de Opus 5.5 resiste la replicación, los prompts de los usuarios y la próxima actualización del modelo.

La primera señal es la reproducción independiente de los resultados de Graphite. Los investigadores deben generar corpus comparables con distintos prompts, géneros y muestras humanas.

Si «fiable», «esto importa» y las estructuras de contraste siguen elevadas, se refuerza el argumento a favor de una firma persistente de Opus 5.5. Si desaparecen con pequeños cambios en los prompts, son señales débiles de atribución.

La segunda señal es la rapidez con que Anthropic modifica el lenguaje del modelo. La empresa respondió claramente a las críticas sobre el estilo de comunicación de Opus 5.

Una actualización posterior podría reducir las señales actuales con la misma contundencia con que Opus 5.5 redujo los guiones largos. Eso confirmaría que los rasgos estilísticos visibles son comportamientos de producto ajustables.

La tercera señal es si los proveedores de detección publican evaluaciones específicas por versión. Un detector debería probarse con modelos actuales, flujos de trabajo mixtos entre humanos e IA y resultados editados.

Las afirmaciones sobre precisión también necesitan tasas de falsos positivos en distintas comunidades de escritura. Los escritores no nativos de inglés, los especialistas técnicos y las personas con estilos formales no deberían convertirse en daños colaterales.

El futuro más útil podría basarse en la procedencia, en lugar de conjeturas lingüísticas. Registros de generación firmados, borradores conservados y una divulgación clara podrían establecer el proceso sin pretender que la prosa por sí sola revele su origen.

Para los escritores, la acción inmediata es sencilla. Revisen los borradores en busca de palabras evaluativas repetidas, contrastes prefabricados, superlativos innecesarios y frases que anuncian importancia en lugar de demostrarla.

Después, verifiquen cada afirmación factual. Eliminen la seguridad sin respaldo. Mantengan la puntuación inusual cuando sirva a la frase, en lugar de eliminarla para evitar sospechas.

Las señales de escritura de Claude Opus 5.5 proporcionan una valiosa lista de verificación editorial, pero no son un veredicto. ¿Usarán los editores los hallazgos para mejorar la revisión o convertirán otro patrón temporal en un atajo poco fiable?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page