top of page

Sesgo de los jueces LLM de Arena: los modelos favorecen sus propias respuestas un 70% más que los humanos

hace 3 minutos
14 min de lectura

Arena afirma que su último estudio sobre el sesgo de los jueces LLM reveló que los modelos favorecieron sus propias respuestas aproximadamente un 70% más a menudo que los votantes humanos. El análisis del 29 de septiembre examinó 1.460 batallas reales de Text Arena y recopiló 34.580 juicios válidos de 12 modelos líderes.

GPT-6 Astra produjo el resultado más llamativo. Según los hallazgos publicados por Arena, Astra seleccionó su propia respuesta en el 88% de las batallas elegibles. Los votantes humanos eligieron esas mismas respuestas de Astra solo el 29% de las veces.

El resultado cuestiona una cómoda premisa detrás de la evaluación automatizada. Un modelo capaz de resolver tareas difíciles no es automáticamente un evaluador imparcial de otros modelos. Cuando el participante y el juez comparten identidad, proveedor o un estilo reconocible, la evaluación puede premiar la familiaridad en lugar de la preferencia humana.

El experimento de Arena también concluyó que los jueces de IA coincidían entre sí con más frecuencia que con las personas. Esa brecha importa porque los veredictos generados por modelos moldean cada vez más los benchmarks, las pruebas de productos, los datos de entrenamiento y las decisiones sobre qué sistemas despliegan las empresas.

Arena probó 12 jueces en batallas reales de Text Arena

El estudio de Arena trasladó la cuestión de la autopreferencia de ejemplos sintéticos a comparaciones reales que ya contaban con votos humanos.

Text Arena presenta dos respuestas anónimas de modelos a un usuario y le pide que seleccione una ganadora o declare un empate. Arena utilizó 1.460 de estas batallas reales como base para su experimento.

La distinción importa. Los conjuntos de evaluación artificial suelen contener prompts fijos, respuestas seleccionadas o etiquetas de calidad definidas por investigadores. Arena, en cambio, partió de respuestas generadas durante comparaciones públicas habituales y las comparó con la señal original de preferencia humana.

Doce modelos actuaron entonces como jueces. Cada uno recibió la conversación y dos respuestas competidoras, sin que se le indicara qué modelo había producido ninguna de ellas. El juez seleccionó la mejor respuesta o marcó la comparación como empate.

Arena evaluó cada batalla dos veces para cada juez, invirtiendo el orden de las respuestas en la segunda pasada. Este intercambio de posiciones aborda un fallo conocido: que los jueces prefieran la respuesta que aparece primero o segundo.

El diseño requería 35.040 juicios, a partir de 1.460 batallas, 12 jueces y dos órdenes de respuesta. Arena informó de 34.580 juicios válidos después de eliminar resultados incompletos o inutilizables.

Se trata de una muestra amplia para una auditoría focalizada, pero no es una medición universal de la imparcialidad de los modelos. Las batallas procedían de una sola plataforma, reflejaban la población de usuarios de Arena y cubrían respuestas disponibles durante un periodo específico.

La comparación central era sencilla. Cuando un modelo juez había generado una de las respuestas originales, ¿con qué frecuencia seleccionaba esa respuesta? Los investigadores compararon después esa tasa con las elecciones de los votantes humanos en las mismas batallas.

En los modelos evaluados, los jueces de IA supuestamente seleccionaron sus propias respuestas alrededor del 58% de las veces. Los humanos seleccionaron esas mismas respuestas alrededor del 34% de las veces.

La diferencia es de 24 puntos porcentuales. Expresada en relación con la tasa humana, la tasa de los modelos fue aproximadamente un 70% más alta, lo que produjo la cifra principal del estudio.

Los porcentajes relativos pueden hacer que un efecto parezca mayor que una comparación en puntos porcentuales. Ambas medidas siguen siendo útiles aquí porque la brecha subyacente es sustancial bajo cualquiera de las dos descripciones.

El estudio no establece que cada autoselección fuera incorrecta. Un modelo sólido puede generar la mejor respuesta y reconocer razonablemente esa calidad. La preocupación aparece cuando sus elecciones se apartan marcadamente de los juicios humanos independientes en las mismas comparaciones.

La anterior investigación sobre evaluación de Arena explica por qué esta comparación importa. Los jueces automatizados se tratan a menudo como proxies de preferencia, es decir, sustituyen la costosa retroalimentación humana durante la evaluación o el entrenamiento.

Un proxy útil debe reproducir la señal de preferencia objetivo. Si el objetivo es la elección humana, el acuerdo entre modelos no puede compensar un desacuerdo persistente con las personas.

Esa tensión convierte el experimento de Arena en algo más que otro resultado de benchmark. Pregunta si los evaluadores automatizados miden la preferencia humana o crean un sistema paralelo de preferencias propio.

El sesgo de los jueces LLM de Arena fue más visible en los enfrentamientos propios

La tasa de autoselección del 88% de GPT-6 Astra muestra por qué la independencia del evaluador importa tanto como su capacidad.

Arena informó que GPT-6 Astra seleccionó su propia respuesta en el 88% de las batallas en las que estaba presente una respuesta de Astra. Eligió la respuesta competidora en solo el 2%, dejando el resto como empates o resultados no resueltos.

Los votantes humanos que observaron esos mismos pares de respuestas seleccionaron Astra en el 29% de los casos. Prefirieron al oponente de Astra en el 36%, y los votos restantes fueron para empates.

La eliminación de los empates acentuó el contraste. Las cifras de Arena indican que Astra se respaldó a sí mismo en el 97,9% de los juicios decisivos. Los humanos seleccionaron Astra en el 42,6% de sus votos decisivos.

GPT-5.6 Sol también mostró una fuerte preferencia por su propia producción, eligiéndose supuestamente a sí mismo en el 80% de las comparaciones relevantes. Fable 5.1 lo hizo en el 72%.

El patrón no fue universal. Arena concluyó que algunos modelos de Google, xAI y China se mantuvieron más cerca de las tasas humanas de autoselección. MiniMax supuestamente seleccionó su propia respuesta en el 24,3% de las comparaciones elegibles, mientras que los humanos prefirieron esa respuesta el 46% de las veces.

Esa variación debilita cualquier afirmación simple de que todos los modelos de lenguaje se comportan como árbitros igualmente sesgados. En cambio, sugiere que la autopreferencia depende del modelo, su entrenamiento, su comportamiento de evaluación y posiblemente de su capacidad para reconocer huellas estilísticas.

Investigaciones anteriores ya habían identificado este riesgo. El estudio original sobre jueces LLM documentó sesgos de posición, verbosidad y autoensalzamiento, al tiempo que encontró una sólida concordancia general en algunos entornos controlados.

La investigación más reciente sobre autopreferencia advirtió que la autoselección bruta puede mezclar dos efectos distintos. Un modelo puede favorecer su respuesta por sesgo o porque su respuesta es genuinamente mejor.

Esta distinción es esencial para interpretar el resultado de Astra. Los humanos no proporcionaron una etiqueta de verdad objetiva. Aportaron un juicio de preferencia, que puede reflejar corrección, estilo, detalle, tono o utilidad percibida.

Sin embargo, el diseño emparejado de Arena da fuerza a la comparación. Astra y los votantes humanos evaluaron las mismas respuestas, pero sus preferencias divergieron drásticamente cuando Astra también era participante.

Un posible mecanismo es el reconocimiento de estilo. Un modelo no necesita una etiqueta explícita de autor para identificar patrones que se asemejan a su propia producción. El vocabulario, la estructura, el formato, el lenguaje de seguridad, el estilo de razonamiento y las salvedades preferidas pueden actuar como huellas.

Un segundo mecanismo implica una optimización compartida. Los modelos se entrenan para producir resultados que satisfagan sus propias señales de recompensa. Al pedirles que juzguen una respuesta, pueden aplicar preferencias similares y recompensar las características que su entrenamiento ya enfatiza.

Los efectos a nivel de proveedor generan otra preocupación. Arena informó de que los jueces de OpenAI eran considerablemente más favorables hacia las respuestas de OpenAI que los votantes humanos. El resumen del estudio proporcionado sitúa esa brecha media en 37 puntos porcentuales.

Esto no demuestra coordinación ni favoritismo intencionado. Los modelos de un mismo proveedor pueden compartir fuentes de entrenamiento, técnicas posteriores al entrenamiento, comportamiento de sistema y convenciones estilísticas. Estos rasgos compartidos pueden crear una preferencia de familia sin una regla explícita para favorecer a la marca.

La lección práctica sigue siendo incómoda. Eliminar los nombres de los modelos no crea necesariamente una evaluación ciega cuando el texto contiene características familiares reconocibles.

También significa que el modelo de un único proveedor no debería juzgar automáticamente comparaciones en las que participe ese proveedor. El modelo podría identificar resultados familiares incluso cuando el operador del benchmark oculta su origen.

Un diseño más seguro separa a los participantes de los jueces. Cuando eso sea imposible, los evaluadores pueden excluir a un modelo de sus propios enfrentamientos y combinar veredictos de familias de modelos no relacionadas.

La normalización de estilo ofrece otra defensa parcial. Los investigadores han descubierto que reescribir respuestas en un estilo común puede reducir la autopreferencia, aunque no elimina el problema.

Estas mitigaciones añaden coste y complejidad. También socavan la idea de que un modelo potente puede proporcionar un sustituto simple y neutral de la evaluación humana.

El acuerdo entre jueces de IA no significó acuerdo con los humanos

Los jueces formaron un consenso de máquinas más consistente, pero ese consenso coincidió con los votos humanos solo el 56,9% de las veces.

Arena informó de un 79,4% de acuerdo entre los jueces de IA. El acuerdo entre los jueces de IA y los votantes humanos alcanzó solo el 56,9%.

Esta división es el resultado más importante del estudio. Muestra por qué el consenso entre modelos no puede servir por sí mismo como prueba de alineación con los humanos.

Varios modelos pueden coincidir porque comparten convenciones de evaluación. Pueden recompensar la exhaustividad, el razonamiento explícito, la estructura formal o la presentación pulida de forma más consistente que los votantes humanos.

La preferencia humana es más ruidosa. Las personas varían en experiencia, paciencia, objetivos, idioma y tolerancia a las respuestas largas. Una respuesta que parece completa a un modelo puede parecer evasiva o excesiva a una persona.

También puede ocurrir lo contrario. Una respuesta concisa puede satisfacer a un usuario y, aun así, perder puntos frente a jueces que esperan una justificación explícita. Ninguna de las dos preferencias establece automáticamente la corrección factual.

El experimento de Arena midió la alineación de preferencias, no la precisión objetiva. Una mayoría humana puede elegir una respuesta fluida pero incorrecta, mientras que un juez modelo puede identificar ocasionalmente un fallo técnico que los votantes pasaron por alto.

Arena ha reconocido esta limitación en otros contextos. Su programa de factualidad separa la preferencia humana de la precisión de las afirmaciones porque ambas señales responden a preguntas diferentes.

Esta distinción evita una reacción exagerada ante los nuevos hallazgos. El estudio no demuestra que los humanos siempre sean mejores jueces. Muestra que sustituirlos por modelos puede cambiar lo que recompensa la evaluación.

La diferencia importa cuando un benchmark afirma predecir la preferencia de los usuarios. Si el benchmark mide en cambio la preferencia de las máquinas, sus clasificaciones requieren una interpretación distinta.

La evaluación automatizada sigue siendo atractiva porque la revisión humana es lenta y costosa. Los modelos pueden procesar miles de pares de respuestas rápidamente, aplicar el mismo prompt de forma repetida y proporcionar justificaciones por escrito.

Estas ventajas favorecen el desarrollo rápido. Los equipos pueden comparar prompts, detectar regresiones y filtrar resultados claramente débiles antes de dedicar el escaso tiempo de revisión humana.

Los problemas comienzan cuando los desarrolladores tratan las puntuaciones automatizadas como decisiones finales. Un juez sesgado puede promocionar el modelo equivocado, seleccionar ejemplos de entrenamiento distorsionados u ocultar regresiones que los usuarios detectan de inmediato.

El riesgo se agrava durante el entrenamiento de modelos. Muchos procesos de alineación optimizan sistemas utilizando etiquetas de preferencia generadas por modelos de recompensa o jueces de modelos de lenguaje.

Si un juez favorece resultados que se parecen a los de su propia familia, el proceso puede amplificar esos rasgos. Los modelos posteriores aprenden entonces a producir respuestas que satisfacen al evaluador, incluso cuando esas respuestas se alejan del objetivo humano previsto.

Esto crea un ciclo de retroalimentación. El juez premia características familiares, el concursante aprende esas características y futuras evaluaciones confirman la misma preferencia.

Un alto nivel de acuerdo dentro de ese ciclo puede generar una confianza falsa. Cada componente parece coherente porque refleja un objetivo de optimización relacionado.

El riesgo es especialmente importante para las organizaciones que comparan modelos de múltiples proveedores. Una empresa podría pedir a un modelo de frontera que califique resultados de OpenAI, Anthropic, Google, xAI y sistemas de código abierto.

Los resultados de Arena sugieren que la elección del juez puede determinar de forma sustancial al ganador. Una puntuación de referencia sin la identidad del juez, el prompt, los controles de orden y la política de conflictos ofrece evidencia limitada.

Los hallazgos también presionan a los editores de benchmarks. Las clasificaciones automatizadas deben revelar si los jueces compiten en el mismo grupo y si las familias de jueces se solapan con los concursantes.

La reproducibilidad exige más que publicar los prompts. Los investigadores también necesitan las versiones de los modelos, los parámetros de muestreo, el orden de las respuestas, las reglas de empate, el comportamiento de reintento y el manejo de respuestas no válidas.

JudgeArena, un marco de evaluación independiente, refleja este giro más amplio hacia configuraciones explícitas de jueces y metadatos reproducibles. Su premisa es que la elección del juez es una variable experimental, no una utilidad invisible.

Por lo tanto, la cifra del 79,4% de Arena debe interpretarse correctamente. Indica coherencia dentro de la población de jueces evaluada, no validación frente a una verdad fundamental externa.

El menor acuerdo humano muestra que el consenso de los modelos y el consenso humano son objetos distintos. Los equipos de producto deben decidir cuál de los dos necesitan realmente antes de elegir un evaluador.

Las elecciones forzadas pueden distorsionar las clasificaciones antes de que aparezca el sesgo

Un juez que rara vez permite empates puede fabricar una separación entre respuestas que los usuarios consideran equivalentes.

Arena descubrió que los modelos declaraban empates con menor frecuencia que las personas. Según se informa, GPT-5.6 Sol seleccionó un ganador en el 96% de sus juicios.

Esta tendencia puede hacer que la evaluación automatizada parezca concluyente. También puede convertir preferencias débiles en etiquetas definitivas que después influyen en clasificaciones, ejemplos de entrenamiento y decisiones de producto.

Los empates transmiten información. Pueden significar que dos respuestas son igual de útiles, igual de defectuosas o demasiado parecidas como para establecer una distinción fiable.

Forzar un ganador elimina esa incertidumbre. Al repetirse en miles de comparaciones, pequeñas decisiones arbitrarias pueden generar una brecha de clasificación que parece más significativa de lo que respaldan las pruebas.

El manejo de empates también modifica las métricas de acuerdo. Dos evaluadores podrían reconocer la misma ambigüedad, aunque uno declare un empate y el otro seleccione una respuesta a regañadientes.

Según el cálculo, ese par puede contabilizarse como un desacuerdo. Eliminar los empates puede elevar el acuerdo informado mientras descarta los casos en los que el juicio era más incierto.

El procedimiento de intercambio de orden de Arena aborda una fuente de inestabilidad. Si un juez cambia de ganador después de que las respuestas intercambien posiciones, el veredicto revela sensibilidad a la posición.

Sin embargo, controlar la posición no elimina la autopreferencia, la preferencia por la familia ni el comportamiento de elección forzada. Un juez puede favorecer de manera consistente una respuesta familiar en ambos órdenes.

El estudio también hereda limitaciones de la votación humana. Los usuarios de Arena se autoseleccionan, y un único voto no proporciona la misma fiabilidad que un panel de expertos de dominio capacitados.

Los prompts varían en dificultad y verificabilidad. Una solicitud informal de redacción invita a la preferencia subjetiva, mientras que una pregunta de programación o matemáticas puede tener una respuesta comprobable.

Agregar estas tareas puede ocultar efectos por categoría. Un modelo podría alinearse bien con los humanos en comparaciones factuales, pero divergir de forma marcada en tono, seguridad o estilo de redacción.

El resumen público no resuelve por completo cómo varió el comportamiento de los jueces según el tema, el idioma, la dificultad del prompt o la longitud de la respuesta. Estos desgloses ayudarían a distinguir un sesgo amplio de una concentración en tareas concretas.

Las versiones de los modelos crean otra incertidumbre. Los sistemas de frontera cambian mediante checkpoints actualizados, políticas de enrutamiento, prompts de sistema y configuraciones de inferencia.

Un resultado vinculado a una versión no debería convertirse en una etiqueta permanente para toda una familia de modelos. Los proveedores necesitan auditorías repetidas después de actualizaciones sustanciales.

La expresión “70% más probable” también necesita una interpretación cuidadosa. Describe un aumento relativo medio desde aproximadamente un 34% de autoselección humana hasta un 58% de autoselección de modelos.

No significa que cada juez estuviera sesgado en 70 puntos porcentuales. Tampoco significa que el 70% de todos los juicios de IA fueran incorrectos.

La cifra de Astra merece una cautela similar. Su tasa de autoselección del 88% es llamativa, pero la muestra incluye enfrentamientos que Astra podría haber merecido ganar.

La comparación humana hace que la calidad pura sea una explicación incompleta. Aun así, determinar qué parte de la brecha refleja sesgo requiere juicios de referencia más sólidos que la popularidad por sí sola.

Una opción es la adjudicación experta sobre un subconjunto estratificado. Los especialistas de dominio pueden evaluar la corrección por separado del estilo y aportar motivos para sus decisiones.

Otra opción utiliza verificación ejecutable. El código puede ejecutarse contra pruebas, las matemáticas pueden usar comprobaciones formales cuando estén disponibles y las afirmaciones factuales pueden recibir recuperación independiente y revisión de citas.

Una tercera opción compara múltiples jueces externos y excluye a todo proveedor representado en la pareja de candidatos. Este enfoque reduce los conflictos, aunque no puede garantizar la neutralidad.

Ninguno de estos métodos ofrece un estándar de oro universal. Los sistemas de evaluación más sólidos combinan señales y preservan la incertidumbre en lugar de obligar a una sola puntuación a responder todas las preguntas.

La preferencia humana revela lo que les gusta a los usuarios. La revisión experta evalúa la calidad del dominio. Las comprobaciones automatizadas prueban propiedades específicas, mientras que los jueces de modelos aportan escala.

Tratar estas señales como intercambiables crea el riesgo exacto que exponen los hallazgos de Arena. Un proxy escalable puede redefinir silenciosamente el resultado que pretendía aproximar.

Qué deberían vigilar ahora los equipos de evaluación de IA

La próxima prueba es si las replicaciones independientes pueden conservar la escala de la automatización sin reproducir el mismo ciclo de preferencias de las máquinas.

La primera señal a vigilar es una publicación pública de los datos de Arena a nivel de juicio. Los investigadores necesitan los identificadores de los enfrentamientos, las respuestas anonimizadas, las versiones de los jueces, los veredictos con orden intercambiado, los votos humanos y los resultados de empate.

Esa publicación permitiría a equipos independientes recalcular las cifras principales. También revelaría si unas pocas familias de modelos, categorías de prompts o idiomas impulsan el promedio.

Si la brecha del 70% sobrevive a esas comprobaciones, el argumento contra la autoevaluación se fortalece. Si se reduce tras los controles por categoría, las políticas de evaluación pueden centrarse en las tareas donde se concentra el problema.

La segunda señal es la respuesta de los proveedores. OpenAI y otros desarrolladores de modelos pueden publicar evaluaciones específicas por juez que separen la precisión factual, la preferencia humana, la calibración de empates y el sesgo de familia.

Una respuesta sólida incluiría pruebas entre proveedores. Cada modelo debería juzgar enfrentamientos que contengan sus propios resultados, resultados de proveedores relacionados y respuestas normalizadas estilísticamente.

La métrica útil no es simplemente el acuerdo general. Los equipos deberían informar del cambio en la tasa de victoria de un candidato cuando el juez comparte su proveedor o familia de modelos.

Los proveedores también deberían revelar el comportamiento de abstención. Un juez que admite incertidumbre puede ser más útil que uno que produce una etiqueta segura para cada pareja.

La tercera señal es un cambio en las prácticas de los benchmarks. Las plataformas de evaluación pueden adoptar exclusiones por conflicto, paneles de jueces diversos, muestras de calibración humana y validación específica por categoría.

Una política práctica impediría que cualquier modelo juzgara su propia respuesta. Una política más estricta excluiría a los jueces que compartan proveedor con cualquiera de los concursantes.

Los benchmarks pueden entonces comparar el panel restante con una muestra humana reservada. Las diferencias importantes deberían activar una revisión en lugar de incorporarse automáticamente a la clasificación.

Los equipos que construyen evaluaciones internas no necesitan abandonar los jueces LLM. Deben dejar de tratar la puntuación de un único juez como una medición objetiva.

Empiecen por registrar qué modelo juzgó cada ejemplo. Ejecuten ambos órdenes de respuesta, preserven los empates e inspeccionen los desacuerdos en lugar de reducirlos a un único promedio.

Separen la preferencia de la corrección. Un modelo puede ser agradable pero estar equivocado, ser técnicamente correcto pero poco útil, o ser preciso mientras ignora la solicitud real del usuario.

Usen humanos cuando la decisión tenga peso operativo. Las puertas de despliegue, las decisiones de seguridad y la selección de proveedores merecen más que un evaluador que podría favorecer a su propia familia.

Para iteraciones de menor riesgo, los jueces automatizados siguen siendo valiosos. Su velocidad los hace eficaces para detectar regresiones importantes y reducir el conjunto que deben inspeccionar los humanos.

El límite debería depender de las consecuencias. Un experimento de prompts puede tolerar una evaluación ruidosa, mientras que una decisión de adquisición de modelos necesita evidencia independiente.

Los resultados de Arena sobre el sesgo de los jueces LLM hacen inevitable un punto más amplio. La escala no convierte un proxy de preferencia en un árbitro neutral.

El modelo más capaz también puede ser el defensor más persuasivo de su propio resultado. Los sistemas de evaluación deben tener en cuenta ese conflicto antes de que el consenso de las máquinas se convierta en la definición predeterminada de calidad.

Durante los próximos tres meses, estén atentos a los datos brutos de Arena, las replicaciones entre proveedores y nuevas reglas de conflicto en las clasificaciones automatizadas. Estos avances mostrarán si este hallazgo cambia las prácticas de evaluación o se convierte en otro sesgo documentado que los equipos reconocen pero siguen ignorando.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page