top of page

La revisión por pares de Sakana AI detecta el 73% de los errores centrales, pero los artículos reales revelan el límite

hace 2 horas
14 min de lectura

Sakana AI afirma que su sistema de revisión por pares detectó el 73,43% de los errores introducidos que afectaban la afirmación central de un artículo. Sin embargo, ese resultado destacado surgió de cuatro revisiones de contradicciones sintéticas, no de revisiones rutinarias de investigaciones sin modificar.

El sistema, denominado Multi-Layered Review, superó ampliamente a tres referencias de revisión automatizada en el nuevo benchmark de Sakana AI. No obstante, su tasa de detección exacta cayó al 16,11% cuando se probó frente a problemas documentados en artículos retirados de arXiv.

Esa brecha define la verdadera historia. La revisión por pares de Sakana AI aporta evidencia de que una lectura cuidadosa y de múltiples pasadas puede mejorar la crítica automatizada. No demuestra que un LLM pueda validar de forma fiable el trabajo científico.

En cambio, la investigación presiona a los desarrolladores a reconsiderar cómo evalúan a los revisores de IA. Igualar las puntuaciones humanas o producir comentarios persuasivos no basta. Un revisor útil debe conectar afirmaciones, métodos, experimentos y evidencias lo suficientemente bien como para detectar cuándo entran en conflicto.

El resultado de Sakana AI también llega en medio de una historia compleja. La empresa utilizó anteriormente IA para generar artículos científicos y enfrentó preguntas sobre qué demostraba realmente superar la revisión por pares. Su proyecto más reciente invierte esa misma preocupación al preguntar si la IA puede ayudar a los humanos a detectar investigaciones débiles.

La revisión por pares de Sakana AI cambia la prueba

El cambio más importante no es el resultado del 73,43%. Es la decisión de evaluar a los revisores de IA según si detectan errores.

Gran parte del trabajo anterior sobre revisión por pares automatizada medía la similitud. Los investigadores comparaban una reseña generada por IA con comentarios humanos, comprobaban si sus puntuaciones se correlacionaban o medían la coincidencia entre sus observaciones.

Esas pruebas capturan si un sistema se comporta como un revisor. No muestran directamente si detectó el error central de un artículo.

El artículo sobre revisión por pares de Sakana AI propone una alternativa centrada en la verificación. Sus autores sostienen que la detección de errores es una de las funciones más importantes y que más recursos consume en la revisión por pares.

El equipo creó un Contradiction Benchmark con 1.164 variantes modificadas de artículos. Estas variantes procedían de 257 artículos publicados en ACL, AISTATS, CVPR e ICML en 2025, además de NeurIPS en 2024.

Los investigadores limitaron la colección a artículos con licencias permisivas de Creative Commons. Esa restricción les permitió modificar y redistribuir los manuscritos.

Para cada artículo, Gemini 2.5 Pro generó un grafo de conocimiento. Un grafo de conocimiento representa afirmaciones, métodos, evidencias y sus relaciones como nodos conectados.

Luego, los investigadores midieron la distancia de cada nodo respecto de una afirmación principal. Una distancia de cero significaba que el nodo representaba una afirmación central. Las distancias mayores representaban detalles cada vez más periféricos.

GPT-4.1 reescribió pasajes seleccionados para contradecir los nodos correspondientes. El texto alterado se insertó en la fuente original, que se compiló de nuevo en un PDF completo.

Ese procedimiento proporcionó a los investigadores un error conocido y una ubicación conocida. También les permitió clasificar cuán directamente amenazaba cada error la conclusión principal del artículo.

Un modelo o3 determinó si las revisiones generadas habían detectado cada contradicción. El proceso de evaluación se ejecutó diez veces por ejemplo, y los investigadores promediaron los resultados.

En artículos sin alteraciones, el evaluador alcanzó una precisión del 99,9%, según el estudio. Un análisis manual halló una sensibilidad del 86,8% en las detecciones confirmadas, lo que sugiere que la puntuación automatizada a veces no identificó aciertos legítimos.

Esta configuración ofrece una prueba más clara que preguntar si un modelo suena como un revisor. Un sistema señala la contradicción introducida o no lo hace.

Sin embargo, el benchmark mide una parte cuidadosamente definida de la revisión. No cubre todas las formas de fallo científico, incluidas la fabricación de datos, supuestos estadísticos inapropiados, errores ocultos de preprocesamiento o experimentos irreproducibles.

La distinción importa porque el titular se refiere específicamente a contradicciones en afirmaciones centrales. No debe interpretarse como una tasa general de precisión del 73% para la revisión científica.

Por qué el sistema MLR de Sakana AI encuentra más errores

Multi-Layered Review mejora la detección de errores al obligar al modelo a comprender un artículo antes de juzgarlo.

El sistema completo MLR de Sakana AI contiene tres roles: un Appendix Agent, un Literature Review Agent y un Review Agent. Estos componentes procesan distintas partes del manuscrito antes de producir una evaluación consolidada.

El Appendix Agent utiliza Claude Haiku 3.5 para resumir detalles de implementación y experimentación fuera del texto principal. Este paso ayuda a evitar que el sistema critique omisiones que el apéndice ya aborda.

El Literature Review Agent opcional utiliza Claude Sonnet 4 y búsqueda web. Su función es situar el manuscrito dentro de la investigación existente y comprobar si sus afirmaciones de novedad parecen justificadas.

El Review Agent central también utiliza Claude Sonnet 4. Recibe hasta diez páginas de texto principal en formato PDF, preservando ecuaciones, gráficos e información de diseño que la extracción de texto plano podría dañar.

Su flujo de trabajo se inspira en el método de tres pasadas establecido para leer artículos de investigación. La primera pasada crea un esquema de alto nivel de las ideas principales del manuscrito.

La segunda pasada lee con mayor detalle y vincula esas ideas con las evidencias que las respaldan. También registra supuestos, lagunas y debilidades.

La tercera pasada combina esas notas con hallazgos relevantes del apéndice y de la literatura. Después produce fortalezas, debilidades, preguntas, una recomendación, una puntuación y una lista de acciones.

Esta secuencia aborda un fallo común en las herramientas de revisión con LLM. Un único prompt extenso puede pedir a un modelo que resuma, verifique, compare, critique, puntúe y dé formato a un artículo a la vez.

El modelo puede producir una reseña pulida sin construir una representación estable de la investigación. Puede repetir afirmaciones del resumen mientras pasa por alto evidencias contrarias en los resultados.

MLR separa la comprensión de la evaluación. Ese diseño proporciona al modelo notas intermedias que pueden conectar una conclusión con el método o experimento que la respalda.

Los resultados del benchmark sugieren que tanto la elección del modelo como el diseño del flujo de trabajo contribuyeron a la mejora. Sustituir GPT-4.1 por Claude Sonnet 4 dentro de la referencia más simple LLM-Review elevó la detección de errores centrales del 14,56% al 35,40%.

Una única revisión MLR alcanzó entonces el 60,79% en la misma clase de contradicciones centrales. Un conjunto de cuatro revisiones MLR elevó la detección al 73,43%.

El mejor resultado competidor para errores en afirmaciones centrales fue del 14,81%, producido por AgentReview. AI Reviewer alcanzó el 11,17%, mientras que la configuración original de LLM-Review llegó al 14,56%.

En las contradicciones de todos los niveles de gravedad medidos, cuatro revisiones MLR detectaron el 40,95%. Los sistemas competidores se mantuvieron entre el 5,95% y el 6,50%.

Estas comparaciones hacen que el mecanismo resulte más interesante que la puntuación absoluta. Cambiar el modelo subyacente produjo una mejora importante, mientras que el diseño de revisión de múltiples pasadas produjo otra.

Eso significa que los compradores no pueden tratar “multi-agent” como una explicación suficiente del rendimiento. AgentReview ya utiliza roles de revisor, autor y presidente de área, pero su resultado en el benchmark siguió siendo mucho menor.

La pregunta importante es qué hacen los agentes. Dividir una tarea entre varias personas es distinto de dividir un manuscrito en componentes con evidencia y construir comprensión a través de pasadas repetidas.

MLR también desafía la suposición de que más tokens producen automáticamente una mejor calidad de revisión. Utilizó 189.062 tokens de entrada por revisión completa en el estudio, menos de la mitad de los 403.654 de AI Reviewer.

El LLM-Review más simple utilizó solo 6.517 tokens de entrada, en parte porque truncaba contenido extenso. Ese enfoque consumía menos recursos, pero perdía información que podría revelar contradicciones.

Por tanto, la disyuntiva útil no es simplemente pequeño frente a grande. Es si el sistema emplea el contexto en construir un modelo revisable del artículo.

La afirmación del 73% se reduce fuera del benchmark

La evidencia más sólida contra tratar a MLR como un árbitro autónomo procede de la propia evaluación de errores reales de Sakana AI.

Los investigadores probaron el Review Agent frente a WithdrarXiv-Check, un conjunto de datos basado en artículos retirados de arXiv y sus comentarios de retirada asociados. Su conjunto de prueba contiene 211 artículos.

Esta evaluación es más difícil que detectar contradicciones introducidas. Los errores reales de investigación pueden distribuirse entre supuestos, derivaciones, citas y experimentos sin producir un conflicto evidente a nivel de oración.

Los autores desactivaron el componente de búsqueda de literatura para esta prueba. De lo contrario, el sistema podría localizar avisos públicos de retirada en lugar de descubrir los problemas a partir de los manuscritos.

MLR identificó una coincidencia exacta con el problema de retirada documentado en el 16,11% de los casos. Bajo un estándar más flexible, que aceptaba una preocupación sustancialmente similar, alcanzó el 26,07%.

La referencia más sólida alcanzó el 9% en coincidencias exactas y el 18,48% en coincidencias similares. MLR siguió liderando la comparación, pero el margen fue mucho menor que en el benchmark sintético.

El conjunto de datos de artículos retirados también incluye principalmente investigación teórica en matemáticas y física. Los sistemas de revisión se diseñaron en torno a artículos de conferencias de aprendizaje automático, lo que limita la comparación directa.

Incluso con ese desajuste de dominio, la brecha de rendimiento revela una limitación central. Las contradicciones introducidas ofrecen al revisor un desacuerdo claro que encontrar. Los defectos reales a menudo requieren reconstruir una prueba, volver a ejecutar código, comprobar datos o poseer conocimiento especializado del dominio.

Los autores del benchmark reconocen otro problema. Evaluadores humanos examinaron 50 contradicciones sintéticas y descubrieron que el 34% carecía de fluidez coherente con las oraciones adyacentes.

Solo el 8% sonaba claramente generado por IA, pero el contexto alterado aún puede proporcionar una pista de detección. Un revisor automatizado podría advertir que un pasaje no encaja sin comprender por qué la ciencia subyacente es incorrecta.

Los autores sostienen que esto hace que el benchmark sea más fácil, no inválido. Los sistemas de referencia siguieron teniendo dificultades incluso cuando algunos errores insertados contenían irregularidades detectables.

Esa interpretación es razonable, pero cambia el significado del 73,43%. La cifra es una puntuación alta en una tarea controlada de contradicciones, no una estimación de la frecuencia con la que MLR detecta errores graves en artículos enviados.

La configuración de cuatro revisiones también merece atención. El conjunto cuenta un error como detectado cuando cualquiera de cuatro revisiones independientes lo menciona.

Eso resulta útil para la evaluación previa al envío por parte de los autores, donde recopilar varias señales de advertencia puede mejorar la cobertura. Es menos directamente comparable con asignar una revisión automatizada para reemplazar a un revisor humano.

El resultado del 60,79% en errores centrales de una única revisión MLR sigue siendo considerable. Aun así, casi cuatro de cada diez contradicciones centrales introducidas no se detectaron en la configuración de revisión única.

El rendimiento también disminuyó a medida que las contradicciones se alejaban de la afirmación principal de un artículo. Este patrón respalda la medida de gravedad del grafo de conocimiento, pero muestra que los errores secundarios detallados siguen siendo difíciles.

Por tanto, para los equipos de investigación, el caso de uso práctico es la auditoría previa al envío. Un sistema automatizado puede señalar posibles inconsistencias y dirigir la atención humana hacia afirmaciones vulnerables.

No está listo para certificar la validez. No se puede asumir que un artículo que no recibe advertencias sea correcto, y tampoco se puede asumir que una advertencia esté justificada.

El acuerdo humano es útil, pero no constituye una verificación científica

MLR produce juicios que se asemejan a las puntuaciones de las revisiones humanas, pero coincidir con los revisores sigue siendo distinto de encontrar la verdad.

En los envíos a ICLR 2025, las puntuaciones de MLR tuvieron una correlación de Pearson de 0.586 con las puntuaciones humanas. La referencia de humano a humano fue de 0.742.

En los artículos de NeurIPS 2024, MLR alcanzó 0.451, frente a una referencia humana de 0.781. En ICML 2025, MLR llegó a 0.429, ligeramente por detrás del AI Reviewer, con 0.439.

Estas cifras muestran una alineación significativa, especialmente en comparación con sistemas cuyas puntuaciones apenas diferenciaban los artículos aceptados de los rechazados. No demuestran que las decisiones humanas o automatizadas sean correctas desde el punto de vista factual.

La revisión por pares incluye cuestiones subjetivas sobre importancia, claridad y novedad. Dos revisores cuidadosos pueden coincidir en que un artículo merece ser aceptado y, aun así, pasar por alto la misma debilidad técnica.

El análisis de Sakana AI también encontró diferencias en aquello que humanos y sistemas automatizados priorizaban. MLR se centró más en la validez y los experimentos, mientras que los revisores humanos prestaron mayor atención a la claridad y la novedad.

Esa divergencia puede resultar útil. Un asistente de revisión aporta más valor cuando revela preocupaciones desatendidas que cuando simplemente predice los comentarios que escribirá una persona.

Sin embargo, un enfoque complementario genera su propio problema de calibración. El sistema debe distinguir entre una debilidad metodológica real y una crítica plausible que no está respaldada por el manuscrito.

La evaluación de usuarios del estudio ilustra ese desafío. Investigadores en activo realizaron 38 sesiones de revisión con el flujo de trabajo completo de MLR.

Entre los 378 comentarios que recibieron retroalimentación directa de conformidad, los usuarios aceptaron el 81%. Las recomendaciones recibieron un 94% de conformidad y las fortalezas, un 92%.

Las preguntas recibieron un 79%, mientras que los elementos de la lista de acciones recibieron un 78%. Las debilidades tuvieron la tasa de conformidad más baja, con un 68%.

Los autores no son jueces neutrales de las críticas, por lo que el desacuerdo no significa necesariamente que el sistema estuviera equivocado. Aun así, las debilidades son precisamente el ámbito donde las acusaciones falsas pueden causar mayor daño.

Un revisor que alega erróneamente un error matemático o un experimento ausente puede distorsionar una decisión editorial. Un lenguaje fluido puede hacer que esa alegación parezca más segura de lo que permiten las pruebas.

Los revisores humanos pueden cometer el mismo error. La diferencia es que la automatización puede replicar una interpretación equivocada en miles de envíos.

Por ello, el sistema de revisión por pares de Sakana AI encaja mejor como segundo lector que como responsable de decisiones. Puede ampliar el conjunto de cuestiones que examina una persona sin recibir autoridad final sobre la aceptación.

Las notas estructuradas del sistema también pueden ayudar a los autores a gestionar evidencia compleja. Los equipos que ya utilizan una base de conocimiento con búsqueda pueden aplicar un principio similar vinculando afirmaciones con experimentos, citas y preguntas sin resolver.

Eso no automatiza la verificación. Hace que el rastro de evidencia sea más fácil de inspeccionar para las personas.

La inyección de prompts expone el riesgo de la automatización

Un revisor que comprende un artículo aún puede ser manipulado por texto incluido dentro de ese artículo.

Sakana AI probó la inyección explícita de prompts añadiendo instrucciones ocultas después de la conclusión de 50 manuscritos rechazados, la mayoría enviados originalmente a ICLR 2025.

La inyección de prompts ocurre cuando el contenido dentro de un documento intenta anular las instrucciones que gobiernan al modelo que lo lee. Un pasaje malicioso podría indicar a un revisor automatizado que ignore las debilidades o asigne una puntuación alta.

Los cuatro sistemas de revisión estuvieron fuertemente influidos por el texto inyectado. MLR mostró el menor cambio promedio de puntuación según algunas medidas, pero sus resultados presentaron una alta varianza.

Detectó explícitamente la manipulación en solo 8 de los 50 artículos. En los casos restantes, el contenido inyectado afectó la revisión sin ser identificado de forma fiable como hostil.

Los investigadores sugieren que MLR recibió cierta protección de su flujo de trabajo centrado primero en la comprensión y de su entrada multimodal. Claude veía tanto el texto del documento como sus páginas renderizadas, mientras que la instrucción inyectada no aparecía en la imagen visible.

Esa discrepancia ofrecía al sistema una posible señal de que el texto oculto no pertenecía al artículo. No fue suficiente para prevenir la manipulación de forma consistente.

Esta debilidad importa porque la revisión por pares implica documentos no confiables. Los autores controlan el PDF, los archivos fuente, el material suplementario, las citas y, en ocasiones, los repositorios enlazados.

Todo revisor automatizado con herramientas de navegación o ejecución de código se enfrenta a una superficie de ataque más amplia. Una página enlazada puede contener instrucciones, un repositorio puede incluir comentarios adversariales y los datos suplementarios pueden ocultar metadatos engañosos.

Las políticas de las conferencias ya reconocen que el uso de LLM requiere divulgación y un manejo cuidadoso. La guía para revisores de ICLR sitúa la responsabilidad humana por encima de la asistencia automatizada.

Un despliegue seguro tendría que aislar el contenido del documento de las instrucciones del sistema. También tendría que restringir las herramientas, registrar las acciones del modelo, señalar el texto oculto y exigir confirmación humana de las afirmaciones relevantes.

Incluso esos controles no resolverían todas las formas de manipulación. Un pasaje puede influir en un modelo sin contener una instrucción evidente.

Los autores pueden enmarcar las comparaciones de forma selectiva, ocultar experimentos fallidos o emplear lenguaje seguro para orientar la atención. Estas técnicas también influyen en los revisores humanos, pero los sistemas automatizados pueden desarrollar puntos ciegos predecibles.

El trabajo anterior de Sakana AI ofrece una advertencia relevante. En 2025, la empresa retiró un artículo de taller generado por IA después de su aceptación y describió errores de citas en la investigación generada.

Investigadores externos cuestionaron si el episodio demostraba capacidad científica autónoma o una selección humana eficaz de resultados de IA. Un posterior análisis de revisión por pares subrayó la diferencia entre superar una revisión y aportar conocimiento fiable.

MLR aborda parte de ese problema al evaluar revisores con errores conocidos. Sin embargo, sus resultados sobre inyección muestran que un evaluador construido a partir de la misma clase de modelo sigue siendo vulnerable a entradas redactadas estratégicamente.

Los autores automatizados y los revisores automatizados podrían terminar optimizándose unos contra otros. Los autores podrían aprender qué lenguaje evita las críticas, mientras que los revisores podrían recompensar patrones que se parecen a trabajos aceptados.

Sin comprobaciones independientes, ese ciclo podría mejorar las puntuaciones sin mejorar la ciencia.

Qué observar después del benchmark de revisión por pares con LLM

Tres señales determinarán si el resultado de Sakana AI se convierte en una herramienta de investigación útil o sigue siendo un experimento controlado impresionante.

La primera señal es la replicación independiente. Sakana AI afirma que los datos y el código están disponibles bajo solicitud, en lugar de mediante un repositorio público de acceso inmediato.

Los equipos externos deben reproducir el benchmark con los mismos artículos, prompts, versiones de modelos y procedimiento de evaluación. También deberían probar distintos modelos evaluadores y auditar manualmente las detecciones en disputa.

La replicación debería medir los falsos positivos junto con la cobertura. Detectar más errores tiene un valor limitado si el sistema también genera muchas críticas plausibles pero incorrectas.

La segunda señal es el rendimiento ante defectos naturales. Los futuros benchmarks deberían incluir errores estadísticos verificados, afirmaciones causales sin respaldo, fallos en las citas, resultados irreproducibles y demostraciones defectuosas.

Algunas tareas requerirán acceso al código y a los datos, no solo a un PDF. Un auditor de investigación serio podría necesitar ejecutar experimentos, inspeccionar el preprocesamiento y comparar los valores reportados con los resultados generados.

El resultado de coincidencia exacta del 16.11% proporciona un punto de partida. Si los sistemas futuros elevan esa tasa en artículos diversos y seleccionados de forma independiente, el argumento a favor de una asistencia práctica será más sólido.

La tercera señal es si las conferencias despliegan estos sistemas con salvaguardas exigibles. Entre los indicadores relevantes se incluyen las reglas de divulgación, los controles de privacidad, las defensas contra la inyección de prompts y la supervisión humana documentada.

Una prueba limitada que ofrezca a los revisores advertencias privadas y opcionales pondría a prueba la ampliación sin delegar decisiones. Un sistema que puntúe los envíos automáticamente implicaría un riesgo mucho mayor.

Los investigadores también deberían observar cómo afectan los cambios de modelo al sistema MLR de Sakana AI. La ablación mostró que cambiar el modelo subyacente representaba una gran parte de la mejora.

Eso genera presión de mantenimiento. Un flujo de trabajo validado con una versión de modelo puede comportarse de manera distinta después de que un proveedor actualice su modelo o retire un endpoint.

También plantea preguntas sobre la reproducibilidad. Los benchmarks científicos se vuelven más difíciles de interpretar cuando los modelos comerciales cambian sin conservar puntos de control públicos idénticos.

Por tanto, la contribución más profunda de Beyond Imitation es metodológica. Su benchmark de revisión por pares con LLM plantea una pregunta mejor que si los comentarios generados se parecen a los comentarios humanos.

¿Puede un revisor de IA encontrar un problema concreto que amenace el razonamiento del artículo?

La respuesta de Sakana AI es alentadora en condiciones controladas y aleccionadora en trabajos reales retirados. La comprensión en múltiples pasadas supera claramente a la imitación superficial en las pruebas reportadas.

La brecha restante es demasiado grande para otorgar autoridad automatizada. Los artículos reales contienen errores que no se anuncian como contradicciones, y los artículos maliciosos pueden manipular directamente al revisor.

Los desarrolladores deberían considerar la cifra del 73.43% como un resultado de benchmark con límites definidos. Los editores deberían exigir validación independiente antes de incorporar puntuaciones automatizadas en las decisiones de publicación.

Los investigadores aún pueden utilizar hoy la idea central del sistema. Pidan a un asistente de IA que relacione cada afirmación importante con su evidencia, inspeccionen los vínculos resultantes e investiguen manualmente cada salto sin respaldo.

El próximo resultado decisivo no será otro récord sintético. Será un sistema replicado que encuentre errores sutiles y naturales sin inundar a los revisores con falsas alarmas ni obedecer instrucciones ocultas dentro del manuscrito.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page