top of page

QED Science afirma que puede clasificar el 1% superior de los preprints. ¿Deberían confiar los investigadores?

11 ago
14 min de lectura

QED Science clasificó 57.455 preprints de ciencias de la vida y situó a 574 en su 1% superior, pese a las dudas aún sin resolver sobre cómo su IA define la calidad científica.

La startup de Tel Aviv afirma que su sistema evalúa la originalidad y la validez sin ver autores, afiliaciones, recuentos de citas ni nombres de revistas. Esa promesa enfrenta el QED Score a las señales de prestigio que los investigadores ya utilizan, a menudo a regañadientes, para navegar una literatura abrumadora.

La cuestión central que plantea la cobertura de Horizon Nature no es si la inteligencia artificial puede leer artículos más rápido que las personas. Es evidente que puede. La pregunta es si una puntuación propietaria puede convertirse en un filtro fiable antes de que investigadores independientes prueben plenamente sus supuestos.

QED Science convirtió un año de preprints en una lista clasificada

QED Science ha transformado el triaje científico de un problema de lectura en un problema de clasificación.

La empresa lanzó “The 1%” el 24 de junio de 2026. Describe el proyecto como una selección de los preprints de ciencias de la vida más originales y científicamente válidos publicados durante un período de 12 meses.

QED analizó 57.455 manuscritos enviados a bioRxiv entre mayo de 2025 y abril de 2026. La colección final contiene 574 artículos, equivalentes al 1% superior de esa población evaluada.

Un preprint es un manuscrito difundido antes de la revisión formal por pares de una revista. Puede hacer que los resultados circulen rápidamente, pero los lectores deben evaluar la evidencia sin la garantía asociada a la revisión editorial.

Esa rapidez genera tanto valor como riesgo. Los investigadores pueden encontrar hallazgos importantes meses antes de la publicación en una revista, pero también se enfrentan a más material del que cualquier persona puede evaluar detenidamente.

QED afirma que una revisión convencional de todo su corpus requeriría entre 860.000 y 1.030.000 horas de trabajo experto. Esa estimación equivale a más de 400 años de trabajo investigador, según el documento de validación de la empresa.

Su sistema completó las evaluaciones en horas. Esa diferencia explica su atractivo, especialmente para financiadores, equipos de investigación y empresas que siguen campos de rápida evolución.

El resultado no es una decisión de aceptación. QED describe The 1% como una señal temprana para decidir qué manuscritos merecen atención.

Esa distinción importa. Un editor de revista puede solicitar revisiones, consultar a revisores, examinar declaraciones y rechazar un artículo tras encontrar un problema insalvable. Una puntuación condensa un proceso distinto en un solo número.

La lista pública de QED abarca las categorías de ciencias de la vida de bioRxiv. Neurociencia aporta 83 artículos seleccionados de 11.058 manuscritos evaluados, mientras que biología celular aporta 55 de 3.408.

Otras categorías incluyen genómica, inmunología, microbiología, biología del cáncer, bioinformática, genética y biología sintética. La distribución refleja tanto el tamaño de cada campo como las evaluaciones de QED.

QED también informa de adopción más allá del proyecto de clasificación. Al 31 de mayo, su plataforma atendía a más de 10.000 laboratorios de más de 1.500 instituciones en más de 70 países.

Estas cifras proceden de QED, no de una auditoría independiente de uso. Aun así, muestran que la evaluación de manuscritos asistida por IA está dejando de ser un experimento de laboratorio.

Por tanto, la pregunta de Horizon Nature va más allá de una sola lista. Si los investigadores usan QED para elegir qué leer, citar, financiar o desarrollar, sus juicios pueden moldear la atención antes de que comience la revisión por pares.

Ese es el cambio real. QED no se ha limitado a resumir preprints. Ha propuesto una puerta automatizada a la entrada de la atención científica.

Por qué el debate de Horizon Nature importa ahora

La presión procede de una brecha cada vez mayor entre la rapidez con que aparece la investigación y la lentitud con que los expertos pueden evaluarla.

Los servidores de preprints permiten a los científicos compartir hallazgos sin esperar al ciclo completo de revisión de una revista. Este modelo cobró especial relevancia cuando los investigadores necesitaban acceso rápido a evidencia biomédica emergente.

También eliminó un mecanismo de clasificación conocido. Un manuscrito recién publicado en bioRxiv no tiene una ubicación final en una revista, un historial consolidado de citas ni una trayectoria de revisión por pares completada.

Los investigadores compensan esta carencia con señales imperfectas. Reconocen laboratorios, instituciones, autores, métodos y áreas temáticas. Siguen recomendaciones sociales e inspeccionan lo que gana relevancia en las redes profesionales.

Estos hábitos pueden ahorrar tiempo, pero también pueden reproducir sesgos de prestigio. El trabajo de una institución famosa recibe atención con más facilidad que un trabajo igual de sólido de un grupo desconocido.

QED se dirige a esa debilidad. Su anuncio de lanzamiento afirma que cada manuscrito se anonimiza antes de recibir una puntuación.

El sistema elimina los nombres de los autores, las afiliaciones y otros datos identificativos. También ignora los recuentos de citas, los lugares de publicación y la reputación de las revistas.

Oded Rechavi, cofundador y científico principal de QED, sostiene que la calidad científica debe juzgarse a través del propio trabajo. La evaluación ciega pretende impedir que la reputación sustituya a la evidencia.

Ese objetivo tiene una base creíble. La revisión humana puede verse influida por el estatus institucional, las relaciones profesionales, el idioma y las expectativas sobre quién produce trabajo importante.

Sin embargo, el anonimato no crea automáticamente neutralidad. Un manuscrito puede contener señales indirectas sobre su origen, incluidos temas de investigación, equipos, conjuntos de datos, patrones de redacción y referencias.

Un modelo de IA también puede heredar asociaciones de sus datos de entrenamiento. Eliminar el nombre de la institución de la entrada no borra todas las relaciones aprendidas durante el desarrollo del modelo.

Investigaciones anteriores han mostrado por qué importa esa distinción. Un estudio de 2024 probó GPT-3.5 con 30 resúmenes médicos emparejados con distintas afiliaciones.

Los investigadores generaron 232.500 revisiones individuales en condiciones de afiliación aleatorizadas. Su estudio sobre sesgo de afiliación concluyó que la información institucional afectaba los juicios del modelo.

La anonimización de QED aborda la versión más directa de ese problema. Sin embargo, la empresa no ha revelado públicamente suficientes detalles del sistema para que terceros puedan trazar todas las vías restantes.

El problema de escala también está empeorando. La IA generativa ha reducido el esfuerzo necesario para redactar texto técnico, crear citas plausibles y producir manuscritos pulidos.

Eso no significa que todos los artículos asistidos por IA sean poco fiables. Significa que la fluidez superficial se ha convertido en una señal aún más débil de calidad científica.

Richard Sever, cofundador de bioRxiv, describió una posibilidad más sombría en reportajes sobre contenido científico sintético. Los sistemas de preprints se vuelven más difíciles de utilizar cuando artículos fabricados abruman los hallazgos genuinos.

La evaluación automatizada parece casi inevitable en ese entorno. Los editores y científicos no pueden responder a un número ilimitado de envíos generados por máquinas con una revisión humana ilimitada.

QED ofrece una versión de la respuesta: usar IA para descomponer cada manuscrito, poner a prueba sus afirmaciones y orientar la escasa atención humana hacia los candidatos más sólidos.

La presión recae primero sobre los investigadores que realizan revisiones de la literatura. También alcanza a editores de revistas, financiadores, equipos de biotecnología y cualquiera que tome decisiones a partir de evidencia temprana.

Estos grupos necesitan un filtrado más rápido. También necesitan saber por qué un artículo superó el filtro, qué pasó por alto el sistema y con qué frecuencia se repiten sus errores.

Una clasificación puede reducir la sobrecarga de información mientras crea una nueva concentración de influencia. Si una puntuación se vuelve ampliamente fiable, los errores en la capa de puntuación pueden redirigir la atención en todo un campo.

Por eso el debate ha llegado ahora. La publicación científica necesita triaje a escala de máquina, pero las normas para validar ese triaje siguen sin resolverse.

QED Score desafía el prestigio, no la revisión por pares

El argumento más sólido a favor de QED no es que sustituya la revisión por pares, sino que evalúa los artículos más directamente que el rango de una revista.

QED Score evalúa dos dimensiones declaradas. La originalidad mide hasta qué punto un hallazgo hace avanzar el conocimiento existente, mientras que la validez mide si la evidencia respalda las conclusiones del manuscrito.

La empresa afirma que su arquitectura multiagente primero descompone cada artículo en una afirmación principal, afirmaciones centrales, afirmaciones relacionadas y experimentos de apoyo.

Después, agentes de IA especializados examinan distintas características en paralelo. Buscan inconsistencias en las figuras, debilidades estadísticas, conflictos con la literatura existente, hipótesis alternativas y problemas relacionados con las normas de presentación de informes.

Una capa de verificación vuelve a comprobar los problemas señalados. Una capa de puntuación califica las afirmaciones individuales, y un agregador combina esas evaluaciones en un percentil calibrado.

Una puntuación de 80 significa que el manuscrito se situó por encima del 80% del corpus de referencia. No significa que el artículo tenga un 80% de probabilidad de ser correcto.

Esa distinción se pierde fácilmente cuando un juicio complejo se convierte en un número familiar. Los percentiles describen una posición relativa, no una verdad absoluta.

QED probó su métrica en tres estudios. El primero utilizó 925 artículos publicados de 185 autores que expertos en el dominio habían clasificado en las categorías Limitado, Satisfactorio o Sólido.

La canalización de puntuación no recibió esas etiquetas. QED informa de un área bajo la curva de 0,867 al separar los artículos Limitados de las demás categorías.

El área bajo la curva, o AUC, mide qué tan bien un sistema distingue dos clases. Un valor de 0,5 representa el azar, mientras que 1,0 representa una separación perfecta.

Para 795 artículos con QED Scores y datos de rango de revista, QED informó de mejores resultados en dos comparaciones. Obtuvo 0,863 frente a 0,804 para identificar artículos Limitados.

Para los artículos Sólidos, los resultados fueron mucho más cercanos. QED informó de 0,782, frente a 0,774 para la medida de rango de revista.

El segundo estudio puntuó 4.953 preprints de bioRxiv de abril de 2025. Después, QED siguió dónde se publicaron finalmente esos artículos.

Los investigadores emparejaron 2.879 preprints con versiones publicadas que contaban con un rango de revista asociado. QED informó de una correlación de Spearman de 0,63 entre sus puntuaciones de preprints y el rango final de la revista.

La correlación varió entre 21 disciplinas. Alcanzó 0,78 en genética, pero cayó a 0,39 en biología de sistemas.

Estas diferencias merecen atención. Un único percentil interdisciplinario puede ocultar variaciones significativas en el rendimiento del modelo, las convenciones de evidencia y el comportamiento de publicación.

El tercer estudio se centró en los desacuerdos. QED creó 100 pares de artículos en los que su puntuación prefería el artículo publicado en la revista de menor rango.

Quince expertos en el dominio revisaron los pares sin ver los QED Scores ni los lugares de publicación. Emitieron 70 juicios seguros, incluidas 60 elecciones decisivas tras excluir los empates.

Los expertos seleccionaron el artículo favorecido por QED en el 75% de esos casos decisivos. El intervalo de confianza del 95% informado osciló entre el 63% y el 84%.

Ese resultado respalda el argumento de QED de que el prestigio de la publicación puede representar erróneamente la calidad de un artículo. No establece que QED pueda identificar la verdad sin juicio humano.

El lugar de publicación también es un punto de referencia incómodo. La ubicación en una revista depende de la novedad, el alcance editorial, el momento, la presentación, la disponibilidad de revisores y las decisiones estratégicas de envío.

Una puntuación que se correlaciona con el rango de una revista puede validar la alineación con los resultados de publicación existentes. Por sí sola, no puede validar la afirmación de que el sistema escapa a los sesgos del sistema de publicación.

QED reconoce un límite importante. Su metodología afirma que The 1% no sustituye la revisión por pares.

Ese es el enfoque sensato. QED puede priorizar manuscritos para su revisión, pero un percentil alto no debe autorizar decisiones clínicas ni resolver disputas científicas.

Por tanto, la disputa principal es entre la evaluación directa y la inferencia basada en el prestigio. QED plantea si los lectores deberían examinar las afirmaciones y las pruebas en lugar de apoyarse en la reputación de una revista.

Ese desafío resulta útil incluso si la puntuación de QED sigue siendo imperfecta. La marca de las revistas siempre ha condensado muchos juicios en una abreviatura que los lectores pueden utilizar indebidamente.

Una puntuación de IA cuidadosamente validada podría convertirse en otra señal. No debería convertirse en la única señal ni en una nueva etiqueta de prestigio con menos rendición de cuentas pública.

Lo que la afirmación del 1% superior no demuestra

Los resultados internos de QED justifican pruebas rigurosas, pero aún no justifican una confianza incondicional.

La principal limitación es la independencia. QED Science desarrolló el sistema, diseñó la validación, publicó la metodología y comunicó las cifras principales de rendimiento.

Los estudios dirigidos por empresas pueden aportar evidencia valiosa. La replicación independiente se vuelve esencial cuando el valor comercial de un producto depende de esas mismas afirmaciones sobre su rendimiento.

Una revisión externa identificó debilidades en los tres estudios de validación. La crítica fue elaborada mediante otro servicio de evaluación de investigación basado en IA, por lo que no constituye una réplica humana definitiva.

Aun así, sus preguntas son concretas. El informe de revisión sostiene que los estudios de QED comparten señales de referencia relacionadas, en lugar de ofrecer una confirmación plenamente independiente.

El primer estudio depende de categorías de calidad asignadas por expertos. El segundo utiliza el rango de la revista como resultado. El tercero selecciona casos en los que QED y el rango de la revista discrepan marcadamente.

Esa estructura puede demostrar consistencia en las pruebas elegidas por QED. Deja abierta la cuestión de cómo funciona el sistema en decisiones prospectivas definidas por investigadores externos.

El segundo estudio también solo emparejó 2.879 de 4.953 preprints con versiones publicadas que contaban con datos de clasificación de revistas. Eso deja 2.074 manuscritos fuera del análisis de correlación comunicado.

Algunos artículos no emparejados podrían publicarse más adelante, aparecer en medios sin la métrica requerida o no llegar nunca a una publicación formal. Su exclusión puede alterar la relación aparente.

Los efectos de selección importan porque la publicación no es aleatoria. Un trabajo sólido puede permanecer inédito, mientras que uno débil puede superar la revisión.

El tercer estudio ofrece datos convincentes sobre desacuerdos, pero utiliza una muestra deliberadamente inusual. Los investigadores seleccionaron pares porque QED y el rango de la revista señalaban direcciones opuestas.

Ese diseño prueba un conflicto relevante. No estima con qué frecuencia QED toma la mejor decisión entre artículos ordinarios.

El resultado de preferencia del 75% también procede de 60 juicios concluyentes. Es informativo, pero reducido en comparación con los 57.455 manuscritos incluidos en The 1%.

La lista seleccionada introduce otro problema. «El 1% superior» parece objetivo, pero sigue siendo relativo al corpus de QED, al tratamiento de categorías, a la versión de puntuación y a las dimensiones de evaluación elegidas.

La originalidad y la validez son criterios valiosos. No abarcan todas las cualidades que importan a los científicos.

Un artículo técnicamente válido puede ser limitado o poco importante. Un artículo original puede depender de mediciones frágiles. Una réplica puede aportar poca originalidad y, aun así, ofrecer un enorme valor científico.

La ética, la disponibilidad de datos, la transparencia metodológica, la reproducibilidad, la importancia práctica y los conflictos de interés también pueden afectar la forma en que los lectores deberían utilizar un resultado.

Los agentes de QED examinan varios factores relacionados, pero quienes están fuera necesitan mayor visibilidad sobre su ponderación. También necesitan análisis de errores, calibración por campo y ejemplos de falsos positivos.

La opacidad del modelo plantea cuestiones operativas. QED afirma que su arquitectura combina varios modelos de lenguaje de gran tamaño con modelos propietarios.

Su metodología pública no identifica todos los modelos subyacentes, prompts, pesos de componentes ni calendario de actualizaciones. Esos detalles pueden afectar la reproducibilidad.

Si un proveedor de modelos modifica un sistema, el mismo manuscrito podría recibir un resultado diferente. QED necesitaría puntuaciones versionadas y registros de auditoría estables para respaldar un uso con consecuencias relevantes.

La investigación ya ha demostrado que los evaluadores basados en LLM pueden reproducir sesgos sociales. Un gran experimento de economía generó 27.090 evaluaciones de 9.030 artículos.

Ese experimento de revisión por pares concluyó que los modelos distinguían la calidad, pero favorecían a instituciones destacadas, autores hombres y economistas reconocidos.

La entrada ciega de QED debería reducir varios de esos efectos. No responde a si su modelo aprendió otras preferencias por métodos conocidos, temas populares o estructuras argumentativas convencionales.

El sistema también podría recompensar manuscritos que sean más fáciles de interpretar para los modelos. Una estructura clara de las afirmaciones es positiva, pero la legibilidad no debe convertirse en un sustituto invisible de la solidez probatoria.

El comportamiento adversarial es otra preocupación. Cuando los autores entiendan qué recompensa un sistema de puntuación, algunos optimizarán los manuscritos para la métrica.

Ese patrón aparece allí donde las clasificaciones distribuyen atención. Los motores de búsqueda, las métricas universitarias, las medidas de citación y los factores de impacto de las revistas han fomentado comportamientos estratégicos.

Por ello, una puntuación pública necesita resistencia a la manipulación. También requiere supervisión de prompts ocultos, citas fabricadas, evidencia duplicada y tácticas estilísticas diseñadas para influir en un evaluador.

Los investigadores deberían tratar QED como una ayuda para el descubrimiento hasta que esas cuestiones reciban respuestas independientes. Una puntuación alta puede justificar leer un artículo antes, no creerlo antes.

Lo contrario es igual de importante. Una puntuación baja no debería enterrar silenciosamente investigaciones poco convencionales sin una vía de apelación ni una explicación clara.

Para los trabajadores del conocimiento que siguen afirmaciones científicas, mantener el contexto de las fuentes importa más que recopilar clasificaciones. Una base de conocimientos con búsqueda puede conservar juntos artículos, críticas, actualizaciones y evidencia contradictoria.

Ese flujo de trabajo mantiene la puntuación en su papel adecuado. Se convierte en un filtro vinculado a una fuente, no en un veredicto desligado del trabajo subyacente.

Tres señales determinarán si los investigadores deberían confiar en ella

La confianza dependerá de una validación independiente, un rendimiento estable entre campos y evidencia de que los científicos usan la puntuación sin renunciar a su criterio.

La primera señal es un estudio prospectivo y prerregistrado realizado por investigadores ajenos a QED Science. Equipos independientes deberían definir los criterios de evaluación antes de conocer los resultados.

Deberían probar manuscritos recientes que ni los modelos ni los evaluadores hayan encontrado. El estudio debería incluir artículos publicados, no publicados, réplicas, resultados negativos y envíos deliberadamente defectuosos.

Expertos externos deberían evaluar las afirmaciones y las pruebas sin recibir las etiquetas de QED. Después, los investigadores podrían comparar QED con paneles humanos, decisiones editoriales, resultados de replicación y correcciones posteriores.

Ningún único referente ofrece una verdad de referencia perfecta. La concordancia entre medidas realmente independientes reforzaría más la afirmación de QED que otra comparación dirigida por la empresa.

Un fracaso en esas condiciones debilitaría la afirmación de que QED ofrece una medida generalmente fiable de la calidad científica. Aun así, podría seguir siendo útil para tareas de triaje más acotadas.

La segunda señal es un rendimiento transparente por campo a lo largo del tiempo. QED ya comunica correlaciones que van de 0,39 a 0,78 entre disciplinas.

Las futuras versiones deberían revelar patrones de falsos positivos, patrones de falsos negativos, deriva de calibración y cambios en la puntuación para cada campo. La precisión agregada puede ocultar un rendimiento débil en áreas especializadas.

El versionado es especialmente importante. Cada puntuación debería identificar la versión del sistema, el corpus de referencia, la fecha de evaluación y la incertidumbre en torno a la clasificación.

Los investigadores también necesitan explicaciones que conecten las puntuaciones con afirmaciones y experimentos específicos. Un percentil sin razonamiento trazable no puede respaldar una corrección significativa.

Si QED publica resultados estables y reproducibles a nivel de campo, su caso se vuelve más sólido. Si las puntuaciones cambian silenciosamente tras modificaciones del modelo, los investigadores deberían limitar la herramienta al descubrimiento informal.

La tercera señal es cómo utilizan la clasificación las instituciones. Las recomendaciones de lectura implican menos riesgo que los filtros de financiación, contratación o decisiones sobre evidencia clínica.

Una herramienta que ayuda a los científicos a descubrir artículos pasados por alto puede reducir el sesgo de prestigio. La misma herramienta puede crear prestigio algorítmico si las instituciones tratan la puntuación como un umbral.

Observe si los financiadores y las revistas utilizan QED junto con la revisión experta o antes de ella. También observe si los autores pueden impugnar errores y obtener una nueva puntuación tras las revisiones.

La adopción más saludable preservaría la responsabilidad humana. Los investigadores usarían QED para identificar artículos, inspeccionar su razonamiento y después evaluar la evidencia subyacente.

La adopción más arriesgada ocultaría decisiones tras un percentil. Una institución podría rechazar un trabajo automáticamente y afirmar que el proceso fue neutral porque se eliminaron los nombres.

La pregunta de Nature tiene una respuesta condicional. Los investigadores deberían confiar en QED lo suficiente como para probar sus recomendaciones, pero no lo suficiente como para externalizar el juicio científico.

QED ha presentado una respuesta creíble a un verdadero cuello de botella. Su escala, puntuación ciega y análisis a nivel de afirmaciones merecen un examen independiente minucioso.

El debate de Horizon Nature ahora necesita evidencia externa a la empresa. Durante los próximos meses, busque replicaciones prerregistradas, informes de errores específicos por campo y usos institucionales divulgados.

¿Cambiaría una puntuación de QED qué preprint lee primero? Probablemente debería hacerlo. ¿Cambiaría lo que usted cree sin comprobar los métodos y la evidencia? No debería.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page