El contrato de Cognita Imaging con la FDA pone a prueba si los jurados de LLM pueden evaluar de forma segura la IA de radiología
Cognita Imaging ha recibido un contrato de 1,29 millones de dólares de la FDA para probar jurados de LLM en aproximadamente un millón de exámenes de pacientes. El proyecto, de 18 meses, aborda un difícil problema regulatorio: evaluar sistemas de IA que generan informes radiológicos completos sin asignar cada caso a revisores humanos.
El contrato de Cognita Imaging con la FDA no autoriza un dispositivo médico ni avala la tecnología de la empresa. En cambio, financia investigación en ciencia regulatoria sobre si varios modelos de lenguaje de gran tamaño pueden evaluar informes de manera consistente. Los radiólogos examinarán desacuerdos clínicamente importantes en lugar de revisar manualmente todo el conjunto de datos.
Esa distinción plantea la tensión central. La evaluación automatizada hace concebibles estudios de un millón de casos, pero introduce otra capa falible de IA entre el generador de informes y el experto humano. Por tanto, el proyecto debe evaluar tanto el modelo de generación de informes como los modelos que juzgan su trabajo.
Cognita planea entregar su código de software, orientación para crear jurados de LLM, comparaciones de cohortes de validación y estudios de discrepancias revisados por radiólogos. La FDA también recibirá informes que cubran los resultados y las limitaciones del proyecto.
El resultado importa más allá de Cognita. Los desarrolladores de IA médica quieren cada vez más generar texto clínico completo, mientras los reguladores deben decidir qué evidencia puede respaldar estos sistemas más amplios. El contrato pondrá a prueba si la automatización puede ampliar esa evidencia sin debilitar su significado clínico.
Lo que realmente financia el contrato de Cognita Imaging con la FDA
El contrato financia un método de evaluación, no el permiso para vender un producto autónomo de radiología.
La FDA otorgó a Cognita Imaging un contrato de precio fijo por un valor de 1.294.042 dólares. Los registros federales de contratos lo identifican como la adjudicación 75F40126C00035, destinada a agentes virtuales expertos basados en IA para la evaluación de informes radiológicos.
El contrato entró en vigor el 22 de junio de 2026 y se extiende hasta el 21 de diciembre de 2027. Cognita anunció públicamente el proyecto el 16 de septiembre. Recibió la adjudicación a través del programa Broad Agency Announcement de la FDA para investigación en ciencia regulatoria.
El proyecto se llama “Virtual Subject Matter Expert Agents for Radiology Report Evaluation”. Cognita desarrollará y validará un marco en el que múltiples LLM evalúan informes radiológicos escritos por humanos y generados por IA.
Un jurado de LLM es un grupo de modelos de lenguaje que evalúan de forma independiente la misma respuesta. Sus juicios combinados pueden revelar desacuerdos que un único evaluador automatizado podría ocultar.
El método se aplicará después a aproximadamente un millón de exámenes de pacientes de una gran cohorte estadounidense. La investigación examinará el rendimiento entre poblaciones de pacientes, entornos de atención, equipos de imagen, enfermedades y hallazgos poco frecuentes.
Esa escala es central en la propuesta. Los estudios convencionales de lectores piden a radiólogos que revisen resultados de modelos frente a casos de referencia. Estos estudios siguen siendo esenciales, pero el tiempo de los expertos limita el número y la variedad de casos que pueden cubrir.
Los informes completos también crean una superficie de evaluación mayor que los sistemas de detección con un enfoque limitado. Un modelo de triaje podría identificar un supuesto coágulo sanguíneo o un pulmón colapsado. Su resultado está acotado y puede compararse con una referencia definida.
Un informe generado puede incluir numerosos hallazgos, matices, comparaciones y recomendaciones. Puede omitir una anomalía, inventar una, expresar incorrectamente su gravedad o describir de forma ambigua el hallazgo correcto.
El enfoque de Cognita pide a varios LLM que clasifiquen estas diferencias a gran escala. Los radiólogos intervendrán cuando el jurado identifique un desacuerdo clínicamente importante.
Según el anuncio del contrato de la empresa, los revisores determinarán si el problema se originó en el informe generado, el jurado de LLM o el informe del radiólogo original. Esa adjudicación a tres bandas es crítica porque un informe de referencia no es automáticamente perfecto.
La investigación estará dirigida por el cofundador de Cognita, Akshay Chaudhari. También es profesor asociado de radiología y ciencia de datos biomédicos en Stanford University. Louis Blankemeier, CEO y cofundador de Cognita, actuará como coinvestigador.
Cognita es una filial de propiedad absoluta de Mosaic Clinical Technologies, que pertenece a Radiology Partners. Esa relación brinda al equipo investigador acceso a infraestructura clínica y experiencia radiológica en diversos entornos de práctica.
Radiology Partners afirma que su red más amplia incluye a más de 4.000 radiólogos que prestan servicio a más de 3.400 centros sanitarios. También informa que interpreta más de 55 millones de estudios de imagen al año.
Estas cifras de la empresa describen un posible contexto operativo, no los resultados de validación del contrato. La cohorte de un millón de exámenes aún debe definirse, probarse y comunicarse con suficiente detalle para que otros puedan evaluar su representatividad.
Los entregables contractuales hacen que el proyecto sea más sustancial que un benchmark privado. Cognita debe proporcionar código, orientación de implementación, análisis de cohortes grandes frente a pequeñas, estudios de discrepancias adjudicadas y limitaciones documentadas.
Sin embargo, la FDA no ha prometido adoptar el marco como estándar regulatorio. La investigación puede informar políticas futuras sin convertirse en una vía obligatoria para cada producto generativo de radiología.
Ese límite importa porque la financiación contractual y la autorización de productos cumplen propósitos diferentes. El modelo independiente de radiografías de tórax de Cognita ha recibido la designación de dispositivo innovador, pero no ha recibido autorización de comercialización.
La información original también confirma que el contrato de investigación y la designación de dispositivo innovador son iniciativas distintas. Ninguna sustituye la evidencia necesaria para respaldar una futura solicitud de dispositivo.
Por qué los informes completos rompen el antiguo modelo de evaluación
Los sistemas generativos de radiología convierten la evaluación de una prueba acotada de precisión en un problema abierto de comparación clínica.
Históricamente, la mayor parte de la IA de radiología autorizada ha realizado tareas delimitadas. Un sistema puede segmentar un órgano, señalar una exploración urgente, medir una estructura o detectar una anomalía específica.
Estas funciones pueden seguir requiriendo pruebas complejas. Sin embargo, los desarrolladores normalmente pueden definir el resultado esperado, el estándar de referencia y la población objetivo antes de realizar un estudio.
La generación de informes completos es diferente. El modelo recibe imágenes y posiblemente contexto clínico, y después produce una narrativa que cubre todo lo que considera relevante.
Un examen puede contener varias anomalías con diferentes prioridades clínicas. Otro puede ser normal, pero incluir cambios posoperatorios que no deben confundirse con enfermedad.
Un informe generado puede ser objetivamente preciso y, aun así, estar mal priorizado. Puede mencionar el hallazgo correcto, pero expresarlo de una forma que cambie su urgencia. También puede producir una frase plausible que no esté respaldada por la imagen.
Las alucinaciones describen información que parece creíble, pero carece de respaldo en la evidencia subyacente. Las omisiones se producen cuando un informe no incluye un hallazgo que debería documentarse.
Ambos errores se resisten a una simple coincidencia de texto. Dos radiólogos correctos pueden describir de forma distinta la misma imagen, mientras que dos informes similares pueden tener implicaciones clínicas significativamente diferentes.
Las métricas tradicionales de lenguaje suelen premiar palabras o frases compartidas. No distinguen de manera fiable entre un cambio inocuo de redacción y un error que modifica el manejo del paciente.
Cognita ayudó previamente a desarrollar GREEN, abreviatura de Generative Radiology Report Evaluation and Error Notation. GREEN utiliza un modelo de lenguaje para identificar, categorizar y explicar diferencias clínicamente significativas entre informes generados y de referencia.
El artículo de GREEN, revisado por pares, informó una mayor concordancia con las evaluaciones de expertos que varias métricas convencionales de texto. También produjo explicaciones y recuentos de errores, en lugar de limitarse a devolver una puntuación de similitud.
El contrato de la FDA amplía la idea básica de dos formas. Utiliza varios modelos como jueces en vez de depender de uno solo, e incorpora radiólogos en los casos en que los juicios automatizados tienen importancia clínica.
Un jurado puede reducir la dependencia de las preferencias de un modelo, pero solo si sus integrantes aportan juicios significativamente diferentes. Varios modelos pueden compartir fuentes de entrenamiento, fallos de razonamiento o sensibilidad ante las mismas formulaciones.
Por tanto, el consenso no equivale a la corrección. Cinco modelos que cometen el mismo error pueden generar una mayor confianza sin aportar evidencia válida.
El proceso de discrepancias propuesto aborda parte de ese riesgo. Cuando los jueces discrepan sobre una cuestión clínicamente significativa, un radiólogo puede examinar los informes y determinar qué falló.
Sin embargo, el acuerdo también merece ser evaluado. Si todos los miembros del jurado pasan por alto la misma omisión, la escalada basada en desacuerdos no enviará ese caso a un revisor humano.
Por ello, el proyecto necesita un conjunto de revisión humana muestreado por separado. Ese conjunto puede estimar los errores tanto en decisiones unánimes como en decisiones divididas del jurado.
También importarán las comparaciones entre cohortes grandes y pequeñas. La empresa debe mostrar qué patrones adicionales de fallos se hacen visibles cuando la evaluación se amplía más allá de unos cientos de casos seleccionados.
Un millón de exámenes debería incluir más afecciones raras y combinaciones inusuales. También puede revelar cambios de rendimiento asociados con escáneres, instituciones, poblaciones de pacientes y entornos clínicos.
Sin embargo, la escala por sí sola no garantiza la cobertura. Un conjunto de datos grande puede seguir infrarrepresentando poblaciones importantes, equipos poco comunes o entornos fuera de su red de origen.
Por eso la composición de la cohorte debe seguir formando parte del análisis final. Los lectores necesitarán más que la cifra del titular para juzgar si el método refleja la práctica real en Estados Unidos.
La FDA necesita evidencia que se ajuste a la IA generativa
El contrato llega mientras la FDA decide cómo deberían aplicarse las normas vigentes sobre dispositivos a sistemas con resultados más amplios y menos predecibles.
El 18 de agosto, la FDA publicó un documento de discusión sobre dispositivos médicos habilitados por IA generativa. La agencia solicitó comentarios sobre evaluación de riesgos, evaluación previa a la comercialización, supervisión posterior a la comercialización y gestión del ciclo de vida.
El momento hace que el contrato de Cognita Imaging con la FDA sea especialmente relevante. La agencia no solo está revisando productos individuales. También está examinando si sus métodos de evaluación son adecuados para dispositivos que crean contenido nuevo.
El documento de discusión de la FDA plantea preguntas sobre cómo medir el rendimiento cuando los resultados son variables o abiertos. También pregunta cómo deberían detectar los desarrolladores las confabulaciones, evaluar la supervisión humana y vigilar los productos tras su despliegue.
Un informe radiológico generado por IA toca cada una de estas cuestiones. Su resultado puede variar entre ejecuciones, contener varias afirmaciones clínicas e influir en las decisiones incluso cuando un radiólogo firma el informe final.
Los estudios previos a la comercialización deben establecer la seguridad y la eficacia antes de la autorización. Sin embargo, los conjuntos de prueba limitados pueden pasar por alto combinaciones poco frecuentes que aparecen posteriormente en el uso clínico.
La supervisión posterior a la comercialización ofrece evidencia más amplia, pero revisar cada informe desplegado impondría una gran carga operativa. Los jueces automatizados podrían ayudar a identificar los casos que merecen atención experta.
Eso crea un posible puente entre la validación previa a la comercialización y la vigilancia en el mundo real. El mismo marco de evaluación podría probar un modelo antes de su lanzamiento y supervisar resultados seleccionados tras su despliegue.
El marco seguiría necesitando umbrales claros. Una discrepancia que modifica el tratamiento merece una respuesta distinta a la de un desacuerdo estilístico o una variación inocua en la redacción.
También necesita registros trazables. Los reguladores y los hospitales deben poder reconstruir por qué un juez automatizado asignó una categoría de error y por qué un caso llegó a un revisor humano.
Las actualizaciones de los modelos añaden otro desafío. Si cambia el generador de informes, su distribución de errores puede cambiar. Si cambia un miembro del jurado, los juicios del sistema de evaluación también pueden variar.
Esto crea dos sistemas en movimiento en lugar de uno. Un generador de informes validado podría parecer mejor o peor simplemente porque se actualizaron sus evaluadores.
Por lo tanto, serán necesarios el control de versiones, los conjuntos de prueba bloqueados y los prompts reproducibles. Los desarrolladores deben documentar tanto el producto bajo revisión como cada juez utilizado para evaluarlo.
La FDA ya mantiene una lista de dispositivos de IA que abarca productos autorizados en distintas especialidades médicas. La radiología sigue representando una gran proporción de los dispositivos incluidos.
La agencia señala que quiere identificar con mayor claridad los dispositivos que contienen funcionalidades basadas en LLM en futuras actualizaciones de la lista. Esto indica la necesidad de una visibilidad regulatoria más precisa a medida que las funciones generativas entran en los productos médicos.
El mercado consolidado de IA para radiología también incrementa la presión competitiva. Empresas como Aidoc, Viz.ai, Lunit, Annalise.ai, Rad AI y DeepHealth han desarrollado distintas combinaciones de herramientas de detección, triaje, flujo de trabajo e informes.
Un método escalable de evaluación de informes no favorecería automáticamente a Cognita. Los competidores podrían emplear estrategias de evidencia similares si la FDA publica directrices de aplicación general.
En cambio, la presión recae sobre todos los desarrolladores que hacen afirmaciones amplias de rendimiento a partir de estudios limitados con lectores. Los reguladores y compradores pueden preguntarse si unos pocos cientos de ejemplos seleccionados revelan el comportamiento del modelo ante la variación clínica real.
Los hospitales pueden plantear la misma pregunta durante las adquisiciones. Necesitan evidencia de que un modelo funciona con escáneres, protocolos, grupos de pacientes y convenciones de informe locales.
Si el contrato genera una metodología creíble, cohortes de validación más grandes podrían convertirse en una parte esperada del paquete de evidencia. Eso aumentaría las exigencias de prueba y dificultaría respaldar afirmaciones generativas amplias con casos seleccionados.
El jurado de LLM también debe ser juzgado
La disyuntiva central es directa: los jueces LLM ofrecen escala, pero sus propios errores pueden distorsionar la evidencia que reciben los reguladores.
Los LLM no evalúan informes desde una posición neutral. Sus juicios dependen de los datos de entrenamiento, los prompts, las versiones de los modelos, el orden de evaluación y la redacción de cada informe candidato.
Un juez podría preferir respuestas más largas incluso cuando el texto adicional genera riesgo clínico. Podría favorecer un estilo de redacción familiar o asignar puntuaciones más altas a resultados que se parezcan a sus propias respuestas.
Un modelo también puede producir decisiones inconsistentes en evaluaciones repetidas. Esto genera un problema de reproducibilidad cuando los desarrolladores necesitan mediciones estables para las presentaciones regulatorias.
La atención sanitaria eleva la importancia porque las diferencias sutiles importan. Un evaluador que funciona bien con preguntas médicas generales podría aun así manejar incorrectamente la incertidumbre, la lateralidad, las comparaciones temporales o la terminología específica de imagen.
Una revisión reciente del sector sanitario sobre sistemas de jueces LLM describe la evaluación automatizada como prometedora, pero subraya la necesidad de validación, transparencia y supervisión humana.
El proyecto Cognita está estructurado para investigar varias de estas preocupaciones. Varios jueces pueden revelar inestabilidad, mientras que la adjudicación por radiólogos puede comprobar si los puntos de desacuerdo indican incertidumbre clínicamente relevante.
Sin embargo, una arquitectura de jurado no elimina automáticamente el sesgo. Sus miembros deben seleccionarse y probarse para ofrecer un rendimiento complementario, en lugar de reunirse solo por cantidad de modelos.
La investigación debería revelar si los jueces proceden de distintas familias de modelos. También debería explicar si algún juez comparte tecnología, datos o métodos de optimización con el generador de informes.
La autopreferencia es una preocupación particular. Una familia de modelos puede favorecer resultados que se asemejen a su propia estructura, extensión o patrones de razonamiento.
El problema se vuelve más grave si un desarrollador evalúa su generador utilizando modelos relacionados. Puntuaciones aparentemente sólidas podrían reflejar afinidad estilística en lugar de corrección clínica.
La sensibilidad a los prompts también requiere análisis. Pequeños cambios en las instrucciones pueden alterar cómo un juez pondera las omisiones, la incertidumbre y la relevancia clínica.
Un marco regulatorio no puede depender de un prompt que funcione solo bajo una configuración no documentada. El prompt, la temperatura, la versión del modelo y las reglas de decisión deberían ser reproducibles.
El jurado también debe distinguir entre la calidad del informe y la verdad de la imagen. Un juez que solo analiza texto puede comparar dos informes, pero no puede confirmar de forma independiente qué descripción coincide con la exploración.
Si el informe original omite un hallazgo, el informe generado podría ser penalizado por añadirlo correctamente. Lo contrario puede ocurrir cuando ambos textos coinciden en un error.
La revisión propuesta por Cognita con radiólogos puede resolver algunos de estos conflictos al volver a las imágenes. La metodología final debería indicar cuándo la revisión de imágenes es obligatoria en vez de opcional.
Un evaluador plenamente consciente de las imágenes plantea sus propias complicaciones. Los modelos de visión y lenguaje pueden inspeccionar imágenes y texto, pero entonces también debe validarse su interpretación visual.
Esto crea un problema de aseguramiento por capas. Cada modelo añadido amplía la capacidad, al tiempo que introduce otro componente que puede fallar silenciosamente.
El desacuerdo clínicamente importante tampoco es una categoría fija. Una diferencia menor de redacción para un paciente puede volverse significativa cuando afecta al seguimiento, la urgencia o el tratamiento.
El marco necesitará categorías de error y definiciones de gravedad explícitas. Los radiólogos deberían mostrar un acuerdo significativo al aplicar esas reglas.
El desacuerdo entre lectores no debería tratarse como ruido que debe eliminarse. Puede revelar una ambigüedad genuina en la imagen, el informe o el contexto clínico.
Por ello, el resultado más útil podría ser una incertidumbre calibrada en lugar de una única puntuación universal. Un sistema que identifica de forma fiable los casos inciertos puede respaldar la supervisión sin pretender sustituir el juicio experto.
El coste y la latencia también influirán en la adopción. Ejecutar varios modelos propietarios sobre un millón de informes puede requerir recursos informáticos significativos y procesamiento repetido.
Estas consideraciones económicas no invalidan el enfoque, pero afectan a si los desarrolladores más pequeños pueden reproducirlo. Un método regulatorio resulta menos útil si solo las grandes organizaciones pueden costear la infraestructura de evaluación.
El código y la orientación de implementación de Cognita podrían ayudar. Los entregables finales aún deberían explicar los requisitos de hardware, el acceso a los modelos, el tiempo de procesamiento y la sensibilidad a las actualizaciones de modelos cerrados.
Por lo tanto, el éxito del contrato debería juzgarse por la transparencia y la repetibilidad, no solo por la coincidencia destacada con los radiólogos. Un resultado negativo creíble también aportaría evidencia regulatoria útil.
Si los jurados LLM fallan en determinadas clases de error, la FDA puede restringir su papel en consecuencia. La investigación no necesita demostrar fiabilidad universal para mejorar las prácticas de evaluación.
Qué significaría el éxito en un millón de exámenes
Un resultado exitoso haría que la revisión humana fuera más específica, no que los radiólogos fueran prescindibles.
El modelo operativo central del proyecto es la escalada selectiva. Los jueces automatizados procesan el amplio conjunto de datos, mientras que los especialistas se centran en los casos con incertidumbre o desacuerdo significativos.
Ese diseño puede ampliar el alcance del tiempo limitado de los expertos. También puede concentrar a los revisores en los casos con mayor probabilidad de revelar debilidades del modelo.
El beneficio depende de la sensibilidad del triaje. El jurado debe enviar suficientes informes verdaderamente problemáticos a los radiólogos sin abrumarlos con diferencias inocuas.
Los falsos negativos plantean la mayor preocupación de seguridad. Se producen cuando el jurado acepta un error de informe clínicamente importante y nunca solicita revisión humana.
Los falsos positivos generan una carga diferente. Si se escalan demasiados informes seguros, desaparece la eficiencia prometida y el sistema se aproxima a otro estudio completo con lectores.
La investigación debería informar ambos resultados en distintos niveles de gravedad del error. Un único porcentaje de concordancia ocultaría la disyuntiva operativa.
El rendimiento también debería desglosarse por enfermedad, modalidad, características del paciente, tipo de centro y equipamiento. Los resultados agregados pueden ocultar un rendimiento deficiente en grupos más pequeños.
Los hallazgos poco frecuentes merecen especial atención. Un modelo puede alcanzar una elevada precisión global y, aun así, fallar en afecciones infrecuentes pero urgentes.
Un millón de exámenes hace más plausible el análisis de eventos raros, pero las cifras reales siguen siendo importantes. Un subgrupo poco frecuente con solo unos pocos ejemplos no puede respaldar una conclusión estable.
La comparación entre cohortes de validación pequeñas y grandes será particularmente informativa. Puede mostrar si las conclusiones extraídas de estudios convencionales se mantienen estables cuando se amplía la mezcla de casos.
Si las clasificaciones o las tasas de error cambian de forma sustancial, los desarrolladores y reguladores tendrán evidencia de que las evaluaciones más pequeñas pasan por alto comportamientos importantes. Ese resultado podría reformular el diseño de los estudios incluso si el propio jurado necesita perfeccionarse.
El éxito también influiría en la supervisión posterior a la comercialización. Los hospitales podrían muestrear informes de producción, aplicar un método de evaluación aprobado y dirigir las discrepancias de alto riesgo a los equipos de calidad.
Esa supervisión requeriría gobernanza local. Los sistemas de salud necesitarían responsabilidades claras para las alertas, los plazos de revisión, las acciones correctivas y la comunicación con los proveedores.
La evaluación automatizada no puede convertirse en un sustituto de la notificación de problemas de seguridad en los informes. Debería generar evidencia que respalde los procesos existentes de calidad y regulación.
El método también podría ayudar a comparar versiones de productos. Los desarrolladores podrían evaluar si una actualización corrige errores conocidos sin introducir otros nuevos en otras áreas.
Ese uso requiere un punto de referencia estable y una configuración de evaluador congelada. De lo contrario, los cambios en el jurado podrían confundirse con cambios en el producto.
El efecto competitivo más amplio podría ser significativo. Los desarrolladores de radiología generativa afirman cada vez más que sus sistemas pueden redactar o producir informes completos.
Estas afirmaciones se vuelven más comprobables cuando los evaluadores pueden revisar cohortes grandes y diversas. Las empresas con evidencia limitada podrían afrontar presión para publicar resultados por subgrupo y tasas de error adjudicadas.
Aun así, el contrato de la FDA otorga a Cognita un papel temprano en la configuración de la metodología. La empresa desarrolla su propia IA de radiología, por lo que la gestión de conflictos y la reproducibilidad externa serán importantes.
Los equipos independientes deberían poder probar el marco con otros generadores de informes. También deberían poder reproducir sus hallazgos centrales sin depender de los sistemas privados de Cognita.
El código abierto puede respaldar ese proceso, pero el código por sí solo es insuficiente. La validación externa requiere conjuntos de datos accesibles, prompts documentados, definiciones de errores y registros de versiones de modelos.
La privacidad de los pacientes limitará cuánto pueden divulgarse los datos de origen. El proyecto puede abordar esto mediante acceso controlado, puntos de referencia desidentificados o entornos de validación independientes.
El resultado más sólido combinaría escala con auditabilidad. Los reguladores podrían entonces inspeccionar cómo se produjo un resultado en vez de aceptar una puntuación opaca.
Ese estándar también beneficiaría a los compradores del sector sanitario. Un hospital podría comparar afirmaciones utilizando categorías de error vinculadas a consecuencias clínicas en lugar de cifras de precisión definidas por los proveedores.
Tres señales mostrarán si los jurados de LLM están preparados
Las próximas pruebas deberían revelar si el marco de Cognita mide la seguridad clínica o simplemente automatiza el acuerdo entre modelos de lenguaje.
La primera señal es un protocolo de validación detallado. Debería identificar a los miembros del jurado, los prompts, las versiones de los modelos, la composición de la cohorte, la taxonomía de errores y las reglas de escalamiento.
Estos detalles determinarán si el enfoque es reproducible. También revelarán si el jurado incluye evaluadores significativamente distintos o modelos estrechamente relacionados.
Un protocolo sólido especificaría cómo los investigadores seleccionan decisiones unánimes para su revisión humana. Esta prueba es esencial porque el acuerdo puede ocultar errores compartidos.
La segunda señal es el análisis de discrepancias adjudicado por radiólogos. Los investigadores deberían informar en qué aspectos fallaron el informe generado, el informe original y el jurado de LLM.
Este análisis debería distinguir entre alucinaciones, omisiones, severidad incorrecta, errores de lateralidad, recomendaciones sin respaldo y diferencias de redacción menos relevantes.
También debería divulgar el rendimiento por subgrupos. Unos resultados generales estables no pueden compensar una evaluación débil en enfermedades raras, poblaciones infrarrepresentadas o determinados entornos asistenciales.
Si el jurado detecta discrepancias clínicamente importantes y mantiene manejable la carga de trabajo de revisión, la tesis principal del contrato gana respaldo. Unas tasas elevadas de omisiones o un escalamiento excesivo la debilitarían.
La tercera señal es la respuesta de la FDA una vez que la investigación madure. La agencia podría hacer referencia a la metodología en guías, talleres públicos, revisiones de dispositivos o propuestas de monitorización poscomercialización.
La FDA no necesita exigir jurados de LLM para que el proyecto sea relevante. Incluso una aceptación limitada podría establecer expectativas para la evaluación de grandes cohortes y la adjudicación humana.
El silencio también sería informativo. Podría indicar que el método necesita validación adicional o que los reguladores prefieren evidencia específica de cada producto.
El público no debería interpretar el contrato de Cognita Imaging con la FDA como una prueba de que la IA puede supervisarse de forma segura a sí misma. El proyecto existe porque esta cuestión sigue sin resolverse.
Su premisa más defendible es más acotada. Los jueces automatizados podrían ayudar a los radiólogos a examinar mucha más evidencia si su propio rendimiento se mide con el mismo rigor.
Los desarrolladores, clínicos y compradores de servicios sanitarios deberían observar si el trabajo final expone los modos de fallo en lugar de condensarlos en una sola puntuación. También deberían preguntarse si equipos independientes pueden reproducir los hallazgos.
La cuestión decisiva no es si varios LLM pueden coincidir sobre un informe. Es si sus coincidencias y desacuerdos dirigen de forma fiable la atención humana hacia los casos que más importan.



