Los ensayos clínicos de IA de HHS cuestionan las fases fijas con evidencia adaptativa
HHS lanzó un programa de cinco años que cuestiona las fases fijas, la infraestructura duplicada y las decisiones demoradas integradas en los ensayos de medicamentos convencionales. La iniciativa de ensayos clínicos con IA de HHS combina modelos predictivos, análisis continuo y operaciones automatizadas bajo un mismo marco de investigación.
La pieza central es SURPASS, siglas en inglés de Simulation-augmented, Real-time Platform Adaptive Seamless Trials. ARPA-H, la Agencia de Proyectos de Investigación Avanzada para la Salud, operará el programa junto con tres proyectos de apoyo para centros de ensayo, datos sanitarios y orientación a pacientes.
La promesa inmediata es la velocidad. La tarea más difícil es demostrar que el software adaptativo puede generar evidencia tan fiable como los procesos que reemplaza. Ese conflicto presiona al mismo tiempo a reguladores, patrocinadores farmacéuticos, organizaciones de investigación clínica, centros de ensayo y equipos estadísticos.
Los ensayos clínicos con IA de HHS van más allá de las fases fijas
SURPASS no se limita a añadir un asistente de IA a un ensayo existente. Propone un modelo operativo distinto para generar evidencia clínica.
HHS anunció SURPASS el 30 de septiembre de 2026. Según el programa de ensayos clínicos del departamento, la iniciativa combinará modelos computacionales predictivos, infraestructura compartida, grupos de control comunes y análisis en tiempo real.
El programa está diseñado para operar durante cinco años. Se espera que comience a solicitar propuestas más adelante en el otoño a equipos especializados en estadística, IA, diseño de ensayos, operaciones y regulación.
HHS no reveló la financiación del programa en su anuncio inicial. Tampoco explicó qué flexibilidad regulatoria recibirían los participantes seleccionados, según la primera cobertura de SURPASS.
Estas omisiones importan porque SURPASS va más allá de la automatización administrativa. Sus tres áreas técnicas abordan el diseño de ensayos, la inferencia estadística y las operaciones.
La primera área es un motor de diseño sin fases. Utilizaría gemelos digitales y modelos predictivos relacionados para simular posibles resultados clínicos y operativos antes de que comience un estudio. Un gemelo digital es una representación computacional de un paciente o proceso que se utiliza para explorar resultados probables.
El término “sin fases” no significa que las pruebas clínicas perderían sus controles de seguridad. Describe una estructura más continua que puede reducir los traspasos rígidos entre fases de ensayo tradicionalmente separadas.
La segunda área es un motor de inferencia continua. Analizaría los datos acumulados mediante reglas estadísticas diseñadas para mantenerse válidas durante revisiones repetidas. Los investigadores podrían entonces añadir, detener o ajustar grupos de tratamiento sin esperar una única fecha fija de análisis.
La tercera área es una capa de operaciones basada en agentes. En este contexto, un agente es software que puede completar una secuencia definida de tareas operativas con una dirección humana limitada. HHS quiere que estos sistemas respalden la preparación de ensayos, la limpieza de datos, la incorporación de grupos de tratamiento y la construcción de conjuntos de datos.
SURPASS combina, por tanto, varias ideas ya establecidas en lugar de depender de un único modelo nuevo. Los ensayos adaptativos ya permiten cambios predeterminados basados en la evidencia acumulada. Los ensayos de plataforma pueden evaluar varios tratamientos bajo un protocolo compartido. Los modelos computacionales ya informan algunas decisiones de desarrollo de medicamentos.
El cambio propuesto consiste en integrar esos elementos dentro de un sistema persistente. Ese sistema aprendería durante un ensayo, en lugar de tratar el diseño, el reclutamiento, el análisis y la elaboración de informes como etapas mayormente separadas.
HHS afirma que el desarrollo de fármacos y productos biológicos a menudo dura más de una década, puede costar hasta $2 billion de media y fracasa más del 90 por ciento de las veces. Estas cifras proceden del anuncio de la agencia y deben entenderse como su justificación para el programa.
La pregunta útil no es si el proceso actual es lento. Pocos participantes discuten ese punto. La cuestión es si una plataforma continua puede eliminar demoras sin trasladar la incertidumbre a modelos más difíciles de auditar.
Esa distinción crea la tensión central del artículo. Las operaciones más rápidas son valiosas, pero la evidencia clínica debe seguir siendo interpretable después de que un ensayo cambie de rumbo.
Cuatro proyectos abordan cuatro cuellos de botella distintos
HHS trata la lentitud de los ensayos como un problema de sistemas que involucra diseño, centros, datos y pacientes, no solo como una falta de mejores algoritmos.
SURPASS cubre el diseño y la ejecución de ensayos. Tres proyectos complementarios de ARPA-H abordan las condiciones que determinan si un estudio adaptativo puede operar a escala nacional.
STACK se centra en la capacidad de los centros clínicos. HHS afirma que el proyecto utilizará IA para acelerar la activación de centros y ayudar a que instalaciones sanitarias sin experiencia en investigación se conviertan en centros capaces de realizar ensayos.
La activación de un centro incluye contratos, preparación del personal, configuración tecnológica, revisión regulatoria y cualificación por parte del patrocinador. Un diseño estadístico más rápido aporta pocos beneficios si los hospitales participantes tardan meses en comenzar a inscribir pacientes.
STACK también plantea un argumento geográfico. Más centros cualificados podrían permitir que los pacientes participen en estudios más cerca de casa, en vez de viajar repetidamente a un importante centro académico.
Esa expansión introduce una prueba práctica. Los nuevos centros deben recopilar datos consistentes, proteger a los participantes y seguir protocolos complejos. La automatización del papeleo no puede sustituir a investigadores con experiencia, coordinadores capacitados o sistemas clínicos fiables.
COMMONS aborda la infraestructura de datos. HHS lo describe como un sistema de privacidad desde el diseño para el consentimiento y el acceso a datos aptos para la regulación.
Los datos aptos para la regulación deben ser rastreables, controlados y adecuados para tomar decisiones sobre la seguridad y la eficacia de los tratamientos. La agregación ordinaria de datos no cumple automáticamente ese estándar.
COMMONS está concebido para conectar la información necesaria para la inscripción, el modelado predictivo y las operaciones de los ensayos. Si se implementa bien, podría reducir las solicitudes repetidas de datos y facilitar la identificación de pacientes elegibles.
También podría exponer uno de los mayores desafíos de implementación de la iniciativa. Los hospitales y las redes de investigación almacenan información en formatos distintos, bajo reglas de gobernanza diferentes y con una calidad de datos desigual.
El consentimiento plantea otro desafío. El permiso de un paciente para aportar información debe seguir siendo comprensible cuando los datos se trasladan entre instituciones o respaldan nuevos análisis computacionales.
CINCH se centra en el lado del paciente. El proyecto busca ayudar a las personas a aportar datos del mundo real, coordinar su atención e identificar ensayos que se ajusten a sus circunstancias.
Los datos del mundo real proceden de la atención rutinaria y de la vida cotidiana, en lugar de una visita de estudio estrictamente controlada. Pueden incluir historiales médicos electrónicos, reclamaciones, resultados de laboratorio, registros e información recopilada por dispositivos conectados.
Estas fuentes pueden ampliar la perspectiva sobre los efectos de los tratamientos. También pueden contener información faltante, mediciones inconsistentes y patrones generados por el acceso desigual a la atención.
Por tanto, CINCH debe hacer más que buscar palabras clave en el historial de un paciente. Un sistema de orientación útil debe explicar por qué un estudio parece relevante y mantener a los clínicos involucrados en las decisiones de elegibilidad.
Juntos, SURPASS, STACK, COMMONS y CINCH forman un programa por capas. SURPASS rediseña el ensayo. STACK amplía dónde puede realizarse. COMMONS proporciona información gobernada. CINCH conecta a los pacientes con el sistema.
Esta estructura diferencia el anuncio de los proyectos de IA clínica más acotados. HHS no promete que un único modelo de predicción seleccionará fármacos exitosos. Intenta crear una infraestructura compartida para la generación repetida de evidencia.
Esa ambición más amplia también aumenta el riesgo de ejecución. Los cuatro proyectos dependen unos de otros, pero involucran instituciones, estándares técnicos y obligaciones legales distintos.
Un fallo en cualquier capa puede limitar a las demás. Una mejor correspondencia no puede reparar un centro no disponible. Un centro más rápido no puede compensar datos inutilizables. Un modelo sólido no puede rescatar un protocolo mal gobernado.
La verdadera disputa es velocidad frente a evidencia verificable
El conflicto principal no es la IA contra los investigadores humanos. Es la promesa de una adaptación continua frente a la necesidad de conclusiones estables y reproducibles.
Los límites tradicionales entre fases generan demoras, pero también organizan responsabilidades. Los patrocinadores saben qué evidencia debe existir antes de avanzar. Los revisores pueden identificar cuándo cambió un protocolo y qué conjunto de datos respaldó una decisión.
Una plataforma continua debilita esos límites conocidos. Esto puede eliminar trabajo duplicado, pero vuelve más importantes la planificación estadística y la auditabilidad.
Los ensayos adaptativos de plataforma ilustran esta disyuntiva. Pueden evaluar varias intervenciones bajo un protocolo maestro, eliminar grupos ineficaces, añadir nuevos candidatos y compartir grupos de control.
Durante la pandemia de COVID-19, los ensayos de plataforma produjeron evidencia importante sobre tratamientos mientras los programas convencionales tenían dificultades con la velocidad. Su éxito demostró que una infraestructura adaptable puede responder eficazmente a preguntas urgentes.
Sin embargo, la adaptación debe especificarse antes de que los investigadores vean resultados que puedan influir en sus decisiones. Los cambios no planificados pueden generar sesgo, aumentar el riesgo de falsos positivos o dificultar la interpretación del efecto de un tratamiento.
Una importante revisión sobre ensayos de plataforma describe los requisitos de diseño, ejecución, supervisión e informe necesarios para estos estudios. Su lección central es que la flexibilidad exige más planificación, no menos.
Los controles compartidos requieren una disciplina similar. Un grupo de control común puede reducir el número de participantes asignados al tratamiento estándar y mejorar la eficiencia en varias comparaciones.
Los problemas surgen cuando un nuevo grupo de tratamiento se compara con pacientes inscritos mucho antes. La práctica médica, los patrones de enfermedad, los métodos diagnósticos y las características de los pacientes pueden cambiar con el tiempo.
Los investigadores llaman a esos participantes anteriores controles no concurrentes. Utilizarlos puede aumentar la potencia estadística, pero también puede introducir sesgo relacionado con el tiempo.
SURPASS propone un motor de inferencia siempre válido para abordar el análisis repetido y la adaptación. HHS aún no ha publicado la especificación estadística del motor, los criterios de validación ni los criterios de aceptación regulatoria.
La misma carga de evidencia se aplica a los gemelos digitales. Un modelo puede simular resultados probables antes de la inscripción, ayudando a los equipos a evaluar supuestos o identificar decisiones débiles en el protocolo.
Una simulación sigue siendo una estimación. Refleja los pacientes, las variables y las relaciones representadas en sus datos de entrenamiento.
Si un gemelo digital representa insuficientemente a adultos mayores, pacientes rurales, personas embarazadas o pacientes con múltiples afecciones, el ensayo resultante puede volverse eficiente en torno a una población incompleta.
Por tanto, la validación debe examinar más que la precisión media de las predicciones. Los patrocinadores y reguladores tendrán que saber dónde falla un modelo, cómo se calibra la incertidumbre y si el rendimiento cambia entre centros.
También necesitarán un proceso para actualizar los modelos. Un modelo que mejora continuamente parece atractivo, pero cambiar el software durante un ensayo puede complicar la reconstrucción de decisiones pasadas.
Toda recomendación importante debe estar vinculada a una versión específica del modelo, un conjunto de datos de entrada, una regla y una aprobación humana. Sin ese registro, la velocidad puede debilitar la rendición de cuentas.
HHS ya ha declarado que la investigación biomédica respaldada por IA debe hacer hincapié en la reproducibilidad, los métodos transparentes y la revisión imparcial. Su estrategia de IA también identifica las presentaciones regulatorias respaldadas por evidencia de IA como un resultado medible.
SURPASS comprobará si esos principios resisten el contacto con una plataforma operativa. La documentación pública será especialmente importante porque HHS quiere que las herramientas, normas y ejemplos regulatorios resultantes beneficien al sistema de investigación en general.
El objetivo no debería ser hacer adaptativos todos los ensayos. Algunas preguntas se ajustan a diseños estables y convencionales. Otras implican resultados que no pueden medirse con la suficiente rapidez como para orientar cambios en tiempo real.
La supervivencia a largo plazo, los efectos adversos tardíos y las afecciones de evolución lenta no se vuelven inmediatos porque el software analice más rápido los datos entrantes.
El diseño debe seguir a la pregunta médica. De lo contrario, el programa corre el riesgo de tratar la adaptación como un objetivo en lugar de como un método.
Operation TrialBlazer eleva las apuestas competitivas
SURPASS forma parte de un esfuerzo federal más amplio para convertir a Estados Unidos en un lugar más rápido para desarrollar medicamentos, especialmente a medida que crece la capacidad de investigación clínica de China.
HHS presentó Operation TrialBlazer en junio de 2026 como una iniciativa de investigación clínica para todo el departamento. Coordina el trabajo de ARPA-H, FDA, NIH, el National Cancer Institute y funcionarios federales de tecnología sanitaria.
El argumento político de la iniciativa es directo. HHS afirma que la investigación en fases tempranas se ha trasladado al extranjero y que Estados Unidos corre el riesgo de perder la inversión, la experiencia y la actividad de desarrollo de fármacos asociadas.
China ofrece la comparación más visible. Los datos de IQVIA mostraron que la proporción de inicios de ensayos globales de las empresas chinas aumentó del 1 por ciento en 2009 al 30 por ciento en 2024.
Estados Unidos sigue manteniendo ventajas importantes, entre ellas un gran mercado farmacéutico, reguladores experimentados, hospitales de investigación líderes y una sólida financiación de biotecnología.
Sin embargo, la velocidad de los ensayos influye en dónde las empresas prueban sus productos y dónde los inversores colocan su capital. Un programa científico que avanza lentamente puede perder oportunidades incluso si sus instituciones siguen siendo respetadas.
SURPASS ataca los retrasos de diseño y operación. Otras medidas de TrialBlazer se centran en la revisión regulatoria y los requisitos de presentación.
La FDA ha puesto en marcha un programa piloto de Expedited Investigational New Drug para estudios de primera administración en humanos. Los patrocinadores seleccionados pueden trabajar con instituciones de investigación cualificadas y presentar los componentes de una solicitud de forma progresiva.
La presentación progresiva permite a los reguladores revisar las secciones terminadas antes de que esté listo todo el paquete. La FDA también quiere que parte del trabajo de revisión institucional y activación de centros avance en paralelo al desarrollo de la solicitud.
La agencia afirma que unas expectativas más claras sobre química y fabricación, adecuadas para cada fase, pueden ahorrar a las empresas entre seis y 12 meses. Estas estimaciones figuran en su hoja de ruta de desarrollo, que también abarca la selección cuantitativa de dosis y los protocolos maestros para fases avanzadas.
Para el desarrollo posterior, la FDA ha aclarado cuándo una investigación pivotal rigurosa, junto con evidencia confirmatoria, puede respaldar una aprobación. También ha revisado el borrador de sus directrices para ensayos de tipo basket, umbrella y platform.
Estas políticas importan porque ARPA-H no puede crear por sí sola aceptación regulatoria. SURPASS puede financiar herramientas y demostraciones, pero la FDA determina si la evidencia resultante respalda una decisión sobre un producto médico.
La relación entre las agencias determinará la adopción. Los patrocinadores dudarán en reconstruir sus programas de ensayos en torno a un sistema nuevo sin pruebas claras de que los reguladores puedan evaluar sus resultados.
También existe el riesgo opuesto. Un impulso político para acelerar el desarrollo nacional podría generar presión para interpretar la incertidumbre de forma generosa.
La defensa más sólida es una validación transparente. Una revisión más rápida debería significar coordinación más temprana, requisitos más claros y menos trabajo duplicado. No debería significar estándares más débiles de seguridad o eficacia.
La iniciativa federal de TrialBlazer afirma explícitamente que la modernización debe preservar el rigor científico. Ese principio ahora necesita una implementación observable.
Por eso el éxito del programa no debería medirse solo por plazos más cortos. HHS también debe hacer seguimiento de las desviaciones del protocolo, la representatividad, la detección de eventos adversos, la reproducibilidad y la concordancia entre las predicciones de los modelos y los resultados clínicos.
La competitividad nacional añade urgencia, pero no resuelve el problema de la evidencia. Estados Unidos gana poco con ensayos más rápidos si otros reguladores, clínicos o pacientes no confían en sus conclusiones.
Lo que HHS debe demostrar a continuación
Los próximos hitos deben demostrar que SURPASS puede producir herramientas validadas, evidencia lista para reguladores y un acceso más amplio para los pacientes al mismo tiempo.
La primera señal es la estructura de la convocatoria de ARPA-H. Los solicitantes necesitan objetivos medibles de velocidad, coste, carga para los participantes, validez estadística y cobertura poblacional.
Una convocatoria centrada principalmente en funciones de automatización debilitaría la afirmación del programa. Una sólida exigirá validación prospectiva frente a enfoques convencionales y criterios claros de fracaso.
Los equipos también deberían indicar cómo se auditarán los modelos entre grupos demográficos y centros participantes. La precisión agregada no basta para decisiones que determinan quién entra en un ensayo o qué tratamiento continúa.
La segunda señal es la alineación regulatoria. La participación de la FDA debe avanzar desde el apoyo general a diseños innovadores hasta métodos concretos para evaluar los resultados de SURPASS.
Los patrocinadores necesitan orientación sobre validación aceptable de gemelos digitales, cambios en los modelos, controles compartidos, análisis continuo y documentación. También necesitan saber cuándo sigue siendo necesario un diseño convencional.
Los ejemplos públicos ayudarían. Un protocolo, un plan de simulación y un marco de análisis revisados por un regulador podrían hacer útil el programa más allá de sus equipos financiados.
La alineación regulatoria reforzaría la iniciativa si produce estándares claros antes de que grandes ensayos dependan de ellos. La ambigüedad persistente ralentizaría la adopción, independientemente del rendimiento técnico del software.
La tercera señal es la evidencia operativa de STACK, COMMONS y CINCH. HHS debería informar si los nuevos centros se activan más rápido, si reclutan poblaciones representativas y si los pacientes pueden comprender el proceso de consentimiento.
Un mayor número de centros no es automáticamente significativo. Los centros deben inscribir participantes, mantener la calidad de los datos, retener al personal y proteger a los pacientes.
COMMONS debería evaluarse por la disponibilidad de datos trazables de calidad regulatoria, no por el volumen de registros conectados. CINCH debería evaluarse por las asignaciones adecuadas, las inscripciones completadas y la comprensión de los pacientes.
Estas medidas revelarían si los ensayos clínicos de IA de HHS amplían el acceso o simplemente aceleran el trabajo en instituciones ya equipadas para participar.
El programa también debería publicar resultados negativos. Un gemelo digital que tenga un rendimiento deficiente en un área de enfermedad aún puede aportar evidencia valiosa sobre dónde no corresponde aplicar el enfoque.
Esa transparencia ayudaría a distinguir la infraestructura científica de una campaña de adquisición tecnológica. También respaldaría los estándares reutilizables que HHS afirma querer crear.
Para los equipos clínicos, la tarea a corto plazo es prepararse. Las organizaciones que consideren participar deberían trazar ahora la procedencia de sus datos, la gobernanza de los modelos, el lenguaje de consentimiento y los registros de decisiones.
Los conocimientos de estadísticos, clínicos, ingenieros de datos, especialistas regulatorios y operadores de centros deben permanecer conectados durante todo el estudio. Los equipos pueden utilizar una base de conocimientos con capacidad de búsqueda para preservar supuestos, decisiones y documentación de modelos entre esos grupos.
El resultado más importante de la iniciativa no será afirmar que la IA hizo los ensayos más rápidos. Será demostrar que los investigadores llegaron antes a respuestas fiables, con menos cargas innecesarias y sin pérdidas ocultas de rigor.
HHS ha definido la ambición. ARPA-H debe ahora demostrar sus métodos, la FDA debe aclarar la vía probatoria y los equipos financiados deben publicar resultados que terceros puedan reproducir. ¿Expondrán los primeros proyectos de SURPASS sus reglas de validación con la misma claridad con la que promocionan su velocidad?



