La predicción cold-start de HierHGT-DTI afronta la prueba más difícil del descubrimiento de fármacos
La predicción cold-start de HierHGT-DTI ha superado a seis modelos de comparación en pruebas clave con objetivos proteicos no observados, según un nuevo estudio revisado por pares. El resultado aborda un problema difícil del descubrimiento computacional de fármacos. Los modelos suelen funcionar bien cuando los datos de prueba se parecen a sus ejemplos de entrenamiento. Su precisión puede caer drásticamente cuando un objetivo no tiene un historial de interacciones registrado.
Los investigadores Zhangben Chen y Yaping Wan desarrollaron HierHGT-DTI en la University of South China. Su sistema combina información sobre estructura química y secuencias proteicas en un único grafo tipado y multiescala. Después predice si un fármaco candidato y una proteína interactúan.
El conflicto no consiste simplemente en HierHGT-DTI frente a otro modelo. Se trata de razonamiento molecular transferible frente a éxito en benchmarks basado en parte en compuestos, proteínas y andamios químicos conocidos. El modelo logró sus mayores ventajas cuando las identidades proteicas se excluyeron del entrenamiento. Sin embargo, varios hallazgos también muestran por qué esas puntuaciones no pueden demostrar utilidad en laboratorio.
HierHGT-DTI gana cuando desaparece el historial de proteínas
El resultado importante no es la clasificación general del modelo. Es dónde apareció la mayor diferencia de rendimiento.
El estudio revisado por pares se publicó en BMC Bioinformatics el 14 de septiembre de 2026. Chen y Wan evaluaron HierHGT-DTI en DrugBank, BioSNAP y BindingDB. Estos conjuntos de datos públicos contienen asociaciones registradas entre fármacos y objetivos proteicos.
Los investigadores utilizaron tres configuraciones de evaluación. Una partición aleatoria distribuye pares de interacción entre los grupos de entrenamiento, validación y prueba. Por tanto, fármacos y proteínas conocidos pueden aparecer a ambos lados de la división.
Una partición cold-drug excluye identidades completas de fármacos del entrenamiento. Una partición cold-protein hace lo mismo con las secuencias proteicas. La tercera configuración representa con mayor fidelidad un objetivo recién implicado sin datos establecidos de ligandos.
La predicción de interacción fármaco-objetivo, o DTI, clasifica compuestos que parecen propensos a interactuar con proteínas específicas. No establece eficacia clínica ni siquiera confirma unión física. En cambio, puede reducir la lista de candidatos enviados a experimentos bioquímicos o celulares.
HierHGT-DTI ocupó el primer puesto en las seis configuraciones aleatorias y cold-start de DrugBank y BioSNAP. Los investigadores repitieron sus evaluaciones con cinco semillas aleatorias para reducir la dependencia de una única inicialización favorable.
En la prueba cold-protein de DrugBank, el modelo registró un AUROC de 0.864 y un AUPR de 0.878. AUROC mide la clasificación entre ejemplos positivos y negativos en distintos umbrales. AUPR enfatiza la precisión entre los positivos recuperados, por lo que resulta útil cuando los ejemplos positivos son escasos.
El baseline más sólido de DrugBank alcanzó un AUROC cold-protein de 0.776. HierHGT-DTI lideró, por tanto, por 8.8 puntos porcentuales. Su ventaja en AUPR fue de 7.9 puntos.
Los resultados de BioSNAP siguieron la misma dirección. HierHGT-DTI alcanzó un AUROC cold-protein de 0.863 y un AUPR de 0.866. El AUROC del baseline más sólido fue 0.805, lo que dejó una diferencia de 5.8 puntos.
Esas diferencias fueron mayores que las fracciones que normalmente separan a los modelos en datos de prueba conocidos. También sobrevivieron a la corrección del estudio por comparaciones múltiples en la familia de benchmarks de DrugBank y BioSNAP.
El resultado fue menos concluyente en BindingDB. HierHGT-DTI logró el mejor AUPR cold-protein, con 0.681. Sin embargo, HiGraphDTI registró un AUROC cold-protein ligeramente superior: 0.835 frente a 0.831.
HiGraphDTI también lideró las configuraciones aleatoria y cold-drug de BindingDB. Su AUROC y AUPR aleatorios fueron 0.934 y 0.837. HierHGT-DTI alcanzó 0.932 y 0.829.
Ese resultado mixto importa. Concentra el argumento más sólido del nuevo modelo en priorizar candidatos para proteínas no observadas. No demuestra superioridad universal en las tareas de predicción fármaco-objetivo.
Los tres conjuntos de datos también difieren de forma sustancial. DrugBank contenía 34,748 pares preparados, incluidos 17,250 ejemplos positivos. BioSNAP contenía 27,457 pares y 13,830 positivos.
BindingDB contenía 24,743 pares, pero solo 5,784 positivos, lo que produjo una tasa de positivos del 23.4 por ciento. DrugBank y BioSNAP se situaban ambos cerca del 50 por ciento.
AUPR cambia con la prevalencia de ejemplos positivos. Por ello, sus valores brutos deben compararse dentro de un conjunto de datos, no entre conjuntos de datos. El estudio reconoció explícitamente esta limitación.
Los autores compararon HierHGT-DTI con MolTrans, TransformerCPI, DrugBAN, DO-GMA, GeNNius y HiGraphDTI. Estos baselines abarcan modelos de secuencias, sistemas de atención y enfoques basados en grafos.
Esta es una prueba más sólida que comparar resultados copiados de artículos no relacionados. Todos los modelos utilizaron particiones de datos equivalentes y las mismas cinco semillas. Esa consistencia reduce varias fuentes comunes de diferencias de rendimiento engañosas.
Sin embargo, los benchmarks equivalentes siguen siendo benchmarks. Las puntuaciones miden la capacidad del modelo para clasificar ejemplos seleccionados y pares no etiquetados muestreados. No muestran si sus predicciones principales se convierten en medicamentos validados.
Por qué la predicción cold-protein genera la presión real
Un modelo que falla con proteínas no observadas ofrece ayuda limitada cuando la biología revela un objetivo sin ligandos conocidos.
Las particiones aleatorias de prueba pueden hacer que la predicción molecular parezca más fácil que el despliegue real. Un sistema puede explotar proteínas recurrentes, compuestos relacionados o andamios químicos conocidos. Puede clasificar pares reservados sin dar un salto significativo hacia una biología desconocida.
Esta preocupación es anterior a HierHGT-DTI. La investigación sobre la memorización de benchmarks ha mostrado que las pruebas basadas en ligandos pueden recompensar la similitud con compuestos de entrenamiento. Por tanto, una alta precisión con particiones aleatorias puede sobrestimar la generalización.
El problema cold-start elimina parte de esos apoyos. Bajo una evaluación cold-protein, cada secuencia proteica de prueba está ausente del entrenamiento y la validación. El modelo debe transferir patrones aprendidos en otros contextos.
Esta configuración importa porque solo una parte del proteoma humano es abordada por fármacos establecidos. Investigaciones anteriores cartografiaron el conjunto limitado de proteínas asociadas con terapias aprobadas y en fase clínica. También identificaron muchos objetivos inexplorados con potencial relevancia terapéutica.
Un objetivo puede volverse interesante por la genética, la biología de una enfermedad, la investigación sobre resistencia o nuevas evidencias de una vía. Sin embargo, puede seguir careciendo de suficientes ligandos probados para un modelo supervisado convencional.
Esto genera presión sobre cada sistema DTI construido alrededor del historial de interacciones. Los objetivos más recientes suelen ser los que tienen las etiquetas más escasas. Un método que depende en gran medida de etiquetas pasadas se vuelve más débil justo donde los equipos de descubrimiento más necesitan priorización.
HierHGT-DTI intenta alejar la fuente de evidencia del historial de interacciones. Consume la representación SMILES de un fármaco, que codifica su estructura química como texto. También utiliza la secuencia de aminoácidos del objetivo.
El modelo no necesita una estructura proteica tridimensional resuelta experimentalmente. En su lugar, utiliza ESM-2, un modelo de lenguaje de proteínas entrenado para aprender patrones a partir de secuencias biológicas.
El estudio utilizó la variante compacta de ESM-2 de ocho millones de parámetros. Generó una representación de 320 dimensiones para cada residuo. El mismo modelo también produjo un mapa de contactos predicho que describe relaciones probables entre residuos.
Esta elección facilita la aplicación del sistema a proteínas con secuencias conocidas, pero sin estructuras experimentales. También significa que parte de la aparente inteligencia procede de representaciones proteicas preentrenadas, no solo de la nueva arquitectura de grafos.
Los autores reconocieron esa distinción. Solicitaron un predictor más simple que use las mismas incrustaciones de ESM-2. Esa comparación aislaría cuánto de la mejora cold-protein procede del diseño del grafo.
La evaluación cold-drug presenta otra complicación. Una molécula reservada puede seguir siendo químicamente similar a un compuesto de entrenamiento. En las particiones cold-drug convencionales de DrugBank y BioSNAP del estudio, más de la mitad de los compuestos de prueba compartían un andamio Bemis-Murcko con datos de entrenamiento o validación.
Un andamio Bemis-Murcko representa los anillos centrales y el armazón de conexión de una molécula. Compartir uno no hace que dos compuestos sean idénticos, pero puede preservar una familiaridad estructural considerable.
Los investigadores añadieron pruebas con andamios disjuntos para abordar ese problema. El AUROC de HierHGT-DTI disminuyó 2.5 puntos en BioSNAP, 2.1 puntos en DrugBank y 1.4 puntos en BindingDB.
Esos descensos respaldan la preocupación de que las puntuaciones cold-drug ordinarias se benefician de la similitud conservada de los andamios. Sin embargo, el estudio solo probó HierHGT-DTI bajo ese protocolo más estricto. No volvió a ejecutar los seis baselines para una comparación directa.
La prueba cold-protein también presenta una limitación relacionada. Las secuencias exactas de prueba fueron excluidas del entrenamiento, pero las proteínas no se separaron mediante agrupación por familias de secuencias. Homólogos cercanos podrían mantenerse a ambos lados de la partición.
Eso significa que la prueba representa identidades no observadas, no necesariamente familias de proteínas desconocidas. Un protocolo futuro más sólido excluiría grupos de secuencias o familias completas.
Por tanto, la predicción cold-start de HierHGT-DTI eleva el estándar sin completar la prueba de generalización. Muestra una transferencia sólida más allá de identidades exactas. Aún no demuestra transferencia entre familias proteicas distantes.
Un grafo multiescala mantiene conectados los detalles moleculares
El mecanismo central de HierHGT-DTI conserva señales moleculares finas mientras les proporciona rutas cortas hacia decisiones sobre el fármaco completo y la proteína completa.
El sistema representa cada par candidato como un único grafo heterogéneo. Heterogéneo significa que el grafo contiene distintos tipos de nodos y relaciones, en lugar de tratar todos los objetos y conexiones de forma idéntica.
Hay seis tipos de nodos. El lado del fármaco contiene átomos, subestructuras químicas y un nodo de fármaco completo. El lado de la proteína contiene residuos, comunidades de residuos y un nodo de proteína completa.
La jerarquía química comienza con descripciones atómicas de 74 dimensiones. Estas codifican propiedades que incluyen identidad del elemento, valencia, carga, aromaticidad, hibridación y quiralidad.
RDKit divide después cada molécula en subestructuras BRICS. BRICS es un método de fragmentación basado en reglas que separa moléculas alrededor de enlaces químicamente significativos.
La jerarquía proteica comienza con las incrustaciones de residuos de ESM-2. El modelo conserva las secuencias registradas completas en lugar de truncar las proteínas largas. Las ventanas superpuestas proporcionan contactos predichos cuando una secuencia es demasiado larga para una sola pasada.
Los residuos se conectan mediante proximidad de secuencia, contactos predichos y similitud de incrustaciones. La agrupación Louvain organiza este grafo en comunidades intermedias.
El código fuente llama “pockets” a esos nodos de comunidad, pero esa etiqueta exige cautela. Son grupos computacionales derivados de información de secuencia. No son bolsillos de unión a ligandos medidos experimentalmente.
HierHGT-DTI conecta después escalas adyacentes en ambas direcciones. Los átomos se conectan con subestructuras, que se conectan con el fármaco completo. Los residuos se conectan con sus comunidades, que se conectan con la proteína completa.
Los atajos directos también conectan átomos con el nodo del fármaco y residuos con el nodo de la proteína. Estas rutas permiten que la información detallada llegue a representaciones globales sin atravesar todos los niveles intermedios.
Por último, una arista bidireccional une los supernodos del fármaco y la proteína para cada par candidato. Esa arista aparece en ejemplos positivos y no etiquetados. No revela la etiqueta correcta de interacción.
El grafo completo utiliza 18 tipos de relaciones dirigidas. Dos capas de transformador de grafos heterogéneos las procesan con cuatro cabezas de atención y un tamaño oculto compartido de 128.
Un transformador de grafos heterogéneos aplica atención respetando los tipos de objetos conectados y sus relaciones. Por tanto, el modelo puede tratar un enlace químico de forma distinta a una conexión de residuos o un enlace jerárquico.
Cada nodo primero recopila mensajes por separado para cada relación entrante. Después, un mecanismo de asignación aprendido combina esos mensajes específicos de cada relación. El cálculo considera tanto las preferencias de relación aprendidas como el número de vecinos disponibles.
Tras dos capas, el modelo extrae las representaciones de los supernodos del fármaco y la proteína. Combina sus vectores brutos, productos elemento a elemento y diferencias absolutas. Un predictor multicapa convierte esa representación en una puntuación de interacción.
La arquitectura parece convincente porque refleja varios niveles utilizados en el razonamiento químico y biológico. Los átomos forman estructuras funcionales, los residuos forman regiones proteicas más grandes y ambos contribuyen al comportamiento global.
Sin embargo, los resultados de ablación cuentan una historia más prudente. Eliminar la jerarquía intermedia modificó el AUPR entre menos 0,0042 y más 0,0041 en seis configuraciones de DrugBank y BioSNAP.
Ninguna de esas comparaciones de jerarquía alcanzó significación estadística. La jerarquía bilateral completa quedó en primer lugar entre las variantes relacionadas en solo tres de las seis configuraciones.
En contraste, eliminar los atajos directos de fino a global redujo el AUPR medio en las seis configuraciones. Las pérdidas oscilaron entre 0,0002 y 0,0109.
Incluso esa evidencia requiere matices. Ninguna comparación de ablación siguió siendo significativa tras la corrección aplicada a la familia completa de 96 pruebas. Eliminar conjuntamente ambas familias de atajos también impide atribuir el efecto a uno de los lados.
Las pruebas post hoc ofrecieron otra perspectiva. En un punto de control de BioSNAP, eliminar las relaciones de atajo durante la inferencia provocó una caída de 0,239 en AUROC. Eliminar las relaciones internas de la proteína causó un descenso de 0,069, mientras que eliminar la jerarquía produjo una caída de 0,038.
Esos diagnósticos muestran de qué dependía un modelo entrenado concreto. No demuestran que una ruta específica haya causado la ventaja más amplia observada en los benchmarks.
Por tanto, el mecanismo más defendible es más limitado de lo que sugiere el titular. HierHGT-DTI tiene éxito como un sistema integrado con múltiples rutas de información. Las rutas directas parecen especialmente importantes, mientras que la jerarquía intermedia aporta contexto con ganancias medidas inconsistentes.
El paquete de reproducibilidad permite poner a prueba esa afirmación. Incluye código fuente, configuraciones, particiones procesadas, manifiestos, resúmenes de resultados e instrucciones de reproducción.
Esa transparencia debería ayudar a grupos independientes a ejecutar controles más estrictos. También hace que el trabajo sea más útil que un artículo cuya construcción del benchmark no pueda reconstruirse.
El Benchmark Aún Contiene Negativos Desconocidos
La mayor incertidumbre no es si los cálculos reportados se ejecutaron correctamente. Es si las etiquetas representan limpiamente la pregunta biológica.
El estudio plantea la tarea como predicción binaria de interacciones. Las etiquetas positivas corresponden a interacciones registradas. Sin embargo, muchas etiquetas negativas no son no interacciones confirmadas experimentalmente.
Son pares candidatos no observados. Algunos podrían representar interacciones reales que los investigadores no han probado ni añadido a las bases de datos de origen.
Este es un problema común en las bases de datos biológicas. “No registrado” no significa necesariamente “no interactúa”. Tratar cada par no observado como negativo introduce ruido en las etiquetas.
El conjunto preparado de DrugBank contenía 17.250 pares positivos y 17.498 pares candidatos negativos tras la deduplicación. Los metadatos que describían el muestreo negativo original eran incompletos.
La versión ascendente no documentó por completo su universo de candidatos, semilla de muestreo, ponderación por grado, controles de andamiaje ni controles de similitud proteica. Esas omisiones limitan lo que los investigadores posteriores pueden inferir del benchmark.
Los autores exploraron esta sensibilidad modificando la construcción de candidatos. El muestreo consciente del grado de los extremos redujo el AUPR entre 0,040 y 0,067 con respecto al muestreo uniforme en pruebas seleccionadas.
Una proporción de tres a uno de candidatos negativos produjo valores de AUPR entre 0,680 y 0,878. Ese rango muestra que el rendimiento absoluto depende de cómo los investigadores construyan el conjunto de cribado.
La selección de métricas también cambia el panorama. AUROC puede parecer tranquilizador cuando predominan los ejemplos negativos porque la tasa de falsos positivos sigue siendo numéricamente pequeña.
AUPR se centra más directamente en si los candidatos mejor clasificados son realmente positivos. La investigación que compara ambas métricas explica por qué la evaluación de precisión-recall suele ser más informativa para tareas de cribado desequilibradas.
BindingDB ilustra esa diferencia. HiGraphDTI registró un AUROC ligeramente mejor para proteínas frías, mientras que HierHGT-DTI produjo un AUPR sustancialmente mejor.
Para un equipo de descubrimiento con capacidad de laboratorio limitada, la parte superior de la lista clasificada importa mucho. Un AUPR alto puede indicar menos ensayos desperdiciados entre los candidatos priorizados.
Sin embargo, el AUPR del benchmark aún no puede estimar el éxito real en laboratorio sin una prueba prospectiva. El modelo todavía no ha recibido una diana genuinamente nueva y producido una lista de compuestos validada.
El estudio incluyó un pequeño ejercicio de interpretación externa con cinco interacciones positivas registradas que involucraban subunidades alfa del receptor GABAA. Los compuestos seleccionados incluyeron clonazepam, isoflurano y desflurano.
Para cada par, los investigadores compararon los cinco residuos mejor clasificados por el modelo con regiones gruesas esperadas. La coincidencia osciló entre cero de cinco residuos y cinco de cinco.
Solo un caso alcanzó un valor de permutación no ajustado de 0,050. Otro alcanzó 0,077, mientras que los casos restantes fueron más débiles.
Ese resultado desigual no valida un mecanismo de unión. Los autores lo dijeron directamente. Sus comunidades de residuos son vecindarios calculados, y los cinco ejemplos no establecen sitios físicos de unión.
Por tanto, la interpretabilidad debe mantenerse separada de la clasificación predictiva. Una puntuación de atención puede mostrar qué características de entrada influyeron en un modelo. No revela automáticamente una causa bioquímica.
El modelo también depende de varias decisiones fijas de preprocesamiento. Estas incluyen un umbral de contacto de 0,5, una resolución de Louvain de 1,0 y un tamaño mínimo de comunidad de residuos de tres.
Esos ajustes no se optimizaron sistemáticamente. Un umbral o método de agrupamiento diferente podría cambiar la representación proteica intermedia.
El estudio utilizó un modelo proteico de ocho millones de parámetros en lugar de una versión ESM-2 más grande. Esa elección redujo los requisitos computacionales, pero deja abierta la cuestión de si representaciones de secuencia más ricas alterarían la clasificación.
Los autores entrenaron cada ejecución en una Nvidia RTX 4090 con entradas moleculares y proteicas precomputadas. El entrenamiento requirió de 26,8 a 43,6 minutos por semilla en las nueve combinaciones principales de conjunto de datos y partición.
La inferencia media de prueba tardó de 5,3 a 11,1 segundos, o aproximadamente de 592 a 890 muestras por segundo. La memoria GPU máxima asignada osciló entre 1,53 y 2,54 GiB.
Estas cifras sugieren que reproducir el clasificador es viable para muchos equipos académicos con acceso a una GPU moderna. La precomputación de representaciones de secuencia sigue añadiendo trabajo que no queda reflejado en los tiempos de entrenamiento reportados.
Más importante aún, la accesibilidad computacional no resuelve la validación experimental. Los ensayos prospectivos siguen siendo la línea divisoria entre un método de clasificación prometedor y una herramienta de descubrimiento en la que se confía para tomar decisiones reales.
Qué Debería Validar Después la Predicción Cold-Start de HierHGT-DTI
Tres pruebas determinarán si la ganancia reportada se mantiene más allá de las convenciones habituales de los benchmarks.
La primera señal es el rendimiento bajo exclusiones por familia proteica. La exclusión de secuencias exactas es útil, pero permite que homólogos cercanos aparezcan durante el entrenamiento.
Un experimento más sólido debería agrupar las proteínas por identidad de secuencia antes de realizar la partición. Entonces, clústeres o familias completas quedarían fuera del conjunto de entrenamiento.
Si HierHGT-DTI conserva su ventaja en ese escenario, la evidencia de transferencia a dianas genuinamente desconocidas será más sólida. Una caída pronunciada mostraría que parientes biológicos cercanos respaldaron el resultado actual.
Esta prueba debería incluir las mismas seis líneas base. Debería preservar candidatos, semillas, métricas y presupuestos de hiperparámetros idénticos en todos los modelos.
La segunda señal es un estudio prospectivo de laboratorio. Los investigadores deberían seleccionar una proteína sin etiquetas de interacción establecidas, congelar el modelo y clasificar una biblioteca de compuestos disponible.
Un equipo ciego podría entonces probar una parte definida de la lista clasificada. Deberían reportarse la unión confirmada, la actividad funcional, las tasas de falsos positivos y el enriquecimiento frente a líneas base prácticas.
Ese diseño respondería preguntas que ningún conjunto de datos retrospectivo puede resolver. Revelaría si las predicciones mejor clasificadas ahorran experimentos y si el modelo funciona fuera de las convenciones de etiquetas heredadas.
Los resultados negativos seguirían siendo valiosos. Podrían revelar similitudes de secuencia engañosas, sesgo de las bases de datos o características que se correlacionan con interacciones registradas sin capturar la unión.
La tercera señal es una ablación con representación controlada. Un predictor más simple debería recibir los mismos embeddings de residuos ESM-2, descriptores de átomos, particiones y presupuesto de optimización.
Esa comparación aislaría el valor de la organización de grafos tipados de HierHGT-DTI. También mostraría si las características de secuencia preentrenadas explican la mayor parte de la ganancia en proteínas frías.
Los autores ya identifican este aspecto como un siguiente paso importante. También proponen ablaciones de atajos separadas para el lado del fármaco y de la proteína, aprendizaje positivo-no etiquetado, particiones temporales y construcción de candidatos emparejada.
El aprendizaje positivo-no etiquetado trata las interacciones registradas como positivas sin asumir que cada par restante es verdaderamente negativo. Este enfoque refleja mejor las bases de datos biológicas incompletas.
La evaluación temporal ofrecería otro desafío realista. Un modelo podría entrenarse con interacciones conocidas antes de una fecha de corte y predecir asociaciones descubiertas posteriormente.
Esa estructura evita que el conocimiento futuro entre en el preprocesamiento o la construcción de particiones. También se parece a la forma en que un sistema desplegado encuentra nueva evidencia a lo largo del tiempo.
Para los equipos farmacéuticos y de biotecnología, el valor a corto plazo es el triaje. HierHGT-DTI no sustituye el docking, los ensayos bioquímicos, los estudios celulares, la toxicología ni la evaluación clínica.
En cambio, puede proponer qué pares compuesto-diana merecen primero esos costosos pasos. Ese papel se vuelve valioso cuando una nueva diana crea miles de candidatos plausibles y la capacidad de laboratorio es limitada.
Los desarrolladores también deberían observar la lección de ingeniería más amplia del estudio. El diseño de la evaluación puede importar tanto como el diseño de la arquitectura. Las particiones aleatorias pueden responder una pregunta distinta de la que afronta un sistema desplegado.
Una ficha de modelo para este tipo de sistema debería documentar la superposición de entidades, la superposición de andamiajes, la similitud entre familias proteicas, el muestreo negativo, la prevalencia de clases y la procedencia temporal. Reportar solo una puntuación principal oculta demasiado.
La evidencia reproducible también requiere registros organizados. Los equipos que comparan modelos, conjuntos de datos y resultados de ensayos necesitan un historial técnico consultable, como una base de conocimiento de ingeniería. De lo contrario, las suposiciones del benchmark pueden desaparecer entre experimentos.
La predicción cold-start de HierHGT-DTI es un avance creíble porque sus mejores resultados aparecen bajo una configuración de evaluación más exigente. Su implementación abierta y sus comparaciones emparejadas refuerzan aún más el trabajo.
La conclusión prudente sigue siendo importante. El sistema clasifica mejor objetivos proteicos no vistos en dos grandes benchmarks y lidera una prueba de precisión-recall de BindingDB. No ha demostrado unión física, mecanismo ni valor clínico.
La próxima decisión corresponde a investigadores independientes. Reproduzcan los resultados actuales, impongan conjuntos de exclusión por familia de proteínas y prueben en el laboratorio una clasificación congelada. Esos pasos mostrarán si el modelo encontró biología transferible o si dominó otro benchmark cuidadosamente construido.



