El mapa del universo de proteínas CLSS une secuencia y estructura, pero no reemplaza a AlphaFold
CLSS ha creado un mapa del universo de proteínas de 32 dimensiones que reúne secuencias de aminoácidos y estructuras tridimensionales, pese a que sus señales a menudo entran en conflicto. El modelo ofrece a los investigadores un único sistema de coordenadas para comparar dominios proteicos, ya partan de una secuencia, una estructura o un fragmento corto.
La distinción importa porque CLSS no es otro intento de predecir miles de millones de estructuras proteicas. AlphaFold y sistemas relacionados ya transformaron esa tarea. CLSS aborda, en cambio, el problema organizativo que generaron esas predicciones: cómo los investigadores pueden navegar enormes colecciones de proteínas y reconocer relaciones que un solo tipo de dato podría pasar por alto.
El estudio revisado por pares, publicado en agosto de 2026, informa de que CLSS reproduce patrones importantes de clasificaciones expertas de proteínas sin utilizar sus etiquetas durante el entrenamiento. También superó a varios modelos de lenguaje de proteínas más grandes en benchmarks de clasificación seleccionados. El resultado cuestiona un flujo de trabajo de investigación habitual que trata el análisis de secuencias y el análisis estructural como etapas separadas.
Qué cambia realmente el mapa del universo de proteínas CLSS
CLSS convierte la secuencia y la estructura de las proteínas en coordenadas compatibles, trasladando el foco de predecir formas individuales a organizar relaciones en todo el espacio proteico.
Investigadores de la Universidad de Haifa, la Universidad de Tel Aviv y el Earth-Life Science Institute desarrollaron Contrastive Learning Sequence-Structure, abreviado como CLSS. Su estudio en PNAS se publicó el 11 de agosto de 2026.
Una secuencia proteica enumera sus aminoácidos en orden. Una estructura proteica describe cómo esa cadena ocupa el espacio tridimensional. Ambas contienen indicios sobre ascendencia y función, pero no siempre cuentan la misma historia.
Secuencias relacionadas de forma distante pueden plegarse en estructuras similares. Las secuencias estrechamente relacionadas también pueden comportarse de manera distinta tras mutaciones, eventos de unión o cambios ambientales. Esa relación de muchos a muchos dificulta construir un mapa universal de proteínas.
CLSS representa cada dominio proteico como un embedding, es decir, un vector numérico que sitúa objetos relacionados cerca unos de otros. Sus embeddings finales contienen solo 32 dimensiones. Los investigadores pueden proyectar esos vectores en dos dimensiones para explorarlos visualmente, mientras que las búsquedas de similitud operan sobre la representación completa.
El modelo acepta una secuencia o una estructura como entrada. Después busca asignar a las entradas de secuencia y estructura coincidentes prácticamente la misma dirección. Esta propiedad se denomina coembedding, lo que significa que distintos tipos de datos comparten un espacio de coordenadas comparable.
Los sistemas existentes también pueden procesar varias modalidades biológicas. Sin embargo, aceptar múltiples modalidades no garantiza que sus representaciones estén alineadas. Un modelo podría situar la secuencia y la estructura de una misma proteína en regiones distintas porque cada entrada sigue una geometría interna independiente.
Los investigadores informan de que CLSS evita esta separación con mayor eficacia que ESM3, ProstT5 y ProTrek en sus evaluaciones. Los mapas derivados de la secuencia de un dominio se asemejan estrechamente a los mapas derivados de su estructura. Esa consistencia hace que la visualización sea más que un par de atlas contiguos.
El modelo también se presenta en dos formas principales. CLSS-full empareja secuencias completas de dominios con sus estructuras correspondientes. CLSS-sub empareja estructuras con fragmentos de secuencia, lo que permite que piezas más cortas entren en el mismo espacio representacional.
Los dominios proteicos son unidades compactas que a menudo pueden plegarse o funcionar con cierta independencia. La evolución recombina repetidamente dominios y fragmentos más pequeños en nuevas proteínas. Por lo tanto, un modelo que sitúa los fragmentos de forma significativa puede revelar relaciones ocultas en las comparaciones de proteínas completas.
Este es el cambio central detrás del titular. El modelo no muestra literalmente todas las proteínas naturalmente posibles, un conjunto ilimitado que ninguna base de datos contiene. Ofrece una forma unificada de organizar dominios representativos y proyectar colecciones más amplias de proteínas en un mapa común.
Este planteamiento es más preciso que afirmar que la IA ha completado el atlas de la biología. El mapa del universo de proteínas CLSS es un sistema de coordenadas analítico, no un inventario final de cada proteína o cada función biológica.
Por qué la investigación de proteínas necesitaba un sistema de coordenadas compartido
La rápida expansión de las estructuras predichas creó un cuello de botella de interpretación que la predicción estructural por sí sola no puede resolver.
AlphaFold puso a disposición predicciones precisas de estructuras proteicas a una escala sin precedentes. Su base de datos pública contiene más de 200 millones de estructuras predichas, que cubren proteínas de organismos de todo el árbol de la vida.
Otros proyectos han ampliado aún más ese panorama. Una publicación de 2026 basada en ESMFold2 generó un atlas abierto con más de mil millones de estructuras proteicas predichas, según los detalles reportados del atlas. Los investigadores se enfrentan ahora a muchos más datos estructurales de los que la clasificación manual tradicional puede absorber cómodamente.
Más estructuras no producen automáticamente una mayor comprensión biológica. Los científicos aún deben determinar qué proteínas están relacionadas, qué regiones se unen a moléculas similares y qué similitudes aparentes reflejan una ascendencia compartida.
La comparación de secuencias sigue siendo valiosa porque la evolución deja patrones reconocibles de residuos. Sin embargo, esos patrones se erosionan a lo largo de escalas temporales extensas. Dos proteínas pueden conservar un plegamiento relacionado después de que sus secuencias hayan divergido más allá del alcance de los métodos de alineamiento convencionales.
La comparación estructural puede recuperar algunas de esas conexiones distantes. Sin embargo, calcular y buscar relaciones tridimensionales detalladas en bases de datos masivas implica costes considerables de computación y almacenamiento. Las estructuras también no están disponibles o son inciertas para muchas secuencias.
Un embedding compacto ofrece otra capa entre los datos sin procesar y el juicio biológico. Una vez que una proteína se convierte en un vector numérico corto, los investigadores pueden buscar elementos cercanos sin volver a alinear cada secuencia o estructura con cada una de las demás entradas.
CLSS va más allá al hacer comparables los vectores derivados de secuencias y estructuras. Un investigador que solo dispone de una secuencia puede buscar en un panorama informado por relaciones estructurales. Otro puede comenzar con una estructura conocida y encontrar vecinos cuyos patrones de secuencia aporten contexto adicional.
El equipo entrenó CLSS sin proporcionar etiquetas jerárquicas de ECOD o CATH. ECOD y CATH son sistemas seleccionados por expertos que clasifican dominios proteicos según relaciones estructurales y evolutivas.
A pesar de esa omisión, los mapas resultantes supuestamente reprodujeron gran parte de su organización jerárquica. Este resultado importa porque sugiere que el modelo aprendió relaciones presentes en los datos emparejados de secuencia y estructura, en lugar de memorizar las etiquetas de clasificación utilizadas para la evaluación.
El mapa también puede revelar relaciones que no encajan limpiamente en una jerarquía. Las clasificaciones tradicionales sitúan las proteínas en grupos anidados, como ramas de una taxonomía. La evolución biológica no siempre coopera con límites tan ordenados.
Los dominios pueden reutilizar fragmentos, intercambiar componentes o pasar por formas intermedias. Un mapa continuo puede situar ejemplos ambiguos entre regiones establecidas en lugar de obligar a cada uno a encajar en una sola casilla.
Investigaciones anteriores ya habían mostrado por qué estos mapas son útiles. Un estudio de 2023 sobre proteínas microbianas describió un espacio continuo de plegamientos e identificó 438 estructuras nunca antes observadas, agrupadas en 148 posibles plegamientos nuevos. Su mapa de proteínas microbianas demostró que las visualizaciones de baja dimensionalidad pueden revelar relaciones graduales entre plegamientos aparentemente distintos.
CLSS aplica un mecanismo y un objetivo diferentes. Aprende una representación compartida a partir de secuencias y estructuras emparejadas, en lugar de utilizar únicamente características de grafos estructurales. El resultado extiende un cambio más amplio de la predicción de proteínas hacia la navegación proteica.
Ese cambio presiona a los equipos que mantienen flujos aislados para secuencias y estructuras. Las herramientas separadas siguen siendo necesarias para el trabajo detallado, pero sus resultados necesitan una capa común de indexación. De lo contrario, los investigadores corren el riesgo de crear bases de datos más grandes sin adquirir una capacidad proporcional para explorarlas.
Para los biólogos computacionales, la lección práctica se parece a un problema conocido en los sistemas de conocimiento. Recopilar más material no resuelve el descubrimiento si el sistema no preserva conexiones significativas. Los equipos que gestionan evidencia científica densa enfrentan el mismo problema al crear una base de conocimiento consultable.
Cómo el aprendizaje contrastivo une secuencia y estructura
CLSS tiene éxito al entrenar dos vías de entrada para que concuerden en la identidad, conservando a la vez suficiente variación para separar dominios proteicos no relacionados.
La arquitectura utiliza dos torres, un diseño en el que codificadores separados procesan distintos tipos de entrada. Una torre lee secuencias de aminoácidos. La otra procesa estructuras proteicas.
La torre de secuencias parte de un modelo pequeño de estilo ESM2. La torre estructural utiliza un codificador ESM3 congelado, lo que significa que sus parámetros subyacentes permanecen sin cambios durante el entrenamiento de CLSS. Las capas adaptadoras transforman ambas salidas al espacio compartido de 32 dimensiones.
El entrenamiento se basa en aprendizaje contrastivo. En cada lote, el sistema aproxima las representaciones de una secuencia y una estructura coincidentes. Al mismo tiempo, aleja los dominios que no coinciden.
Este mecanismo se parece a los enfoques utilizados para conectar imágenes con texto. El modelo no necesita que un investigador etiquete cada familia de dominios. Aprende del hecho de que una secuencia concreta corresponde a una estructura concreta.
El equipo entrenó la red durante 80 épocas en ocho GPU NVIDIA A100 con 40 gigabytes de memoria cada una. Según se informa, el entrenamiento tomó alrededor de cuatro días y medio.
Solo unos 36 millones de parámetros eran entrenables. Ese total se aproxima al pequeño modelo ESM2 de 35 millones de parámetros utilizado para inicializar la vía de secuencias. Está muy por debajo de los tamaños reportados de ESM3, ProstT5 y ProTrek.
El tamaño del modelo por sí solo no determina la calidad. Los sistemas más grandes suelen admitir tareas más amplias o comportamientos generativos más ricos que un modelo especializado no intenta abordar. Aun así, CLSS demuestra que un objetivo de entrenamiento centrado puede producir representaciones útiles sin actualizar miles de millones de parámetros.
El contraste importa porque no todos los grupos de investigación de proteínas cuentan con presupuestos de computación a hiperescala. Un componente entrenable más pequeño reduce la barrera para reproducir, adaptar o ampliar el enfoque. Los embeddings compactos también reducen los costes de almacenamiento y búsqueda después del entrenamiento.
CLSS-full se concentra en dominios completos. Su torre de secuencias y su torre estructural produjeron la concordancia multimodal más sólida reportada. Si un dominio completo entra por cualquiera de las dos vías, su vecindario permanece comparativamente estable.
CLSS-sub acepta fragmentos como una modalidad adicional. Durante el entrenamiento, el sistema empareja una subsecuencia muestreada con la estructura del dominio completo. Aprende a situar ese fragmento cerca del contexto estructural más amplio al que pertenece.
Esa tarea es más difícil que comparar una secuencia completa con su propia estructura. Un segmento corto contiene menos información, y pueden aparecer motivos similares en proteínas no relacionadas. Por ello, el modelo de fragmentos renuncia a parte de la calidad de alineamiento de dominios completos, pero adquiere una capacidad de la que a menudo carecen las representaciones competidoras.
La justificación evolutiva es considerable. La naturaleza rara vez inventa cada proteína partiendo de un lienzo en blanco. Pequeños segmentos de secuencia pueden duplicarse, modificarse e insertarse en distintos dominios a lo largo de extensos periodos evolutivos.
Un fragmento que aparece en dos proteínas por lo demás no relacionadas puede indicar una historia compartida distante. También puede reflejar evolución convergente, donde restricciones similares generan soluciones similares de manera independiente. CLSS aporta candidatos para investigar, pero no puede resolver esa distinción únicamente por su ubicación.
Los investigadores también superpusieron propiedades biológicas sobre sus mapas. Los dominios asociados a cofactores orgánicos se agruparon en regiones concretas, mientras que los dominios de unión a metales parecían estar distribuidos de forma más amplia.
Los cofactores son moléculas o iones no proteicos que ayudan a las proteínas a realizar reacciones químicas. Su distribución en el mapa permite comprobar si la geometría aprendida se corresponde con propiedades funcionales más allá del parecido de secuencia.
Estas superposiciones hacen que el mapa del universo proteico de CLSS pueda resultar útil para generar hipótesis. Un investigador podría identificar un dominio no caracterizado cerca de proteínas que se unen a un ligando concreto y, después, priorizar pruebas bioquímicas en torno a ese vecindario.
Sin embargo, la proximidad en el mapa es evidencia de similitud representacional, no una prueba de función idéntica. Las proteínas vecinas pueden diferir en residuos críticos del sitio activo. También pueden operar en organismos, compartimentos celulares o complejos moleculares distintos.
Por tanto, el papel del modelo se parece más al de un motor de búsqueda que al veredicto automatizado de un laboratorio. Puede acotar un enorme conjunto de candidatos y revelar asociaciones inesperadas. El trabajo experimental aún debe determinar si esas asociaciones se mantienen en condiciones biológicas.
La verdadera competencia es entre el mapeo unificado y el análisis separado
CLSS cuestiona los procesos fragmentados de representación, no los sistemas de predicción estructural que aportan gran parte de su información subyacente.
Las comparaciones con AlphaFold resultan tentadoras porque ambos proyectos utilizan IA para estudiar proteínas. Sin embargo, resuelven problemas diferentes.
AlphaFold predice la estructura tridimensional de una proteína a partir de su secuencia. CLSS mapea relaciones entre dominios proteicos mediante representaciones de secuencia y estructura. Uno genera candidatos estructurales, mientras que el otro organiza evidencia en un espacio más amplio.
Por ello, las herramientas pueden complementarse. Una estructura predicha por AlphaFold puede entrar en la ruta estructural, mientras que su secuencia de aminoácidos entra en la ruta de secuencia. La concordancia entre ambas representaciones puede facilitar la navegación y la clasificación.
ESM3 ocupa una posición más amplia. Puede trabajar con información relacionada con la secuencia, la estructura y la función de las proteínas, y admite generación. CLSS toma prestado un codificador estructural congelado de ESM3, pero entrena su espacio compartido en torno a un objetivo de mapeo más acotado.
ProstT5 traduce entre la secuencia proteica y alfabetos estructurales. ProTrek utiliza múltiples modalidades biológicas y un enfoque contrastivo. Estos sistemas demuestran que el modelado multimodal de proteínas es anterior a CLSS.
La afirmación más sólida del estudio es más específica. En los entornos evaluados, CLSS produjo un solapamiento más cohesionado entre los mapas de secuencia y estructura. Los investigadores también informan de un buen desempeño en tareas de clasificación de ProteinShake, un marco estandarizado para evaluar representaciones de proteínas.
Estos resultados respaldan el mapeo unificado como dirección técnica. No establecen que CLSS sea universalmente superior en predicción, diseño, anotación o generación de proteínas.
Una representación especializada de 32 dimensiones necesariamente comprime información. Esa compresión puede enfatizar relaciones generales mientras descarta detalles necesarios para otras tareas. Las interacciones a nivel de residuo, las conformaciones dinámicas, las regiones desordenadas y el contexto celular no pueden conservarse intactos dentro de un único vector corto.
La distribución de entrenamiento introduce otra limitación importante. CLSS aprendió de dominios proteicos representados en recursos estructurales existentes, incluidos ejemplos determinados experimentalmente y predichos asociados con ECOD.
Esas bases de datos contienen un enorme valor científico, pero no son muestras neutrales de toda la biología. Las estructuras experimentales favorecen proteínas que los investigadores pueden aislar, estabilizar y medir. Las colecciones predichas heredan sesgos de las secuencias disponibles y de la confianza del modelo.
Un Protein Universe Atlas más amplio combinó anteriormente redes de secuencias, predicciones estructurales y anotaciones para identificar familias inexploradas. Sus creadores también documentaron la persistente dificultad de asignar funciones a grandes porciones del espacio proteico.
CLSS no elimina ese territorio oscuro. Lo reorganiza. Un dominio poco caracterizado puede recibir coordenadas sin adquirir una función, mecanismo u origen evolutivo verificados.
La evaluación frente a ECOD y CATH también merece una interpretación cuidadosa. Recuperar jerarquías de expertos sin sus etiquetas es una evidencia significativa. Sin embargo, esas clasificaciones siguen reflejando el mismo paisaje proteico conocido del que procedían los ejemplos de entrenamiento.
El artículo señala que sus dominios aleatorios de entrenamiento y validación procedían de la misma distribución general. Esa elección encaja con el objetivo de construir un mapa exhaustivo dominado por familias comunes. Es menos exigente que evaluar únicamente familias distantes separadas deliberadamente de los ejemplos de entrenamiento.
Esta distinción importa cuando los usuarios preguntan si CLSS puede generalizar a una biología verdaderamente desconocida. El rendimiento en clasificaciones estándar no responde por completo cómo maneja el modelo plegamientos raros, proteínas de membrana inusuales, regiones desordenadas o secuencias de entornos poco muestreados.
La reducción de dimensionalidad añade otra razón para la cautela. La incrustación subyacente de CLSS tiene 32 dimensiones, pero un mapa mundial suele mostrar solo dos. Algoritmos como t-SNE pueden preservar vecindarios locales mientras distorsionan las distancias y la geometría global.
Por tanto, un grupo llamativo en pantalla es una pista, no una conclusión biológica. Los investigadores deben inspeccionar los vecinos en el espacio completo de incrustación y compararlos con alineamientos de secuencia, superposiciones estructurales, anotaciones funcionales y experimentos.
La expresión “vista única” también puede generar una expectativa errónea. La secuencia y la estructura se vuelven compatibles, pero no intercambiables en todos los contextos científicos. Cada modalidad contiene evidencia, incertidumbre y modos de fallo distintos.
Una secuencia se observa directamente cuando los científicos determinan el gen o la proteína subyacentes. Una estructura predicha es una inferencia cuya confianza varía entre residuos y complejos. Integrar ambas en una misma incrustación no elimina esa diferencia de estatus probatorio.
La competencia adecuada es el mapeo unificado frente al análisis separado. CLSS sostiene que un sistema de coordenadas aprendido puede facilitar la búsqueda de la evidencia combinada. Las herramientas detalladas aún deben examinar por qué dos proteínas aparecen cerca una de otra.
Qué debe ocurrir antes de que CLSS transforme el descubrimiento de proteínas
La siguiente prueba consiste en determinar si investigadores independientes pueden convertir vecindarios del mapa en descubrimientos verificados en proteínas desconocidas y experimentalmente difíciles.
La primera señal que debe vigilarse es la reproducción externa en familias de proteínas distantes. Los investigadores deberían evaluar CLSS con particiones que limiten drásticamente el solapamiento de secuencia y estructura entre los dominios de entrenamiento y de prueba.
Un rendimiento sólido en esas condiciones reforzaría la afirmación de que la representación captura principios biológicos transferibles. Un descenso pronunciado sugeriría que gran parte de su organización depende de distribuciones de familias conocidas.
La segunda señal es la validación experimental de hipótesis derivadas del mapa. Los estudios más convincentes comenzarán con una proteína desconocida o controvertida, utilizarán CLSS para identificar vecinos inesperados y pondrán a prueba la relación predicha en un laboratorio.
Entre los resultados útiles podrían figurar la unión verificada a ligandos, la actividad enzimática, la similitud estructural o fragmentos evolutivos compartidos. Los resultados negativos serán igualmente informativos porque pueden revelar qué tipos de proximidad sobrevalora la incrustación.
La tercera señal es la adopción en flujos de trabajo prácticos de búsqueda en bases de datos e ingeniería de proteínas. El equipo investigador prevé usos en alineamiento de secuencias, reconstrucción evolutiva y diseño. Estas aplicaciones exigen más que visualizaciones atractivas.
Las herramientas de búsqueda deben seguir siendo rápidas a medida que crecen las bases de datos. Los resultados necesitan evidencia interpretable para que los investigadores comprendan por qué apareció un candidato. Los procesos también deben registrar versiones de modelos, estructuras de origen, puntuaciones de confianza y actualizaciones de bases de datos.
La descripción institucional del proyecto describe un visor interactivo para explorar el espacio proteico. El uso por laboratorios independientes mostrará si la interfaz ayuda a los investigadores a llegar a preguntas comprobables en lugar de limitarse a explorar clasificaciones conocidas.
La ingeniería de proteínas plantea un listón más alto. Un vecindario útil puede sugerir fragmentos o plantillas de dominio, pero diseñar una proteína funcional requiere compatibilidad en plegamiento, estabilidad, actividad y expresión.
CLSS-sub resulta especialmente interesante aquí porque sitúa fragmentos cortos de secuencia junto a dominios y estructuras completos. Si esas ubicaciones identifican sistemáticamente componentes reutilizables, podrían mejorar la etapa de búsqueda del diseño de proteínas.
Sin embargo, la reutilización histórica de un fragmento no garantiza que pueda trasplantarse de forma segura. Su comportamiento depende de los residuos circundantes y del contexto molecular. El diseño experimental debe tratar una incrustación cercana como una relación candidata, no como una instrucción de ensamblaje.
La misma cautela se aplica al descubrimiento de fármacos. Un grupo asociado a un tipo de cofactor o ligando puede orientar la priorización. No puede establecer que todas las proteínas cercanas se unan a la misma molécula u ofrezcan un sitio susceptible de intervención farmacológica.
Los usuarios también deberían observar si las futuras versiones de CLSS incorporan explícitamente la incertidumbre. Un único vector puede ocultar desacuerdos entre modalidades o regiones estructurales de baja confianza. Exponer esos desacuerdos ayudaría a los investigadores a distinguir vecindarios estables de otros frágiles.
Otro avance útil conectaría las ubicaciones del mapa con explicaciones a nivel de residuo. Los científicos necesitan saber si dos proteínas se alinean debido a un núcleo compartido, un motivo corto, un bolsillo de unión o una amplia semejanza arquitectónica.
Esa transparencia determinará si CLSS se convierte en una capa analítica de uso cotidiano. Los biólogos pueden tolerar predicciones imperfectas cuando un sistema les ayuda a diseñar el siguiente experimento. Es menos probable que confíen en un vecindario sin explicación dentro de un mapa visualmente persuasivo.
La importancia más profunda de CLSS radica en su respuesta a la abundancia de datos. La biología cuenta ahora con inmensas colecciones de secuencias, estructuras predichas y anotaciones. El problema limitante implica cada vez más hacer que esas colecciones sean comparables y fáciles de buscar.
El mapa del universo proteico de CLSS ofrece una respuesta creíble. Comprime secuencia y estructura en un lenguaje compartido, recupera clasificaciones establecidas e incorpora los fragmentos al mismo paisaje.
Su logro sigue siendo más limitado que completar un mapa de las proteínas de la vida. Persisten las funciones desconocidas, las estructuras inciertas, las bases de datos sesgadas y los experimentos difíciles. Ninguna visualización bidimensional puede eliminar esas limitaciones.
Los investigadores deberían plantearse ahora una pregunta concreta: ¿un vecindario CLSS los conduce a una relación que de otro modo no encontrarían, y esa relación resiste las pruebas experimentales? Si laboratorios independientes responden afirmativamente de forma reiterada, el mapeo unificado de proteínas será más que una perspectiva convincente. Pasará a formar parte de cómo comienza el descubrimiento biológico.



