La carte de l’univers protéique CLSS réunit séquence et structure, mais ne remplace pas AlphaFold
CLSS a créé une carte de l’univers protéique en 32 dimensions qui associe les séquences d’acides aminés et les structures tridimensionnelles, malgré les signaux souvent contradictoires qu’elles fournissent. Le modèle offre aux chercheurs un système de coordonnées unique pour comparer des domaines protéiques, qu’ils partent d’une séquence, d’une structure ou d’un court fragment.
Cette distinction est importante, car CLSS ne constitue pas une nouvelle tentative de prédire des milliards de structures protéiques. AlphaFold et des systèmes apparentés ont déjà transformé cette tâche. CLSS s’attaque plutôt au problème d’organisation créé par ces prédictions : comment les chercheurs peuvent parcourir d’immenses collections de protéines et reconnaître des relations qu’un seul type de données pourrait ne pas révéler.
L’étude évaluée par les pairs, publiée en août 2026, indique que CLSS reproduit de grands motifs issus des classifications expertes des protéines sans utiliser leurs étiquettes pendant l’entraînement. Il a également surpassé plusieurs modèles de langage protéique plus vastes sur certains benchmarks de classification. Ce résultat remet en question un flux de recherche habituel qui traite l’analyse des séquences et l’analyse structurale comme des étapes distinctes.
Ce que la carte de l’univers protéique CLSS change réellement
CLSS transforme les séquences et les structures protéiques en coordonnées compatibles, déplaçant l’attention de la prédiction de formes individuelles vers l’organisation des relations dans l’espace protéique.
Des chercheurs de l’Université de Haïfa, de l’Université de Tel Aviv et de l’Earth-Life Science Institute ont développé Contrastive Learning Sequence-Structure, abrégé en CLSS. Leur étude PNAS a été publiée le 11 août 2026.
Une séquence protéique énumère ses acides aminés dans l’ordre. Une structure protéique décrit la manière dont cette chaîne occupe l’espace tridimensionnel. Toutes deux contiennent des indices sur l’ascendance et la fonction, mais elles ne racontent pas toujours la même histoire.
Des séquences apparentées de façon lointaine peuvent se replier en structures semblables. Des séquences étroitement apparentées peuvent aussi se comporter différemment après des mutations, des événements de liaison ou des changements environnementaux. Cette relation plusieurs-à-plusieurs rend difficile la construction d’une carte protéique universelle.
CLSS représente chaque domaine protéique sous la forme d’un embedding, c’est-à-dire un vecteur numérique qui place les objets apparentés à proximité les uns des autres. Ses embeddings finaux ne comportent que 32 dimensions. Les chercheurs peuvent projeter ces vecteurs en deux dimensions pour une exploration visuelle, tandis que les recherches de similarité utilisent la représentation complète.
Le modèle accepte soit une séquence, soit une structure en entrée. Il cherche ensuite à attribuer presque la même adresse aux entrées de séquence et de structure correspondantes. Cette propriété est appelée coembedding : différents types de données partagent un même espace de coordonnées comparable.
Les systèmes existants peuvent également traiter plusieurs modalités biologiques. Toutefois, accepter plusieurs modalités ne garantit pas l’alignement de leurs représentations. Un modèle peut placer la séquence et la structure d’une même protéine dans des régions différentes parce que chaque entrée suit une géométrie interne distincte.
Les chercheurs indiquent que CLSS évite cette séparation plus efficacement que ESM3, ProstT5 et ProTrek dans leurs évaluations. Les cartes dérivées de la séquence d’un domaine ressemblent étroitement aux cartes dérivées de sa structure. Cette cohérence fait de la visualisation davantage qu’une paire d’atlas juxtaposés.
Le modèle existe aussi sous deux formes principales. CLSS-full associe des séquences de domaines complètes à leurs structures correspondantes. CLSS-sub associe les structures à des fragments de séquence, permettant à des morceaux plus courts d’entrer dans le même espace représentationnel.
Les domaines protéiques sont des unités compactes qui peuvent souvent se replier ou fonctionner avec une certaine indépendance. L’évolution recombine à plusieurs reprises des domaines et des fragments plus petits en nouvelles protéines. Un modèle qui positionne les fragments de manière pertinente peut donc révéler des relations masquées par les comparaisons de protéines entières.
C’est le changement central derrière le titre. Le modèle n’affiche pas littéralement toutes les protéines naturellement possibles, un ensemble sans limites qu’aucune base de données ne contient. Il propose une méthode unifiée pour organiser des domaines représentatifs et projeter de plus vastes collections protéiques dans une carte commune.
Ce cadrage est plus précis que d’affirmer que l’IA a achevé l’atlas de la biologie. La carte de l’univers protéique CLSS est un système de coordonnées analytique, et non un inventaire final de chaque protéine ou de chaque fonction biologique.
Pourquoi la recherche sur les protéines avait besoin d’un système de coordonnées partagé
L’expansion rapide des structures prédites a créé un goulot d’étranglement interprétatif que la seule prédiction structurale ne peut résoudre.
AlphaFold a rendu accessibles, à une échelle sans précédent, des prédictions précises de structures protéiques. Sa base de données publique contient plus de 200 millions de structures prédites, couvrant des protéines d’organismes issus de l’ensemble de l’arbre du vivant.
D’autres projets ont encore étendu ce paysage. Une publication de 2026 basée sur ESMFold2 a généré un atlas ouvert contenant plus d’un milliard de structures protéiques prédites, selon les détails rapportés de l’atlas. Les chercheurs sont désormais confrontés à bien plus de données structurales que les classifications manuelles traditionnelles ne peuvent absorber aisément.
Davantage de structures ne produisent pas automatiquement davantage de compréhension biologique. Les scientifiques doivent toujours déterminer quelles protéines sont apparentées, quelles régions lient des molécules semblables et quelles similitudes apparentes reflètent une ascendance commune.
La comparaison de séquences reste précieuse, car l’évolution laisse des motifs de résidus reconnaissables. Pourtant, ces motifs s’érodent sur de longues échelles de temps. Deux protéines peuvent conserver un repliement apparenté alors que leurs séquences ont divergé au-delà de la portée des méthodes d’alignement conventionnelles.
La comparaison structurale peut retrouver certaines de ces connexions lointaines. Toutefois, calculer et rechercher des relations tridimensionnelles détaillées à travers d’immenses bases de données implique des coûts substantiels de calcul et de stockage. Les structures sont aussi indisponibles ou incertaines pour de nombreuses séquences.
Un embedding compact offre une couche supplémentaire entre les données brutes et le jugement biologique. Une fois qu’une protéine devient un court vecteur numérique, les chercheurs peuvent rechercher des éléments proches sans réaligner à plusieurs reprises chaque séquence ou structure avec toutes les autres entrées.
CLSS va plus loin en rendant comparables les vecteurs dérivés des séquences et ceux dérivés des structures. Un chercheur disposant uniquement d’une séquence peut explorer un paysage informé par les relations structurales. Un autre peut partir d’une structure connue et trouver des voisins dont les motifs de séquence apportent un contexte supplémentaire.
L’équipe a entraîné CLSS sans fournir les étiquettes hiérarchiques d’ECOD ou de CATH. ECOD et CATH sont des systèmes organisés par des experts qui classent les domaines protéiques selon leurs relations structurales et évolutives.
Malgré cette omission, les cartes résultantes auraient reproduit une grande partie de leur organisation hiérarchique. Ce résultat importe, car il suggère que le modèle a appris des relations présentes dans les données de séquence et de structure appariées, plutôt que de mémoriser les étiquettes de classification utilisées pour l’évaluation.
La carte peut également révéler des relations qui ne s’insèrent pas nettement dans une hiérarchie. Les classifications traditionnelles placent les protéines dans des groupes imbriqués, à la manière des branches d’une taxonomie. L’évolution biologique ne se conforme pas toujours à des frontières aussi ordonnées.
Les domaines peuvent réutiliser des fragments, échanger des composants ou passer par des formes intermédiaires. Une carte continue peut placer des exemples ambigus entre des régions établies, au lieu de forcer chacun dans une seule case.
Des recherches antérieures avaient déjà montré l’utilité de telles cartes. Une étude de 2023 sur les protéines microbiennes a décrit un espace continu de repliements et identifié 438 structures jusque-là inédites, regroupées en 148 candidats à de nouveaux repliements. Sa carte des protéines microbiennes a démontré que des vues de faible dimension peuvent révéler des relations graduelles entre des repliements apparemment différents.
CLSS applique un mécanisme et un objectif différents. Il apprend une représentation partagée à partir de séquences et de structures appariées, plutôt que d’utiliser uniquement des caractéristiques de graphes structuraux. Le résultat prolonge une évolution plus large, de la prédiction des protéines vers leur navigation.
Cette évolution met sous pression les équipes qui maintiennent des pipelines isolés pour les séquences et les structures. Des outils distincts restent nécessaires pour les travaux détaillés, mais leurs résultats ont besoin d’une couche d’indexation commune. Sans cela, les chercheurs risquent de créer des bases de données plus vastes sans acquérir une capacité proportionnelle à les explorer.
Pour les biologistes computationnels, la leçon pratique ressemble à un problème familier des systèmes de connaissances. Collecter davantage de matière ne résout pas le problème de la découverte si le système ne préserve pas les connexions pertinentes. Les équipes qui gèrent des preuves scientifiques denses rencontrent le même enjeu lorsqu’elles créent une base de connaissances consultable.
Comment l’apprentissage contrastif réunit séquence et structure
CLSS réussit en entraînant deux voies d’entrée à s’accorder sur l’identité tout en préservant suffisamment de variation pour séparer les domaines protéiques non apparentés.
L’architecture utilise deux tours, une conception dans laquelle des encodeurs distincts traitent différents types d’entrée. Une tour lit les séquences d’acides aminés. L’autre traite les structures protéiques.
La tour de séquence part d’un petit modèle de type ESM2. La tour de structure utilise un encodeur ESM3 gelé, ce qui signifie que ses paramètres sous-jacents restent inchangés pendant l’entraînement de CLSS. Des couches d’adaptation transforment les deux sorties dans l’espace partagé à 32 dimensions.
L’entraînement repose sur l’apprentissage contrastif. Pour chaque lot, le système rapproche les représentations d’une séquence et d’une structure correspondantes. Il éloigne simultanément les domaines non correspondants.
Ce mécanisme ressemble aux approches utilisées pour relier des images à du texte. Le modèle n’a pas besoin qu’un chercheur étiquette chaque famille de domaines. Il apprend du fait qu’une séquence particulière appartient à une structure particulière.
L’équipe a entraîné le réseau pendant 80 époques sur huit GPU NVIDIA A100 disposant chacun de 40 gigaoctets de mémoire. L’entraînement aurait duré environ quatre jours et demi.
Seuls environ 36 millions de paramètres étaient entraînables. Ce total est proche du petit modèle ESM2 de 35 millions de paramètres utilisé pour initialiser la voie de séquence. Il est très inférieur aux tailles rapportées pour ESM3, ProstT5 et ProTrek.
La taille du modèle ne détermine pas à elle seule la qualité. Les systèmes plus vastes prennent souvent en charge des tâches plus larges ou des comportements génératifs plus riches qu’un modèle spécialisé ne cherche pas à reproduire. Néanmoins, CLSS montre qu’un objectif d’entraînement ciblé peut produire des représentations utiles sans mettre à jour des milliards de paramètres.
Cette différence est importante, car les groupes de recherche sur les protéines ne disposent pas tous de budgets de calcul à très grande échelle. Une composante entraînable plus petite abaisse la barrière à la reproduction, à l’adaptation ou à l’extension de l’approche. Les embeddings compacts réduisent également les coûts de stockage et de recherche après l’entraînement.
CLSS-full se concentre sur les domaines complets. Sa tour de séquence et sa tour de structure ont produit le plus fort accord intermodal rapporté. Lorsqu’un domaine complet entre par l’une ou l’autre voie, son voisinage reste relativement stable.
CLSS-sub accepte les fragments comme modalité supplémentaire. Pendant l’entraînement, le système associe une sous-séquence échantillonnée à la structure du domaine complet. Il apprend à placer ce fragment près du contexte structurel plus vaste auquel il appartient.
Cette tâche est plus difficile que de faire correspondre une séquence complète dotée de sa propre structure. Un court segment contient moins d’informations, et des motifs similaires peuvent apparaître dans des protéines sans lien entre elles. Le modèle de fragments renonce donc à une partie de la qualité d’alignement sur domaine complet, tout en gagnant une capacité dont les représentations concurrentes manquent souvent.
La justification évolutive est solide. La nature invente rarement chaque protéine à partir d’une page blanche. De petits segments de séquence peuvent être dupliqués, modifiés et insérés dans différents domaines sur de longues échelles de temps.
Un fragment présent dans deux protéines par ailleurs sans rapport peut signaler une histoire commune lointaine. Il peut également refléter une évolution convergente, où des contraintes similaires produisent indépendamment des solutions similaires. CLSS fournit des pistes à examiner, mais ne peut pas trancher cette distinction à partir de la seule localisation.
Les chercheurs ont également superposé des propriétés biologiques à leurs cartes. Les domaines associés à des cofacteurs organiques se regroupaient dans certaines régions, tandis que les domaines liant des métaux semblaient répartis plus largement.
Les cofacteurs sont des molécules non protéiques ou des ions qui aident les protéines à réaliser des réactions chimiques. Leur distribution sur la carte permet de vérifier si la géométrie apprise correspond à des propriétés fonctionnelles allant au-delà de la ressemblance des séquences.
Ces superpositions pourraient rendre la carte de l’univers protéique CLSS utile pour générer des hypothèses. Un chercheur pourrait repérer un domaine non caractérisé près de protéines liant un ligand particulier, puis donner la priorité à des essais biochimiques autour de ce voisinage.
Cependant, la proximité sur la carte constitue une preuve de similarité de représentation, et non une démonstration d’une fonction identique. Des protéines voisines peuvent différer au niveau de résidus critiques du site actif. Elles peuvent aussi agir dans des organismes, compartiments cellulaires ou complexes moléculaires différents.
Le rôle du modèle s’apparente donc davantage à celui d’un moteur de recherche qu’à un verdict automatisé de laboratoire. Il peut réduire un vaste ensemble de candidats et révéler des associations inattendues. Les travaux expérimentaux doivent encore déterminer si ces associations se vérifient dans des conditions biologiques.
Le véritable enjeu est la cartographie unifiée face à l’analyse séparée
CLSS remet en question les pipelines de représentation fragmentés, et non les systèmes de prédiction de structure qui fournissent une grande partie de ses informations sous-jacentes.
Les comparaisons avec AlphaFold sont tentantes, car les deux projets utilisent l’IA pour étudier les protéines. Pourtant, ils répondent à des problèmes différents.
AlphaFold prédit la structure tridimensionnelle d’une protéine à partir de sa séquence. CLSS cartographie les relations entre domaines protéiques à l’aide de représentations de séquences et de structures. L’un produit des candidats structuraux, tandis que l’autre organise des éléments de preuve dans un espace plus vaste.
Les outils peuvent donc se compléter. Une structure prédite par AlphaFold peut emprunter la voie structurelle, tandis que sa séquence d’acides aminés emprunte la voie séquentielle. L’accord entre ces représentations peut faciliter la navigation et la classification.
ESM3 occupe une position plus large. Il peut travailler avec des informations liées à la séquence, à la structure et à la fonction des protéines, et prend en charge la génération. CLSS emprunte un encodeur de structure ESM3 figé, mais entraîne son espace partagé autour d’un objectif de cartographie plus restreint.
ProstT5 traduit entre les séquences protéiques et les alphabets structuraux. ProTrek utilise plusieurs modalités biologiques et une approche contrastive. Ces systèmes montrent que la modélisation multimodale des protéines est antérieure à CLSS.
L’affirmation plus forte de l’étude est plus précise. Dans les configurations testées, CLSS a produit un chevauchement plus cohérent entre les cartes de séquences et de structures. Les chercheurs indiquent également qu’il a obtenu de solides résultats sur des tâches de classification issues de ProteinShake, un cadre standardisé d’évaluation des représentations protéiques.
Ces résultats soutiennent la cartographie unifiée comme orientation technique. Ils n’établissent pas que CLSS est universellement supérieur en matière de prédiction, de conception, d’annotation ou de génération de protéines.
Une représentation spécialisée à 32 dimensions comprime nécessairement l’information. Cette compression peut mettre en évidence de grandes relations tout en éliminant des détails nécessaires à d’autres tâches. Les interactions au niveau des résidus, les conformations dynamiques, les régions désordonnées et le contexte cellulaire ne peuvent pas tous subsister à l’identique dans un seul vecteur court.
La distribution d’entraînement introduit une autre contrainte importante. CLSS a appris à partir de domaines protéiques représentés dans des ressources structurelles existantes, y compris des exemples déterminés expérimentalement et prédits associés à ECOD.
Ces bases de données ont une immense valeur scientifique, mais elles ne constituent pas des échantillons neutres de toute la biologie. Les structures expérimentales favorisent les protéines que les chercheurs peuvent isoler, stabiliser et mesurer. Les collections prédites héritent des biais des séquences disponibles et de la confiance des modèles.
Un Protein Universe Atlas plus vaste avait auparavant combiné réseaux de séquences, prédictions structurales et annotations pour identifier des familles inexplorées. Ses créateurs avaient également documenté la difficulté persistante d’attribuer une fonction à de larges portions de l’espace protéique.
CLSS n’efface pas ce territoire obscur. Il le réorganise. Un domaine mal caractérisé peut recevoir des coordonnées sans acquérir pour autant une fonction, un mécanisme ou une origine évolutive vérifiés.
L’évaluation par rapport à ECOD et CATH mérite également une interprétation prudente. Retrouver des hiérarchies établies par des experts sans disposer de leurs étiquettes constitue un élément de preuve significatif. Cependant, ces classifications reflètent toujours le même paysage protéique connu dont proviennent les exemples d’entraînement.
L’article indique que ses domaines d’entraînement et de validation aléatoires provenaient de la même distribution générale. Ce choix correspond à l’objectif de construire une carte exhaustive dominée par les familles courantes. Il est moins exigeant que de tester uniquement sur des familles éloignées, délibérément séparées des exemples d’entraînement.
Cette distinction est importante lorsque les utilisateurs se demandent si CLSS peut se généraliser à une biologie véritablement inconnue. Les performances sur des classifications standard ne répondent pas pleinement à la question de savoir comment le modèle traite les plis rares, les protéines membranaires atypiques, les régions désordonnées ou les séquences issues d’environnements peu échantillonnés.
La réduction de dimensionnalité ajoute une autre source de prudence. L’intégration CLSS sous-jacente possède 32 dimensions, mais une carte du monde n’en affiche généralement que deux. Des algorithmes tels que t-SNE peuvent préserver les voisinages locaux tout en déformant les distances et la géométrie globale.
Un regroupement frappant à l’écran constitue donc une piste, et non une conclusion biologique. Les chercheurs doivent examiner les voisins dans l’espace d’intégration complet et les comparer avec des alignements de séquences, des superpositions structurales, des annotations fonctionnelles et des expériences.
L’expression « vue unique » peut également créer une attente erronée. Les séquences et les structures deviennent compatibles, mais elles ne deviennent pas interchangeables dans tous les contextes scientifiques. Chaque modalité contient des éléments de preuve, des incertitudes et des modes de défaillance distincts.
Une séquence est observée directement lorsque les scientifiques déterminent le gène ou la protéine sous-jacente. Une structure prédite est une inférence dont la confiance varie selon les résidus et les complexes. L’intégration conjointe des deux ne supprime pas cette différence de statut probant.
La comparaison pertinente oppose donc la cartographie unifiée à l’analyse séparée. CLSS affirme qu’un système de coordonnées appris unique peut rendre les preuves combinées plus faciles à explorer. Des outils détaillés doivent toujours examiner pourquoi deux protéines semblent proches l’une de l’autre.
Ce qui doit se produire avant que CLSS transforme la découverte de protéines
Le prochain test consistera à voir si des chercheurs indépendants peuvent transformer des voisinages de carte en découvertes vérifiées sur des protéines inconnues et difficiles à étudier expérimentalement.
Le premier signal à surveiller est une reproduction externe sur des familles protéiques éloignées. Les chercheurs devraient évaluer CLSS avec des séparations limitant fortement le chevauchement séquentiel et structural entre les domaines d’entraînement et de test.
De solides performances dans ces conditions renforceraient l’affirmation selon laquelle la représentation capte des principes biologiques transférables. Un déclin marqué suggérerait qu’une grande part de son organisation dépend de distributions de familles familières.
Le deuxième signal est la validation expérimentale d’hypothèses dérivées de la carte. Les études les plus convaincantes commenceront par une protéine inconnue ou controversée, utiliseront CLSS pour identifier des voisins inattendus, puis testeront la relation prédite en laboratoire.
Les résultats utiles pourraient inclure une liaison vérifiée à un ligand, une activité enzymatique, une similarité structurelle ou des fragments évolutifs communs. Les résultats négatifs seront tout aussi instructifs, car ils peuvent révéler quels types de proximité sont surévalués par l’intégration.
Le troisième signal est l’adoption dans des flux de travail pratiques de recherche en base de données et d’ingénierie protéique. L’équipe de recherche envisage des usages pour l’alignement de séquences, la reconstruction évolutive et la conception. Ces applications exigent davantage que des visualisations attrayantes.
Les outils de recherche doivent rester rapides à mesure que les bases de données grandissent. Les résultats nécessitent des preuves interprétables afin que les chercheurs comprennent pourquoi un candidat est apparu. Les pipelines doivent également enregistrer les versions des modèles, les structures sources, les scores de confiance et les mises à jour des bases de données.
La présentation institutionnelle du projet décrit un visualiseur interactif permettant d’explorer l’espace protéique. Son utilisation par des laboratoires indépendants montrera si l’interface aide les chercheurs à atteindre des questions testables plutôt qu’à simplement parcourir des classifications familières.
L’ingénierie protéique impose un seuil plus élevé. Un voisinage utile peut suggérer des fragments ou des modèles de domaines, mais concevoir une protéine fonctionnelle exige une compatibilité en matière de repliement, de stabilité, d’activité et d’expression.
CLSS-sub est particulièrement intéressant ici, car il place de courts fragments de séquence à côté de domaines et de structures complets. Si ces positionnements identifient systématiquement des composants réutilisables, ils pourraient améliorer l’étape de recherche dans la conception de protéines.
Pourtant, la réutilisation historique d’un fragment ne garantit pas qu’il puisse être transplanté sans risque. Son comportement dépend des résidus environnants et du contexte moléculaire. La conception expérimentale doit considérer une intégration proche comme une relation candidate, et non comme une instruction d’assemblage.
La même prudence s’applique à la découverte de médicaments. Un groupe associé à un type de cofacteur ou de ligand peut guider la priorisation. Il ne peut pas établir que chaque protéine voisine lie la même molécule ou offre un site pouvant être ciblé par un médicament.
Les utilisateurs devraient également surveiller si les futures versions de CLSS intègrent explicitement l’incertitude. Un seul vecteur peut masquer des désaccords entre modalités ou des régions structurelles de faible confiance. Exposer ces désaccords aiderait les chercheurs à distinguer les voisinages stables des voisinages fragiles.
Un autre développement utile consisterait à relier les positions sur la carte à des explications au niveau des résidus. Les scientifiques doivent savoir si deux protéines s’alignent en raison d’un noyau commun, d’un court motif, d’une poche de liaison ou d’une large ressemblance architecturale.
Cette transparence déterminera si CLSS devient une couche d’analyse quotidienne. Les biologistes peuvent tolérer des prédictions imparfaites lorsqu’un système les aide à concevoir la prochaine expérience. Ils seront moins enclins à faire confiance à un voisinage inexpliqué sur une carte visuellement persuasive.
La portée plus profonde de CLSS réside dans sa réponse à l’abondance des données. La biologie dispose désormais d’immenses collections de séquences, de structures prédites et d’annotations. Le problème limitant consiste de plus en plus à rendre ces collections comparables et explorables.
La carte de l’univers protéique CLSS propose une réponse crédible. Elle compresse séquence et structure dans un langage partagé, retrouve des classifications établies et intègre les fragments au même paysage.
Sa réalisation reste plus limitée que l’achèvement d’une carte des protéines du vivant. Des fonctions inconnues, des structures incertaines, des bases de données biaisées et des expériences difficiles subsistent. Aucune visualisation bidimensionnelle ne peut dissoudre ces contraintes.
Les chercheurs doivent désormais se poser une question concrète : un voisinage CLSS les conduit-il vers une relation qu’ils n’auraient pas identifiée autrement, et cette relation résiste-t-elle aux tests expérimentaux ? Si des laboratoires indépendants répondent à plusieurs reprises par l’affirmative, la cartographie unifiée des protéines deviendra plus qu’une perspective convaincante. Elle fera partie intégrante de la manière dont commencent les découvertes biologiques.



