L’investissement de Google Biohub dans la cellule virtuelle cible les données manquantes de la biologie
Google a rejoint un investissement d’entreprise de 300 millions de dollars dans le projet de cellule virtuelle de Biohub, pariant que de meilleures données biologiques pourront faire de l’IA un outil de recherche sur les maladies. Meta et Isomorphic Labs, détenue par Alphabet, participent aux côtés de Google DeepMind. L’investissement de Google Biohub dans la cellule virtuelle fait partie d’un ensemble plus large de 1,8 milliard de dollars impliquant Biohub et deux agences américaines.
Le titre évoque un nouveau projet de grand modèle d’IA. La véritable cible est plus difficile à construire. Biohub veut constituer des jeux de données décrivant la façon dont les cellules vivantes réagissent aux médicaments, aux modifications génétiques, aux conditions environnementales et à d’autres interventions.
Cette distinction crée la tension centrale. Les modèles de langage ont appris à partir d’informations que des personnes avaient déjà mises en ligne. Une cellule virtuelle utile nécessite des observations expérimentales qui, souvent, n’existent pas encore. Les chercheurs doivent produire ces observations en laboratoire avant qu’un système d’IA puisse en tirer des enseignements.
Biohub, fondé par Mark Zuckerberg et Priscilla Chan, organise donc un réseau de production de données plutôt que d’annoncer un simulateur biologique achevé. Le projet combine capitaux d’entreprise, infrastructures fédérales de recherche, instituts scientifiques et jeux de données publics standardisés.
Cette approche remet aussi en question une hypothèse familière sur la concurrence en IA. Google et Meta se disputent habituellement le contrôle des modèles, de l’infrastructure, des talents et de la distribution. Ici, ils financent une ressource biologique partagée, car aucune des deux entreprises ne peut facilement produire seule suffisamment de données expérimentales de haute qualité.
Cette collaboration n’élimine pas les incitations commerciales. Les entreprises participantes bénéficieront d’un accès anticipé temporaire à certains jeux de données financés par le privé avant que ces ressources ne deviennent publiques. L’accord place la science ouverte et l’avantage des entreprises au sein d’un même programme.
L’investissement de Google Biohub dans la cellule virtuelle s’étend à un effort de 1,8 milliard de dollars
Le changement important n’est pas qu’une entreprise finance un modèle. Il s’agit de l’assemblage d’un système partagé destiné à produire, standardiser et exploiter par le calcul des données biologiques.
Biohub a annoncé l’extension de la Virtual Biology Initiative le 7 octobre 2026. Son annonce officielle de financement évalue l’engagement combiné à 1,8 milliard de dollars en financements, données existantes, capacités de calcul et technologies de mesure.
Google DeepMind, Meta et Isomorphic Labs investissent collectivement 300 millions de dollars. Le montant communiqué ne précise pas la contribution de chaque entreprise. Il serait donc inexact de présenter l’intégralité de cette somme comme l’investissement de Google.
Le Department of Energy prévoit d’apporter plus de 500 millions de dollars sur cinq ans. Ces travaux soutiendront les mesures en laboratoire, la modélisation biologique, le calcul, l’imagerie et la collecte de données via le réseau de laboratoires nationaux du département.
Les National Institutes of Health coordonneront des référentiels et des jeux de données créés grâce à plus de 500 millions de dollars d’investissements fédéraux antérieurs. Biohub prévoit d’aider à transformer ces ressources en matériel standardisé adapté à l’entraînement de l’IA.
Biohub a engagé 500 millions de dollars supplémentaires lorsqu’il a présenté la Virtual Biology Initiative en avril 2026. L’organisation à but non lucratif a indiqué que 400 millions de dollars soutiendraient de nouvelles technologies de mesure. Celles-ci comprennent la microscopie avancée, la cryotomographie électronique et des outils permettant de modifier des systèmes biologiques à plusieurs échelles.
Les catégories de financement ne sont pas interchangeables. Certaines représentent de nouveaux fonds, tandis que d’autres correspondent à des dépenses fédérales antérieures, des jeux de données, des équipements et des capacités de calcul. Le total de 1,8 milliard de dollars doit être compris comme un ensemble combiné de ressources, et non comme une unique levée de fonds.
L’initiative réunit plusieurs organisations scientifiques. Biohub a cité parmi ses collaborateurs l’Allen Institute, le Broad Institute, les Gladstone Institutes, le Human Cell Atlas, le Human Protein Atlas et le Wellcome Sanger Institute. Nvidia apportera des technologies de calcul et une expertise technique.
Biohub prévoit également de créer des normes partagées, des identifiants communs et un point d’accès central. Ces tâches moins visibles comptent, car les jeux de données biologiques utilisent fréquemment des protocoles expérimentaux, des étiquettes, des instruments et des contrôles qualité différents.
Combiner des jeux de données incompatibles sans normalisation rigoureuse peut produire une vaste ressource qui enseigne malgré tout les mauvaises leçons à un modèle. Celui-ci pourrait apprendre les différences entre laboratoires plutôt que des comportements cellulaires significatifs.
L’initiative vise à résoudre ce problème avant que l’échelle ne l’aggrave. Ses organisateurs veulent que les groupes de recherche conçoivent des expériences complémentaires, consignent des métadonnées plus riches et traitent les résultats dans des systèmes compatibles.
Le premier grand jeu de données est attendu dans environ un an, selon le responsable scientifique de Biohub, Alex Rives, dans les conditions rapportées. Les partenaires visent des modèles prédictifs précis d’ici cinq ans.
Ces échéances sont des objectifs, et non des jalons validés. Biohub n’a pas encore publié de norme universelle de précision permettant de déterminer à quel moment sa cellule virtuelle deviendra suffisamment fiable pour guider des décisions de recherche importantes.
Le véritable goulot d’étranglement est la biologie expérimentale, pas la taille des modèles
L’investissement de Google Biohub dans la cellule virtuelle considère la génération de données comme le facteur limitant, car la biologie ne peut pas être aspirée depuis l’internet public.
Une cellule virtuelle est un modèle informatique qui prédit comment une cellule évolue après une intervention biologique. Cette intervention peut consister à inhiber un gène, ajouter un médicament, modifier les nutriments ou exposer des cellules à une condition liée à une maladie.
Le résultat recherché n’est pas simplement une image réaliste d’une cellule. Les chercheurs veulent des prédictions sur l’activité des gènes, les protéines, les structures, les voies de signalisation et le comportement observable. Différents laboratoires peuvent construire des modèles distincts pour répondre à différentes questions.
Un chercheur en cancérologie pourrait demander comment une cellule tumorale réagit lorsque l’on désactive un gène spécifique. Un développeur de médicaments pourrait comparer plusieurs composés avant de décider lesquels méritent des essais en laboratoire. Une autre équipe pourrait examiner le comportement d’une cellule immunitaire dans un tissu malade.
Le modèle a besoin d’observations appariées pour répondre à ces questions. Les chercheurs doivent mesurer une cellule avant une intervention, appliquer une modification contrôlée et enregistrer l’état qui en résulte. Ils doivent répéter ce processus selon les types cellulaires, les conditions, les doses et les moments d’observation.
Les collections publiques actuelles contiennent des centaines de millions d’observations cellulaires. Rives a déclaré à Reuters que des milliards, puis à terme des milliers de milliards, seront nécessaires pour une modélisation prédictive fiable. Cet écart d’échelle explique pourquoi l’initiative comprend des microscopes, l’automatisation des laboratoires et des installations fédérales.
L’échelle seule ne résoudra pas le problème. Mille milliards d’observations mal documentées peuvent préserver les biais expérimentaux à une ampleur sans précédent. Les données doivent aussi capturer les changements causaux, le contexte biologique, le temps et l’incertitude.
La transcriptomique spatiale, par exemple, cartographie l’activité moléculaire tout en préservant la localisation d’une cellule dans un tissu. Ce contexte compte, car les cellules voisines et la structure du tissu peuvent modifier le comportement d’une cellule.
La cryotomographie électronique produit des vues tridimensionnelles détaillées des structures à l’intérieur des cellules. Les criblages de perturbation mesurent les réponses après que les chercheurs ont modifié des gènes ou des conditions environnementales. Chaque méthode capture une couche différente de la biologie.
Biohub veut coordonner ces modalités plutôt que de les traiter comme des collections isolées. Le postulat de l’organisation est que les modèles doivent apprendre les relations entre les niveaux moléculaire, cellulaire, tissulaire et organismique.
Ce postulat distingue l’initiative du simple entraînement d’un réseau neuronal plus grand. Pushmeet Kohli, dirigeant chez Google DeepMind, a déclaré que le défi exige des données expérimentales montrant comment les cellules vivantes réagissent au changement. Il a décrit un bien commun de données ouvert et standardisé comme le fondement nécessaire.
Le goulot d’étranglement des données modifie également la façon dont les chercheurs allouent le temps de laboratoire. Un modèle crédible pourrait examiner numériquement de nombreuses hypothèses, puis orienter les expériences physiques vers les candidats les plus informatifs.
Prenons une équipe qui étudie une voie moléculaire associée à la maladie d’Alzheimer. Aujourd’hui, elle pourrait choisir ses expériences à partir des preuves publiées et du jugement d’experts. Une cellule virtuelle pourrait classer les interventions selon leur effet prédit et leur degré d’incertitude.
Le laboratoire réaliserait toujours l’expérience décisive. Il pourrait toutefois sélectionner un ensemble plus restreint et plus informatif de candidats. Le modèle apprendrait alors des nouveaux résultats, créant un cycle entre prédiction et mesure.
Ce flux de travail ressemble à l’apprentissage actif, où un algorithme sélectionne les prochains points de données qui amélioreraient le plus sa compréhension. La valeur pratique réside dans une meilleure sélection des expériences, et non dans l’élimination des expériences.
La biologie varie également d’un individu à l’autre, selon les tissus, les stades de développement et les états pathologiques. Un modèle performant sur une lignée cellulaire cultivée peut échouer dans un tissu humain primaire. Un résultat obtenu à une dose peut ne pas se généraliser à une autre.
Pour cette raison, la contribution la plus forte du projet à court terme pourrait être un meilleur socle de recherche plutôt qu’un simulateur universel. Des jeux de données partagés peuvent soutenir des modèles plus ciblés bien avant qu’un système unique ne prédise chaque réponse cellulaire pertinente.
Les données ouvertes et l’accès des entreprises coexistent dans un équilibre inconfortable
L’initiative dépend d’une science partagée, mais sa structure de financement donne aux participants commerciaux un avantage informationnel temporaire.
Biohub affirme que la ressource résultante sera finalement ouverte à la communauté scientifique. Les jeux de données financés par le gouvernement ne feront pas l’objet de périodes d’embargo privé, selon Rives. Les données financées par les entreprises suivront une voie différente.
Les financeurs commerciaux bénéficieront d’une période durant laquelle ils pourront travailler avec les données avant leur publication. Biohub n’a pas communiqué la durée de ces embargos dans son annonce publique.
L’accord offre une incitation directe. La génération de données est coûteuse, et un accès anticipé peut aider à justifier l’investissement des entreprises. Google DeepMind, Isomorphic Labs et Meta gagnent du temps pour entraîner des modèles, tester des méthodes ou identifier des pistes de recherche prometteuses.
Isomorphic Labs entretient le lien commercial direct le plus clair. L’entreprise d’Alphabet développe des systèmes d’IA pour la découverte de médicaments. Un accès plus précoce à de vastes jeux de données de perturbation pourrait soutenir l’identification de cibles ou l’évaluation de composés.
Google DeepMind apporte l’expérience de systèmes tels qu’AlphaFold, qui prédit les structures et les interactions des protéines. Pourtant, la modélisation de cellules entières est un problème différent. La structure d’une protéine n’est qu’un composant au sein d’un réseau biologique dynamique.
La voie commerciale de Meta est moins explicite. Son organisation de recherche en IA a travaillé sur la modélisation biologique, tandis que Zuckerberg a contribué à établir Biohub avec Chan. La participation de l’entreprise lui donne également une place dans une initiative de données scientifiques stratégiquement importante.
Les universités et les petites entreprises de biotechnologie pourront éventuellement accéder aux mêmes jeux de données. Pendant un embargo, toutefois, les partenaires bien financés peuvent développer des modèles et des flux de travail avant que la communauté élargie ne reçoive la ressource sous-jacente.
Cette avance ne doit pas nécessairement invalider la promesse de science ouverte. Elle soulève néanmoins une question sur ce que signifie « ouvert » lorsque l’accès intervient à des moments différents.
La réponse dépendra d’une gouvernance détaillée. Les chercheurs devront surveiller la durée des embargos, les conditions de licence, la disponibilité des métadonnées, les restrictions de téléchargement et la présence éventuelle de résultats expérimentaux négatifs.
Les résultats négatifs sont particulièrement importants. Un modèle doit apprendre lorsqu’une intervention n’a pas d’effet significatif, et pas seulement lorsque les chercheurs observent une réponse intéressante. Une publication sélective fausserait la distribution d’entraînement.
L’initiative devra également décider de la manière dont les chercheurs externes pourront contester ou corriger ses jeux de données. Des fichiers ouverts ont une valeur limitée si la documentation est incomplète ou si le signalement d’erreurs reste difficile.
L’accès commercial pourrait créer un autre déséquilibre autour de la puissance de calcul. Publier un vaste jeu de données biologiques ne garantit pas que les équipes universitaires pourront se permettre d’entraîner des modèles compétitifs dessus. L’implication de Nvidia pourrait améliorer l’infrastructure, mais les règles d’attribution seront déterminantes.
Le modèle de Biohub se situe donc entre deux alternatives imparfaites. Des jeux de données entièrement propriétaires limiteraient l’examen scientifique et concentreraient les capacités. Une initiative purement publique pourrait avoir du mal à attirer un investissement privé équivalent ou à progresser au rythme souhaité.
La compétition principale n’oppose pas Google à Meta. Elle oppose la promesse d’une infrastructure biologique ouverte aux avantages pratiques accordés aux entreprises qui la financent.
Des calendriers de publication clairs permettraient d’évaluer plus facilement ce compromis. Il en irait de même pour des fiches descriptives publiques des jeux de données détaillant les méthodes expérimentales, les limites connues, la couverture démographique, les contextes cellulaires et les contrôles de qualité.
Les chercheurs auront également besoin d’un accès durable. Une ressource publique qui modifie ses interfaces, supprime des versions ou ne dispose pas d’identifiants stables peut compromettre la reproductibilité. Les normes communes de Biohub pourraient devenir aussi importantes que n’importe quel modèle individuel.
Cette question de gouvernance dépasse le projet actuel. La fondation d’OpenAI a commencé à financer des jeux de données biologiques et médicaux, tandis qu’Anthropic s’est développé dans la recherche biologique menée en laboratoire. Les entreprises d’IA considèrent de plus en plus les données expérimentales propriétaires comme un actif stratégique.
Biohub propose une couche partagée au sein de cette compétition. La question de savoir si elle restera véritablement partagée se vérifiera dans les politiques d’accès, et non dans les engagements du jour du lancement.
Les cellules virtuelles actuelles échouent encore aux tests élémentaires de généralisation
La principale raison de rester prudent provient des benchmarks publics, où les meilleurs modèles peinent encore à prédire de façon cohérente des réponses cellulaires inconnues.
Arc Institute offre une comparaison utile. Sa Virtual Cell Initiative développe des jeux de données, des modèles et des compétitions annuelles qui testent les prédictions de réponses cellulaires.
Le premier défi demandait aux modèles de prédire les changements d’expression génique après que les chercheurs avaient inhibé certains gènes dans des cellules souches embryonnaires humaines. Son benchmark contenait environ 300 000 profils unicellulaires couvrant 300 perturbations génétiques.
Plus de 5 000 personnes se sont inscrites depuis 114 pays. Plus de 1 200 équipes ont soumis des résultats, et plus de 300 ont finalisé leurs soumissions. Ce niveau de participation a fait de la compétition un test significatif des approches actuelles.
Les résultats du défi étaient édifiants. Arc a indiqué que les modèles ne surpassaient pas systématiquement des références simples pour chaque métrique d’évaluation.
Les systèmes gagnants se sont améliorés pour distinguer les perturbations et identifier les gènes dont l’activité changeait. Toutefois, les meilleures approches combinaient l’apprentissage profond avec des caractéristiques statistiques classiques. L’apprentissage pur de bout en bout n’avait pas résolu la tâche.
Ce résultat ne montre pas que les cellules virtuelles sont impossibles. Il montre que de bonnes performances sur des données familières ne peuvent pas remplacer la généralisation à un nouveau type cellulaire ou à une nouvelle intervention.
Cette distinction est importante pour la découverte de médicaments. Les chercheurs ont besoin qu’un modèle dise quelque chose d’utile sur des conditions qui n’ont pas déjà été mesurées. Mémoriser des schémas courants issus de jeux de données existants offre une valeur limitée lorsque la question centrale est nouvelle.
Le défi 2026 d’Arc relève la difficulté. Les modèles doivent prédire les réponses dans six lignées cellulaires dont les perturbations n’ont pas été fournies pendant l’entraînement. Ce cadre zero-shot, c’est-à-dire une prédiction sans exemples spécifiques à la tâche, ressemble davantage à l’usage scientifique réel.
Le modèle STATE d’Arc illustre à la fois les progrès et les limites. Selon son programme de cellules virtuelles, STATE a appris à partir de données observationnelles couvrant 167 millions de cellules et de données de perturbation couvrant plus de 100 millions de cellules dans 70 contextes humains.
Ces chiffres sont importants, mais la couverture reste limitée par rapport aux possibilités biologiques. Les cellules humaines contiennent des systèmes moléculaires en interaction qui évoluent au fil du temps et réagissent différemment au sein des tissus vivants.
Les expériences sur des lignées cellulaires simplifient également la réalité. Les lignées cellulaires de laboratoire peuvent croître dans des conditions contrôlées, tandis que les cellules chez un patient sont confrontées à des signaux immunitaires, à des tissus voisins, à l’évolution des nutriments et à des traitements antérieurs.
Une cellule virtuelle pourrait prédire avec précision l’expression génique tout en passant à côté d’un autre résultat important. Un médicament pourrait modifier la localisation des protéines, la forme cellulaire, le métabolisme, la toxicité ou la communication sans produire de signature transcriptomique évidente.
Les chercheurs doivent donc définir le succès autour de décisions spécifiques. Un modèle pourrait être utile pour classer des cibles génétiques même s’il ne peut pas reproduire chaque processus cellulaire. Un autre modèle pourrait aider à sélectionner des expériences tout en restant inadapté aux prédictions cliniques.
L’expression « cellule virtuelle universelle » peut masquer ces seuils plus restreints. Elle suggère un modèle unique qui gère chaque cellule et chaque intervention. La voie la plus probable implique plusieurs modèles, types de mesures et estimations de confiance.
Une vue d’ensemble des cellules virtuelles a souligné que les chercheurs ne partagent pas une définition unique du concept. Certains imaginent une simulation visuelle, tandis que d’autres entendent des programmes prédictifs qui répondent à des questions biologiques ciblées.
Cette ambiguïté rend les calendriers ambitieux plus difficiles à évaluer. Biohub prévoit des modèles prédictifs précis dans les cinq ans, mais la précision dépend du test, du contexte cellulaire et de la tolérance à l’erreur.
Le programme devrait publier ses critères d’évaluation avant de déclarer son succès. Parmi les mesures utiles pourraient figurer les performances sur des types cellulaires non vus, de nouvelles interventions, plusieurs laboratoires et des conditions différentes des données d’entraînement.
La réplication externe sera également importante. Un résultat produit dans un système expérimental devrait être testé par des laboratoires indépendants utilisant des équipements et des échantillons différents.
La démonstration la plus convaincante ne serait pas une visualisation soignée. Ce serait une étude prospective dans laquelle un modèle recommande des expériences, des chercheurs indépendants les réalisent et les prédictions améliorent les décisions.
Tant que ces tests ne deviendront pas routiniers, les affirmations concernant un développement plus rapide des médicaments resteront des hypothèses. Les modèles peuvent réduire le travail de découverte initiale, mais le développement clinique comprend également les essais de toxicité, la fabrication, les essais cliniques et l’examen réglementaire.
Trois signaux montreront si le pari de la cellule virtuelle fonctionne
La prochaine phase devra être jugée à l’aune de preuves publiques : le premier jeu de données, les performances sur des benchmarks indépendants et des règles d’accès applicables.
Le premier signal sera le premier vaste jeu de données de Biohub, attendu vers octobre 2027. Sa taille attirera l’attention, mais sa couverture et sa documentation compteront davantage.
Les lecteurs devront examiner le nombre de types cellulaires, d’interventions, de doses, de points temporels et de donneurs biologiques. Ils devront également vérifier si la publication comprend des résultats négatifs, des mesures brutes, des métadonnées normalisées et des contrôles de qualité indépendants.
Un jeu de données bien documenté et publié dans les délais renforcerait l’argument de Biohub selon lequel des investissements coordonnés peuvent répondre à la pénurie de données en biologie. Une publication étroite ou retardée affaiblirait l’objectif de modèle à cinq ans.
Le deuxième signal sera la performance sur une biologie véritablement inconnue. Biohub et ses partenaires ont besoin de benchmarks qui empêchent les modèles de réussir grâce à la mémorisation ou à des artefacts propres à un laboratoire.
Le défi zero-shot d’Arc fournit un modèle pour ce type de test. Les évaluations futures devraient ajouter des contextes tissulaires, des interventions chimiques, des échelles de temps plus longues et des mesures allant au-delà de l’expression génique.
La question décisive est de savoir si les prédictions améliorent de véritables choix expérimentaux. Un modèle devrait identifier des interventions que les scientifiques n’auraient pas autrement privilégiées, puis produire des résultats qui se confirment en laboratoire.
Le succès dans un classement rétrospectif serait encourageant, mais incomplet. Des expériences prospectives, répliquées de manière indépendante, fourniraient des preuves bien plus solides.
Le troisième signal sera la publication des conditions d’accès et de gouvernance. Biohub devrait indiquer la durée des embargos commerciaux, les partenaires qui en bénéficient et la date à laquelle chaque jeu de données devient public.
Les chercheurs devront également surveiller les licences, l’accès aux ressources de calcul, les politiques de publication des modèles, les garanties de confidentialité et les mécanismes de correction des enregistrements défectueux. Ces règles détermineront si le projet devient une infrastructure ou un actif d’entreprise différé.
L’ampleur de l’initiative lui donne la possibilité de façonner les normes techniques dans l’ensemble du domaine. Ce résultat pourrait être précieux même si une cellule virtuelle universelle reste hors d’atteinte sur l’horizon de cinq ans.
Des identifiants partagés et des jeux de données interopérables permettraient aux chercheurs de comparer les modèles plus équitablement. Des benchmarks communs rendraient plus difficile la présentation de résultats sélectifs comme une intelligence biologique générale.
Pour les développeurs, le projet offre une leçon qui dépasse la médecine. De meilleurs algorithmes ne peuvent pas compenser indéfiniment des données manquantes, mal étiquetées ou faibles sur le plan causal.
Pour les entreprises de biotechnologie, le programme pourrait réduire le coût d’obtention de données de préentraînement utiles. Il pourrait également intensifier la concurrence en donnant aux grandes entreprises d’IA une position précoce dans l’infrastructure de découverte de médicaments.
Pour les établissements de recherche, l’opportunité s’accompagne d’une responsabilité : tester les modèles de manière critique. Les scientifiques devraient distinguer les outils de prédiction utiles des affirmations de compréhension cellulaire exhaustive.
Pour les patients, les attentes immédiates doivent rester modestes. Cet investissement ne fournira pas un nouveau traitement l’année prochaine. Ses résultats à court terme seront des jeux de données, des normes, des systèmes de mesure et des modèles expérimentaux.
L’investissement de Google Biohub dans les cellules virtuelles est important parce qu’il finance le travail physique qui sous-tend l’IA biologique. Il reconnaît que la prochaine amélioration des modèles dépend autant des laboratoires que des grappes de calcul.
La question est désormais de savoir si Biohub peut transformer de nombreuses institutions, instruments et incitations en preuves fiables. Surveillez le premier jeu de données public, le premier test prospectif indépendant et les règles d’accès définitives. Ces résultats montreront si ce partenariat a créé une infrastructure scientifique partagée ou seulement une promesse bien financée.



