L'investimento di Google Biohub nella cellula virtuale punta ai dati mancanti della biologia
Google si è unita a un investimento aziendale da 300 milioni di dollari nell'iniziativa sulla cellula virtuale di Biohub, scommettendo che dati biologici migliori possano trasformare l'IA in uno strumento per la ricerca sulle malattie. Meta e Isomorphic Labs, controllata da Alphabet, partecipano insieme a Google DeepMind. L'investimento di Google Biohub nella cellula virtuale fa parte di un più ampio pacchetto da 1,8 miliardi di dollari che coinvolge Biohub e due agenzie statunitensi.
Il titolo sembra quello di un altro grande progetto di modello IA. L'obiettivo reale è più difficile da costruire. Biohub vuole dataset che descrivano il modo in cui le cellule viventi rispondono ai farmaci, alle modifiche genetiche, alle condizioni ambientali e ad altri interventi.
Questa distinzione crea la tensione centrale. I modelli linguistici hanno appreso da informazioni che le persone avevano già pubblicato online. Una cellula virtuale utile necessita di osservazioni sperimentali che spesso non esistono ancora. I ricercatori devono generare tali osservazioni in laboratorio prima che un sistema di IA possa apprendere da esse.
Biohub, fondata da Mark Zuckerberg e Priscilla Chan, sta quindi organizzando una rete di produzione di dati anziché annunciare un simulatore biologico già completato. Il progetto combina capitale aziendale, infrastrutture federali per la ricerca, istituti scientifici e dataset pubblici standardizzati.
L'approccio mette inoltre in discussione un presupposto noto sulla competizione nell'IA. Google e Meta di solito competono per controllare modelli, infrastrutture, talenti e distribuzione. Qui finanziano una risorsa biologica condivisa perché nessuna delle due aziende può creare autonomamente una quantità sufficiente di dati sperimentali di alta qualità.
Questa collaborazione non elimina gli incentivi commerciali. Le aziende partecipanti riceveranno un accesso anticipato temporaneo ad alcuni dataset finanziati privatamente prima che tali risorse diventino pubbliche. L'accordo colloca scienza aperta e vantaggio aziendale all'interno dello stesso programma.
L'investimento di Google Biohub nella cellula virtuale si espande in un'iniziativa da 1,8 miliardi di dollari
Il cambiamento importante non è un'azienda che finanzia un modello. È l'assemblaggio di un sistema condiviso per produrre, standardizzare ed elaborare dati biologici.
Biohub ha annunciato l'espansione della Virtual Biology Initiative il 7 ottobre 2026. Il suo annuncio ufficiale di finanziamento valuta l'impegno combinato in 1,8 miliardi di dollari tra finanziamenti, dati esistenti, capacità di calcolo e tecnologie di misurazione.
Google DeepMind, Meta e Isomorphic Labs stanno investendo collettivamente 300 milioni di dollari. La cifra resa nota non indica quanto contribuirà ciascuna azienda. Descrivere l'intero importo come investimento di Google sarebbe quindi impreciso.
Il Dipartimento dell'Energia prevede di contribuire con oltre 500 milioni di dollari nell'arco di cinque anni. Questo lavoro sosterrà misurazioni di laboratorio, modellazione biologica, calcolo, imaging e raccolta dati attraverso il sistema nazionale dei laboratori del dipartimento.
I National Institutes of Health coordineranno repository e dataset creati grazie a oltre 500 milioni di dollari di precedenti investimenti federali. Biohub intende contribuire a trasformare tali risorse in materiale standardizzato adatto all'addestramento dell'IA.
Biohub ha impegnato altri 500 milioni di dollari quando ha introdotto la Virtual Biology Initiative nell'aprile 2026. L'organizzazione non profit ha dichiarato che 400 milioni di dollari avrebbero sostenuto nuove tecnologie di misurazione. Tra queste figurano microscopia avanzata, tomografia crioelettronica e strumenti per modificare sistemi biologici a più scale.
Le categorie di finanziamento non sono intercambiabili. Alcune rappresentano nuovi fondi, mentre altre corrispondono a precedenti spese federali, dataset, attrezzature e capacità di calcolo. Il totale di 1,8 miliardi di dollari va inteso come un pacchetto combinato di risorse, non come un unico round di finanziamento in contanti.
L'iniziativa riunisce diverse organizzazioni scientifiche. Biohub ha nominato tra i collaboratori Allen Institute, Broad Institute, Gladstone Institutes, Human Cell Atlas, Human Protein Atlas e Wellcome Sanger Institute. Nvidia contribuirà con tecnologia di calcolo e competenze tecniche.
Biohub prevede inoltre di creare standard condivisi, identificatori comuni e un punto di accesso centrale. Questi compiti meno visibili contano perché i dataset biologici utilizzano spesso progetti sperimentali, etichette, strumenti e controlli di qualità diversi.
Combinare dataset incompatibili senza un'attenta normalizzazione può produrre una grande risorsa che insegna comunque le lezioni sbagliate a un modello. Un modello potrebbe apprendere le differenze tra laboratori anziché comportamenti cellulari significativi.
L'iniziativa è pensata per affrontare questo problema prima che la scala lo aggravi. I suoi organizzatori vogliono che i gruppi di ricerca progettino esperimenti complementari, registrino metadati più ricchi ed elaborino i risultati attraverso sistemi compatibili.
Il primo grande dataset è atteso tra circa un anno, secondo il responsabile scientifico di Biohub Alex Rives nei termini riportati. I partner puntano a modelli predittivi accurati entro cinque anni.
Queste date sono obiettivi, non traguardi convalidati. Biohub non ha ancora pubblicato uno standard universale di accuratezza che stabilisca quando la sua cellula virtuale diventerà sufficientemente affidabile per decisioni di ricerca rilevanti.
Il vero collo di bottiglia è la biologia sperimentale, non la dimensione dei modelli
L'investimento di Google Biohub nella cellula virtuale considera la generazione di dati il fattore limitante, perché la biologia non può essere estratta dal web pubblico.
Una cellula virtuale è un modello computazionale che prevede come una cellula cambi dopo un intervento biologico. Tale intervento può comportare il silenziamento di un gene, l'aggiunta di un farmaco, la modifica dei nutrienti o l'esposizione delle cellule a una condizione correlata a una malattia.
L'output desiderato non è semplicemente un'immagine realistica di una cellula. I ricercatori vogliono previsioni sull'attività genica, le proteine, le strutture, le vie di segnalazione e il comportamento osservabile. Laboratori diversi possono costruire modelli distinti per domande differenti.
Un ricercatore oncologico potrebbe chiedere come risponde una cellula tumorale quando un gene specifico viene disattivato. Uno sviluppatore di farmaci potrebbe confrontare diversi composti prima di scegliere quali meritino test di laboratorio. Un altro team potrebbe esaminare il comportamento di una cellula immunitaria all'interno di tessuto malato.
Il modello necessita di osservazioni appaiate per rispondere a tali domande. I ricercatori devono misurare una cellula prima di un intervento, applicare un cambiamento controllato e registrare lo stato risultante. Devono ripetere il processo su tipi cellulari, condizioni, dosi e punti temporali diversi.
Le raccolte pubbliche attuali contengono centinaia di milioni di osservazioni cellulari. Rives ha dichiarato a Reuters che una modellazione predittiva affidabile richiederà miliardi e, in seguito, trilioni di osservazioni. Il divario di scala spiega perché l'iniziativa includa microscopi, automazione di laboratorio e strutture federali.
La sola scala non risolverà il problema. Un trilione di osservazioni scarsamente documentate può preservare i pregiudizi sperimentali a una dimensione senza precedenti. I dati devono anche catturare cambiamenti causali, contesto biologico, tempo e incertezza.
La trascrittomica spaziale, per esempio, mappa l'attività molecolare preservando la posizione di una cellula nel tessuto. Questo contesto è importante perché le cellule vicine e la struttura dei tessuti possono cambiare il comportamento di una cellula.
La tomografia crioelettronica produce immagini tridimensionali dettagliate delle strutture all'interno delle cellule. Gli screening di perturbazione misurano le risposte dopo che i ricercatori modificano geni o condizioni ambientali. Ogni metodo cattura un diverso strato della biologia.
Biohub vuole coordinare queste modalità anziché trattarle come raccolte isolate. La premessa dell'organizzazione è che i modelli debbano apprendere relazioni tra i livelli molecolare, cellulare, tissutale e dell'organismo.
Questa premessa distingue l'iniziativa dal semplice addestramento di una rete neurale più grande. Il dirigente di Google DeepMind Pushmeet Kohli ha affermato che la sfida richiede dati sperimentali che mostrino come le cellule viventi rispondono al cambiamento. Ha descritto una commons di dati aperta e standardizzata come la base necessaria.
Il collo di bottiglia dei dati cambia anche il modo in cui i ricercatori assegnano il tempo di laboratorio. Un modello credibile potrebbe vagliare digitalmente molte ipotesi, per poi indirizzare gli esperimenti fisici verso i candidati più informativi.
Si consideri un team che studia una via molecolare associata alla malattia di Alzheimer. Oggi potrebbe scegliere gli esperimenti sulla base di evidenze pubblicate e del giudizio di esperti. Una cellula virtuale potrebbe classificare gli interventi in base all'effetto previsto e all'incertezza.
Il laboratorio eseguirebbe comunque l'esperimento decisivo. Potrebbe però selezionare un insieme più piccolo e più informativo di candidati. Il modello apprenderebbe quindi dai nuovi risultati, creando un ciclo tra previsione e misurazione.
Questo flusso di lavoro ricorda l'apprendimento attivo, in cui un algoritmo seleziona i punti dati successivi che migliorerebbero maggiormente la propria comprensione. Il valore pratico risiede in una migliore selezione degli esperimenti, non nell'eliminazione degli esperimenti.
La biologia cambia anche tra individui, tessuti, fasi dello sviluppo e stati patologici. Un modello che funziona bene su una linea cellulare coltivata potrebbe fallire nel tessuto umano primario. Un risultato ottenuto con una dose potrebbe non essere generalizzabile a un'altra.
Per questo motivo, il contributo più importante del progetto nel breve termine potrebbe essere un migliore substrato per la ricerca anziché un simulatore universale. Dataset condivisi possono sostenere modelli più circoscritti molto prima che un unico sistema preveda ogni risposta cellulare rilevante.
Dati aperti e accesso aziendale convivono in un equilibrio precario
L'iniziativa dipende dalla scienza condivisa, ma la sua struttura di finanziamento offre ai partecipanti commerciali un vantaggio informativo temporaneo.
Biohub afferma che la risorsa risultante sarà infine aperta alla comunità scientifica. Secondo Rives, i dataset finanziati dal governo non saranno soggetti a periodi di embargo privati. I dati finanziati dalle aziende seguiranno un percorso diverso.
I finanziatori commerciali riceveranno un periodo durante il quale potranno lavorare con i dati prima della loro pubblicazione. Biohub non ha reso nota, nel suo annuncio pubblico, la durata di tali embarghi.
L'accordo offre un incentivo diretto. La generazione di dati è costosa e l'accesso anticipato può contribuire a giustificare gli investimenti aziendali. Google DeepMind, Isomorphic Labs e Meta guadagnano tempo per addestrare modelli, testare metodi o individuare direzioni di ricerca promettenti.
Isomorphic Labs ha il collegamento commerciale diretto più chiaro. L'azienda di Alphabet sviluppa sistemi di IA per la scoperta di farmaci. Un accesso anticipato ad ampi dataset di perturbazione potrebbe sostenere l'identificazione di bersagli o la valutazione di composti.
Google DeepMind apporta esperienza proveniente da sistemi come AlphaFold, che prevede strutture e interazioni proteiche. Tuttavia, la modellazione dell'intera cellula è un problema diverso. La struttura di una proteina è soltanto un componente all'interno di una rete biologica dinamica.
Il percorso commerciale di Meta è meno esplicito. La sua organizzazione di ricerca sull'IA ha lavorato alla modellazione biologica, mentre Zuckerberg ha contribuito a fondare Biohub con Chan. La partecipazione dell'azienda le assegna inoltre una posizione all'interno di un'iniziativa sui dati scientifici strategicamente importante.
Università e piccole aziende biotecnologiche potrebbero alla fine accedere agli stessi dataset. Durante un embargo, tuttavia, i partner ben finanziati possono sviluppare modelli e flussi di lavoro prima che la comunità più ampia riceva la risorsa sottostante.
Questo vantaggio iniziale non invalida necessariamente la promessa della scienza aperta. Solleva però una questione su cosa significhi “aperto” quando l'accesso avviene in tempi diversi.
La risposta dipenderà da una governance dettagliata. I ricercatori dovrebbero monitorare la durata degli embarghi, i termini di licenza, la disponibilità dei metadati, le restrizioni al download e l’eventuale inclusione di risultati sperimentali negativi.
I risultati negativi sono particolarmente importanti. Un modello deve imparare quando un intervento non produce effetti significativi, non solo quando i ricercatori osservano una risposta interessante. Una pubblicazione selettiva distorcerebbe la distribuzione dei dati di addestramento.
L’iniziativa deve inoltre decidere in che modo i ricercatori esterni possano contestare o correggere i suoi dataset. I file aperti hanno valore limitato se la documentazione è incompleta o se la segnalazione degli errori rimane difficile.
L’accesso commerciale potrebbe creare un ulteriore squilibrio sul fronte del calcolo. Pubblicare un enorme dataset biologico non garantisce che i gruppi accademici possano permettersi di addestrare modelli competitivi su di esso. Il coinvolgimento di Nvidia potrebbe migliorare l’infrastruttura, ma le regole di allocazione saranno decisive.
Il modello di Biohub si colloca quindi tra due alternative imperfette. Dataset completamente proprietari limiterebbero il controllo scientifico e concentrerebbero le capacità. Un’iniziativa interamente pubblica potrebbe faticare ad attrarre investimenti privati equivalenti o a procedere al ritmo desiderato.
La competizione principale non è Google contro Meta. È la promessa di un’infrastruttura biologica aperta contro i vantaggi pratici concessi alle aziende che la finanziano.
Calendari di rilascio chiari renderebbero questo compromesso più semplice da valutare. Lo stesso varrebbe per dataset card pubbliche che descrivano metodi sperimentali, limitazioni note, copertura demografica, contesti cellulari e controlli di qualità.
I ricercatori avranno anche bisogno di un accesso duraturo. Una risorsa pubblica che modifica le interfacce, rimuove versioni o non dispone di identificatori stabili può compromettere la riproducibilità. Gli standard comuni di Biohub potrebbero diventare importanti quanto qualsiasi singolo modello.
Questa questione di governance va oltre il progetto attuale. La fondazione di OpenAI ha iniziato a finanziare dataset biologici e medici, mentre Anthropic ha ampliato le proprie attività nella ricerca biologica basata su laboratorio. Le aziende di AI considerano sempre più i dati sperimentali proprietari come una risorsa strategica.
Biohub propone un livello condiviso all’interno di questa competizione. Se rimarrà realmente condiviso sarà evidente dalle politiche di accesso, non dagli impegni del giorno del lancio.
Le attuali cellule virtuali falliscono ancora i test fondamentali di generalizzazione
La ragione più forte per essere cauti arriva dai benchmark pubblici, dove i modelli più avanzati faticano ancora a prevedere con coerenza risposte cellulari non familiari.
Arc Institute offre un confronto utile. La sua Virtual Cell Initiative sviluppa dataset, modelli e competizioni annuali che testano le previsioni delle risposte cellulari.
La prima sfida chiedeva ai modelli di prevedere i cambiamenti nell’espressione genica dopo che i ricercatori avevano soppresso specifici geni nelle cellule staminali embrionali umane. Il suo benchmark comprendeva circa 300.000 profili a singola cellula relativi a 300 perturbazioni genetiche.
Si sono registrate oltre 5.000 persone da 114 Paesi. Più di 1.200 team hanno inviato risultati e oltre 300 hanno completato le candidature finali. Quel livello di partecipazione ha reso la competizione un test significativo degli approcci attuali.
I risultati della sfida sono stati sobri. Arc ha riferito che i modelli non hanno superato in modo costante semplici baseline in tutte le metriche di valutazione.
I sistemi vincitori hanno migliorato la capacità di distinguere le perturbazioni e identificare i geni la cui attività cambiava. Tuttavia, gli approcci migliori combinavano deep learning e caratteristiche statistiche classiche. L’apprendimento puro end-to-end non aveva risolto il compito.
Questo risultato non dimostra che le cellule virtuali siano impossibili. Mostra che buone prestazioni su dati familiari non possono sostituire la generalizzazione a un nuovo tipo cellulare o intervento.
La distinzione conta per la scoperta di farmaci. I ricercatori hanno bisogno di un modello che dica qualcosa di utile su condizioni che non sono già state misurate. Memorizzare schemi comuni nei dataset esistenti offre un valore limitato quando la domanda centrale è nuova.
La sfida di Arc del 2026 aumenta la difficoltà. I modelli devono prevedere risposte in sei linee cellulari le cui perturbazioni non sono state fornite durante l’addestramento. Questa impostazione zero-shot, ovvero la previsione senza esempi specifici del compito, assomiglia maggiormente all’uso scientifico.
Il modello STATE di Arc illustra sia i progressi sia i limiti. Secondo il suo programma sulle cellule virtuali, STATE ha appreso da dati osservazionali relativi a 167 milioni di cellule e da dati sulle perturbazioni relativi a oltre 100 milioni di cellule in 70 contesti umani.
Questi numeri sono grandi, ma la copertura resta limitata rispetto alle possibilità biologiche. Le cellule umane contengono sistemi molecolari interagenti che cambiano nel tempo e reagiscono in modo diverso all’interno dei tessuti viventi.
Anche gli esperimenti sulle linee cellulari semplificano la realtà. Le linee cellulari di laboratorio possono crescere in condizioni controllate, mentre le cellule di un paziente incontrano segnali immunitari, tessuti vicini, nutrienti variabili e trattamenti precedenti.
Una cellula virtuale potrebbe prevedere con precisione l’espressione genica e tuttavia non cogliere un altro esito importante. Un farmaco potrebbe modificare la localizzazione delle proteine, la forma cellulare, il metabolismo, la tossicità o la comunicazione senza produrre una firma trascrittomica evidente.
I ricercatori devono quindi definire il successo attorno a decisioni specifiche. Un modello potrebbe essere utile per classificare bersagli genetici anche se non riesce a riprodurre ogni processo cellulare. Un altro modello potrebbe aiutare a selezionare esperimenti pur rimanendo inadatto alle previsioni cliniche.
L’espressione “cellula virtuale universale” può oscurare queste soglie più ristrette. Suggerisce un unico modello capace di gestire ogni cellula e intervento. Il percorso più probabile coinvolge diversi modelli, tipi di misurazione e stime di confidenza.
Una panoramica sulle cellule virtuali ha osservato che i ricercatori non condividono una sola definizione del concetto. Alcuni immaginano una simulazione visiva, mentre altri intendono programmi predittivi che rispondono a domande biologiche mirate.
Questa ambiguità rende più difficile giudicare le tempistiche ambiziose. Biohub prevede modelli predittivi accurati entro cinque anni, ma l’accuratezza dipende dal test, dal contesto cellulare e dalla tolleranza all’errore.
Il programma dovrebbe pubblicare i criteri di valutazione prima di dichiarare il successo. Misure utili potrebbero includere le prestazioni su tipi cellulari non osservati, nuovi interventi, più laboratori e condizioni diverse dai dati di addestramento.
Anche la replicazione esterna sarà importante. Un risultato prodotto all’interno di un sistema sperimentale dovrebbe essere testato da laboratori indipendenti che utilizzano attrezzature e campioni diversi.
La dimostrazione più convincente non sarebbe una visualizzazione raffinata. Sarebbe uno studio prospettico in cui un modello raccomanda esperimenti, ricercatori indipendenti li eseguono e le previsioni migliorano le decisioni.
Finché tali test non diventeranno di routine, le affermazioni su uno sviluppo più rapido dei farmaci resteranno ipotesi. I modelli potrebbero ridurre il lavoro nella fase iniziale della scoperta, ma lo sviluppo clinico comprende anche test di tossicità, produzione, sperimentazioni e revisione normativa.
Tre segnali mostreranno se la scommessa sulla cellula virtuale sta funzionando
La prossima fase dovrebbe essere valutata in base a prove pubbliche: il primo dataset, le prestazioni nei benchmark indipendenti e regole di accesso applicabili.
Il primo segnale è il dataset iniziale di grandi dimensioni di Biohub, atteso intorno a ottobre 2027. Le sue dimensioni attireranno l’attenzione, ma copertura e documentazione conteranno di più.
I lettori dovrebbero cercare il numero di tipi cellulari, interventi, dosi, punti temporali e donatori biologici. Dovrebbero inoltre verificare se il rilascio include risultati negativi, misurazioni grezze, metadati standardizzati e controlli di qualità indipendenti.
Un dataset ben documentato e rilasciato nei tempi previsti rafforzerebbe l’argomento di Biohub secondo cui un investimento coordinato può affrontare la carenza di dati della biologia. Un rilascio limitato o ritardato indebolirebbe l’obiettivo del modello a cinque anni.
Il secondo segnale è la prestazione su una biologia realmente non familiare. Biohub e i suoi partner hanno bisogno di benchmark che impediscano ai modelli di avere successo tramite memorizzazione o artefatti specifici del laboratorio.
La sfida zero-shot di Arc fornisce un modello per questo tipo di test. Le valutazioni future dovrebbero aggiungere contesti tissutali, interventi chimici, scale temporali più lunghe e misurazioni oltre l’espressione genica.
La domanda decisiva è se le previsioni migliorino le vere scelte sperimentali. Un modello dovrebbe identificare interventi che gli scienziati altrimenti non prioritizzerebbero, per poi produrre risultati che reggano in laboratorio.
Il successo in una classifica retrospettiva sarebbe incoraggiante ma incompleto. Esperimenti prospettici, replicati in modo indipendente, fornirebbero prove molto più solide.
Il terzo segnale è la pubblicazione dei termini di accesso e governance. Biohub dovrebbe rendere noto quanto durano gli embarghi commerciali, quali partner ne beneficiano e quando ciascun dataset diventa pubblico.
I ricercatori dovrebbero inoltre monitorare licenze, accesso al calcolo, politiche di rilascio dei modelli, tutele della privacy e meccanismi per correggere record difettosi. Queste regole determineranno se il progetto diventerà un’infrastruttura o una risorsa aziendale ritardata.
La scala dell’iniziativa le dà la possibilità di definire standard tecnici in tutto il settore. Questo risultato potrebbe essere prezioso anche se una cellula virtuale universale restasse oltre l’orizzonte di cinque anni.
Identificatori condivisi e dataset interoperabili consentirebbero ai ricercatori di confrontare i modelli in modo più equo. Benchmark comuni renderebbero più difficile commercializzare risultati selettivi come ampia intelligenza biologica.
Per gli sviluppatori, il progetto offre una lezione che va oltre la medicina. Algoritmi migliori non possono compensare indefinitamente dati mancanti, etichettati male o deboli sul piano causale.
Per le aziende biotecnologiche, il programma potrebbe ridurre il costo di ottenere dati di preaddestramento utili. Potrebbe anche intensificare la concorrenza, offrendo alle grandi aziende di AI una posizione iniziale nell’infrastruttura per la scoperta di farmaci.
Per le istituzioni di ricerca, l’opportunità comporta la responsabilità di testare criticamente i modelli. Gli scienziati dovrebbero separare gli strumenti di previsione utili dalle affermazioni di una comprensione cellulare completa.
Per i pazienti, le aspettative immediate dovrebbero rimanere modeste. Questo investimento non fornirà un nuovo trattamento il prossimo anno. I suoi risultati nel breve termine saranno dataset, standard, sistemi di misurazione e modelli sperimentali.
L’investimento di Google Biohub nella cellula virtuale è significativo perché finanzia il lavoro fisico alla base dell’AI biologica. Riconosce che il prossimo miglioramento dei modelli dipende dai laboratori tanto quanto dai cluster di calcolo.
La domanda ora è se Biohub possa trasformare molte istituzioni, strumenti e incentivi in prove affidabili. Osservate il primo dataset pubblico, il primo test prospettico indipendente e le regole definitive di accesso. Questi risultati mostreranno se questa partnership ha creato un’infrastruttura scientifica condivisa o soltanto una promessa ben finanziata.



