top of page

La inversión de Google Biohub en células virtuales aborda los datos faltantes de la biología

hace 15 horas
14 min de lectura

Google se ha sumado a una inversión corporativa de 300 millones de dólares en el proyecto de células virtuales de Biohub, apostando a que mejores datos biológicos pueden convertir la IA en una herramienta de investigación de enfermedades. Meta e Isomorphic Labs, propiedad de Alphabet, participan junto a Google DeepMind. La inversión de Google Biohub en células virtuales forma parte de un paquete más amplio de 1.800 millones de dólares que involucra a Biohub y a dos agencias estadounidenses.

El titular parece otro gran proyecto de modelos de IA. El objetivo real es más difícil de construir. Biohub busca conjuntos de datos que describan cómo responden las células vivas a los fármacos, los cambios genéticos, las condiciones ambientales y otras intervenciones.

Esa distinción genera la tensión central. Los modelos de lenguaje aprendieron de información que las personas ya habían publicado en internet. Una célula virtual útil necesita observaciones experimentales que, a menudo, aún no existen. Los investigadores deben generar esas observaciones en laboratorios antes de que un sistema de IA pueda aprender de ellas.

Biohub, fundada por Mark Zuckerberg y Priscilla Chan, está organizando por tanto una red de producción de datos, en lugar de anunciar un simulador biológico terminado. El proyecto combina capital corporativo, infraestructura federal de investigación, institutos científicos y conjuntos de datos públicos estandarizados.

Este enfoque también desafía una suposición habitual sobre la competencia en IA. Google y Meta suelen competir por controlar modelos, infraestructura, talento y distribución. Aquí financian un recurso biológico compartido porque ninguna de las dos empresas puede crear fácilmente por sí sola suficientes datos experimentales de alta calidad.

Esta colaboración no elimina los incentivos comerciales. Las empresas participantes recibirán acceso anticipado temporal a algunos conjuntos de datos financiados de forma privada antes de que esos recursos se hagan públicos. El acuerdo sitúa la ciencia abierta y la ventaja corporativa dentro del mismo programa.

La inversión de Google Biohub en células virtuales se amplía hasta un esfuerzo de 1.800 millones de dólares

El cambio importante no es que una empresa financie un modelo. Es la creación de un sistema compartido para producir, estandarizar y procesar datos biológicos.

Biohub anunció la ampliación de la Virtual Biology Initiative el 7 de octubre de 2026. Su anuncio oficial de financiación valora el compromiso combinado en 1.800 millones de dólares en financiación, datos existentes, capacidad de cómputo y tecnología de medición.

Google DeepMind, Meta e Isomorphic Labs están invirtiendo conjuntamente 300 millones de dólares. La cifra divulgada no indica cuánto aportará cada empresa. Por tanto, describir la totalidad como inversión de Google sería inexacto.

El Department of Energy planea aportar más de 500 millones de dólares durante cinco años. Ese trabajo respaldará la medición de laboratorio, el modelado biológico, la computación, la obtención de imágenes y la recopilación de datos a través del sistema nacional de laboratorios del departamento.

Los National Institutes of Health coordinarán repositorios y conjuntos de datos creados mediante más de 500 millones de dólares en inversión federal previa. Biohub planea ayudar a transformar esos recursos en material estandarizado apto para el entrenamiento de IA.

Biohub comprometió otros 500 millones de dólares cuando presentó la Virtual Biology Initiative en abril de 2026. La organización sin fines de lucro indicó que 400 millones de dólares respaldarían nuevas tecnologías de medición. Entre ellas figuran la microscopía avanzada, la tomografía crioelectrónica y herramientas para modificar sistemas biológicos a varias escalas.

Las categorías de financiación no son intercambiables. Algunas representan dinero nuevo, mientras que otras corresponden a gasto federal previo, conjuntos de datos, equipos y capacidad de cómputo. El total de 1.800 millones de dólares debe entenderse como un paquete combinado de recursos, no como una única ronda de efectivo.

La iniciativa reúne a varias organizaciones científicas. Biohub mencionó al Allen Institute, Broad Institute, Gladstone Institutes, Human Cell Atlas, Human Protein Atlas y Wellcome Sanger Institute entre sus colaboradores. Nvidia aportará tecnología de cómputo y experiencia técnica.

Biohub también planea crear estándares compartidos, identificadores comunes y un punto central de acceso. Estas tareas menos visibles importan porque los conjuntos de datos biológicos suelen utilizar diseños experimentales, etiquetas, instrumentos y controles de calidad diferentes.

Combinar conjuntos de datos incompatibles sin una normalización cuidadosa puede producir un gran recurso que, aun así, enseñe a un modelo las lecciones equivocadas. Un modelo podría aprender diferencias entre laboratorios en lugar de comportamientos celulares significativos.

La iniciativa pretende abordar ese problema antes de que la escala lo empeore. Sus organizadores quieren que los grupos de investigación diseñen experimentos complementarios, registren metadatos más completos y procesen los resultados mediante sistemas compatibles.

Se espera el primer gran conjunto de datos en aproximadamente un año, según el responsable científico de Biohub, Alex Rives, en los términos reportados. Los socios apuntan a modelos predictivos precisos en un plazo de cinco años.

Esas fechas son objetivos, no hitos validados. Biohub aún no ha publicado un estándar universal de precisión que determine cuándo su célula virtual será lo bastante fiable para tomar decisiones de investigación importantes.

El verdadero cuello de botella es la biología experimental, no el tamaño del modelo

La inversión de Google Biohub en células virtuales considera la generación de datos como el factor limitante porque la biología no puede extraerse de internet.

Una célula virtual es un modelo computacional que predice cómo cambia una célula después de una intervención biológica. Esa intervención puede implicar silenciar un gen, añadir un fármaco, cambiar nutrientes o exponer células a una condición relacionada con una enfermedad.

El resultado deseado no es simplemente una imagen realista de una célula. Los investigadores buscan predicciones sobre actividad genética, proteínas, estructuras, vías de señalización y comportamiento observable. Diferentes laboratorios pueden construir modelos distintos para preguntas diferentes.

Un investigador del cáncer podría preguntar cómo responde una célula tumoral cuando se desactiva un gen específico. Un desarrollador de fármacos podría comparar varios compuestos antes de elegir cuáles merecen pruebas de laboratorio. Otro equipo podría examinar cómo se comporta una célula inmunitaria dentro de tejido enfermo.

El modelo necesita observaciones emparejadas para responder esas preguntas. Los investigadores deben medir una célula antes de una intervención, aplicar un cambio controlado y registrar el estado resultante. Deben repetir ese proceso entre tipos celulares, condiciones, dosis y momentos temporales.

Las colecciones públicas actuales contienen cientos de millones de observaciones celulares. Rives dijo a Reuters que el modelado predictivo fiable requerirá miles de millones y, finalmente, billones. La brecha de escala explica por qué la iniciativa incluye microscopios, automatización de laboratorio e instalaciones federales.

La escala por sí sola no resolverá el problema. Un billón de observaciones mal documentadas puede preservar el sesgo experimental a una escala sin precedentes. Los datos también deben capturar cambios causales, contexto biológico, tiempo e incertidumbre.

La transcriptómica espacial, por ejemplo, cartografía la actividad molecular mientras preserva la ubicación de una célula dentro del tejido. Ese contexto importa porque las células vecinas y la estructura del tejido pueden cambiar el comportamiento de una célula.

La tomografía crioelectrónica produce vistas tridimensionales detalladas de las estructuras dentro de las células. Los cribados de perturbación miden las respuestas después de que los investigadores modifiquen genes o condiciones ambientales. Cada método captura una capa diferente de la biología.

Biohub quiere coordinar estas modalidades en vez de tratarlas como colecciones aisladas. La premisa de la organización es que los modelos deben aprender relaciones entre los niveles molecular, celular, tisular y del organismo.

Esa premisa distingue a la iniciativa de simplemente entrenar una red neuronal más grande. El ejecutivo de Google DeepMind, Pushmeet Kohli, afirmó que el desafío requiere datos experimentales que muestren cómo responden las células vivas al cambio. Describió un repositorio de datos abierto y estandarizado como la base necesaria.

El cuello de botella de los datos también cambia la forma en que los investigadores asignan el tiempo de laboratorio. Un modelo creíble podría evaluar digitalmente muchas hipótesis y luego dirigir los experimentos físicos hacia los candidatos más informativos.

Consideremos un equipo que estudia una vía molecular asociada con la enfermedad de Alzheimer. Hoy podría elegir experimentos usando evidencia publicada y juicio experto. Una célula virtual podría clasificar las intervenciones según el efecto previsto y la incertidumbre.

El laboratorio seguiría realizando el experimento decisivo. Sin embargo, podría seleccionar un conjunto más pequeño y más informativo de candidatos. El modelo aprendería entonces de los nuevos resultados, creando un ciclo entre predicción y medición.

Ese flujo de trabajo se asemeja al aprendizaje activo, en el que un algoritmo selecciona los siguientes puntos de datos que mejorarían en mayor medida su comprensión. El valor práctico reside en una mejor selección de experimentos, no en eliminar los experimentos.

La biología también cambia entre individuos, tejidos, etapas de desarrollo y estados de enfermedad. Un modelo que funciona bien en una línea celular cultivada podría fallar en tejido humano primario. Un resultado de una dosis podría no generalizarse a otra.

Por esa razón, la contribución más sólida del proyecto a corto plazo podría ser una mejor base para la investigación, en lugar de un simulador universal. Los conjuntos de datos compartidos pueden respaldar modelos más acotados mucho antes de que un sistema prediga todas las respuestas celulares relevantes.

Los datos abiertos y el acceso corporativo mantienen un equilibrio incómodo

La iniciativa depende de la ciencia compartida, pero su estructura de financiación otorga a los participantes comerciales una ventaja temporal de información.

Biohub afirma que el recurso resultante terminará estando abierto a la comunidad científica. Los conjuntos de datos financiados por el gobierno no tendrán períodos de embargo privado, según Rives. Los datos financiados por empresas seguirán una vía diferente.

Los financiadores comerciales recibirán un período durante el cual podrán trabajar con los datos antes de su publicación. Biohub no ha divulgado la duración de esos embargos en su anuncio público.

El acuerdo ofrece un incentivo directo. La generación de datos es costosa, y el acceso anticipado puede ayudar a justificar la inversión corporativa. Google DeepMind, Isomorphic Labs y Meta ganan tiempo para entrenar modelos, probar métodos o identificar direcciones prometedoras de investigación.

Isomorphic Labs tiene la conexión comercial directa más clara. La empresa de Alphabet desarrolla sistemas de IA para el descubrimiento de fármacos. El acceso anticipado a amplios conjuntos de datos de perturbaciones podría respaldar la identificación de dianas o la evaluación de compuestos.

Google DeepMind aporta experiencia de sistemas como AlphaFold, que predice estructuras e interacciones de proteínas. Sin embargo, el modelado de células completas es un problema diferente. La estructura de una proteína es solo un componente dentro de una red biológica dinámica.

La vía comercial de Meta es menos explícita. Su organización de investigación de IA ha trabajado en modelado biológico, mientras que Zuckerberg ayudó a establecer Biohub con Chan. La participación de la empresa también le otorga una posición dentro de un esfuerzo de datos científicos estratégicamente importante.

Las universidades y las empresas biotecnológicas más pequeñas podrían obtener finalmente acceso a los mismos conjuntos de datos. Sin embargo, durante un embargo, los socios bien financiados pueden desarrollar modelos y flujos de trabajo antes de que la comunidad más amplia reciba el recurso subyacente.

Esa ventaja inicial no tiene por qué invalidar la promesa de la ciencia abierta. Sí plantea una pregunta sobre qué significa “abierto” cuando el acceso ocurre en momentos diferentes.

La respuesta dependerá de una gobernanza detallada. Los investigadores deberían vigilar la duración de los embargos, los términos de licencia, la disponibilidad de metadatos, las restricciones de descarga y si se incluyen resultados experimentales negativos.

Los resultados negativos son especialmente importantes. Un modelo necesita aprender cuándo una intervención no tiene un efecto significativo, no solo cuándo los investigadores observan una respuesta interesante. La publicación selectiva distorsionaría la distribución de entrenamiento.

La iniciativa también debe decidir cómo pueden los investigadores externos cuestionar o corregir sus conjuntos de datos. Los archivos abiertos ofrecen un valor limitado si la documentación es incompleta o si sigue siendo difícil reportar errores.

El acceso comercial podría crear otro desequilibrio en torno a la capacidad de cómputo. Publicar un enorme conjunto de datos biológicos no garantiza que los equipos académicos puedan permitirse entrenar modelos competitivos con él. La participación de Nvidia puede mejorar la infraestructura, pero las reglas de asignación serán importantes.

Por lo tanto, el modelo de Biohub se sitúa entre dos alternativas imperfectas. Los conjuntos de datos totalmente propietarios restringirían el escrutinio científico y concentrarían la capacidad. Un esfuerzo puramente público podría tener dificultades para atraer una inversión privada equivalente o avanzar al ritmo deseado.

La competencia principal no es Google contra Meta. Es la promesa de una infraestructura biológica abierta frente a las ventajas prácticas otorgadas a las empresas que la financian.

Calendarios de publicación claros facilitarían la evaluación de esa disyuntiva. También lo harían las fichas públicas de los conjuntos de datos que describan los métodos experimentales, las limitaciones conocidas, la cobertura demográfica, los contextos celulares y las comprobaciones de calidad.

Los investigadores también necesitarán acceso duradero. Un recurso público que cambie sus interfaces, elimine versiones o carezca de identificadores estables puede socavar la reproducibilidad. Los estándares comunes de Biohub podrían llegar a ser tan importantes como cualquier modelo individual.

Esta cuestión de gobernanza se extiende más allá del proyecto actual. La fundación de OpenAI ha comenzado a financiar conjuntos de datos biológicos y médicos, mientras que Anthropic se ha expandido hacia la investigación biológica basada en laboratorio. Las empresas de IA ven cada vez más los datos experimentales propietarios como un activo estratégico.

Biohub propone una capa compartida dentro de esa competencia. Que siga siendo realmente compartida se verá en las políticas de acceso, no en los compromisos del día de lanzamiento.

Las células virtuales actuales siguen sin superar pruebas básicas de generalización

La razón más sólida para la cautela procede de los benchmarks públicos, donde los principales modelos aún tienen dificultades para predecir de forma consistente respuestas celulares desconocidas.

Arc Institute ofrece una comparación útil. Su Virtual Cell Initiative desarrolla conjuntos de datos, modelos y competiciones anuales que evalúan predicciones de respuestas celulares.

El primer desafío pidió a los modelos predecir cambios en la expresión génica después de que los investigadores suprimieran genes concretos en células madre embrionarias humanas. Su benchmark contenía cerca de 300.000 perfiles de células individuales que abarcaban 300 perturbaciones genéticas.

Más de 5.000 personas se registraron desde 114 países. Más de 1.200 equipos enviaron resultados y más de 300 completaron entregas finales. Ese nivel de participación convirtió la competición en una prueba significativa de los enfoques actuales.

Los resultados del desafío fueron aleccionadores. Arc informó que los modelos no superaban de forma consistente a las líneas base simples en todas las métricas de evaluación.

Los sistemas ganadores mejoraron a la hora de distinguir perturbaciones e identificar genes cuya actividad cambió. Sin embargo, los mejores enfoques combinaron aprendizaje profundo con características estadísticas clásicas. El aprendizaje puro de extremo a extremo no había resuelto la tarea.

Este resultado no demuestra que las células virtuales sean imposibles. Demuestra que un rendimiento sólido con datos conocidos no puede sustituir la generalización a un nuevo tipo celular o intervención.

La distinción importa para el descubrimiento de fármacos. Los investigadores necesitan que un modelo diga algo útil sobre condiciones que aún no se han medido. Memorizar patrones comunes de conjuntos de datos existentes ofrece un valor limitado cuando la cuestión central es novedosa.

El desafío de Arc de 2026 eleva la dificultad. Los modelos deben predecir respuestas en seis líneas celulares cuyas perturbaciones no se proporcionaron durante el entrenamiento. Ese escenario zero-shot, es decir, una predicción sin ejemplos específicos de la tarea, se parece más al uso científico.

El propio modelo STATE de Arc ilustra tanto el progreso como la limitación. Según su programa de células virtuales, STATE aprendió de datos observacionales que abarcan 167 millones de células y datos de perturbaciones que cubren más de 100 millones de células en 70 contextos humanos.

Estas cifras son grandes, pero la cobertura sigue siendo escasa en comparación con las posibilidades biológicas. Las células humanas contienen sistemas moleculares que interactúan, cambian con el tiempo y reaccionan de forma diferente dentro de tejidos vivos.

Los experimentos con líneas celulares también simplifican la realidad. Las líneas celulares de laboratorio pueden crecer en condiciones controladas, mientras que las células dentro de un paciente encuentran señales inmunitarias, tejidos vecinos, nutrientes cambiantes y tratamientos previos.

Una célula virtual podría predecir con precisión la expresión génica y aun así pasar por alto otro resultado importante. Un fármaco podría alterar la localización de proteínas, la forma celular, el metabolismo, la toxicidad o la comunicación sin producir una señal transcriptómica evidente.

Por ello, los investigadores deben definir el éxito en torno a decisiones concretas. Un modelo podría ser útil para clasificar dianas génicas aunque no pueda reproducir cada proceso celular. Otro modelo podría ayudar a seleccionar experimentos sin ser adecuado para predicciones clínicas.

La expresión “célula virtual universal” puede ocultar estos umbrales más limitados. Sugiere un único modelo que maneja todas las células e intervenciones. La vía más probable implica varios modelos, tipos de medición y estimaciones de confianza.

Una visión general de las células virtuales señaló que los investigadores no comparten una única definición del concepto. Algunos imaginan una simulación visual, mientras que otros se refieren a programas predictivos que responden preguntas biológicas concretas.

Esa ambigüedad dificulta evaluar los calendarios ambiciosos. Biohub espera modelos predictivos precisos en cinco años, pero la precisión depende de la prueba, el contexto celular y la tolerancia al error.

El programa debería publicar criterios de evaluación antes de declarar el éxito. Las medidas útiles podrían incluir el rendimiento en tipos celulares no observados, nuevas intervenciones, múltiples laboratorios y condiciones que difieran de los datos de entrenamiento.

La replicación externa también será importante. Un resultado producido dentro de un sistema experimental debería probarse en laboratorios independientes que utilicen equipos y muestras diferentes.

La demostración más convincente no sería una visualización pulida. Sería un estudio prospectivo en el que un modelo recomiende experimentos, investigadores independientes los realicen y las predicciones mejoren las decisiones.

Hasta que tales pruebas se vuelvan rutinarias, las afirmaciones sobre un desarrollo de fármacos más rápido seguirán siendo hipótesis. Los modelos pueden reducir el trabajo de descubrimiento temprano, pero el desarrollo clínico también incluye pruebas de toxicidad, fabricación, ensayos y revisión regulatoria.

Tres señales mostrarán si la apuesta por la célula virtual está funcionando

La próxima fase debería evaluarse mediante evidencia pública: el primer conjunto de datos, el rendimiento en benchmarks independientes y reglas de acceso exigibles.

La primera señal es el conjunto de datos inicial de gran escala de Biohub, previsto para alrededor de octubre de 2027. Su tamaño atraerá atención, pero la cobertura y la documentación importarán más.

Los lectores deberían buscar el número de tipos celulares, intervenciones, dosis, puntos temporales y donantes biológicos. También deberían comprobar si la publicación incluye resultados negativos, mediciones sin procesar, metadatos estandarizados y controles de calidad independientes.

Un conjunto de datos bien documentado y publicado a tiempo reforzaría el argumento de Biohub de que la inversión coordinada puede abordar la escasez de datos en biología. Una publicación limitada o retrasada debilitaría el objetivo de modelos a cinco años.

La segunda señal es el rendimiento ante biología verdaderamente desconocida. Biohub y sus socios necesitan benchmarks que impidan a los modelos tener éxito mediante memorización o artefactos específicos de laboratorio.

El desafío zero-shot de Arc ofrece un modelo para ese tipo de pruebas. Las evaluaciones futuras deberían añadir contextos de tejidos, intervenciones químicas, escalas temporales más largas y mediciones más allá de la expresión génica.

La pregunta decisiva es si las predicciones mejoran las decisiones experimentales reales. Un modelo debería identificar intervenciones que los científicos no priorizarían de otro modo y, después, producir resultados que se sostengan en el laboratorio.

El éxito en una clasificación retrospectiva sería alentador, pero incompleto. Los experimentos prospectivos replicados de forma independiente aportarían evidencia mucho más sólida.

La tercera señal es la publicación de los términos de acceso y gobernanza. Biohub debería revelar cuánto duran los embargos comerciales, qué socios los reciben y cuándo cada conjunto de datos se hace público.

Los investigadores también deberían vigilar las licencias, el acceso a capacidad de cómputo, las políticas de publicación de modelos, las salvaguardas de privacidad y los mecanismos para corregir registros defectuosos. Estas reglas determinarán si el proyecto se convierte en infraestructura o en un activo corporativo retrasado.

La escala de la iniciativa le da la oportunidad de moldear estándares técnicos en todo el campo. Ese resultado podría ser valioso incluso si una célula virtual universal sigue fuera del horizonte de cinco años.

Los identificadores compartidos y los conjuntos de datos interoperables permitirían a los investigadores comparar modelos de forma más justa. Los benchmarks comunes dificultarían presentar resultados selectivos como inteligencia biológica amplia.

Para los desarrolladores, el proyecto ofrece una lección que va más allá de la medicina. Mejores algoritmos no pueden compensar indefinidamente datos faltantes, mal etiquetados o causalmente débiles.

Para las empresas de biotecnología, el programa podría reducir el coste de obtener datos útiles para el preentrenamiento. También podría intensificar la competencia al otorgar a las grandes empresas de IA una posición temprana en la infraestructura para el descubrimiento de fármacos.

Para las instituciones de investigación, la oportunidad conlleva la responsabilidad de probar los modelos de forma crítica. Los científicos deberían separar las herramientas de predicción útiles de las afirmaciones de comprensión celular integral.

Para los pacientes, las expectativas inmediatas deberían seguir siendo modestas. Esta inversión no proporcionará un nuevo tratamiento el próximo año. Sus resultados a corto plazo serán conjuntos de datos, estándares, sistemas de medición y modelos experimentales.

La inversión de Google Biohub en células virtuales es significativa porque financia el trabajo físico que respalda la IA biológica. Reconoce que la próxima mejora de los modelos depende tanto de los laboratorios como de los clústeres de cómputo.

La cuestión ahora es si Biohub puede convertir muchas instituciones, instrumentos e incentivos en evidencia fiable. Vigile el primer conjunto de datos público, la primera prueba prospectiva independiente y las reglas finales de acceso. Esos resultados mostrarán si esta alianza creó infraestructura científica compartida o solo una promesa bien financiada.

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page