Saltar al contenido

Biohub y Google impulsan la «célula virtual»: qué significan los 1.800 millones para la biología

octubre 10, 2026
Imagen microscópica de células humanas con tinción fluorescente, fotografía científica ilustrativa para el artículo sobre Biohub y la célula virtual. Archivo del National Cancer Institute, Unsplash; no representa resultados del proyecto Biohub.

¿Y si los investigadores pudieran ensayar una intervención sobre una célula digital antes de utilizarla en el laboratorio? La idea de una «célula virtual» lleva tiempo circulando por la biología computacional. Ahora una alianza entre Biohub, el Departamento de Energía de Estados Unidos, los Institutos Nacionales de Salud y empresas como Google DeepMind, Meta e Isomorphic Labs quiere construir una de las piezas que faltan para acercarse a ese objetivo: una base de datos biológicos mucho más amplia, estandarizada y apta para entrenar modelos de inteligencia artificial.

El 7 de octubre de 2026, Biohub anunció la ampliación de la Virtual Biology Initiative, con una cifra global de 1.800 millones de dólares en financiación, recursos, datos e infraestructura científica. Es una iniciativa relevante para la investigación sobre enfermedades, medicamentos y envejecimiento. Sin embargo, el anuncio exige dos aclaraciones fundamentales: no se trata de 1.800 millones íntegramente nuevos y todavía no existe una célula digital capaz de predecir con fiabilidad cualquier respuesta del organismo.

La importancia del proyecto reside en una pregunta que afecta a toda la inteligencia artificial científica: ¿cómo entrenar sistemas para que aprendan las relaciones causales de la biología, en vez de limitarse a reconocer semejanzas entre datos históricos?

Índice

Qué anunció Biohub el 7 de octubre de 2026

La comunicación oficial de Biohub describe una colaboración internacional para generar datos sobre cómo reaccionan células, tejidos y sistemas biológicos cuando cambian las condiciones. Participan el Departamento de Energía estadounidense —DOE, por sus siglas en inglés— y los Institutos Nacionales de Salud —NIH—, junto a varios socios del sector tecnológico y centros de investigación.

El objetivo inmediato no consiste en vender un programa que diagnostique enfermedades. Consiste en crear mediciones de alta calidad, acordar procedimientos para organizarlas y poner a disposición de los investigadores recursos que puedan utilizarse en modelos predictivos. Los nuevos experimentos se combinarán con repositorios ya existentes, siempre que su estructura y procedencia permitan integrarlos.

La iniciativa fue presentada inicialmente en abril de 2026. Lo nuevo de octubre es la ampliación de socios, capacidades e inversiones. Por eso conviene distinguir lanzamiento original y expansión anunciada: ambas fechas describen etapas del mismo proyecto, no dos programas distintos que deban sumarse por separado.

Los 1.800 millones: de dónde sale realmente la cifra

Un titular que se limite a decir que varias organizaciones «ponen 1.800 millones sobre la mesa» puede dar a entender que acaba de aprobarse una única partida de dinero nuevo. Los documentos oficiales permiten reconstruir una imagen bastante más precisa:

  • Biohub: 500 millones de dólares. Es su compromiso fundacional, comunicado en abril de 2026 y distribuido a lo largo de cinco años. Incluye 400 millones para tecnologías de medida, imágenes y generación de datos, y 100 millones para impulsar investigación externa.
  • Departamento de Energía: más de 500 millones. El DOE anuncia una inversión durante cinco años en experimentos, instrumentación, modelos, cálculo y recursos científicos de sus laboratorios nacionales.
  • Google DeepMind, Isomorphic Labs y Meta: 300 millones en conjunto. Se presentan como inversiones colectivas para ampliar tecnologías y conjuntos de datos multimodales.
  • NIH: recursos generados con más de 500 millones de inversión federal anterior. Los institutos coordinarán el uso de repositorios, conocimiento y datos ya financiados previamente; esa contribución no equivale a anunciar otros 500 millones de dinero fresco.

La suma de estos bloques explica la magnitud de la colaboración. No todos son fondos nuevos desembolsados en octubre ni tienen idéntica naturaleza: algunos son compromisos plurianuales, otros corresponden a recursos preexistentes y otros implican capacidades de cálculo e infraestructura. La cifra señala la escala conjunta del proyecto, no un presupuesto único y líquido inmediatamente disponible.

La nota oficial del Departamento de Energía confirma su aportación plurianual y la existencia de un acuerdo de colaboración. Por su parte, el comunicado de los NIH especifica que coordinarán conjuntos de datos biomédicos e iniciativas previas. Esta distinción económica importa: es distinta la noticia de una ampliación de recursos de la de una nueva inversión directa de la misma cantidad.

Qué es una «célula virtual» y qué no es

Una célula virtual sería una representación computacional capaz de predecir, dentro de un ámbito definido, cómo cambia una célula cuando recibe un estímulo, pierde la actividad de un gen o entra en contacto con una sustancia. La ambición final es que ese modelo incorpore suficiente información para proponer hipótesis que después puedan ponerse a prueba físicamente.

Podemos imaginar un experimento: un investigador quiere conocer qué ocurre cuando desactiva un gen relacionado con una enfermedad. Primero consulta un sistema digital entrenado con experimentos pertinentes; el modelo estima qué cambios podrían observarse en la actividad de otros genes o en ciertas proteínas. Si la predicción es suficientemente prometedora, el laboratorio realiza la intervención real para comprobarla.

La simulación no sustituye a la observación. No sería una célula biológica viva encerrada en el ordenador, ni una garantía de que un compuesto funciona en personas. Una predicción puede fallar si el sistema encuentra un tipo celular, una dosis, un estado patológico o una interacción que no estuvo bien representada en los datos de entrenamiento.

También es importante diferenciar niveles. Modelar una proteína no significa modelar una célula completa; modelar una célula aislada no equivale a predecir la respuesta de un tejido; y predecir un tejido no representa automáticamente el funcionamiento de un organismo. La llamada «célula universal» es una meta de investigación, no un producto terminado en octubre de 2026.

Por qué la inteligencia artificial necesita muchos más datos biológicos

Los modelos lingüísticos aprendieron de bibliotecas enormes de textos y de otros materiales digitales. En biología el problema es diferente: para saber qué sucede si hacemos algo a una célula, no basta con leer qué ocurrió en una muestra observada en reposo. Necesitamos experimentos que registren cómo cambia el sistema ante una intervención concreta.

La respuesta de una célula depende de su tipo, su estado, la edad del tejido, el entorno, las moléculas presentes y los cambios que se le hayan aplicado. Dos células con secuencias de ADN muy parecidas pueden comportarse de manera distinta porque están activando programas de expresión genética diferentes.

Si el conjunto de entrenamiento se concentra en unas pocas líneas celulares cultivadas en laboratorio, es posible que un modelo funcione razonablemente bien en esas condiciones y fracase cuando se aplica a tejido humano complejo. Los investigadores quieren ampliar precisamente la diversidad de tipos celulares, perturbaciones y contextos experimentales.

La iniciativa planea reunir información generada por nuevos instrumentos con datos históricos útiles. Sin embargo, mezclar miles de proyectos no crea calidad por acumulación: los formatos, controles, procedimientos y metadatos deben permitir saber cómo se obtuvo cada observación y si resulta comparable con las demás.

Qué tipos de mediciones se quieren combinar

El anuncio habla de datos multimodales, es decir, de diferentes maneras de describir un mismo sistema biológico. Algunas de las técnicas involucradas son:

  • Genómica y perturbaciones genéticas: permiten relacionar secuencias o intervenciones en genes con cambios observables.
  • Transcriptómica: muestra qué fragmentos de información genética se expresan en unas condiciones determinadas.
  • Proteómica: ayuda a analizar las proteínas, sus cantidades y algunos de sus estados funcionales.
  • Microscopía e imagen espacial: indican dónde están las estructuras celulares y cómo se organizan dentro de tejidos.
  • Mediciones temporales: registran procesos dinámicos, imprescindibles cuando una reacción cambia entre minutos, horas o días.

Biohub ha anunciado inversiones en criotomografía electrónica, microscopía avanzada e ingeniería de células y tejidos. Su programa inicial destinaba 400 millones de dólares a mejorar lo que puede observarse y medirse, y otros 100 millones a apoyar la creación de datos en instituciones externas. La descripción original de abril explica por qué la infraestructura experimental es una parte fundamental del proyecto.

Una cuestión técnica de fondo es que los datos han de tener identificadores compatibles y definiciones comunes. Si dos laboratorios llaman de manera diferente a una población celular o utilizan protocolos distintos para medir la misma señal, el sistema puede aprender diferencias instrumentales en lugar de diferencias biológicas reales.

El papel de los laboratorios nacionales estadounidenses

El DOE no participa solo aportando capacidad de cálculo. Sus laboratorios nacionales disponen de instalaciones científicas que permiten caracterizar materiales y estructuras con técnicas difíciles de reproducir en centros pequeños. La nota de octubre del organismo menciona computación a escala de exaflops, rayos X, dispersión de neutrones, microscopía electrónica y experimentación automatizada.

Su implicación se coordina con Genesis Mission, un programa federal de descubrimiento científico asistido por sistemas avanzados. Biohub y sus socios quieren aprovechar esa infraestructura para aumentar tanto el volumen como el detalle de los datos utilizados en modelos biológicos.

Los laboratorios autónomos son especialmente relevantes: un sistema puede proponer una serie de experimentos, activar instrumentos dentro de límites previamente autorizados, recoger resultados y utilizar la información para mejorar una hipótesis. No obstante, la automatización debe pasar controles de seguridad física, calidad y supervisión por investigadores responsables.

En FormateconIA ya analizamos otra estrategia de este ámbito, el laboratorio autónomo anunciado por Danaher para investigar anticuerpos. Son proyectos diferentes y no deben confundirse, pero comparten la idea de que la inteligencia artificial científica necesita conectar cálculos con mediciones y experimentos reales.

Los NIH y el reto de reutilizar información científica anterior

Los Institutos Nacionales de Salud pueden aportar repositorios, bancos de conocimiento y trabajos financiados durante años mediante distintas iniciativas públicas. Su comunicado menciona recursos de la Biblioteca Nacional de Medicina y del Centro Nacional de Información Biotecnológica, además de programas del NIH Common Fund que ya trabajan con atlas biológicos y estándares.

La contribución de estos organismos consiste especialmente en organizar, armonizar y hacer útiles datos existentes. Es una función menos llamativa que entrenar un modelo enorme, pero esencial: sin un esquema común de procedencia y sin documentación experimental, el sistema podría confundir la ausencia de una medida con un resultado negativo.

Algunos datos biomédicos pueden compartirse abiertamente; otros requieren condiciones de acceso por su origen, sus consentimientos o sus restricciones de privacidad. Un proyecto que promete datos abiertos necesita especificar qué se liberará, en qué formato, cuándo y bajo qué condiciones legales. La intención de apertura no significa que todas las bases de datos puedan publicarse sin limitaciones.

Google DeepMind, Meta e Isomorphic Labs: qué aportan y qué no está demostrado

La entrada de estas empresas amplía la dimensión tecnológica del proyecto. Google DeepMind participa en investigación de modelos y aplicaciones científicas; Isomorphic Labs trabaja en descubrimiento de fármacos mediante métodos computacionales; y Meta aporta experiencia en modelos e infraestructura. Según Biohub, las tres organizaciones comprometen en conjunto 300 millones de dólares para tecnologías y conjuntos de datos.

La presencia de compañías con capacidad de entrenar modelos avanzados es relevante, pero el anuncio no acredita que ya exista un modelo biológico universal validado ni que esas organizaciones dispongan de una terapia revolucionaria terminada. Participar en la financiación o en el diseño de una infraestructura no equivale a demostrar eficacia médica.

La colaboración también plantea preguntas legítimas sobre acceso y gobernanza: qué datos recibirán los socios, cuánto tiempo podrían disfrutar de acceso anticipado, qué derechos tendrán los investigadores independientes y cuáles serán los criterios para liberar conjuntos completos. El objetivo declarado es construir un recurso abierto; los detalles de cada liberación deberán comprobarse a medida que se publiquen.

Qué significa «predecir» en biología: un ejemplo práctico

Supongamos que un equipo investiga por qué determinadas células responden mal a un tratamiento. El laboratorio reúne muestras con información genética, proteínas y fotografías de tejidos. Después aplica de forma controlada distintas intervenciones a células cultivadas y registra qué respuestas se producen.

Un modelo bien entrenado podría estimar qué intervención merece investigarse primero. Pero para saber si esa estimación es útil hay que comprobar al menos tres cuestiones: si predice correctamente condiciones nuevas, si distingue correlaciones espurias de relaciones que resisten experimentos y si sus resultados se mantienen cuando cambian las muestras o el laboratorio.

Solo después de esa validación tendría sentido avanzar hacia investigaciones preclínicas o, si corresponde y se cumplen sus requisitos, clínicas. Entre una simulación celular prometedora y un tratamiento aprobado hay numerosas etapas de seguridad, eficacia y reproducibilidad.

El proyecto podría acelerar la selección de hipótesis, pero ninguna comunicación oficial permite afirmar que una enfermedad concreta vaya a curarse como consecuencia directa de esta inversión. Las fechas de desarrollo de modelos y las promesas de descubrimiento son objetivos, no resultados clínicos ya obtenidos.

¿Qué relación tiene con el envejecimiento y las células senescentes?

La biología del envejecimiento depende de muchos procesos interconectados. Entre ellos están los cambios en la función celular, las respuestas inmunitarias, el daño acumulado y la aparición de células senescentes, que han dejado de dividirse de manera estable y pueden influir en su entorno mediante señales moleculares.

Un conjunto de datos que registre numerosas respuestas celulares podría resultar útil para estudiar cómo cambian esas vías en distintas circunstancias. Sin embargo, un modelo general no demostrará por sí solo que determinado compuesto rejuvenece tejidos o prolonga la vida humana. Para eso hacen falta pruebas específicas y resultados reproducibles.

Ya explicamos una aplicación relacionada, aunque independiente, en nuestro artículo sobre RamanOmics y la identificación de células senescentes. Esa investigación trata sobre métodos de medición de células; la Virtual Biology Initiative persigue una infraestructura mucho más amplia para entrenar modelos predictivos. Una técnica que mide mejor y una plataforma que intenta predecir pueden llegar a complementarse, pero eso no significa que los dos proyectos estén colaborando actualmente.

Datos abiertos: una promesa importante que habrá que comprobar

Biohub afirma que su infraestructura pretende convertirse en una base abierta para la comunidad científica. La organización ya ha impulsado recursos como CELLxGENE y el portal de datos de criotomografía electrónica, con la intención de facilitar análisis y reutilización en otros grupos.

Pero un anuncio de apertura no sirve como sustituto de una base de datos descargable y documentada. Para valorar los resultados, los investigadores necesitarán información sobre versiones, cobertura de muestras, métodos de normalización, licencias, restricciones de uso, controles de calidad y políticas de revisión cuando se detecten errores.

También hay una cuestión científica: el modelo ha de evaluarse con experimentos que no formaban parte del entrenamiento. Sin esa separación, puede parecer que predice correctamente cuando en realidad está reconociendo información ya vista. La publicación de conjuntos de evaluación y de resultados negativos sería una señal importante de madurez.

Cuatro riesgos que conviene tener presentes

1. Datos muy grandes, pero poco representativos

Si determinadas poblaciones, tejidos, edades o enfermedades se encuentran infrarrepresentados, el modelo puede fallar al salir del conjunto más estudiado. Más datos no garantiza automáticamente mayor diversidad científica.

2. Confundir una predicción con una causa

Un sistema que acierta al estimar un patrón no necesariamente ha identificado por qué ocurre. Las intervenciones controladas y los experimentos independientes seguirán siendo fundamentales.

3. Privacidad y derechos de los datos

Los datos celulares y genéticos pueden estar vinculados a información humana delicada. Los procedimientos de consentimiento, anonimización y acceso deben adecuarse al origen de cada conjunto, sin asumir que todo material biomédico puede difundirse públicamente.

4. Expectativas desmedidas sobre los plazos

Un proyecto plurianual para crear infraestructura no significa que sus tratamientos estén disponibles en cinco años. La inversión podrá impulsar herramientas de investigación; los beneficios sanitarios concretos deberán demostrarse después.

Lo que puede aprender cualquier equipo que utilice inteligencia artificial

La noticia también ofrece una enseñanza fuera de los laboratorios: la calidad de los datos determina buena parte del valor del modelo. En una empresa, un asistente puede escribir respuestas muy convincentes, pero si el catálogo está desactualizado o faltan registros verificables, las conclusiones serán poco fiables.

Para entender cómo trabajar con estas herramientas de manera crítica pueden consultarse, como recursos formativos generales, nuestro análisis de Inteligencia Artificial para Todos y el de Domina la IA. Ninguno de los dos cursos participa en esta investigación biomédica ni confiere capacitación para desarrollar o utilizar productos sanitarios.

El principio es el mismo que exige cualquier experimento serio: separar lo que se ha medido de lo inferido, mantener la trazabilidad, anotar los límites y no considerar correcto un resultado solo porque una automatización terminó de ejecutarse.

Preguntas frecuentes sobre Biohub y la célula virtual

¿La iniciativa ha creado ya una célula humana virtual universal?

No. Su objetivo es producir y organizar datos que hagan posibles modelos predictivos mucho más completos. La exactitud de esos modelos tendrá que probarse con experimentos independientes.

¿Se han destinado 1.800 millones nuevos en octubre de 2026?

No íntegramente. El anuncio agrega compromisos plurianuales, inversiones previas y recursos de datos o infraestructura. En particular, los NIH coordinan recursos financiados con más de 500 millones de dólares anteriores.

¿Cuándo estarán disponibles los datos?

Biohub declara un objetivo de apertura para la comunidad científica, pero es necesario consultar las publicaciones y condiciones concretas de cada conjunto conforme aparezcan.

¿Podría servir para investigar el cáncer o las enfermedades del envejecimiento?

Potencialmente, sí: una mejor comprensión de las respuestas celulares puede orientar futuras hipótesis. No obstante, el anuncio no acredita curaciones, terapias aprobadas ni resultados clínicos en esas enfermedades.

¿Qué diferencia hay entre una célula virtual y un atlas celular?

Un atlas describe características y distribución de células observadas. Una célula virtual predictiva aspira a estimar cómo cambiaría el sistema bajo intervenciones o condiciones nuevas. La segunda tarea requiere pruebas de predicción adicionales.

Conclusión: el verdadero avance sería saber qué pasará antes de hacer el experimento

La expansión de la Virtual Biology Initiative sitúa una idea ambiciosa en el centro de la investigación: usar inteligencia artificial para simular, con limitaciones bien descritas, algunas respuestas de los sistemas vivos. La colaboración aporta recursos, experiencia y proyectos científicos existentes, pero todavía hay una enorme distancia entre disponer de más datos y predecir con precisión el comportamiento de cualquier célula humana.

La novedad del 7 de octubre de 2026 es el esfuerzo coordinado para construir esa base científica, no el lanzamiento de una medicina milagrosa. Si las mediciones resultan abiertas, diversas y reproducibles, el proyecto podría ayudar a que los investigadores seleccionen mejor sus experimentos y encuentren hipótesis más prometedoras. El éxito se medirá por la validez de esas predicciones, no por lo impresionante de la cifra anunciada.

Fuentes oficiales consultadas

Artículo de divulgación científica. Ni la financiación anunciada ni los modelos propuestos demuestran tratamientos médicos eficaces. La imagen destacada es una composición editorial ilustrativa basada en fotografía de laboratorio y gráficos conceptuales, no una captura de una célula virtual real.