top of page

Los hologramas de Meta ponen un rostro sintético en las llamadas de Ray-Ban Display

27 sept
15 min de lectura

Meta Holograms entrará en Early Access este otoño y ofrecerá a los usuarios estadounidenses de Meta Ray-Ban Display un rostro sintético durante las videollamadas de WhatsApp. La primera versión mostrará únicamente al interlocutor de los hombros hacia arriba. Más importante aún, generará esa apariencia a partir de la voz del interlocutor, en lugar de capturar su rostro durante la llamada.

Esa distinción convierte una función común de las gafas en una prueba de presencia sintética. La persona que recibe la llamada ve una versión digital fotorrealista del usuario, con expresiones inferidas. La imagen parece vídeo, pero la genera un modelo que se ejecuta en los servidores de Meta.

Apple estableció el referente de consumo más cercano con Vision Pro Personas, que representan a los usuarios del headset durante llamadas de FaceTime y conferencias compatibles. Meta sigue una ruta distinta. Planea incorporar su primer Hologram de consumo en unas gafas de aspecto cotidiano y utilizar WhatsApp como canal de distribución inicial.

El resultado es más accesible que un avatar espacial dentro de un headset, pero también más ambiguo. Meta debe demostrar que quienes llaman quieren un rostro sintético verosímil cuando no hay una transmisión de vídeo normal disponible, y que los destinatarios pueden entender lo que están viendo.

Meta Holograms comienza con WhatsApp, no con la realidad virtual

Meta está lanzando su sistema de avatares realistas como una solución práctica para la ubicación de la cámara, no como un producto completo de telepresencia espacial.

Meta anunció Hologram en Connect 2026 como una de varias incorporaciones a Meta Ray-Ban Display. Según la actualización de Ray-Ban Display de la compañía, la función comenzará a implementarse mediante Early Access en Estados Unidos a finales de este otoño.

El caso de uso inicial es sencillo. Las gafas inteligentes permiten realizar llamadas con manos libres, pero su cámara orientada hacia el exterior no puede ofrecer una vista convencional del usuario. Quien llama puede mostrar a otra persona lo que tiene delante, pero el destinatario no puede ver su rostro.

Hologram cubre ese ángulo de cámara ausente con un retrato generado. El usuario realiza una breve captura con la aplicación móvil Meta AI antes de hacer llamadas. El proceso registra la apariencia facial y ejemplos del usuario hablando de manera expresiva.

Durante una llamada de WhatsApp, las gafas proporcionan un flujo de audio en lugar de una vista facial en directo. Un modelo de difusión generativa, que crea fotogramas visuales sintetizando progresivamente detalles de imagen, se ejecuta en los servidores de Meta. Utiliza la voz para inferir movimientos faciales y envía al destinatario el vídeo bidimensional resultante.

La descripción pública de Meta indica que las expresiones se infieren tanto de lo que dice quien llama como de cómo lo dice. Esto significa que el modelo no observa cada movimiento que representa. Predice una interpretación visual que parece compatible con el habla entrante.

El destinatario no necesita llevar gafas ni entrar en un entorno virtual. El Hologram aparece dentro de una videollamada normal de WhatsApp en el dispositivo de la otra persona. Esa amplia compatibilidad es fundamental para el enfoque de Meta.

La primera versión también presenta limitaciones claras. Según informes de uso práctico, la captura conserva la ropa y el fondo registrados durante la configuración. Cambiar esa presentación requiere otra captura, en lugar de un cambio de vestuario normal o un ajuste de cámara.

Meta está explorando entradas adicionales para versiones posteriores. Los datos de la unidad de medición inercial de las gafas, o IMU, podrían vincular la rotación de la cabeza del avatar con el movimiento real del usuario. La compañía también estudia fondos asistidos por cámara y cambios de ropa generados.

Ninguna de esas incorporaciones tiene una fecha pública de lanzamiento. La versión de otoño sigue siendo una representación de hombros hacia arriba, controlada por voz, con una apariencia y un entorno preseleccionados.

Este producto limitado sigue suponiendo un cambio importante. Meta ha pasado años mostrando avatares realistas como investigación, normalmente en demostraciones asociadas a la realidad virtual. Hologram traslada la idea a un servicio de comunicación para consumidores con una plataforma, mercado y ventana de lanzamiento definidos.

El movimiento también separa el producto de su nombre. No se proyecta nada en el espacio físico para la persona que recibe una llamada de Ray-Ban Display. En ese dispositivo, un Hologram es un retrato de vídeo generado por IA diseñado para sustituir la ausencia de una cámara frontal.

Por qué Meta incorporó primero su avatar realista en gafas inteligentes

Ray-Ban Display plantea a Meta un problema acotado que el vídeo generativo puede resolver antes de que la telepresencia espacial completa esté lista.

La investigación de Meta sobre avatares realistas tradicionalmente ha apuntado más alto. Sus trabajos sobre Codec Avatars exploraron personas fotorrealistas que podían ocupar entornos virtuales compartidos. El objetivo no era simplemente una mejor foto de perfil, sino un contacto visual, expresiones y presencia física convincentes a distancia.

Un artículo de 2020 sobre Modular Codec Avatars describía rostros controlados por cámaras montadas en un headset de realidad virtual. Ese enfoque buscaba una representación tridimensional conectada a comportamientos rastreados.

La primera versión de consumo de Hologram cambia el mecanismo. No requiere cámaras orientadas hacia el interior para observar continuamente el rostro del usuario. Genera una salida bidimensional a partir de audio y una identidad capturada previamente.

Ese compromiso encaja con Meta Ray-Ban Display. Las gafas destinadas al uso público habitual deben seguir siendo relativamente compactas y socialmente familiares. Llenar su montura con cámaras adicionales de seguimiento facial impondría otras restricciones de hardware, energía y diseño.

La voz ya está disponible durante una llamada. Por tanto, Meta puede utilizar los micrófonos como entrada conductual y trasladar el costoso trabajo de generación a sus servidores. Las gafas recopilan menos información facial durante la conversación porque no pueden ver directamente al usuario.

Este enfoque también ofrece a Meta una respuesta inmediata a una debilidad del producto. Las llamadas con gafas actuales pueden compartir el punto de vista del usuario, lo que funciona bien para mostrar una escena o solicitar asistencia remota. Son menos adecuadas cuando el otro participante quiere un contacto cara a cara convencional.

Meta ilustra esa brecha con una llamada mientras se cocina. Alguien que lleva las gafas puede seguir preparando comida mientras un familiar ve su rostro digital. Quien llama evita sostener o colocar un teléfono, y el destinatario obtiene algo más cercano a una videoconversación convencional.

El escenario recoge tanto el atractivo como la incertidumbre. La comunicación con manos libres resulta útil al cocinar, reparar equipos, recorrer un espacio de trabajo o cuidar de un niño. Sin embargo, un fondo sintético fijo puede ocultar el contexto que hace significativos esos momentos.

El rostro generado tampoco muestra necesariamente la expresión literal de quien llama. El tono y el lenguaje proporcionan señales sólidas, pero no pueden captar cada mirada, distracción, reacción contenida o acontecimiento físico. Por tanto, una salida convincente es una interpretación del usuario, no una ventana transparente hacia él.

La investigación de Meta ayuda a explicar por qué cree que el audio puede transmitir más comportamiento de lo que sugiere un sistema convencional de avatares. En 2025, la compañía describió modelos de movimiento conversacional entrenados para conectar señales audiovisuales con expresiones faciales, gestos y conductas de escucha.

Esa investigación involucró más de 4.000 horas de interacciones entre dos personas y más de 4.000 participantes. Respalda un esfuerzo más amplio por modelar cómo encajan el habla, el movimiento y las respuestas sociales.

Hologram aplica la misma idea general a una experiencia de consumo más acotada. En lugar de reconstruir únicamente lo que los sensores miden directamente, el sistema predice una interpretación expresiva que parece plausible.

Por eso las gafas inteligentes llegan primero. Un teléfono ya tiene una cámara frontal, por lo que sustituir su imagen en directo ofrecería menos beneficios prácticos. Un headset de realidad virtual puede admitir un seguimiento más rico, pero también eleva el listón técnico para una presencia espacial genuina.

Ray-Ban Display se sitúa entre esos dispositivos. Crea una limitación real para las videollamadas y, al mismo tiempo, permite a Meta lanzar una versión de apariencia útil antes de que esté lista su visión más amplia de los avatares.

Meta Holograms sigue una ruta distinta a Apple Personas

La competencia central no es simplemente Meta contra Apple. Es la predicción a partir de señales escasas frente a la reconstrucción con sensores dedicados de un headset.

El sistema Persona de Apple ofrece la comparación más clara porque también permite que una persona aparezca en llamadas mientras un dispositivo cubre su rostro. Apple presentó Personas con Vision Pro y posteriormente mejoró su realismo y expresividad mediante versiones posteriores de visionOS.

Un usuario de Vision Pro crea una Persona escaneando su apariencia con el headset. Durante una llamada, el dispositivo rastrea el comportamiento facial y de las manos mediante su sistema de sensores. Apple describe una Persona como una representación espacial que transmite las expresiones y movimientos del usuario en tiempo real.

Personas también funciona más allá de FaceTime. Apple afirmó en el lanzamiento que las aplicaciones compatibles incluían Zoom, Cisco Webex y Microsoft Teams. Esto posicionó la función como una capa de comunicación para un headset de computación espacial, en lugar de un efecto de un único servicio.

Meta Holograms aborda el mismo problema básico de obstrucción, pero parte de hardware diferente. Meta Ray-Ban Display no cubre el rostro como Vision Pro. Simplemente carece de una cámara orientada hacia el usuario.

Apple puede utilizar un headset rico en sensores para observar el comportamiento oculto tras el dispositivo. Meta, en cambio, pide a un modelo del lado del servidor que infiera comportamientos que sus gafas no pueden observar directamente.

La diferencia se hace más clara mediante la configuración y la salida:

Captura y seguimiento

  • Meta: Un teléfono captura la identidad, las expresiones, la ropa y el fondo durante la configuración. El audio del micrófono controla la versión de otoño durante las llamadas.

  • Apple: Vision Pro crea la Persona y utiliza sensores del headset para animar las expresiones y el movimiento durante el uso.

Destino inicial

  • Meta: Una representación de vídeo de hombros hacia arriba aparece en llamadas de WhatsApp recibidas en pantallas convencionales.

  • Apple: Una representación espacial aparece en FaceTime y aplicaciones de conferencia compatibles.

Contexto de hardware

  • Meta: Quien llama lleva gafas de pantalla más ligeras y socialmente familiares, diseñadas para usarse en actividades cotidianas.

  • Apple: Quien llama lleva un ordenador espacial inmersivo con amplio hardware de seguimiento.

Compromiso de producto

  • Meta: El hardware de menor fricción exige más inferencia conductual y generación en la nube.

  • Apple: Una detección más rica permite comportamientos rastreados más directamente, pero exige una categoría de dispositivo sustancialmente diferente.

Apple ha seguido mejorando el resultado visual. Su vista previa de visionOS 26 destacó perfiles más nítidos, cabello, pestañas y tonos de piel más naturales. También añadió controles de configuración mejorados y experiencias espaciales compartidas.

Esos refinamientos importan porque las semejanzas digitales afrontan un umbral de calidad especialmente exigente. Problemas menores en los ojos, la sincronización, la mirada o el movimiento de la piel pueden atraer más atención que errores grandes en un avatar caricaturesco.

La solución de Meta intenta superar ese umbral generando un formato de vídeo familiar. En una prueba práctica de UploadVR, David Heaney confundió inicialmente el Hologram de un empleado de Meta con una transmisión normal de cámara selfie. Describió el resultado como plausible, aunque también cuestionó su utilidad en una pantalla de teléfono convencional.

Esa reacción identifica la oportunidad de Meta. Hologram no necesita reproducir cada movimiento a la perfección para funcionar como presencia en una llamada informal. Debe parecer lo bastante creíble al tamaño de una pantalla de teléfono y mantenerse sincronizado con el habla.

También identifica el riesgo. Un resultado que parece una transmisión normal de cámara puede ocultar el hecho de que es sintético. Persona de Apple a menudo ha tenido un aspecto visiblemente distinto al vídeo convencional, lo que facilita reconocer esa mediación.

Por tanto, Meta debe resolver algo más que la fidelidad visual. Necesita un lenguaje de interacción claro para una identidad generada. Los destinatarios deben saber cuándo termina una vista de cámara real y comienza una interpretación inferida.

Un rostro plausible no es lo mismo que un rostro fiel

El principal logro técnico de Hologram crea su problema de confianza más difícil: cuanto mejor se ve, más fácil resulta confundir una inferencia con una observación.

Una videollamada normal tiene muchos defectos. Las cámaras recortan la escena, las redes pierden fotogramas, la iluminación distorsiona la piel y los participantes eligen qué entra en el encuadre. Sin embargo, se mantiene la expectativa básica de que la cámara registra la luz de la persona y su entorno en ese momento.

Los Holograms de Meta cambian esa relación. El resultado representa a quien llama, pero su entrada conductual inmediata es el audio. El modelo decide cómo debería verse el habla en la identidad capturada.

Esa decisión puede funcionar bien durante una conversación normal. El habla transmite ritmo, tono emocional, énfasis, pausas y otras señales expresivas. Un modelo entrenado puede convertir esas señales en movimientos labiales y respuestas faciales convincentes.

Sin embargo, la voz no puede especificar por completo el estado de un rostro. Una persona puede sonreír al comunicar malas noticias, apartar la mirada ante una pregunta incómoda o reaccionar en silencio ante algo fuera de la llamada. La versión de otoño no tiene una vista directa de esos momentos.

Por tanto, el Hologram puede parecer más atento, expresivo o sereno que quien llama. Puede mostrar una reacción estadísticamente adecuada en lugar de la reacción real de quien lleva el dispositivo.

Esta distinción importa de forma diferente según la situación. Durante una llamada familiar informal, los participantes podrían aceptar el avatar como un sustituto práctico. En una reunión de trabajo delicada, una conversación médica, una entrevista o una negociación, la expresión inferida puede cambiar la forma en que se recibe un mensaje.

Meta no ha detallado públicamente todos los controles de divulgación, consentimiento, retención o moderación asociados con Hologram. El anuncio disponible confirma la generación del lado del servidor y una configuración personalizada, pero no responde todas las preguntas que plantea esa arquitectura.

Los usuarios necesitarán explicaciones claras sobre qué sale del dispositivo, durante cuánto tiempo persisten los recursos de captura y si pueden eliminar o regenerar su modelo. Los destinatarios de las llamadas también necesitan una señal evidente de que la imagen es sintética.

La protección de la identidad presenta otra área sin resolver. Un modelo personalizado capaz de producir vídeo realista a partir de la voz se convierte en material sensible. Meta necesita salvaguardas contra la activación no autorizada, los datos de captura copiados, el compromiso de cuentas y la reutilización engañosa fuera del flujo de llamadas previsto.

El sistema también depende de computación remota. Eso plantea preguntas sobre latencia, interrupciones del servicio, requisitos de red y disponibilidad regional. La restricción de Early Access de Meta a Estados Unidos sugiere un primer lanzamiento deliberadamente controlado.

La ropa capturada y el fondo estático generan problemas sociales menos graves, pero más inmediatos. Quien llama podría aparecer con la camiseta de ayer, en una habitación que ya no ocupa o ante un fondo que sugiera una ubicación falsa.

Estos desajustes podrían recordar a los destinatarios que están viendo un avatar. También podrían crear confusión si Hologram se parece lo suficiente a una transmisión en directo como para que la gente suponga que la escena es actual.

La inclusión visual también merece atención. Los sistemas fotorrealistas deben representar de forma coherente distintos rostros, tonos de piel, tipos de cabello, accesorios, patrones de habla y expresiones. Un modelo con resultados desiguales puede hacer que algunos usuarios parezcan menos precisos o menos expresivos que otros.

Early Access debería generar evidencia sobre estas cuestiones, pero Meta no ha publicado mediciones independientes amplias del rendimiento de esta función para consumidores. Una demostración exitosa en un escenario establece viabilidad, no fiabilidad entre millones de personas y condiciones no controladas.

El criterio correcto no es si Hologram puede engañar brevemente a alguien. Es si el sistema sigue siendo útil después de que los participantes entiendan exactamente cómo funciona.

La confianza dependerá de la coherencia, la divulgación, el control del usuario y expectativas adecuadas. El realismo por sí solo no puede proporcionar esas cualidades.

Los Holograms de cuerpo completo revelan cuánto trabajo queda por hacer

El próximo Hologram de Meta parece más espacial, pero su arquitectura de lanzamiento todavía se queda corta frente a la ambición original de copresencia de la empresa.

Meta planea una versión de cuerpo completo para sus VR Glasses en la primavera de 2027. Cuando dos usuarios llamen mediante WhatsApp, primero verán Holograms dentro de una ventana tridimensional. Un control podrá situar a la otra persona aproximadamente a tamaño real en el espacio del espectador.

Esta versión utiliza más información de seguimiento que el lanzamiento de Ray-Ban Display. También crea una transmisión estereoscópica, lo que significa que cada ojo recibe una imagen ligeramente diferente para producir sensación de profundidad.

Sin embargo, el producto de lanzamiento no es una persona volumétrica. No construye un avatar que el espectador pueda inspeccionar con naturalidad desde todos los lados. En su lugar, presenta un plano de vídeo estereoscópico enmascarado que sigue orientado hacia el observador.

La técnica puede resultar convincente mientras ambos participantes permanecen en posiciones favorables. La demostración de UploadVR consideró efectivo el resultado al permanecer de pie o sentado. La sensación de escala y profundidad hacía que una persona remota pareciera más cerca de ocupar la habitación.

El movimiento expuso la concesión. Cuando el observador se inclinaba o caminaba lateralmente, el Hologram rotaba para mantener su vista frontal. El comportamiento se parecía a un sprite de cartel publicitario en un videojuego, en lugar de a un cuerpo con geometría tridimensional estable.

Los detalles finos también parecían pixelados durante la demostración, especialmente alrededor de los ojos. Según se informa, los ingenieros de Meta señalaron el Wi-Fi congestionado del evento como un posible factor, pero la prueba pública no aisló la causa.

Estas limitaciones separan Hologram de la promesa anterior de Codec Avatar de Meta. Los prototipos de investigación pretendían reconstruir y animar a una persona como una presencia verdaderamente tridimensional. Las primeras versiones comerciales generan, en cambio, transmisiones de vídeo optimizadas para condiciones de visualización concretas.

Esa es la inversión central del artículo. Meta por fin se prepara para comercializar avatares realistas tras años de investigación, pero lo hace acotando el problema. La empresa no está incorporando directamente a hardware de consumo su sistema de laboratorio más ambicioso.

El atajo es comercialmente comprensible. Una transmisión de alta calidad puede ofrecer gran parte del impacto visual sin resolver todos los problemas de geometría, reiluminación, mirada, captura y renderizado en tiempo real.

También puede ayudar a Meta a recopilar evidencia sobre lo que valoran las personas. Los usuarios podrían preocuparse más por rostros reconocibles y una conversación natural que por caminar alrededor de una reconstrucción volumétrica perfecta. De ser así, la generación de vídeo podría convertirse en la base práctica en lugar de un sustituto temporal.

Meta afirma que una versión posterior de Hologram será realmente volumétrica, admitirá conversaciones grupales y estará disponible para desarrolladores externos. No acompaña ese compromiso de un calendario específico.

La distinción importa para los desarrolladores. Un avatar espacial completo podría interactuar con la geometría de una aplicación, ocupar posiciones estables y admitir experiencias más allá de las llamadas. Una transmisión frontal ofrece mucha menos flexibilidad.

El actual Avatar SDK de Meta, basado en personajes estilizados, permite experiencias en las que la coherencia y la animación importan más que el parecido exacto. Sustituirlo por representaciones realistas requeriría rendimiento predecible, permisos, herramientas de integración y comportamiento coherente en muchas aplicaciones.

Hologram aún no ha llegado a esa etapa. La versión de 2027 debe juzgarse como una transmisión de telepresencia diseñada para hardware de Meta y WhatsApp, no como la culminación de la plataforma de avatares más amplia de la empresa.

Tres señales decidirán si Hologram se convierte en algo más que una demostración

La siguiente prueba no es otra presentación controlada. Es si Meta puede convertir la plausibilidad visual en una comunicación sostenida y confiable.

La primera señal es el despliegue de US Early Access en Meta Ray-Ban Display. Meta debe lanzar dentro de su ventana de otoño anunciada y demostrar que la configuración, el inicio de llamadas, la generación y la entrega funcionan fuera de Connect.

La fiabilidad importará tanto como la calidad de imagen. Los usuarios deben poder crear una apariencia estable sin escaneos repetidos, y la transmisión generada debe mantenerse sincronizada en condiciones normales de red.

El comportamiento de los destinatarios ofrece la medida de adopción más reveladora. Las personas deben preferir recibir un Hologram antes que continuar con una llamada de audio o ver la cámara exterior de quien lleva el dispositivo. Si la función parece innecesaria, incómoda o engañosa, el realismo técnico no la rescatará.

Meta también debería dejar claro el estado sintético dentro de WhatsApp. Un indicador reconocible, combinado con controles y explicaciones accesibles, reforzaría la idea de que Hologram es un modo de comunicación y no una imitación de transmisión de cámara.

La segunda señal es la entrada de movimiento. Meta ha afirmado que planea incorporar la IMU de las gafas para que la rotación real de la cabeza pueda influir en el avatar. Ese cambio reduciría la brecha entre el comportamiento inferido y el observado sin añadir cámaras orientadas hacia el interior.

La actualización también revelaría el equilibrio a largo plazo de Meta entre sensores y generación. Cada entrada medida mejora la fidelidad, pero añade requisitos de datos, ingeniería y, potencialmente, energía. Cada movimiento predicho conserva la simplicidad, pero incrementa la posibilidad de una expresión imprecisa.

La tercera señal es el lanzamiento de cuerpo completo en la primavera de 2027. Meta debe demostrar que el enfoque estereoscópico funciona de forma consistente en redes domésticas y espacios físicos variados. También debería aclarar cuándo, o en qué condiciones, Hologram se volverá realmente volumétrico.

La respuesta de Apple aportará un contexto útil. Las mejoras continuas de Persona podrían reforzar el argumento a favor de la reconstrucción rica en sensores. El progreso de Meta podría respaldar la idea competidora de que los modelos generativos pueden producir una presencia convincente con menos entradas y hardware más familiar.

Para desarrolladores y compradores empresariales, la lección inmediata es cautela. Hologram todavía no es un servicio general de avatares, una plataforma para desarrolladores ni un sustituto de una presencia visual verificada. Es una función de WhatsApp de alcance limitado que entra en un despliegue restringido.

Para los consumidores, la elección será más personal. Un rostro sintético puede hacer que las llamadas con gafas manos libres sean más cálidas y familiares. También puede sustituir detalles visuales veraces por la mejor estimación de un modelo.

Meta Holograms solo tendrá éxito si ese intercambio parece valioso después de que se desvanezca la novedad. Observe si los usuarios mantienen la función activada, si los destinatarios confían en su presentación y si Meta conecta más movimiento real con el rostro generado.

La pregunta definitoria es simple: cuando alguien llama desde unas gafas inteligentes, ¿quiere ver cómo un modelo cree que se ve, o preferiría escuchar su voz y saber qué permanece fuera de cámara?

 
 

Empieza gratis

Un asistente de IA local-first con gestión del conocimiento personal

Para ofrecer una mejor experiencia con la IA,

actualmente remio solo es compatible con Windows 10+ (x64) y M-Chip Macs.

Tu aliado de IA para el trabajo
Haz más con remio

Planifica. Crea. Entrega.
Todo en un solo lugar.

bottom of page