top of page

Meta Holograms Colocam um Rosto Sintético nas Chamadas do Ray-Ban Display

27 de set.
14 min de leitura

Meta Holograms entrará em Acesso Antecipado neste outono, oferecendo aos usuários americanos do Meta Ray-Ban Display um rosto sintético durante chamadas de vídeo no WhatsApp. A primeira versão mostra apenas a pessoa que liga, dos ombros para cima. Mais importante, ela gera essa aparência a partir da voz da pessoa, em vez de capturar seu rosto durante a chamada.

Essa distinção transforma um recurso comum dos óculos em um teste de presença sintética. Quem recebe a chamada vê uma versão digital fotorrealista de quem usa os óculos, com expressões inferidas. A imagem parece um vídeo, mas é gerada por um modelo executado nos servidores da Meta.

A Apple estabeleceu a referência de consumo mais próxima com as Personas do Vision Pro, que representam usuários do headset durante chamadas do FaceTime e de plataformas de conferência compatíveis. A Meta está seguindo outra rota. Ela planeja colocar seu primeiro Hologram de consumo em óculos com aparência cotidiana, usando o WhatsApp como canal inicial de distribuição.

O resultado é mais acessível do que um avatar espacial dentro de um headset, mas também mais ambíguo. A Meta precisa provar que quem liga quer um rosto sintético plausível quando uma transmissão de vídeo normal não está disponível, e que os destinatários conseguem entender o que estão vendo.

Meta Holograms Começa pelo WhatsApp, Não pela Realidade Virtual

A Meta está lançando seu sistema de avatares realistas como uma solução prática para o posicionamento da câmera, e não como um produto completo de telepresença espacial.

A Meta anunciou o Hologram no Connect 2026 como uma das várias novidades do Meta Ray-Ban Display. De acordo com a atualização do Ray-Ban Display da empresa, o recurso começará a ser disponibilizado em Acesso Antecipado nos Estados Unidos no fim deste outono.

O caso de uso inicial é simples. Óculos inteligentes oferecem suporte a chamadas sem as mãos, mas sua câmera voltada para fora não pode fornecer uma visão convencional de quem os usa. A pessoa que liga pode mostrar o que está à frente, mas o destinatário não consegue ver seu rosto.

O Hologram preenche esse ângulo de câmera ausente com um retrato gerado. Antes de fazer chamadas, a pessoa realiza uma breve captura usando o app Meta AI para celular. O processo registra a aparência facial e exemplos do usuário falando de forma expressiva.

Durante uma chamada no WhatsApp, os óculos fornecem um fluxo de áudio em vez de uma visão facial ao vivo. Um modelo generativo de difusão, que cria quadros visuais sintetizando progressivamente detalhes da imagem, é executado nos servidores da Meta. Ele usa a voz para inferir movimentos faciais e envia o vídeo bidimensional resultante ao destinatário.

A descrição pública da Meta afirma que as expressões são inferidas tanto a partir do que alguém diz quanto da forma como a pessoa diz. Isso significa que o modelo não observa cada movimento que retrata. Ele prevê uma performance visual que parece compatível com a fala recebida.

O destinatário não precisa usar óculos nem entrar em um ambiente virtual. O Hologram aparece dentro de uma chamada de vídeo comum do WhatsApp no dispositivo da outra pessoa. Essa ampla compatibilidade é central para a abordagem da Meta.

A primeira versão também traz limitações claras. Segundo reportagens práticas, a captura preserva as roupas e o fundo registrados durante a configuração. Alterar essa apresentação exige outra captura, em vez de uma troca comum de roupa ou ajuste de câmera.

A Meta está explorando entradas adicionais para versões futuras. Dados da unidade de medição inercial dos óculos, ou IMU, poderiam conectar a rotação da cabeça do avatar ao movimento real de quem os usa. A empresa também considera fundos assistidos por câmera e mudanças de roupa geradas.

Nenhuma dessas adições tem data pública de lançamento. A versão de outono continua sendo uma representação dos ombros para cima, controlada por voz, com aparência e ambiente pré-selecionados.

Esse produto limitado ainda representa uma mudança importante. A Meta passou anos exibindo avatares realistas como pesquisa, geralmente em demonstrações associadas à VR. O Hologram leva a ideia a um serviço de comunicação para consumidores com plataforma, mercado e janela de lançamento definidos.

A mudança também separa o produto de seu nome. Nada é projetado no espaço físico para quem recebe uma chamada do Ray-Ban Display. Nesse dispositivo, um Hologram é um retrato em vídeo gerado por IA, projetado para substituir uma câmera frontal ausente.

Por Que a Meta Colocou Primeiro Seu Avatar Realista em Óculos Inteligentes

O Ray-Ban Display dá à Meta um problema delimitado que o vídeo generativo pode resolver antes de a telepresença espacial completa estar pronta.

A pesquisa da Meta sobre avatares realistas tradicionalmente mirou mais alto. Seus trabalhos com Codec Avatars exploraram pessoas fotorrealistas capazes de ocupar ambientes virtuais compartilhados. O objetivo não era apenas uma foto de perfil melhor, mas contato visual, expressão e presença física convincentes à distância.

Um artigo de 2020 sobre Modular Codec Avatars descreveu rostos controlados por câmeras instaladas em um headset de VR. Essa abordagem buscava uma representação tridimensional conectada a comportamentos rastreados.

A primeira versão de consumo do Hologram muda o mecanismo. Ela não exige câmeras voltadas para dentro observando continuamente o rosto de quem usa os óculos. Gera uma saída bidimensional a partir de áudio e de uma identidade capturada anteriormente.

Esse compromisso combina com o Meta Ray-Ban Display. Óculos destinados ao uso público regular precisam permanecer relativamente compactos e socialmente familiares. Preencher sua armação com câmeras adicionais de rastreamento facial criaria diferentes restrições de hardware, energia e design.

A voz já está disponível durante uma chamada. A Meta pode, portanto, usar os microfones como entrada comportamental e transferir o trabalho pesado de geração para seus servidores. Os óculos coletam menos informações faciais durante a conversa porque não conseguem ver diretamente o rosto de quem os usa.

Essa abordagem também dá à Meta uma resposta imediata para uma fraqueza do produto. As chamadas nos óculos atuais podem compartilhar o ponto de vista de quem os usa, algo que funciona bem para mostrar uma cena ou pedir assistência remota. Elas são menos adequadas quando o outro participante quer um contato comum cara a cara.

A Meta ilustra essa lacuna com uma chamada durante o preparo de comida. Alguém usando os óculos pode continuar preparando alimentos enquanto um familiar vê seu rosto digital. Quem liga evita segurar ou posicionar um celular, e o destinatário recebe algo mais próximo de uma conversa em vídeo convencional.

O cenário captura tanto o apelo quanto a incerteza. A comunicação sem as mãos é útil ao cozinhar, consertar equipamentos, caminhar por um espaço de trabalho ou cuidar de uma criança. Porém, um fundo sintético fixo pode ocultar o contexto que torna esses momentos significativos.

O rosto gerado também não mostra necessariamente a expressão literal de quem liga. Tom e linguagem fornecem sinais fortes, mas não capturam cada olhar, distração, reação contida ou acontecimento físico. Portanto, uma saída convincente é uma interpretação do usuário, não uma janela transparente para ele.

A pesquisa da Meta ajuda a explicar por que ela acredita que o áudio pode transmitir mais comportamento do que um sistema convencional de avatares sugere. Em 2025, a empresa descreveu modelos de movimento conversacional treinados para conectar sinais audiovisuais a expressões faciais, gestos e comportamento de escuta.

Essa pesquisa envolveu mais de 4.000 horas de interações entre duas pessoas e mais de 4.000 participantes. Ela sustenta um esforço mais amplo para modelar como fala, movimento e respostas sociais se encaixam.

O Hologram aplica a mesma ideia geral a uma experiência de consumo mais restrita. Em vez de reconstruir apenas o que os sensores medem diretamente, o sistema prevê uma performance expressiva que parece plausível.

É por isso que os óculos inteligentes vêm primeiro. Um celular já tem câmera frontal, portanto substituir sua imagem ao vivo ofereceria menos benefícios práticos. Um headset de VR pode oferecer suporte a rastreamento mais rico, mas também eleva o padrão técnico para uma presença espacial genuína.

O Ray-Ban Display fica entre esses dispositivos. Ele cria uma limitação real para chamadas de vídeo, ao mesmo tempo que permite à Meta lançar uma versão de aparência útil antes de sua visão maior para avatares estar pronta.

Meta Holograms Segue uma Rota Diferente das Apple Personas

A disputa central não é simplesmente Meta contra Apple. É a previsão a partir de sinais escassos versus a reconstrução com sensores dedicados do headset.

O sistema Persona da Apple oferece a comparação mais clara porque também permite que alguém apareça em chamadas enquanto um dispositivo cobre o rosto. A Apple apresentou as Personas com o Vision Pro e depois aprimorou seu realismo e expressão em versões posteriores do visionOS.

Um usuário do Vision Pro cria uma Persona escaneando sua aparência com o headset. Durante uma chamada, o dispositivo rastreia comportamentos faciais e das mãos por meio de seu sistema de sensores. A Apple descreve uma Persona como uma representação espacial que transmite as expressões e os movimentos de quem a usa em tempo real.

As Personas também funcionam além do FaceTime. No lançamento, a Apple disse que os aplicativos compatíveis incluíam Zoom, Cisco Webex e Microsoft Teams. Isso posicionou o recurso como uma camada de comunicação para um headset de computação espacial, e não como um efeito de um único serviço.

Meta Holograms aborda o mesmo problema básico de obstrução, mas parte de hardware diferente. O Meta Ray-Ban Display não cobre o rosto como o Vision Pro. Ele simplesmente não possui uma câmera apontada de volta para quem o usa.

A Apple pode usar um headset rico em sensores para observar comportamentos ocultos pelo dispositivo. A Meta, em vez disso, pede a um modelo executado no servidor que infira comportamentos que seus óculos não conseguem observar diretamente.

A diferença fica mais clara pela configuração e pela saída:

Captura e rastreamento

  • Meta: Um celular captura identidade, expressões, roupas e fundo durante a configuração. O áudio do microfone controla a versão de outono durante as chamadas.

  • Apple: O Vision Pro cria a Persona e usa sensores do headset para animar expressões e movimentos durante o uso.

Destino inicial

  • Meta: Uma representação em vídeo dos ombros para cima aparece em chamadas do WhatsApp recebidas em telas comuns.

  • Apple: Uma representação espacial aparece no FaceTime e em aplicativos de conferência compatíveis.

Contexto de hardware

  • Meta: Quem liga usa óculos de tela mais leves e socialmente familiares, projetados para atividades cotidianas.

  • Apple: Quem liga usa um computador espacial imersivo com amplo hardware de rastreamento.

Compromisso de produto

  • Meta: Hardware de menor atrito exige mais inferência comportamental e geração na nuvem.

  • Apple: Sensoriamento mais rico oferece suporte a comportamentos rastreados mais diretamente, mas exige uma categoria de dispositivo substancialmente diferente.

A Apple continuou aprimorando o resultado visual. A prévia do visionOS 26 destacou perfis mais nítidos, cabelos, cílios e tons de pele mais naturais. Também adicionou controles de configuração aprimorados e experiências espaciais compartilhadas.

Esses refinamentos importam porque semelhanças digitais enfrentam um padrão de qualidade excepcionalmente exigente. Pequenos problemas nos olhos, no timing, no olhar ou no movimento da pele podem chamar mais atenção do que grandes erros em um avatar de desenho animado.

A solução da Meta tenta superar esse limiar ao gerar um formato de vídeo familiar. Em uma análise prática do UploadVR, David Heaney inicialmente confundiu o Hologram de um funcionário da Meta com uma transmissão normal da câmera de selfie. Ele descreveu o resultado como plausível, embora também tenha questionado sua utilidade em uma tela de celular comum.

Essa reação identifica a oportunidade da Meta. O Hologram não precisa reproduzir todos os movimentos perfeitamente para funcionar como uma presença em chamadas casuais. Ele precisa parecer convincente o bastante no tamanho de uma tela de celular, mantendo-se sincronizado com a fala.

Ela também identifica o risco. Um resultado que parece uma transmissão normal de câmera pode ocultar o fato de ser sintético. O Persona da Apple frequentemente parece visivelmente distinto de um vídeo convencional, tornando essa mediação mais fácil de reconhecer.

Portanto, a Meta precisa resolver mais do que fidelidade visual. Ela precisa de uma linguagem clara de interação para uma identidade gerada. Os destinatários devem saber quando uma visualização de câmera real termina e uma performance inferida começa.

Um Rosto Plausível Não É o Mesmo que um Rosto Fiel

A principal conquista técnica do Hologram cria seu mais difícil problema de confiança: quanto melhor ele parece, mais fácil é confundir inferência com observação.

Uma videochamada normal tem muitas falhas. Câmeras recortam a cena, redes perdem quadros, a iluminação distorce a pele e os participantes escolhem o que entra no enquadramento. Ainda assim, permanece a expectativa básica de que a câmera registra a luz da pessoa e do ambiente naquele momento.

Os Meta Holograms mudam essa relação. A saída retrata quem liga, mas sua entrada comportamental imediata é o áudio. O modelo decide como a fala deve aparecer na identidade capturada.

Essa decisão pode funcionar bem durante uma conversa comum. A fala carrega ritmo, tom emocional, ênfase, pausas e outros sinais expressivos. Um modelo treinado pode transformar esses sinais em movimentos labiais e reações faciais convincentes.

No entanto, a voz não consegue especificar completamente o estado de um rosto. Uma pessoa pode sorrir ao dar uma notícia ruim, desviar o olhar durante uma pergunta desconfortável ou reagir silenciosamente a algo fora da chamada. A versão de outono não tem uma visão direta desses momentos.

Assim, o Hologram pode parecer mais atento, expressivo ou composto do que quem está ligando. Ele pode mostrar uma reação estatisticamente adequada em vez da reação real de quem o utiliza.

Essa distinção importa de formas diferentes conforme a situação. Em uma chamada casual com a família, os participantes podem aceitar o avatar como um substituto conveniente. Em uma reunião de trabalho delicada, conversa médica, entrevista ou negociação, uma expressão inferida pode alterar a forma como uma mensagem é recebida.

A Meta não detalhou publicamente todos os controles de divulgação, consentimento, retenção ou moderação associados ao Hologram. O anúncio disponível confirma a geração no servidor e uma configuração personalizada, mas não responde a todas as questões levantadas por essa arquitetura.

Os usuários precisarão de explicações claras sobre o que sai do dispositivo, por quanto tempo os recursos de captura persistem e se podem excluir ou gerar novamente seu modelo. Os destinatários das chamadas também precisam de um sinal evidente de que a imagem é sintética.

A proteção de identidade apresenta outra área ainda não resolvida. Um modelo personalizado capaz de produzir vídeo realista a partir da voz se torna material sensível. A Meta precisa de salvaguardas contra ativação não autorizada, dados de captura copiados, comprometimento de conta e reutilização enganosa fora do fluxo de chamadas pretendido.

O sistema também depende de computação remota. Isso cria questões sobre latência, interrupções de serviço, requisitos de rede e disponibilidade regional. A restrição do Early Access da Meta aos Estados Unidos sugere um primeiro lançamento deliberadamente controlado.

As roupas capturadas e o fundo estático criam problemas sociais menos graves, mas mais imediatos. Quem liga pode aparecer com a camisa de ontem, em um cômodo que já não ocupa ou diante de um fundo que sugere uma localização falsa.

Essas discrepâncias podem lembrar aos destinatários que estão vendo um avatar. Elas também podem gerar confusão se o Hologram se parecer o suficiente com uma transmissão ao vivo para que as pessoas presumam que a cena é atual.

A inclusão visual também merece atenção. Sistemas fotorrealistas precisam representar diferentes rostos, tons de pele, tipos de cabelo, acessórios, padrões de fala e expressões de maneira consistente. Um modelo de desempenho desigual pode fazer alguns usuários parecerem menos fiéis ou menos expressivos do que outros.

O Early Access deve gerar evidências sobre essas questões, mas a Meta não publicou medições independentes amplas de desempenho para o recurso de consumo. Uma demonstração de palco bem-sucedida comprova a viabilidade, não a confiabilidade entre milhões de pessoas e condições não controladas.

O padrão adequado não é saber se o Hologram consegue enganar alguém por alguns instantes. É saber se o sistema continua útil depois que os participantes entendem exatamente como ele funciona.

A confiança dependerá de consistência, divulgação, controle do usuário e expectativas adequadas. O realismo, por si só, não pode oferecer essas qualidades.

Hologramas de Corpo Inteiro Revelam Quanto Trabalho Ainda Resta

O próximo Hologram da Meta parece mais espacial, mas sua arquitetura de lançamento ainda fica aquém da ambição original de copresença da empresa.

A Meta planeja uma versão de corpo inteiro para seus VR Glasses na primavera de 2027. Quando dois usuários ligarem pelo WhatsApp, eles primeiro verão Holograms dentro de uma janela tridimensional. Um controle poderá então posicionar a outra pessoa em tamanho aproximadamente real no espaço do observador.

Essa versão usa mais informações de rastreamento do que o lançamento do Ray-Ban Display. Ela também cria um fluxo estereoscópico, o que significa que cada olho recebe uma imagem ligeiramente diferente para produzir uma sensação de profundidade.

Ainda assim, o produto de lançamento não é uma pessoa volumétrica. Ele não constrói um avatar que o observador possa inspecionar naturalmente por todos os lados. Em vez disso, apresenta um plano de vídeo estereoscópico mascarado que continua voltado para o observador.

A técnica pode parecer atraente enquanto ambos os participantes permanecem em posições favoráveis. A demonstração do UploadVR considerou o resultado eficaz quando as pessoas estavam paradas ou sentadas. A sensação de escala e profundidade fez uma pessoa remota parecer mais próxima de ocupar o ambiente.

O movimento expôs o compromisso. Quando o observador se inclinava ou caminhava lateralmente, o Hologram girava para manter sua visão frontal. O comportamento se assemelhava a um sprite de billboard em um videogame, e não a um corpo com geometria tridimensional estável.

Detalhes finos também pareceram blocados durante a demonstração, particularmente ao redor dos olhos. Engenheiros da Meta teriam apontado o Wi-Fi congestionado do evento como um possível fator, mas o teste público não isolou a causa.

Essas limitações separam o Hologram da promessa anterior da Meta com o Codec Avatar. Os protótipos de pesquisa buscavam reconstruir e animar uma pessoa como uma presença genuinamente tridimensional. As primeiras versões comercializadas, em vez disso, geram fluxos de vídeo otimizados para condições específicas de visualização.

Essa é a inversão central do artigo. A Meta está finalmente se preparando para lançar avatares realistas após anos de pesquisa, mas o faz ao restringir o problema. A empresa não está colocando seu sistema de laboratório mais ambicioso diretamente no hardware de consumo.

O atalho é comercialmente compreensível. Um fluxo de alta qualidade pode oferecer grande parte do impacto visual sem resolver todos os problemas de geometria, reiluminação, olhar, captura e renderização em tempo real.

Ele também pode ajudar a Meta a reunir evidências sobre o que as pessoas valorizam. Os usuários podem se importar mais com rostos reconhecíveis e conversas naturais do que com caminhar ao redor de uma reconstrução volumétrica perfeita. Se for esse o caso, a geração de vídeo poderá se tornar a base prática, e não um substituto temporário.

A Meta afirma que uma versão posterior do Hologram se tornará verdadeiramente volumétrica, oferecerá suporte a conversas em grupo e ficará disponível para desenvolvedores externos. Nenhum cronograma específico acompanha esse compromisso.

A distinção importa para desenvolvedores. Um avatar espacial completo poderia interagir com a geometria de uma aplicação, ocupar posições estáveis e oferecer suporte a experiências além das chamadas. Um fluxo frontal oferece muito menos flexibilidade.

O atual Avatar SDK da Meta, baseado em personagens estilizados, dá suporte a experiências nas quais consistência e animação importam mais do que semelhança exata. Substituí-lo por representações realistas exigiria desempenho previsível, permissões, ferramentas de integração e comportamento consistente em muitas aplicações.

O Hologram ainda não chegou a esse estágio. A versão de 2027 deve ser avaliada como um fluxo de telepresença projetado para hardware da Meta e WhatsApp, não como a conclusão da plataforma mais ampla de avatares da empresa.

Três Sinais Determinarão se o Hologram se Tornará Mais do que uma Demonstração

O próximo teste não é outra apresentação controlada. É saber se a Meta consegue transformar plausibilidade visual em comunicação sustentada e confiável.

O primeiro sinal é o lançamento em Early Access nos Estados Unidos para o Meta Ray-Ban Display. A Meta precisa lançar dentro da janela de outono declarada e mostrar que a configuração, o início de chamadas, a geração e a entrega funcionam fora do Connect.

A confiabilidade será tão importante quanto a qualidade da imagem. Os usuários precisam ser capazes de criar uma semelhança estável sem escaneamentos repetidos, e a transmissão gerada deve permanecer sincronizada em condições normais de rede.

O comportamento dos destinatários oferece a medida de adoção mais reveladora. As pessoas precisam preferir receber um Hologram a continuar com uma chamada de áudio ou ver a câmera externa de quem usa os óculos. Se o recurso parecer desnecessário, constrangedor ou enganoso, o realismo técnico não o salvará.

A Meta também deve deixar claro o status sintético dentro do WhatsApp. Um indicador reconhecível, combinado com controles e explicações acessíveis, reforçaria a ideia de que o Hologram é um modo de comunicação, e não uma imitação de transmissão de câmera.

O segundo sinal é a entrada de movimento. A Meta disse que planeja incorporar a IMU dos óculos para que a rotação real da cabeça possa influenciar o avatar. Essa mudança reduziria a lacuna entre comportamento inferido e observado sem adicionar câmeras voltadas para dentro.

A atualização também revelaria o equilíbrio de longo prazo da Meta entre sensores e geração. Cada entrada medida melhora a fidelidade, mas adiciona requisitos de dados, engenharia e potencialmente energia. Cada movimento previsto preserva a simplicidade, mas aumenta a chance de expressão imprecisa.

O terceiro sinal é o lançamento de corpo inteiro na primavera de 2027. A Meta precisa mostrar que a abordagem estereoscópica funciona de forma consistente em redes domésticas e espaços físicos variados. Ela também deve esclarecer quando, ou sob quais condições, o Hologram se tornará genuinamente volumétrico.

A resposta da Apple fornecerá um contexto útil. Melhorias contínuas no Persona poderiam reforçar o argumento em favor de reconstrução rica em sensores. O progresso da Meta poderia sustentar a ideia concorrente de que modelos generativos podem produzir uma presença convincente com menos entradas e hardware mais familiar.

Para desenvolvedores e compradores corporativos, a lição imediata é cautela. O Hologram ainda não é um serviço geral de avatares, uma plataforma para desenvolvedores ou um substituto para presença visual verificada. É um recurso de WhatsApp com escopo restrito, entrando em uma implementação limitada.

Para consumidores, a escolha será mais pessoal. Um rosto sintético pode tornar chamadas com óculos mãos-livres mais calorosas e familiares. Ele também pode substituir detalhes visuais verdadeiros pela melhor estimativa de um modelo.

Os Meta Holograms só terão sucesso se essa troca parecer válida depois que a novidade passar. Observe se os usuários mantêm o recurso ativado, se os destinatários confiam em sua apresentação e se a Meta conecta mais movimento real ao rosto gerado.

A pergunta decisiva é simples: quando alguém liga usando óculos inteligentes, você quer ver como um modelo acha que essa pessoa se parece ou prefere ouvir sua voz e saber o que continua fora da câmera?

 
 

Comece grátis

Um assistente de IA local-first com gestão de conhecimento pessoal

Para oferecer uma experiência de IA melhor,

atualmente, o remio é compatível apenas com Windows 10+ (x64) e M-Chip Macs.

Seu parceiro de IA no trabalho
Faça mais com o remio

Planeje. Crie. Entregue.
Tudo em um só lugar.

bottom of page