Meta Holograms 为 Ray-Ban Display 通话配上合成面孔
Meta Holograms 将于今年秋季进入 Early Access,为美国 Meta Ray-Ban Display 用户在 WhatsApp 视频通话中提供合成面孔。首个版本仅展示来电者肩部以上的形象。更重要的是,它依据来电者的声音生成这一形象,而非在通话过程中捕捉其面部。
这种差异将一项普通的眼镜功能变成了对合成临场感的测试。接听者看到的是佩戴者的照片级真实数字版本,其中包含推断生成的表情。画面看起来像视频,但实际由运行在 Meta 服务器上的模型生成。
Apple 已通过 Vision Pro Personas 建立了最接近的消费级参照,其功能可在 FaceTime 和受支持的会议通话中呈现头显佩戴者。Meta 则选择了不同路线。该公司计划将首个面向消费者的 Hologram 功能置于日常外观的眼镜中,并以 WhatsApp 作为初始分发渠道。
这一结果比头显中的空间虚拟形象更易使用,但也更具模糊性。Meta 必须证明:当普通视频画面不可用时,通话者是否愿意使用可信的合成面孔;接听者又能否理解自己所看到的内容。
Meta Holograms 从 WhatsApp 而非虚拟现实开始
Meta 将其逼真虚拟形象系统定位为解决摄像头位置问题的实用方案,而非完整的空间远程临场产品。
Meta 在 Connect 2026 上宣布 Hologram,它是 Meta Ray-Ban Display 的多项新增功能之一。根据该公司的 Ray-Ban Display 更新公告,该功能将于今年秋季晚些时候通过 Early Access 在美国开始逐步推出。
最初的使用场景很直接。智能眼镜支持免手持通话,但其朝外的摄像头无法提供佩戴者的常规视角。来电者可以向对方展示前方所见,但接听者看不到来电者的脸。
Hologram 通过生成的人像填补这一缺失的摄像头角度。佩戴者需要在拨打电话前,使用 Meta AI 手机应用完成一次简短采集。该过程会记录面部外观,以及用户进行富有表情的讲话时的样本。
在 WhatsApp 通话期间,眼镜提供的是音频流,而非实时面部画面。一种生成式扩散模型——通过逐步合成图像细节来创建视觉帧——运行在 Meta 的服务器上。该模型利用声音推断面部动作,并将生成的二维视频发送给接听者。
Meta 的公开说明称,表情同时根据来电者所说的内容以及说话方式进行推断。这意味着模型并不会观察它所呈现的每一个动作,而是预测一段看似与传入语音相符的视觉表演。
接听者无需佩戴眼镜,也无需进入虚拟环境。Hologram 会出现在对方设备上的常规 WhatsApp 视频通话中。这种广泛兼容性是 Meta 方案的核心。
首个版本也存在明确限制。据实际上手报道,采集会保留设置期间录制的服装和背景。如需改变这一呈现效果,必须重新采集,而不能像普通场景那样更换服装或调整摄像头。
Meta 正在探索后续版本的额外输入。眼镜惯性测量单元(IMU)的数据可能将虚拟形象的头部旋转与佩戴者的真实动作关联起来。该公司也在考虑摄像头辅助背景和生成式服装变化。
这些新增功能均未公布上线日期。今年秋季的版本仍将是一个肩部以上、由语音驱动的形象,拥有预先选定的外观和环境。
这一有限的产品仍然是一项重要变化。Meta 多年来一直将逼真虚拟形象作为研究成果展示,通常出现在与 VR 相关的演示中。Hologram 则将这一理念带入了具有明确平台、市场和发布时间窗口的消费级通信服务。
这一转变也使产品与其名称有所区分。对于接听 Ray-Ban Display 通话的人而言,并没有任何内容投射到物理空间中。在该设备上,Hologram 是一种 AI 生成的视频人像,旨在替代缺失的自拍摄像头。
Meta 为何先将逼真虚拟形象放入智能眼镜
Ray-Ban Display 为 Meta 提供了一个受限的问题,而生成式视频可在完整空间远程临场技术成熟前解决它。
Meta 的逼真虚拟形象研究历来目标更高。其 Codec Avatars 项目探索了可置身于共享虚拟环境中的照片级真实人物。目标不仅是更好的个人资料图片,而是在远距离交流中实现令人信服的眼神交流、表情和实体临场感。
一篇关于 Modular Codec Avatars 的 2020 年论文描述了由安装在 VR 头显上的摄像头驱动的面部。这种方法追求与追踪行为相连的三维呈现。
Hologram 的首个消费版本改变了这一机制。它不需要内向摄像头持续观察佩戴者的脸部,而是根据音频和此前采集的身份信息生成二维输出。
这种妥协适合 Meta Ray-Ban Display。面向日常公共使用的眼镜必须保持相对紧凑,并具备人们熟悉的社交外观。若在镜架中填入额外的面部追踪摄像头,将带来不同的硬件、续航和设计限制。
通话时语音本就可用。因此,Meta 可以将麦克风用作行为输入,并将昂贵的生成工作转移至服务器。由于眼镜无法直接看到佩戴者的脸,它们在对话中采集的面部信息更少。
这种方法也让 Meta 能立即回应一项产品弱点。现有眼镜通话能够分享佩戴者的视角,这很适合展示场景或寻求远程协助。但当另一位参与者希望进行普通的面对面交流时,它们就不那么适用。
Meta 以烹饪通话说明这种缺口。佩戴眼镜的人可以继续准备食物,同时家人看到其数字面孔。来电者无需手持或摆放手机,接听者则能获得更接近传统视频对话的体验。
这一场景同时体现了吸引力与不确定性。做饭、维修设备、穿行于工作场所或照顾孩子时,免手持通信确实有用。然而,固定的合成背景可能掩盖让这些时刻富有意义的语境。
生成的面孔也不一定展示来电者真实的字面表情。语气和语言提供了强烈信号,但无法捕捉每一次瞥视、分心、被压抑的反应或身体发生的事件。因此,可信的输出是对用户的一种诠释,而非通向用户的透明窗口。
Meta 的研究有助于说明为何该公司相信音频能够承载比传统虚拟形象系统所暗示的更多行为信息。2025 年,该公司介绍了 对话动作模型,这些模型经过训练,可将视听信号与面部表情、手势和倾听行为关联起来。
该研究涉及超过 4,000 小时的双人互动及 4,000 多名参与者。它支持了一项更广泛的工作,即建模语音、动作和社交反应如何彼此契合。
Hologram 将同一总体思路应用于更狭窄的消费级体验。系统并非只重建传感器直接测得的内容,而是预测一段看起来可信的富有表情的呈现。
这就是智能眼镜优先的原因。手机已经拥有前置摄像头,因此替换其实时画面带来的实际好处较少。VR 头显可以支持更丰富的追踪,但也为真正的空间临场感设立了更高的技术门槛。
Ray-Ban Display 处于这两类设备之间。它制造了真实的视频通话限制,同时让 Meta 能够在其更宏大的虚拟形象愿景准备就绪前推出一个看起来实用的版本。
Meta Holograms 选择了不同于 Apple Personas 的路线
核心竞争并不只是 Meta 对阵 Apple,而是从稀疏信号进行预测,与通过专用头显传感器进行重建之间的差异。
Apple 的 Persona 系统提供了最清晰的对比,因为它同样能让用户在设备遮挡面部时出现在通话中。Apple 随 Vision Pro 推出 Personas,随后在后续 visionOS 版本中提升了其真实感和表情表现。
Vision Pro 用户可通过头显扫描自己的外观来创建 Persona。通话期间,设备通过传感器系统追踪面部和手部行为。Apple 将 Persona 描述为一种空间呈现,可实时传达佩戴者的表情和动作。
Personas 的适用范围也不限于 FaceTime。Apple 在发布时表示,受支持的应用包括 Zoom、Cisco Webex 和 Microsoft Teams。这使该功能成为空间计算头显的通信层,而非单一服务中的效果。
Meta Holograms 解决的是相同的基础遮挡问题,但起点是不同的硬件。Meta Ray-Ban Display 不像 Vision Pro 那样遮挡面部;它只是缺少一枚朝向佩戴者的摄像头。
Apple 可以利用传感器丰富的头显观察被设备遮挡的行为。Meta 则让服务器端模型推断眼镜无法直接观察到的行为。
通过设置和输出可以更清楚地看出这一差异:
采集与追踪
Meta:手机在设置期间采集身份、表情、服装和背景。秋季版本在通话中由麦克风音频驱动。
Apple:Vision Pro 创建 Persona,并在使用期间通过头显传感器为表情和动作制作动画。
初始目的地
Meta:肩部以上的视频呈现出现在普通屏幕接收的 WhatsApp 通话中。
Apple:空间呈现出现在 FaceTime 和受支持的会议应用中。
硬件语境
Meta:来电者佩戴更轻、在社交上更熟悉的显示眼镜,旨在覆盖日常活动场景。
Apple:来电者佩戴拥有广泛追踪硬件的沉浸式空间计算机。
产品权衡
Meta:低摩擦硬件需要更多行为推断和云端生成。
Apple:更丰富的感知支持更直接追踪的行为,但需要一种截然不同的设备类别。
Apple 持续改善视觉效果。其 visionOS 26 预览 突出了更清晰的侧脸轮廓、更自然的头发、睫毛和肤色。它还增加了改进的设置控制和共享空间体验。
这些改进至关重要,因为数字肖像面临异常苛刻的质量门槛。眼睛、时序、注视方向或皮肤运动中的微小问题,可能比卡通虚拟形象中的重大错误更容易引起注意。
Meta 的解决方案试图通过生成一种熟悉的视频形式跨越这一门槛。在一篇 UploadVR 上手体验中,David Heaney 起初将一名 Meta 员工的 Hologram 误认为普通的自拍摄像头画面。他认为输出效果颇为可信,但也质疑其在普通手机屏幕上的实用性。
这一反应揭示了 Meta 的机会。Hologram 不必完美复现每个动作,便能作为轻松通话中的替身存在。它需要在手机屏幕尺寸下看起来足够真实,同时与语音保持同步。
这也揭示了风险。看起来像普通摄像头画面的结果,可能掩盖其为合成内容这一事实。Apple 的 Persona 往往与传统视频有明显区别,因此更容易识别其经过了中介处理。
因此,Meta 需要解决的不只是视觉保真度。它还需要为生成式身份建立清晰的交互语言。接收者应当知道,真实摄像头画面何时结束,推断生成的表演何时开始。
可信的面孔不等于忠实的面孔
Hologram 最重要的技术成就也带来了最棘手的信任问题:它看起来越逼真,人们就越容易将推断误认为观察。
普通视频通话存在许多缺陷。摄像头会裁切场景,网络会丢帧,光线会扭曲肤色,参与者也会自行决定哪些内容进入画面。但人们的基本预期依然是,摄像头记录的是当下来自人物和周围环境的光线。
Meta Holograms 改变了这种关系。输出内容描绘的是来电者,但其即时行为输入是音频。模型决定捕捉到的身份应如何随着语音呈现。
这种决策在日常对话中可能效果良好。语音携带节奏、情绪语调、重音、停顿及其他表达线索。经过训练的模型可以将这些信号转化为令人信服的嘴唇动作和面部反应。
然而,声音无法完整说明一张脸的状态。一个人可以在传达坏消息时微笑,在面对令人不适的问题时移开目光,或对通话外发生的事情作出无声反应。秋季版本无法直接看到这些瞬间。
因此,Hologram 可能显得比来电者本人更专注、更富表情或更镇定。它展示的可能是统计上合适的反应,而非佩戴者真实的反应。
这种区别在不同场景中的重要性也不同。在轻松的家庭通话中,参与者或许会接受这个头像作为方便的替身。但在敏感的职场会议、医疗交流、面试或谈判中,推断出的表情可能改变信息被理解的方式。
Meta 尚未公开详述与 Hologram 相关的每一项披露、同意、留存或审核控制机制。现有公告确认了服务器端生成和个性化设置,但并未回答该架构引发的所有问题。
用户需要清晰说明哪些数据会离开设备、捕捉资产会保存多久,以及他们能否删除或重新生成自己的模型。通话接收者同样需要一个明显信号,表明画面是合成的。
身份保护则是另一个尚未解决的领域。一个能够根据语音生成逼真视频的个性化模型,属于敏感材料。Meta 需要采取措施,防范未经授权的激活、被复制的捕捉数据、账户被盗,以及在预期通话流程之外的欺骗性复用。
该系统还依赖远程计算。这带来了延迟、服务中断、网络要求和区域可用性等问题。Meta 将 Early Access 限制在美国,表明其有意控制首次发布的范围。
所捕捉的服装和静态背景会带来不那么严重、但更为直接的社交问题。来电者可能穿着昨天的衬衫,身处已经不再使用的房间,或面对暗示错误地点的背景。
这些不匹配之处可能提醒接收者,他们看到的是一个头像。如果 Hologram 与实时画面足够相似,以至于人们认为场景是当前的,它们也可能造成混淆。
视觉包容性同样值得关注。照片级真实系统必须稳定地呈现不同面孔、肤色、发型、配饰、说话方式和表情。表现不均衡的模型,可能让一些用户看起来不够准确,或显得不如他人有表现力。
Early Access 应当能针对这些问题产生证据,但 Meta 尚未公布针对这一消费级功能的大范围独立性能测量结果。一场成功的舞台演示证明的是可行性,而不是其在数百万人和不受控条件下的可靠性。
正确的标准并不是 Hologram 能否在短时间内骗过某个人,而是当参与者完全了解其运作方式后,该系统是否依然有用。
信任将取决于一致性、披露、用户控制和恰当预期。仅靠真实感无法提供这些品质。
全身 Holograms 揭示仍有多少工作要做
Meta 的下一代 Hologram 看起来更具空间感,但其发布架构仍未达到公司最初的共在愿景。
Meta 计划于 2027 年春季为其 VR Glasses 推出全身版本。当两名用户通过 WhatsApp 通话时,他们首先会在一个三维窗口内看到 Holograms。随后,用户可通过控制功能将对方以接近真人大小的比例放置在自己的空间中。
这一版本使用的信息追踪比 Ray-Ban Display 发布版本更多。它还会生成立体视频流,也就是说每只眼睛会接收到略有差异的图像,从而形成深度感。
但这款首发产品并非体积化人物。它不会构建一个让观看者能够从各个角度自然查看的头像。相反,它呈现的是一块始终面向观察者的遮罩式立体视频平面。
当双方都处于有利位置时,这种技术可以显得很有吸引力。UploadVR 的演示发现,在静止站立或坐下时,效果颇具说服力。比例和深度感让远程人物仿佛更接近于身处房间之中。
移动暴露了这种妥协。当观察者俯身或横向行走时,Hologram 会旋转以维持正面视图。这种行为更像电子游戏中的广告牌精灵图,而非拥有稳定三维几何结构的身体。
在演示中,细节也显得粗糙,尤其是在眼部周围。据报道,Meta 工程师将拥挤的活动 Wi-Fi 视为可能因素之一,但公开测试未能隔离具体原因。
这些限制将 Hologram 与 Meta 早先的 Codec Avatar 承诺区分开来。研究原型旨在将一个人重建并动画化为真正的三维存在。首批上市版本则生成了针对特定观看条件优化的视频流。
这正是本文的核心转折。经过多年研究后,Meta 终于准备推出逼真的头像,但它是通过缩小问题范围来实现的。该公司并未将其实验室中最雄心勃勃的系统直接植入消费级硬件。
这种捷径在商业上是可以理解的。高质量视频流无需解决几何、重光照、视线、捕捉和实时渲染的所有问题,便能提供大部分视觉冲击力。
它也可能帮助 Meta 收集有关人们真正看重什么的证据。用户或许更关心可辨认的面孔和自然的对话,而非围绕完美体积化重建四处走动。如果是这样,视频生成可能成为实用基础,而非临时替代方案。
Meta 表示,后续 Hologram 版本将实现真正的体积化、支持群组对话,并向外部开发者开放。该承诺并未附带具体时间表。
这种区别对开发者而言很重要。完整的空间头像可以与应用几何体互动、占据稳定位置,并支持通话之外的体验。正面视频流提供的灵活性则要低得多。
Meta 当前围绕风格化角色构建的 Avatar SDK,支持的是一致性和动画效果比精确相似度更重要的体验。要将其替换为逼真的表现形式,需要在众多应用中提供可预测的性能、权限、集成工具和行为表现。
Hologram 尚未达到这一阶段。2027 年版本应被视为一项为 Meta 硬件和 WhatsApp 设计的远程临场视频流,而不是该公司更广泛头像平台的完成形态。
三个信号将决定 Hologram 是否会超越演示阶段
下一项考验不是又一次受控展示,而是 Meta 能否将视觉可信度转化为持续且值得信赖的沟通。
第一个信号是 Meta Ray-Ban Display 在美国的 Early Access 推出。Meta 需要在其所述的秋季窗口内完成发布,并证明设置、发起通话、生成和传输在 Connect 之外也能正常工作。
可靠性将与图像质量同等重要。用户必须能够无需反复扫描便创建稳定的形象,同时生成画面必须在正常网络条件下保持同步。
接收者的行为将提供更具启发性的采用指标。人们必须更愿意接收 Hologram,而不是继续进行音频通话或观看佩戴者的外向摄像头画面。如果该功能显得没有必要、尴尬或具有误导性,技术上的真实感也无法挽救它。
Meta 还应在 WhatsApp 内明确合成状态。一个易于识别的标记,加上便捷的控制选项和说明,将有助于证明 Hologram 是一种通信模式,而非模仿摄像头画面的功能。
第二个信号是动作输入。Meta 表示计划将眼镜的 IMU 纳入系统,使真实的头部转动能够影响头像。这一改变无需增加面向内侧的摄像头,便可缩小推断行为与观察行为之间的差距。
这一更新还将揭示 Meta 在传感器与生成之间的长期平衡。每一项测得的输入都会提升保真度,但也增加数据、工程复杂度以及潜在的功耗要求。每一个预测动作则保留了简洁性,但也增加了表情不准确的可能性。
第三个信号是 2027 年春季的全身版本发布。Meta 必须证明,这种立体方案能够在家庭网络和各种实际空间中稳定运行。它还应澄清 Hologram 将在何时或何种条件下成为真正的体积化形象。
Apple 的回应将提供有用的背景。Persona 的持续改进可能会加强传感器丰富的重建方案的论点。Meta 的进展则可能支持另一种观点:生成式模型能够凭借更少输入和更熟悉的硬件,创造出令人信服的临场感。
对开发者和企业买家而言,眼下的教训是保持谨慎。Hologram 尚不是通用头像服务、开发者平台,也不能替代经过验证的视觉临场。它是一项范围有限、正进入有限推广阶段的 WhatsApp 功能。
对消费者来说,这一选择将更具个人色彩。一张合成面孔可以让免手持智能眼镜通话显得更温暖、更熟悉。它也可能用模型的最佳猜测取代真实的视觉细节。
只有在新鲜感消退后,这种交换依然值得,Meta Holograms 才能成功。值得关注的是用户是否会持续启用该功能、接收者是否信任其呈现,以及 Meta 是否会将更多真实动作连接到生成的面孔上。
决定性的问题很简单:当有人通过智能眼镜来电时,你想看到模型认为他们看起来是什么样,还是更愿意听到他们的声音,并知道哪些内容仍在镜头之外?



