top of page

Meta Holograms、Ray-Ban Display通話に合成された顔を導入

9月27日
読了時間: 18分

Meta Hologramsはこの秋、Early Accessとして提供を開始し、米国のMeta Ray-Ban DisplayユーザーはWhatsAppビデオ通話で合成された顔を利用できるようになる。初期版で表示されるのは、発信者の肩から上のみだ。より重要なのは、通話中に本人の顔を撮影するのではなく、発信者の声からその姿を生成する点にある。

この違いによって、一般的なメガネの機能が、合成された存在感を試す実験へと変わる。通話を受ける側には、推定された表情を備えた、着用者のフォトリアルなデジタル版が表示される。映像のように見えるが、その画像はMetaのサーバー上で動作するモデルによって生成される。

Appleは、Vision Pro Personasによって最も近い消費者向けの先例を築いた。これは、FaceTimeや対応する会議通話でヘッドセット着用者を表現するものだ。Metaは別の道を取る。同社は初の消費者向けHologramを日常的な見た目のメガネに搭載し、最初の配信チャネルとしてWhatsAppを用いる計画だ。

その結果、ヘッドセット内の空間アバターより利用しやすくなる一方で、曖昧さも増す。Metaは、通常のビデオ映像が利用できないときに、発信者がもっともらしい合成顔を求めること、そして受信者が見ているものを理解できることを示さなければならない。

Meta HologramsはバーチャルリアリティではなくWhatsAppから始まる

Metaは、完全な空間テレプレゼンス製品としてではなく、カメラ配置の問題に対する実用的な回避策として、リアルなアバターシステムを展開する。

Metaは、Meta Ray-Ban Display向けの複数の追加機能の一つとして、Connect 2026でHologramを発表した。同社のRay-Ban Display updateによれば、この機能は今秋後半、米国でEarly Accessを通じて段階的に提供される予定だ。

初期の用途は明快だ。スマートグラスはハンズフリー通話に対応しているが、外向きカメラでは着用者を通常の視点で映せない。発信者は目の前にあるものを相手に見せられる一方、受信者は発信者の顔を見ることができない。

Hologramは、その欠けたカメラアングルを生成されたポートレートで補う。着用者は通話前に、Meta AI phone appを使って短時間のキャプチャを行う。このプロセスでは、顔の外見に加え、表情豊かに話すユーザーの例が記録される。

WhatsApp通話中、メガネはライブの顔映像ではなく音声ストリームを提供する。画像の細部を段階的に合成して視覚フレームを作る生成拡散モデルが、Metaのサーバー上で動作する。このモデルは音声から顔の動きを推定し、得られた2次元ビデオを受信者へ送信する。

Metaの公開説明によると、表情は発信者が何を言うかだけでなく、どのように言うかからも推定される。つまり、モデルは描写するすべての動きを観察しているわけではない。入力される音声と整合して見える視覚的な演技を予測する。

受信者はメガネを着用したり、仮想環境に入ったりする必要はない。Hologramは、相手のデバイス上にある通常のWhatsAppビデオ通話内に表示される。この幅広い互換性は、Metaのアプローチの中核にある。

初期版には明確な制約もある。実機を試した報道によれば、キャプチャではセットアップ時に記録した衣服と背景が保持される。この見た目を変えるには、通常の着替えやカメラ調整ではなく、あらためてキャプチャを行う必要がある。

Metaは後続版に向け、追加の入力も検討している。メガネの慣性計測装置、すなわちIMUのデータにより、アバターの頭部回転を着用者の実際の動きに連動させられる可能性がある。同社はカメラ支援型の背景や、生成による衣服変更も検討している。

これらの追加機能には、いずれも公開されたリリース日がない。秋のバージョンは、事前に選択された外見と環境を持つ、肩から上の音声駆動型表現にとどまる。

それでも、この限定的な製品は重要な変化だ。Metaは長年、通常はVRに関連するデモで、研究成果としてリアルなアバターを披露してきた。Hologramはこの構想を、明確なプラットフォーム、市場、提供時期を持つ消費者向けコミュニケーションサービスへ移す。

この動きは、製品をその名称からも切り離す。Ray-Ban Display通話を受ける人の物理空間に、何かが投影されるわけではない。このデバイスにおけるHologramとは、不足している自撮りカメラの代替として設計された、AI生成のビデオポートレートだ。

Metaがリアルなアバターを最初にスマートグラスへ導入した理由

Ray-Ban Displayは、完全な空間テレプレゼンスの準備が整う前に、生成ビデオで解決できる制約付きの課題をMetaにもたらす。

Metaのリアルなアバター研究は、従来より高い目標を掲げてきた。同社のCodec Avatarsに関する研究では、共有仮想環境に存在できるフォトリアルな人物を探究している。その狙いは単に優れたプロフィール写真を作ることではなく、距離を越えて説得力のあるアイコンタクト、表情、身体的存在感を実現することだった。

2020年のModular Codec Avatarsに関する論文では、VRヘッドセットに搭載したカメラで駆動する顔が説明されている。このアプローチは、追跡された行動に結び付く3次元表現を目指した。

Hologramの最初の消費者向けバージョンでは、その仕組みが変わる。着用者の顔を継続的に観察する内向きカメラは必要としない。音声と、あらかじめキャプチャされた本人のアイデンティティから2次元の出力を生成する。

この妥協はMeta Ray-Ban Displayに適している。日常の公共空間で使うことを想定したメガネは、比較的コンパクトで、社会的に馴染みのある見た目を維持する必要がある。フレームを顔追跡用の追加カメラで埋めれば、ハードウェア、電力、デザインに異なる制約が生じる。

通話中はすでに音声が利用できる。したがってMetaは、マイクを行動の入力として使い、負荷の大きい生成処理をサーバーへ移せる。メガネは着用者の顔を直接見られないため、会話中に収集する顔情報は少なくなる。

このアプローチは、Metaに製品上の弱点への即時の答えも与える。既存のメガネ通話では着用者の視点を共有でき、場面を見せたり遠隔支援を求めたりするには適している。一方で、相手が通常の対面に近い接触を求める場合には、あまり適していない。

Metaは料理中の通話でこの隔たりを説明している。メガネを着用した人は、家族がその人のデジタルな顔を見る間も、料理を続けられる。発信者はスマートフォンを手に持ったり位置を調整したりせずに済み、受信者は従来のビデオ会話により近いものを得られる。

この場面は、魅力と不確実性の両方を捉えている。料理、機器の修理、職場内の移動、子どもの世話をしながらのハンズフリー通信は有用だ。しかし、固定された合成背景は、そうした瞬間を意味あるものにしている文脈を隠してしまう可能性がある。

生成された顔も、必ずしも発信者の文字どおりの表情を示すわけではない。声の調子や言葉は強いシグナルとなるが、すべての視線、気の散り、抑えた反応、身体的な出来事を捉えることはできない。したがって説得力のある出力は、ユーザーを透明に映す窓ではなく、ユーザーの解釈である。

Metaの研究は、一般的なアバターシステムが示唆する以上に、音声が多くの行動情報を伝えられると同社が考える理由を説明する。2025年、同社は、視聴覚シグナルを顔の表情、ジェスチャー、聞く際の行動へ結び付けるよう訓練したconversational motion modelsを説明した。

この研究には、4,000時間を超える2人組のインタラクションと、4,000人以上の参加者が含まれていた。発話、動き、社会的反応がどのように組み合わさるかをモデル化する、より広範な取り組みを支えるものだ。

Hologramは、この同じ一般的な考え方を、より限定された消費者体験に適用する。センサーが直接測定したものだけを再構築するのではなく、もっともらしく見える表情豊かな演技をシステムが予測する。

これが、スマートグラスが先に来る理由だ。スマートフォンにはすでに前面カメラがあるため、そのライブ映像を置き換えても実用上の利点は少ない。VRヘッドセットはより豊かな追跡を可能にするが、真の空間的存在感に対する技術的な基準も高くなる。

Ray-Ban Displayはこれらのデバイスの中間に位置する。実際のビデオ通話上の制約を生みながら、Metaがより大きなアバター構想の準備が整う前に、有用に見えるバージョンを提供することを可能にする。

Meta HologramsはApple Personasとは異なる道を取る

中心となる競争は、単純なMeta対Appleではない。限られたシグナルからの予測と、専用ヘッドセットセンサーによる再構築の対比だ。

AppleのPersonaシステムは、デバイスが顔を覆う状況でも通話で本人を表示できるため、最も明確な比較対象となる。AppleはVision ProとともにPersonasを導入し、その後のvisionOSリリースを通じてリアリティと表情を改善してきた。

Vision Proユーザーは、ヘッドセットで自身の外見をスキャンしてPersonaを作成する。通話中、デバイスはセンサーシステムを通じて顔や手の動きを追跡する。AppleはPersonaを、着用者の表情や動きをリアルタイムで伝える空間表現として説明している。

PersonasはFaceTime以外でも機能する。Appleは発表時に、対応アプリケーションとしてZoom、Cisco Webex、Microsoft Teamsを挙げた。これにより同機能は、単一サービスのエフェクトではなく、空間コンピューティングヘッドセットのためのコミュニケーションレイヤーとして位置付けられた。

Meta Hologramsは同じ基本的な遮蔽の問題に対処するが、出発点となるハードウェアが異なる。Meta Ray-Ban DisplayはVision Proのように顔を覆わない。単に着用者に向いたカメラがないだけだ。

Appleは、センサーを豊富に備えたヘッドセットを使い、デバイスの背後に隠れた行動を観察できる。一方Metaは、メガネが直接観察できない行動を、サーバー側のモデルに推定させる。

この違いは、セットアップと出力を比較するとより明確になる。

キャプチャと追跡

  • Meta: セットアップ時に、スマートフォンが本人のアイデンティティ、表情、衣服、背景をキャプチャする。秋のリリースでは、通話中にマイク音声が駆動入力となる。

  • Apple: Vision ProがPersonaを作成し、使用中はヘッドセットのセンサーで表情と動きをアニメーション化する。

初期の提供先

  • Meta: 肩から上のビデオ表現が、通常の画面で受信するWhatsApp通話に表示される。

  • Apple: 空間表現がFaceTimeと対応する会議アプリケーションに表示される。

ハードウェアの文脈

  • Meta: 発信者は、日常的な活動全般での使用を想定した、より軽量で社会的に馴染みのあるディスプレイグラスを着用する。

  • Apple: 発信者は、広範な追跡ハードウェアを備えた没入型の空間コンピュータを着用する。

製品上のトレードオフ

  • Meta: 摩擦の少ないハードウェアには、より多くの行動推定とクラウド生成が必要になる。

  • Apple: より豊富なセンシングは、より直接的に追跡された行動を支えるが、大きく異なるデバイスカテゴリを必要とする。

Appleは視覚的な結果の改善を続けている。visionOS 26 previewでは、よりシャープな横顔、より自然な髪、まつ毛、肌色が強調された。また、セットアップ操作の改善と、共有空間体験も追加された。

こうした改良は重要だ。デジタル上の肖像には、特に厳しい品質基準が求められる。目、タイミング、視線、肌の動きにわずかな問題があれば、漫画風アバターの大きな誤差よりも注目を集めかねない。

Metaの解決策は、見慣れた動画形式を生成することで、その閾値を超えようとしている。UploadVRのハンズオンでは、David Heaneyは当初、Meta社員のHologramを通常のセルフィーカメラ映像だと見間違えた。彼は出力をもっともらしいと評する一方、一般的なスマートフォン画面での有用性には疑問を呈した。

この反応は、Metaの可能性を示している。Hologramは、気軽な通話での存在感として機能するために、あらゆる動きを完璧に再現する必要はない。音声との同期を維持しつつ、スマートフォン画面の大きさで十分に自然に見えることが重要だ。

同時に、リスクも浮き彫りにしている。通常のカメラ映像に見える結果は、それが合成されたものだという事実を見えにくくする。AppleのPersonaは従来の動画とは明確に異なって見えることが多く、その媒介性を認識しやすい。

したがって、Metaが解決すべきなのは視覚的忠実度だけではない。生成されたアイデンティティのための明確なインタラクション言語が必要になる。受信者は、実際のカメラ映像が終わり、推定された演技が始まるタイミングを理解できるべきだ。

もっともらしい顔と忠実な顔は同じではない

Hologramの最大の技術的成果は、最も難しい信頼の問題も生み出している。見た目が優れるほど、観測結果と推論結果を取り違えやすくなる。

通常のビデオ通話には多くの欠点がある。カメラは場面を切り取り、ネットワークはフレームを落とし、照明は肌の見え方を歪め、参加者はフレームに入れるものを選ぶ。それでも、カメラはその瞬間に本人と周囲から届く光を記録している、という基本的な期待は残る。

Meta Hologramsは、その関係を変える。出力は発信者を描写するが、直接の行動入力は音声だ。モデルが、取得した本人のアイデンティティ上で、発話がどのように見えるべきかを決める。

この判断は、通常の会話ではうまく機能し得る。発話には、タイミング、感情の調子、強調、間、その他の表現的な手がかりが含まれる。訓練されたモデルは、これらの信号を説得力のある口の動きや表情反応へ変換できる。

しかし、音声だけでは顔の状態を完全には指定できない。人は悪い知らせを伝えながら笑うことも、不快な質問の最中に視線をそらすことも、通話の外で起きた何かに無言で反応することもある。秋のバージョンには、こうした瞬間を直接見る手段がない。

そのためHologramは、発信者本人よりも注意深く、表情豊かに、あるいは落ち着いて見える可能性がある。装着者の実際の反応ではなく、統計的に適合する反応を表示するかもしれない。

この違いが持つ意味は、状況によって異なる。気軽な家族通話では、参加者はアバターを便利な代理として受け入れるかもしれない。一方で、繊細な職場会議、医療に関する会話、面接、交渉では、推定された表情がメッセージの受け取られ方を変え得る。

Metaは、Hologramに関連する開示、同意、保持、モデレーションの管理機能をすべて公表しているわけではない。利用可能な発表は、サーバー側での生成とパーソナライズされた設定を確認しているが、そのアーキテクチャが提起するすべての疑問には答えていない。

ユーザーには、何がデバイス外へ送信されるのか、キャプチャ資産がどれほど長く保持されるのか、モデルを削除または再生成できるのかについて、平易な説明が必要になる。通話の受信者にも、画像が合成物であることを示す明確なシグナルが必要だ。

アイデンティティ保護も、未解決の領域である。音声からリアルな動画を生成できるパーソナライズドモデルは、機微な素材となる。Metaには、無許可の有効化、複製されたキャプチャデータ、アカウント侵害、意図された通話フロー外での欺瞞的な再利用を防ぐための保護策が求められる。

このシステムはリモートコンピューティングにも依存する。そのため、遅延、サービス中断、ネットワーク要件、地域ごとの提供状況について疑問が生じる。MetaがEarly Accessを米国に限定していることは、意図的に管理された初期リリースを示唆している。

取得された服装と静的な背景は、より深刻度は低いものの、より直接的な社会的問題を生む。発信者は昨日のシャツを着ているように見えたり、もはやいない部屋にいるように見えたり、誤った場所を示唆する背景の前にいるように見えたりする可能性がある。

こうした不一致は、受信者にアバターを見ていることを思い出させるかもしれない。一方で、Hologramがライブ映像に十分近く見え、人々がその場面は現在のものだと想定するなら、混乱も生み得る。

視覚的インクルージョンにも注意が必要だ。フォトリアリスティックなシステムは、異なる顔、肌の色、髪質、アクセサリー、話し方、表情を一貫して表現しなければならない。不均一な性能のモデルは、一部のユーザーを他の人より不正確、あるいは表情に乏しく見せるおそれがある。

Early Accessはこれらの問題に関する証拠を生むはずだが、Metaは消費者向け機能について、広範な独立性能測定を公表していない。成功したステージデモは実現可能性を示すが、何百万人もの人々と制御されていない環境全体での信頼性を示すものではない。

適切な基準は、Hologramが短時間誰かをだませるかどうかではない。参加者がその仕組みを正確に理解した後も、このシステムが有用であり続けるかどうかだ。

信頼は、一貫性、開示、ユーザーコントロール、適切な期待に左右される。リアリズムだけでは、こうした性質を提供できない。

全身Hologramは、残された作業の大きさを示す

Metaの次期Hologramはより空間的に見えるが、そのローンチアーキテクチャは、同社が当初掲げた共存在の野心にはなお届いていない。

Metaは、2027年春にVR Glasses向けの全身版を計画している。2人のユーザーがWhatsApp経由で通話すると、まず三次元ウィンドウ内にHologramsが表示される。その後、操作によって相手を視聴者の空間内にほぼ等身大で配置できる。

このバージョンは、Ray-Ban Display版よりも多くのトラッキング情報を使用する。また、立体視ストリームを生成するため、両目には奥行き感を生むためのわずかに異なる映像が送られる。

しかし、ローンチ製品はボリュメトリックな人物ではない。視聴者があらゆる方向から自然に確認できるアバターを構築するものではない。代わりに、観察者に正面を向き続けるマスク付き立体視ビデオ平面を表示する。

両方の参加者が好条件の位置にとどまっている間、この技術は説得力を持ち得る。UploadVRのデモでは、立ったまま、または座ったままなら効果的だったという。スケール感と奥行き感により、遠隔の人物が部屋をより実際に占めているように感じられた。

動くと、その妥協が明らかになった。観察者が身を乗り出したり横方向に歩いたりすると、Hologramは正面向きの視点を維持するために回転した。この挙動は、安定した三次元形状を持つ身体というより、ビデオゲームのビルボードスプライトに似ていた。

デモ中には、特に目の周辺で細部がブロック状に見えた。Metaのエンジニアは、混雑したイベント会場のWi-Fiを要因の一つとして指摘したと報じられているが、公開テストでは原因を切り分けられなかった。

こうした制約は、HologramをMetaが以前掲げたCodec Avatarの約束と隔てている。研究プロトタイプは、人物を真の三次元的な存在として再構築・アニメーション化することを目指していた。対して最初に出荷されるバージョンは、特定の視聴条件に最適化された映像ストリームを生成する。

これがこの記事の中心的な逆転だ。Metaは長年の研究を経て、ついにリアルなアバターの提供を準備している。しかし、そのために問題の範囲を狭めている。同社は、最も野心的な研究室のシステムをそのまま消費者向けハードウェアへ投入しているわけではない。

この近道は商業的には理解できる。高品質なストリームなら、ジオメトリ、再照明、視線、キャプチャ、リアルタイムレンダリングに関するすべての問題を解決せずとも、視覚的インパクトの多くを提供できる。

また、人々が何を重視するかについての証拠を集める助けにもなるかもしれない。ユーザーは、完璧なボリュメトリック再構築の周囲を歩き回ることより、認識可能な顔と自然な会話を重視する可能性がある。そうであれば、動画生成は一時的な代替ではなく、実用的な基盤になり得る。

Metaは、後のHologramバージョンが真にボリュメトリックになり、グループ会話をサポートし、外部開発者にも提供されると述べている。この約束に具体的な時期は添えられていない。

この違いは開発者にとって重要だ。完全な空間アバターは、アプリケーションのジオメトリと相互作用し、安定した位置を占め、通話を超える体験を支えられる。正面向きのストリームが提供する柔軟性は、はるかに低い。

スタイライズされたキャラクターを中心に構築されたMetaの現在のAvatar SDKは、正確な肖像よりも一貫性とアニメーションが重要な体験をサポートしている。これをリアルな表現に置き換えるには、多数のアプリケーションで予測可能な性能、権限、統合ツール、挙動が必要になる。

Hologramはまだその段階に達していない。2027年版は、より広範なアバタープラットフォームの完成形ではなく、MetaハードウェアとWhatsApp向けに設計されたテレプレゼンスストリームとして評価すべきだ。

Hologramがデモ以上の存在になるかを決める3つのシグナル

次の試験は、再び管理されたプレゼンテーションを行うことではない。Metaが視覚的なもっともらしさを、継続的で信頼されるコミュニケーションへ変えられるかどうかだ。

最初のシグナルは、Meta Ray-Ban Displayにおける米国でのEarly Access展開だ。Metaは表明した秋の期間内に提供を開始し、セットアップ、通話開始、生成、配信がConnectの外でも機能することを示す必要がある。

信頼性は画質と同じくらい重要になる。ユーザーは何度もスキャンを繰り返さずに安定した肖像を作成できなければならず、生成されたフィードは通常のネットワーク条件下で同期を維持しなければならない。

より示唆に富む導入指標は、受信者の行動だ。人々は、音声通話を続けることや装着者の外向きカメラを見ることよりも、Hologramを受け取ることを好まなければならない。この機能が不要、不自然、あるいは誤解を招くものだと感じられれば、技術的なリアリズムで救うことはできない。

Metaは、WhatsApp内で合成状態を明確にすべきでもある。認識しやすいインジケーターを、利用しやすいコントロールや説明と組み合わせれば、Hologramが模倣カメラ映像ではなくコミュニケーションモードであるという主張を強められる。

2つ目のシグナルは動きの入力だ。Metaは、グラスのIMUを組み込み、実際の頭部回転がアバターに影響するよう計画していると述べている。この変更は、内向きカメラを追加せずに、推定された行動と観測された行動の隔たりを縮めるだろう。

この更新はまた、センサーと生成の間でMetaが長期的にどうバランスを取るかも明らかにする。測定される入力はすべて忠実度を高めるが、データ、エンジニアリング、場合によっては電力要件も増やす。予測される動きはすべて単純さを維持するが、不正確な表情の可能性を高める。

3つ目のシグナルは、2027年春の全身版ローンチだ。Metaは、立体視アプローチが家庭のネットワークや多様な物理空間で一貫して機能することを示さなければならない。また、Hologramがいつ、あるいはどのような条件で真にボリュメトリックになるのかも明確にすべきだ。

Appleの対応は有益な文脈を提供する。Personaの継続的な改善は、センサーを多用する再構築の正当性を強める可能性がある。Metaの進展は、生成AIモデルがより少ない入力とより身近なハードウェアから説得力のある存在感を生み出せるという対抗する考えを支持するかもしれない。

開発者や企業の購入担当者にとって、当面の教訓は慎重さだ。Hologramはまだ、汎用的なアバターサービスでも、開発者プラットフォームでも、検証済みの視覚的存在の代替でもない。これは限定的な展開に入る、狭く範囲を定めたWhatsApp機能である。

消費者にとって、その選択はより個人的なものになる。合成された顔は、ハンズフリーのグラス通話をより温かく、親しみやすくできる。一方で、真実の視覚的な細部を、モデルによる最良の推測へ置き換える可能性もある。

Meta Hologramsが成功するのは、新鮮さが薄れた後もこの交換に価値を感じられる場合だけだ。ユーザーがこの機能を有効にし続けるか、受信者がその表現を信頼するか、そしてMetaがより多くの実際の動きを生成された顔へ結び付けるかを見守るべきだ。

決定的な問いはシンプルだ。誰かがスマートグラスから電話をかけてきたとき、あなたはモデルが推測するその人の姿を見たいのか。それとも、その人の声を聞き、カメラの外に何が残っているかを理解していたいのか。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page