マルチモーダルAIとは? モデルがテキスト画像音声動画を一緒に処理する方法
- Aisha Washington

- 6月5日
- 読了時間: 6分
マルチモーダルAIモデルは、テキスト、画像、オーディオ、ビデオを1つのネットワーク内に組み合わせることで、システムが異なる入力タイプを同時に推論できるようにします。これらのモデルは、1種類のデータのみを扱う以前のシステムとは異なります。現在では、文書リーダー、音声アシスタント、ビデオエディタに登場しています。
マルチモーダルAIモデルが重要である理由は、多くの日常的なタスクが複数のデータタイプを必要とするためです。1回のミーティングでスライド、音声、メモが生成されることがあります。医療記録にはスキャン、レポート、音声口述が含まれる場合があります。複数の入力を扱えるモデルは、別々のツールを切り替える必要性を減らします。
主なポイント
マルチモーダルAIモデルは、テキスト、画像、オーディオ、ビデオを1回のフォワードパスで受け入れます。
融合はネットワーク層の早期、晚期、または全体を通じて行われます。
現在のモデルは、長いビデオや微妙なオーディオの手がかりにまだ苦労しています。
実際の用途には、文書検索、ミーティング要約、ビデオキャプションがすでに含まれています。
マルチモーダルAIモデルとは
マルチモーダルAIモデルは、複数のデータタイプを受け入れ、同じネットワーク内で関連付けるように訓練されたシステムです。したがって、主なキーワードであるmultimodal AI modelsは、テキスト、画像、オーディオ、ビデオを別のパイプラインを必要とせずに処理するアーキテクチャを指します。
これらのモデルを定義する3つの特性があります。第一に、各モダリティが同じベクトル空間にマッピングされる共同埋め込み空間を共有します。第二に、あるモダリティのトークンを別のモダリティのトークンと比較するアテンションメカニズムを使用します。第三に、画像領域やビデオフレームを参照するテキスト回答など、モダリティを混合した出力を生成します。
これらの特性により、1つのモデルで写真に関する質問に答えたり、ビデオクリップを説明したり、付属のスライドデッキを読みながら音声を書き起こしたりできます。
マルチモーダルAIモデルの仕組み
現在、3つの主な融合戦略が存在します。各戦略は、異なるモダリティからの情報がいつどのように統合されるかを変えます。
早期融合:生の入力を近くに保つ
早期融合は、メインネットワーク層が始まる前にデータを結合します。画像はパッチにトークン化され、オーディオ波形はスペクトログラムパッチになり、テキストはトークンのままです。すべてのパッチは最初の層から同じトランスフォーマースタックに入ります。この方法は、モダリティが強い空間的または時間的アライメントを共有する場合に機能します。
晚期融合:別々のエンコーダを最初に処理
晚期融合は、各モダリティを最初に独自のエンコーダで処理します。テキストは言語エンコーダ、画像はビジョンエンコーダ、オーディオは専用オーディオエンコーダを使用します。最終的な埋め込みのみがクロスアテンションブロック内で統合されます。このアプローチは、各エンコーダを個別に最適化できるため、長い入力に対してよりスケーラブルです。
ハイブリッド融合:両方のアプローチを組み合わせる
ハイブリッド設計は、短く整列したセグメントには早期融合を、長いまたは緩く関連するセグメントには晚期融合を適用します。GPT-4oとGemini 1.5はどちらもこのパターンのバリエーションを使用しています。モデルはタスクに応じて内部的にどのパスを強調するかを決定します。
現在の限界には、長いビデオに対する2次アテンションコストと、話者の感情などの細かいオーディオの違いに対する弱いパフォーマンスが含まれます。これは、Google Researchの効率的なトランスフォーマーに関するブログで指摘されています。研究は、これらのコストを削減するためのスパースアテンションとモダリティ固有の圧縮を続けています。
GPT-4oはVQAv2で88.7%、ActivityNet-QAビデオQAで63.3を達成しています。Gemini 1.5はEgoSchemaで70.8%を報告しています。より深い技術的レビューについては、マルチモーダルモデルの概要(The Verge)と公式のGemini 1.5 technical reportを参照してください。
実世界のアプリケーション
文書理解ツールは現在、マルチモーダルモデルを使用してチャート、テーブル、スキャンされたページに関する質問に答えます。ユーザーはPDFをアップロードし、手動でのデータ入力なしで直接回答を受け取ります。たとえば、ユーザーがNotebookLMを開いて40ページの研究PDFをアップロードし、「ページ12-18のテーブルからすべての数値結果を抽出して、要約と10%以上異なるものをフラグ付けせよ」と入力すると、引用されたテーブルとソース引用が1回の応答で返されます。
音声インターフェースは、画面コンテキストと音声入力を組み合わせます。ユーザーはスマートフォンのカメラをデバイスに向け、自然な音声でトラブルシューティングの手順を尋ねることができます。
ビデオ分析プラットフォームは、要約と検索可能なトランスクリプトを生成します。編集者は、シーンを説明したり話された言葉を引用したりすることで、数時間の映像内を検索できます。
これらの例は、1つのモデルが複数の専門ツールに取って代わる方法を示しています。
実践におけるマルチモーダルAIモデル
Claude 3.5は、ページを画像としてレンダリングし、レイアウト、テーブル、数式を抽出するためにビジョンエンコーダを適用した後、添付されたテキストプロンプトと結果を組み合わせることでPDFを処理します。ElevenLabsは、音声波形を会話履歴の埋め込みと並行してエンコードすることで、音声とコンテキストを扱い、プロソディが進行中の対話に一致するようにします。パーソナル知識ツールの中では、remioは独自の共同埋め込みモデルを訓練するのではなく、キャプチャしたファイルや録音を別々のインデックス付きオブジェクトとして保存することで、マルチモーダル入力に軽いアプローチを取っています。ユーザーはソース全体で統一された検索が可能になり、重いマルチモーダルトレーニングはより大規模な基盤システムに任せられます。
マルチモーダルAIモデルに関するよくある質問
Q: マルチモーダルトレーニングは単一モダリティのトレーニングとどう違うのですか?
A: トレーニングデータにはモダリティ間の対応を学習するための整列した例が含まれている必要があり、孤立したパターンではなく対応を学習します。
Q: マルチモーダルモデルはコンシューマーハードウェアで動作しますか?
A: 小さな蒸留版は最近のラップトップに収まりますが、フルスケールのモデルは依然としてクラウドGPUを必要とします。
Q: 1つのモダリティが欠けている場合はどうなりますか?
A: 現在のほとんどのモデルは利用可能なモダリティにフォールバックしますが、重要なコンテキストが欠如すると精度が低下します。
Q: マルチモーダルAIモデルを実装するツールを使用する際、私のデータは安全ですか?
A: セキュリティはデプロイメントによって異なります。ローカル処理はファイルをデバイス上に保持しますが、クラウドAPIはデータをリモートサーバーに送信します。
Q: すでにマルチモーダルAIモデルを使用しているツールはどれですか?
A: 商用例にはGPT-4o、Gemini 1.5、およびいくつかの文書およびビデオプラットフォームが含まれます。


