top of page

Google VidsがGemini Omniとパーソナルアバターを発表、AI動画をWorkspaceへ

7月17日
読了時間: 20分

更新日:7月20日

Google Vidsは、職場での動画制作をどう変えるべきかという、相互に関連した2つの構想とともにGemini Omniとパーソナルアバターを発表しました。一方は、通常のプロンプトを動画の作成・編集コマンドに変換します。もう一方は、従業員のデジタル版が、改めてカメラで撮影することなく、入力された台本を読み上げられるようにします。

7月16日に発表された今回のアップデートにより、Google Vidsは、支援付きストーリーボード作成や単発のクリップ生成を超えるものになりました。ユーザーは自然言語で修正を指示できるようになり、パーソナルアバターはアカウント所有者の外見と声を再現します。Googleは、ドキュメント、プレゼンテーション、メール、会議で企業にすでに利用されているコラボレーションスイート内に、これら両方の機能を組み込んでいます。

ここに本当の緊張関係が生まれます。専門のAI動画プラットフォームは、カメラ、俳優、複雑な編集ソフトを不要にすることを魅力としてきました。Googleは今や、多くの職場向けメッセージが作られ始めるDocsやSlidesのすぐそばで、同様の制作モデルを提供できます。もはや問われているのは、生成動画が機能するかどうかではありません。Workspace内での利便性が、専用ツールの提供する高度な制御機能より重要かどうかです。

Google VidsがGemini Omniとパーソナルアバターを発表

今回のアップデートでは、生成、反復的な編集、デジタルプレゼンテーションが、1つの職場向け動画プロジェクト内に統合されます。

Gemini Omniは、自然言語のプロンプトと、写真やラフスケッチなどの参照画像を受け付けます。これらの入力を使用して、指定された被写体、構図、演出に沿った動画クリップを生成します。ユーザーは最初の結果を見るために、アイデアを従来のタイムライン操作へ置き換える必要がありません。

より重要な追加機能は、その最初の生成後に発揮されます。ユーザーは、希望する変更を説明するだけで、背景の差し替え、照明の調整、エフェクトの追加をVidsに依頼できます。システムは段階的な修正に対応しているため、編集者はクリップ全体を再生成することなく、既存の結果を洗練できます。

この違いが重要なのは、実際の制作において初稿がそのまま採用されることはほとんどないからです。生成されたシーンには適切な被写体が含まれていても、雰囲気が合わない場合があります。照明がほかの映像と調和しなかったり、背景が研修メッセージの邪魔になったりする可能性もあります。プロンプトベースの修正は、許容できるクリップと、プロジェクト全体に適合するクリップとの隔たりを縮めます。

Googleによると、この編集ワークフローはスマートフォンで撮影した映像にも適用できます。そのためGemini Omniは、単なるテキスト動画生成ツール以上の役割を果たします。合成素材と撮影素材の両方を編集するための、対話型レイヤーとなるのです。

パーソナルアバターは、別の制作上のボトルネックに対処します。ユーザーが自撮り写真と短い音声録音をアップロードして台本を入力すると、そのユーザーと同じ外見と声を持つアバターが、画面上で文章を読み上げます。

このワークフローは、日常的なコミュニケーションのために何度も撮影する作業を置き換えられます。マネージャーは、毎回カメラを準備することなく、週次のプロジェクト報告を作成できます。製品スペシャリストは、機能変更後にデモの一段落だけを修正できます。研修チームは、元の話者をスタジオに呼び戻すことなく、コンプライアンスに関する説明を更新できます。

Googleは、アバターの作成をアカウント所有者本人の容姿に限定しています。この機能はユーザーのGoogle Accountに紐づけられており、現時点では18歳以上であることが利用条件です。地域による制限も適用されます。

同社のアバターのプライバシーに関するガイダンスによると、顔と声の録音はユーザーのアカウントとともに保存されます。Googleは、不正利用や危害への対応時を除き、これらの録音を生成モデルの学習には使用しないとしています。また、関連情報が一部の法域では生体認証データに該当する可能性があると警告しています。

Gemini Omniとパーソナルアバターは、対象となるGoogle AI登録者およびGoogle Workspaceの法人顧客がGoogle Vidsを通じて利用できます。ただし、今回の発表は、すべてのユーザーが利用できることを意味するものではありません。管理者と個人ユーザーは、アカウント、地域、機能の利用資格を引き続き確認する必要があります。

生成されたすべてのクリップには、AI生成メディア向けのGoogleの不可視ウォーターマークであるSynthIDが含まれます。この保護措置により、対応ツールが検査できる技術的なシグナルが付与されますが、視聴者が動画を見るだけでは目に見える開示は表示されません。

これらの変更が、この記事の中心的な対立を生み出しています。Googleは、単に生成ボタンをもう1つ追加しているのではありません。職場での制作における複数の工程を、使い慣れたコラボレーション環境へ集約しているのです。

プロンプトベースの動画編集がワークフローを変える理由

Gemini Omniが重要なのは、生成だけでなく修正も対話型のプロセスに変えるからです。

生成動画は当初、テキストを動画へ変換することで注目を集めました。これにより印象的なデモが可能になりましたが、最初の結果から実用可能な成果物へ仕上げるまでの作業がなくなったわけではありません。ビジネス動画には、一貫したメッセージ、認識しやすいブランド表現、正確な製品情報、制御されたテンポが求められます。

従来の編集ツールでは、トラック、マスク、カラー調整、キーフレーム、エフェクトパネルを通じて、これらの要件を表現します。こうしたシステムは精密な制御を提供する一方、習得も必要です。Gemini Omniは異なる操作方法を導入します。ユーザーが望む結果を説明し、出力を確認して、さらに変更を依頼するというものです。

社内向けの安全教育動画を考えてみましょう。チームが工場の作業現場に入る従業員を生成した後、その服装が現場の要件に合っていないことに気づくかもしれません。編集者はシーケンス全体を破棄することなく、保護具の変更と照明の修正を依頼できます。このやり取りは、従来型のタイムラインを操作するというより、人間の編集者にフィードバックを与える作業に似ています。

同じ仕組みは、それほど複雑ではない素材にも役立ちます。照明条件の悪いオフィスでスマートフォン撮影した映像を、文章による指示で調整できます。気が散る部屋の背景を差し替えたり、話者が撮影を終えた後からエフェクトを追加したりすることもできます。

このプロセスは技術的なハードルを下げますが、編集上の判断を不要にはしません。ユーザーは依然として、事実の誤り、視覚的な不整合、不自然なテンポ、元のメッセージを歪める変更を見抜く必要があります。自然言語による操作は、指示を出しやすくしますが、すべての結果が正しいことを保証するものではありません。

Googleは段階的にこのモデルへ移行してきました。2024年11月にVidsが対象のWorkspace顧客へ広く提供された当時、Geminiの機能は初稿の生成に重点を置いていました。プロンプトとDrive内の素材から、構成案、シーンの提案、台本、ストックメディア、BGMを生成できました。

その後、同社はオリジナルクリップの生成機能を追加しました。2025年8月、GoogleはVidsの月間アクティブユーザー数が100万人を超え、Veo 3で8秒間のクリップを作成できるようになったと発表しました。このリリースでは、既製のAIプレゼンター、文字起こしを利用したトリミング、画像から動画への生成機能も製品に導入されました。

2026年4月、GoogleはVeo 3.1による生成、カスタム音楽、より細かく制御できるアバター、YouTubeへの直接公開機能を追加し、Vidsをさらに拡張しました。同社によると、個人用Googleアカウントのユーザーには毎月一定回数の動画生成が提供される一方、追加機能はアカウントの利用資格によって異なります。

Gemini Omniは、この進化を支援付きの組み立てから反復的な制作へと進めます。このモデルには、指示と参照画像を横断して処理し、その後の修正でもコンテキストを維持できるという価値があります。ユーザーは同じワークフロー内で、「このシーンを作って」から「この部分を変えて」へ進めます。

そのため、Google Vidsの新機能は、元の素材がすでにWorkspace内にあるチームにとって特に有用です。製品概要を台本に変換でき、Slidesを視覚的な構成として利用でき、Driveから承認済みの画像を取り込めます。同僚は、使い慣れた共有機能とコメント機能を通じてプロジェクトをレビューできます。

制作を始める前には、情報管理も引き続き重要です。チームには、信頼できる情報源、承認済みの主張、最新のドキュメントが必要です。検索可能なナレッジベースは、アバターや生成シーンが完成動画として情報を提示する前に、これらの入力情報を整理するうえで役立ちます。

その結果、職場の情報を職場向けメディアに変えるまでの経路が短縮されます。Googleは、ソースドキュメント、コラボレーション、生成、修正、配信など、その経路に含まれる複数の工程を掌握しています。この統合こそ、専門のAI動画プラットフォームが対抗しなければならない戦略的優位性です。

Googleの配信力が専用AI動画ツールに圧力をかける

Googleはワークフロー内での配置によって競争し、専門プラットフォームは依然として制作機能の深さで競争しています。

AIアバター企業は、Googleがこの市場へ参入する前から、明確な価値提案を確立していました。顧客は、台本を書き、プレゼンターを選択または作成し、従来型の撮影を調整することなく、洗練された動画を生成できました。研修、オンボーディング、営業支援、多言語コミュニケーションが一般的な用途となりました。

Googleは今や、その基本的な仕組みをVids内で提供しています。さらに重要なのは、チームがすでに台本を作成し、素材を保存し、フィードバックを求め、アクセスを管理しているスイートに、その仕組みを接続していることです。従業員は、ドキュメントを書き出し、別のアカウントを作成し、権限を再設定してから、完成したファイルを元のワークスペースへ戻す必要がありません。

この配置は、SynthesiaやHeyGenなどの専用製品に圧力をかけます。また、Adobe FireflyやCanvaなどの汎用クリエイティブプラットフォームにとっても脅威となります。各競合企業は異なる出発点からAI動画に取り組んでいますが、いずれも、ユーザーが既存の生産性向上環境を離れるべき理由を説明しなければなりません。

専門ツールには、依然として明確な優位性があります。専用のアバタープラットフォームは、より大規模なプレゼンターライブラリ、翻訳ワークフロー、音声制御、テンプレート、分析、ブランドガバナンス、動画に特化した配信機能を提供できます。インタラクティブなアバターや、学習システムおよびカスタマーサポート向けの統合機能を提供するものもあります。

プロ向けのクリエイティブソフトウェアも、より高度な手動制御を提供します。熟練した編集者には、正確なタイミング、レイヤー化された音声、詳細な色補正、素材管理、フレーム単位の調整が必要になる場合があります。プロンプトベースの編集は、一部の作業を高速化できますが、こうした要件を置き換えるものではありません。

Googleのターゲットは、より幅広く、専門性の低い層です。Vidsは、Docs、Sheets、Slidesと並ぶ職場向け制作アプリとして導入されました。この製品は、シーン単位の組み立て、コラボレーション、扱いやすい操作性を重視しています。特に適しているのは、動画で情報を伝える必要はあるものの、自分を動画編集者とは考えていない人々です。

職場向け動画の多くは、反復可能で構造化されたメッセージで構成されているため、この対象層は相当な規模に上ります。チームは、オンボーディング教材、ポリシーの説明、プロジェクトの振り返り、営業報告、製品デモ、経営陣からの発表などを制作します。こうしたプロジェクトでは、映画的な複雑さよりも、明確さと一貫性が求められます。

Googleは、Vidsを発表した際に、こうした用途のいくつかを紹介しています。カスタマーサービスチームは、サポート説明の1シーンだけを更新できます。経営陣は社内向けメッセージを収録できます。学習チームは研修を構築でき、プロジェクトチームは報告書を、より理解しやすい要約へ変換できます。

パーソナルアバターは、その位置づけをさらに明確にします。ストックのプレゼンターは一般的なコンテンツには適していますが、社内向けメッセージでは発信者とのつながりが希薄に感じられることがあります。実際のマネージャー、トレーナー、専門家をデジタル化すれば、スケジュール調整の負担をなくしながら、本人だと認識できるアイデンティティを維持できます。

この機能により、組織はコンテンツの作成と実際の収録を切り離すこともできます。分野の専門家は、修正のたびにカメラの前で演じることなく、テキストを承認できます。コミュニケーションチームは、最初のアバターを作成した後でも、日付、製品名、指示を修正できます。

この利便性は、既存の「AIスポークスパーソン」カテゴリーに圧力をかけます。従業員がスクリプト作成に使用するものと同じスイート内で、十分な品質のパーソナルプレゼンターを生成できるなら、専門サービスは明確に優れた成果か、より包括的な運用システムを提供しなければなりません。

Googleは、基盤となるモデル群からも恩恵を受けています。Vidsはすでに動画生成にVeo、音楽生成にLyriaを使用しています。Geminiはスクリプトやプロジェクトの構成を支援できます。SynthIDは、複数のメディア形式にわたって共通のウォーターマーク手法を提供します。

したがって、競争の全体像はVidsの単一機能だけにとどまりません。Googleは、モデル、アイデンティティ、アカウント管理、ストレージ、コラボレーション、公開を連携させることができます。独立型プラットフォームは、その環境と統合するか、環境から離れることで十分な付加価値が得られると顧客に納得させる必要があります。

専門プロバイダーにも対抗手段はあります。多くの企業は、多言語配信、ブランドテンプレート、承認システム、分析、学習プラットフォームとの統合を重視しています。調達チームは、生成品質だけでなく、ガバナンスやサポートも比較します。動画専門企業は、特定の制作ニーズに対してより迅速に対応することもできます。

それでも、Googleは基準を変えます。かつては別のプラットフォームを導入する根拠となっていた機能が、生産性向上サブスクリプションに当然含まれる要素になる可能性があります。そうなれば専門サービスは、より価値の高い管理機能、業界特化型ワークフロー、または測定可能なビジネス成果へと軸足を移さなければなりません。

パーソナルアバターは利便性とアイデンティティリスクを不可分にする

デジタルプレゼンターは、アイデンティティを再利用可能な制作基盤に変えることで、収録時間を短縮します。

このトレードオフは、アバターが話す姿を見る目新しさ以上に注目されるべきです。パーソナルアバターは、ユーザーの顔、声、アカウントとの関係に依存します。これらの入力情報は、認識可能な人物を表すため、背景画像や生成された音楽トラックよりも機密性が高くなります。

Googleは、アカウント所有者本人がキャプチャ手続きを完了することを求めています。その手順では、管理された環境で顔と声を録画し、指示された頭の動きを行い、背景にほかの人物の顔が映らないようにすることが求められます。これらの確認は、本人の参加を確認し、不正な登録を減らすことを目的としています。

同社によると、ユーザーはアバターがどこで作成され、使用されたかを確認できます。また、Google Accountを通じて元の録画を削除できます。ただし、その録画を削除しても、アバターを使用してすでに作成または公開された動画が自動的に削除されるわけではありません。ユーザーは、該当するサービス内でそれらの出力を管理する必要があります。

この違いは雇用主にとって重要です。企業は、1人の従業員のアバターを使用して、研修、営業、方針説明用の動画を何十本も作成する可能性があります。その従業員が異動または退職した場合、組織には継続使用、削除、アーカイブ保存、差し替えに関するルールが必要です。

作成時の同意だけでは、その後に生じるすべての問題に答えられません。従業員は社内研修でのアバター使用には同意しても、顧客向け広告での使用には同意しないかもしれません。ある言語やスクリプトは受け入れても、別のものには異議を唱える可能性があります。再利用可能な肖像には、最初の収録後も有効であり続ける範囲管理が必要です。

書面による許可では、誰がスクリプトを作成できるか、誰が最終出力を承認するか、動画をどこに掲載できるか、いつまで有効かを明示する必要があります。また、組織には、必要な業務記録を失うことなく、将来の使用許可を取り消すためのプロセスも必要です。

正確性も別の問題を引き起こします。リアルなアバターは、話者がその具体的なパフォーマンスを収録していなくても、承認されたテキストを本人による新たな発言のように感じさせる可能性があります。視聴者は、表現されている人物が口調、タイミング、表情、周囲の文脈を選んだと考えるかもしれません。

明確な表示は、その曖昧さを軽減できます。GoogleのSynthIDウォーターマークは機械検出可能なシグナルを提供しますが、目に見えないマークがすべての視聴者に自動的に伝わるわけではありません。アバターが実在する従業員を表す場合、職場では依然として、目に見える開示、文脈を説明する注記、または方針上の文言が必要になることがあります。

Google DeepMindは、SynthIDウォーターマーキングを、生成コンテンツに直接埋め込まれる知覚できないシグナルと説明しています。動画の場合、システムは生成されたフレーム全体にウォーターマークを配置し、切り抜き、フィルタリング、フレームレートの変更、圧縮といった一般的な編集後も検出可能な状態を保つことを目指しています。

これは出所確認に役立ちますが、Google自身も、SynthIDがAI識別に対する完全な答えではないと注意を促しています。検出は、互換性のあるツールと対応する出力に依存します。ウォーターマークは、Google AIが素材を生成または変更したことを示せますが、スクリプトが承認されたか、文脈が誤解を招くものか、配布が許可されていたかを説明することはできません。

真正性と許可の違いは極めて重要です。検出器は合成による制作を識別できても、メッセージの正当性を検証できない場合があります。誰かがアクセス権を取得したり、付与された権限を逸脱したり、承認された文脈の外でコンテンツを配布したりすれば、適切にウォーターマークが付けられたなりすましでも被害を引き起こす可能性があります。

したがって、アカウントセキュリティは動画ガバナンスの一部になります。組織は、強力な認証によってアバター対応アカウントを保護し、プロジェクトを開いたり変更したりできる人物を制限し、共有設定を確認する必要があります。スクリプトの承認には、アバター自体へのアクセスと同じレベルの注意が必要です。

Googleによる地域および年齢の制限は、同社がこうした懸念の一部を認識していることを示しています。パーソナルアバターは一部の地域では利用できず、ユーザーは成人でなければなりません。アカウント所有者本人の肖像に限定することで、公人や同僚の無許可の複製を作成する当面の可能性も抑えられます。

しかし、組織はこれらの管理機能を方針の代替として扱うべきではありません。地域ごとにプライバシーや雇用に関する規則は異なります。顔や声の情報は特別な法的保護の対象となることがあり、職場での同意には消費者の同意にはない複雑さが伴う場合があります。

品質も不確定要素の一つです。Googleは、パーソナルアバターが作成者本人のような外見と声を持つと述べていますが、この発表には、類似度、リップシンク、感情表現の幅、スクリプト間の一貫性に関する独立したベンチマークは示されていません。パフォーマンスは、収録条件、言語、入力品質、シーンの複雑さによって異なる可能性があります。

Gemini Omniによる編集にも同じ注意が必要です。自然言語による修正は簡単そうに聞こえますが、変更後もアイデンティティ、製品の詳細、ロゴ、テキスト、連続性が維持されるかをユーザーが検証する必要があります。背景の差し替えによって安全標識や製品の操作部が変われば、効率的なワークフローが正確性の問題へと変わりかねません。

責任ある姿勢とは、拒絶することでも、自動的に信頼することでもありません。パーソナルアバターは、特に管理された頻繁に更新されるコミュニケーションにおいて、繰り返し発生する制作作業を削減できます。同時に組織は、再利用可能なデジタルアイデンティティをどこで使用し、どこでは人間による収録が引き続き必要なのかを定義する必要があります。

Google Vidsのアップデートが今後証明すべきこと

導入状況、ガバナンス、競合他社の対応によって、Vidsが職場の標準的なメディアになるのか、それとも時折使われるだけのWorkspaceツールになるのかが明らかになります。

最初の指標は、リリース後の継続的な利用です。Googleによると、Veo生成クリップの導入後、Vidsの月間アクティブユーザー数は2025年8月に100万人を超えました。今後の情報開示では、Gemini Omniとパーソナルアバターが、一度限りの試用ではなく、継続的な制作を増加させるかを示す必要があります。

利用可能なアカウント数そのものよりも、利用頻度の方が重要です。組織が一度アバターを試しただけで、まったく公開しない可能性もあります。研修内容の更新、製品リリース、営業支援、社内コミュニケーションで繰り返し使用されれば、より確かな成果といえます。

管理者は、プロジェクトが下書きから承認済みの配信へと進んでいる証拠に注目すべきです。有用な指標には、繰り返し制作するユーザーの数、修正サイクル、公開された動画、再利用されたアバターなどがあります。Googleは、新しいリリースについてこれらの指標を公表していません。

2つ目の指標は、Googleがアイデンティティ管理をどのように拡充するかです。現在のドキュメントでは、アカウント所有権、元の録画の管理、年齢制限、地域ごとの提供状況、肖像に関する制限が説明されています。企業の購入担当者には、承認、取り消し、保存、監査、従業員の退職に関する、より明確な運用管理機能が必要です。

意義のある改善としては、管理者がアバターの使用場所や、そのアバター用のスクリプトを提出できる人物を定義できるようにすることが挙げられます。堅牢な監査記録では、どのアカウントがクリップを作成し、どの元アバターが使用され、誰が公開を承認したかが示されるでしょう。こうした管理機能は、パーソナルアバターがビジネスワークフローに適しているというGoogleの主張を裏付けます。

ガバナンスが脆弱であれば、機密性の高い用途での導入は制限されます。法務、人事、財務、医療、広報の各チームは、非公式な同意に頼ることができません。方針管理の大部分が手作業のままであれば、組織はこの機能を低リスクのコンテンツに限定する可能性があります。

3つ目の指標は、専門競合企業の対応です。AI動画を専門とする企業は、多言語出力、インタラクティブなプレゼンテーション、分析、ブランド管理、編集精度、業界固有の管理機能を改善することで、自社の地位を守ることができます。また、Workspaceを置き換えようとするのではなく、より深く統合することもできます。

AdobeとCanvaも同様の選択に直面しています。Googleが利便性やビジネスコンテンツとの近さを重視する一方で、両社はプロフェッショナル向けのクリエイティブ管理や、より広範なデザインシステムを強調できます。チームが1つの統合環境を好むのか、それともより強力な専門ツールの組み合わせを好むのかは、市場が明らかにするでしょう。

Googleによる2026年4月のVidsの機能拡張は、機能群がどれほど迅速に拡大し得るかをすでに示しています。このリリースでは、Veo 3.1による生成、カスタマイズ可能なアバター、生成音楽、画面収録、YouTubeへの公開が追加されました。Gemini Omniは現在、対話形式の作成と修正を通じて、これらの機能をさらに密接に結び付けています。

結果はまだ不明でも、方向性は明確です。Googleは、動画をプロンプトで作成し、共同で修正できる、日常的なWorkspaceドキュメント形式の一つにしようとしています。パーソナルアバターは、発信者をそのドキュメントの再利用可能な構成要素に変えます。

ナレッジワーカーにとって、当面の問いは実務的なものです。どのメッセージが動画によって本当に効果を高められ、どのメッセージは検索可能なテキストのままにすべきでしょうか。生成されたプレゼンターは研修を親しみやすくできますが、短い最新情報を、確認に時間がかかり、修正しにくい形式に変えてしまう可能性もあります。

チームは、最終的なメディアと併せて、スクリプト、情報源、承認、意思決定を保存すべきです。構造化されたAIワークフローを使用すれば、洗練されたアバターによって出力が実際以上に確定済みであるように見える場合でも、それらの資料の追跡可能性を維持できます。

まずは、定期的な社内向け最新情報や、事実が安定しているオンボーディングモジュールなど、範囲を限定したユースケースから始めます。節約できた時間を、修正作業、承認の負担、視聴者の反応と比較してください。そのうえで、Gemini Omniが複数回の編集を経ても重要な詳細を維持できるかを検証します。

Google VidsによるGemini Omniとパーソナルアバターの提供開始は、単なる新たなモデルリリースではありません。職場向け動画がスライド資料と同じように編集可能で、反復利用でき、共同制作できるものになるかを試す取り組みです。継続的な利用状況、アイデンティティガバナンス、専門家の反応に注目してください。これらのシグナルを総合すれば、Googleが制作の基準そのものを変えたのか、それとも初稿の作成を容易にしただけなのかが明らかになるでしょう。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page