Googleは一貫性ある長尺動画生成を自動化するが、本当の試練はデモ後に始まる
Googleは、一貫性ある長尺動画の生成を自動化するための、相互に連携した4つの研究システムを発表した。その中には、10分間にわたって動作するデモも含まれる。同社が狙うのは、生成動画における根強い課題だ。個々のクリップは説得力があっても、長いシーケンスではキャラクター、物体、場所が変化してしまうことが多い。
この発表は、純粋な画質から注目を移すものだ。Googleは現在、動画制作を、計画、記憶、生成、評価、改訂を含むオーケストレーションの問題として扱っている。その研究では、GeminiとVeoを、共通のクリエイティブ方針を維持し、シーンをまたいで何が起きたかを追跡する専門エージェントと組み合わせている。
このアプローチは、モノリシックな生成モデルを構築するチームや独立系のエージェント型制作ツールを開発するチームを含め、長尺AI動画に取り組むすべての企業に圧力をかける。もはや問われているのは、モデルが印象的な短いクリップを作れるかどうかではない。自動化システムが、プロットを進め、誤りを修正し、人間の指示を尊重しながら、物語内部の現実を維持できるかどうかだ。
Googleは4つの研究プロジェクトを一つの制作論にまとめた
Googleの中心的な主張は、長尺AI動画には、より長い出力ウィンドウを持つモデルだけでなく、管理された制作システムが必要だというものだ。
2026年9月24日、Google Researchは、Co-Director、CANVAS、A²RD、VQQAを、AI支援による制作プロセスを補完し合う要素として発表した。これらのシステムは、クリエイティブな計画、ビジュアルのストーリーボード、セグメント生成、品質管理に対応する。
研究発表では、GeminiとVeoを中心に構築されたオーケストレーション層が説明されている。これは高レベルのクリエイティブ仕様を受け取り、その意図を制作上の判断へと変換し、反復的なフィードバックループを通じて生成メディアを評価する。
これは単純なプロンプト連鎖とは異なる。線形パイプラインでは、脚本を生成し、画像を作成し、それをアニメーション化し、音声を追加し、結果を組み立てるかもしれない。初期の画像でキャラクターの衣装を誤れば、後続のすべての要素がその誤りを引き継ぐ可能性がある。
Googleはこれをカスケード障害と呼ぶ。最終的な欠陥は複数の段階を経て初めて目に見えるため、原因の特定が難しい。修正には、プロンプトの書き直し、アセットの再生成、依存するすべてのシーンの確認が必要になる場合がある。
これに対し、GoogleのAI動画コディレクターは、制作をグローバル最適化問題として捉える。専門エージェントが制作を開始する前に、オーケストレーターがクリエイティブ戦略、物語構造、視覚表現を選択する。
多腕バンディットは、新しい選択肢の試行と成功した選択肢の再利用のバランスを取るアルゴリズムであり、利用可能なクリエイティブ構成を探索する。その判断は、プリプロダクション、キーフレーム生成、動き、音声、最終評価を導く。
ポストプロダクションの判定役はマルチモーダル言語モデルであり、テキストだけでなく複数のメディア種別を評価できる。組み立てられた結果を、当初のクリエイティブ上の評価軸に照らして採点し、構造化された報酬信号をオーケストレーターへ返す。
このフィードバックにより、最終クリップを単に修復するのではなく、戦略上の選択を見直す道筋が生まれる。この根底にある考え方は重要だ。多くの見かけ上の動画欠陥は、計画段階に起因する。パイプラインが後続シーンでどの衣装が属するかを記録していなければ、生成器は一貫した衣装を維持できない。
Googleによれば、このフレームワークは基盤モデルの上に位置し、概念上はモデル非依存を保つ。ただし公開された実装はGeminiとVeoを使用しているため、最も強い証拠はGoogle自身のスタックに結び付いている。
このシステムは、これらのメディアモデルからSynthIDウォーターマーキングも継承する。Googleは、個別には許容できるクリップでも、編集して組み合わせると問題のある表現になり得るため、本番デプロイでは完成動画全体に分類器を追加できると指摘する。
4つのプロジェクトは研究システムであり、新たに発表された消費者向け製品ではない。Co-DirectorとCANVASは学会発表が予定されており、関連論文ではアーキテクチャと評価の詳細が提供されている。
この区別は重要だ。Googleは説得力のある技術的仮説をまとめ上げたが、一般提供、サービス保証、ワークフロー統合、制作コストについては発表していない。
一貫性ある長尺動画生成の自動化はボトルネックを変える
新たなボトルネックは永続的な状態だ。システムは、何が存在し、何が変化し、何を変えてはならないかを記憶しなければならない。
短い動画を生成するモデルは、一つのプロンプトに含まれる情報と、生成フレームの限られた範囲に大きく依存できる。より長い物語では、複数の場所、衣装変更、物体、ストーリー上の出来事を経た後でも、キャラクターを記憶する必要がある。
Googleは、その結果として生じる失敗を、アイデンティティ・ドリフト、特徴ドリフト、コンテンツ崩壊として説明する。アイデンティティ・ドリフトはキャラクターの見た目の人物像を変えてしまう。特徴ドリフトは物体や場所を変質させ、コンテンツ崩壊では、物語が映像上は動いていても、ナラティブが停滞する。
CANVASは、完全な動画生成の前段階でこれらの問題に対応する。このシステムは、キャラクター、場所、物体、それらの変化する状態の構造化表現を維持しながら、ストーリーボードを作成する。
その永続的な視覚メモリには、後続シーンが取得できるアンカーが保存される。物語が美術館のホールに戻る場合、システムはテキストだけから新たな解釈を生成するのではなく、ホールの空間構成を復元できる。
このメモリは、意図的な変化と偶発的な不整合も分ける。物語上必要ならキャラクターは衣装を変えられるが、別の計画された変更が起きるまで、システムはその新しい衣装を維持しなければならない。
CANVAS論文は、最も強力なベースラインと比較して、背景の連続性が21.6%、キャラクターの一貫性が9.6%、小道具の一貫性が7.6%改善したと報告している。これらは、同システムが選択したベンチマークにおける著者報告の結果だ。
ベンチマークの一つであるHardContinuityBenchは、繰り返し登場する要素の間に意図的に長い間隔を設ける。キャラクターはアクセサリーを変える場合があり、相互作用する物体は変化し、物語がその場を離れた後でも環境は認識可能なままでなければならない。
この設計が試すのは、隣接フレーム間の滑らかさよりも厳しいものだ。一つのショットでは場所が安定して見えても、数シーン後に再登場した際には認識不能になり得る。
Googleの美術館強盗の例は、この違いを示している。基盤となるGeminiベースラインでは、アーティファクトと部屋のレイアウトが変化する。別のエージェント型ベースラインであるAutoStudioも、カットをまたぐとキャラクターと背景の詳細を失う。
CANVASは保存された視覚アンカーを用いて、盗賊、宝石、展示空間を復元する。Googleは、得られたストーリーボードが、連続する遷移と非連続の遷移の両方で一貫していると説明している。
この比較は明示的なメモリの価値を支持するが、管理された研究例にとどまる。読者は、すべてのジャンル、スタイル、カメラワーク、キャラクターデザインで同じ信頼性が得られると想定すべきではない。
永続的な状態はガバナンス上の問題も生む。制作チームは、何がメモリに入るのか、保存済みの参照がいつ更新されるのか、矛盾する指示をどのように解決するのかを把握する必要がある。
誤ったアンカーは、間違った詳細を異例なほど一貫して維持してしまう可能性がある。メモリはランダムなドリフトを減らす一方、システムがその状態を検知して修正しない限り、初期の誤りを永続化することもある。
これが、この発表の背後にあるより大きな逆転だ。長尺動画には、単により多くのフレームを生成すること以上が必要となる。連続性と意図的な変容を区別できるだけの構造を備えた、架空世界の編集可能なモデルが必要だ。
クリエイターにとって、これは従来のプロンプティングというよりも制作ドキュメントに近い。キャラクターシート、ロケーション参照、小道具の状態、ショットプランは、その後のあらゆる段階を導く機械可読なアセットとなる。
A²RDはメモリを生成ループの一部にする
Googleの10分間デモは、扱いやすいセグメントを生成しつつ、選択したコンテキストを次へ引き継ぐことに依存している。
Agentic Autoregressive Diffusionの略であるA²RDは、計画されたシーケンスをより長い動画へと変換する。自己回帰生成とは、システムが先行する出力の情報を用いて新しいセグメントを生成することを意味する。
単純な自己回帰動画は、時間とともに劣化し得る。小さな視覚的エラーが次のセグメントのコンテキストの一部となり、シーケンスが長くなるにつれて変異やレイアウト変更が蓄積される。
A²RDは、取得・合成・改良・更新のサイクルを用いる。セグメントを生成する前に、システムは視覚的および物語的コンテキストを含むマルチモーダルメモリから関連情報を取得する。
その後、候補を合成し、結果を評価し、セグメントを改良し、将来の生成に向けてメモリを更新する。これにより、誤りが残りのシーケンス全体に広がる前に介入できるチェックポイントが生まれる。
このシステムは、外挿と補間も切り替える。外挿は物語を新しい領域へ進め、補間は確立済みのキャラクター、物体、環境とシーケンスを再接続する。
この選択は、長尺生成における基本的な対立に対応する。アンカーへの依存が強すぎると物語は反復的になり得る。新規性が強すぎると、連続性が壊れる可能性がある。
Googleのデモは10分間にわたり、大きな間隔を置いて要素を再登場させる。同社によれば、A²RDは物語を継続させながら、キャラクターのアイデンティティ、衣装の詳細、環境構造を維持する。
A²RDの研究は、1分から10分の動画での結果を報告している。著者らは、選定した最先端ベースラインに対し、一貫性で最大30%、物語的一貫性で最大20%の改善を主張している。
これらの数値は有用だが、文脈が必要になる。「最大」は、すべてのベンチマークやシナリオにおける普遍的な向上ではなく、報告された最良の改善を示す。
A²RDはまた、キャラクターの変化、物体の変更、環境の新たな発見を含む120のテキストシナリオで構成されるLVBench-Cを導入している。重要な視覚アセットは、再登場する前に少なくとも10セグメントにわたって消失しなければならない。
この間隔ルールは、直近の時間的滑らかさではなく、長距離メモリを対象とする。多数の無関係なシーンが生成コンテキストを占めた後も、システムが重要な要素を想起できるかを試す。
他の研究者はこの問題に異なる形で取り組んでいる。MovieDreamerは、自己回帰的な視覚トークンと拡散レンダリングによる階層的計画を用いる。InfLVGは、固定された計算予算の中で保持すべき過去のコンテキストを学習する。
これらのアプローチには重要な共通前提がある。履歴全体を保持しながらすべてのフレームを生成するだけでは、十分でも必ずしも効率的でもない。長尺システムはコンテキストを整理し、関連する状態を取得し、何を忘れられるかを判断しなければならない。
Googleのアプローチが際立つのは、メモリシステムが協働するエージェント群のより広い枠組みの中で動作する点だ。ストーリーボード、生成、評価が、連続性の責任を一つの動画モデルにすべて負わせるのではなく、分担する。
この分担はオーバーヘッドももたらす。各取得、批評、再生成、メモリ更新は計算資源を消費する。Googleは発表の中で、完全な制作コストやレイテンシー分析を公表していない。
したがって、10分間の出力は、研究条件下でパイプラインが長いシーケンスを完了できることを証明する。スタジオが多数のバージョン、キャラクター、クライアント要件にわたって迅速に反復できることを示すものではない。
実際の試練は編集にあります。クリエイターが生成された長尺シーケンスをそのまま受け入れることはほとんどありません。ショットを差し替え、テンポを調整し、台詞を変更し、前後のシーンにも影響する修正を求めます。
実制作に耐えるメモリシステムには、意図的な編集を伝播させながら、影響を受けない素材を不安定にしない能力が必要です。現在の研究はその方向性を示していますが、Googleはエンドツーエンドのノンリニア編集ワークフローをまだ文書化していません。
Video CriticはPrompt Engineerでもある
VQQAは品質評価を能動的な修正プロセスへ変えますが、直接ピクセルを編集するのではなく、プロンプトを修正します。
従来の動画指標は出力を順位付けできても、改善方法までは説明できません。低いスコアは何かが失敗したことをシステムに伝えますが、風船の素材が誤っているのか、音楽家が楽器を持ち替えてしまったのかまでは示しません。
Video Quality Question Answering、すなわちVQQAは、出力について的を絞った質問を生成します。視覚言語モデルがその質問に答え、観察結果を自然言語によるガイダンスへ変換します。
Googleはこのフィードバックをsemantic gradientと呼んでいます。モデル学習における数値勾配に似た役割を果たしますが、言語を用いて修正の方向性を記述します。
このシステムは、意図した被写体が登場しているか、属性が正しい対象に属しているか、あるいは場面転換をまたいでキャラクターの役割が安定しているかを尋ねられます。その後、プロンプトを書き換え、別の候補を生成します。
これはGoogleの動画生成の仕組みを理解するうえで重要です。VQQAはブラックボックス最適化器であり、動画モデルの内部重みや活性化データにアクセスする必要がありません。
この設計により、評価レイヤーは異なる生成器と連携できます。同時に、利用可能な修正の種類も限定されます。VQQAは、隣接するすべてのフレームを保ったまま、ある1フレームだけを直接修復することはできません。
代わりに、改善されたプロンプトから新しい出力をサンプリングするよう生成器に求めます。その修正によって元の欠陥は解決しても、別の問題が導入される可能性があります。
Googleはこのリスクにグローバル選択で対処します。別の評価器が最適化軌跡全体から候補をレビューし、元の未編集のリクエストと比較します。
このシステムは、最終改訂版が必ず優れていると仮定するのではなく、総合的に最良の候補を選択します。これにより、局所的な修正がより広い構図を密かに弱める可能性を減らします。
ある例では、直方体の風船が求められます。ベースラインは説得力のある風船素材を欠いた硬い立方体を描画する一方、VQQAで改訂されたプロンプトは、継ぎ目と反射性のあるマイラー素材の質感を持つ箱型の物体を生成します。
別の例には、女性ピアニストと男性バイオリニストが登場します。ベースラインではカット後に誰がどの楽器を演奏しているかが入れ替わりますが、洗練された生成では役割が維持されます。
VQQA paperは、未精緻化の生成と比べて、T2V-CompBenchで11.57パーセント、VBench2で8.43パーセントの絶対的な向上を報告しています。著者らによれば、この向上は少数のリファインメント手順の後に得られます。
VQQAが魅力的なのは、モデルによる批評を理解可能にする点です。人間は生成された質問を確認し、なぜシステムが再試行を求めたのかを理解できます。
ただし、評価器もAIモデルです。欠陥を見落としたり、芸術的意図を誤解したり、感情的な効果を弱めつつベンチマーク適合性を高める変更を評価したりする可能性があります。
このフレームワークには、視覚言語モデルが判断しやすい出力へ収束するリスクもあります。曖昧さ、視覚的メタファー、型破りなブロッキング、意図的な不連続性は、自動批評器にはエラーのように見える場合があります。
したがって、人間による演出は初期プロンプト作成以上に必要です。どの不整合が意味を持つのか、どの奇妙な構図が意図的なのか、最適化によって何か価値あるものが失われたのはいつなのかを、クリエイターが判断しなければなりません。
Googleはhuman-in-the-loopワークフローを探求していると述べていますが、この表現は複数の制御モデルを含みます。クリエイターはすべてのストーリーボードを承認することも、フラグが立ったエラーの後にだけ介入することも、メモリ状態を直接変更することもできます。
この違いは、システムが制作アシスタントのように感じられるのか、ときどき許可を求める自律的なプロセスのように感じられるのかを左右します。
ベンチマークが示すのは進歩であり、実制作への準備完了ではない
Googleの結果はエージェント型動画オーケストレーションの研究上の根拠を示しますが、その向上が実際の制作制約のもとでも維持されるかは、独立した利用によって判断されます。
この発表では、長尺コンテンツの品質を単一の尺度に還元できないため、複数のベンチマークを導入または利用しています。キャラクターの連続性、環境の安定性、物語の進行、動き、プロンプトへの忠実性は、それぞれ独立して失敗する可能性があります。
GenAD-Benchには、4製品ずつを持つ50の架空ブランドにまたがる400のシナリオが含まれます。よく知られた著作権保護ブランドに依存せず、Co-Directorシステムがマーケティング上の制約に従うかを評価します。
Googleは、このベンチマークで最高品質スコア81.4を報告しています。Co-Director paperによると、このフレームワークはグローバルな創造的探索とローカルなマルチモーダル精緻化によって、選定したベースラインを上回っています。
HardContinuityBenchは、繰り返し登場するシーンと視覚状態に焦点を当てます。LVBench-Cは長い間隔をまたぐ変化する特性を扱います。既存のスイートは、構成の正確性、動き、画像から動画への一貫性を測定します。
これらの評価を組み合わせることで、ハイライト映像よりも多くの情報が得られます。異なる失敗モードを明らかにし、コード、プロンプト、設定が利用可能になれば比較の再現も容易になります。
それでも、証拠の多くはGoogle中心のシステムをGoogleの研究者が評価したものです。複数のベンチマークは、検証対象の手法と並行して作成されました。
これは結果を無効にするものではありません。ただし、特に評価器に、制作スタックと好みを共有する可能性がある言語モデルや視覚言語モデルが含まれる場合、独立した再現が重要であることを意味します。
テストシナリオも、プロの映像制作に伴うあらゆる複雑さを再現することはできません。実際のプロジェクトには、改訂された脚本、ライセンス済み素材、俳優の肖像利用許可、クライアントからのフィードバック、変化するアスペクト比、厳密な納品要件が関わります。
連続性は制作基準の一つにすぎません。台詞のタイミング、サウンドデザイン、演技、カメラ文法、法的クリアランス、文化的文脈、編集上の意図が、映像を使用可能にするかを決定します。
Googleのシステムは、創造的な合成と一貫性の強制も分けています。この分割は技術的には有用ですが、制作チームが気にするのは、各最適化ループを通じてどれだけの制御が維持されるかです。
監督は、姿勢、年齢、照明、感情表現を変えながらも、キャラクターが視覚的に認識できる状態を望むかもしれません。あまりに多くの属性を固定するメモリシステムは、表現の幅を可能にする代わりに狭める可能性があります。
自動判定器が「最良」の結果を選択する場合、リスクはさらに高まります。一貫性の低い候補のほうが物語をより効果的に伝えていても、スコアは一貫性を優遇することがあります。
したがって、この発表は創造上のトレードオフを取り除くものではありません。それをメモリスキーマ、評価器のプロンプト、報酬要因、選択ポリシーへ移し替えるものです。
安全性にも同様の精査が必要です。SynthIDは生成メディアの来歴シグナルを提供しますが、ウォーターマーキングですべてのリスクが解決されるわけではありません。なりすまし、著作権で保護されたスタイル、誤解を招く文脈、有害な物語の組み合わせに関するリスクは残ります。
Googleは、個別には安全なクリップでも、組み合わせることで危険な意味を生み出し得ることを認めています。最終動画分類器という提案は、長尺コンテンツの安全性がシーケンスレベルの問題であることを認識したものです。
同じ原則は事実コンテンツにも当てはまります。洗練された解説動画は、視覚的な連続性を完璧に保ちながら、不正確な物語を提示することがあります。技術的な整合性は真実を保証しません。
このアプローチを検討する企業は、デモ品質と運用上の信頼性を分けて考えるべきです。失敗率、改訂コスト、所要時間、制御インターフェース、そしてブランド資産が繰り返しの実行を通じて正しく維持される証拠が必要です。
こうした詳細は、発表時点ではまだ利用できません。Googleが公開したのは研究アーキテクチャとベンチマーク結果であり、実制作サービスの契約内容ではありません。
GoogleのAI Video Co-Directorが次に証明すべきこと
次の段階は、独立した再現性、編集可能なワークフロー、そして反復的な精緻化の経済性によって評価されます。
最初のシグナルは、より広範な技術アクセスです。研究者には、Googleが好んで示す事例の外で4つのシステムを検証するために、十分なコード、ベンチマーク資料、プロンプト、設定の詳細が必要です。
未知の生成器や創作ジャンルにおいても連続性の向上が再現されれば、独立した結果はこの主張を強化します。大幅な性能低下が見られれば、オーケストレーションレイヤーが慎重に選ばれたモデルやタスクに依存していることが示されます。
2つ目のシグナルは、クリエイター向けの編集ワークフローです。有用なシステムは、動画全体を作り直さずに、1ショットの差し替え、オブジェクト状態の修正、物語後半の展開変更を可能にしなければなりません。
ローカル編集が成功すれば、持続的メモリがデモだけでなく実制作を支えられることが確認されます。小さな修正が広範な再生成を引き起こすなら、このワークフローは高コストで予測不能なままです。
3つ目のシグナルは、運用効率です。テスト時の探索、複数のエージェント、評価器の呼び出し、反復生成は、各結果により多くの計算資源を使うことで品質を高めることができます。
Googleは、このコストを手作業による修正や代替の長尺動画手法と比較するための十分な情報を提供していません。レイテンシと再生成回数が、どのプロジェクトでこのアプローチを日常的に利用できるかを決定します。
これらのシグナルは、映像制作以外でも重要です。マーケティングチームは、繰り返し登場する製品を使ったキャンペーンに長尺システムを活用できるかもしれません。研修部門はシナリオベースの教材を作成でき、ゲームスタジオは物語シーケンスのプロトタイプを制作できます。
ナレッジワーカーも、より大きな検証負担に直面する可能性があります。自動化された制作は、より整合性の高いプレゼンテーションや解説を生成できるため、視覚表現が一貫しているという理由で、弱い主張がより信頼できるように見えることがあります。
チームには、追跡可能なソース資料、レビューのチェックポイント、整理された創造的判断が必要になります。personal knowledge baseは参照資料と承認を保持する助けになりますが、編集上の判断を代替することはできません。
Googleのより大きな貢献は、問題定義を変えたことです。整合性のある長尺動画生成を自動化するとは、物語全体にわたり、メモリ、計画、メディア合成、批評、改訂を調整することを意味します。
これは、1つの生成器により長い秒数の継続を求めるよりも強力な制作モデルです。同時に、失敗、衝突、誤った目的の最適化が起こり得るコンポーネントも増えます。
クリエイターは、何が長くなるかだけでなく、何が編集可能になるかに注目すべきです。また、連続性が自分たちの資産、改訂、品質基準のもとでも維持されるかを問うべきです。
10分間のデモンストレーションは、到達可能な上限が動いていることを示しています。決定的な試験は、外部チームがプロセスを中断し、考えを変え、それでも物語を完成できるようになったときに始まります。



