ByteDance Seedance 2.5、動画尺を2倍に拡大。ただし本当の試練は制御性
ByteDanceは、ネイティブで30秒の動画を生成できるSeedance 2.5を公開した。従来の上限を2倍にする一方で、クリエイターには制作プロセスのより多くを単一モデルに委ねるよう求める内容だ。
長尺クリップは、この発表を簡潔に要約しやすいポイントである。しかし重要な変化は、尺の延長だけではない。ByteDanceは参照入力も拡張し、タイムスタンプベースの編集を導入。動き、カメラ位置、グリーンスクリーン映像に対する制御も強化した。
これらの変更により、同モデルはクリップ生成器から制作ワークスペースへと位置付けを変える。単発のデモ品質ではなく、制御性で競うGoogle Veo、Runway、Klingなどのシステムにも圧力がかかる。
ByteDanceは2026年7月31日にこのリリースを発表した。モデルはJimeng AIとDoubao Professionalを通じて展開され、Volcano Ark経由のAPI提供は後日予定されている。
中心的な問いは、AIモデルが印象的なショットを生成できるかどうかではなくなった。そのモデルが、複数のショット、編集、参照アセット、繰り返しの延長にまたがって、創造上の決定を維持できるかどうかである。
Seedance 2.5、15秒クリップから30秒の物語へ
ByteDanceがモデルに求めているのは、単に生成ショットを長く動かし続けることではなく、一連のシーケンスを構成することだ。そのため、尺の倍増には意味がある。
公式のSeedance 2.5リリースによると、1回の生成で30秒の音声付き動画クリップを生成できるようになった。従来モデルが対応していたのは、4秒から15秒のクリップだった。
ByteDanceによれば、新バージョンはこの時間枠の中で、論理的につながる複数のショットを配置できる。シーケンスは舞台を示し、アクションを進め、展開を加え、結末を届けられる。
この主張は、物語としての長さと、単純な時間的な長さを分けて考えるものだ。ひとつの被写体に30秒間カメラを向け続ければ、技術的には長い動画になる。だが、必ずしも一貫したシーンになるわけではない。
同社のデモのひとつでは、歌手を楽屋からバックステージの通路を経てコンサートステージまで追う。カメラ位置が変わり、音声がアクションに合わせて続くなかで、登場人物たちは相互に関わる。
このシーンは複数の課題を同時に試す。歌手は外見を維持し、場所は論理的に変化し、音は移動を通じて同期を保たなければならない。
ByteDanceは、ユーザーが生成結果を複数回にわたって延長できるとも説明している。各延長では、被写体、環境、テンポ、ビジュアルスタイル、音を保ちながら、さらに30秒を追加できる。
原理上、繰り返し延長すれば数分間にわたるつながった素材を制作できる。実際には、セグメントを追加するたびに、アイデンティティ、空間構造、物語上の整合性が崩れる新たな機会が生まれる。
そのため、尺という数字は完全な品質指標ではなく、出発点となる主張として捉えるべきだ。30秒間にわたり意図を維持できるモデルは、無関係な15秒クリップを2本生成するモデルより難しい問題を解いている。
前世代との比較は、その規模をより明確にする。公開されたSeedance 2.0論文は、480pおよび720pで最大15秒のネイティブ音声付き動画出力を説明していた。
同モデルは、最大9枚の画像、3本の動画、3本の音声クリップを参照として受け付けた。すでに単一アーキテクチャ内で、マルチモーダル生成、編集、継続を提供していた。
したがってバージョン2.5は、既存の設計を置き換えるのではなく拡張するものだ。ByteDanceは統合された音声・映像アーキテクチャを維持しつつ、調整すべき時間と文脈の量を増やした。
実用面での目標は、生成、つなぎ合わせ、音声修正、連続性補正の間で発生する受け渡しを減らすことだ。成功すれば、短い物語のために必要な分断されたツールの数を減らせる。
ただし、ByteDanceは繰り返し延長に関する独立した成功率を公表していない。また、許容できる結果を得るまでにユーザーがどの程度シーンを再生成する必要があるかも示していない。
このリリースは、選別されたプロンプトにおける長尺出力を実演している。多様な被写体や制作スタイルで、一般的なユーザーがその品質をどれほど安定して再現できるかを証明するものではない。
この隔たりが、モデルに対するあらゆる本格的な評価を左右する。30秒という長さに価値があるのは、クリエイターがその30秒の中で何が起きるかを予測できる場合に限られる。
長い実行時間以上に重要なマルチモーダル参照
参照枠の拡大により、プロンプトは意図した結果の一部を各アセットに割り当てる、クリエイティブブリーフの組み立てに近づく。
1回のリクエストには、最大30枚の画像、10本の動画、10本の音声クリップを含められる。これは、前世代で文書化されていた参照上限から大幅な増加だ。
長いテキスト説明を必要とせず、これらの入力に異なる指示を持たせられる。ある画像はキャラクターを定義し、別の画像は場所を設定し、動画は動きやカメラのリズムを提供できる。
音声参照は、声、音楽、音の特徴を導くことができる。そのうえでモデルは、記述プロンプトに従い、素材間の衝突を避けながら、これらのシグナルを組み合わせなければならない。
このアプローチは、テキストのみの制御が持つ根本的な限界を反映している。プロンプトで衣装を説明することはできても、参照画像に見える色、質感、縫い目、比率をすべて捉えられることはめったにない。
動きでは同じ問題がさらに難しくなる。「自然に動く」「ダイナミックなカメラを使う」といった表現では、多くの決定が未解決のまま残る。
参照動画は、タイミングと軌跡を直接伝える。要求された動きが時間の経過とともにどのように見えるのか、モデルに例を示すことになる。
ByteDanceによると、このシステムは参照アセットを構図、キャラクター、小道具、場所、スタイル、声、動き、カメラ挙動に利用できる。また、ひとつのシーン内で複数の参照被写体を維持することも可能だ。
公式例のひとつでは、会場、歌手、ピアニスト、個々の楽器、オーケストラ、合唱団、観客の参照を用いてコンサートを構成する。プロンプトは、30秒の演奏にわたってこれらの要素を調整する。
この例は、可能性と難しさの双方を示している。参照容量が増えれば具体性を高められる一方、モデルが維持すべき関係の数も増える。
モデルは、どの詳細が結び付くべきで、どれが独立して維持されるべきかを理解しなければならない。キャラクターの顔が、照明参照の空間構造や別キャラクターの声を引き継ぐべきではない。
このリリースは、競合する入力に関する公開の失敗分析を提供していない。参照アセットが異なる内容を示唆する場合、システムが記述指示をどのように優先するかは依然として不明だ。
この不確実性は、プロフェッショナルな仕事において重要になる。クリエイティブチームは、しばしば不完全な素材、一貫しないドラフト、異なる段階で承認されたアセットを扱う。
反復可能なワークフローの中で機能するには、Seedanceがこうした衝突を予測可能に解決しなければならない。特定のブランド要素に厳密な準拠が求められる場合、魅力的な折衷案を作るだけでは不十分だ。
ByteDanceは「ホワイトモデル」の参照サポートも拡大した。ホワイトモデルとは、空間レイアウト、被写体の位置、移動経路、カメラ配置を定義するために使われる、テクスチャのない3Dシーンである。
クリエイターは、この簡略化されたシーンを構造上のガイドとして利用できる。生成器はその後、他の参照からキャラクター、素材、照明、色、雰囲気を適用する。
このワークフローは、生成動画と従来のプリビジュアライゼーションを橋渡しする。ディレクターは、記述言語で意図した演出が生まれることを期待する代わりに、ラフなジオメトリでブロッキングを指定できる。
ByteDanceによると、モデルはホワイトモデルの空間情報から照明も推論できる。これには光の方向、色温度、強度、影の配置が含まれる。
信頼性が高ければ、この機能はテキストプロンプトでは提供しにくいレベルの制御をクリエイターに与える。また、入力パッケージを制作仕様にかなり近いものにする。
競争上の変化は大きい。動画モデルは長年、視覚的なスペクタクル、プロンプト追従、短時間の動きの品質で競ってきた。
参照容量は競争の構図を変える。勝つシステムは、組織化されたクリエイティブ上の決定群を理解し、生成されるシーン全体でそれを維持しなければならない。
それはプロンプトに答えるというより、コンパクトな制作計画を実行することに近い。
精密編集がByteDanceのワークフロー戦略を支える仕組み
タイムスタンプ制御と対象を絞った編集は、生成を繰り返しの試行錯誤から、方向付けられた修正へ転換しうる機能だ。
生成システムでは、ユーザーがあと少しで許容できる結果を捨てざるを得ないことが多い。一瞬の軽微なエラーでも、全体を再試行する必要があり、その結果、別の箇所に異なる問題が生じることがある。
Seedance 2.5は、生成時にタイムスタンプベースの制御を加える。プロンプトでは、アクションの発生時刻、カメラの切り替え時点、定義された区間ごとのシーン進行を指定できる。
同じタイミングの概念は、生成後にも適用される。ByteDanceによれば、ユーザーはセグメントを選択し、そのキャラクター、アクション、音、視点、物語上の出来事を変更できる。
このシステムは、改訂された区間の前後で連続性を保つよう設計されている。編集が後続フレームに影響する条件を変えうるため、これは厳しい要件だ。
キャラクターが8秒時点で物体を拾った場合、その後も物体はキャラクターの手に残っていなければならない。局所的な視覚変更には、時間的な影響が伴う。
精密編集では、シーンの無関係な部分を書き換えずに、こうした影響を考慮しなければならない。これが、同社の制作に関する主張を支える中核的な仕組みである。
ByteDanceはカメラ編集も強調している。あるデモでは、被写体とアクションを保持したまま、元のカメラ挙動を、タイミングを指定したクローズトラッキング、横移動、俯瞰フレーミング、引きのショットの連続に置き換えている。
別の機能はグリーンスクリーン映像を対象とする。ユーザーは撮影済みの被写体を残しながら、背景、衣装、障害物、脇役を置き換えられる。
モデルは、置き換え後のシーンに合うよう物理的な効果を調整するとされる。髪の動き、衣服の向き、歩行リズム、照明、影は、新しい環境に応じて変化するべきだ。
これは一般的な背景除去を超える。意図される結果では、被写体と生成環境が同じ物理的シーンの一部として振る舞う必要がある。
参照編集では、既存の演技を維持しながら、その見せ方を変えることもできる。これによりクリエイターは、撮影済みの動きと生成されたプロダクションデザインを組み合わせる道筋を得る。
この価値は、とりわけ広告で明確になる。ブランドは、承認済みの演技を複数の環境で再利用しつつ、キャンペーンごとに設定の詳細を変えられる。
映画のプリビジュアライゼーションも別の用途となる。チームは、実写撮影にリソースを投入する前に、カメラ経路、キャラクターのブロッキング、照明、シーン転換を試せる。
教育コンテンツは、より単純なシナリオを提供する。教師は歴史的な舞台や科学的プロセスを時間指定された視覚シーケンスに変え、不正確なセグメントだけを修正できる。
ByteDanceによれば、このモデルはすでに教育、産業シミュレーション、ロボティクス、自動運転データでの活用が検討されている。これらは独立して検証された導入事例ではなく、あくまで同社が説明する用途である。
合成トレーニングデータには、固有の正確性要件がある。物理的に誤った産業シーケンスは間違った手順を学習させかねず、非現実的な運転イベントはモデル評価を歪める可能性がある。
その用途では、映画のような見栄えよりも、演出を直接指定できることの方が重要だ。生成されたシーンは、ただ一見もっともらしく見えるだけでなく、既知の条件を満たさなければならない。
ここでは、アセット管理も制作上の課題の一部になる。チームは、各生成出力に紐づくプロンプト、参照素材、承認、来歴、改訂判断を保持する必要がある。
検索可能なナレッジベースは、そのコンテキストを維持する助けになるが、生成された動画そのものを検証できるわけではない。
そのため編集システムは、評価基準も変える。レビュアーは、修正が局所的に留まるか、時間指定が守られるか、後続フレームの一貫性が保たれるかを測るべきだ。
洗練された初回結果にも価値はある。だが、繰り返し発生する業務にシステムを適用可能にするのは、制御できる二回目のパスだ。
Seedance vs Veoは制作コントロールをめぐる競争になりつつある
ByteDanceは、単一のプロンプトから見栄えの良いサンプルを生成するだけでなく、創作プロセスのより多くを公開するよう競合に圧力をかけている。
Google Veo、Runway、Klingなどの動画システムは、すでにリアリズム、音声、カメラワーク、指示追従で競争している。各社の能力と利用条件は、引き続き急速に変化している。
ByteDanceの戦略的な動きは、長尺生成、大規模な参照セット、延長、編集を単一のモデルファミリーにまとめることだ。これにより、制作と修正の区別が小さくなる。
これは、競合ツールに編集機能がないという意味ではない。競争単位が、生成されたクリップから、素材の入力から承認済みの成果物に至る完全な経路へと移りつつあることを意味する。
制作者にとっては、再現可能なコントロールを提供するなら、名目上は性能が劣る生成器の方が有用な場合がある。視覚的に優れたモデルでも、改訂のたびに無関係な細部が変われば時間を失う。
圧力がかかるのは、短く独立した生成を中心に据えるあらゆるシステムだ。30秒のネイティブ出力では、一度のリクエスト内で、会話、人物配置、カメラ遷移、物語の進行により多くの余地が生まれる。
同時に、失敗の余地も広がる。長いシーンでは、アイデンティティ、物体の永続性、物理的な相互作用、発話、テンポ、空間的連続性に関する問題が増幅される。
ByteDanceは一部の限界を公然と認めている。同社のリリースでは、複雑な物理運動や非常に多数の被写体間の相互作用には、なお改善が必要だとしている。
この認識は重要だ。参照の拡張は、まさにそのような複雑なシーンを促すからだ。アセットが増えれば、制作者はより多くの人物、場所、協調した動作を求めるようになる。
前世代に関する研究も、慎重さを求める理由を与えている。CLVG benchmarkは、物理、論理、インタラクティブなタスクにまたがる動画生成のコンテキスト学習を評価した。
著者らは、Seedance 2.0を含む主要システムが、論理的根拠を必要とする生成とインタラクティブな生成で低い性能を示したと報告している。あるカテゴリでは成功率が25%を下回り、別のカテゴリではほぼゼロに近づいた。
このベンチマークは新バージョンを評価していないため、その結果からSeedance 2.5の性能を断定することはできない。ただし、長尺で参照の多いシーンが解決しなければならない問題の類型は示している。
研究者らは、外部の視覚言語モデルがコンテキストを解釈し、指示を書き換えることで一部の結果を改善したとした。これは、オーケストレーションが生成器の弱点を補える可能性を示唆する。
ByteDanceも、より豊富なコンテキストと明示的な時間指定をモデルに与えることで、類似した製品方向を追求している可能性がある。ただし同社は、その推論を確認するのに十分な技術的詳細を公表していない。
したがって、VeoやRunwayとの比較で単一の勝者を決めるべきではない。公開デモでは、プロンプト、インターフェース、解像度、安全フィルター、選定手法が異なる。
公平なテストでは、同一の参照パッケージと物語仕様をシステム横断で使用する必要がある。レビュアーは、試行回数、局所編集の成功、連続性の破綻、使用不能なフレームを数える必要がある。
出力品質は引き続き一つの指標だ。より意味のある制作指標は、承認済みシーンあたりの信頼性になる。
APIの提供状況も重要になる。クリエイティブソフトウェア企業には、文書化された制限、予測可能なレイテンシー、安定したモデルバージョン、出力の商用利用許可が必要だ。
7月のリリースは当初、中国におけるByteDance自身のアプリケーションへユーザーを誘導している。同社はVolcano Ark APIへのアクセスが後に続くとしているが、発表では確定日を示していない。
この段階的な展開は、多くの海外開発者にとって即時比較を制限する。同時に、広範なインフラ需要が到来する前に、ByteDanceがユーザー行動を観察する時間も与える。
その結果、競争上の主張は依然として一部が未検証のままだ。ByteDanceは異例に広いコントロール領域を構築した一方、制作上の信頼性には独立した証拠がなお必要だ。
長尺AI動画は著作権と同意の問題も拡大させる
参照素材の扱いが改善されれば創作上のコントロールは高まる一方、来歴、許諾、アイデンティティ保護の重要性も増す。
このシステムは、画像、動画、音声、キャラクター参照、声、撮影済みの演技を受け付ける。各入力には、提出者が保有していない権利が含まれている可能性がある。
モデルは許可を確認せずに顔や声を技術的に再現できる。精密な参照素材が利用可能であっても、それらの法的地位が解決されるわけではない。
この問題は、すでに前回のリリースを取り巻いていた。Hollywoodの団体は、ByteDanceの以前のモデルが、保護されたキャラクターやパフォーマーの無許可利用を可能にしていると非難した。
Motion Picture Associationは、Seedance 2.0が大規模に著作権保護された作品を無許可で利用したと述べた。SAG-AFTRAは、声と肖像に関する懸念を表明した。
ByteDanceは、知的財産権を尊重しており、安全策を強化していると回答した。このやり取りは、Associated Pressが報じたAI copyright disputeで記録されている。
現在の公式資料では、キャラクター参照のデモには生成された被写体、または適切にライセンスされた被写体を使用しているとしている。また、実在人物のポートレート参照には、本人確認または事前の法的許可が必要だとしている。
これらの条件は有用だが、リリースでは施行方法が十分に説明されていない。すべてのインターフェース、地域、APIクライアント、下流の統合にわたって、検証がどのように機能するのかは依然として不明だ。
長尺生成は、保護されたキャラクターや識別可能な人物を含む、より完成度の高いシーンを生成できるため、重要性を高める。編集コントロールは、そうしたシーンを特定のキャンペーンや物語に合わせて調整できる。
音声参照は、さらに別の層を加える。声のアイデンティティ、音楽権利、録音、演技への同意には、異なる権利者と異なる許可が関わり得る。
グリーンスクリーン編集も関連する疑問を生む。パフォーマーは一つの背景や物語には許可を与えても、録画された動きが登場し得るすべての生成コンテキストには許可を与えていない場合がある。
したがって、プロフェッショナルな導入は出力品質だけに依存しない。購入者には、来歴記録、アクセス制御、監査証跡、保持ポリシー、無許可素材を削除する実用的なプロセスが必要だ。
安全フィルターは、標的を絞った編集にも耐える必要がある。後から参照素材や局所的な改訂を通じて制限コンテンツを導入できるなら、初回リクエストをブロックするだけでは不十分だ。
これらの懸念は、モデルを責任ある形で利用できないことを証明するものではない。創作上のコントロールとガバナンスがともに進展しなければならない理由を示している。
より広い意味で、真実性に関する問題もある。明らかな視覚エラーが減るにつれ、同期した音声を伴うフォトリアリスティックな動画は、記録映像と誤認されやすくなる。
長いシーンは、捏造された出来事をより説得力のあるものにする物語的コンテキストを加えられる。連続したシーケンスは、短く曖昧なクリップよりも証拠性が高いように感じられることがある。
ウォーターマーキングとコンテンツクレデンシャルは役立ち得るが、その有用性は実装と保存に依存する。プラットフォームはメタデータを削除でき、一般の視聴者が共有前に来歴を確認することはほとんどない。
ByteDanceはこのリリースで、包括的な公開安全仕様を提示していない。それまでは、顧客は製品能力に関する主張とガバナンス上の保証を区別しなければならない。
企業の評価担当者にとって、来歴は連続性と並行してテストすべきだ。チームは、誰がアイデンティティをアップロードできるのか、同意がどのように記録されるのか、生成アセットがエクスポート後も追跡可能かを検証すべきである。
成功するモデルは、より多くの参照素材に従うだけでは不十分だ。正当なユーザーが、それらの参照素材を利用する権利を持っていたことを証明できるよう支援しなければならない。
30秒という賭けが成り立つかを示す3つのシグナル
次の試金石は、ByteDanceが選別されたデモを、API、通常のプロンプト、制御された改訂にわたる測定可能な信頼性へと変えられるかどうかだ。
最初のシグナルは、Volcano Ark APIのリリースだ。文書化されたAPIは、実際の長さ制限、参照サイズ、編集操作、出力形式、地域ごとのアクセス制限を明らかにする。
開発者は、完全な機能セットがリリース時に提供されるかを注視すべきだ。参照アセットが少なかったり編集機能が制限されたりするAPIでは、ワークフローの主張が弱まる。
APIはまた、ByteDanceが時間と改訂をどのように表現するかも明らかにする。構造化パラメータは、すべての指示を非構造化プロンプトに入れるよりも効果的に自動化を支援する。
安定したモデル識別子とバージョンポリシーも重要になる。リクエストの間に挙動が密かに変われば、制作チームは承認済みコンテンツを再現できない。
二つ目のシグナルは、繰り返しの延長と標的編集に関する独立テストだ。レビュアーは、中心的な被写体を変えずに、固定された30秒のシーンを何度も延長することから始めるべきだ。
アイデンティティのドリフト、背景の変化、音声の不連続、物理的エラー、物語上の矛盾を記録すべきである。必要な試行回数は、最良の結果と並べて報告されるべきだ。
編集テストでは、他のすべてを一定に保ちながら、一つの定義された時間区間だけを変更すべきだ。成功とは、要求した修正が、その前後に無関係な変更を生じさせずに反映されることを意味する。
この種の評価によって、「精密な」編集が運用上何を意味するかが明確になる。また、慎重に選ばれたデモと、再現可能なユーザー成果を切り分けることにもなる。
三つ目のシグナルは、競合の対応と権利保護の組み合わせだ。Google、Runway、Klingなどは、参照ワークフローと長尺コントロールを拡張する圧力に直面している。
迅速な対応は、競争の境界が統合された制作へ移ったことを裏付ける。競合によるより強力な編集とアセットオーケストレーションは、ByteDanceの初期差別化を縮小するだろう。
同時に、ByteDanceはアイデンティティと著作権の安全策が、消費者向けアプリケーションとAPI全体で一貫して機能することを示さなければならない。新たな紛争は、視覚品質にかかわらず企業の信頼を弱める。
明確な市場の勝者を宣言する前に、これらのシグナルが現れるべきだ。ネイティブの長さは比較しやすいが、制作の成功には信頼性、コントロール、ガバナンス、改訂に要する総労力が関わる。
制作者にとって、直近のステップは抽象的な美しさを問うプロンプトではなく、代表的なプロジェクトをテストすることだ。複数の名前付き被写体、計画したカメラパス、時間指定した動作、意図的な一つの改訂を使用する。
そのうえで、システムが魅力的な代替案を生み出しただけでなく、判断を保持したかを問う。プロンプト、元アセット、許可、失敗した試行、承認済み出力をまとめて保持する。
Seedanceは、AI動画の競争を短いクリップの先へ進めた。今後数カ月で、その30秒モデルが制作パートナーのように振る舞うのか、それともより長いデモ生成器に留まるのかが分かる。



