top of page

Tongyi Lab、エンドツーエンド遅延550msのWan-Streamer v0.2をリリース、ただし処理負荷はより多くのGPUが担う

更新日:7月20日

Tongyi Labは、出力解像度を192×336から640×368へ引き上げながら、エンドツーエンド遅延550msを実現するWan-Streamer v0.2をリリースした。AlibabaのWanチームによると、このモデルは引き続き毎秒25フレームで動画を生成する。最大の改善点は、報告されている応答時間を延ばすことなく動画をより鮮明にしたことだ。

この成果は、高解像度生成を低コスト化したことで得られたものではない。Tongyiは、遅延に敏感な処理を1基のGPUに分離し、負荷の高い動画生成を別のGPUグループに分散している。このアップグレードは、インターフェースの背後でより多くの並列計算資源を投入することにより、応答性を維持している。

これにより、Wan-Streamer v0.2は、インタラクティブAIをめぐる2つの競合するアプローチを試す存在となる。カスケード型システムは、音声、推論、アニメーション、レンダリングに特化したコンポーネントを接続する。Wan-Streamerは知覚と生成を単一の因果的なタイムライン上に置き、入念に分割されたサービングパイプラインを用いて処理を継続させる。

Tongyi Lab、エンドツーエンド遅延550msのWan-Streamer v0.2をリリース

今回のリリースでは、初期バージョンで導入された遅延目標を維持しながら、Wan-Streamerの視覚面での実用性を向上させている。

TongyiのWanチームは、2026年7月5日にWan-Streamer v0.2を公開した。同時に発表されたv0.2の論文では、リアルタイムの視聴覚インタラクションに向けた、遅延を維持したままのアップグレードと説明されている。

出力はv0.1の192×336ピクセルから、v0.2では640×368ピクセルへ拡大した。チームによると、どちらのバージョンも毎秒25フレームで動作する。

この増加により、1フレーム当たりの出力ピクセル数は約3.6倍となる。モデルは、姿勢、視線、手、周囲の物体、環境の細部を描画するために、より多くの空間を利用できるようになる。

Wan-Streamer v0.1は、主にクローズアップのビデオ通話構図に適していた。より広いシーンでは、身体や周囲の物体が小さな画像内に圧縮されていた。そのため、話者の顔以外での動作が重要となる場面では、モデルの有用性が限られていた。

Wanチームによると、v0.2はシーンに根差したミディアムショットをサポートしており、生成されたキャラクターを、判別可能な周辺環境の中に表示し続けられる。リリースのデモには、屋内外の環境における講師、動物、架空のキャラクター、人間のようなエージェントが登場する。

これらのデモは、キャラクターとシーンを設定する自然言語プロンプトから始まる。チームの報告によると、プロンプトのプリフィルは約0.5秒で完了する。その後、キャラクターは継続的な視聴覚会話に参加できる。

より重要な数値は、モデル側で報告されている200msの信号間遅延だ。Tongyiはこの間隔を、ユーザー入力ユニットが利用可能になってから、それに対応する視聴覚応答がデコードされるまでと定義している。

広く引用されている550msという数値には、双方向ネットワーク用に別途見込まれた350msが含まれる。したがって、これは遠隔インタラクションのモデル上の合計値であり、あらゆるユーザー、接続、デプロイ環境に共通する測定値ではない。

帯域幅の制約も、報告されているモデル側の遅延には含まれていない。本番サービスでは高解像度動画を安定して転送する必要があり、論文の処理測定値を超える遅延が生じる可能性がある。

システムは160msのストリーミングユニット単位で動作する。各ユニットは、質問全体や発話ターンの完了を待つのではなく、進行中のインタラクションの短い区間を伝送する。

これが重要なのは、知覚される応答性が高速なテキスト生成だけで決まるわけではないからだ。インタラクティブなキャラクターは、同期を崩すことなく、聞き、話し、動き、視覚的な同一性を維持し、中断に反応しなければならない。

Wan-Streamerは、これらの振る舞いを単一の継続的なプロセスとして学習しようとする。ユーザーの動画、ユーザーの音声、生成された発話、生成された動作、内部の言語状態がすべて、刻々と変化する履歴に反映される。

Tongyi Labはエンドツーエンド遅延550msのWan-Streamer v0.2をリリースしたが、解像度の向上は本記事の中心的な緊張関係を生み出している。ユーザーにとって体験はより軽快で即時的に見える一方、その基盤はより重くなっている。

エンドツーエンドモデルがカスケード型AIエージェントに挑む理由

Wan-Streamerの主要な主張は、リアルタイムインタラクションは、複数の独立したモデルが処理を終えた後に組み立てるのではなく、単一の因果的な振る舞いとして学習されるべきだというものだ。

従来型の視聴覚エージェントでは、しばしばカスケード方式が使われる。音声区間検出が発話を識別し、自動音声認識がテキストを生成し、言語モデルが何を話すかを決定する。

次に、テキスト音声合成が音声を生成する。別のアバターまたは動画モデルが顔と身体をアニメーション化する。さらに別のソフトウェアが、口の動きを生成音声に合わせる。

各境界で待ち時間が追加される可能性がある。パイプラインの初期段階で生じたエラーが、その後のすべての段階に残り続けることもある。

誤った文字起こしは、無関係な回答を生む可能性がある。音声が遅れると口の動きとずれることがある。独立したアニメーションシステムは、エージェントがすでに応答を決めた後も、中立的な傾聴姿勢を表示するかもしれない。

カスケード方式は、コンポーネントを交換でき、検証しやすいため、依然として魅力的だ。チームはレンダラーを再学習することなく音声認識をアップグレードできる。また、テキスト、音声、動画に異なる安全制御を適用することもできる。

Wan-Streamerは正反対のアプローチを採る。元のv0.1アーキテクチャは、入出力のテキスト、音声、動画を、1つのTransformerで処理される交互配置されたトークンとして表現する。

Transformerは、アテンションを用いてシーケンス内の情報を関連付けるニューラルアーキテクチャだ。Wan-Streamerはブロック因果アテンションを追加し、各ストリーミングブロックが、その時点で利用可能な情報だけを参照するよう制限している。

これにより、システムがまだ存在しない未来のフレームに依存するのを防ぐ。入力ユニットを処理し、インタラクション状態を更新し、次の応答ユニットを段階的に生成できる。

この設計では、音声認識、言語生成、音声合成、アバターアニメーション、動画生成のための外部モジュールも排除されている。Tongyiによると、これらの機能は1つのモデル内で共同学習される。

「エンドツーエンド」を「単一の操作」と混同してはならない。Wan-Streamerも依然として、信号のエンコード、状態の更新、潜在表現の生成、出力のデコードを行う。違いは、それらの段階がどのように学習され、連携するかにある。

生成された出力も、モデルのインタラクション履歴に戻される。次の応答は、エージェントによる以前の発話、表情、位置、動きに依存できる。

このフィードバックループは、全二重通信にとって重要だ。全二重とは、人間が聞き、身振りをし、話し、割り込むときのように、双方が信号の送受信を同時に行えることを意味する。

ターン制のアシスタントは通常、応答する前に発話の区切りを待つ。製品レイヤーでは割り込みをサポートしていても、内部ワークフローは依然として、要求と回答を交互に繰り返す形式に似ている。

Wan-Streamerは、目に見える傾聴行動を応答の一部として扱う。エージェントは、自ら発話や動作を生成しながら、ユーザーの観察を続けられる。

このアプローチは、専門サービスを連結してデジタルヒューマンを構築する開発者に圧力をかける。統合システムは、切り離された表現間でインタラクションを繰り返し変換しないため、より緊密なタイミングを実現できると期待される。

しかし、モジュール型システムには実務上の利点が残る。ログによって、中間の文字起こしやモデル出力を確認できる。企業は個々の段階を監査し、ベンダーを変更し、機密データをより限定的なコンポーネント経由で処理できる。

したがって、この競争は単に統合された知能と旧来のソフトウェアとの対立ではない。統合された時間的協調と、モジュール型の制御性、デバッグ容易性、運用上の柔軟性との対立である。

Wan-Streamer v0.2は、視覚出力をより実用的にすることで、統合型の立場を強化している。低解像度の話す顔であれば、研究デモとして片付けられるかもしれない。判別しやすいミディアムショットは、教育、サポート、娯楽、ガイド付きインタラクションを、現実的なデプロイに近づける。

このモデルには、慎重に選ばれたシーン以外での実証が依然として必要だ。組織は、アクセント、割り込み、暗い照明、背景雑音、長時間のセッション、予期しない視覚的事象に対応できるかを知りたがるだろう。

こうした疑問に、遅延だけで答えることはできない。視聴覚ループ全体にわたる振る舞いの評価が必要となるが、まさにそこが統合モデルでは診断しにくい部分だ。

ThinkerとPerformerの分離が隠す高解像度化のコスト

Wan-Streamer v0.2は、コンパクトな制御経路を保護し、高解像度生成を複数のGPUへ移すことで応答時間を維持している。

Tongyiは、2つのサービング上の役割をThinkerとPerformerと呼んでいる。これらは同じ学習済みモデル内のデプロイ上の役割であり、独立して学習された2つのアシスタントではない。

Thinkerは1基のGPU上に置かれる。因果的な音声・動画エンコード、短い言語および状態の更新、キー・バリューキャッシュの構築、最終的なデコードを処理する。

キー・バリューキャッシュは、以前のトークンから得られたアテンション情報を保存する。これを再利用することで、モデルは履歴全体を再計算せずにシーケンスを継続できる。

Performerは、負荷の高い動画潜在表現の生成を処理する。潜在表現とは、後にデコーダーが可視フレームへ変換する、圧縮された内部表現である。

Wan-Streamer v0.1では、単一GPUのPerformerが使用されていた。バージョン0.2では、そのコンポーネントをUlysses方式のコンテキスト並列処理を用いるマルチGPUグループへ変更している。

コンテキスト並列処理は、長いシーケンスを複数のプロセッサーに分割する。各デバイスが一部分を処理しながら、通信処理によってアテンションに必要な情報を交換する。

v0.2では、Performerが長い高解像度動画の潜在シーケンスをGPUランク間で分割する。それらの部分を並列にノイズ除去した後、デコード用に結果を集約する。

音声シーケンスははるかに短い。Tongyiによると、分割すると有効な高速化よりも通信オーバーヘッドの増加が大きくなるため、音声の潜在表現は分割されない。

Thinkerは、コンパクトなキャッシュスライスをPerformerグループへ送信する。独立した言語シーケンスは、その状態がすでにキャッシュ内に表現されているため、同グループを経由しない。

この境界は重要だ。すべてのデバイス間で大規模な中間シーケンスを送信すると、並列計算によって得られた遅延短縮が失われる可能性がある。

サービングスケジュールでは、隣接するストリーミングユニット間で複数の処理を重ね合わせる。Thinkerは以前の出力をデコードしながら、現在の入力を知覚できる。一方、Performerは次の動画潜在セグメントを生成する。

Tongyiによると、Performerの計算と通信が1つの160msユニット内に収まる場合、リアルタイムのスループットが維持される。モデル側の完全な信号経路は、引き続き約200msとなる。

これはスループットと応答遅延を分けて考えるものだ。スループットは、システムが必要な速度でユニットを継続的に生成できるかどうかを指す。応答遅延は、特定の入力が出力に反映されるまでの時間を測る。

処理が効果的に重なれば、パイプラインは両方を低く維持できる。一方で、ある段階が割り当てられた時間枠を超え、増え続けるキューを生み出すと、急速に破綻する可能性もある。

だからこそ、Thinker-Performerアーキテクチャは、解像度の数値だけよりも重要となる。少なくとも報告された構成では、追加のハードウェアを並列の視覚処理に振り向け、制御ループを長引かせない。

その代償は、インフラ負荷の増大だ。論文では汎用的なデプロイ構成を指定していないものの、Wan-Streamer v0.2には、Thinker用の1基のGPUに加え、Performerグループ用の複数のGPUが必要となる。

また、チームはカスケード型の代替手法との完全なコスト比較も公開していない。入手可能な資料には、エネルギー消費量、同時セッション容量、メモリ要件、インタラクション1分あたりのコストに関する情報が欠けている。

こうした情報の欠落により、公平な商業的比較はできない。550msのデモンストレーションは技術的な実現可能性を示せても、大規模環境で経済的にサービスを提供できることまでは証明しない。

マルチGPU通信も運用上の制約をもたらす。この手法は、高速な相互接続とPerformerランク間の予測可能な同期によって恩恵を受ける。

低速または共有負荷の高いインフラに分散されたデプロイメントでは、160msの時間枠を満たせない可能性がある。ユーザーとサービス間のネットワーク混雑によって、モデル外でさらに遅延が加わることもある。

Tongyi Labは、Thinkerを小規模に保ち、Performerを水平方向に拡張することで、エンドツーエンド遅延550msを実現したWan-Streamer v0.2をリリースした。遅延が一定に保たれるのは、解像度の向上にコストがかからなくなったからではなく、ハードウェアトポロジーが変化するからである。

これはデジタルヒューマン以外にも有用なパターンである。将来のマルチモーダルサービスでは、知覚と意思決定に高速経路を確保しながら、並列システムで計算コストの高いメディアを生成できる。

リスクは、視覚的に即応性の高いエージェントが、プレミアム用途または厳格に管理されたデプロイメントでしか経済的に成立しない可能性にある。Tongyiが処理容量とハードウェアのデータを公開するまで、それは未解決の問題として残る。

550msという主張では証明されていないこと

報告された遅延はTongyiが定義したプロトコル内では信頼できるが、独立して再現された製品ベンチマークにはまだなっていない。

論文では、応答の測定範囲が明確に説明されている。測定は160msのユーザーユニットがThinkerで利用可能になった時点から始まり、対応する音声・映像応答ユニットが送出用にデコードされた時点で終了する。

この定義の下で、Tongyiはモデル側の遅延を約200msと報告している。さらに双方向ネットワークの予算として350msを加え、リモートインタラクションの総遅延を約550msとしている。

この計算自体は単純である。ただし、競合システムは応答の測定開始点と終了点を異なる形で定義することが多いため、その解釈には注意が必要だ。

あるサービスは最初の音声パケットまでの時間を報告する場合がある。別のサービスは最初に表示されるフレームまでの時間を測定することがある。さらに別のサービスでは、エンドポイント検出、バッファリング、転送、アプリケーションのレンダリングまで含めることがある。

Wanの論文も、この測定上の問題を認めている。製品ごとに応答の開始点と終了点の定義が異なる場合、直接比較は誤解を招きかねない。

350msというネットワーク項も、保証ではなく仮定である。近距離にいて安定した接続を利用するユーザーは、より短い転送遅延を経験できる。一方、遠距離または帯域幅に制約のあるユーザーでは、遅延がはるかに大きくなる可能性がある。

解像度が高くなるほど、エンコードして配信しなければならない出力データ量は増加する。モデル側の測定結果には、帯域幅に関連するすべての転送上の影響が含まれているわけではない。

視覚品質については、遅延ほど十分な定量的根拠が提示されていない。研究者らは、顔の細部、視線、口の動き、手、姿勢、物体、シーン構成を定性的に確認したと説明している。

論文には、広範な第三者による選好テストが提示されていない。また、アイデンティティの安定性、リップシンク、動作品質、応答内容の正確性、長時間セッションでの一貫性に関する標準化されたスコアも欠けている。

選別されたデモンストレーションは、特定の条件下でシステムが何を生成できるかを示せる。しかし、障害や失敗の全体的な分布までは明らかにしない。

キャラクターは短い会話では安定していても、長時間のセッションでは変質する可能性がある。あるシーンでは手が鮮明に見えても、素早い動作や物体の操作中には変形するかもしれない。

同じ不確実性は会話行動にも当てはまる。説得力のあるアバターには、割り込み、感情的な手がかり、視覚的な参照、ユーザー意図の変化を理解する能力が必要である。

低遅延はこうしたインタラクションを可能にするが、応答が正しいことまでは証明しない。素早い誤りは、誤りであることに変わりはなくても、より自然に感じられる可能性がある。

安全性評価も不足している。同期された音声と人間らしい映像を生成するシステムには、テキストアシスタントを超えるなりすまし、操作、情報開示のリスクがある。

研究資料では、完全な本番環境向け安全ポリシーが説明されていない。また、デプロイされたサービスが合成キャラクターであることをどのように表示し、無断でのアイデンティティ利用をどう防止するのかも明らかにされていない。

有害な行動が複数のモダリティをまたぐ可能性があるため、統合モデルはモデレーションを複雑にする。一見無害な文字起こしに、誤解を招くジェスチャー、視覚的シンボル、または他者になりすました外見が伴う可能性がある。

カスケード型システムでは、テキスト、音声、レンダリングに個別のフィルターを適用できる。Wan-Streamerの統合された動作には、同様に統合された監視が必要になる可能性があるが、これは運用面でまだ成熟していない領域である。

プライバシーにも注意を払う必要がある。全二重インタラクションでは、マイクとカメラからの入力が継続的に処理される。エンタープライズユーザーがこのようなシステムを機密性の高い環境に導入するには、保存、アクセス、デプロイメントに関する明確な管理策が必要になる。

音声・映像エージェントを評価するチームは、テスト録画、プロンプト、遅延トレース、失敗に関するメモを検索可能なAIナレッジベースに保存すべきである。集計指標だけでは、繰り返し発生するインタラクション上の障害が隠れてしまう可能性がある。

リリースの展開も速かった。Tongyiは、v0.2の論文投稿からわずか11日後の7月16日にv0.3を公開した。

v0.3の論文では、640×368、25 FPS、160msのユニット、報告された遅延目標を維持している。モデルの枠組みは、持続する「世界」と変化する「イベントストリーム」を中心とするものに再定義されている。

この急速な後継リリースによってv0.2の意義が失われるわけではない。Version 0.2は、v0.3でも維持されているサービングトポロジーと、より高解像度の動作点を確立した。

ただし、読者はv0.2を安定した製品世代ではなく、急速に進展する研究上のマイルストーンとして捉えるべきである。組織が調達や統合を完了する前に、評価結果が時代遅れになる可能性がある。

最も確実に導ける結論は限定的である。Tongyiは、従来の遅延測定値を維持しながら視覚解像度を向上させると報告された、特定のアーキテクチャを提示している。

より広範な主張は、まだ決着していない。公開されている証拠では、本番運用コスト、管理されていない条件下での信頼性、独立した遅延の再現、大規模環境での安全な運用はまだ証明されていない。

Wan-Streamerの重要性を左右する3つのシグナル

次の段階は、独立した再現、実際のデプロイメント経済性、ほかのリアルタイムマルチモーダルシステムによる競争上の対応にかかっている。

第1のシグナルは、開示されたハードウェアおよびネットワーク条件下で再現可能な遅延である。研究者や顧客がモデル側200msという結果を再現するには、十分な実装詳細が必要だ。

有用なテストでは、GPUモデル、Performerグループの規模、相互接続、バッチサイズ、セッション同時実行数、エンコード設定、地理的距離を明示すべきである。また、概算の中央値だけでなく、パーセンタイル遅延も報告すべきだ。

短時間の成功したやり取りよりも、持続的な性能のほうが重要である。システムは、遅延を蓄積することなく、長時間の会話を通じてストリーミングスケジュールを維持しなければならない。

Tongyiの目標に近い独立した結果が得られれば、アーキテクチャの中心的な主張は強化される。大きな差があれば、デモンストレーションが特殊なインフラまたは好条件に依存していることを示唆する。

第2のシグナルは、セッションの経済性である。Tongyiは、1つのデプロイメントで同時に何件の会話を維持できるか、また共有負荷の下で品質がどのように変化するかを示す必要がある。

Thinker-Performerの分割では、高解像度処理をGPUグループに集中させる。この設計は遅延の観点では合理的だが、デモンストレーション以外でも機能するかどうかは処理容量によって決まる。

商用サービスでは、視覚的忠実度、同時実行性、モデルサイズ、転送帯域幅、稼働時間のバランスを取らなければならない。需要が増加した場合、運用者は解像度やフレームレートを下げる可能性がある。

Tongyiが同時セッション全体で640×368の出力と低いテールレイテンシを維持できれば、Wan-Streamerはカスタマーサポート、教育、エンターテインメント、インタラクティブメディアにおいて、より信頼できる選択肢になる。

ユーザーごとに専用のマルチGPUグループが必要なら、普及範囲は狭まる。この体験はハイエンドキャラクターには引き続き価値があっても、汎用インターフェースにはならない可能性がある。

第3のシグナルは、競合他社が統合因果モデルにどう対応するかである。リアルタイム音声システムはすでに高速で割り込み可能な発話を実現しており、アバタープラットフォームも同期映像のストリーミングを強化している。

焦点となるのは、こうしたプロバイダーがモジュール型の構成を維持するのか、それともより多くの知覚処理と生成処理を共有状態に移行するのかという点である。また、スケジューリングとモダリティ間の同期を改善しながら、カスケード構成を維持する可能性もある。

競合システムは、Wan-Streamerを完全に模倣する必要はない。同等の測定条件下で、会話のタイミング、視覚的一貫性、制御性、コストを同等にする必要がある。

標準化された評価が役立つだろう。市場には、信号間遅延、最初の音声、最初のフレーム、割り込みへの応答、音声・映像の整合性、長時間セッションでのドリフトに関する共通定義が必要である。

共通の測定点がなければ、各プロバイダーは異なる体験を表す、自社に有利な数値を報告できてしまう。購入者は、見出しに掲げられた遅延値だけから正当な比較を行うことはできない。

Tongyi自身のリリース頻度も実用上の指標となる。Version 0.3はすでに、トレーニングフレームワークを変更しながらv0.2の性能目標を維持している。

今後のアップデートでは、遅延やインフラを増やすことなく、シーンの安定性と動作を改善できるかどうかが明らかになるはずだ。また、より強力な定量評価も開示すべきである。

開発者にとって、当面の教訓はアーキテクチャにある。より小規模な経路でインタラクティブな応答速度を守りながら、メディア生成により多くの並列計算資源を割り当てられる。

エンタープライズの購入者にとって、教訓は手順にある。実際のユーザー、現実的な接続環境、長時間セッション、同時負荷を用いたエンドツーエンドテストを要求すべきである。

AIユーザーにとって、その変化は体験にある。継続的に聞き、話し、動くキャラクターは、各ターン後にアニメーション付きの返答を生成するアシスタントとは異なる感覚をもたらす。

その違いは、教育、アクセシビリティ、遠隔ガイダンス、エンターテインメント、役割別トレーニングを改善できる可能性がある。一方で、誤った出力や欺瞞的な出力の説得力を強める可能性もある。

Tongyi Labは、エンドツーエンド遅延550msのWan-Streamer v0.2をリリースしたが、この数値は評価の終着点ではなく出発点とすべきである。再現可能なテールレイテンシ、開示されたセッション容量、比較可能な競合測定値に注目する必要がある。

これらのシグナルが揃えば、Wan-Streamerの統合因果アプローチは、持続性のあるプラットフォームの方向性として見なされるだろう。揃わなければ、v0.2は、応答性の高い顔の背後に集中的な並列ハードウェアのコストを隠せることを示した印象的なデモンストレーションにとどまる。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page