top of page

HappyHorse がブラインド Video AI テストで #1 に到達 - その後 Alibaba が自社製と発表

更新日:6月17日

2026年4月7日、会社名の記載がないAI動画モデルがArtificial Analysis Video Arenaに登場し、勝利を収め始めました。それはHappyHorse - Alibabaの動画生成モデルであることが判明しましたが、3日間、開発者コミュニティの誰もそれが誰によって作られたのか知りませんでした。72時間以内に、テキストから動画、画像から動画の両方のブラインド比較リーダーボードでトップに躍り出ました。

Alibabaは4月9日に作者であることを確認しました。同社のTaotian Future Life LabとATH Innovation Unitが構築したHappyHorse 1.0は、テキストから動画で1367、画像から動画で1401のエロスコアを達成し、最寄りの競合であるByteDanceのSeedance 2.0を96対107ポイントで上回りました。直接対決のブラインド比較では、HappyHorseは約65%の確率で勝利したと報告されています。

AlibabaのHappyHorse AI動画モデルは、動画生成市場では前例のないものを表しています。大手テクノロジー企業が匿名性を利用して、公式発表の前にベンチマーク結果で信頼を築いたのです。この戦略は、通常の製品発表よりも大幅に多くのメディア露出を生み出しました。また、報道のほとんどで触れられなかった疑問も提起しました。ブラインドベンチマークですべての現行競合他社を打ち負かすことと、それを市場シェアに転換することは、全く異なることです。

4月27日、開発者が基盤モデルにアクセスするために使用するAIインフラストラクチャプラットフォームであるfalが、公式APIアクセスをローンチしました。HappyHorse-1.0 のために。匿名で登場してから 3 週間後、あらゆるビデオ AI リーダーボードでトップに立ったモデルが、4 つの API エンドポイント経由で利用可能になりました。

何が起こったか

HappyHorse の物語は Zhang Di から始まります。15 年以上の経験を持つベテラン AI エンジニアである Zhang は、Kuaishou の Kling AI を構築したチームを率いていました。Kling AI は、2024 年と 2025 年に中国で最も使用された AI ビデオ生成ツールの 1 つです。2025 年後半、Zhang は Alibaba に移籍し、Alibaba の ATH Innovation Unit の R&D 部門である Taotian Future Life Lab を率いることになりました。彼が連れてきた HappyHorse チームは、すでに別の会社でトップランクのビデオモデルを 1 つ構築していました。問題は、より多くのリソースで再びそれを達成できるかどうかでした。

その答えは、Artificial Analysis Video Arena でした。 - AI業界における、ブラインドビデオモデル比較のための主要プラットフォームです。Arenaは、チェスの競技から借用した方法論を使用しています。人間ユーザーは、同じプロンプトから異なるモデルによって生成された2つのビデオクリップを、どちらのモデルが生成したかを示す表示なしに表示されます。そして、より良いクリップを選択します。数千回の比較が集計されてEloレーティングになります。投票者はモデル名を見ることができないため、結果はブランド評判や既存の好みに影響されることはありません。

4月7日、HappyHorseは会社名を伏せたままArenaに参入しました。このモデルは、テキストからビデオ、画像からビデオの両方のカテゴリで匿名で競いました。4月9日までに、両方のリーダーボードのトップに到達しました。その後、Alibabaは自社がこのモデルを構築したことを公に確認しました。発表では、HappyHorseは150億パラメータの統合Transformerであり、Apache 2.0ライセンスでリリースされたと説明されており、完全なモデルウェイトは「近日公開」と記載されていました。

このステルスアプローチは、言語モデルの分野で前例があります。2024年には、 "gpt2-chatbot"というコードネームでLMSYS Chatbot Arenaに提出されたモデルが、GPT-4のバリアントであることが特定される前に大きな憶測を呼びました。HappyHorseは、ビデオAIにおいてこの戦術を大規模に意図的に使用した最初の例であり、Alibabaのような大企業がフラッグシップAI製品のローンチ戦略として匿名性を使用した最初の例です。

2023年4月27日、falremio は、テキストからビデオ、画像からビデオ、参照からビデオ(参照画像から被写体を挿入し、同一性を維持する)、ビデオ編集の 4 つのエンドポイントで API アクセスを開始しました。Python および JavaScript SDK が利用可能です。同日、Alibaba Cloud の Bailian プラットフォームは、エンタープライズレベルの API テストを開始しました。2026 年 5 月に完全商用利用が開始される予定です。

トッピングのブラインドランキングが異なる種類の勝利である理由

すべての AI ベンチマーク結果が同じように作られているわけではありません。多くの公開されているリーダーボードは、自動化されたメトリックに依存しています。これは、ビデオの品質、動きの一貫性、またはテキストの整合性を計算で測定するもので、モデルは、結果のビデオが実際の視聴者には貧弱に見える場合でも、うまくスコアリングするように特別に最適化できます。特定のメトリックを最大化するようにトレーニングされたモデルは、経験豊富なビデオプロデューサーがすぐに却下するような出力を生成しながら、高いリーダーボードスコアを達成できます。

人工分析ビデオアリーナは、はるかに不正操作が難しい手法を使用しています。人間のブラインド投票は、モデルがスコアリング関数が良いと考えるものだけでなく、ユーザーが実際に良いと認識するものに勝つ必要があることを意味します。過剰適合するターゲットメトリックはありません。Eloシステムは、モデルのスコアが、それらの対戦相手の質によって調整された、実際の競合他社に対する実際の勝率を反映することを意味します。弱い競争に勝つモデルは、強い競争に勝つモデルよりも少ないポイントを獲得します。

テキストからビデオへの変換で1367、画像からビデオへの変換で1401のHappyHorseのEloは、2位のSeedance 2.0に対して96〜107ポイントのリードを表しています。実際には、100ポイントのEloギャップは、直接の直接対決で約64〜65%の期待勝率に相当します。HappyHorseとSeedanceの同じプロンプト出力を10人の異なるユーザーに見せると、HappyHorseは約6〜7回勝ちます。

T2VとI2Vの両方のカテゴリにわたるHappyHorseのパフォーマンスの一貫性は、結果に信頼性を加えています。一部のビデオモデルは専門化されており、1つのタスクに最適化されている一方で、別のタスクでは平均的なパフォーマンスを発揮します。複数の入力モダリティにわたってリードするモデルは、基盤となるアーキテクチャが、1つのユースケースで狭く優れているのではなく、多様な入力をうまく処理できることを示唆しています。


VBenchリーダーボード - 被写体の整合性、動きの滑らかさ、背景の一貫性、時間的安定性などの自動評価指標を使用してビデオ生成を評価する、独立した学術ベンチマークです。報告によると、HappyHorseは総合スコア84.32を記録しており、これは以前のトップランクモデルから7.8%の改善とされています。VBenchは、人間の好みではなく計算を使用して、Video Arenaとは異なるものを測定します。HappyHorseが両方のフレームワーク(人間主導のものと自動化されたもの)で良好なスコアを獲得しているという事実は、全体的なシグナルを強化します。

ベンチマークが示すことには限界があり、HappyHorseを実際の業務で評価する人にとって、それらの限界は重要です。Video Arenaは主に短いクリップと美的好みをテストします。モデルは、視覚的な品質と動きの滑らかさで勝利する一方で、長いシーケンス、ニュアンスのある対話同期、または特定のプロの制作要件でパフォーマンスが低下する可能性があります。ByteDanceのモデルであり、HappyHorseの最も近いベンチマークライバルであるSeedance 2.0は、長編オーディオ対話同期でより強力なパフォーマンスを発揮すると報告されています。これは、拡張されたスピーチまたはスクリプト化された対話を含むユースケースにとって意味のある差別化要因です。OpenAIのモデルであるSoraは、物理シミュレーションと拡張シーケンス全体での物語の一貫性のベンチマークであり続けています。Artificial Analysis Video Arenaで1位であることは、重要なデータポイントです。それは、特定の制作ワークフローが必要とするものの完全な全体像ではありません。

ブラインドベンチマークスコアが確立しているのは、HappyHorseが、自己申告による主張ではなく、どの企業が何を作ったかを知らずに行われた数千もの人間の好みによる判断を通じて、世界の最高のビデオ生成モデルと真に競争力があるということです。

ランキングの背後にあるアーキテクチャ - 1つのモデル、1回のパス

HappyHorse の中心的な技術的アプローチは、単一のフォワードパスでのオーディオとビデオの同時生成です。ほとんどのAIビデオシステムでは、オーディオは別個のステップとして扱われます。つまり、まずビデオを生成し、その後、別のモデルまたは後処理パイプラインを通じてサウンドを追加します。2つの出力は独立して生成され、後で同期されるため、タイミングのずれ、リップシンクのエラー、画面上の視覚情報と一致しない環境音が発生します。

Alibaba によると、HappyHorse の 150 億パラメータのアーキテクチャは、テキストプロンプト、ビデオフレーム、オーディオトークンを 1 つの Transformer 内で単一の統合シーケンスとして処理します。同社によれば、このモデルは 3 つのモダリティすべてにわたって同時に関係なくノイズ除去を行い、個別のエンコーダー間のクロスアテンションモジュールを不要にします。その結果、後から調整された 2 つの出力ではなく、本質的に同期されたオーディオとビデオが生成されると、同社は主張しています。

このモデルは、標準的な拡散モデルで使用される 50 ~ 100 ステップではなく、8 ステップにノイズ除去プロセスを圧縮する技術である DMD-2 蒸留を使用しています。効率の向上は顕著です。HappyHorse は、H100 GPU で約 2 秒で 5 秒の 256p クリップを生成し、約 38 秒で 1080p バージョンを生成すると報告されています。これらの数値は、HappyHorse が品質だけでなく速度においても競争力があることを示しています。

出力仕様には、最大 1080p の解像度、3 秒から 15 秒のクリップ期間、および 16:9、9:16、1:1、4:3 のアスペクト比のサポートが含まれます。このモデルは、フォトリアリズムやアニメからシネマティックなフィルムグレーディングスタイルまで、50 以上の美的スタイルプリセットを提供すると報告されています。多言語リップシンクは、英語、中国語(北京語、広東語)、日本語、韓国語、ドイツ語、フランス語の 7 言語をカバーしており、リップシンク評価での単語誤り率(WER)は 14.60% と報告されています。この言語カバレッジは、単一の制作パイプラインから複数の市場でローカライズされたビデオコンテンツを制作するブランドにとって重要です。

Apache 2.0 ライセンスのコミットメントは、Alibaba が HappyHorse のウェイトを、クラウド API を通じてだけでなく、商用利用のために公開する意向であることを示しています。実際のウェイトリリース時期は、2026 年 4 月下旬現在、未定です。

HappyHorse AIビデオモデルの競合比較

AlibabaのHappyHorse AIビデオモデルは、すでに開発者エコシステムと商用展開を確立している4つの有力な競合相手がいる市場に参入します。

Sora (OpenAI) は、複雑な物理シミュレーションと長編ナレーションの一貫性において、最も広く引用されているベンチマークであり続けています。物理的な妥当性が長期間にわたって重要なビジュアルエフェクト作業やドキュメンタリースタイルの生成において、Soraは依然として明確な優位性を保っています。OpenAIはSoraのローンチ以来、APIアクセスの拡大に慎重であり、開発者の採用をHappyHorseのファルパートナーシップが当初から回避するように設計されている方法で制限しています。

Seedance 2.0 (ByteDance) は HappyHorse の最も近いベンチマーク競合相手です。96~107 Elo ポイントの差は現実ですが、ByteDance の構造的優位性も同様です。TikTok と Douyin を合わせると、月間 10 億人以上のユーザーにリーチします。ByteDance が Seedance をコンテンツ作成ツールに統合すれば、Alibaba が別のチャネルを通じて模倣する必要のある流通チャネルを持つことになります。Seedance はまた、長編対話同期において HappyHorse を上回ると報告されています。これは、スクリプトコンテンツやナレーション付きのマーケティングビデオにとって意味のある差別化要因です。

Kling (Kuaishou) は、現在 HappyHorse を運営しているのと同じチーム、つまり Zhang Di と 2025 年後半に Alibaba に移籍したエンジニアたちによって構築されました。ある意味で、HappyHorse は Kling の直接的な建築的後継者であり、同じ人々がより多くのリソースで構築したものです。Kling はソーシャルメディアコンテンツ生成において強力な地位を確立しており、特に生成速度とスループットがピーク時の視覚的品質よりも重要な、大量の短編コンテンツに適しています。

Veo 3.1 (Google) は、映画および放送品質の制作を対象としています。Google のクラウドインフラストラクチャとエンタープライズリレーションシップにより、Veo は消費者向けビデオ AI モデルが浸透するのが難しいプロのビデオ制作ワークフローにアクセスできます。ハリウッドのプリビジュアライゼーション、広告制作、放送コンテンツにおいて、Veo は Google の既存の関係が大きな資産となる市場セグメントで事業を展開しています。

HappyHorseの具体的な強み, 利用可能なベンチマークデータによると、モーションの物理特性、滑らかさ、および短いクリップでの音声と映像の同期が挙げられます。モーションダイナミクスのスコアは、Wan 2.7のような古い参照モデルよりも大幅に高いと報告されています。共同の音声・映像アーキテクチャは、既存のビデオ生成システムに対する最も一貫した批判の1つである、映像コンテンツから切り離されたように聞こえる音声の問題に対処します。ソーシャルメディアのコンテンツクリエイター、ブランド広告主、ローカライズされたマーケティングキャンペーンにとって、その同期品質は、使用可能な出力と修正が必要な出力との差別化要因となることがよくあります。リファレンス・トゥ・ビデオエンドポイントは、純粋なテキスト・トゥ・ビデオモデルにはない実用的なユースケースを追加します。それは、生成されたシーンに特定の人物や製品を挿入し、その視覚的アイデンティティを維持することであり、これは広告やブランドコンテンツのワークフローに直接関連しています。

認識されている制限はクリップの長さです。HappyHorseは3秒から15秒の範囲で生成します。より長いシーケンスの場合、ユーザーはクリップを手動で連結する必要があります。これは、現在のほとんどのビデオ生成モデルに共通するワークフローの制限ですが、連続した映像を必要とするプロフェッショナルなユースケースにとっては依然として実用的な制約となります。ベンチマークでのリードは本物です。プロダクションワークフローの制約も同様に本物です。プロダクションパイプラインに統合するビデオAIモデルを評価しているチームにとって、その答えは実際に構築しているものによって異なります。同期されたオーディオを備えたソーシャルファーストのショートコンテンツにはHappyHorse、物理的に正確な長編シーケンスにはSora、ByteDanceの配信範囲が重要ならSeedance、エンタープライズ放送のコンテキストにはVeoが適しています。

次は何が来るか

Alibabaは、HappyHorseの全ウェイトをApache 2.0ライセンスの下で公開することを約束しました。GitHubリポジトリは、2026年4月下旬時点で「近日公開」と記載されていました。もしオープンソースリリースが、AlibabaのQwen言語モデルシリーズの軌跡をたどるなら(ウェイトが公開され、モデルがすぐに世界で最も広く採用されているオープンソースオプションのいくつかになった)、HappyHorseは、その商用APIに依存せずに、強力な開発者エコシステムの存在を確立する可能性があります。オープンウェイトは、オンプレミスインフラストラクチャを実行している研究者、スタートアップ、企業が、Alibaba Cloudの請求を経由せずにHappyHorseを構築できることを意味します。

Alibaba Cloud Bailian を通じた完全な商用 API アクセスは 2026 年 5 月に予定されており、4 月下旬にテストを開始したエンタープライズ顧客には早期アクセス割引が提供されます。この fal パートナーシップにより、Alibaba Cloud の展開と並行して、開発者向けの API がすぐに利用可能になります。

あらゆる方面からの競争圧力は激しいです。Sora、Kling、Seedance、HappyHorse はすべて、12 か月以内にローンチまたは大幅なアップグレードを行いました。特定のベンチマークで 1 位になったモデルが、その地位を永久に維持できる可能性は低いです。言語 AI とビデオ AI の両方におけるパターンは、リーダーボードを四半期ごとにシャッフルする継続的な急速なイテレーションです。単一のベンチマークのスナップショットよりも重要なのは、イテレーションのペースと、モデルがリーダーシップを発揮している期間中に構築された開発者エコシステムの深さです。

ステルスローンチ戦略は、アテンションメカニズムとして機能しました。Bloomberg、CNBC、The Information、および数十の AI 関連の出版物からの報道は、HappyHorse の北米開発者市場での認知度を高めました。この市場では、Alibaba の AI 関連の取り組みは、e コマースやクラウド事業と比較して歴史的に注目度が低かったのです。その注目度は出発点であり、ゴールではありません。開発者の好奇心を持続的な API 使用に、そして API 使用を組み込まれた本番ワークフローに転換できるかは、ベンチマークスコアでは捉えきれない要因にかかっています。競合他社との価格設定、API の信頼性、ドキュメントの質、そしてオープンウェイトが実際に展開されるスピードなどです。

Alibabaは、Qwenモデルシリーズで競争力のある価格設定と高品質なウェイトリリースを示してきました。HappyHorseが同じ戦略を踏襲した場合、4月の匿名でのローンチは、AlibabaのビデオAI機能をビデオ生成アプリケーションを構築する開発者にとってデフォルトの選択肢として位置づけるための、より長期的なキャンペーンの最初の動きとなる可能性があります。

AIにおけるベンチマークリーダーボードは急速に変化します。今月1位のモデルが3ヶ月後も1位であるとは限りませんし、最も広く展開されているモデルが、特定のテストで最も高いスコアを出すモデルとは限りません。HappyHorseが注目に値するのは、Eloスコアだけではありません。Alibabaが市場をリードするビデオモデルを一度構築したチームを投入し、その後、会社名が付けられる前にその成果を語らせるために型破りなローンチを行ったことです。

AI動画生成分野の知識を体系的に把握したい場合 - ベンチマークの更新、APIリリース、Sora、Kling、Seedance、HappyHorse間の競争力学を時系列で追跡するなど - remioの「情報キャプチャ」機能が、閲覧したページを自動的に検索可能な個人の知識ベースに保存します。3ヶ月後にモデルを比較したり、チームにブリーフィングしたりする必要がある場合、同じ記事をゼロから読み直すのではなく、自身で収集したリサーチから情報を引き出すことができます。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)M-Chip Mac のみをサポートしています。

脳内に検索バーを追加

ただremioに尋ねるだけ

すべてを思い出す

何も整理しない

bottom of page