top of page

HappyHorse 在盲测视频 AI 测试中达到 #1 - 然后阿里巴巴表示它构建了它

已更新:6月17日

2026年4月7日,一个未署名公司的视频 AI 模型出现在 Artificial Analysis Video Arena 中并开始胜出。它后来被证实是 HappyHorse —— Alibaba 的视频生成模型 —— 但在最初的三天里,开发者社区中没有人知道是谁构建了它。在72小时内,它就攀升至文本生成视频(text-to-video)和图像生成视频(image-to-video)盲测排行榜的首位。

Alibaba 于4月9日确认了其作者身份。由该公司的淘天未来生活实验室(Taotian Future Life Lab)及其 ATH Innovation Unit 构建的 HappyHorse 1.0,在文本生成视频中获得了1367分的 Elo 评分,在图像生成视频中获得了1401分 —— 领先最接近的竞争对手 ByteDance 的 Seedance 2.0 达96至107分。据报道,在面对面的盲测对比中,HappyHorse 的胜率约为65%。

Alibaba HappyHorse AI 视频模型代表了视频生成市场前所未见的一种现象:一家大型科技公司利用匿名性,在正式发布前通过基准测试结果建立公信力。这一策略产生的媒体曝光度远高于标准的产品发布。它也提出了一个报道中大多略过的问题 —— 在盲测基准测试中击败所有当前竞争对手,与将其转化为市场份额,是两件截然不同的事情。

4月27日,开发者用于访问基础模型的 AI 基础设施平台 fal 推出了官方 API 访问权限,用于调用 HappyHorse-1.0。在匿名亮相三周后,这款登顶各大视频 AI 排行榜的模型已可通过四个 API 端点使用。

事件回顾

HappyHorse 背后的故事始于张迪(Zhang Di)。作为一名拥有超过15年经验的资深 AI 工程师,张迪曾领导团队在快手(Kuaishou)构建了 Kling AI —— 这是2024年和2025年中国使用最广泛的 AI 视频生成工具之一。2025年底,张迪加入 Alibaba,领导淘天未来生活实验室,这是 Alibaba 旗下 ATH Innovation Unit 的一个研发部门。他带来的 HappyHorse 团队此前已在另一家公司构建过顶级视频模型。当时的问题在于,他们能否在拥有更多资源的情况下再次成功。

答案通过Artificial Analysis Video Arena - AI 行业首要的视频模型盲测平台。该竞技场采用了借鉴自竞技国际象棋的方法论:向人类用户展示由不同模型根据相同提示词生成的两个视频片段,且不标明哪个视频是由哪个模型生成的。用户从中选出更好的片段。成千上万次的比较汇总成 Elo 评分。由于投票者看不到模型名称,结果不会受到品牌声誉或预先存在的偏好的影响。

4 月 7 日,HappyHorse 在没有任何公司署名的情况下进入了竞技场。该模型在文本生成视频和图像生成视频两个类别中进行了匿名竞争。到 4 月 9 日,它已登顶这两个排行榜。随后,Alibaba 公开确认开发了该模型。公告将 HappyHorse 描述为一个拥有 150 亿参数的统一 Transformer,根据 Apache 2.0 许可证发布,并标注完整模型权重“即将推出”。

这种隐身策略在语言模型领域已有先例。2024 年,一个以代号“gpt2-chatbot”提交给 LMSYS Chatbot Arena 的模型在被确认为 GPT-4 变体之前引发了巨大的猜测。HappyHorse 标志着这种策略首次在视频 AI 领域大规模有意识地使用,也是 Alibaba 这种规模的公司首次将匿名化作为旗舰 AI 产品的发布策略。

4 月 27 日,fal 推出了具有四个端点的 API 访问:文本生成视频、图像生成视频、参考图生成视频(在保持身份一致性的同时插入参考图中的主体)以及视频编辑。Python 和 JavaScript SDK 已可用。同日,Alibaba Cloud 的百炼平台开启了企业级 API 测试。预计将于 2026 年 5 月全面实现商业化。

为什么登顶盲测排行榜是另一种胜利

并非所有的 AI 基准测试结果都是平等的。许多已发布的排行榜依赖于自动化指标——即对视频质量、动作连贯性或文本对齐的计算测量,模型可以针对这些指标进行专门优化以获得高分,即使生成的视频在真实观众看来效果很差。一个为了最大化特定指标而训练的模型,可以在排行榜上获得高分,但产出的内容却会被经验丰富的视频制作人立即否决。

Artificial Analysis Video Arena 采用的方法论极难被投机取巧。人类盲测意味着模型必须在用户真实感知的优劣上获胜,而不是迎合评分函数的标准。这里没有可以过度拟合的目标指标。Elo 体系意味着模型的得分反映了其对阵真实竞争对手的实际胜率,并根据对手的水平进行校准。击败弱势对手的模型积累的分数,要少于击败强势对手的模型。

HappyHorse 在文生视频中的 Elo 分数为 1367,在图生视频中为 1401,领先第二名 Seedance 2.0 约 96 到 107 分。从实际角度来看,100 分的 Elo 差距意味着在直接的面对面比较中,预期胜率约为 64–65%。向 10 位不同的用户展示来自 HappyHorse 和 Seedance 的相同提示词输出,HappyHorse 大约会胜出 6 到 7 次。

HappyHorse 在 T2V 和 I2V 两个类别中表现的一致性增加了结果的可信度。一些视频模型是专门化的——针对某项任务进行了优化,但在另一项任务上表现平平。一个在多种输入模态下均处于领先地位的模型表明,其底层架构能够很好地处理多样化输入,而不是仅仅局限于某一种用例。

VBench leaderboard(一个独立的学术基准测试,使用包括主体一致性、运动平滑度、背景连贯性和时间稳定性在内的自动化指标来评估视频生成)中,据报道 HappyHorse 的综合得分为 84.32,比之前的顶级模型提高了 7.8%。VBench 与 Video Arena 衡量的内容不同,它使用计算而非人类偏好。HappyHorse 在这两个框架(一个是人类驱动,一个是自动化)中都表现出色,这一事实增强了整体信号。

任何基准测试所能告诉你的信息都是有限的,这些限制对于任何评估 HappyHorse 实际工作表现的人来说都很重要。Video Arena 主要测试短视频和审美偏好。一个模型可能在视觉质量和运动平滑度上获胜,但在长序列、细微的对话同步或特定的专业制作要求上表现不佳。Seedance 2.0(ByteDance 的模型,也是 HappyHorse 最接近的基准对手)据报道在长篇音频对话同步方面表现更强,这对于涉及长篇演讲或剧本对话的用例来说是一个有意义的差异化因素。Sora(OpenAI 的模型)在物理模拟和长序列叙事连贯性方面仍是基准。在 Artificial Analysis Video Arena 上排名第一是一个重要的数据点,但它并不能代表任何特定制作流程所需的全部全貌。

盲测基准分数所确立的是,HappyHorse 与世界上最优秀的视频生成模型相比具有真正的竞争力——这不是自封的声明,而是通过数千次在不知道开发公司的情况下做出的人类偏好判断得出的。

排名背后的架构——单一模型,一次通过

HappyHorse 背后的核心技术主张是在单次前向传递中实现音视频联合生成。大多数 AI 视频系统将音频视为一个单独的步骤:先生成视频,然后通过独立的模型或后处理流水线添加声音。这两个输出是独立产生的,随后进行同步,这会导致时间伪影、口型同步错误以及与屏幕视觉内容不匹配的环境音。

据报道,HappyHorse 的 150 亿参数架构将文本提示词、视频帧和音频标记(tokens)作为一个统一序列在单个 Transformer 中进行处理。根据 Alibaba 的说法,该模型同时对所有三种模态进行联合去噪,消除了在独立编码器之间使用交叉注意力模块的需求。该公司声称,其结果是本质上同步的音视频,而不是事后对齐的两个输出。

该模型使用了 DMD-2 蒸馏技术——这种技术将去噪过程压缩为 8 个步骤,而不是标准扩散模型所使用的 50 到 100 个步骤。效率提升非常显著:据报道,HappyHorse 在 H100 GPU 上生成一段 5 秒 256p 剪辑大约需要 2 秒,生成 1080p 版本大约需要 38 秒。这些数据使 HappyHorse 在速度上具有竞争力,而不只是质量。

输出规格包括最高 1080p 的分辨率、3 到 15 秒的剪辑时长,并支持 16:9、9:16、1:1 和 4:3 的纵横比。据报道,该模型提供超过 50 种美学风格预设——涵盖从写实主义、动漫到电影级调色风格。多语言口型同步涵盖七种语言:英语、普通话、粤语、日语、韩语、德语和法语,在口型同步评估中的词错误率(WER)据报道为 14.60%。这种语言覆盖范围对于通过单一制作流水线在多个市场制作本地化视频内容的品牌非常有用。

Apache 2.0 许可证承诺表明 Alibaba 打算公开 HappyHorse 的权重以供商业使用,而不仅仅是通过其云 API。截至 2026 年 4 月下旬,实际权重发布的具体时间表仍未确定。

HappyHorse AI 视频模型与竞争对手的对比

Alibaba 的 HappyHorse AI 视频模型进入了一个拥有四个强劲对手的市场,这些对手已经建立了成熟的开发者生态系统和商业部署。

Sora(OpenAI)仍然是复杂物理模拟和长篇叙事连贯性方面被引用最广泛的基准。对于物理真实性在长序列中至关重要的视觉特效工作或纪录片风格生成,Sora 保持着明显的优势。自 Sora 发布以来,OpenAI 对扩展 API 访问一直持谨慎态度,这限制了开发者的采用,而 HappyHorse 与 fal 的合作似乎从一开始就是为了避免这种情况。

Seedance 2.0(字节跳动)是 HappyHorse 最接近的基准竞争对手。96 到 107 的 Elo 分数差距是真实存在的,但字节跳动的结构性优势也同样存在:TikTok 和抖音的月活跃用户总数超过 10 亿。如果字节跳动将 Seedance 集成到其内容创作工具中,它将拥有阿里巴巴需要通过不同渠道去复制的分发能力。据报道,Seedance 在长对话同步方面也优于 HappyHorse —— 这对于脚本内容和带有旁白的营销视频来说是一个重要的差异化优势。

Kling(快手)是由目前运营 HappyHorse 的同一团队打造的 —— 即张迪以及在 2025 年底加入阿里巴巴的工程师们。在某些方面,HappyHorse 是 Kling 的直接架构继承者,由同一批人利用更多资源构建而成。Kling 在社交媒体内容生成领域建立了稳固的地位,特别是在生成速度和吞吐量比峰值视觉质量更重要的高容量、短视频输出方面。

Veo 3.1(Google)专注于电影级和广播级的制作。Google 的云基础设施和企业关系使 Veo 能够进入专业视频制作工作流,而以消费者为中心的视频 AI 模型很难渗透进这些领域。对于好莱坞的预演、广告制作和广播内容,Veo 在 Google 现有关系作为重要资产的市场细分领域中运营。

HappyHorse 的具体优势根据现有的基准测试数据,主要体现在运动物理学、流畅度以及短视频的音画同步。据报道,其运动动力学评分显著高于 Wan 2.7 等较旧的参考模型。这种音视频联合架构解决了现有视频生成系统最常被诟病的问题之一 —— 即音频与视觉内容脱节。对于社交媒体内容创作者、品牌广告商和本地化营销活动来说,这种同步质量通常是“可用输出”与“需要返工的输出”之间的分水岭。参考视频(reference-to-video)端点增加了一个纯文本生成视频模型所缺乏的实用用例:在保持视觉特征的同时,将特定人物或产品插入生成的场景中,这与广告和品牌内容工作流直接相关。

公认的局限性是片段长度。HappyHorse 生成的片段在 3 到 15 秒之间。对于更长的序列,用户需要手动拼接片段 —— 这是目前大多数视频生成模型共有的工作流限制,但对于需要连续镜头的专业用例来说,这仍然是一个实际的约束。基准测试的领先是真实的,生产工作流的限制也同样真实。对于正在评估将哪种视频 AI 模型集成到生产流水线的团队来说,答案将取决于他们实际构建的内容:针对社交优先、带有同步音频的短内容选择 HappyHorse;针对长篇幅、物理特性准确的序列选择 Sora;如果字节跳动的分发覆盖范围很重要,则选择 Seedance;在企业广播场景下选择 Veo。

下一步计划

阿里巴巴已承诺根据 Apache 2.0 许可证发布完整的 HappyHorse 权重。截至 2026 年 4 月下旬,GitHub 仓库被列为“即将推出”。如果开源发布遵循阿里巴巴 Qwen 语言模型系列的轨迹(即发布权重后,模型迅速成为全球采用最广泛的开源选项之一),HappyHorse 可能会建立起一个独立于其商业 API 的强大开发者生态系统。开放权重意味着研究人员、初创公司和运行本地基础设施的企业可以在不经过阿里云计费的情况下,基于 HappyHorse 进行构建。

预计将于 2026 年 5 月通过阿里云百炼提供全面的商业 API 访问,并为 4 月底开始测试的企业客户提供早期访问优惠。与 fal 的合作伙伴关系使该模型在阿里云推出的同时,能够立即面向开发者提供 API。

来自各方的竞争压力非常激烈。Sora、Kling、Seedance 和 HappyHorse 都在 12 个月内发布或进行了重大升级。在任何给定基准测试中排名第一的模型可能都不会无限期地保持该位置——语言和视频 AI 的模式都是持续的快速迭代,每季度都会重新洗牌排行榜。比任何单一基准快照更重要的是迭代速度,以及在模型领先期间建立的开发者生态深度。

隐身发布策略起到了一种注意力机制的作用。来自 Bloomberg、CNBC、The Information 以及数十家专注于 AI 的出版物的报道,提升了 HappyHorse 在北美开发者市场的知名度,而阿里巴巴的 AI 工作在历史上受到的关注一直少于其电子商务和云计算业务。这种关注只是一个起点,而不是终点。将开发者的好奇心转化为持续的 API 使用,并将 API 使用转化为嵌入式的生产工作流,取决于基准测试分数无法捕捉的因素:相对于竞争对手的价格、API 的可靠性、文档质量,以及权重实际落地的速度。

阿里巴巴在其 Qwen 模型系列中展示了极具竞争力的定价和高质量的权重发布。如果 HappyHorse 遵循同样的剧本,4 月份的匿名发布可能会成为一场长期战役的开场白,旨在将阿里巴巴的视频 AI 能力定位为开发者构建视频生成应用的首选。

AI 基准排行榜变化极快。本月排名第一的模型在三个月后可能就不再是第一,而部署最广泛的模型往往不是在任何给定测试中得分最高的那个。HappyHorse 值得关注的原因不仅仅是 Elo 分数——而是阿里巴巴部署了一支已经构建过市场领先视频模型的团队,然后通过一种非传统的发布方式,在公司名称挂钩之前让作品自己说话。

如果你正在构建关于 AI 视频生成领域的知识体系——跨时间跟踪基准更新、API 发布以及 Sora、Kling、Seedance 和 HappyHorse 之间的竞争动态——remio 的信息捕获会自动将你阅读的页面保存到可搜索的个人知识库中。当你三个月后需要对比模型或向团队汇报时,你调用的是自己收集的研究资料,而不是从头开始重新阅读相同的文章。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page