Black Forest Labs 称 FLUX 3 在初步测试中优于竞争对手的视频模型
- Olivia Johnson

- 8月2日
- 讀畢需時 16 分鐘
Black Forest Labs 于 7 月 23 日开放 FLUX 3 的早期访问,随后宣称其击败了七款竞争对手的视频模型。Google News 的标题将这些初步结果包装成了更简洁的叙事:FLUX 3 优于 Seedance 2.0、Grok Imagine Video 和其他主要系统。但这些数据仅能在该公司自有测试的范围内支持这一表述。
最重要的结果也是最有限的。Black Forest Labs 表示,在与 Seedance 2.0 的对比中,观众有 52% 的情况下更偏好 FLUX 3。这接近五五开。其报告称,FLUX 3 相较 Grok Imagine Video 的优势达到 69%,而对 Runway 和 Luma 的领先幅度更大。
这些分数背后隐藏着更大的变化。FLUX 3 多模态 AI 将图像、视频、音频和动作预测整合在同一个基础模型中。Black Forest Labs 押注于一种共享表征能够同时服务创作者、开发者和工业机器人。因此,Seedance 是最明确的生产力基准,而机器人技术则构成更具影响力的考验。
Black Forest Labs 实际发布了什么
FLUX 3 是一个处于早期访问阶段的模型系列,并非一款已确立独立领先地位的成熟产品。
Black Forest Labs 将 FLUX 3 宣布为统一的多模态基础模型。基础模型是一种开发者可适配于多项相关任务的通用系统。该模型从图像、视频和音频中联合学习,而非将每种媒介视为彼此孤立的处理流程。
该公司的 FLUX 3 公告称,模型可以同时生成视频和原生音频。它接受文本、图像或视频作为参考输入。其列出的功能包括文本生成视频、图像生成视频、视频生成视频、片段续写、关键帧转场、多语言对话和动态排版。
FLUX 3 可一次生成最长 20 秒的视频片段。Black Forest Labs 还称,用户可以将单个片段串联为更长的序列。视觉参考旨在让角色和风格在这些序列中保持一致。
这听起来比传统的文本生成视频发布更为广泛。然而,访问权限仍在分阶段开放。FLUX 3 Video 进入了受限的早期访问计划,而图像版本计划在后续早期访问阶段推出。API 访问、私有权重以及开放权重的 FLUX 3 Dev 模型均被列入未来路线图。
此次发布方式很重要,因为可用性决定了哪些内容能够被验证。经过精心挑选的发布演示,只能展示模型在有利条件下能够生成什么。广泛的 API 访问则会揭示其在常规提示词下的可靠性、延迟、审核行为、可复现性和失败率。
因此,这次发布同时改变了两件事。Black Forest Labs 进入了音视频联合生成的竞争,也将 FLUX 从媒体生成扩展至动作预测。然而,在访问权限仍受控制的情况下,开发者无法独立复现每一项标题中的对比。
当聚合平台将一次发布压缩为简短标题时,这一区别便容易被模糊。Google News 的结果可以准确重复来源标题,却未必验证其最强的暗示。“击败”因而听起来像是已尘埃落定的排名,即便底层证据描述的只是一次初步偏好测试。
产品本身仍值得关注。FLUX 1 和 FLUX 2 奠定了该系列在图像生成领域的基础。FLUX 3 则将这一品牌扩展至动态画面、声音、编辑、模拟和机器人技术。Black Forest Labs 并非只是为现有图像技术栈增加了一个视频端点。
该公司以 Self-Flow 构建 FLUX 3,这是一种让生成与表征学习对齐的方法。表征学习训练模型从原始输入中组织出有意义的特征。Black Forest Labs 认为,改进这些内部特征能同时提升媒体质量和下游物理任务的表现。
这一论点为本次发布提出了一个可检验的命题。如果图像、运动、声音和动作描述的是同一个物理世界,那么将它们一起训练应能减少矛盾。一次撞击应产生正确的声音。运动物体应保持质量和动量。预测的动作应导向合理的下一状态。
这些要求比生成十秒吸引人的画面更高,也为模型制造了更多失败的可能。
为什么 Google News 的对比需要更多背景
已发布的分数表明这是一个具有竞争力的模型,但并未确立独立的行业排名。
Black Forest Labs 对带有原生音频的 10 秒、720p 文本生成视频片段进行了评估。该公司报告称,在与 Luma Ray 3.2 的比较中,观众有 93% 的情况下更偏好 FLUX 3。它报告的偏好率为:相较 Runway Gen-4.5 为 77%,相较 Grok Imagine Video 为 69%。
与其他系统相比,差距有所缩小。FLUX 3 对 Kling v3 Pro 的偏好率为 60%,对 Happy Horse v1 为 59%,对 Happy Horse 1.1 为 57%。相较 Seedance 2.0 和 Gemini Omni Flash,报告的比例均为 52%。
最后这个数字应当比现实中更常见的情况更能影响标题。52% 的偏好率意味着 FLUX 3 在这项评估中略胜 Seedance。尤其在未披露不确定性、评分者数量或重复试验的情况下,它并不能证明存在决定性领先。
Black Forest Labs 明确将这些结果标注为初步结果。该公司表示,模型及其评估框架仍在开发中。这一谨慎表述很重要,因为测试由该公司设计或控制,提示词由其选择,片段由其生成,结果也由其发布。
该公告未提供足以复现完整评估的细节。它没有说明完整的提示词集合,也没有解释如何采样输出结果。此外,它未披露每项对比由多少人评分,或评估者是否分别判断了动作、音频、提示词遵循度和视觉吸引力。
偏好测试将多种感受合并为一次选择。观众可能因为光线更清晰、对话更有趣,或可见伪影更少而选择某个片段。这一投票并不能揭示同一模型是否更擅长处理物理规律、剪辑、身份一致性或音频时序。
模型版本同样重要。视频系统可能提供多个端点,并采用不同的质量和速度设置。当读者无法确认每个对手的配置、生成次数、提示词调整或内容过滤方式时,对比就更难解读。
这并不意味着这些结果毫无意义。两两人工偏好能够比自动化图像指标更好地捕捉感知质量。它也允许提出一个直接的问题:面对同一提示词生成的两个输出,人们更愿意观看哪一个?
问题在于,“在这项测试中更受偏好”与“击败竞争对手”之间存在距离。Google News 倾向于简洁标题,而技术评估需要限定条件。聚合层放大了结论,却让方法论停留在数次点击之外。
Grok 的结果说明了这一差距。69% 的偏好率表明,在报告的样本中存在有意义的优势。但它无法解释 FLUX 3 是凭借面部表情、原生声音、镜头行为、动态排版还是提示词遵循度获胜。
Seedance 则带来了不同的启示。52% 的结果描述的是两个势均力敌的系统,而非清晰的等级关系。独立测试可能维持这一排序,也可能颠倒它,或发现每个模型在不同创作任务中各有胜场。
开发者应将这项对比视为一个短名单信号。一旦访问条件允许,FLUX 3 就值得纳入严肃评估。团队在选择模型前,仍应使用自身生产工作负载中的提示词进行测试。
这些测试应包括重复生成。它们应衡量可用输出率,而不只是各系统最出色的一条片段。生产团队关心的是有多少次尝试能通过审核、角色能否持续保持一致,以及音频需要修复的频率。
目前证据支持一个克制的结论:Black Forest Labs 展示了一位抱负广泛且可信的竞争者。但它尚未提供足够公开的方法论,无法将其发布图表变成通用排行榜。
FLUX 3 与 Seedance 2.0 才是真正的竞争
Seedance 2.0 对 FLUX 3 构成压力,因为它已经在一个以创作者为中心的系统中整合了多模态参考、原生音频、编辑功能和复杂运动。
ByteDance 于 2026 年 2 月 12 日在中国发布了 Seedance 2.0。其官方模型发布公告描述了一种统一的音视频架构,可接受文本、图像、视频和音频作为输入。
用户可在文字指令之外,提供最多九张图像、三个视频片段和三个音频片段。Seedance 能够从这些素材中参考构图、动作、镜头运动、视觉特效和声音。它也支持定向视频编辑和续写。
该模型可生成最长 15 秒、带原生立体声音频的多镜头视频。ByteDance 表示,它可以生成与视觉序列相匹配的对话、背景音乐、环境音和特效。该公司强调复杂运动、角色一致性以及由提示词引导的镜头规划。
FLUX 3 所列的单次生成时长更长,最长可达 20 秒。它还强调多语言对话、动态排版、片段串联和视频生成视频转换。然而,时长本身无法决定这场竞争的胜负。
真正的生产问题是,有多少可用秒数能通过审核。一段拥有稳定手部、同步对话和一致身份的较短片段,可能比一段需要大量修复的较长片段更有价值。两份发布页面都未提供中立、共享的可用输出基准。
Seedance 也拥有外部证据,支持其部分技术定位。AV-Phys Bench 的研究人员在物理常识方面评估了七个音视频联合系统。他们的测试涵盖稳态、事件转换、环境转换,以及要求物理上不一致行为的提示词。
Seedance 2.0 在该研究中综合排名最佳。但研究人员也发现,所有受测模型距离可靠的物理理解仍相差甚远。在事件驱动和环境转换中,性能有所下降;而刻意矛盾的提示词甚至暴露了强大专有系统中的失败。
这一发现使 Black Forest Labs 的核心主张变得更复杂。FLUX 3 的设计基于这样一种理念:联合训练能够形成对物理现实更好的表征。这一理论是连贯的,但公开对比图表主要衡量的是观众对短生成片段的偏好。
不能仅因为一段视频看起来令人信服,就认定它是世界模型。系统必须在场景变化时保持因果关系。当物体进入不同环境时,声音应作出正确反应。即使提示词邀请矛盾,运动也应遵循物理约束。
独立评估需要将 FLUX 3 纳入 AV-Phys Bench 等测试。如果它能在跨模态物理、转换行为和对抗性提示词上胜过 Seedance,Black Forest Labs 的架构主张就将获得证据支持。若它仅在审美偏好上获胜,其优势仍有价值,但范围会更窄。
Seedance 还面临另一重压力:它已向中国公众开放。这种开放带来了快速试验、可见的失败案例、令人印象深刻的成果,以及争议。真实世界的曝光所产生的证据,是封闭项目难以迅速匹敌的。
公开访问也暴露了法律风险。用户制作出包含可辨识演员和受保护角色的视频后,好莱坞团体提出了异议。这场版权争议引发了美国电影协会和 SAG-AFTRA 的批评。
ByteDance 表示尊重知识产权,并正加强防护措施,防止受保护内容和个人肖像被未经授权地使用。这些举措说明,一旦模型面向广泛受众推出,其能力与部署政策便密不可分。
Black Forest Labs 可以在控制早期访问的同时研究这一案例。其分阶段发布让公司有时间测试防护措施、记录可接受的使用方式,并观察受邀合作伙伴如何处理参考素材。与此同时,这也减少了外界能够获得的证据。
因此,核心竞争并不只是 FLUX 3 与 Seedance 2.0 在视觉吸引力上的较量,而是两种架构与部署策略之间的竞争。两者都在追求统一的音视频生成、丰富的参考控制、编辑能力以及更一致的运动表现。
Seedance 拥有更广泛的公众曝光和独立的物理表现结果。FLUX 3 则提供更长的视频片段、计划中的开放权重骨干模型,以及通往动作预测的直接桥梁。据报道,52% 的偏好评分表明,创意竞赛仍十分接近。
Grok Imagine Video 仍具相关性,尤其是 Black Forest Labs 声称自己相较其拥有更明显优势。不过,与 Seedance 的对比更具参考价值。两套系统都对多模态控制和现实世界连贯性提出了同样广泛的主张。
这也是为什么“击败 Seedance 和 Grok”过度简化了这次发布。在 Black Forest Labs 的评估中,FLUX 3 看起来强于 Grok;但与 Seedance 相比,它更像是具备竞争力,而非占据主导地位。
一个同时服务视频与机器人的骨干模型改变了格局
FLUX 3 的重要性在于,Black Forest Labs 希望同一套学习到的世界表征既能生成媒体内容,也能指导物理动作。
该公司正在开发两种动作预测方案。一种是将动作预测直接加入 FLUX 3;另一种则将预训练视频骨干模型作为基础,以有限的任务专属数据训练专业动作模型。
Black Forest Labs 在第二条路径上与 mimic robotics 展开合作。他们的 FLUX-mimic 系统为中间层 FLUX 3 特征增加了轻量级动作解码器。动作解码器会将模型的内部表征转换为机器人能够执行的指令。
合作双方已在 Audi 的工业任务中测试该系统。其机器人部署涵盖将零件分装到托盘中、将电子控制单元插入夹具、组装组件,以及处理密封件和线缆等柔性材料。
这些任务比精致演示所呈现的更难。柔性物体会变形、遮挡自身几何结构,并会因受力变化而产生不同反应。紧密配合的组件需要精确操作。微小的预测误差就可能中断工作流程或损坏零件。
Black Forest Labs 表示,FLUX 3 使用了数千万小时的通用视频进行训练,同时还引用了数十万小时聚焦于人类和机器人操作的视频数据。这些训练数据规模由公司自行披露,底层数据构成仍未公开。
该公司称,在 FLUX 骨干模型保持冻结的情况下,其动作解码器优于早期视觉-语言-动作模型。冻结骨干模型意味着主模型保持不变,而由一个较小组件学习目标任务。这种设置可能表明,基础模型内部已存在有用的物理表征。
不过,Black Forest Labs 尚未公布足够详细的公开基准信息,无法对不同机器人系统进行广泛比较。工厂场景的成功取决于硬件、传感、控制频率、安全系统、任务设置和恢复行为。模型评分不能替代部署可靠性。
即便如此,这种方法改变了应当关注 FLUX 3 的人群。显而易见的受众包括视频创作者、创意机构、游戏工作室和媒体开发者。较不显眼的受众则包括机器人团队、仿真公司、制造商,以及构建具身智能体的研究人员。
如果共享骨干模型能够有效迁移,这一广泛覆盖会形成战略优势。通过跨多种模态训练一个模型,可以减少重复研究。对运动表征的改进,可能同时支持生成视频和机器人操作。
同样,这种广泛覆盖也带来取舍。通用模型可能比专业系统消耗更多算力和数据。它也可能在许多任务上表现良好,却并非任何单一部署场景的最佳选择。
创作者或许更偏好具有更强电影化控制能力的专用模型。机器人团队可能选择延迟可预测、可本地执行的更小型系统。如果许可、数据处理或运营要求仍不明确,企业也可能拒绝使用统一服务。
FLUX 3 Dev 可能改变这一判断。Black Forest Labs 计划为视频、音频、图像和动作预测提供多模态骨干模型的开放权重访问。开放权重允许符合条件的团队依据适用许可检查、调整和运行模型参数。
确切的许可条款将与下载本身同样重要。“开放权重”并不自动意味着可不受限制地用于商业用途。开发者需要明确涵盖再分发、微调、生成媒体、机器人部署和可接受使用执行的条款。
对于无法将敏感材料发送至共享 API 的组织,私有权重访问提供了另一条路径。工作室可以在受控基础设施中处理未发布素材。制造商可以将工厂视频、布局和运营数据保留在明确界定的环境内。
在正式推出前,这些能力仍只是承诺。早期访问发布确立的是方向,而非成熟可用性。开发者无法围绕开放模型进行规划,直到权重、文档、硬件要求和许可条款到位。
这正是 Google News 的叙事忽略的最重要压力。FLUX 3 不只是提出 Black Forest Labs 能否在视频偏好测试中击败 Grok 的问题。它提出的是:媒体生成器能否成为可迁移的视觉智能层。
如果可行,视频基准将只是更大平台中可见的一面。如果失败,FLUX 3 仍可能作为创意模型取得成功。届时,机器人相关主张更像是一项相邻的研究项目,而不是单一通用表征的证据。
对于评估快速变化模型主张的知识工作者而言,结构化的AI knowledge base可以保留发布声明、基准修订和后续独立结果。这类记录有助于避免初步数字演变为长期假设。
早期结果仍无法证明什么
最大的未知之处在于,FLUX 3 的共享表征能否在精选演示和公司控制的评估之外提升可靠性。
多模态模型可以学习相关性,却未必形成可靠的物理模型。它可能将撞击画面与撞击声音关联起来,却在材料、环境或时序发生变化时失效。它可能制作出类似机器人动作的动画,却无法为真实机器生成安全指令。
这种区别会在反事实测试中显现。要求系统将一只正在鸣响的时钟放入带衬垫的容器中,音量和声学特性都应发生变化。要求它移动重物时,加速度应反映质量,而非视觉风格。
AV-Phys Bench 发现,当前联合音视频系统普遍存在从语义到物理的差距。模型通常能遵循提示词的大致含义,却会违反物理细节。过渡场景尤其困难,因为当事件或环境变化时,正确输出也必须随之改变。
FLUX 3 的架构直接针对这一问题。Black Forest Labs 表示,图像揭示空间结构,视频增加时间维度,而音频则提供视觉无法获得的因果信号。联合训练应当迫使这些观察结果形成更连贯的表征。
此次发布尚未在外部测试中证明这一结果。其偏好评估奖励的是整体观众选择,而其机器人主张采用不同的基准和部署语境。统一架构需要将这些结果连接起来的统一证据。
评估污染同样存在疑问。开发者需要了解发布提示词是否与内部训练示例相似、输出是否经过挑选,以及每个展示片段经过了多少次尝试。没有公开证据表明 Black Forest Labs 操纵了结果,但方法论缺失意味着读者无法排除常见的选择效应。
安全测试也存在未知。多模态参考素材可以越来越精确地复现身份、声音、风格和受保护角色。原生音频将风险从视觉肖像扩展至对白和声音模仿。
Seedance 展示了出色输出触发法律反对的速度。美国电影协会指责该服务助长未经授权的受版权保护材料,SAG-AFTRA 则聚焦于声音和肖像。这些争议在数日内便成为产品故事的一部分。
Black Forest Labs 表示,其分阶段发布包含反馈与安全测试。这一过程可能在广泛开放前减少滥用;但如果过滤机制仍然粗糙,也可能限制正当的编辑、戏仿、历史复原或获授权角色工作流。
开发者需要的不只是安全承诺。他们需要有文档记录的参考政策、来源控制、内容凭证、申诉流程和可预测的 API 响应。企业团队还需要明确,提交的媒体是否会用于未来训练。
计划中的开放权重发布让治理变得更加困难。本地权重可支持隐私、研究、定制和低延迟机器人应用,但在分发后也可能削弱集中式控制。
许可可以设定法律边界,却无法从技术上防止每一种滥用。模型卡、训练披露、水印、来源追踪系统和社区治理,将共同决定 FLUX 3 Dev 是否会成为可信赖的基础设施。
可靠性是另一个尚未解决的问题。一个视频模型可能一次就生成出色结果,却在接下来的五次尝试中失败。生产环境的采购方需要的是结果分布,而非高光片段。
有用的衡量指标包括提示词遵循度、时间稳定性、身份持续性、音频同步、文本准确性、生成延迟和拒绝率。团队还应衡量恢复能力:有缺陷的片段能否在不改变已正常部分的情况下完成编辑。
机器人应用需要更严格的标准。视觉上合理的预测仍可能不安全。工业部署需要故障检测、受限动作、人工接管、硬件感知规划,以及在变化条件下的验证。
与 mimic 的合作提供了有意义的现场信号,因为它涵盖真实工厂任务。然而,这并不能证明其在不同机器人、地点或运行条件下的通用性。每个新环境都会引入不同的摄像头、夹具、公差、材料和安全要求。
这些不确定性并不会否定此次发布。它们界定了一个引人注目的早期模型与可靠平台之间仍需完成的工作。Black Forest Labs 已提出多项足够具体、可供验证的主张,为外部研究人员提供了一份有价值的验证议程。
当前最有力的结论,比许多新闻标题所描述的更为谨慎。FLUX 3 在短篇音视频生成方面似乎具备竞争力,并有望成为共享骨干模型。至于其是否更胜一筹、对物理世界的理解能力,以及是否已具备生产就绪性,仍是未解问题。
Google News 热度飙升后值得关注什么
三个信号将决定 FLUX 3 会成为领先的多模态平台,还是仅停留在令人印象深刻的早期体验演示。
第一个信号是独立的视频评估。研究人员和制作团队需要获得与 Black Forest Labs 测试时相同版本的模型。他们应将多次生成结果与 Seedance 2.0、Grok Imagine Video、Runway、Kling 以及其他现有系统进行比较。
一项可信的评估应公布提示词、采样设置、生成次数和评审方法。它应将视觉吸引力与运动表现、音频、指令遵循、身份一致性和编辑成功率区分开来,同时也应报告接近结果所伴随的不确定性。
如果独立测试仍能保持相对 Grok 的 69% 偏好优势,那么发布时的主张将更有说服力。如果测试仅证实其与 Seedance 之间存在微弱差距,FLUX 3 应被描述为同级竞争者。若结果反转,则会削弱当前“击败”叙事,但不会否定其架构价值。
第二个信号是承诺中的 API 与 FLUX 3 Dev 推出进展。实际可用性将揭示生成速度、运行限制、文档质量、硬件要求和许可条款,也将让开发者测试发布演示无法体现的工作流。
API 的采用将增强 Black Forest Labs 能服务生产级客户的论据。一个可用的开放权重骨干模型,则会把这一论据延伸到本地部署、定制化、研究和机器人领域。延期或限制性条款会缩小其实际影响。
开发者尤其应关注版本一致性。API、私有权重和开放模型未必提供完全相同的质量。供应商往往会提供多个版本,分别针对延迟、成本、安全性或硬件限制进行优化。
第三个信号是对动作预测的独立验证。机器人团队应关注详细基准、部署时长、人工干预率、故障恢复能力,以及在陌生任务上的表现。工厂演示需要转化为可重复的工程证据。
若取得成功,将支持 Black Forest Labs 的核心观点:生成与动作可以共享一种有用的世界表征。若迁移能力较弱,则可能表明专用机器人数据和解码器承担了大部分实际工作。这一结果依然具有价值,但会改变人们对该方案的解读。
这些信号应按以下顺序出现:中立的创意测试、可访问的模型发布,以及更广泛的物理世界验证。每个阶段都提出更困难的问题:FLUX 3 能否生成更受偏好的媒体?开发者能否可靠地基于它构建产品?其内部表征能否指导行动?
读者还应关注 Black Forest Labs 如何处理权利与来源追溯问题。广泛开放将使模型接触受保护角色、真实人物、私人影像和商业制作资产。政策质量将与视觉质量一样影响其采用。
最新一轮 Google News 热潮带给 FLUX 3 的是关注,而非最终裁决。Black Forest Labs 提供了引人注目的架构、广泛的路线图和颇具前景的初步比较结果,同时也给出了那些较短标题往往会省略的限定条件。
对于创作者,眼下应申请访问权限,并准备一套可重复使用的提示词测试集。对于开发者,应跟踪 API 行为和许可条款。对于企业采购方,则应要求在自身的媒体与运营条件下获得证据。
应将发布图表视为一个值得验证的假设。如果独立结果、开放访问和机器人验证相互印证,FLUX 3 所代表的将不只是又一个视频模型。如果这些信号出现分歧,最初的比较将仍是一则成功的新闻标题,而非经得起时间考验的技术结论。


