Black Forest Labs 发布 FLUX 3,但其 20 秒视频主张仍需现实检验
- Sophie Larsen

- 2天前
- 讀畢需時 13 分鐘
Black Forest Labs 已发布处于早期访问阶段的 FLUX 3,承诺可生成最长 20 秒、且音频同步生成的视频片段。这一时长很重要,但更重要的是其更大的押注:该公司希望用一个架构同时学习图像、视频、音频和物理动作。
此次发布使 Black Forest Labs 与 Google、OpenAI、Runway、Kling、Seedance 及其他视频模型开发商直接竞争。这些公司已在视觉质量、提示词准确性、角色一致性、声音和分发能力上展开角逐。FLUX 3 必须证明,将这些能力统一起来,能够比组合多个专业系统带来更好的结果。
该公司已发布了颇具前景的演示和初步偏好评分。然而,早期访问范围有限,生产环境使用通常受到限制,完整的基准测试方法也尚未公开。因此,FLUX 3 最适合被理解为一次技术雄心勃勃的预览,而非对视频生成市场的既定排名。
Black Forest Labs 将视频和音频纳入 FLUX 3
FLUX 3 将 FLUX 系列从图像生成扩展为一个面向视觉媒体、声音和动作预测的共享模型。
Black Forest Labs 于 2026 年 7 月 23 日宣布 FLUX 3。根据该公司的 FLUX 3 发布公告,该模型在同一底层架构中从图像、视频和音频中学习。
该模型可根据文本提示词生成带有原生音频的视频。原生音频意味着声音作为生成过程的一部分被创建,而非之后由独立的声音模型附加。
Black Forest Labs 表示,单次生成最长可达 20 秒。这一时长足以支持一段完整的社交媒体短片、短广告,或多个连贯动作,而无需立即进行延展。
该模型还接受视觉参考。用户可以提供起始图像、参考图像或现有视频来引导结果。
其公布的视频工作流包括:
带音频的文生视频生成。
基于起始帧的图生视频动画。
使用视觉参考的图像引导视频。
视频转视频变换。
基于现有视频和音频序列的延续。
在选定时刻之间生成关键帧转视频过渡。
多语言对话生成。
将单个片段串联为更长的多镜头序列。
这些模式覆盖了实际制作工作流的不同环节。设计师可能会为产品图像制作动画,而电影创作者则可能希望在多个场景中保持角色一致。
单个 20 秒输出与多镜头序列之间的区别很重要。FLUX 3 可在一次生成中产出最长 20 秒的内容,而更长序列则需要通过串联片段实现。
串联让自动化代理或编辑系统能够构建更长的作品,但并不保证跨越每个衔接点都能实现完美连续性。
Black Forest Labs 表示,视觉参考可帮助在不同场景中保持角色一致。该公司尚未发布关于数分钟内身份一致性的独立测量结果。
FLUX 3 Video 可通过受限的早期访问计划使用。面向机器人技术的动作预测版本 FLUX 3 Action 也正进入选定测试阶段。
根据已公布的发布计划,FLUX 3 Image 将在未来几周推出。该公司还计划在 2026 年晚些时候提供 API、私有模型权重,以及开放权重的 FLUX 3 Dev 模型。
这一发布节奏将公告与广泛可用性区分开来。大多数创作者尚无法在常规生产条件下比较该系统。
不过,这一变化意义重大。Black Forest Labs 最初将 FLUX 系列作为图像生成项目推出,如今正将同一系列定位为声音、运动、编辑、模拟和机器人控制的基础。
单一多模态模型才是 FLUX 3 的真正押注
FLUX 3 的核心主张不是更长的视频,而是多种媒体类型在训练中相互约束时会变得更有用。
Black Forest Labs 基于 Self-Flow 构建 FLUX 3;这是其用于对齐多模态生成与理解的框架。模态是指一种信息形式,例如文本、图像、音频或视频。
传统媒体流水线通常将这些形式分配给不同模型。一个模型生成图像,另一个负责创建运动,第三个提供对话或特效。
这种分离可能引入可见和可听的矛盾。例如,玻璃杯可能先撞到桌面,碰撞声才随后传来;说话者的嘴部动作也可能与生成的对话不一致。
联合训练让系统能够接触同一事件的多种描述。视频承载运动信息,音频承载时间节奏,静态图像则提供细致的空间结构。
该公司的 Self-Flow 研究描述了一种自监督流匹配方法。流匹配训练模型通过学习得到的连续路径,将简单分布转化为结构化数据。
“自监督”意味着训练信号可以从数据本身推导得出,而不完全依赖人工标注。这可使大规模多模态训练更具扩展性。
Black Forest Labs 表示,其通过大幅增加数据和计算资源扩展了该方法。随后,FLUX 3 同时在图像、视频和音频数据上进行训练。
预期收益是相互约束:一个动作应对应预期的声音,而后续画面应能从先前画面中合理延续。
这一机制也解释了该公司为何对动作预测感兴趣。视频模型学习物体移动、掉落、弯曲或碰撞后通常会发生什么。
动作模型则提出一个相关问题:机器人执行特定动作后,环境会如何变化。
Black Forest Labs 认为,内容生成和机器人行为并不需要完全不同的基础模型。预训练的视频骨干模型可以成为专用动作模型的起点。
该公司与 mimic robotics 合作开发了 FLUX-mimic。该系统将 FLUX 3 骨干模型与灵巧机器人操控训练相结合。
据两家公司称,FLUX-mimic 仅使用 30 分钟机器人数据即可适配某些操控任务。此前的方法据称需要 30 小时或更长时间。
Audi 已在生产环境中测试该模型对软性材料的操控。这些任务对传统自动化而言很困难,因为柔性材料无法保持固定形状。
这些主张比一段精美的演示视频更具影响力。如果该方法能够泛化,Black Forest Labs 就可以在创意工具、模拟平台和实体自动化领域销售同一套基础模型。
然而,来自选定机器人试验的结果并不能证明其具有广泛可靠性。不同物体、摄像头、光照条件和工厂布局都可能改变性能。
该公司尚未公布足够的技术细节,无法判断这些模态之间到底共享了多少知识。哪些组件需要额外的任务专用训练,也仍不明确。
因此,这一机制可信但尚未完成。FLUX 3 为 Black Forest Labs 提供了连贯的研究方向,而早期访问则提供了验证它所需的测试场。
原生音频加大了专业视频工具的压力
FLUX 3 迫使视频平台围绕完整场景竞争,而不再只是无声的动态画面。
原生音频已迅速从一项少见功能转变为竞争性要求。OpenAI 将 Sora 2 描述为结合视频和音频的模型,具备对话、音效和背景声景能力。
其 Sora 2 发布公告还强调了物理行为以及跨多个镜头的指令。这些目标与 FLUX 3 最强的主张直接重叠。
Google 已将 Veo 整合进更广泛的创作和企业产品体系。其工具覆盖 Gemini app、YouTube、Flow、Google Vids、Vertex AI 和 API。
Google 的 Veo 3.1 更新强调了参考图像、竖屏输出、角色一致性、更丰富的对话以及高分辨率超分。分发能力为 Google 带来了原始模型质量无法抹去的优势。
Runway 从专业创意软件切入市场。Gen-4.5 强调运动质量、提示词遵循度、物理行为和精细的创意控制。
Runway 也为创作者提供了成熟的工作空间,用于生成、转换和整理素材。其 Gen-4.5 model支持图生视频、关键帧和视频转视频控制。
FLUX 3 凭借三项不同的竞争主张进入这一市场:更长的单次生成、原生声音,以及可延展至物理动作的单一多模态基础。
20 秒的上限很容易营销,因为它足够具体。但时长本身并不能决定一个片段是否可用。
更长的生成会给模型更多机会丢失角色身份、改变服装、让物体意外移动,或破坏因果关系。一段连贯的 8 秒视频,可能比一段不稳定的 20 秒视频更有价值。
音频又引入了一层评估标准。观众会注意到口型同步错误、音效错位、不自然的室内声学效果,以及说话者声音的变化。
多语言对话进一步提高了预期。正确发音只是其中一项要求,节奏、情绪、说话者身份和嘴部动作也必须保持一致。
Black Forest Labs 报告了基于带音频的 10 秒、720p 视频片段的初步人工偏好比较。该公司称,在与 Grok Imagine Video 的比较中,FLUX 3 的偏好率最高达到 69%。
其报告称,相较 Kling v3 Pro 的偏好率为 60%,相较 Seedance 2.0 为 52%,相较 Gemini Omni Flash 为 52%。此外,相较 Runway Gen-4.5 为 77%,相较 Luma Ray 3.2 为 93%。
这些数字提供了早期信号,但并不能终结比较。Black Forest Labs 将这些评估描述为初步结果,并表示模型和测试框架仍在开发中。
“最高达到”这一表述同样需要谨慎对待。它可能指测试中表现最强的一部分,而非在各种提示词、风格和输出类别中均匀一致的结果。
该公司尚未发布完整提示词集、采样流程、评估者说明、失败率或置信区间。缺少这些材料,读者无法复现相关发现。
竞争对手也在针对不同目标进行优化。Runway 高度重视制作控制,而 Google 则将模型能力与消费者和企业分发相结合。
因此,FLUX 3 在架构层面对专业工具施加压力。它提出的问题是:统一的基础模型能否最终匹配这些工具各自最强的功能,同时简化整个工作流。
这比赢得一次偏好测试是更强的挑战,也需要更长时间才能证明。
早期 FLUX 3 结果尚未证明什么
早期访问既限制了外部人士可获得的证据,也限制了负责任的买方应当接受的主张。
Black Forest Labs 公开将其已发布的评估称为初步结果。该公司计划在更广泛可用时,一并发布更完整的基准测试结果和方法论。
在此之前,仍有一些基本问题没有答案。该公司尚未披露模型的参数量、训练数据构成、推理速度或计算需求。
它也没有提供完整的 20 秒生成失败率。公开对比采用的是 10 秒、720p 视频片段,尽管最大时长是发布宣传的核心卖点。
这一差异至关重要。随着序列增长,时间一致性通常会变得更难保持。10 秒的结果并不能自动代表 20 秒时的表现。
早期访问的机制带来了额外限制。根据公司的项目条款,访问权限可能受限、可被撤销,并会分批发放。
除非 Black Forest Labs 另行书面同意,早期模型仅限用于评估、测试和开发。参与者通常不能将其用于大规模生产环境或终端用户应用。
条款还指出,模型可能产生不准确、不安全、低质量或意料之外的输出。模型也可能不稳定、被修改,或在未通知的情况下撤回。
通过该项目提交的输入和输出可被用于运行、评估和改进模型。因此,处理机密材料的组织必须评估该项目是否符合自身的数据管理规则。
参与者还须承担保密义务。这减少了在封闭阶段可能出现的公开批评、独立测试和具代表性的输出数量。
由公司挑选的演示通常会突出成功生成的结果。生产团队需要知道系统失败的频率、需要多少次重试,以及失败是否遵循可预测的模式。
他们还需要实用的控制能力。专业工作流需要可重复呈现的角色、镜头选择、产品细节、字体排版、对白和品牌元素。
FLUX 3 宣称在字体排版和动态设计方面表现出色。对于广告、解说视频和社交媒体素材而言,这很有前景,因为错误的文字足以让一个片段无法使用。
然而,“字体排版出色”并未说明错误率,也没有展示当镜头或物体移动时,小字号文字能否保持稳定。
安全性是另一个尚未解决的问题。原生对白可以支持叙事,但也使冒充和误导性媒体更容易被制作出来。
视频系统需要来源标识、肖像控制、内容过滤,以及追踪滥用输出的机制。例如,OpenAI 曾介绍其视频系统采用可见水印、C2PA 元数据、音频扫描和同意控制措施。
Black Forest Labs 表示将在早期访问期间进行安全测试。但其公告并未提供与 FLUX 3 安全防护措施相当的公开说明。
开放权重访问会让这一问题更加复杂。本地部署可以改善隐私、延迟和定制能力,但可下载的权重也可能削弱集中式执行。
许可条款的重要性将不亚于技术访问。该公司承诺提供开放权重的多模态骨干模型,但“开放权重”并不自动意味着可不受限制地用于商业用途。
开发者在规划再分发、商业微调或嵌入式部署之前,应等待实际的 FLUX 3 Dev 许可证。此前的 FLUX 版本采用了不同的访问和许可安排。
恰当的结论应当保持审慎。Black Forest Labs 展示了一个严肃的多模态系统及雄心勃勃的路线图。它尚未展示一款拥有独立验证领先地位的完整生产级产品。
Black Forest 的战略不止于创意视频
Black Forest Labs 正在将生成式媒体作为更广泛视觉智能平台的首个市场。
该公司的发布措辞多次将视频创作与模拟、计算机使用和机器人技术联系在一起。这一框架揭示了它预计长期价值将从何处显现。
创意生成提供了丰富的训练材料和即时的商业需求。用户能够迅速检查输出、识别失败,并提供偏好反馈。
机器人技术则面临更难的问题。生成的视觉错误可能毁掉一个片段,而动作预测错误则可能损坏设备或中断生产。
不过,这两个领域都要求模型表征运动及其物理后果。系统必须预判当手拉动布料、工具移动或两个物体碰撞时会发生什么。
FLUX-mimic 是这一共享基础假说最清晰的检验。该模型采用 FLUX 3 的视频骨干,并为机器人操作增加了专门训练。
Black Forest Labs 表示,这种方法可减少适配所需的任务专属机器人数据量。mimic robotics 则提供实用的部署专业知识,以及来自实体机器的数据。
Audi 提供了工业测试环境。柔性材料是一个要求很高的目标,因为其形状会在操作过程中不断变化。
如果 FLUX-mimic 能在经过精心挑选的演示之外稳定运行,这项合作将加强视频和动作表征共享基础的论据,也将使 FLUX 3 区别于仅面向媒体的系统。
这一结果可能形成有用的开发循环。视频数据教授广泛的物理模式,而机器人交互则提供动作及其后果的实例。
然而,将视觉知识迁移为安全控制仍然困难。能够预测出合理画面的模型,未必足够精确,能够直接指挥机器。
机器人系统还需要实时响应、经过校准的不确定性,以及严格的安全边界。对视频生成可接受的延迟,在工厂车间可能完全不可接受。
这构成了本文的核心张力。统一架构承诺带来更高的复用性,但每个目标市场都要求专门的可靠性。
创意应用可以容忍反复采样和人工挑选。机器人技术往往要求首次尝试就给出正确响应。
Black Forest Labs 似乎认识到了这种差异。FLUX 3 Action 正通过指定的研究和商业合作伙伴推出,而非提供不受限制的消费者界面。
计划中的私有权重方案也可服务于需要更低延迟或本地处理的组织。开放权重版本则会给研究人员更多空间来检查和适配骨干模型。
该公司的路线与主要聚焦于成品创意产品的平台不同。Google 可以通过既有服务分发 Veo,而 Runway 提供了成熟的生产环境。
Black Forest Labs 则希望成为底层模型提供商。其技术可以出现在创意应用、开发者平台、企业系统和专用的实体 AI 产品之中。
这一战略依赖合作伙伴。据报道,Canva、Krea、Picsart、Burda 和 Magnific 正在测试 FLUX 3,为该公司进入成熟工作流提供了多条路径。
合作伙伴能够将模型能力转化为可用工具。他们也决定有多少用户会接触到这项技术,以及哪些反馈会回流给开发者。
对于评估 FLUX 3 的团队而言,模型质量不应是唯一关注点。API 可靠性、许可、安全控制、部署选项和合作伙伴集成,将决定这一架构能否成为基础设施。
因此,Black Forest 的路线图远不止一次视频发布。FLUX 3 是对单一视觉基础能否同时支持内容与动作、且不会在两者上都沦为平庸表现的首次公开检验。
三个信号将决定 FLUX 3 能否兑现承诺
基准测试披露、生产访问和独立合作伙伴结果,将决定 FLUX 3 的发布能否超越一次令人印象深刻的预览。
第一个信号是承诺发布完整的基准测试方法。Black Forest Labs 需要披露提示词、评估者流程、采样设置、对比条件,以及完整 20 秒时段内的表现。
独立研究人员应能够复现其所报告偏好评分的大致趋势。如果能够做到,该公司对既有视频模型的挑战将更具说服力。
如果结果在中立测试下走弱,这次发布看起来就更像是经过精心挑选的早期证据。这并不会让 FLUX 3 变得无关紧要,但会削弱其领先地位的主张。
第二个信号是从早期访问走向可靠生产使用的路径。开发者需要稳定的 API、可预测的延迟、文档、安全控制和清晰的商业条款。
FLUX 3 Image 的发布将显示,共享训练能否在另一种主要输出类型上带来一致收益。私有权重和 FLUX 3 Dev 将揭示该公司对开放性的实际定义。
应仔细关注许可证。能够检查权重,与获准修改、再分发或将其用于商业用途,是不同的事情。
第三个信号是合作伙伴工作流中的表现。Canva、Krea、Picsart 及其他创意平台能够暴露受控演示所遗漏的问题。
Audi 和 mimic robotics 提供了更严苛的验证点。利用有限机器人数据实现可靠的动作预测,将支持视频学习可迁移至实体任务这一主张。
无法在不同任务间泛化,将削弱共享基础假说。这将表明,专门训练仍承担了大部分实际负担。
创作者也应比较完整工作流,而非孤立的视频片段。相关问题包括重试率、连续性、可编辑性、声音准确性,以及获得可接受结果所需的时间。
开发者应测试参考图像如何在多个相连场景中影响身份和风格。企业买家则应在上传敏感资产前,审查数据处理、访问保障和部署限制。
FLUX 3 值得关注,因为它将多个难题整合进一个模型,并为此提供了清晰的技术解释。其 20 秒视频生成为这一战略提供了易于理解的标题亮点。
更深层的考验在于,当访问限制开放后,这一架构是否仍能带来可靠收益。Black Forest Labs 已经提出了主张。更广泛的用户、独立基准测试和真实部署现在必须证明它的价值。
在接下来的几个月里,应将已发布的方法论与实际上手结果进行比较。然后提出一个实际问题:FLUX 3 是否减少了你的工作流所需的模型数量和编辑步骤,还是仅仅把这些复杂性转移到了同一个界面之后?


