top of page

Qwen-Image-2.1 Arena 结果使其位居开源模型第一,但并非总榜第一

17小时前
讀畢需時 12 分鐘

Qwen-Image-2.1 的 Arena 结果显示,阿里巴巴这款新模型在图像编辑和文生图两个类别中均位居开源模型首位。这一双项领先在其 9 月 20 日发布数日后便已实现,为 Qwen 带来了异常强势的公开首秀。

这一标题需要加上重要限定。Qwen-Image-2.1 在图像编辑总榜中排名第 16,在文生图总榜中排名第 17。OpenAI、Google、Microsoft、Meta、xAI 等公司的专有系统仍占据其上方的大多数席位。

最值得关注的对比出现在图像编辑排名的临界位置。Qwen-Image-2.1 得分为 1,367,仅比 OpenAI 的 GPT-Image-1.5 high-fidelity 模型 1,370 分低三分。不过,Qwen 的结果仍属初步数据,误差区间更大,且投票数远少于后者。

这并非只是又一个在开源模型筛选条件下登顶的模型。Qwen 在一项人类偏好测试中,已将可下载系统推进到接近成熟专有产品的水平。然而,其限制较多的研究许可证意味着,“开源”这一说法比排行榜标签所暗示的更复杂。

两项 Arena 排名发生了什么变化

Qwen-Image-2.1 在两份独立的 Arena 榜单上取得开源模型第一的位置,但这两项结果都不代表它是整体最佳图像模型。

在 Arena 的单图编辑榜单上,该模型获得 1,367 分,误差区间为正负九分。在 9 月 21 日的快照中,它在 56 个上榜模型里位列第 16。

这一得分使其成为 Arena 开源筛选条件下排名最高的模型。腾讯的 Hunyuan Image 3.0 Instruct 以 1,302 分紧随其后,较早发布的 Qwen Image Edit 则达到 1,241 分。因此,在该快照中,Qwen-Image-2.1 以 65 分领先最接近的开源竞争对手。

与 Qwen 之前的编辑模型相比,差距更大。其 1,367 分比 Qwen Image Edit 高出 126 分,尽管两者的投票总数和评估周期存在显著差异。这一差异具有参考意义,但不能视为对架构进步的受控测量。

总排名则呈现出更克制的叙事。OpenAI 的 GPT-Image-2.5 Sunburst 以 1,526 分领跑,另一款 GPT-Image-2.5 变体以 1,482 分紧随其后。Qwen-Image-2.1 仍落后榜首 159 分。

不过,它与一款成熟 OpenAI 模型的接近程度值得关注。GPT-Image-1.5 high-fidelity 以 1,370 分排名第 15,仅留下三分差距。两者显示的误差区间存在重叠,因此不应将这一排序视为决定性的质量差异。

图像编辑榜还显示出明显的证据不均衡。Qwen-Image-2.1 获得了 4,841 票,而 GPT-Image-1.5 high-fidelity 获得了 589,013 票。Arena 将 Qwen 的结果标记为初步结果。

Qwen 还在文生图领域领跑开源模型。它获得 1,228 分,误差区间为正负 11 分,在 79 个模型中排名第 17。其结果基于 2,843 票。

文生图榜显示,OpenAI 的 GPT-Image-2.5 Sunburst 以 1,423 分位居第一。OpenAI、Microsoft、xAI、Reve、Meta、Google、ByteDance,以及阿里巴巴的专有 Qwen 模型,均排在这一可下载 Qwen 版本之前。

阿里巴巴的发布声明准确地将 Qwen-Image-2.1 定义为两份榜单上的领先开源模型。但不应将其解读为该模型在任一未筛选排行榜中登顶。

这一差别很重要,因为“开源模型第一”和“总榜第一”回答的是不同问题。前者衡量的是受限范围内的竞争,后者反映该模型与所有可评估系统相比的表现。

双项领先为何会给开源竞争者带来压力

Qwen-Image-2.1 的 Arena 排名提高了人们对可下载模型的期待;这些模型此前主要依靠专业化能力或更低的部署门槛竞争。

其最直接的压力对象并非 OpenAI,而是腾讯、Black Forest Labs、ByteDance 以及 Qwen 自身早期版本推出的开源和开放权重图像模型。这些系统如今要在两项任务上面对更高的公开标杆。

在图像编辑领域,Hunyuan Image 3.0 Instruct 以 1,302 分在 Arena 的开源筛选中排名第二。Qwen Image Edit 及其 2511 修订版随后分别为 1,241 分和 1,235 分。Black Forest Labs 的 Flux 2 Dev 和 Klein 变体排名更低。

Qwen-Image-2.1 不只是某一榜单上超过这些模型。它在创作和编辑两项筛选榜中均居首位。这种广度对那些为两项任务分别维护不同模型或工作流的竞争者构成挑战。

文生图的竞争图景更为拥挤。Nvidia 的 Cosmos3 模型、Hunyuan Image 3.0、Flux 变体、Ideogram 的开放模型及更早的 Qwen 版本都出现在榜单上。Qwen-Image-2.1 排名高于它们,同时还具备编辑能力。

这种组合在工作流层面形成了压力。开发者可以用一个模型家族完成初始生成、基于指令的修改、多参考图合成以及透明背景输出。减少模型切换,能够简化本地实验和应用设计。

该模型发布时也获得了即时生态支持。Qwen 表示,Diffusers、ComfyUI、vLLM-Omni、SGLang、LightX2V 和 ModelScope 在发布当日便支持该模型。这些集成缩短了权重发布到获得有价值社区反馈之间的延迟。

首日支持并不保证采用率,但确实让独立开发者能够通过熟悉的界面开始测试模型。缺乏相当集成能力的竞品发布,可能在质量差异尚未明朗之前就失去关注。

因此,这一竞争格局的逆转比简单的开源对闭源胜利更为有限。Qwen 尚未取代专有模型领跑者,但它使领先的开放选项更加统一,并将其编辑得分推进到接近一款较早专有模型的水平。

这一组合改变了用户对开放权重发布版本的合理期待。仅有强大的生成能力已不再足够。具备竞争力的模型越来越需要编辑能力、参考图控制、高效推理服务,以及对常用工具的可靠支持。

Qwen 的新位置也可能给阿里巴巴自家的商业图像服务带来压力。Arena 将专有 Qwen 模型与可下载版本分别列出。在文生图领域,Qwen Image 3.0 Pro 仍以 1,254 分领先,而 Qwen-Image-2.1 为 1,228 分。

内部差距相对较小,但两类产品满足不同的部署需求。托管专有模型强调受管理的访问方式;可下载模型则强调控制权、实验能力,以及在许可证边界内运行的能力。

对于开源模型开发者而言,需要作出的回应很明确:他们需要更强的编辑质量、更广的任务覆盖范围,或限制更少的商业许可证。仅匹配显示出的分数,只能解决这一挑战的一部分。

Qwen-Image-2.1 Arena 结果缩小了一项专有模型差距

与 GPT-Image-1.5 仅差三分令人瞩目,但这并非开源模型已追平 OpenAI 的统计学证据。

Arena 通过匿名的并排对战衡量人类偏好。用户提交提示词,接收来自两个未标明身份模型的输出,并选择自己偏好的结果。模型名称会在投票后显示。

该系统能够捕捉固定基准可能遗漏的特质。人类投票者可以对指令遵循、视觉吸引力、文字准确性、身份保留程度,以及编辑结果是否实用作出反应。提示词也反映真实用户兴趣,而非静态测试集。

Arena 将其匿名模型对战描述为由用户投票推动的公开评估过程。这种设计使榜单与实际感知相关,但并不意味着每一分差距都构成明确排名。

Qwen-Image-2.1 的编辑得分为 1,367,误差区间为正负九分。GPT-Image-1.5 high-fidelity 得分为 1,370,误差区间为正负三分。Qwen 显示的排名范围从第 14 至第 17,而 OpenAI 模型的范围为第 14 至第 16。

这些重叠区间削弱了任何关于哪款模型更好的确定性说法。名义上的三分差距小于 Qwen 显示的误差区间。当前结果支持其具有竞争性接近程度,但不支持两者等同。

投票量使审慎判断更加重要。Qwen 获得了 4,841 张编辑投票,而作为比较对象的 OpenAI 模型有 589,013 张。更大的样本并不自动意味着每个 OpenAI 输出都更好,但确实意味着其位置更为成熟。

同样的问题也影响文生图结果。Qwen 的 1,228 分带有正负 11 分的误差区间,基于 2,843 张投票。其估计排名范围覆盖第 15 至第 17 位。

随着模型遇到更多对手、提示词类型和用户偏好,初步排名可能发生变化。早期投票者也可能用受其宣传优势启发的提示词测试新版本。后续流量往往更加多样。

Arena 排名还取决于可用的模型池。Qwen 在归入开源筛选条件的模型中排名第一,并非在所有可下载模型定义中均居首位。分类与许可证选择塑造了这一子集。

即便存在这些限制,结果仍具有战略意义。Qwen-Image-2.1 上榜时已接近一款拥有数十万记录投票的专有模型。这为开发者提供了具体理由去评估它,而不是将其视为质量较低的本地替代方案而忽略。

这一结果尤其适合需要可重复私有工作流的团队。可下载模型可让图像、提示词和参考图保留在运营方控制的基础设施中。专有服务则可提供不同优势,包括托管容量和成熟界面。

Arena 分数无法决定应在这两类部署模式中选择哪一种。它表明,在一个公开偏好系统中,可见的质量权衡已经缩小。运营成本、延迟、安全控制、许可证和特定领域可靠性,仍需要单独测试。

统一的 7B 设计解释了更广泛的挑战

Qwen-Image-2.1 将图像创作和编辑整合进一个拥有 70 亿参数的视觉生成器,而非将其视为彼此无关的产品模式。

根据 Qwen 的模型仓库,其视觉生成组件包含 32 个单流扩散 Transformer 层。扩散 Transformer 会在每一步根据文本和视觉输入的条件,迭代地将噪声转换为图像。

该系统使用 Qwen3-VL 8B 作为文本和图像编码器。该组件将指令和参考图像转换为共享表征,以引导生成过程。独立的自动编码器则处理常规彩色图像和原生 RGBA 透明度。

Qwen 表示,该模型支持文生图、单图编辑,以及最多使用 10 张参考图的合成。它还可接受圆圈、绘制标注或蒙版,以识别局部编辑目标。

这些控制方式解决了实际的图像编辑问题。零售商可以组合来自不同参考图的产品、模特、服装和配饰。设计师可以隔离对象、更换其背景,并保留透明像素以便后续版式设计。

官方示例包括一张由六张人像参考图合成的群像,以及一套由五个独立输入组成的服装。它们展示了所承诺的工作流,但仍属于模型创建者筛选出的示例。

独立用户仍需在复杂角度、拥挤场景、小字号文本和反复修改中测试身份一致性。模型或许能产出令人惊艳的首次编辑结果,却可能在数次修改后逐渐偏离。Arena 的单场对战分数无法充分揭示这种表现。

原生透明度是另一项实用差异。大多数图像生成器即使被要求生成独立对象,也会输出平面的矩形图像。Qwen-Image-2.1 则可生成 RGBA 图像,其中 alpha 通道与颜色信息一同存储透明度。

这项功能可减少贴纸、界面素材、产品抠图和合成场景中的去背景工作量。Qwen 还表示,该模型能够编辑透明图层,并从照片中提取主体。

其架构采用混合粒度注意力机制和前缀键值缓存复用。简单来说,模型可以在去噪步骤之间复用指令和参考图像的表征,从而避免反复重新计算相同的条件信息。

Qwen 建议使用 40 个推理步骤,并列出了约 2K 分辨率的原生输出尺寸。支持的画幅包括正方形、竖版、横版和宽屏格式。这些规格使该模型比受限的研究演示更适合面向生产环境的实验。

更广泛的部署生态同样重要。此次发布包含面向 Diffusers 和 ComfyUI 的工作流,这两者是开发者和视觉创作者常用的入口。vLLM-Omni 和 SGLang 也提供了服务支持,包括缓存、并行化和内存卸载选项。

这套周边工具链有助于解释该发布为何迅速受到关注。当人们无需从零搭建推理栈,就能加载开源图像模型、调整工作流并比较结果时,这类模型会更具实用价值。

不过,7B 的标签并不能说明完整的资源需求。Qwen 的视觉生成器还需要配合独立的 8B 视觉语言编码器和自编码器。实际内存占用取决于精度、卸载方式、分辨率以及所选软件栈。

因此,紧凑的视觉核心支持其效率方面的论点,但不足以证明部署成本普遍低廉。团队应在自己的硬件上,以应用所需的分辨率和参考图数量,对完整管线进行基准测试。

Qwen 图像编辑还依赖提示词改写。该项目提供独立的 Qwen3.5-VL 9B 检查点,用于扩展生成和编辑的简短指令。更好的提示词可以改善输出,但也会为工作流增加一个组件。

这种模块化带来了权衡。开发者获得了对改写、推理和服务的控制权,但也需要管理更多模型和依赖项。托管的专有工具通常会将这些选择隐藏在单一界面之后。

开放模型的标题没有展现什么

最大的保留并不在于总体排名,而在于 Arena 的开源标签与 Qwen-Image-2.1 实际使用权之间的差距。

Qwen 将此次发布描述为开源,Arena 也将其纳入开源筛选条件。然而,该模型采用的是 Qwen Research License,而非 Apache 2.0 等宽松许可证。

这份研究许可证授予用户将相关材料用于非商业目的的使用、复制、修改和分发权利。商业使用则需要另行从 Qwen 获得许可。

这一限制对评估该模型用于客户产品、营销系统、设计服务或内部商业运营的公司至关重要。可下载并不自动意味着拥有在这些场景中部署模型的权利。

该许可证还要求在重新分发时进行署名。使用 Qwen 材料或输出训练另一款进行分发的模型的产品,必须展示指定措辞。协议还包含涉及命名、诉讼和终止的额外限制。

这些条款并未抹去此次发布的技术价值。研究人员、评估者和非商业创作者仍可根据协议检查并运行权重。该模型也能为可下载图像系统的能力提供有价值的证据。

不过,“开源”通常意味着不止是可见的权重和可运行的代码。开放源代码促进会对 AI 的定义强调使用、研究、修改和共享系统的自由。非商业限制削弱了其中一项核心自由。

根据榜单信息,Arena 上较早的 Qwen Image Edit 条目采用 Apache 2.0。Qwen-Image-2.1 因此在提高公开分数的同时转向了更严格的许可证。对开发者而言,这是实质性变化,而非法律脚注。

许可证分类也可能扭曲竞争比较。Arena 的开放筛选将采用宽松许可证的模型与仅限研究或非商业使用的模型归为一类。它们的实际可用性存在显著差异。

初创公司无法像使用 Apache 许可的依赖项那样使用 Qwen-Image-2.1,除非获得单独授权。学术实验室可能面临较少障碍。但两类用户会在同一排行榜筛选条件下看到同一模型。

分数本身还存在另一项保留。Qwen 的位置仍属初步结果,基于数千张投票,其不确定性范围也比成熟竞争对手更大。该排名需要时间稳定下来。

Arena 偏好衡量的是投票者喜欢什么,而不是企业所需的所有维度。它并不直接验证版权风险、安全表现、输出来源、人口统计学表现,或在私有数据集上的一致性。

公开榜单同样无法证明服务效率。模型可以赢得视觉投票,却仍难以在严格的延迟目标下运行。其原生 2K 输出和多参考图工作流可能需要大量内存和处理时间。

关于身份保留的主张也需要保持同样谨慎。Qwen 表示模型可在编辑过程中保留人物和产品特征,但经过筛选的演示无法证明它在每张面孔、每个角度或每种光照条件下都可靠。独立测试仍然必要。

因此,更负责任的解读应比宣传标题更谨慎:Qwen-Image-2.1 在两份 Arena 快照中都是得分最高的被归类为开放的模型。其确切排名仍属初步结果,且许可证限制商业使用。

这样的解读仍为 Qwen 留下了值得关注的成果。它只是将营销语言常常混为一谈的三个问题区分开来:权重是否可获取、质量是否具有竞争力,以及部署权利是否适合商业产品。

Qwen-Image-2.1 登上 Arena 后值得关注什么

三个信号将决定此次亮相能否形成持久领先:稳定的 Arena 分数、独立工作流测试,以及更清晰的商业使用权限。

首先,关注投票数量和不确定性范围。Qwen-Image-2.1 需要在两个排行榜中获得显著更多的对战投票。若在更广泛投票后仍保持稳定分数,将强化其性能可超越发布首周热度而普遍适用的说法。

重要的数字不只是名义排名。随着投票积累,其不确定性区间应当收窄。在可比条件下,该模型还应持续领先于 Hunyuan、Flux、Cosmos、Ideogram 以及未来的开放发布。

相对于专有模型的变化也值得谨慎解读。若 Qwen 在数万场对战后仍接近 GPT-Image-1.5,当前的接近程度会显得更具持续性。若排名下滑,则说明这三分差距只是早期快照。

其次,独立测试者应检验连续编辑,而非孤立的展示图像。有效测试应涵盖排版、产品身份、面孔、透明素材、多主体构图,以及多次连续修改。

他们还应报告完整的硬件配置。分辨率、精度、模型卸载、提示词改写和参考图数量都可能改变内存使用和延迟。缺少这些细节的结果,对部署决策几乎没有指导意义。

第三,开发者应关注 Qwen 的许可政策。广泛可用的商业协议、更宽松的条款,或后续采用 Apache 许可的版本,都将扩大该模型的实际影响力。持续的非商业限制则会让许多商业用途仍需另行谈判。

竞争对手也将影响最终判断。即使 Qwen 自身分数保持稳定,其位置也可能下滑,因为新发布的模型可能在它之上进入榜单。Flux、Hunyuan、Nvidia、Ideogram 和其他团队如今都有一个明确目标。

对于开发者而言,合理的下一步是直接评估,而不是膜拜排行榜。请用最具挑战性的参考图测试 Qwen 图像编辑,并比较完整工作流。将输出质量、失败率、内存使用、延迟和许可证兼容性一并纳入考量。

对于企业采购方,Qwen-Image-2.1 的 Arena 结果足以支持技术评审,但不足以自动作出采购决定。在构建依赖该模型的产品前,应确认商业权利。应将当前分数视为前景的证据,而非保证。

对于创作者而言,该模型的一体化工作流和透明度支持,是立即尝试它的最强理由。排行榜提供邀请;你的提示词、素材和修订流程将给出答案。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page