top of page

Qwen-Image-2.1 基准测试在开放权重模型中登顶,但总排名仍为第18

6天前
讀畢需時 14 分鐘

Qwen-Image-2.1 在 Artificial Analysis 的两项测试中位列开放权重模型第一,尽管在两张总榜上的排名均为第18。Qwen-Image-2.1 的基准测试结果为 Alibaba 在文生图生成和基于指令的图像编辑领域赢得了一场值得关注的胜利。

Artificial Analysis 表示,其评估使用了在本地部署的已发布权重。这一细节使 Qwen-Image-2.1 区别于托管服务,后者的模型、基础设施和输出流程均由提供商控制。

不过,这一结果并不意味着 Qwen-Image-2.1 是目前可用的最佳图像模型。两张总榜的前17个位置仍由专有系统占据。真正的竞争,在于可访问的模型权重与仍在绝对质量上领先的封闭服务之间。

Qwen-Image-2.1 基准测试带来了两项不同的胜利

Qwen-Image-2.1 在两项不同任务中领跑开放权重模型,但其总排名也显示出仍有很大差距需要追赶。

Artificial Analysis 在9月30日的一次本地评估中公布了结果。该测试机构称,其在自有基础设施上运行 Qwen-Image-2.1,而非依赖由创建方控制的 API。

在 AA-Image-T2I v2.0 上,Qwen-Image-2.1 的 Elo 分数为 1,034,报告的95%区间为 1,024 至 1,044。截至10月2日可查看的排行榜快照中,该模型累计获得了 5,286 个评估样本。

这一分数使其在完整文生图排行榜中位列第18。当按可下载权重模型筛选同一榜单时,它则排名第一。

Ideogram 4.0 Quality 在这一开放权重组别中位居第二。其分数为 1,011,在 12,176 个样本中,区间为 1,004 至 1,018。

点估计显示,Qwen-Image-2.1 领先23分。报告的置信区间也没有重叠,因此相比仅相差一个名次,这提供了更有力的证据。

文生图评估衡量模型根据文字提示生成新图像的能力,涵盖广告、产品图像、建筑、图表、娱乐和创作者内容等任务。

图像编辑的结果更接近,但结论不那么明确。Qwen-Image-2.1 得分为 1,074,在 5,536 个样本中,报告区间为 1,065 至 1,083。

这一分数同样使其总排名第18,也让该模型成为编辑排行榜中排名最高的开放权重条目。

Tencent 的 HunyuanImage 3.0 Instruct 以 1,066 分紧随其后。在 5,221 个样本中,其报告区间为 1,057 至 1,075。

因此,按展示的估计值计算,Qwen 领先 HunyuanImage 8分。不过,两者的区间存在明显重叠,Artificial Analysis 也为两款模型给出了覆盖第一和第二名的潜在开放权重排名区间。

更负责任的解读应当保持克制。Qwen-Image-2.1 目前拥有更高的展示分数,但编辑测试尚未证明它相较 HunyuanImage 存在明确无误的质量差距。

这两项结果依然意义重大,因为生成与编辑带来了不同的技术要求。一款模型可以擅长构建美观场景,却可能难以在编辑中保持人物身份、布局或未修改区域不变。

Qwen-Image-2.1 在一次可下载发布中,于两种模式下均展现出竞争力。正是这种组合,而非任何单一分数,让结果对开发者更具影响力。

为什么开放权重第一很重要

这项基准测试将对开放权重模型的讨论,从基本的可获得性推向了完整视觉工作流中的可信性能。

Alibaba 于9月20日发布 Qwen-Image-2.1。该公司将其描述为用于图像生成、图像编辑和透明图像制作的统一模型。

其视觉生成组件包含70亿参数和32个单流扩散 Transformer 层。扩散 Transformer 结合 Transformer 风格的注意力机制,通过迭代将噪声转化为所需图像。

70亿这一数字仅适用于该视觉组件,不应被理解为该流程所需所有支持组件的总规模。

根据官方 Qwen 发布说明,该模型最多可使用十张参考图像,也支持圆形标记、涂绘注释和蒙版,用于局部编辑。

这些控制能力面向实际生产工作。零售商可以在保留产品的同时,更换其背景、光照或周围道具。设计师则可以将对象分离至透明背景,无需手动重建素材。

该模型还可生成 RGBA 图像,即在红、绿、蓝颜色数据之外包含透明度通道。这使透明背景成为原生输出,而非后续单独的抠图步骤。

本地部署改变了围绕这些能力的运营模式。团队可以检查文件、自主选择基础设施,并构建无需将每个输入都发送至远程生成端点的工作流。

当源图像包含未发布产品、营销材料、客户信息或内部设计资产时,这一点尤为重要。本地运行并不会自动解决治理问题,但会扩大可掌控的范围。

可下载权重还让开发者能够测试量化、内存优化、自定义推理调度和特定任务适配器,并在自己的硬件和提示词上衡量取舍。

托管的专有服务通常会在这些层面提供更少控制。提供商会选择模型版本、安全系统、基础设施和支持的接口。

代价是运营责任。可下载模型仍需要合适的硬件、兼容的软件、存储、监控,以及能够维护部署的人员。

Qwen 的公开模型卡包含一项 CPU 卸载选项,用于降低加速器的内存压力。卸载会在推理期间,在系统内存与加速器之间迁移选定组件。

这项技术扩大了硬件兼容性,但也可能增加延迟。规模较小的组织仍需评估,本地控制是否值得额外的工程投入。

该发布版本还采用 Qwen Research License Agreement。因此,与其将该模型视为不受限制的开源软件,“开放权重”是更准确的表述。

开放权重意味着训练参数可在规定的许可条款下下载。开源通常意味着更广泛的权利,以及对完整开发材料的访问。

这一术语差异对商业规划十分重要。模型可以在本地部署,却不一定授予开发者与宽松软件许可证相关联的全部权利。

Artificial Analysis 通过可下载权重链接识别 Qwen-Image-2.1,而非托管的创建方 API。因此,该基准测试评估的是开发者实际可以获取的产物,而不只是一个品牌服务。

这使结果与正在本地视觉基础设施和封闭图像 API 之间做选择的团队相关。它为这些团队提供了独立证据:获得访问权不再意味着必须接受末流水平的质量。

总排名第18仍限制了更宽泛的说法。Qwen-Image-2.1 缩小了实际差距,但并未消除专有系统在测得质量上的领先优势。

Qwen-Image-2.1 与 Ideogram 4.0 改变了生成竞赛

Qwen-Image-2.1 如今在可下载模型中拥有最明确的生成性能领先,对 Ideogram 侧重质量的发布版本形成直接压力。

Qwen-Image-2.1 与 Ideogram 4.0 的比较,是两场基准竞争中更清晰的一场。两款模型均发布了可下载权重,也都面向以生成任务为主的创意工作流展开竞争。

Ideogram 4.0 Quality 的 Elo 分数为 1,011。Qwen-Image-2.1 在同一 AA-Image-T2I v2.0 框架下达到 1,034。

这一差异反映了人类在成对输出之间的偏好。它并不将事实准确性、提示词遵循度、排版或视觉吸引力分别作为独立分数衡量。

Artificial Analysis 根据盲测比较计算评分。评估者会看到竞争图像,但不知道每张图由哪个系统创建,随后选出更偏好的输出。

其当前基准测试方法采用十个实用类别,范围覆盖零售、广告、建筑、知识工作、界面设计和社交内容等。

该机构每月更新提示词集合。这减少了对永久固定集合的依赖,尽管任何有限的提示词集合都无法代表所有生产任务。

该基准测试还将开放与封闭模型锚定在同一套总分尺度上。这一设计使 Qwen 的开放权重领先地位能够与其第18名的总排名并存。

这一区分对采购方很重要。“最佳开放权重模型”回答的是部署问题,而“整体最佳模型”回答的是更广泛的质量问题。

需要可下载权重的组织,可能会将 Qwen 放在候选清单首位。另一类只关注基准测试最高质量的买家,仍有17个排名更高的选择。

Ideogram 也依然具备竞争力。其置信区间上限为 1,018,而 Qwen 的下限为 1,024,但随着更多比较结果出现,基准测试结果仍可能变化。

样本数量存在显著差异。Ideogram 4.0 Quality 记录的样本数超过两倍,因此其估计区间更窄。

Qwen 的 5,286 个样本仍超过 Artificial Analysis 对上榜模型公布的要求。该机构称,目前模型至少需要在竞技场中出现500次,才能获得排行榜排名。

生成结果并不能证明 Qwen 在每个类别中都获胜。模型的总 Elo 汇总了多样化任务中的偏好,而用户对这些任务的权重可能不同。

营销团队可能最看重可读排版、品牌一致性和布局控制。概念艺术家则可能优先考虑纹理、构图和风格范围。

Qwen 强调了其在排版、人像和精细纹理方面的改进。这些说法来自 Alibaba,在采用前应结合真实项目材料进行测试。

该模型对多参考图的支持增加了总体分数无法捕捉的另一维度。高度依赖参考图的工作,可能更看重一致性,而非不受约束的视觉质量。

产品团队可以提供同一件商品的多张照片,再要求生成新的构图,同时保留其外观。结果必须保持形状、标签和可识别的细节。

这种场景将生成与身份保持结合起来,也说明了为何综合排行榜应当是评估的起点,而不是终点。

尽管如此,这一结果仍改变了竞争基线。Ideogram 不再在该基准测试中保持开放权重发布版本中展示分数最高的文生图成绩。

Qwen 现在成为下一款可下载生成模型的比较目标。新入局者不仅需要超过 1,034 分,还需证明这一优势能够经受更多投票的检验。

专有服务商面临的是另一种压力。由于 Qwen 排名第18,它们无需立即作出回应;但它们必须证明,为何仍应保持部署与模型控制的封闭状态。

随着开放权重模型的质量提升,采购方可以要求托管系统提供更清晰的优势。这些优势可能包括更高的输出质量、更低的运营负担、更快的生成速度,或更强的企业级控制能力。

该基准测试并不决定哪种方案能带来最低的总体成本。它评估的是输出偏好,而非硬件采购、维护人力或工作流集成成本。

不过,Qwen 的紧凑型视觉组件提供了一个颇具吸引力的方案。它兼具可观的整体质量,以及闭源供应商通常无法提供的控制能力。

相较 HunyuanImage 的编辑领先真实存在,但幅度有限

Qwen-Image-2.1 在开放权重模型中拥有最高的展示编辑得分,但统计不确定性意味着 HunyuanImage 3.0 Instruct 仍在可追赶范围内。

图像编辑通常比从零生成更难容错。模型必须修改指定区域,同时保留指令未要求改动的一切内容。

Artificial Analysis 测试对象变更、重新打光、修复、重新构图、身份保留、排版以及基于推理的编辑。每项请求都包含一张输入图像和一条文字指令。

这种结构比要求模型创作一张无关图像,更接近真实的后期制作工作。微小的非预期改动,就可能让原本颇具吸引力的结果无法使用。

Qwen-Image-2.1 在这项测试中取得 1,074 分。HunyuanImage 3.0 Instruct 获得 1,066 分,使两款模型在开放权重参赛项中分列第一和第二。

这 8 分的差距值得关注,因为两款模型都使用了数千个已评估输出。不过,其区间在 1,065 至 1,075 之间存在重叠。

这种重叠意味着,随着更多偏好数据的加入,当前展示的排序可能发生变化。它也意味着读者不应将结果解读为笼统的绝对领先。

Qwen 的统一设计仍赋予其战略价值。开发者可使用同一条管线完成初始生成和后续编辑,而不必维护彼此无关的模型。

一个创意团队或许会生成产品场景、替换其中一个物体、修正可见文字,并以透明背景导出主体。从理论上说,一个模型即可覆盖这一完整链路。

其优势在于一致性和集成简便性。风险则是,通才模型未必能在每个环节都领先于专用系统。

HunyuanImage 3.0 Instruct 仍是开放权重编辑类别中最有力的直接挑战者。其公布得分在统计上接近 Qwen 当前的成绩。

因此,腾讯的模型提供了恰当的压力测试。如果随着两者样本量增长,Qwen 仍能保持领先,结果将更具说服力。

这场竞争还表明,中国模型开发者如今占据了这项开放权重编辑比较的前两名。阿里巴巴和腾讯都在推进易于获取的视觉模型,同时也提供托管产品。

这并不只是一个地域叙事。它反映了一种开发策略:通过可下载版本加速实验、集成与社区优化。

本地社区通常会在模型发布后不久推出量化版本。量化通过降低数值精度来减少内存需求,通常会对质量带来一定风险。

社区工作流还可能加入替代调度器、适配器和应用接口。这些改动有助于推广采用,但也使其与原始评估配置的比较变得复杂。

Artificial Analysis 表示其在本地托管了 Qwen-Image-2.1。因此,读者应区分其测量配置与经过大幅修改的社区版本。

在消费级硬件上运行的量化版本,可能与评估模型表现不同。延迟、内存消耗和图像质量都可能发生变化。

官方模型文档支持文生图、编辑以及多种图像尺寸。其示例工作流使用 40 个推理步骤。

推理步骤是用于构建最终图像的重复去噪阶段。更多步骤可能增加处理时间,却无法保证质量按比例提升。

同一份文档展示了多种宽高比下最高约 2K 尺寸的输出。实际内存需求取决于分辨率、精度、卸载方式和支持组件。

这些实现细节很重要,因为无法适配团队硬件的编辑领先者,并不必然是最佳的运营选择。

开发者应在投入前复现若干高价值任务。实用测试包括身份保留型修改、精确文字替换、产品一致性、遮罩以及多参考图构图。

他们还应在多个随机种子下重复提示词。偶尔能产出优秀结果的模型,仍可能无法满足生产环境的可靠性要求。

Qwen 的基准测试位置值得严肃评估。但这并不能取代评估本身,尤其是在 Hunyuan 仍处于公布不确定性区间内时。

排名并未证明什么

排行榜衡量的是在既定测试下的人类偏好,而非普适质量、生产可靠性、法律适用性或运营效率。

Elo 是一种相对指标。分数取决于比较池中包含的模型、输出、提示词和投票。

数字 1,034 脱离该基准测试本身并没有独立含义。它的价值来自 Qwen 相对于在同一系统下评估的其他模型所处的位置。

Artificial Analysis 汇集了招募评审团的投票与符合条件的历史公开投票。在以类似 Elo 的尺度展示结果前,它会进行筛选并使用 Bradley-Terry 估计。

这一过程比创作者自行挑选最佳示例更具参考价值。但它仍取决于人类偏好,而偏好会因受众和使用场景而变化。

排行榜也会随时间变化。新模型会加入,更多样本会积累,提示词集合也会更新。

在 10 月 2 日的快照中,Qwen-Image-2.1 在两份总榜上均排名第 18。这些数字应被视为有日期标记的位置,而非永久标签。

文生图领先看起来更稳固,因为其置信区间与 Ideogram 4.0 Quality 不重叠。编辑领先则需要更多谨慎解读,因为 Qwen 与 Hunyuan 的区间存在重叠。

两项结果都不能证明其在每种语言中的提示词准确性。它们也无法证明稳定拼写、安全的商业输出,或符合品牌要求的能力。

Qwen 表示该模型提升了排版、身份保留和视觉细节。在团队依据自身验收标准进行验证前,这些仍属于开发者声明。

许可证审查是另一项独立要求。可下载权重并不能免除 Qwen Research License Agreement 中规定的义务。

组织在将模型用于商业部署前,应审查允许的用途、分发条件及任何限制。排行榜无法回答这些法律问题。

训练数据透明度同样不在展示排名的范围内。强劲的输出质量并不能说明开发期间使用数据的完整来源。

内容安全是另一个缺失维度。团队可能需要针对冒充、违禁内容、受版权保护的角色或未经授权的品牌资产设置防护措施。

本地部署会将更多责任转移给运营方。组织必须自行设计访问控制、日志记录、审核和留存机制。

闭源供应商通常会将其中一些系统与服务一并提供。用户可能获得便利,同时也会让渡可见性和部署控制权。

硬件效率同样需要独立测量。Qwen 将其架构描述为紧凑,但一个拥有 70 亿参数的视觉组件仍需要大量计算资源。

支持性的文本编码器及其他管线元素会增加内存和处理需求。仅凭视觉参数量无法预测部署成本。

生成时间对分辨率、精度、推理步骤、优化方式和加速器类型高度敏感。一项公布的延迟数字无法泛化到所有这些选择。

排行榜中没有创作者 API,也带来了另一项考量。希望使用 Qwen-Image-2.1 的团队,目前必须通过可用的模型工具或第三方基础设施自行安排部署。

这可能吸引寻求控制权的开发者,却可能劝退希望获得托管端点、服务保障和统一支持的采购方。

因此,最佳选择取决于具体约束。设计工作室、研究团队、受监管企业和消费级应用,可能会从同一组分数得出不同结论。

该基准测试提供了一个可信信号:开放权重模型在绝对前沿之下已具备竞争力。它并未证明本地部署会自动更简单或更安全。

它也没有抹去整体差距。在每份完整排行榜中,仍有 17 个模型排在 Qwen-Image-2.1 之前。

这一排名正是这篇报道的核心张力所在:开放权重模型出现了新的领跑者,而专有模型仍定义着测得的上限。

三个信号将揭示 Qwen 的领先能否持续

下一项考验在于:随着投票增加、真实部署扩大以及新的开放权重竞争者到来,Qwen 能否保持其位置。

第一个信号是排行榜稳定性。Qwen 的文生图结果已经显示出,与最接近的开放权重竞争对手之间存在更清晰的统计差距。

其编辑优势仍较为脆弱,因为置信区间与 HunyuanImage 3.0 Instruct 重叠。更多比较将会巩固当前排序,或将其推翻。

稳定的生成领先将强化阿里巴巴的主张:较小的统一模型能够平衡质量与效率。若编辑排名反转,当前叙事的力度则会减弱。

第二个信号是可复现的本地性能。开发者应关注在常见加速器、精度等级和内存配置下开展的标准化测试。

社区量化版本将扩大硬件可及性,但其输出应与原始权重进行比较。只有在质量保持可接受时,降低内存使用才有意义。

生产报告还应考察重复尝试时的一致性。吸引人的展示图像不能替代可靠的文字、身份、几何结构和局部编辑能力。

若有证据表明其能在消费级和工作站硬件上可靠使用,将增强开放权重方案的说服力。高内存需求或脆弱的工作流则会削弱这一论点。

第三个信号是下一轮竞争回应。Ideogram、腾讯、Black Forest Labs 及其他开发者,如今在 Artificial Analysis 上拥有明确目标。

竞争对手可以通过推出得分更高的开放权重版本、更宽松的许可证、更易部署的方案或更强的专用控制能力作出回应。

闭源供应商可以采取不同方式回应。他们可以扩大质量差距,或让托管服务更容易集成和治理。

如果 Qwen 能迫使两类厂商都做出改进,它的地位将最具意义。一个孤立的第一名成绩,不如采购方预期发生持久变化来得重要。

对开发者而言,实际的下一步很直接:使用定义自身工作流的精确提示词、源图像和失败案例,测试 Qwen-Image-2.1。

将它与 Ideogram 4.0 比较生成能力,与 HunyuanImage 3.0 Instruct 比较编辑能力。当可下载权重并非硬性要求时,评估中仍应保留专有模型领跑者。

除偏好输出外,还应记录失败率。追踪非预期变更、文字错误、身份漂移、处理时间、内存使用量以及人工修正工作量。

Qwen-Image-2.1 的基准测试已经确立了一个站得住脚的结论。阿里巴巴如今在 Artificial Analysis 的两项图像测试中,都提供了排名最高的开放权重模型。

更广泛的结论仍未揭晓。本地控制能力是否会变得足够有竞争力,从而抵消闭源系统在最终质量上的优势?

构建图像工作流的团队应当基于自身素材来回答这个问题,而不能只看一则标题。接下来几次排行榜更新将显示,Qwen 的双重领先地位能否持续。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page