top of page

阿里巴巴称 Qwen Image 2.1 击败 Google Nano Banana 2.0,但其许可证改变了竞争格局

48分钟前
讀畢需時 15 分鐘

Alibaba Cloud 发布了 Qwen Image 2.1,这是一款拥有 70 亿参数的视觉生成器,并提出了一项明确主张:它能够胜过 Google 的 Nano Banana 2.0。这一结果来自 Alibaba 自身的基准测试,领先幅度很小,而独立排行榜则呈现出更为克制的结论。

即便这一醒目的对比结论未必能经受所有测试,此次发布依然值得关注。Qwen Image 2.1 集图像生成与编辑于一体,支持原生透明输出,并可结合多达 10 张参考图像。其可下载的权重也让希望在自有硬件上运行图像模型的开发者能够获得这些能力。

但这并非开放模型战胜封闭竞品的简单胜利。Alibaba 将早期 Qwen 图像版本所采用的宽松许可证,替换为限制模型材料商业使用的研究许可证。因此,该模型既提供本地访问和技术灵活性,也未赋予企业不受限制的部署权利。

这种张力定义了这次发布。Qwen Image 2.1 凭借效率和可控性向云端图像服务施压,但 Alibaba 的基准测试和许可证都需要仔细解读。

Qwen Image 2.1 将一个 7B 生成器整合进单一图像管线

关键变化不只是 Alibaba 又发布了一款图像模型,而是它将生成、编辑、透明效果和基于参考图像的合成压缩进了一个可下载系统。

Alibaba 于 2026 年 9 月 20 日发布 Qwen Image 2.1。根据其模型仓库,视觉生成组件包含 70 亿参数,分布在 32 个单流扩散 Transformer 层中。

扩散 Transformer,常简称为 DiT,是在用于形成图像的去噪系统中采用 Transformer 式处理的方法。参数数量并不衡量整体质量,但会影响内存需求、部署选项和模型运行成本。

这 70 亿参数的数字也需要放在具体语境中理解。它描述的是视觉生成器,而不是完整工作流中加载的每一个组件。Qwen Image 2.1 使用一个拥有 80 亿参数的 Qwen3-VL 编码器来处理指令和参考图像。

这一差异在估算内存消耗时尤为重要。尽管核心图像生成器依然紧凑,但若将整个系统称作一个 70 亿参数的软件包,就会低估其辅助组件的规模。

根据 Alibaba 的文档,该模型可生成原生分辨率为 2,048 × 2,048 像素的图像。它默认采用 40 个去噪步骤,并支持多种横向和纵向长宽比。

Alibaba 还将文生图与图像条件编辑统一到同一条管线中。开发者可以从文字提示开始,提供现有图像进行修改,或给出多张参考图以生成合成结果。

该系统最多接受 10 张参考图像。Alibaba 的示例包括利用多张独立照片合成集体肖像,以及将多张源图像中的服装放到同一个人身上。

这些示例瞄准了生成式图像软件长期存在的一项弱点:模型或许能够创作出吸引人的图片,却可能丢失人物身份特征、改变产品,或忽略某张参考图中的细节。

Alibaba 表示,Qwen Image 2.1 改进了这些操作中的身份和产品一致性。在更广泛的测试覆盖不同面孔、产品、光照条件和参考图组合之前,这仍属于公司自身的主张。

原生 RGBA 输出是另一项重要新增功能。RGBA 图像包含红、绿、蓝和 Alpha 通道,其中 Alpha 通道控制透明度。

大多数图像生成器会生成一幅完成的矩形画面。移除背景通常需要单独的分割工具,而这可能损伤头发、玻璃、阴影或其他精细边缘。

Qwen Image 2.1 则可直接生成透明素材。这项功能适用于贴纸、界面元素、产品抠图、演示图形和设计组件等实际任务。

它还可以编辑透明图层,或从照片中提取主体。其结果更接近可复用的生产素材,而非单张扁平化插图。

该版本发布后即获得 Diffusers、ComfyUI、vLLM-Omni、SGLang 和 LightX2V 的支持。首日集成降低了将新模型置入熟悉的本地或服务器工作流所需的工作量。

这些周边软件支持具有战略意义。模型权重本身无法带来采用。开发者还需要加载器、内存优化、界面、文档和可复现的推理设置。

小型生成器向封闭图像服务施压

Qwen Image 2.1 对封闭图像平台的挑战,在于提供本地控制和实用编辑功能,而不在于赢下每一项质量比较。

Google 和 OpenAI 主要通过托管产品和 API 提供其领先的图像系统。这种方式令安装变得简单,但用户必须接受提供商的界面、可用性、审核规则、账户要求和服务边界。

可下载权重则带来不同的运行模式。开发者可以检查可用文件,选择服务框架,控制输入数据的处理位置,并将生成器集成到定制应用中。

这一差异对于参考图像编辑尤其重要。时尚工作室、设计团队或产品开发者可能不愿将机密图像、未发布产品或可识别的客户素材上传至外部服务。

本地运行的模型可以将这些输入保留在用户控制的基础设施内。本地执行并不自动保证隐私,因为日志、扩展程序和连接的应用仍需要审计。但它消除了一个主要的外部处理依赖。

Qwen Image 2.1 还让开发者对可复现性拥有更多控制权。他们可以保留模型版本、记录随机种子、标准化推理设置,并在不依赖未公开的云端更新的情况下测试变化。

封闭服务仍保有明显优势。它们隐藏了配置工作,无需规划本地硬件即可扩展,并通常通过精致的界面封装生成能力。其提供商还负责大部分服务基础设施。

运行 Qwen Image 2.1 需要兼容的软件、足够的内存,以及应对快速变化工具链的耐心。CPU 卸载可以减轻显存压力,但它会在系统内存和 GPU 之间转移工作,从而可能降低生成速度。

早期社区报告表明,该模型可在消费级显卡上运行。Tom’s Hardware 记录了涵盖新款显卡和旧系统的示例,其中包括一套使用大量系统内存的 RTX 3060 配置。

这些报告是有价值的迹象,而非受控性能测量。分辨率、量化、参考图数量、卸载设置、软件版本和去噪参数都会显著改变速度和内存占用。

这篇发布分析还提到,一张 RTX 4090 可在约五秒内完成一次百万像素转换。其他公开测试耗时更长,尤其是在编辑或多参考图工作时。

因此,企业应将“可在本地运行”视为评估的起点。一款能够装入工作站的模型,仍可能因交互使用速度过慢或生产一致性不足而不适用。

最强的压力将落在那些将便利性作为核心卖点的提供商身上。如果本地模型在提供透明输出和多参考图编辑的同时接近托管服务的质量,云端产品就必须通过可靠性、速度、界面或更佳结果来证明其限制的合理性。

这种压力是长期的,而非立竿见影的。大多数人不会安装模型、管理 Python 依赖项或排查 GPU 内存问题。产品团队和技术创作者更可能率先测试 Qwen Image 2.1。

即便在这类受众中,许可证也限制了其竞争威胁。开发者可在本地检查和评估模型,但商业产品不能在相同条款下直接采用这些权重。

这使 Qwen Image 2.1 成为一项强有力的研究和实验发布。它并不是每一家希望替代托管图像 API 的企业都可不受限制使用的基础。

Qwen Image 2.1 的基准测试需要独立语境

Alibaba 的基准测试显示 Qwen Image 2.1 略高于 Nano Banana 2.0,但这一结果并不能证明其拥有普遍的质量领先优势。

Alibaba 的 Qwen Image Benchmark 从质量、美学、提示词对齐、真实世界保真度和创意生成等维度评估模型。其已发布的框架包含五个顶层维度、23 项子能力和 56 个更细的指标。

该基准测试使用围绕 Qwen 模型构建的 AI 评审。自动评审令大规模评估更快、更具可复现性,但也带来了有关模型偏好、评分校准和提示词覆盖范围的方法论问题。

根据发布时公布的数据,Qwen Image 2.1 的综合得分约为 60.2。Google 的 Nano Banana 2.0 得分为 59.82,使 Alibaba 的模型领先不足一分。

对于一款紧凑、可下载的模型而言,这是值得注意的结果。但这并不意味着 Google 遭遇决定性失利。

狭窄的平均分差可能掩盖不同任务之间的巨大差异。一款模型可能在文字排版上更准确,另一款则可能更擅长照片级真实感、指令遵循、人脸或复杂编辑。

该基准测试本身也来自 Qwen 团队。Alibaba 已发布评估框架,包括评分代码和推理设置,这有助于外部研究人员审查其方法。

不过,发布基准测试并不会使其结果自动具备独立性。第三方仍须复现生成条件,审查评审模型的行为,并测试模型创建者未挑选的提示词。

该基准测试的公开排行榜也提供了另一个谨慎看待结果的理由。其列出的领先模型包括得分 64.69 的 GPT Image 2,其后是得分 59.82 的 Nano Banana 2.0 和得分 59.65 的 GPT Image 1.5。围绕 Qwen Image 2.1 报告的确切模型版本需要仔细比较,因为图像服务变化频繁。

公开竞技场结果提供了第二种视角。竞技场测试依赖用户在成对输出之间的偏好,这衡量的是与结构化内部基准不同的一类性能。

Tom’s Hardware 引用的初步竞技场数据中,Qwen Image 2.1 在相关比较中得分为 1,228,Nano Banana 2.0 为 1,260。在这些条件下,Google 的模型仍保持领先。

当比较范围限定为可下载选项时,Alibaba 的模型表现更强。早期 Image Arena 报告将其列为图像编辑和文生图两项任务中开放权重条目的第一名。

编辑结果尤其值得关注。据报道,1,367 的早期得分使 Qwen Image 2.1 位列总榜第 16 名,仅落后于一款高保真 GPT Image 1.5 变体三分。

Arena 排名也可能快速变动。新增投票、模型版本调整、采样差异以及不同的提示行为,都可能改变相对位置。

两种方法都不应被视为最终裁决。内部基准测试提供受控的任务覆盖范围,而偏好竞技场则揭示了用户并排查看输出时会选择什么。

更公允的解读是,尽管生成器规模紧凑,Qwen Image 2.1 看起来仍具备与知名闭源模型竞争的实力。现有证据并未表明它在所有重要工作负载中都能稳定胜过 Nano Banana 2.0。

开发者应在选择模型前构建面向具体任务的测试集。该测试集应包含来自目标应用的提示词、参考图像、排版、人物身份、产品及编辑指令。

他们还应评估失败率,而不只是偏爱的输出结果。一个需要多次重试才产生一张出色样本的模型,可能不如一个稍逊一筹但能稳定遵循指令的模型实用。

对于 Qwen Image 2.1,多参考图一致性尤其值得关注。测试应逐步增加参考图数量,并记录哪些人物身份、产品、纹理和位置指令会消失。

透明度同样需要进行务实测试。只有当 alpha 通道能正确处理复杂边缘、部分透明度、孔洞、反射和柔和阴影时,透明 PNG 才有价值。

Alibaba 的基准测试声明已成功吸引关注。独立工作负载将决定其微弱领先究竟代表广泛能力,还是有利的测量环境。

原生透明度与参考编辑诠释了效率押注

Qwen Image 2.1 旨在跨生成步骤复用计算成果,帮助较小的架构支持高要求的编辑任务。

该模型采用单流架构,在统一的 Transformer 中处理文本和视觉条件。Alibaba 将其注意力系统描述为混合粒度,因为文本和图像在该数据流中遵循不同的掩码模式。

注意力掩码决定了哪些信息片段可以在处理过程中相互交互。Qwen Image 2.1 对文本采用因果行为,同时允许图像块更广泛地交换信息。

其编辑效率还依赖于前缀键值缓存。这一缓存会在首次计算后存储指令和条件图像的表示,并在后续去噪步骤中复用。

图像扩散涉及反复迭代,逐渐将噪声转换为所需输出。在默认的 40 个步骤中反复计算每张参考图,会浪费时间和内存带宽。

缓存并不会消除生成成本。它针对的是流水线条件处理部分的冗余工作,而随着用户增加参考图,这部分会变得愈发重要。

该架构还包含一个具有 64 个通道、16 倍空间压缩的变分自编码器。变分自编码器(VAE)可在像素空间与生成期间使用的较小潜在表示之间转换图像。

Alibaba 将这一 VAE 设计为可与颜色一同表示 alpha 通道。这项技术选择实现了原生透明度,而无需在生成后额外移除背景。

这种差异会在实际工作流中显现。设想一位营销设计师,需要利用模特照片、鞋子、包袋和单独的服装图像制作产品组合图。

传统工作流可能需要生成、手动蒙版、产品修正和背景移除。Qwen Image 2.1 的目标是在一个编辑系统内生成合成场景,同时保留可辨识的输入元素。

另一个例子是贴纸或应用图标。创作者可在生成时要求透明背景,再将生成的 RGBA 资产直接叠加到另一项设计上。

这些案例解释了为何参数效率比简单的排行榜位置更重要。即使另一模型在整体视觉偏好上取胜,一个能在本地处理日常资产准备工作的紧凑模型仍可创造价值。

模型文档建议使用明确的透明度提示词,将所需图像指定为 RGBA,并要求 alpha 通道。这种措辞表明,原生支持仍能从结构化指令中受益。

提示词改写又增加了一层复杂性。Alibaba 提供独立的 Qwen3.5-VL checkpoints,可将简短的生成和编辑请求扩展为更详细的提示词。

使用提示词改写器可能改善结果,但也会使比较更加复杂。基准测试应披露各模型是否接收了相同的原始指令,还是受益于模型专属的提示词扩展。

额外的 checkpoints 也会增加部署负担。评估 Qwen Image 2.1 的团队应区分生成器、文本编码器、提示词改写器和服务框架各自的内存占用。

Diffusers 和 ComfyUI 的支持降低了入门门槛。ComfyUI 为可视化工作流构建者提供熟悉的基于节点的环境,而 Diffusers 则为开发者提供 Python 流水线。

vLLM-Omni 和 SGLang 通过缓存、批处理、量化和多 GPU 选项支持更高吞吐量的服务。它们的出现表明,Qwen 的目标不止于孤立的桌面实验。

硬件灵活性扩大了模型的潜在受众。Alibaba 记录了对 Nvidia 和 AMD 系统的支持路径,以及名为 FlagOS 的多芯片软件层。

然而,兼容并不等同于性能一致。不同供应商之间,内核成熟度、精度格式、内存行为和操作系统支持可能存在很大差异。

该架构为效率提供了可信的论据。其实际价值将取决于第三方部署能否在不依赖脆弱配置或过度卸载的情况下复现良好质量。

Qwen Image 2.1 许可证收窄了其开放权重承诺

权重可供检查和运行,但 Alibaba 的许可证禁止在未经单独协议的情况下将模型材料用于商业用途。

官方仓库在介绍性文字中称 Qwen Image 2.1 为开源。其法律条款却远比这一标签通常暗示的范围更窄。

根据 Qwen research license,非商业使用仅限研究或评估。该协议仅为这些目的授予使用、修改、复制和分发材料的权利。

商业用途需要获得 Qwen 团队的单独许可。限制涵盖已定义的材料,包括权重、参数、模型代码、推理代码、训练代码、文档及相关元素。

这与早期采用 Apache 2.0 分发的 Qwen 图像版本相比发生了重大变化。Apache 2.0 通常允许商业使用、修改和再分发,同时要求保留其声明和条件。

因此,新协议将技术开放性与商业许可区分开来。任何人都可以下载已发布的文件,但并非所有人都能合法地围绕它们构建付费服务。

Alibaba 后来澄清,生成的输出不属于许可材料。这一澄清意味着,Qwen Image 2.1 仅因生成了一张图像,并不会自动主张该图像的权利。

即便如此,输出所有权也不能解决每一个部署问题。企业即使仅在内部将模型用于商业工作,仍需确定其对材料的使用是否需要商业许可。

官方协议称,未经单独授权,材料不得用于任何商业目的。企业应依赖该文本及合格法律意见,而非社交媒体上的摘要。

许可证还对使用输出训练或改进另一种已分发 AI 模型增加了条件。在这种情况下,产品文档必须展示诸如“Built with Qwen”或“Improved using Qwen”的归属说明。

另一项条款限制将 Qwen 作为衍生产品的主要名称。关于模型由 Qwen 微调而来的描述性声明仍然被允许。

这些条款并不阻止研究、评估或个人实验。但它们改变了初创公司、代理机构、平台运营商和成熟软件公司的决策考量。

初创公司不能假定可下载权重就是 Google 或 OpenAI 的零摩擦替代方案。它必须获得商业权利,并了解这些权利是否涵盖托管、微调、再分发或面向客户的生成服务。

许可证也可能减缓社区投资。当开发者知道商业采用可在可预测条款下获得许可时,往往会构建优化、适配器和专门的衍生版本。

仅限研究的可用性仍可能形成活跃的技术社区。然而,如果成功原型最终需要进行私下谈判,一些贡献者会犹豫不决。

Alibaba 有保留商业筹码的商业理由。一个有能力的模型可以通过公开权重吸引开发者,同时为企业协议或托管服务创造需求。

其中的取舍在于信息传达的清晰度。将一个模型称为开源,会引发与非商业研究许可证并不相符的期待。

“开放权重”是更精确的描述,因为参数确实可用。即使如此,这个词也没有说明这些参数附带的权利,因此许可证仍必须成为任何严肃评估的一部分。

许可问题也削弱了与 Nano Banana 2.0 的直接比较。Google 根据商业产品条款提供闭源服务,而 Alibaba 则提供具有受限商业权利的可下载材料。

一种安排最大化了即时模型访问以供评估。另一种则将访问封装在托管产品中。两种安排都没有赋予开发者对技术和商业部署的完全、不受限制的控制权。

对于研究人员和爱好者而言,考虑到其表面上的能力,Qwen Image 2.1 仍然异常易于获取。对于商业团队而言,许可流程则成为核心产品依赖项。

三项信号将决定 Alibaba 的声明是否成立

独立质量测试、可复现的消费级硬件结果,以及商业许可的清晰度,将决定 Qwen Image 2.1 是否能成为一项不止于令人印象深刻的研究发布。

第一个信号是同时覆盖生成与编辑的独立评估。研究人员需要使用相同的提示词、参考图、分辨率和重试限制,对 Qwen Image 2.1 与 Nano Banana 2.0 进行比较。

这些测试应分别报告排版、照片真实感、提示词对齐、身份保留、透明边缘和多参考图构图的结果。单一总分无法解释两种模型各自在哪些方面成功。

如果 Qwen 能在多样化工作负载中保持其内部领先,独立测试将强化 Alibaba 的论点。相反,如果它在盲测偏好测试中持续落败,则可能表明 Qwen Image 2.1 的基准测试偏向其设计。

第二个信号是在普通硬件上的可复现性能。社区经验表明本地运行是可行的,但买家需要标准化测量。

有价值的报告应包括完整的 GPU 型号、系统内存、精度、量化、软件版本、分辨率、步数和参考图数量。它们还应测量启动时间、峰值内存和端到端生成延迟。

在 24GB 和 16GB 消费级显卡上的成功测试将扩大模型的实际受众。依赖大量 CPU 卸载或长时间等待的工作流则会削弱其效率主张。

编辑性能值得单独测量,因为多张参考图会扩大条件处理工作负载。能够轻松生成基础图像的配置,在被要求保留多个人物和产品时可能会遇到困难。

第三个信号是阿里巴巴的商业许可路径。清晰、标准化的条款将为企业从评估走向部署提供一条现实可行的道路。

缓慢或不透明的谈判流程会促使企业转向许可更简单的模型或托管 API。它也会削弱面向生产系统的社区优化所带来的价值。

公开许可的变化则会产生更深远的影响。若重新采用宽松条款,该模型的本地运行效率将转化为更广泛的竞争威胁。

Google 的回应同样重要,尽管这并非三项主要测试之一。Nano Banana 在编辑能力、定价结构、接口或企业控制方面的改进,可能会维持托管服务的优势。

OpenAI、Meta 及其他图像模型开发商也是如此。Qwen Image 2.1 树立了一个紧凑的参照点,未来发布的模型都将据此受到评判,即便其基准测试领先地位仍存在争议。

对开发者而言,明智的下一步是进行受控评估,而不是迁移整个平台。应基于真实工作构建提示词套件,测试失败案例,记录完整配置,并在集成前审阅许可条款。

对创意团队而言,最具说明力的实验应围绕可复用资产展开。透明背景产品抠图、多人构图、排版以及身份保持型编辑,能够检验这次发布中最具差异化的功能。

对企业采购方而言,治理应从测试一开始就纳入考量。本地处理可以加强控制,但安全审查、模型来源、许可条款及生成内容政策仍然适用。

Qwen Image 2.1 已经证明了一个可信的观点:一款相对紧凑、可下载的生成器,能够在多项图像任务上接近备受关注的闭源系统。阿里巴巴尚未证明它在所有方面都胜过 Nano Banana 2.0。

这一区别至关重要。基准测试的头条热度很快会消退,而可部署性、可重复性和法律清晰度决定了哪些模型能够成为基础设施。

关注下一轮独立竞技场更新、已有文档记录的消费级 GPU 测试,以及阿里巴巴的商业条款。这些信号将共同表明,Qwen Image 2.1 究竟是持久的竞争者,还是一款吸引力十足但覆盖范围受限的研究模型。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page