top of page

GPT-Image-2 在测试中被发现:gpt-4o 图像生成可能永远不会再一样

2026年4月4日,三个匿名图像模型以奇怪的代号出现在LM Arena的盲测队列中:maskingtape-alpha、gaffertape-alpha和packingtape-alpha。几小时内,它们就消失了。但截图已经传播到Threads、Reddit和AI开发者社区,共识难以忽视。OpenAI悄悄加入轮换的任何东西看起来都与公开可用的不同。这不是一个小更新。gpt-4o图像生成谱系已经重塑了开发者和内容团队对AI生成视觉效果的思考方式,似乎正在迈出另一个重要步骤。

OpenAI尚未发布任何官方公告。没有模型页面、没有API别名、没有文档条目。我们所拥有的,是不断增长的社区证据、让时机显得不可避免的竞争格局,以及对任何以图像生成为核心构建产品的开发者都至关重要的能力改进。

关于来源的说明:本文综合了社区报告的测试观察、FrontierBeat的独立报道以及行业基准的竞争背景。归因于泄露模型的能力声明反映了LM Arena测试会话的社区共识,仅描述为报告内容,未经独立验证。截至本文撰写时,OpenAI尚未确认或评论GPT-Image-2存在的任何方面。

发生了什么:三个胶带代号、数小时测试,随后归于沉默

LM Arena作为一个盲测评估平台,用户向匿名模型提交提示并投票选出更好的输出,而不知道哪个模型生成了哪张图像。这是少数几个真正新能力可以在正式公告前浮出水面的环境之一,因为测试是由用户驱动而非精选的。

4月4日,三个以胶带变体命名的模型出现在队列中,与已知的生产模型并列。早期测试者很快注意到有些不对劲。输出在特定提示集上持续更好:UI截图、嵌入文本的产品样机、需要真实世界上下文的复杂构图。差距并不微妙。测试者将文本渲染和世界知识的提升描述为在任何当前生产模型中都未曾见过的。

一位测试者用“average engineer's screen”提示模型,得到的输出显示一个显示器,带有真实的浏览器标签、熟悉的开发环境UI和上下文合适的内容。不是通用的库存照片近似,而是看起来像真实截图的东西。另一位提示IKEA夜间店面,得到的建筑细节与IKEA零售设计的实际视觉语言相符。

开发者@paulvuz在Threads上的帖子直截了当地指出:OpenAI's leaked models在胶带代号下“在文本渲染和世界知识上与Nano Banana Pro竞争或更优,黄色彩偏问题已解决。”黄色彩偏曾是GPT Image 1.5反复被批评的问题,该问题继承自早期模型。它的消失表明底层模型发生了有意义的改变。

OpenAI在三个模型被识别为非标准模型后数小时内将其从LM Arena撤下。该公司尚未承认这一事件。这是否代表加速的时间表,还是在更大发布公告前进行的计划灰色地带测试,目前仍不清楚。

GPT Image 1于2025年3月25日作为first native OpenAI image model推出,4月23日进入API,并在首周生成了超过7亿张图像。Sam Altman当时指出,GPU因这一量级而承受异常压力。GPT Image 1.5大约在九个月后跟进。这一节奏表明,完整的GPT Image 2发布可能落在2026年年中至年底之间。

为什么gpt-4o图像生成仍设定标准

当GPT Image 1发布时,最显著的转变不是分辨率或美学质量,而是可靠性。图像中嵌入的文本曾是每个主要模型的近乎失误:远看合理,近看错误。GPT Image 1改变了操作预期。开发者开始构建假设生成视觉效果中可读文本的工作流,企业也随之跟进。

采用数字反映了这一点。AI演示工具Gamma表示,现在每天使用gpt-image-1生成超过500万张演示图形。根据MindStudio's analysis of the GPT Image lineage,Adobe、Figma、Canva和Wix在集成该模型后,提示到资产的管道速度均实现了两位数提升。Photoroom将其用于产品摆拍和电商卖家的生活方式图像生成。这些不是实验性部署,而是核心产品基础设施。

基于有限的测试证据,GPT-Image-2似乎进一步推动了三项特定能力:

文本渲染准确性。 GPT Image 1将图像中文本准确性提升至约90-95%,相比DALL-E 3的估计60-70%有重大改进。基于多位测试者放大生成输出且未发现字母错误或布局偏移的情况,泄露模型似乎将这一数字推近99%。对于生成营销资产、包装设计或UI样机的产品团队而言,这是“需编辑后可用”与“即用即用”之间的区别。

视觉语境中的世界知识。该模型似乎对特定真实世界语境中事物应有的外观有更丰富的理解。它不只是生成IKEA店面或Windows界面的合理近似,而是生成符合这些环境实际视觉标准的内容。这类能力更难正式基准测试,但在输出质量上立即可辨。

色彩保真度。GPT Image 1.5在某些光照条件下特有的黄色彩偏似乎已得到纠正。这看似微小,但一直是使用API进行商业摄影和产品视觉效果的团队持续的摩擦点。

对于之前依赖Photoshop在最终输出前清理AI生成文本的设计师而言,实际影响重大:需要手动干预的工作流步骤可以消除。每周生成一百张产品图像的营销团队从这一单一变化中获得有意义的时间节省。

真正的问题是OpenAI能否保持领先

以下是胶带代号泄露在语境中实际发出的信号:OpenAI并未通过发布活动推出GPT-Image-2。它在半公开环境中进行了灰色地带测试,在社区识别后撤回,且未作任何表态。这不是一家对其领先地位充满信心的公司的行为。真正的竞赛不是在图像模型之间,而是在OpenAI的API生态系统与Flux所代表的开源堆栈之间。

Flux由Black Forest Labs(由前Stability AI研究人员创立)构建,已成为2026年闭源API模型最可信的开源替代品。它在多个基准上达到或接近Midjourney的水平,支持本地部署,且无需API订阅。对于构建将生成高量级图像的应用程序的开发者而言,Flux与gpt-image-1的经济性并不接近。自托管Flux可在规模化时将每张图像成本降至接近零。

OpenAI对此压力的回应是GPT Image 1 Mini,这是一款在OpenAI DevDay 2025发布的模型,定价比标准版本低80%。这是一个可预测的剧本:引入更低成本层级以在市场底部竞争,同时旗舰模型保持质量上限。GPT Image 1通过API生成中等质量图像的成本约为每张0.07美元;自有基础设施上的Flux成本为按量摊销的硬件开销。交叉点取决于规模,但存在,且对中型产品而言并非遥不可及。

Midjourney呈现出另一种竞争压力。拥有超过1000万活跃用户且daily image generation volume超过每天5亿张,Midjourney v7仍是创意语境中视觉质量的默认选择。其限制是结构性的:API访问受限,定价模式为订阅制而非用量制,且针对美学探索而非程序化生成进行了优化。对于构建自动化管道的开发者而言,Midjourney在规模上不是真实选项。

Adobe Firefly占据一个独特利基:仅在授权内容上训练,提供OpenAI和Midjourney都无法匹敌的商业免责。对于企业法务团队而言,这是决定性的。对于没有此约束的开发者而言,这是次要考虑。

GPT-Image-2泄露的不安含义是,OpenAI在发布重大改进的同时,正面临来自下方的结构性商品化压力。改进文本渲染和世界知识不足以抵御开源模型以0% API成本匹配80%能力的竞争。OpenAI在图像领域的实际优势在于其API分发:开发者集成、企业合同、使切换成本高昂的工作流嵌入。这是一个合法的护城河,但它是分发护城河,而非能力护城河。

在OpenAI自己的开发者论坛中浮现的次要担忧是:现有图像API因过度限制的内容过滤而受到批评,这会扰乱创意工作流。如果GPT-Image-2继承与GPT Image 1.5相同的安全边界,部分质量改进将被创意团队经常遇到的边缘情况提示拒绝所抵消。

GPT-Image-2与当前领域的比较

将GPT-Image-2与其当前竞争对手在生产使用最重要的维度上进行对比:

文本渲染: GPT-Image-2(估计99%)领先于GPT Image 1.5(90-95%)、Flux(强劲但模型依赖)、Midjourney v7(有所改进但次于美学)和Adobe Firefly(中等)。对于任何需要输出中可读文本的用例,GPT-Image-2是预计的领先者。

美学质量:Midjourney v7保持优势。GPT-Image-2显著提升了照片真实感,但Midjourney训练出的美学感知仍是其核心差异化因素。使输出看起来有意而非仅称职的视觉质量仍是Midjourney的主场。

API可访问性和定价:GPT-Image-2预计将遵循与GPT Image 1相同的分层定价模型,完整发布时很可能伴随Mini变体。Flux在自托管基础设施上在规模上更便宜。Midjourney没有用于生产的公开API。

商业安全性:Adobe Firefly的授权内容训练无与伦比。OpenAI提供usage policies for API access,但没有针对版权主张的正式免责。

开源:Flux是开源的。本对比中的其他一切均为闭源。

对于在它们之间选择的开发者:如果文本准确性和世界知识是优先事项且你已在OpenAI生态系统中,GPT-Image-2有意义。如果需要量驱动的成本控制且能管理基础设施,Flux是正确选择。Midjourney仍是创意总监的工具,而非开发者的工具。

OpenAI图像栈的下一步

基于GPT Image发布节奏,完整的GPT-Image-2发布在2026年年中至年底之间是可行的。可见测试的步伐和来自Flux的竞争压力表明,它可能在该窗口的较早端到来。

GPT Image 2 Mini几乎肯定会与完整模型一同发布,复制GPT Image 1 DevDay模式。这将使OpenAI能够解决对成本敏感的开发者的定价异议,同时保持高级层级。

更广泛的结构性问题是,随着Flux持续改进,OpenAI能否保留开发者忠诚度。当前的答案是肯定的,但这取决于分发惯性而非技术优越性。嵌入OpenAI API生态系统的企业客户不会因错误方向的20%质量差距而切换,但他们会在有意义规模上因2倍成本差异而切换。GPT-Image-2需要足够好,以证明其价格点相对于免费替代品是合理的,而不仅仅是足够好以击败Midjourney。

对于内容团队和产品经理而言,实际影响是一个短暂窗口来审计当前的图像生成工作流。如果你正在使用GPT Image 1.5,升级到GPT-Image-2的路径很可能很简单:相同的API、新模型别名、更好的输出。如果你仍在使用DALL-E 3或尚未转向API-based image generation,GPT-Image-2中改进的文本渲染和世界知识的结合改变了构建自动化视觉管道的成本计算。

GPT-Image-2的泄露留下的开放问题是OpenAI能否发布更好的模型。问题是更好的模型本身是否足以维持OpenAI在2025年推出gpt-4o图像生成时建立的地位。

胶带代号已从LM Arena消失。但它们引发的对话不会就此结束。如果你的团队正在追踪AI生成视觉效果如何融入更广泛的内容和知识工作流,remio's knowledge capture tools可以帮助你在一个地方收集和组织从产品研究到竞争分析的所有内容,这样当GPT-Image-2正式发布时,你不会从零开始。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page