top of page

ChatGPT Images 2.5 发布:OpenAI 押注编辑可控性,而非一镜惊艳

7小时前
讀畢需時 12 分鐘

OpenAI 于 9 月 8 日发布 ChatGPT Images 2.5,称其生成延迟最多降低 50%,并能对连续编辑提供更严格的控制。此次发布瞄准了生成式图像领域一个顽固的弱点:与在第一次就生成令人印象深刻的图像相比,在不破坏其他内容的前提下修改某一项细节要困难得多。

新模型侧重于更清晰的细节、更自然的光照、更丰富的纹理,以及更好地保留参考照片中的主体。OpenAI 还在 ChatGPT 中加入了 Sketch、模板、图像评论和提示词分享功能。这些变化共同推动图像生成摆脱单次提示词模式,转向可编辑的创作流程。

这一转变给 Google Gemini 和 Adobe Firefly 带来压力;两者已经围绕参考图像、对话式编辑和创作控制展开竞争。竞争的焦点不再只是哪个模型能产出最惊艳的初始结果,而是哪套系统能让人们将一个粗略想法变成可靠的最终素材,而无需反复从头开始。

ChatGPT Images 2.5 改变编辑循环

此次核心升级并不只是图像质量更好,而是承诺用户可以修改图像,同时保留他们已经认可的部分。

OpenAI 表示,ChatGPT Images 2.5 比 Images 2.0 更可靠地遵循聚焦式编辑指令。用户可以要求更换产品、背景或某段文字,同时要求模型保留主体、构图和视觉风格。

这听起来很基础,因为传统编辑软件早已能区分对象、蒙版、图层和效果。但生成式模型的工作方式不同:即使处理一个非常局部的请求,它们也常常会重建图像的大部分内容。

有人要求更换一件夹克,结果可能得到一张新面孔、改变的光线,或意料之外的背景。营销团队替换某件产品时,也可能发现排版、取景或品牌色一并发生了偏移。

OpenAI 正将 Images 2.5 定位为对这种不稳定性的回应。其图像模型发布说明称,先前的修改更有可能在更长的对话中保持一致,也称随着编辑次数累积,图像质量的下降会更少。

这种区别至关重要,因为许多实用图像并非一次生成完成。一张营销活动视觉图可能从参考照片开始,换上新场景、加入产品文案,随后还需制作多个地区版本。每一次不必要的改动都会增加审核工作。

参考照片保真度也是另一项重点。OpenAI 表示,人物或物体可辨识的特征在场景、风格和构图改变后更有可能得以保留。该公司展示了涉及肖像、宠物、合成照片和日常场景的示例。

这些例子指向的是个性化,而不是通用的文生图。用户不只是描述想象中的场景;他们还会提供人物、地点、草图、产品和记忆,而输出结果必须保留这些内容。

该公司称,Images 2.5 对透明背景和复杂版式的处理也更为有效。这些能力尤其适用于产品样机、演示文稿图形、界面概念和可复用设计素材。

OpenAI 尚未发布足够的独立证据,以证明这些改进能在非常规提示词中始终稳定呈现。不过,产品方向已很清晰:该公司希望图像生成更像一个持续运行的工作空间,而不是一场视觉彩票。

这也解释了为何周边界面与底层模型同样重要。Images 2.5 提供了多种表达创意的方法,不再完全依赖文字提示词。

草图、评论与模板降低对提示词的依赖

OpenAI 正在将图像生成的输入语言从单纯的文字,扩展为粗略绘图、定位反馈和可复用的起点。

Sketch 让移动端用户能直接在 ChatGPT 内绘图,并将其作为视觉参考。在消息框中输入 @ 即可打开 Sketch 选项,用户可先定义大致形状或布局,再描述希望得到的结果。

草图能够传达用文字描述会显得别扭的空间关系。规划房间的人可以标示家具应放置的位置;服装概念可以从轮廓开始,海报则可通过展示视觉层级的方框起步。

生成的草图不需要具备专业细节。它的作用是在模型解读风格、材质、光照和其他指令之前,先约束构图。

图像评论提供了第二种控制方法。在移动端,用户可以全屏打开图像,并直接在图上添加反馈。这样一来,诸如移动某个物体或更改特定区域的请求就不再那么含糊。

OpenAI 还为传单和产品照片等常见格式加入了模板。模板为那些知道目标格式、却尚未形成完整提示词的人提供结构化起点。

官方 ChatGPT 发布说明补充了重要限定:模板目前尚未在 ChatGPT Work 中提供,现有图像生成限额也维持不变。部分界面细节还会因平台和推送进度而异。

提示词分享将这套工作流延伸至单个用户之外。用户可以分享某张图像背后的提示词,让其他人以不同的照片或细节复用这一创意。

这一功能可能让提示词更像轻量级创意模板。设计师可以一次定义一种视觉模式,再由同事将其调整用于产品、活动或地区营销活动。

模型仍会对每个请求进行解读,因此共享提示词并不能保证构图完全一致。不过,它确实让成功的方法更容易复用和检查。

对于构建可复用提示词集合的人而言,结构化的提示词库也可以保留成功输出背后的推理过程。有价值的记录应包括源图像、所需约束条件,以及最终得到获批版本的编辑过程。

这些新增功能体现了 OpenAI 更广泛的产品判断:更好的提示词能力不应要求每位用户都特别擅长描述几何关系、构图和局部修改。

OpenAI 图像产品负责人 Adele Li 向 Axios 表示,Sketch 和模板是“让人们更多参与创作过程的一种尝试”。重点在于参与,而不是向模型索取一个完成品后接受任何出现的结果。

从实际层面看,这对创作主导权很重要。当用户能够指向、绘制、评论、比较和修改时,他们拥有更多控制权。模型则成为迭代流程中的一名参与者。

不过,更多控制方式并不会自动带来专业级的可预测性。草图可能被宽泛解读,评论可能影响相邻元素,模板也可能导致产出看起来相似。编辑循环的质量仍是决定性考验。

真正的竞争是可控修改

ChatGPT Images 2.5 进入的是一个 Google 和 Adobe 已将一致性与定向编辑视为核心产品能力的市场。

Google 的 Gemini 图像工具允许用户上传多个参考素材,并通过对话修改已生成或上传的图像。其文档将更高的一致性和更精确的创作控制描述为高级图像功能的定义性能力。

Google 先前将升级后的 Gemini 编辑器定位为可在新场景中维持人物或宠物外观的工具。这与 OpenAI 目前借参考照片保真度和多轮一致性所强调的问题几乎相同。

这种重叠确立了主要的竞争压力。OpenAI 并非在推出一个无人竞争的品类;它试图让 ChatGPT 成为从非正式想法走向可控视觉结果最容易使用的地方。

Google 通过 Gemini、Search 和其他面向消费者的产品界面拥有分发能力。OpenAI 则拥有 ChatGPT 的对话式界面和极大的既有生成量。OpenAI 表示,人们每周通过 ChatGPT Images 和 GPT-Image API 模型创建超过 30 亿张图像。

这一数字是公司自行报告的活动数据,并非独立审计机构核实的统计结果。即便如此,它仍说明了为何编辑行为的改进比展示孤立输出更重要。工作流上的微小提升可以影响海量生成任务。

Adobe 则从相反方向参与竞争。Firefly 位于一个成熟的生产环境中,与 Photoshop 和 Creative Cloud 相结合。其编辑工具包含文字指令、参考图像、生成式填充,以及为精细工作设计的控制功能。

Adobe 的精确编辑工具使用视觉标记和引导式修改,以减少不必要的改动。Firefly 也可以接入合作伙伴模型,让创作者能在同一个界面内从多个系统中选择。

这使 Adobe 既是竞争对手,也是分发合作伙伴。OpenAI 表示,其新 API 模型已在 Adobe Firefly 中可用。Adobe 获得了另一个模型选项,而 OpenAI 则触达了可能不会在 ChatGPT 中开始工作的专业用户。

因此,竞争边界仍在不断变化。模型提供商、编辑界面和最终生产套件不必来自同一家公司。

OpenAI 最强的优势是易用性。用户可以从一句话、一张照片或一幅粗略绘图开始,并在同一段对话中不断优化结果。这降低了不以图层、蒙版或传统设计控件思考的用户的使用门槛。

Adobe 的优势在于流程深度。专业团队需要资产管理、版式工具、审批、色彩控制和可预测的交接。图像生成只是这个更大工作流中的一个组成部分。

Google 的优势在于多模态覆盖范围。其 Gemini 产品能够将图像创作与更广泛的信息、移动端和搜索体验连接起来。

Images 2.5 对两条路径都施加了压力,但并未取代其中任何一条。它让 ChatGPT 在迭代式视觉工作中更具可信度,同时也迫使竞争对手改善生成与修改之间的衔接。

胜者不会由单张对比图决定,而将取决于用户多常能获得获批结果、发生多少不必要的漂移,以及输出在经过数次修改后是否仍然可用。

两个 API 模型将速度与精度拆分

OpenAI 正在将高量生成与高端控制分开,而不是要求一种模型配置服务所有工作流。

开发者可通过 Images API 使用两个新模型。GPT-Image-2.5 Flare 是大多数应用的默认推荐,而 GPT-Image-2.5 Sunburst 面向可接受更长生成时间的精细工作。

Flare 集成了本次发布在质量、编辑和速度方面的改进。OpenAI 表示,它的图像质量高于 GPT-Image-2,同时延迟降低 50%。

该公司将 Flare 定位用于创作者工具、社交内容、视觉搜索、产品体验、快速原型和高量生成。这些场景中,响应时间可能决定用户是否会继续迭代。

Sunburst 则选择了这一权衡的另一侧。它专为需要更严格把控广告创意、精致产品图像及其他精确性优先于即时输出的工作流程而设计。

这种划分承认,“更好”有多重含义。社交应用可能更看重快速生成变体,而广告工作流程则可能愿意等待更久,以保留主体和精确构图。

早期合作伙伴的反馈支持 OpenAI 的表述,但不应将其视为独立基准测试。Manus 表示,其评估发现 Flare 的结果生成速度是 GPT-Image-2 的两到四倍。Adobe 则强调了更快的生成速度,以及在优化过程中保持一致分辨率的能力。

Higgsfield 强调了该模型理解“哪些内容不应改变”的能力。Runway 则指出,从初始想法到成品图像所需的路径更短。这四家公司都对成功集成抱有产品层面的利益诉求。

OpenAI 没有提供涵盖 Gemini、Firefly、Midjourney 或其他领先系统的广泛第三方比较。该公司也未在公告中公布多轮编辑保留能力的失败率指标。

缺失这些证据,限制了读者应得出的结论。“最高达 50%”描述的是 OpenAI 比较中测得的最佳延迟降幅,并不意味着每项请求的运行速度都会快一倍。

同样,“更精准的编辑”也未说明未触及区域发生变化的频率。最有价值的评估应在明确的编辑序列中,衡量身份、文字、布局和背景的保留情况。

开发者还应区分模型行为与界面行为。ChatGPT 提供 Sketch、评论、模板和对话状态。使用 API 的应用则必须自行设计控制机制,并决定源图像和先前输出如何在请求之间传递。

API 的发布仍将影响范围扩大到 ChatGPT 之外。零售商可以构建产品变体,媒体工具可以提供选择性编辑,演示文稿产品则可以生成遵循既定结构的视觉内容。

不过,生产环境的采用不仅取决于输出质量。团队还需要可靠的延迟、稳定的结果、审核行为、溯源数据,以及对上传材料的清晰处理方式。

Flare 和 Sunburst 为开发者提供了更明确的性能选择。接下来的考验在于,这种选择能否在真实工作负载中保持可预测,而非只在受控的发布示例中成立。

更高相似度带来更棘手的安全问题

让个性化图像更有用的同样是这种高保真度,而当模型处理真实人物外貌时,它也会提高风险。

OpenAI 表示,ChatGPT Images 2.5 会同时检查提示词和图像,以减少有害输出。该公司还继续采用 C2PA 元数据和不可见水印,帮助识别生成内容。

C2PA 是一种为媒体附加溯源信息的技术标准。它可以帮助兼容系统识别资产是如何创建或修改的。但它并不能保证元数据在每一次导出、截图或平台转换后都能保留。

不可见水印增加了另一层识别机制,但没有任何溯源机制能够彻底消除滥用。检测工具可能产生不确定的结果,而图像在不同服务之间流转时,可见的上下文也可能消失。

Images 2.5 system card 将离线审查、分类器和拦截系统描述为 OpenAI 安全方案的组成部分。它还表示,底层模型基于多类数据进行训练。

这些类别包括公开可用的互联网信息、获得许可或来自合作伙伴的信息,以及用户、训练人员和研究人员提供或创建的材料。该说明并未提供完整、逐项列出的训练数据集。

当系统更擅长再现可辨识的主体或特定视觉特征时,这一缺失就显得尤为重要。艺术家、摄影师、品牌和个人仍持续追问:图像模型使用了哪些材料训练,输出又与受保护作品有何关系。

个性化还带来了独立的问题。一张家庭照片可以支持有意义的创作项目,但同样的高保真度也可能被用于冒充或未经同意的篡改。

因此,OpenAI 的防护措施必须区分普通转换与欺骗性或滥用性用途。当意图取决于图像之外的上下文时,这一点会变得更困难。

Axios 对一枚标志、一个纹身概念和一张记者宠物猫照片进行了早期测试。其上手评估发现,该系统在保留内容和细节编辑方面有所提升,同时也指出了生成图像涉及的更广泛伦理问题。

早期公开反应并不一致。一些用户报告称,定向编辑能力更强;另一些用户则抱怨真实感、文字质量或行为变化。这些轶事并不能证明整体性能,因为提示词、平台和推送条件各不相同。

但它们确实揭示了 OpenAI 表述中的一个风险:当用户必须多次重新生成图像以修正新的错误时,更快的输出几乎没有价值。低延迟模型仍可能带来更慢的工作流程。

最重要的安全与质量问题也彼此重叠。当用户拥有许可时,身份保留是一项功能;当图中人物未同意时,它就会成为风险。

因此,评判 ChatGPT Images 2.5 不应只看其最佳图像是否显得精致。更难的衡量标准在于,它能否在拒绝有害请求、维持有用溯源信息的同时,保留用户意图。

三个信号将显示 Images 2.5 是否兑现承诺

下一阶段应通过编辑可靠性、持续采用情况和具体的竞争回应来评估。

第一个信号是 OpenAI 演示之外的多轮编辑表现。用户应通过数次范围明确的编辑测试一张固定图像,并记录哪些已确认的细节得以保留。

一项有意义的测试可以从一名人物在特定场景中手持带品牌标识物品的图像开始。后续提示词可以改变服装颜色、替换一行文字、移动该物品并调整光照。

如果身份、构图、排版和先前的更改能够保持稳定,OpenAI 的核心主张就更有说服力。如果错误不断累积,Images 2.5 仍只是更好的生成器,而不会成为可靠的编辑器。

第二个信号是用户如何在 ChatGPT、Flare 和 Sunburst 之间分配工作。OpenAI 已为对话式创作、快速 API 生成和以精确性为导向的生产建立了不同路径。

持续的开发者采用将表明,这些改进能够在 ChatGPT 界面之外延续。它也将显示,应用是否能够围绕 API 构建有效的控制机制。

每周图像量值得关注,但原始生成次数可能会误导判断。更多生成可能意味着需求更高、反复失败,或两者兼有。完成率以及每项被接受资产所需的修订次数,能揭示更多信息。

第三个信号是 Google 和 Adobe 如何回应。Google 可以强调 Gemini 在更广泛产品版图中的多模态编辑能力。Adobe 则可以深化专业控制,同时继续托管来自多家提供商的模型。

若竞争对手迅速推出聚焦选择性编辑的更新,将强化 OpenAI 的主张:可控修订已成为关键战场。若回应有限,则说明竞争对手将 Images 2.5 视为一次渐进式模型更新。

OpenAI 还必须澄清功能可用性不均的问题。其公告称,Images 2.5 正在通过桌面端、移动端和网页端向 ChatGPT、ChatGPT Work 和 Codex 推出。然而,模板最初未在 Work 中提供,部分编辑控制则仅限移动端。

这一差距不会削弱模型本身,但会影响其宣传中的用户体验。只有当目标用户能在所需环境中访问一项功能时,它才能创造工作流程价值。

因此,推出 ChatGPT Images 2.5 的重点并非单次惊艳输出,而是减少从想法到获批成品之间的摩擦。OpenAI 找准了问题:生成图像需要经受住修订。

现在,不妨让同一张参考照片、草图或广告创意经历数次谨慎编辑。观察哪些内容保持不变、哪些内容发生漂移,以及需要多少次尝试才能得到可用结果。这些证据将揭示,Images 2.5 是否已成为真正的创作工作空间,还是仅仅是更快地产出令人印象深刻的初稿。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page