top of page

AI 图像收敛:为什么算法默认生成视觉电梯音乐

我们常常假设人工智能凭借对数十亿训练图像的访问,拥有无限的想象力。现实在数学上是令人失望的。当AI模型相互通信时——生成图像、为其添加标题,并基于该标题重新生成图像——它们不会扩展创意视野。它们会缩小它。

Recent research from Dalarna University highlights a phenomenon known as AI image convergence. 当模型自行运作时,像Stable Diffusion XL (SDXL)和LLaVA这样的模型会停止创新并开始取平均值。它们会螺旋式陷入一组狭窄的视觉陈词滥调,过滤掉怪异的、细微的和出乎意料的内容,直到只剩下一个精致的数字平均值。

在您的工作流程中对抗AI图像收敛

Fighting AI Image Convergence in Your Workflow

在分析其发生机制之前,了解这对创作者意味着什么以及如何绕过它至关重要。AI image convergence不仅仅是研究人员的理论问题;这也是试图从生成工具中获得特定结果的资深用户的日常困扰。

如果您使用AI tools to iterate on designs,您很可能遇到过“细节消失”问题。您生成一个带有复杂背景元素的场景——比如,一场混乱的晚宴,窗户里有一只隐约的恐龙。如果您将该图像反馈给视觉语言模型以获取变体提示,该模型很可能会关注“晚宴”而忽略恐龙。下一次迭代会渲染出一个普通的晚宴。独特元素消失了。

创作者的实用解决方案

要阻止AI image convergence破坏您的输出,您必须充当“熵”或混沌的来源。系统渴望稳定性;您必须引入不稳定性。

  • 拒绝循环: 永远不要依赖生成到描述的闭环。如果您正在优化图像,不要让AI为下一次传递撰写描述。您必须手动重写提示,以重新注入AI丢弃的细节。

  • 强制异常值: 使用提示加权来强调标准模型视为噪声的背景元素。收敛发生是因为模型优先考虑“主体”(例如,一个女人、一辆车)并模糊上下文。您必须明确要求上下文。

  • “人类驱动”规则: 最成功的用户将AI视为翻译层,而不是创意伙伴。当您将“驾驶座”交给算法的那一刻,输出就开始向平均值回归。您得到的是所有晚宴的平均值,而不是your 晚宴。

生成反馈循环的机制

The Mechanics of Generative Feedback Loops

识别这一趋势的研究揭示了我们对自主AI思考方式中的一个关键缺陷。研究人员设置了一个generative feedback loop:SDXL生成图像,LLaVA描述它,SDXL基于该描述生成新图像。他们重复了数千次。

它就像电话游戏,但有一个转折。在人类的电话游戏中,消息通常变得更怪异、更发散。人类记忆以创造性的方式出错。然而,AI以简化的方式出错。

AI图像收敛如何剥离信息

在这些generative feedback loops中,视觉模型(LLaVA)充当过滤器。它根据最强烈识别的内容(通常是主要主体)创建标题。它忽略光照细微差别、纹理怪癖或背景奇特之处,因为其训练数据告诉它这些东西在统计上不太重要。

当SDXL收到这个精简提示时,它会生成最“可能”的图像来匹配描述。它用通用数据填充空白。经过十到二十个周期,原始想法的独特噪声被清除。模型并不是合谋变得无聊;它们只是在数学上最大化概率。结果是AI image convergence,其中概率曲线坍缩成一个单一的、不可动摇的点。

“视觉电梯音乐”的兴起

Dalarna University的研究人员为AI image convergence的最终归宿创造了一个完美的术语:“视觉电梯音乐”。

经过足够多的迭代后,研究中几乎所有图像,无论从哪里开始,都会变形为12种特定视觉风格之一。这些风格是互联网的“最大似然”美学。它们在技术上胜任,没有伪影,完全没有灵魂。

收敛是什么样子?

“视觉电梯音乐”美学是独特的。它通常具有:

  • 高饱和度和戏剧性光照(“艳俗”外观)。

  • 类似于廉价数字海报艺术的“俗气”喷绘效果。

  • 标准化构图(居中主体、模糊背景)。

这是因为这些模型的训练数据包含数百万高质量、流行但风格安全的图像。当模型不确定该怎么做时——因为反馈循环中的提示模糊——它会默认进入这个“商业安全区”。这在视觉上相当于由委员会生成的Top 40流行歌曲。它不冒犯任何人,不激发任何人,并且看起来与所有其他东西完全一样。

长期风险:模型崩溃

The Long-Term Risk: Model Collapse

AI image convergence标志着互联网未来的一个巨大问题。如果网络充斥着这种“电梯音乐”内容,未来的AI模型将抓取它并在其上训练。

这会导致“模型崩溃”。如果v2在v1的收敛输出上训练,方差会进一步减小。可用的美学池从人类艺术的广阔历史缩小到SDXL偏好的12种风格。

我们能避免完全同质化吗?

唯一能阻止完全AI image convergence的是人类低效。人类做出奇怪的选择。我们将不应该搭配的颜色组合在一起。我们关注背景恐龙而不是晚宴。我们给系统添加“摩擦”。

为了遏制AI image convergence,循环必须不断被打破。研究证明,自主AI代理无法自行维持文化或创造力。它们只能模仿已经看到的最稳健的模式。如果没有新的、外部的、人类数据进入系统,数字世界就会灰暗化。

这项技术令人印象深刻,但该研究起到了现实检验的作用。我们不是在构建创造性思维;我们是在构建概率引擎。而概率总是押注于平均值。

常见问题:理解AI图像收敛

FAQ: Understanding AI Image Convergence

AI图像收敛到底是什么?

当AI模型相互馈送数据时,逐渐失去视觉多样性并产生几乎相同输出的现象。图像失去独特细节,并陷入几种通用、重复的风格。

为什么研究将结果称为“视觉电梯音乐”?

该术语描述了模型最终采用的平淡、无害且高度商业化的美学。就像电梯音乐一样,这些图像旨在成为愉快的背景噪音,而不是引人入胜的艺术。

更好的提示能否防止AI图像收敛?

是的,但前提是人类进行提示。如果您使用use an AI (like ChatGPT or LLaVA) 根据之前的图像优化提示,您将触发收敛。人类的不可预测性是唯一的解药。

这与模型崩溃是同一回事吗?

它们是相关的。收敛是生成循环中图像变得相似的即时过程。模型崩溃是长期后果,即未来的AI模型因为在这些收敛的低质量数据上训练而变得更愚蠢。

模型最终会收敛到什么风格?

研究确定了大约12种主导风格,大多倾向于超现实主义、高对比度数字艺术和海报式图形。这些代表了模型最初训练所用的数十亿图像的“平均”。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page