深入探讨 AI 图像生成:扩散模型如何从噪声中创造艺术
- Aisha Washington

- 6月6日
- 讀畢需時 9 分鐘
已更新:6月18日

引言
作为一名观察生成式模型快速演进的 AI 研究员,我亲眼见证了简单的文本行是如何转化为令人惊叹的逼真图像或视频的。这看起来可能像魔法,但近年来,人工智能系统在将书面提示词转化为视觉媒体方面取得了惊人的进展。其中的奥秘并非魔法,而是与物理学原理之间迷人且深刻的联系。这项技术正在彻底改变内容创作,使得无需摄像机、画笔或复杂的动画软件就能制作出精美的视觉效果——你只需要语言。本文将全面分析 AI 图像和视频生成的工作原理,从基础概念到赋予我们精细控制的高级技术,逐一拆解其核心机制,为你提供这一变革性技术的完整知识图谱。
什么是 AI 图像生成?理解核心扩散模型 (Diffusion Models)

在核心层面,大多数现代 AI 图像和视频模型背后的方法被称为“扩散” (diffusion)。想象一下粒子扩散时随机、混沌的运动——这一过程被称为布朗运动;扩散模型经过训练,执行完全相反的操作,即从一片完全混沌的领域出发,通过时间倒流来创造秩序。本质上,这些模型经过训练来系统地从图像或视频中去除噪声,直到出现清晰的画面。
核心特征:
从纯噪声开始: 整个生成过程始于一段完全由随机像素值组成的视频或图像。
迭代细化: 这块纯噪声画布被反复输入到强大的 AI 模型中(通常是类似于 ChatGPT 等大语言模型所使用的 transformer)。每一次处理,模型都会对噪声进行细化,逐渐引入结构线索,直到形成照片级真实的视频或图像。
文本引导创作: 模型通过文本输入来理解要创作的内容。它利用了一个巧妙设计的“共享空间”,在这里文本中的概念与图像内容相互关联, 从而允许提示词引导噪声混沌走向特定的结果。
辟谣:事实与虚构
误区: AI 模型通过简单地一步步反转噪声过程来学习。
事实: 这种训练模型通过单步去噪的朴素方法在实践中被证明是无效的。该领域的里程碑式论文揭示了一种更稳健的方法:训练模型去预测最初添加到清晰图像中的全部噪声量。虽然这看起来是一个更难的学习任务,但它提供了更清晰的信号,并允许模型更高效地学习。
文生图 AI 对艺术与行业的影响

扩散模型的崛起代表了我们创作视觉媒体以及与之交互方式的根本性转变。其重要性体现在个人和社会两个层面。
对个人的影响
这项技术使视觉艺术创作变得大众化。以前,创作高质量的图像或动画需要摄影、绘画或数字软件方面的专业技能。而现在,唯一的先决条件就是语言。这为更广泛的受众开启了创意表达的大门,让任何有想法的人都能将想象变为现实。这是一种全新的艺术创作机器。
对行业和社会的影响
这项技术的飞速发展,尤其是自 2020 年以来,预示着创意产业将迎来重大变革。强大的开源模型的出现,例如 Stable Diffusion,使这项技术能够被全球的开发者和艺术家所使用,从而引发了新应用和工具的寒武纪大爆发。从广告到娱乐,各家公司都在利用 AI 生成新颖的视觉概念并简化生产工作流程。
支持数据
这些模型的强大力量建立在海量规模的基础之上。例如,来自 OpenAI 的开创性模型 CLIP 是在从互联网抓取的 4 亿个图像-文本对数据集上训练而成的。这遵循了 GPT-3 等模型所证明的“神经缩放定律”,即在庞大数据集上训练的大型模型可以解锁其小型版本所不具备的涌现能力。
AI 图像生成的演变:从 DDPM 到 DALL-E 2
通往当今文本生成图像模型的历程异常迅速。虽然这些理念植根于数十年的研究,但过去几年见证了关键突破的汇聚。
现代 AI 图像生成的起源 (2020) 现代纪元由语言建模开启。OpenAI 的 GPT-3 在 2020 年的成功证明,扩大模型和数据规模能带来前所未有的能力,研究人员很快便寻求将这一原理应用于视觉领域。
扩散模型发展的关键里程碑
2020 年夏季 - DDPMs:就在 GPT-3 发布几周后,来自加州大学伯克利分校的研究人员发表了《Denoising Diffusion Probabilistic Models》(DDPM) 论文。这是首次证明扩散过程——即系统地向图像添加噪声并训练模型将其逆转——可以生成高质量的图像, 从而使该技术声名鹊起。
2021年2月 - CLIP: OpenAI 发布了 CLIP (Contrastive Language-Image Pre-training)。它虽然不是图像生成器,但却是一个至关重要的缺失环节。CLIP 学习了一个共享的“嵌入空间”,将文本和图像强有力地连接起来,为语言理解和分类视觉内容创造了途径。
2022年 - unCLIP (DALL-E 2): OpenAI 通过训练扩散模型来有效地“逆转” CLIP 图像编码器,从而将这些环节连接起来。其成果就是 unCLIP,商业名称为 DALL-E 2, 这是一个能够以前所未有的细节和准确度遵循文本提示的模型。
文本生成图像 AI 的现状
如今,模型已经融入了 进一步的改进,如用于加快生成速度的 DDIM 以及用于更好控制提示词的无分类器指导(classifier-free guidance)。其结果是一系列 功能极其强大的文本生成图像和文本生成视频模型,它们似乎神奇地将这些复杂的组件编织成一个无缝的创意工具。
AI 图像生成原理:逐步揭秘

要真正理解这些模型的工作原理,我们需要关注它们的两个主要支柱:理解概念的组件 (CLIP) 和创建图像的组件 (扩散模型)。
基础:CLIP 如何使 AI 能够理解提示词
在 AI 生成一张“狗”的图像之前,它需要理解“狗”是什么,无论是作为一个词汇还是一个视觉概念。这就是 CLIP 发挥作用的地方。CLIP 由两个独立的模型组成:一个文本编码器(text encoder)和一个图像编码器(image encoder)。它们在 4 亿对图像-文本对上共同训练,并设定了一个巧妙的目标:对于任何给定的图像及其匹配的说明文字,它们的编码向量应尽可能相似。这被称为对比学习(contrastive learning)。其结果是一个共享的高维“潜空间(latent space)”,在这里,概念具有几何现实。CLIP 提供了地图,但它无法画图;它只能将图像和文本映射到这个空间中,而不能从中生成图像。
去噪扩散模型(Denoising Diffusion Models)的核心机制
这就是扩散过程发挥作用的地方。核心思想很简单:取一张真实的图像,添加一点随机噪声,然后再添加一点,依此类推,直到只剩下纯粹的静电噪声(“前向过程”)。然后,训练一个神经网络来反向执行此操作。这种“反向”比简单的去噪更复杂。更好的理解方式是将其视为模型在学习一种随时间变化的向量场。
AI 图像生成过程逐步指南
步骤 1:从噪声开始: 该过程始于一个纯随机像素值的张量——一张看起来像电视雪花的“静态”图像。
步骤 2:预测与步进: 将此噪声图像输入扩散模型。模型预测“得分(score)”——即为了让图像噪声稍微减少而需要步进的方向。算法会向该预测方向迈出一小步。
步骤 3:重新添加噪声(在 DDPM 中): 这里有一个来自原始 DDPM 算法的关键且反直觉的转折. 在向清晰图像迈出一步后,会重新加入少量的新随机噪声。这确保了模型能够探索目标分布的完整多样性,从而创造出清晰、细腻且多样化的图像。
第 4 步:重复: 这种“预测、步进、添加噪声”的循环会重复多次——50次、100次或更多。随着每一次迭代,初始的随机噪声逐渐被学习到的向量场塑造,直到一个连贯、详尽的图像浮现。
如何控制文本生成图像 AI:提示词与引导
扩散模型本身会从其训练数据中生成随机图像。真正的力量来自于通过文本对其进行引导。这是通过几种日益强大的技术实现的。
AI 图像生成中的条件控制入门指南
最基础的引导形式是调节 (conditioning)。在训练和生成过程中,文本提示词(由 CLIP 转换为向量)作为额外输入馈送到扩散模型中。模型学习使用该文本向量作为上下文,以更准确地对图像进行去噪。例如,给定提示词 "tree in a desert",模型就有了额外的信息来引导噪声向树的形状演变。
使用 Classifier-Free Guidance 的最佳实践
仅靠调节往往不够强大。一种更强大的技术是Classifier-Free Guidance。其技巧是训练一个模型以两种模式工作:有时接收文本提示词(有调节),而大约10-20% 的时间则不接收(无调节). 在生成过程中,你在每一步都进行两次预测:一次带有提示词,一次不带。通过从“有条件”预测中减去“无条件”预测,你可以分离出提示词带来的纯向导性“推力”。这种差异可以通过“引导比例 (guidance scale)”设置进行放大,从而强制模型更紧密地遵循提示词。
工具与资源:负面提示词的力量
这一理念的一个巧妙扩展是使用负面提示词 (negative prompts)。与其引导模型趋向某些事物,你可以引导它远离 远离你不想要的概念。例如,一些 AI 艺术平台允许用户输入负面提示词(negative prompts),如 "blurry, disfigured, extra fingers",以避免常见的生成瑕疵。模型会计算该负面提示词的向量,并从其预定方向中减去该向量,从而有效地避开这些不理想的特征。
AI 图像生成的未来:趋势与挑战
该领域正以惊人的速度发展,但前景中既有明确的机遇,也存在持续的挑战。
扩散模型与生成式 AI 的未来趋势
鉴于从静态图像到连贯视频的快速进展,未来的趋势可能会集中在生成更长、更复杂的视频上,提高生成场景的逻辑一致性,并实现对细微人类语言更深层次的理解。我们还可以期待更多多模态输入,允许用户结合文本、图像甚至声音来引导创作。
AI 艺术与内容创作的机遇
最大的机遇仍然在于赋能人类的创造力。随着这些工具变得更加强大且易于获取,它们将开启叙事、艺术和沟通的新形式。这是视觉创作的一种新范式,其中核心技能变成了用语言清晰表达创意的能力。
克服 AI 图像生成中的挑战
计算成本: 早期的一个主要挑战是 DDPM 方法极高的计算开销。
解决方案 - 更快的采样: 通过新的采样方法,这一问题已得到显著缓解。研究人员开发了确定性采样器,例如 DDIM (Denoising Diffusion Implicit Models),它可以 以更少的步数生成高质量图像(例如 20-50 步),且无需在每一步重新添加噪声。
质量与控制:确保模型准确生成所请求的内容(提示词遵循度),同时避免出现诡异的伪影,这仍然是一个持续的挑战。像 classifier-free guidance 和负面提示词(negative prompts)这类技术虽然是强大的解决方案,但并不完美,无法完全解决这一问题。
结论:AI 图像生成的关键要点
从噪声到艺术的历程证明了结合不同 AI 突破所产生的巨大力量。以下是关键要点:
AI 图像生成主要由……驱动扩散模型,通过逆转添加噪声的过程从混沌中创造结构。
等模型学习得到,其中概念具有几何意义,允许文本提示词引导视觉生成。生成过程遵循一条向量场……通过像重新加入噪声(DDPM)这样的巧妙技巧,这对于质量和多样性至关重要。
精细的控制是通过诸如Classifier-Free Guidance和 Negative Prompts 等技术实现的,这些技术可以放大并引导文本提示词的影响。
这项技术融合了物理学、高维几何和海量神经网络,代表了创意表达的新前沿。
关于 AI 图像生成的常见问题解答 (FAQ)

问题 1:AI 究竟是如何将文本转化为图像的? 它从随机噪声开始并逐渐对其进行细化……由文本提示词的向量表示引导,从而将噪声引导至你所描述的图像。
问题 2:为什么生成 AI 图像有时会很慢? 最初的算法(如 DDPM)需要很多步骤。较新的算法(如 DDIM)速度快得多,因为它们使用了更直接、确定性的数学路径,显著减少了所需的步骤数。
问题 3:为什么仅通过一次性“去噪”图像效果不好? 简单的逐步去噪方法效果不佳。现代方法在更稳健的目标上训练模型,例如预测添加到原始图像中的总噪声,这提供了更稳定的学习信号。
Q4: 什么是“负面提示词 (negative prompt)”,它有什么作用? 负面提示词是你不希望出现在图像中的概念列表。模型计算与这些术语相关的方向,并引导生成过程远离从它们开始,这是一种消除错误或不想要的风格的强大方法。
Q5: 过程中所有的随机性对于生成都是必要的吗? 这取决于具体情况。原始的 DDPM 方法依赖于在每一步添加随机噪声,以获得高质量、多样化的结果。然而,像 DDIM 这样的后期方法是确定性的;它们遵循可预测的路径,在生成过程中不需要添加噪声,但仍能更快地生成高质量图像。


