生成式 AI 创造力上限为何将输出限制在业余水平
- Aisha Washington

- 6月6日
- 讀畢需時 6 分鐘
已更新:6月17日

在人工智能的炒作周期中,我们已经进入了一个奇怪的平台期。虽然 ChatGPT 和 Midjourney 等工具以其速度令我们惊叹,但越来越多的研究表明,它们正面临着难以逾越的瓶颈。最近的一项研究强调了 生成式 AI 的创意天花板, 认为这些模型在数学上注定会停留在“业余”水平的创意输出阶段。
这无关算力或训练数据的大小。这关乎这些模型如何衡量概率的底层逻辑。对于依赖 AI 的企业和创作者来说,理解这一瓶颈是生成平庸的噪音与产出专业级作品之间的本质区别。
生成式 AI 创意天花板背后的数学原理

核心论点源自最近在各大技术论坛引发讨论的一篇论文,该论文认为创意并非神秘的灵感火花,而是一个可衡量的变量。研究人员提出了一个具体的公式:创意等于有效性乘以新颖性。
问题的关键在于概率系统中这两个变量之间的关系。
0.25 数学上限
在Generative AI的语境下,有效性(Effectiveness)与新颖性(Novelty)往往是相互制约的。
有效性是指输出内容的实用性、连贯性或逻辑上的合理性。
新颖性是指输出内容相对于训练数据的独特程度、令人惊讶的程度或差异化程度。
研究指出,对于大型语言模型(LLMs)而言,新颖性本质上等于
1−有效性. 你无法同时将两者都调至最大。如果 AI 生成的文本是 100% 可预测的(高效力),那么它的新颖性为零。如果它生成的文本是纯随机噪声(高新颖性),那么它的效力为零。
当你绘制这条倒 U 型曲线时,数学上的峰值——即最高可能的“创意得分”——恰好位于 0.25。这个 0.25 数学上限 代表了 生成式 AI 创意天花板。这是一个安全区,其中的内容既足够连贯以被理解,又足够独特而不至于构成抄袭。用人类的话来说,这就是“业余”作品的定义。它很称职,但没有开辟新的领域。
概率模型中的效力-新颖性权衡

这种局限性的存在是因为 概率模型的局限性。AI 是一个预测引擎。它基于数十亿个数据点来预测下一个最可能的像素或单词。
为了达到“有效”,模型必须选择在统计学上紧随前文的 token。它针对平均值进行优化。当 AI 试图变得“有创意”时,它本质上是在偏离统计学上最可能的答案。
如果你将模型推向过于追求新颖性的极端,就会产生幻觉——无法运行的代码、长着七根手指的手,或者不存在的事实。如果你优先考虑有效性,你就会得到企业级的“灰色粘液”——平庸的营销文案和图库照片风格的艺术品。
这种有效性与新颖性的权衡创造了一个边界。真正的人类天才通常同时具备高新颖性和高有效性——这是一种范式转移,即一个奇特的新想法最终被证明是完全合乎逻辑的。目前的概率模型很难在不崩溃成废话的情况下调和这两种状态。
生成式 AI 的创意天花板是绝对的吗?
对于这种平庸的“数学证明”,各界反应不一。在 Reddit 等平台上,用户指出了该研究逻辑中潜在的缺陷。
挑战定义
主要的批评针对公式本身。将 Novelty(新颖性)简单地定义为 Effectiveness(有效性)的倒数
(N=1−E) 对许多观察者来说,这感觉像是循环论证。它预设了你无法同时做到既实用又独特。
历史并不认同这一点。相对论既具有高度的新颖性,又具有高度的有效性。然而,对于统计模型而言,这种批评并不那么站得住脚。LLM 并不“懂”物理;它只知道单词出现在“物理”一词附近的概率。对于机器来说,偏离训练数据(新颖性)本质上增加了出错的风险(无效性)。
业余级创意 vs. Pro-c
心理学家将“Little-c”创意(日常问题解决)与“Pro-c”创意(专业的、改变领域的创新)区分开来。业余级创意是生成式 AI 大放异彩的地方。它提高了底线,让任何人都能写出像样的电子邮件或编写基础脚本。
生成式 AI 的创意天花板
只有当我们期望工具能够独立达到 “Pro-c” 级别时,这才会成为一个问题。数据表明,AI 创造的是 “互联网的平均水平”。它聚合了人类的智慧,但很难轻易超越它,因为从定义上讲,超越平均水平是一个低概率事件。
行动指南:通过 Human-in-the-loop 突破天花板

如果数学逻辑将 AI 限制在 0.25 分,那么唯一能改变等式的变量就是你。 Generative AI creativity ceiling 仅适用于孤立的工具。它不适用于集成了 Human-in-the-loop 流程的工作流。
以下是如何强迫模型突破其业余限制的方法。
1. 分离变量
不要在同一个提示词中要求 AI 既有创意又有效率。
阶段 A(有效性):利用 AI 生成结构、样板代码或背景纹理。让它处理那些它在有效性方面表现出色的“枯燥”且高概率的工作。
阶段 B(新颖性):以高“temperature”设置(增加随机性)运行独立的会话。索取狂野、不连贯的想法、隐喻或视觉概念。其中大部分会是垃圾(无效的),但有些会成为高新颖性的火花。
2. 人类综合
你必须成为桥梁。AI 无法可靠地将高新颖性和高有效性结合起来,但人类专家可以。
从阶段 A 中提取“安全”的基础内容。
注入阶段 B 中的“怪异”元素。
关键步骤:你必须手动修复逻辑。当你插入一个新颖的想法时,“有效性”会下降。你的专业知识将恢复连贯性。你修复旨在完成不可能任务的代码;你平滑文章中连接两个无关主题的过渡。
3. 有意违背规则
AI 经过训练以遵循规则。要突破天花板,你必须迫使它违反其训练逻辑。
在图像生成中:提示词中使用矛盾修辞法或冲突的艺术风格。使用 ControlNet 等工具强制生成 AI 自然状态下不会选择的构图。
在文本生成中:明确禁止与你的主题相关的最常见论点。如果写关于“远程办公”的内容,告诉 AI:“不要提到生产力或 Zoom 疲劳。”这会迫使模型挖掘其概率分布的“长尾”部分,从而人为地提高新颖性得分。
对未来工作的启示

“生成式 AI 创意天花板”的存在对于人类专业人士来说实际上是个好消息。如果 AI 仅通过增加算力就能毫不费力地达到最高创意水平(高新颖性 + 高有效性),那么人类的专业知识将变得毫无用处。
相反,我们看到了明确的分工。AI 创造了“均值”——即合格的、平均水平的基础。人类则提供了“方差”——那些被统计模型视为“错误”并加以惩罚的、违背逻辑的飞跃。
天花板并不是一堵墙,而是人类表现的底线。AI 能让你立即达到 0.25。而通往卓越的剩余距离,仍然需要手动攀登。
自适应常见问题解答
什么是生成式 AI 的创意天花板?
这是一个由研究人员提出的理论限制,认为 AI 模型无法同时实现新颖性(Novelty)和有效性(Effectiveness)的最大化。由于这些特性在概率模型中表现为权衡关系,AI 的输出往往在“安全”的业余水平达到顶峰,而无法实现专家级的创新。
为什么创意得分上限是 0.25?
该得分源自一个数学公式:创意 = 有效性 × 新颖性。如果将新颖性视为有效性的反面(1 - 有效性),那么这两个数字的最大数学乘积为 0.25,即当两个变量在 0.5 达到平衡时。
AI 能否超越业余水平的创意?
就其本身而言,由于依赖概率和训练数据均值,可能无法超越。然而,通过特定的提示策略和人工干预,输出水平可以得到提升。AI 擅长“小 c”(日常)创意,但在“专业 c”(职业级)范式转移方面表现乏力。
“有效性-新颖性”权衡如何影响内容创作?
这意味着当你让 AI 生成的内容变得更独特(新颖)时,它往往会变得不那么符合逻辑或连贯(有效)。相反,高度连贯的 AI 内容往往趋于平庸。创作者必须通过手动将独特的见解注入连贯的 AI 草案中来平衡这一点。
“人工在环”(human-in-the-loop)在克服这一限制方面起什么作用?
人类充当高新颖性想法的“连贯性过滤器”。人类可以采用一个怪异、低概率的 AI 概念,并对其进行编辑,使其变得逻辑通顺且有用,从而有效地绕过约束模型的数学权衡。


