多样性崩溃:为什么后训练使AI写作可检测
已更新:6月17日

人们普遍认为 AI 写作 本质上是平庸的——认为大语言模型仅仅是“互联网的一张模糊 JPEG 图片”,除了平淡乏味的散文外,无法产出任何东西。这种假设催生了当前的一批 AI 检测工具。当检测器标记一个段落时,它发现的并不是机器灵魂,而是一种被称为多样性坍塌的统计异常。
我们目前正处于一个短暂的过渡窗口期,像 Pangram 这样的 AI 检测器看起来似乎有效。它们之所以起作用,并不是因为 AI 无法实现类人的变化,而是因为当前行业的安全标准——后训练阶段的人类反馈强化学习 (RLHF)——阉割了模型的创作潜力。
理解多样性坍缩是理解为什么当今 AI 模型的语气如此雷同,以及为什么它们未来不会一直如此的关键。
机制:后训练如何导致多样性坍缩

要理解为什么 ChatGPT 的输出感觉很枯燥,你必须观察其流水线。大语言模型 (LLM) 最初是一个“基座模型”。基座模型在海量数据集上进行训练以预测下一个 token。它们是原始的、不可预测的,且在怪诞之处表现得非常像人类。它们代表了人类语言的完整分布,包括混乱的和天才的部分。
开发者获取原始基座模型并对其进行 RLHF,以使其变得有用,无害且诚实。这一过程起到了窄滤网的作用。它会惩罚模型过于不可预测或“怪异”的行为,迫使其输出的概率分布收敛于一个安全的平均值。
这就是 Reddit 用户和开发者所说的“企业机器人”效应。在 r/singularity 等平台的讨论中,从事医疗 AI 和其他敏感应用的行业内部人士证实了这一现象。基础模型可能会提供富有创意、细致入微的诊断或笑话,但 RLHF 层会抑制这种波动,转而选择标准化的安全回答。其结果是模型遭受了 多样性崩溃(diversity collapse)——它失去了表达长尾创意的能力。
现代 LLM 中的多样性崩溃分析

当我们谈论 多样性崩溃 时,它与“模式崩溃”(mode collapse)是有区别的。这是一个常用于 GAN(生成对抗网络)研究的术语,指生成器无论输入什么都产生相同的输出图像。在这里,文本在技术上是唯一的,但在风格上是平淡的。
检测行业完全依赖于这种平淡性。像 Pangram 这样的工具声称具有很高的准确率,因为它们被调整为寻找“训练后伪影(post-training artifacts)”。这些是特定的句法模式——过度使用过渡词、均衡的句子结构以及缺乏困惑度(perplexity)——这些都是 RLHF 压缩过程产生的结果。
目前的 AI 写作之所以成为“废话(slop)”,并不是因为技术不好。它之所以是废话,是因为我们将其优化得过于乏味。
两年前,喜剧作家 Simon Rich 尝试了 OpenAI 的基础模型(特别是 Base4 的一个版本)。他的经历突显了这种鲜明的差异。他发现基础模型令人不安,并不是因为它像机器人,而是因为它与才华横溢的人类作家无异。它尚未经历导致训练后调节所引起的多样性崩溃(diversity collapse)。因此,这些基础模型的输出对于 AI 检测器来说通常是不可见的,因为它保留了人类思维的高熵和统计不规则性。
检测中训练后伪影的作用
目前 AI 检测器的效率是当前开发周期的一个临时特征。它们检测的不是“智能”;它们检测的是安全过滤器。
当模型经历 RLHF 时,它学会了回避。它会避免强烈的风格选择。这便形成了一种指纹。训练后人工痕迹是导致文章听起来像是委员会撰写的原因。人类的写作是“有棱角”的。它会有突兀的语气转变、参差不齐的句子长度以及古怪的词汇选择。经过训练后的模型则磨平了这些棱角。
这创造了一个悖论:我们让模型对公众使用变得越“好”、越“安全”,它就越容易被检测出来。检测工具本质上是在寻找“风险的缺失”。如果你移除了风险(即产生怪异感的可能性),你就移除了人性。
然而,最近的研究表明这个问题是可以解决的。
通过 Style Fine-Tuning 解决多样性崩溃问题

最有效的规避方法是 多样性崩溃 是通过有针对性的 风格微调来绕过通用的 RLHF 过滤器.
最近的一项研究针对 GPT-4o、Claude 3.5 Sonnet 和 Gemini 1.5 Pro 等主流模型,使用包含 50 位不同作家作品的数据集进行了微调。该研究旨在观察模型是否能够恢复被安全训练所抑制的基座模型潜在能力。
结果发人深省。研究人员邀请人类专家(艺术硕士)模仿特定作家的风格进行写作,并将其与微调后的模型输出进行对比。专家们一致更青睐 AI 的模仿作品。更重要的是,专家们表现出对未经微调的默认 AI 输出的强烈反感。
专家们所排斥的并非“AI 写作”与“人类写作”的区别,而是训练后的人工痕迹。一旦模型经过微调,将特定的风格模式置于安全对齐的泛化要求之上,多样性崩溃现象就消失了。模型不再生成那些典型的 AI “废话”,而是开始产出具有作者感的文本。
这对内容策略具有直接的启示意义。如果多样性崩溃 仅仅是对齐训练的一个副作用,那么“修复” AI 写作并不需要技术突破。它只需要不同的训练目标。
NeurIPS 与对抗性训练的兴起
学术界已经在着手解决这个问题。 Neural Information Processing Systems (NeurIPS) 是 AI 研究日程中最重要的盛会,最近将其最佳论文奖授予了一项专门针对 多样性崩溃 的研究。
研究人员建议使用 对抗训练 在 训练后 阶段,以防止输出分布过度收窄。在生成对抗网络 (GAN) 的架构中,一个模型尝试生成文本,而另一个模型则尝试将其与人类文本(或特定的目标分布)区分开来。这迫使生成器保持高度的多样性和熵,以欺骗判别器。
通过将 对抗训练 集成到对齐过程中,开发者理论上可以兼顾两者:既能让模型遵循指令(对齐),又能保留基础模型的统计丰富性。
这表明,“AI 口音”——即我们与 ChatGPT 联系在一起的那种平淡、可检测的风格——是一个可以解决的 Bug,而非固有特征。
未来的图景:高质量的废话 (Slop)

我们正奔向这样一个现实:多样性崩溃 已从系统中被工程化消除。随着各公司开始部署经过对抗性训练或专门的风格微调训练的模型,当前的 AI 检测器的效用将会消失。
如果你能规避多样性崩溃,像 Pangram 这样的工具就会失效。它们所寻找的统计水印将根本不复存在。
这导致了一个更复杂的问题。如果 AI 能够生成无限种独特的、听起来像人类的文本变体,“高质量废话”的数量将会爆炸式增长。我们已经习惯于忽略通用的机器人评论,因为它们看起来就像机器人评论。未来的模型可能会生成技术文档、创意小说和社交媒体评论,这些内容将与人类产出无异,因为它将模仿目前将我们与机器区分开来的多样性。
NeurIPS 的作者们甚至警告说存在一种反馈循环:随着我们被 AI text 所淹没,人类的写作可能实际上会开始遭受 diversity collapse,因为我们会潜意识地模仿那些最初为了模仿我们而训练的机器。我们最终可能会达到这样一个阶段:证明你是人类的唯一方法就是写出一些极其不连贯的内容,以至于任何经过优化的模型都无法预测它。
FAQ
mode collapse 与 diversity collapse 之间有什么区别?
Mode collapse 是一种故障状态,即生成模型对不同的输入输出完全相同的结果,本质上是陷入了停滞。Diversity collapse 则是一个更微妙的问题,模型虽然能生成唯一的文本,但文体范围被压缩了,导致输出结果因其平庸、大众化而显得千篇一律,这是由于 post-training 约束。
为什么 base models 比 RLHF 模型更难检测?
Base models 保留了训练数据中原始的高熵模式,包括人类的特质和不规则性。它们尚未经过 post-training 对齐(RLHF),而这种对齐会平滑这些统计峰值,使得那些寻找低困惑度(low-perplexity)模式的检测器无法识别它们。
针对特定作者进行微调能解决多样性崩溃(diversity collapse)吗?
是的,针对特定数据集进行 style fine-tuning 可以让模型优先考虑独特的风格,而非通用的安全对齐。研究表明,针对特定作家微调的模型所生成的文本可以超越人类模仿者,并且缺乏由以下原因导致的“AI 口音”:多样性崩溃。
对抗训练如何帮助提升 AI 多样性?
对抗训练引入了竞争机制,激励模型去欺骗判别器。这迫使生成模型在生成过程中保持更广泛的输出范围和更高的熵。post-training,防止其陷入导致多样性崩溃的安全、重复模式。
像 Pangram 这样的 AI 检测器在未来还会有效吗?
这不太可能。目前的检测器依赖于识别由训练后伪影导致的多样性崩溃。随着开发者实施更好的训练方法,如对抗训练和专门的微调,这些伪影将会消失,使得 AI 文本在数学上与人类写作无法区分。



