top of page

伟大的数据排毒:放弃Reddit是修复‘更笨’ChatGPT的唯一方法吗?


The Great Data Detox: Is Dropping Reddit the Only Way to Fix a 'Dumber' ChatGPT?

AI 社区正在经历一场剧烈变革,其核心问题听起来像科幻笑话的开场白:当 AI 不想阅读其他 AI 撰写的内容时,会发生什么?这一传闻的主角是 ChatGPT,据称它与 Reddit——互联网上最大、最混乱、最具人类特色的论坛之一——在数据来源上分道扬镳。数月以来,用户涌入 r/ChatGPT 等 subreddit 抱怨,问道:“是我的错觉,还是 ChatGPT 变笨了?”他们反映,这个曾经出色的模型变得懒惰、粗鲁,或者能力下降。

现在,社区认为他们找到了确凿证据。该理论认为,OpenAI 正在故意切断 ChatGPT 与 Reddit 的联系,以防止它“自食其尾”——即在充斥该平台的海量低质量 AI 生成内容上进行训练。这一举措在互联网上引发了分裂。一些人称赞这是必要的质量控制措施,以拯救 AI 免于一种被称为“模型崩溃”的数字大脑腐化。另一些人则发出警告,担心 ChatGPT 在试图净化其“饮食”的过程中,会变成一种无菌、孤立的智能体,与最初使其革命性的真实人类对话的生动混乱隔绝。

本文深入探讨了 ChatGPT 数据源的争议。我们将探讨为什么这一决定如此关键,“模型崩溃”的真正含义,以及这种数据排毒如何永久改变人工智能的未来。

ChatGPT 数据源争议究竟是什么?

What Exactly Is the Controversy Over the ChatGPT Data Source?

这一争议的核心是一个被污染的水井的故事。多年来,AI 开发者一直依赖公共互联网的广阔空间作为训练场。像 Reddit 这样的平台曾是金矿:每天数百万关于各种话题的对话,包含俚语、讽刺、利基专业知识和原始的人类情感。这些未经过滤的数据帮助像 ChatGPT 这样的模型学会了人们实际交谈的细微差别。

问题在于?今天的互联网已不是五年前的互联网。自生成式 AI 工具发布以来,网络已被合成文本淹没。论坛帖子、产品评论,甚至看似个人的轶事往往由机器人撰写。曾经是人类互动堡垒的 Reddit,现在充斥着 AI 生成的内容。

这导致了广泛的猜测,即OpenAI 正在积极从其数据管道中移除 Reddit。虽然目前没有官方的、明确的声明确认全面禁令,但证据和社区共识正在积累。r/ChatGPT 上的用户指出模型性能下降以及最近无法引用当前 Reddit 线程作为证据。

社区反应严重分化:

支持“终于摆脱了”的一方:相当一部分用户表示欣慰。他们认为 Reddit 是“胡言乱语”、“妄想”和泛滥错误信息的来源。对他们来说,从 ChatGPT 数据源中移除它是提高准确性和可靠性的迟来举措。正如一位用户讽刺所说,“AI 机器人不想阅读 AI 生成的内容”是个好兆头。

支持“你在让它变笨”的一方:相反,另一群人担心这将对 ChatGPT 的实用性造成致命打击。他们认为,尽管 Reddit 有种种缺陷,但它包含了现实世界问题解决、利基爱好者知识和多样文化视角的宝库,这些在经过净化的学术文本中找不到。他们担心,仅在“批准”数据上训练的 ChatGPT 会变成一种无菌的、企业腔调的工具,失去创造性火花和与现实世界的联系。

这场辩论不仅仅关乎一个平台。它是对 AI 训练未来的公投,在一个充斥 AI 生成信息的世界上。

为什么 ChatGPT 数据源如此重要?

训练数据的影响

要理解这一情况的严重性,你必须了解机器学习最基本的规则:“垃圾进,垃圾出”(GIGO)。AI 模型是其训练数据的反映。其知识、偏见、个性及局限性均继承自训练语料库。

对话细微差别:它教会 AI 自然对话的节奏和流程,包括幽默、讽刺和习语。

知识广度:从高级编程问题到古代历史辩论,再到修理漏水龙头的建议,Reddit 的内容极其多样。

实时信息:它提供了关于当前事件、趋势和演变语言的不断更新的信息流。

然而,GIGO 原则有其黑暗面。当训练数据被有缺陷、重复或有偏见的信息污染时,模型性能会下降。根据2023 年 Rice 和 Stanford 大学研究人员的一项研究,在合成数据上训练的模型可能很快陷入“模型崩溃”,即它们开始失去对原始人类生成数据的了解。它们会遗忘异常值,抹平细微差别,最终产生越来越单调且事实错误的内容。这正是用户现在报告的“变笨”现象。因此, curation ChatGPT 数据源不仅仅是小调整;它是对模型自我保护的关键行为。

AI 训练数据的演变:从精选库到数字“狂野西部”

AI 训练数据的历史一直是不断追求更多的过程。早期模型在精心挑选的高质量但相对较小的数据集上训练,如 Google Books、Wikipedia 和学术论文。这给了它们坚实的事实基础,但使它们听起来僵硬且学术化。

为了实现现代 LLM 的对话流畅性,像 OpenAI 这样的公司转向了大规模网络抓取,如 Common Crawl,它从公共互联网捕获 PB 级数据——包括博客、新闻网站,当然还有像 Reddit 这样的论坛。从精选库转向数字“狂野西部”的这一转变,赋予了 ChatGPT 理解和模仿人类交流的革命性能力。

但我们现在进入了一个新的、更危险的时代。AI 创造物已逃出实验室,并在野外繁殖。Dr. Evelyn Reed,一位专注于 LLM 的数据科学家,将其描述为“Ouroboros 问题”——蛇吃自己尾巴的古老象征。“我们创造了一个闭环信息生态系统,”她合理地表示。“AI 生成内容,这些内容发布到网络,网络爬虫抓取这些内容来训练下一代 AI,然后产生略微退化的内容。每个循环,模型与原始人类源材料的联系都会失去一点。”这种递归污染是 ChatGPT 数据源变化旨在对抗的核心威胁。

受污染的 ChatGPT 数据源如何导致“模型崩溃”

How a Polluted ChatGPT Data Source Leads to 'Model Collapse'

“模型崩溃”听起来戏剧化,但它是数据科学家正在积极防止的 tangible 现象。这是一个逐渐退化的过程,而不是突然崩溃。以下是其发生的分步说明:

内容洪水

第一代生成式 AI 工具被用于以前所未有的规模创建海量文本——文章、评论、评论和社交媒体帖子。其中大部分内容平庸、略显泛化,可能包含微妙的事实错误或“幻觉”。

平台饱和

这些合成内容发布在开放网络上,包括像 Reddit 这样的平台,在那里它与人类生成的帖子难以区分。如果内容结构良好且易于阅读,点赞算法甚至可能偏爱这些内容。

不加区分的抓取

下一次公司为新 AI 模型准备训练数据集时,其网络爬虫会抓取一切。它们无法轻易区分发自内心的、人类撰写的故事和无灵魂的 AI 生成的模仿。

从副本学习副本

新模型在这一混合数据集上训练。它从 AI 生成文本的模式中学习,就像从人类文本中学习一样。然而,AI 文本多样性较少,且在统计上更“平均”。模型学会偏好这些常见模式,有效地遗忘了来自人类的更稀有、更细微或“异常值”的数据。

加速衰退

随着这一过程在几代中重复,模型的知识库缩小。它对较小范围的信息更有信心,在遇到超出其退化理解范围的内容时更易编造。结果是一个感觉不那么有创意、不那么博学且更重复的 AI——正是用户抱怨的。

如何在现实生活中观察“ChatGPT 衰退”

How to Observe the 'ChatGPT Decline' in Real Life

关于 ChatGPT 数据源的辩论不仅仅是理论上的;它直接与每天报告的令人沮丧的用户体验相关。这些不仅仅是感觉;它们可能是数据污染和模型崩溃早期阶段的症状。

增加的“懒惰”:模型拒绝完成它曾经轻松处理的任务,通常提供大纲而不是完整响应,或声称任务太复杂。

更“粗鲁”或更“审查”式的语气:AI 变得过度谨慎,即使对于良性请求,也经常用关于安全和伦理的陈词滥调回应。

创造力和细微差别的丧失:它在创意写作提示上挣扎,产生泛化、公式化的文本。其理解幽默、讽刺或复杂指令的能力明显减弱。

事实退化:模型似乎忘记了它以前知道的信息,或自信地断言不正确的事实。

虽然 OpenAI 不断调整其模型,但许多专家认为,这种感知衰退的根本原因是 ChatGPT 数据源的完整性。通过试图过滤掉像 Reddit 这样的来源,OpenAI正在进行一场高风险的手术。他们正在切除潜在的癌性增长(污染数据),但风险是在过程中切断重要器官(真实人类知识)。

ChatGPT 数据源的未来:机遇与挑战

切断 Reddit 和类似论坛并不是终极解决方案;它是整个 AI 行业面临的新、更复杂挑战的开始。后 Reddit 世界中的 AI 训练数据未来会是什么样子?

面临的挑战:

数据稀缺问题:高质量的人类生成文本现在是一种有限且日益珍贵的资源。下一个万亿词数据集将来自哪里?

回音室风险:如果 AI 公司仅依赖来自官方出版商的预先批准、净化的数据,模型可能变得危险地有偏见,仅反映狭窄的、企业批准的世界观,并与全球文化脱节。

伦理雷区:公共数据的替代是私人数据。AI 公司已经在与出版商达成大规模交易以许可其内容。这引发了版权、补偿以及少数大公司是否应成为塑造全球 AI 的数据的看门人的问题。

地平线上的机遇:

高质量合成数据:未来可能不是避免合成数据,而是创建更好的合成数据。研究人员正在开发使用 AI 生成新的、多样且事实准确的训练数据的方法,这些数据可用于在不依赖网络抓取的情况下教授模型新事物。

回归人类专家:AI 公司可能会更多地投资于人类反馈和 curation(如 RLHF - Reinforcement Learning from Human Feedback)。这将涉及支付专家创建、审查和纠正数据,确保更高的质量标准。

混合模型:最可能的未来涉及混合方法。模型将建立在许可的高质量数据的可信核心基础上,然后用来自专业人类注释者或受控合成生成的更小、更动态的数据集进行微调。

结论:ChatGPT 数据源困境的关键要点

  Conclusion: Key Takeaways on the ChatGPT Data Source Dilemma

围绕 ChatGPT 数据源的争议不仅仅是社区戏剧;它是人工智能发展中的关键转折点。可能切断与像 Reddit 这样庞大的人类对话存储库的联系的决定,突显了一个根本冲突:对数据质量的迫切需求与对数据多样性的基本需求。

放弃 Reddit 是针对“模型崩溃”这一存在威胁的防御性举措——一种由 AI 从自身有缺陷的输出中学习的数字痴呆。虽然这可能导致 ChatGPT 感觉如此人类的“火花”暂时或永久丧失,但这是确保其长期可靠性和事实准确性的计算风险。

随着我们前进,获取、清理和 curation 训练数据的策略将成为定义未来 AI 能力和局限性的最重要因素。不加区分地抓取整个互联网的时代已经结束。伟大的数据排毒已经开始,其结果将塑造我们每天依赖的机器的智能。

关于 ChatGPT 及其数据的常见问题 (FAQ)

Frequently Asked Questions (FAQ) about ChatGPT and its Data

1. 什么是“模型崩溃”,它与 ChatGPT 的数据源有何关系?

模型崩溃是一种现象,即一个 AI 模型在反复训练于其他 AI 生成的数据上时,开始失去对原始人类知识和细微差别的理解。这就像复印件的复印件;每个版本都变得不那么清晰。它与 ChatGPT 数据源直接相关,因为如果像 Reddit 这样的平台充满 AI 内容,使用它们进行训练可能会启动这种退化循环。

2. ChatGPT 真的在变“笨”吗?

许多用户报告性能下降,包括增加的“懒惰”、重复性以及更不具创意或细微差别的个性。虽然 OpenAI 不断更新模型,但这些用户体验与污染数据源和模型崩溃早期阶段的理论症状一致。因此,虽然尚未官方确认,但认为它变“笨”的感知是一个广泛且与训练数据相关的有效担忧。

3. 使用 Reddit 数据和精选数据集训练 AI 有什么区别?

Reddit 数据庞大、多样且对话化,反映了实时人类互动及其所有混乱、俚语和利基知识。精选数据集(来自学术期刊或许可出版商等来源)通常更干净、更事实化且结构良好。权衡是,精选数据可能缺乏 Reddit 的对话创造力和广度,可能使 AI 更准确但更不“人性化”。

4. 为什么 Reddit 最初被认为是好的数据源?

Reddit 是 AI 训练的宝矿,因为它提供了庞大、不断更新的自然人类对话语料库,涵盖几乎所有想象的话题。这种非结构化、真实的数据对于教授模型人类语言的节奏、语境和多样性至关重要,使它们超越从书籍和百科全书中学习的僵硬正式语气。

5. 如果 AI 停止使用像 Reddit 这样的公共论坛,它未来将从哪里获取数据?

AI 数据来源的未来很可能是一种多管齐下的方法。这包括:1)直接从出版商和媒体公司许可高质量、受版权保护的内容。2)大力投资于 Reinforcement Learning from Human Feedback (RLHF),即付费人类专家创建和验证数据。3)开发先进技术以生成高质量、经过事实核查的合成数据,在受控环境中教授模型新概念。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page