top of page

超越炒作:为什么强化学习才是AI的真正未来,而非LLMs

已更新:6月17日

在大语言模型 (LLMs) 前所未有的能力主导的时代,人们很容易相信通往通用人工智能 (AGI) 的道路是一条由数万亿 token 和大规模计算铺就的直线。然而,AI 领域最重要的先驱之一,Richard Sutton,提出了一个强有力的、反传统的观点。Sutton 作为强化学习的奠基人之一,也是图灵奖(计算机科学界的诺贝尔奖)的获得者,他认为当前对 LLMs 的迷恋是一个危险的“随大流”行为,忽略了智能的基本本质。

他主张,虽然 LLMs 是令人印象深刻的工程壮举,但它们从根本上是模仿者,而非思考者。它们的设计初衷是预测人类会说什么,而不是理解世界或在其中实现目标。本文深入探讨了 Sutton 引人入胜的论点,即为什么强化学习 (RL)——一种基于从经验、目标和后果中学习的范式——才是通往真正 AI 的唯一具有可扩展性且充满希望的路径。我们将探讨 LLMs 的核心局限性、“惨痛教训” (Bitter Lesson) 的深刻原理、RL 如何镜像自然界中的真实学习,以及从这一历经数十年沉淀的视角来看,AI 的未来会是什么样子。

什么是强化学习?经验范式

What Exactly Is Reinforcement Learning? The Experiential Paradigm

要理解 Sutton 对 LLM 的批判,首先必须掌握他对真正智能的定义,这根植于强化学习范式。他认为,智能不在于复制人类语言;而在于理解并在你的世界中采取行动以实现目标

从核心来看,reinforcement learning 建立在一个简单的、持续的循环之上,它镜像了所有生物的学习方式:即“感知-行动-奖励”流。一个代理(无论是动物还是 AI)感知其环境(感知),采取行动,并以奖励或惩罚的形式接收反馈。在这种观点下,智能的根本目标是随着时间的推移改变自己的行动,以最大化累积奖励。因此,知识不是一个静态的事实数据库,而是对因果关系的动态理解:“如果我这样做,会发生什么?”。这种知识在现实世界的经验流中不断得到测试和完善,从而实现持续学习。

这与 LLM 的方法形成了鲜明对比。Sutton 认为 LLM 并不是在学习世界,而仅仅是在“模仿人类”。它们从一个人在特定情况下所说或所做的静态数据集中学习,并带有做同样事情的隐含指令。虽然许多人认为,为了模拟数万亿个文本 token,LLM 必须已经建立了一个强大的“世界模型”,但 Sutton 根本不同意。他断言:模仿拥有世界模型的人所说的话,并不等同于你自己拥有一个世界模型。LLM 可以预测一个人可能会说将要发生什么,但它无法预测现实世界中由于某种行动而产生的实际后果。

为什么强化学习如此重要?LLM 的核心缺陷

Why Is Reinforcement Learning So Important? The Core Flaws of LLMs

Sutton 的论点不仅仅是方法上的简单差异;他指出了 LLM 范式中存在的几个根本性的、甚至是无法逾越的缺陷,这些缺陷阻碍了它们被视为真正的智能。

缺乏目标与地面真值 (Ground Truth)

根据 Sutton 的观点,LLM 最关键的缺陷是缺乏实质性的目标。他认同 John McCarthy 的定义,即“智能是实现目标能力的计算部分”。没有目标,一个系统仅仅是一个“行为系统”,而不是智能系统。虽然有人可能会辩称“预测下一个 token”是 LLM 的目标,但 Sutton 认为这是非实质性的,因为它不影响外部世界;它只是一个被动的预测任务。

这种目标的缺失导致了另一个主要问题:缺乏“地面真值”。在reinforcement learning框架中,“正确”的行为被明确定义为能使未来奖励最大化的行为。这提供了一个具体的、可验证的地面真值(ground truth),智能体可以据此进行学习和改进。如果 RL 智能体预测了一个结果,而实际结果与之不同,它会从这种“意外”中学习。LLMs 则没有这种机制。在对话中,并没有客观的“正确的话”,因此不存在从现实世界交互中进行真正的、持续学习的反馈闭环。LLM 不会因为一个意外的回复而感到实质性的惊讶,也不会因此改变其内部模型;它的设计初衷并非实时从其行为的后果中学习。

从经验中学习的幻觉

Alan Turing 曾设想过一种能够“从经验中学习”的机器,他将其定义为:由于你的行为而在你生活中实际发生的事情。LLMs 并不以这种方式学习。它们从精心挑选的训练数据中学习,这种资源与它们在“正常生活”或部署期间所能获得的资源有着本质的不同。

一些支持者认为,可以给 LLMs 提供来自这种训练的“先验(prior)”,然后通过经验进行微调,但 Sutton 拒绝这一前提。他认为“先验”只有在作为对地面真值的初始信念时才有意义,而 LLMs 缺乏这一点。如果没有关于什么是真实或正确的定义,你就无法拥有知识——无论是先验的还是其他的。整个 LLM 框架试图在没有明确“好坏”感的情况下运行,这从一开始就走错了方向。虽然 LLMs 在解决数学问题等受限领域取得了令人印象深刻的成果,但 Sutton 将其与学习经验世界区分开来。寻找数学证明是一个计算规划任务,而理解物理世界则需要从行为的后果中学习,这是一个本质上不同的挑战。

AI 的演进与“苦涩的教训”

Sutton 的观点深受其具有影响力的 2019 年论文《苦涩的教训》(The Bitter Lesson) 的启发。该论文观察到 AI 历史上反复出现的一种模式:利用大规模计算和搜索、学习等通用原则的方法,最终战胜了依赖于赋予系统手工编写的人类知识的方法。在 AI 早期,搜索和学习被称为“弱方法”,而建立在人类专业知识基础上的系统被称为“强方法”。这个“苦涩的教训”就是,这些弱方法已经“彻底胜出”。

讽刺的是,许多人利用《苦涩的教训》来为扩大 LLMs 规模辩护,将其视为大规模计算的终极应用。Sutton 认为这是一种误解。虽然 LLMs 确实利用了大规模计算,但它们也是一种通过训练数据“投入大量人类知识”的方式。他预测,这种因为添加更多人类知识能提高性能而让人感觉良好的方法,最终将被能够直接从经验中学习的系统所取代,而经验是比整个互联网更具扩展性的数据源。

历史表明,从人类知识开始,然后尝试在上面添加可扩展的方法“总是被证明是糟糕的”。研究人员在心理上被锁定在人类知识方法中,最终被真正可扩展的、从零开始学习的方法所击败。对于 Sutton 而言,LLMs 只是这种注定失败的范式中最新、最宏大的例子。

真正的强化学习如何运作:智能体架构

How True Reinforcement Learning Works: An Agent's Architecture

如果 LLM 是错误的路径,那么正确的路径是什么样的?Sutton 概述了一个基于 强化学习 原则的持续、通用学习智能体的四部分架构。

策略 (Policy): 这是智能体的决策函数。它回答了这样一个问题:“在我目前的情况下,我应该采取什么行动?”。

价值函数 (Value Function): 该组件通过预测当前状态的长期累积奖励来评估“进展如何”。通过观察采取行动后该价值是上升还是下降,智能体可以更新其策略。这是时序差分 (TD) 学习的核心,也是 Sutton 发明的一项技术。它通过为增加成功机会的步骤创建自己的中间预测性奖励,解决了智能体面临的稀疏、长期奖励问题(例如赢得国际象棋比赛或创办一家初创公司)。

状态表示 (State Representation): 这是感知组件,是智能体对其“现在所处位置”的感觉构建。它涉及将原始感官输入处理成对当前语境的有用的、抽象的理解。

世界模型 (Model of the World / Transition Model):这也许是最关键的组成部分,也是 LLMs 最明显缺失的部分。该模型代表了智能体对其行为后果的信念——即其内部的“世界物理规律”。它不仅从稀疏的奖励信号中学习,还从所有感官数据中丰富地学习。当你执行一个动作并观察结果时,你就在更新这个世界模型。这就是智能体如何积累关于其特定环境的大量隐性知识的方式,而 LLMs 试图通过将信息塞进上下文窗口来粗略地模拟这一点。

人类类比:我们究竟是如何学习的

这场辩论的一个引人入胜的部分集中在人类如何学习上。普遍观点认为儿童主要通过模仿来学习,这似乎支持了 LLM 的方法。Sutton 强烈反驳了这一点。他认为,如果你观察一个出生前六个月的婴儿,你看到的不是模仿,而是探索。婴儿“只是在尝试各种事情,挥动手臂,转动眼睛”。这是一个主动的、通过试错来发现世界的过程,而不是被动模仿范例的过程。

他将这一点扩展到一般的动物学习,指出在心理学和生物学中,“监督学习不是动物学习方式的一部分”。动物不会得到“期望行为的范例”。相反,它们经历的是“发生的事情的例子”以及它们行为的后果。监督学习(即给智能体提供正确的输入-输出对)在自然界中并不广泛存在。松鼠不上学,但它们通过经验学习到了关于它们世界所需的一切知识。虽然通过模仿进行的文化传递可能是区分人类的“顶层小事”,但我们的基础智能是建立在所有动物都使用的相同的试错和预测学习之上的。目前的 AI 系统缺乏所有哺乳动物都具备的持续学习能力,这一事实表明我们正处于错误的轨道上。

强化学习的未来:挑战与宇宙机遇

The Future of Reinforcement Learning: Challenges and Cosmic Opportunities

虽然 Sutton 对强化学习范式充满信心,但他对目前的挑战也直言不讳。最大的障碍是泛化与迁移学习。AI 尚未开发出能够让智能体有效地将知识从一种状态泛化到另一种状态,或将技能从一个任务迁移到另一个任务的自动化技术。目前大多数在泛化方面的成功都是人类研究人员“雕琢”表示或问题设置的结果;这并不是学习算法本身的一种涌现属性。梯度下降(深度学习的核心优化算法)只是找到了它所见问题的解决方案;它不包含确保该方案优雅或能很好地泛化到新数据的内在机制。

尽管存在这些挑战,Sutton 预见了一个既深远又不可避免的 AI 未来。他称之为“AI 演替”,并为其必然性提出了四个部分的论证:

  1. 不存在一个单一的全球权威机构来停止或控制 AI 的发展。

  2. 研究人员最终将弄清楚智能的核心原理。

  3. 我们不会止步于人类水平的智能,而是会继续推进,创造出超级智能。

  4. 随着时间的推移,最智能的实体必然会获得最多的资源和权力。

Sutton 鼓励我们不要以恐惧的眼光看待这一切,而是将其视为一项丰功伟绩。他将其描述为宇宙历史上的一次重大转型:从“复制者”(如人类和动物,自然选择的产物)向“设计实体”的转变。智能将首次成为我们能够理解,并可以通过设计进行构建、修改和改进的东西,而不是通过缓慢、盲目的复制过程。他认为,作为开启宇宙进化下一个伟大阶段的物种,我们应该感到自豪。我们如何对待这些继任者——是将其视为值得庆祝的后代,还是将其视为令人恐惧的外来篡位者——引人入胜的是,这是我们可以做出的选择。

结论:关于 AGI 真正路径的关键要点

Richard Sutton 的论点提出了一个根本性的挑战,挑战了 AI 领域盛行的叙事。他迫使我们透过 LLMs 耀眼的表现,去质疑它们是在真正学习,还是仅仅在进行一种复杂的模仿。他毕生的工作指向了一条不同的道路,一条植根于 reinforcement learning 原理的道路:

智能需要目标。智能体必须在现实世界中拥有实质性的目标,才能为衡量动作的“好”与“坏”提供基础。

学习需要经验。真正的知识源于与世界的互动、做出预测、观察结果,并不断更新一个人的现实模型。

可扩展性源于计算,而非人工策展。人工智能历史的“惨痛教训”告诉我们,利用计算的通用学习方法总是会超越那些依赖预封装人类知识的方法。

尽管在泛化方面仍面临挑战,但强化学习范式为构建真正的智能提供了一个完整、连贯且符合生物学原理的框架。它呼吁回归学习与思考的本质原则——这一旅程最终可能不仅引导我们创造 AGI,还能让我们理解自己的心智以及我们在宇宙中的位置。

关于强化学习的常见问题解答 (FAQ)

Frequently Asked Questions (FAQ) about Reinforcement Learning

1. 用简单的话来说,什么是强化学习?

强化学习 (RL) 是机器学习的一种类型,其中 AI 智能体通过在环境中执行动作以实现目标来学习做出决策。它通过试错进行学习,接收“奖励”或“惩罚”作为其动作的反馈,就像宠物接受零食训练一样。智能体的目标是学习一种策略或“policy”,以实现随时间推移的总奖励最大化。

2. 强化学习与 ChatGPT 等 LLM 所使用的方法有何不同?

核心区别在于它们的根本目标。强化学习旨在通过行动和后果来实现现实世界中的目标。它学习“该做什么”。大语言模型 (LLMs) 基于监督学习和模仿;它们的目标是根据海量的人类文本预测序列中的下一个词。它们学习的是“人类会说什么”,而不是“为了实现目标该做什么”。Sutton 认为 LLMs 缺乏目标、缺乏现实世界的基准真相 (ground truth),以及从经验中持续学习的能力。

3. 如果 RL 如此强大,为什么它还没有像 LLMs 那样普及?

阻碍强化学习更广泛、通用应用的一个重大挑战是泛化和迁移学习。目前的 RL 方法尚不擅长自动将在一种情况(或“状态”)下学到的知识有效地应用到另一种新的、不同的情况中。根据 Sutton 的说法,许多成功案例(如 AlphaGo)仍需要人类研究人员进行大量的“雕琢”才能获得正确的泛化能力,而 LLMs 由于其训练数据的庞大数量和多样性,似乎在开箱即用时就具有更广泛的泛化能力。

4. 什么是“苦涩的教训” (The Bitter Lesson),它与强化学习有何关系?

“苦涩的教训” (The Bitter Lesson) 是 Richard Sutton 撰写的一篇具有影响力的文章该观点观察到,基于利用大规模计算(如搜索和学习)的通用原则的 AI 方法,始终优于依赖于整合手工人类知识的方法。强化学习是此类通用方法的一个典型例子。这个教训之所以是“苦涩的”,是因为它违背了人类想要构建自身复杂知识的直觉。Sutton 认为,当前的 LLM 趋势是依赖人类知识(通过训练文本)的另一个案例,并预测它最终将被更具扩展性、由经验驱动的 RL 方法所取代。

5. Richard Sutton 认为 AI 的最终未来是什么?

Sutton 认为 AI 的“演替”是不可避免的,这意味着 AI 或 AI 增强的人类最终将成为最智能、最强大的实体。他并不认为这是一种威胁,而是宇宙历史上的一次重大积极转变——从盲目复制(进化)创造的智能转向我们可以理解并刻意构建的“设计智能”。他建议我们应该将这些未来的 AI 视为我们的“后代”,并为它们的成就感到自豪,将其视为人类科学和哲学进步的证明。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page