Dario Amodei 谈 Scaling Laws 和 AGI:对“天才之国”的押注
已更新:6月17日

有一个特定的短语 Dario Amodei 经常使用,往往会让人们停下来深思。他将人工智能的近期未来描述为:不是一个更好的聊天机器人或更快的搜索引擎,而是“数据中心里的天才国度”。
这是一个引人注目的意象。它暗示了通往 AGI(通用人工智能)的道路并非由某种尚未发现的神奇算法铺就,而是依靠强力工程和数学。根据 Anthropic 的 CEO Amodei 的说法,其机制很简单:Scaling Laws(规模法则)。
其前提是,如果你给模型喂入足够的数据并投入足够的算力,智能就会作为一种自然副产品而出现。这种观点已将整个行业变成了一场高风险的军备竞赛。然而,在旧金山的研究实验室之外,在真实工程师讨论日常工作流程的评论区里,人们的反响褒贬不一。
虽然 Amodei 预测在不久的将来,Scaling Laws解决生物学和软件工程问题,Reddit 等平台上的用户却在应对一个更混乱的现实——在这个现实中,AI 虽然有所帮助,但仍会产生幻觉、步履蹒跚,且无法理解代码库的更广泛上下文。
智能物理学:为什么 Scaling Laws 是新的信条

要理解为什么 Anthropic 将公司前途以及数十亿美元押在这个概念上,你必须将 Scaling Laws 视为计算机科学的一种物理形式。
长期以来,人们一直假设 AI 的进展会进入平台期。你会达到一个收益递减的点,即增加更多的 GPU 或更多的文本数据不会产生更聪明的模型,只会产生一个更昂贵的模型。Amodei 的论点(得到了过去五年 LLM 发展的支持)是我们尚未达到那个天花板。事实上,我们可能在很长一段时间内都不会达到它。
Transformer Architecture 是其背后的引擎。与以往在复杂性面前陷入瓶颈的架构不同,Transformers 以一种允许大规模并行化的方式消化信息。它们不仅仅是记忆,而是学习推理模式。当你将其规模扩大时,你得到的不仅是更好的语法,而是“涌现”。
涌现是指系统表现出并非由显式编码产生的行为的时刻。一个在互联网文本上训练的模型,会突然学会如何翻译语言、编写 Python 脚本或解决逻辑谜题。
对于 Scaling Laws 的信奉者来说,AGI 只是最终的涌现属性。 它是当曲线持续向右上方增长时必然发生的结果。这意味着我们不需要新的发明,我们只需要更大的数据中心。
“无状态” Transformer 的问题
然而,技术上的质疑依然存在。很大一部分工程界人士指出,Transformer Architecture 本质上是无状态的。它执行的是静态矩阵乘法。它并不具备像生物大脑那样根据经验改变结构的“记忆”。
批评通常集中在这样一个观点:规模扩张本质上只是构建了一个庞大的人类知识查询表。它可以模拟推理,但它能真正创新吗?如果 AGI 需要具备持续运行并在无需重置的情况下实时学习的能力,那么当前的 Scaling Laws 最终可能会撞上一堵硬墙。
撞墙:AGI、数据稀缺与合成数据

如果 Scaling Laws 是通往 AGI 的载体,那么燃料就是迫在眉睫的问题。
互联网资源正趋于枯竭。高质量的人类文本——书籍、科学论文、干净的代码——是有限的资源。据估计,到 2020 年代后期,模型训练者将耗尽公开的网络数据。
这就是 Synthetic Data(合成数据)概念变得至关重要的原因。 如果人类无法编写足够的高质量数据来喂养这个庞然大物,那么它就必须自我喂养。该理论认为,高能力模型(如 Claude 3.5 或 GPT-4)可以生成比人类数据更干净、逻辑性更强的教科书、代码示例和推理轨迹。
使用 合成数据 来训练下一代模型是一个充满争议的反向反馈循环。反对者将其称为“模型崩溃”——即错误在迭代中被不断放大,就像对复印件进行再次复印一样。
但 Anthropic 等公司认为,通过严格的过滤,这实际上是解决方案。一个“天才国度”不仅能回答问题,还能产生新的知识,作为下一次迭代的训练场。这有效地绕过了数据瓶颈,使得 缩放定律 (Scaling Laws) 在人类数据耗尽后仍能继续发挥作用。
现实检验:缩放定律遇上 AI 编程
在软件工程领域,理论开始接受实践的检验。在这个领域,AGI 与工人们的日常磨练相碰撞。
Amodei 预测,在不久的将来,AI 将处理绝大多数编码任务。如果你观察使用 Claude 等工具的开发者之间的讨论,会发现反应呈现出惊叹与沮丧并存的两极分化。
生产力倍增器
人类的角色从编写语法转向“架构审查”和提示词工程。在这种观点下,Scaling Laws 正在发挥作用。模型在遵循复杂指令和管理上下文方面正变得越来越出色。
“幻觉”障碍
另一方面,怀疑情绪依然深厚。许多开发者报告称,虽然 AI 非常擅长编写脚本和独立函数,但在面对庞大的遗留代码库时,它就会崩溃。
这个“天才之国”似乎在处理项目全局上下文时显得力不从心。它会引入微妙的 Bug——不存在的变量、凭空捏造的库,或者乍看之下正确但在执行时失败的逻辑。
对于这些用户来说,AGI即将到来的想法与现实脱节。他们认为,调试 AI 生成的代码往往比从头编写耗时更长。这表明,虽然 Scaling Laws 提高了文本生成能力,但尚未解决高风险工程所需的可靠性和逻辑一致性这一根本问题。
AGI 经济学:边际收益与炒作周期

Dario Amodei 是一位 CEO。他的工作是推销一个愿景,以证明为测试 Scaling Laws 而构建集群所需的数十亿美元资金是合理的。Scaling Laws。
社区分析中一个反复出现的主题是对什么的恐惧边际收益。从 GPT-3 升级到 GPT-4 大约花费了 1 亿美元。下一次跨越可能需要 10 亿美元。再往后,可能是 100 亿甚至 1000 亿美元。
经济学层面的问题在于,所获得的智能提升是否值得成本的指数级增长。如果一个 1000 亿美元的模型仅比 100 亿美元的模型强 10%,那么 Scaling Laws 的经济可行性在技术可行性崩溃之前就会先崩溃。
怀疑论者认为,行业领袖们有动力维持“AGI 即将来临”的叙事,以保持风险投资的流入。如果增长曲线趋于平缓,这些公司的估值就会崩盘。
然而,Amodei 似乎赢得了一种不同于 Sam Altman 等同行的信任度。他的语气通常被描述为“冷静”或“工程师式的”,这为他的预测增添了分量。当他谈论成本时,他将其描述为解决当前经济手段无法触及的问题所必需的入场费。
超越代码:AGI 与延长人类寿命
为什么要花 1000 亿美元在一个计算机程序上?Amodei 的回答从软件转向了生物学。
关于 AGI 最引人注目的长尾论点并非关于自动化客户服务;而是关于 延长人类寿命。生物学是复杂、凌乱且数据密集的——这对于一个擅长大规模模式识别的系统来说是完美的。
其愿景是 AGI 系统可以以人类研究人员无法企及的速度模拟生物相互作用、蛋白质折叠和药物疗效。它有效地将数百年的医学研究压缩到几年之内。
这是应用于癌症、衰老和慢性病的“天才之国”。如果 Scaling Laws 成立,价值主张将从“更便宜的代码编写”转向“治愈死亡”。这极大地改变了投资回报率(ROI)的计算方式。即使文本生成的边际收益递减,生物建模领域 1% 的提升也可能带来数万亿美元的经济价值和人类福祉。
展望:推理、思考时间与未来

我们正进入一个阶段,在这个阶段,通过扩大模型规模进行的训练扩展,正得到推理扩展的补充。这就是“思考时间”的概念。
新一代系统不再是直接脱口而出答案,而是被设计为在开口前先“思考”,探索多条推理路径并进行自我修正。这符合社区对可靠性而非单纯速度的追求。
如果 Scaling Laws 适用于这一推理阶段,我们可能会看到模型不仅掌握更多事实,而且能对其进行更深层的思考。
矛盾依然存在。一方面,AGI 的宏伟轨迹承诺将重写经济和生物学规则;另一方面,则是工程师们在处理幻觉代码的残酷现实,并怀疑自己的工作五年后是否还会存在。
Dario Amodei 的赌注很明确:规模就是一切。而世界其他地方则在拭目以待,看数据中心里的那些“天才”是否真的能维持局面。
FAQ
1. Dario Amodei 关于 Scaling Laws 的核心观点是什么?
Amodei 认为,仅仅通过增加计算能力、数据和模型参数,就必然会实现通用人工智能 (AGI)。他相信我们尚未达到边际收益递减的阶段,且推动当前进展的相同公式将继续解锁推理和生物研究等高级能力。
2. “数据墙” (Data Wall) 概念如何威胁 AGI 的进展?
“数据墙”是指互联网上可用于训练 AI 的高质量、人类生成文本即将耗尽。如果模型没有新的人类数据可供学习,进展可能会停滞,除非开发者能成功利用合成数据(即由 AI 自身生成的内容)来训练下一代模型。
3. 围绕 AI 编程和“天才之国” (Country of Geniuses) 这一说法的争议是什么?
虽然 Amodei 设想了一个能够自动化处理复杂任务的“天才之国”,但许多开发者发现目前的模型在处理大型复杂代码库时仍然吃力。争议点在于:全自动化软件工程的炒作与现实之间存在差距,现实中 AI 经常会产生“幻觉”或引入需要人工干预的细微 Bug。
4. 为什么延长人类寿命被认为是 AGI 扩展的主要目标?
像 Amodei 这样的支持者相信训练 AGI 的高昂成本因其解码复杂生物系统的潜力而变得合理。通过将海量算力应用于生物学,AGI 可以加速药物研发和疾病治愈,在延长人类寿命方面的效率可能远高于人类研究人员的独立工作。
5. Scaling Laws 是提升 AI 的唯一路径吗,还是存在其他方法?
虽然 Amodei 专注于训练缩放(将模型做大),但行业也在探索“推理缩放”。这涉及允许模型在回答之前拥有更多“思考时间”来处理查询,从而在不一定增加训练数据集规模的情况下提高推理能力和准确性。



