AI 扩展限制正遭遇瓶颈:为什么更多 GPU 无法解决 AGI
- Aisha Washington

- 6月6日
- 讀畢需時 7 分鐘
已更新:6月17日

关于 Artificial Intelligence 的叙述一直被一种单一的信念所主导:只要我们不断增加更多的算力和数据,神一般的超人工智能就不可避免。多年来,Silicon Valley 一直基于这一假设运作。然而,随着我们接近这个十年的中期,数学逻辑开始失效。我们正看到明确的迹象表明,AI scaling limits并非遥远未来的理论障碍,而是我们现在正面临的具体壁垒。
从开发者社区的挫败感,到 Tim Dettmers 等专家的高层级硬件分析,共识正在发生转变。指数级“免费”增长的时代即将结束。要理解其中的原因,需要透过营销手册,审视当前技术的物理和实际现实。
现实世界的用户体验:当下如何应对 AI Scaling Limits

在剖析硬件物理特性之前,我们必须先看看这些局限性是如何体现在那些实际付费并使用这些工具的人身上的。行业曾承诺大语言模型 (LLMs) 将演变成具备复杂推理能力的自主智能体。而实际情况却并非如此。
应对 AI 扩展限制可靠性时的实用解决方案
试图将 AI 整合进工作流的专业人士正面临瓶颈。主要问题不在于模型“愚笨”,而在于它们缺乏与事实的根本联系。这是以下现象的直接症状:AI 扩展限制——增加更多参数并没有解决幻觉问题;这往往只会让模型对自己的错误更加自信。
开发者体验:软件工程师报告称,AI 编程助手经常虚构不存在的库。这让原本节省时间的工具变成了调试噩梦。当模型幻觉出一个依赖项时,开发者花在追踪幻影方案上的时间,甚至比从头开始编写代码还要多。
“搜索”谬论:尝试将 LLM 作为搜索引擎使用的用户发现,准确率低到无法接受。报告显示,对于事实性查询,幻觉率可能在 30% 到 50% 之间波动,具体取决于模型。
给当前用户的实用建议:如果你现在正在部署这些工具,必须将它们视为随机文本生成器,而非逻辑引擎。
核实一切:切勿在没有人工核实的情况下直接复制粘贴代码或引用。仅靠“信任但核实”的方法是不够的;在证明其正确之前,请假设输出是有缺陷的。
缩小范围:将 LLMs 用于转换任务(重写、总结、格式化),而不是信息检索或逻辑发明。这些模型擅长操纵语言,但在将语言与现实挂钩方面表现不佳。
摒弃拟人化:停止将 AI 视为一个“人”。它是一个工具。期望它能“理解”或“推理”会导致糟糕的提示词设计和失望。
为什么企业级 Agent 在 AI 扩展极限面前会失败
企业界目前正痴迷于“AI Agents”——旨在自主执行多步骤工作的软件。然而,早期采用者的反馈表明,这在很大程度上只是虚假宣传。员工被迫参加数小时关于如何管理这些 Agent 的培训,结果却发现这些工具需要极其精确、工程级别的指令,以至于非技术人员根本无法使用。
这种“代理能力”的失败是 AI 扩展极限 的副产品。我们并没有破解推理的密码;我们只是构建了更好的自动补全。当一项任务需要十个连续步骤,而模型每步有 5% 的错误率时,智能体在整体任务上失败的概率在统计学上是必然的。那些投资于用这些工具取代白领员工(会计师、中层管理人员)的公司很可能是在挥霍金钱。技术水平根本还没达到,而且扩展现有架构也无法实现这一目标。
AI 扩展极限背后的硬件现实

用户的怀疑态度得到了来自硬件领域的硬数据的支持。“越大越好”的信念依赖于摩尔定律和高效扩展定律保持不变。根据 Allen Institute for AI 研究员、CMU 教授 Tim Dettmers 的说法,那样的日子已经不多了。
数据证明 AI 扩展极限是物理性的
Dettmers 预测,当前的扩展范式——即仅通过做大模型来使其更智能——大约还剩一到两年的寿命。我们正接近一个临界点,即AI 扩展限制是由芯片本身的物理约束所决定的。
硬件效率的峰值实际上出现在 2018 年。从那时起,制造商并没有获得更“聪明”的性能提升;他们一直在通过降低精度来“欺骗”系统。
Nvidia Ampere:使用了 BF16(16 位)精度。
Nvidia Hopper: 转向了 FP8(8位)精度。
Nvidia Blackwell: 正在推行 FP4(4位)精度。
量化技术已经快触及天花板了。你不可能在不破坏模型学习能力的情况下无限降低数据精度。一旦我们触及 FP4 的底线,就再也找不到“简单”的性能倍增方法了。硬件行业正耗尽所有技巧,来掩盖摩尔定律放缓的事实。
能耗与性能增益
关于 AI 缩放限制 最不利的证据就是能源成本。 我们目前正处于收益递减阶段,这使得 AGI(通用人工智能)的经济前景看起来非常糟糕。
比较最近几代的 GPU:
Ampere 到 Hopper: 性能提升了 3 倍,但功耗上升了 1.7 倍。
Hopper 到 Blackwell: 性能提升了 2.5 倍,但功耗又上升了 1.7 倍,且芯片面积翻了一倍。
我们正看到一种趋势:能力的线性增长需要能源和成本的指数级增长。Dettmers 指出,机架级优化(如 Nvidia 的 GB200 NVL72,它连接了 72 个 GPU)提供了暂时的提升。然而,这是一种一次性的架构转变。到 2026 年或 2027 年,一旦这些集群级效率达到极限,我们将撞上一堵硬墙。电力物理学和热传递将使进一步的扩展在经济上变得不合理。
AGI 炒作的经济脱节

硅谷依赖叙事运作,而当前的叙事是 AGI 迫在眉睫。这种信念驱动了数十亿美元的投资。然而,这种幻想与上述 AI 扩展限制 之间的脱节正在扩大。
面对 AI 扩展极限时的成本效益比
业界正陷入一种“扩展定律(scaling law)”的教条,认为只要给模型喂足够的数据和算力,意识或超人工智能就会出现。这忽略了 LLMs 是概率系统这一事实。它们预测的是下一个 token;它们并不理解宇宙的本质。
训练这些模型的成本正在飙升,但其效用并没有以同样的速度增长。我们正在见证一个典型的经济泡沫,即基础设施投资(数百亿美元的 GPU)远超软件的营收能力。如果一个模型的训练成本高达 10 亿美元,但仅能提供比前一版本略好一点的搜索体验,那么这种商业模式就会崩溃。
科技界的许多声音现在认为,通过 LLMs 追求 AGI 是一个财务陷阱。它将科幻目标置于创建功能性、盈利性产品之上。认为 AI 将在法律或医学等复杂领域简单地“取代”人类的预期忽略了可靠性差距。你无法用一个有 30% 概率产生幻觉的系统来自动化高风险职业,无论它的运行速度有多快。
超越幻想的务实未来

承认 AI 扩展极限 并不意味着 AI 毫无用处。这意味着“幻想”阶段已经结束,“效用”阶段必须开始。未来最成功的路径可能来自于那些忽视 AGI 竞赛,而专注于具体的、可验证的应用的人。
将战略从 AI 缩放定律转向
对神一般数字智能的痴迷是硅谷特有的现象。其他地区,特别是中国,正在采取更务实的策略。他们不再追求模糊的 AGI,而是将现有的 AI 能力整合到工业流程、供应链和消费工具中,在这些领域,80% 的准确率是可以接受的,或者已经内置了人工监督。
前沿在于物理世界:为了突破当前的局限,AI 需要理解物理世界,而不仅仅是互联网上的数字文本。
数据稀缺:我们已经抓取了整个互联网。为了变得更“聪明”,模型需要在线上并不存在的数据——即物理世界的交互数据。
机器人技术:下一个突破不会是更大的聊天机器人,而是在机器人技术领域。收集关于物体如何移动、重量以及如何交互的数据既昂贵又缓慢,但这是让 AI 立足于现实的唯一途径。
Dettmers 认为AGI 需要一个智能体去执行一切 人类能做的事情。 这包括系鞋带和修理水槽。文本预测无法教会机器物理学。未来属于那些不再试图通过扩大规模来创造奇迹,而是开始通过工程手段实现实用性的公司。
AI 扩展限制 是真实存在的。 硬件数据证实了这一点,用户体验也验证了这一点。那些接受这一现实并转向专业化、可靠工具的公司将在即将到来的调整中生存下来。而那些仍在等待 GPU 仙女带来超人工智能的公司,最终将只剩下一堆昂贵且不断贬值的硅片。
常见问题解答
问:AI 扩展限制究竟是什么?
答:AI 扩展极限是指向模型添加更多算力及数据时,其智能水平不再产生比例提升的临界点。当前研究表明,由于硬件效率的边际收益递减以及高质量训练数据的枯竭,我们正面临这一瓶颈。
问:为什么 Tim Dettmers 认为 AI 的进展将在 2027 年停滞?
答:Dettmers 认为硬件效率的提升已经停止,目前的性能提升主要源于牺牲精度(在计算中使用更少的比特位)。他预测到 2027 年,物理限制和机架级优化的终结将使进一步的扩展在经济和物理上都变得不可能。
问:我们能通过扩大模型规模来解决 AI 幻觉问题吗?
答:不能,单纯扩大模型规模并不能修复幻觉。幻觉是 LLMs 概率特性的产物,而非规模不足导致的缺陷。更大的模型往往只是在陈述错误信息时显得更加口齿伶俐。
问:目前对 AI 硬件的投资是可持续的吗?
答:可能不是。GPU 的能耗和成本呈指数级增长,而性能提升却趋于线性。除非 AI 模型能产生与这些巨额基础设施成本相匹配的收入,否则当前的投资水平就是一个经济泡沫。
问:AGI 与当前的 AI 有什么区别?
答:目前的 AI(如 ChatGPT)是弱智能,专注于根据训练数据预测文本或识别模式。AGI(通用人工智能)意味着一个可以执行人类能完成的任何智力任务的系统,包括在全新情境下进行推理以及与物理世界互动——这些都是目前 LLM 尚不具备的能力。


