top of page

AI 2027 在其超级智能预测遭遇现实后滑向 2028-2032 年

尽管 Google News 再度关注似乎表明其超级智能情景总体仍在按计划推进,AI 2027 正面临一场决定性的时间线考验。原始情景将超人类编程能力设定在 2027 年,并将人工超级智能设定在 2027 年末或 2028 年初。更新后的建模和已观察到的瓶颈,如今比那条戏剧化的原始路径更能支持一个更宽泛的 2028-2032 年窗口。

这一变化并不意味着 AI 2027 已失去意义。它改变的是读者应当从中得出的结论。该情景愈发像是一张依赖关系图,而非一份可靠的事件日历。

核心冲突在于快速的软件进步,与其周边较慢的系统之间。更强的编程代理确实存在,但研究实验、可靠评估、数据中心建设、电力输送以及组织采纳,仍遵循人类与物理世界的时间尺度。这些约束决定了高能力代理会否引发失控式改进,还是仅仅成为更好的工具。

结果比 Google News 的标题所暗示的更为复杂。AI 能力正在进步,但自主系统能够管理完整研究项目的证据仍然有限。从 2027 年推迟至 2028-2032 年,将保留该情景的核心机制,同时否定其最为压缩的假设。

AI 2027 时间线究竟发生了什么变化

重要进展并非某个已获确认的超级智能日期,而是情景叙事日历与其底层预测之间不断扩大的差距。

AI Futures Project 于 2025 年 4 月发布 AI 2027,将其定位为一份详尽情景,而非传统预测。其虚构的领先实验室 OpenBrain 部署能力日益增强的代理来自动化 AI 研究。这种内部自动化又加速了更强系统的开发。

竞速版本包含四个主要里程碑。一名超人类程序员将在 2027 年 3 月出现,随后是 8 月出现的超人类 AI 研究员。能力远胜于前者的 AI 研究员将在 11 月出现,人工超级智能则在 12 月到来。

该项目将人工超级智能定义为:在所有认知任务上表现远胜于最优秀人类的系统。这远比通过基准测试、编写生产代码或在无人协助下操作浏览器更强。

即便该项目的支持性研究,也呈现出比其叙事更不精确的图景。其起飞预测显示,在以 2027 年 3 月出现超人类程序员为条件时,人工超级智能到来的中位时间为 2028 年 4 月。其不确定性区间从 2027 年 6 月延伸至 2100 年以后。

同一预测将 2027 年 11 月列为超级智能 AI 研究员出现的中位时间,但其给出的区间从 2027 年 5 月延续至 2034 年。这些范围并非无关紧要的限定条件。它们表明,那些令人印象深刻的日期依赖于高度不确定的判断。

该项目还在 2025 年 12 月加入了一项免责声明。其中称,起飞预测在很大程度上依赖直觉判断,因为现有证据无法支持确定性的外推。这一承认比某个里程碑前后移动数月更为重要。

其时间线模型也发生了变化。更新后的时间跨度方法将一项超人类程序员中位时间估计从 2027 年 8 月推至 2029 年 2 月。另一项基准与差距模型则从 2028 年 12 月推至 2030 年 3 月。

这些修订并未形成一项官方的 2028-2032 年预测。不过,它们确实使这一范围成为对该项目更新后程序员估计,以及其预期从编程自动化过渡到更广泛超级智能过程的合理综合。

这一差别至关重要。没有任何公开基准验证过一个超级智能倒计时。真正改变的是围绕该情景第一个关键里程碑的证据平衡。

原始故事将 2027 年的超人类程序员视为点火时刻。后续研究对缺失能力、可靠性要求和整合障碍赋予了更大权重。若点火时刻推迟至 2029 年或 2030 年,一年起飞模型自然会将后续里程碑推向 2030 年代初。

Google News 的报道可能让这种变化看起来只是一次简单延期。更恰当的理解是:它标志着从叙事精确性转向预测不确定性。

为什么 AI 代理仍让该情景保持活力

AI 2027 尚未被证伪,因为推动它的能力趋势依然可见,尤其是在软件任务领域。

该情景很大程度上建立在 AI 时间跨度的概念之上。这一指标估算代理能以特定成功率完成的任务时长,按专家人类完成该任务所需时间衡量。

独立模型评估机构 METR 在一组软件任务中计算 50% 和 80% 的时间跨度。其研究发现,数年来前沿代理能够完成的任务时长大约每七个月翻一倍。

这一趋势使最初的超人类程序员预测显得可信。如果代理持续以稳定速度处理更长的任务,它们最终将从协助完成零散工作,跨越到完成实质性的工程项目。

近期评估强化了狭义的能力论据。METR 报告称,在 2026 年初评估的领先公开代理,在其更新后的任务集中,测得的时间跨度已超过两个全职等效工作日。一些系统能够处理早期的软件重实现任务,而这些任务由人类完成需要更长时间。

这些结果代表了有意义的进步。它们表明前沿系统正超越孤立功能和简短的调试练习,能够维持更长的推理、工具使用和代码修改链条。

然而,时间跨度并不是通向自主研究的倒计时。METR 自己的局限性说明警告称,测得的时间跨度并不等于 AI 能够独立工作的时间。它代表的是在既定评估设置下可替代的串行人类劳动。

50% 的成功率对于许多研究和生产环境而言也仍然不足。一次失败的实验可能浪费昂贵的算力。一个细微的软件错误可能会在未立即显现的情况下污染后续结果。

该指标可以提高,而可靠自动化的进展可能更慢。更长的任务会产生更复杂的失败,而诊断这些失败可能需要更多人力。随着代理跨越更大的代码库和更长的工作流程运作,验证也会变得更困难。

AI 2027 假设实验室能够运行许多高级编程代理的副本。并行化将使这些代理可以提出实验、修改训练系统、分析结果,并开发它们的后继者。这一反馈循环正是该情景的引擎。

当前证据支持这一机制的部分内容。编程系统已经能够生成测试、检查代码仓库、修复缺陷并协调工具。它们也日益帮助研究人员实现原本会占用工程时间的想法。

然而,研究机构做的不只是编写代码。它需要选择有价值的问题、识别误导性结果、平衡相互竞争的目标、管理保密基础设施,并决定证据何时足以指导下一轮训练。

这种差异类似于优秀程序员与高效研究实验室之间的差距。自动化前者,并不会自动复制后者。

这正是 2030 年代初的日期仍可与快速能力增长相容的原因。更长的准备期让实验室有时间提高可靠性、构建代理管理系统、扩展算力,并重新设计研究工作流程。

因此,更新后的时间窗口不一定意味着看空 AI。它可以描述同一快速机制通过更多运营步骤展开的过程。

Google News 的说法遭遇物理算力约束

软件可以快速改进,但训练和运行前沿系统所需的基础设施无法以软件的速度复制。

AI 2027 的算力模型极为激进,甚至早于其关于自动化研究的假设开始发挥作用。它预测,从 2025 年 3 月到 2027 年 12 月,与 AI 相关的全球算力存量将增长十倍。

该预测以 H100 等效单位衡量容量,这是基于 Nvidia H100 加速器的标准化单位。它估计,在此期间容量将从 1,000 万 H100 等效单位增至 1 亿。

领先 AI 公司将获得这部分供应中不断增长的份额。AI 2027 预测,该公司的可用容量将从 2024 年末约 50 万 H100 等效单位升至 2027 年 12 月的 2,000 万。

算力预测还预计,到 2027 年末,全球 AI 电力需求将达到 60 吉瓦。其中,美国占 50 吉瓦,领先实验室占 10 吉瓦。

这些是情景输入,而非已测量结果。作者明确表示,公开信息稀缺且不确定。他们还指出,后续章节在很大程度上依赖于情景所假定的能力进展。

电力已开始成为具有约束力的瓶颈。新增发电能力、输电线路、变电站、变压器、冷却系统和数据机房都需要许可和建设。这些工作遵循区域规划流程,软件改进无法以同样速度压缩这些流程。

Gartner 此前估计,到 2027 年,电力短缺将限制 40% 的 AI 数据中心。其电力预测将电力可用性描述为新设施面临的严重限制。

RAND 探讨了一条同样要求严苛的轨迹。其分析估计,如果芯片供应继续指数级增长,到 2027 年 AI 数据中心将在全球范围内需要 68 吉瓦电力。这一总量接近 2022 年记录的全球数据中心电力需求的两倍。

这些估计大体印证了 AI 2027 对算力集中化的担忧。但它们并不能证实更多算力将在固定时间表内产生超人类研究员的说法。

硬件可得性和算法效率是独立变量。实验室可以拥有大量加速器,却未必知道如何训练出一个整体上更优越的研究系统。反过来,一项算法突破也可能减少实现某一能力所需的硬件。

该情景假定两个维度均取得进展。芯片产量扩大,同时自动化研究员发现效率改进。两者结合,使领先公司能够以加速速度运行庞大的 AI 工作者群体。

这一机制带来了融资与部署问题。该组织必须在训练、推理、合成数据、客户产品和内部实验之间分配容量。每一块用于投机性研究循环的加速器,都无法用于创造收入的工作负载。

AI 2027 预测,只有领先公司容量的 5% 至 10% 将直接运行 AI 代理。它将 20% 分配给合成数据,35% 分配给研究实验。这样的资源配置将意味着对内部自动化的一项重大战略投入。

没有任何保证商业实验室会做出这种选择。客户需求、竞争压力、安全测试和投资者预期都会影响算力分配。

这正是 Google News 的叙事过于简单的地方。追踪数据中心建设并不能揭示实验室是否正在接近智能爆炸。它只能表明,公司预期 AI 需求和能力发展将足以支撑巨额基础设施投入。

这轮建设抬高了未来系统的能力上限,但并不能说明实验室何时会找到达到该上限所需的算法、评估方法或可靠智能体。

真正的较量是自动化与研究摩擦之间的对抗

这个故事中的主要对手并非一家 AI 公司与另一家 AI 公司,而是自动化软件进步与顽固的现实世界研究摩擦之间的对抗。

AI 2027 的起飞预测探讨的是:超人类编程能力将以多快速度催生超人类 AI 研究能力。两者听起来差别不大,却包含了该预测中很大一部分不确定性。

编程人员可以实现一项明确指定的改动。研究人员则必须判断哪项改动值得实施。这需要针对不完整证据作出判断、具备科学品味,并理解先前实验之间的关联。

该情景假设,在有利条件下,超人类编程能力可将软件工作加速约 100 倍。但作者并不认为整个研究过程会因此快 100 倍。

实验仍需运行。团队必须讨论结果、比较假设、诊断意外行为,并选择下一项干预措施。算力排队和硬件故障还会带来更多延误。

这体现了阿姆达尔定律:当流程中只有一部分变快时,整体加速程度会受到限制。随着编程在研究周期中所占比例不断缩小,继续提升编程速度最终会带来递减回报。

AI 2027 认为,后续智能体将自动化更多研究环节。超人类 AI 研究人员将设计实验并解读结果,从而消除仅具备编程能力的智能体所面临的瓶颈。

而这种转变恰恰尚未得到证明。公开评测高度聚焦软件任务,因为这类任务更容易定义、重复和评分。开放式的科学判断则要难得多。

曾为原始项目提供预测工作的 FutureSearch 强调了这一差距。其预测批评指出,现实世界的实验可能需要数周、数月甚至数年。组织背景和复杂权衡也可能进一步拖慢自动化进程。

FutureSearch 还质疑,商业激励是否会支持该情景中的资源分配。前沿实验室往往在长期研究之外,同时追求产品、客户采用和营收。内部递归式改进会与这些目标竞争资源。

分歧并不在于进步还是停滞。双方都承认,编程智能体将持续进步,实验室也会更广泛地部署它们。

他们的分歧在于转化效率。AI 2027 将巨大的研究速度提升归因于能力不断增强的智能体;其批评者则认为,实验、背景信息、管理和可靠性会消耗其中更多收益。

2028-2032 年这一时间窗口在不放弃自动化前景的同时,隐含地赋予了“摩擦”因素更大权重。在这段时期内,编程智能体可能显著提升。实验室也可能将其整合到开发、评估和运营的各个环节。

实际影响会早于人工超级智能出现。软件团队会将更大的项目委托给智能体。AI 实验室将让每位研究人员完成更多实验。产品周期将缩短,同时对评估和监督的需求将上升。

知识工作者也将面临新的信息问题。更多由智能体生成的研究意味着更多报告、实验日志、代码改动和相互冲突的结论。团队将需要一个可靠的可搜索知识库,以保留背景信息并审计决策。

这一看似平常的组织需求非常重要。无法获取正确内部历史的 AI 智能体,可能会重复失败的实验,或针对过时假设进行优化。上下文管理将成为研究绩效的一部分。

因此,对 2030 年代初的解读建立在一条合理的演进路径上:智能体先自动化边界明确的编程工作,随后参与更长期的项目,最后在监督下处理更广泛的研究决策。

每一次转变都需要的不只是更高的基准测试分数,还需要信任、整合、安全性,以及能够发现错误的证据。

2028-2032 年预测仍无法证明什么

推迟日期并不能解决模型的核心不确定性,因为其起飞速度仍取决于一个尚无人实现的里程碑。

2028-2032 年这一范围听起来可能比 2027 年末更可信,因为它为进展预留了更多时间。但更宽、更晚的窗口仍不是直接证据。

预测往往会在错过里程碑后通过推迟日期来保留其核心主张。这种灵活性可能使理论难以被证伪。因此,读者应通过可观察的中间预测来评判 AI 2027。

第一项是前沿实验室内部工作所需的可靠超人类编程能力。这不仅要求完成基准任务,还要求系统能够处理陌生代码库、模糊目标、安全限制和不断变化的需求。

它还必须在速度上优于最优秀的工程师,并且成本低到足以同时运行大量副本。这些经济性和可靠性条件也是该项目定义的一部分。

第二项预测涉及研究加速。实验室应报告或展示,智能体的使用能够可量化地缩短从假设提出到结果验证的周期。仅仅生成更多代码并不符合这一标准。

第三项涉及递归收益。AI 辅助研究必须产出更好的 AI 系统,而这些系统又会进一步改进研究过程。普通的生产率提升并不能证明智能爆炸。

衡量还面临另一项困难。前沿实验室可能会将其最好的内部系统保持私密。公开模型可能落后于内部能力,而安全和安保顾虑也可能限制披露。

相反的风险同样存在。公司有动机将智能体描述得比实际更自主。精心挑选的演示可能掩盖人工准备、反复重试、狭窄的任务设计或大量验证工作。

随着开发者针对公开基准进行优化,它们的信息价值可能下降。成功可能反映的是对评估模式的熟悉程度,而非开展研究的通用能力。

METR 的谨慎态度在这里尤其相关。其研究人员强调,时间跨度翻倍并不意味着具有经济价值的自动化工作量也翻倍。不同任务对可靠性和验证的要求各不相同。

更广泛的专家群体对 2028 年的共识也远未形成。一项针对 2,778 名 AI 研究人员的调查显示,无辅助机器在 2027 年前于所有任务上超越人类的概率为 10%。其达到 50% 概率的中位日期是 2047 年。

这项专家调查并不能推翻 AI 2027。预测汇总可能错过快速变化,许多受访者也可能缺乏专门的预测经验。但这一结果表明,该情景只是更宽泛概率分布中的一个激进区域。

定义也造成了额外混淆。通用人工智能、高级机器智能、超人类编程能力和人工超级智能描述的是不同门槛。一个系统可以在许多具有经济价值的任务上超越人类,而无需在每一种认知活动上都更胜一筹。

新闻标题经常将这些区别压缩为一谈。这让故事更容易传播,却更难评估。声称 AI 2027 进展顺利,可能指的是编程智能体的进步、基础设施投入,或模型基准表现的提升。

这些观察没有任何一项能独立证实完整的演进序列。它们只是支持该情景中的部分前提。

因此,怀疑论的结论是明确的:证据支持 AI 软件能力持续快速提升,但尚不足以支持人工超级智能将在 2028-2032 年出现这一具体日期判断。

将决定 AI 2027 是否按轨迹推进的三个信号

下一次判断应取决于自主工作、研究加速和基础设施使用方面可衡量的变化,而不是又一次戏剧化的日历主张。

第一个信号是可靠智能体时间跨度的经验证跃升。评估者应证明,前沿系统能够在多样化、抗污染的任务中完成持续数天的软件项目。

可靠性与持续时间同等重要。接近生产要求的结果将加强“超人类编程能力”的论据。若更长的时间跨度伴随着频繁的隐性失败,则会削弱这一论据。

独立复现至关重要。实验室演示无法替代外部测试,因为评估者需要了解失败率、人工干预、推理预算和重试策略。

第二个信号是端到端 AI 研究自动化的证据。前沿实验室需要展示,智能体能够提出假设、实施实验、解读结果,并选择富有成效的后续工作。

最有力的证据将是每位人类研究人员所带来的算法进步出现可衡量的增长。一个主要通过智能体主导研究开发出的新模型,将实质性加强 AI 2027 的机制论证。

大量生成实验的说服力则较弱。真正相关的问题是,智能体是否能识别出更好的研究方向,而不是它们是否消耗了更多算力。

关注实验室如何描述内部部署。如果人类仍定义每一项任务,并验证每一个具有重要后果的决策,那么关于数千个编程智能体的说法就值得审视。

第三个信号是公司如何分配新增算力。AI 2027 预计,领先实验室会将大量算力集中用于合成数据、内部智能体和由 AI 主导的研究实验。

仅有公开的数据中心扩张还不够。如果公司明确将算力从客户推理转向内部研究自动化,这一预测将更具说服力。

如果大部分新硬件服务于传统云需求、消费级产品和渐进式模型训练,那么预测就会被削弱。这些用途可以维持 AI 热潮,却未必会产生递归式自我改进。

电力供应也构成实际边界。即便算法持续进步,电网接入或加速器部署的延迟也会将该情景推迟。更快的效率提升则可能减轻这一压力。

关注 Google News 的读者应将 2028-2032 年视为观察窗口,而不是约定日期。这一时间范围结合了更新后的里程碑估计和不确定的起飞模型,尚未得到独立验证。

有用的问题不再是 AI 2027 中的每个场景是否都会如期到来,而是自主编程能否在物理、经济和组织约束消耗收益之前,转化为自主研究。

在未来几个月追踪这三个信号:经过独立测试的多日智能体、已有记录的研究加速,以及用于递归改进的算力。如果三者同步发展,2030 年代初的论据将得到加强。如果只有基准测试和数据中心投入上升,那么这场著名的起飞仍将是一个引人入胜的情景,而非已被观察到的发展轨迹。

 
 

免费开始

一款本地优先的AI助手,具备个人知识管理功能

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

在你的大脑里添加一个搜索栏

Ask remio

记住一切

​无需整理

bottom of page