top of page

美国 AI 基础设施战略正在扩张错误的层级

1小时前
讀畢需時 12 分鐘

尽管越来越多的观点认为,集中式数据中心只能解决问题的一部分,美国的 AI 基础设施战略仍已进入一场高成本的冲刺。华盛顿将更多芯片、电力和超大规模算力视为保持 AI 领先地位最明确的路径。这种做法能强化前沿研究,但也将智能集中在用户必须通过可靠网络才能访问的设施之中。

Washington Examiner 最近的一篇观点文章挑战了这种基础设施定义。文章认为,美国应当将前沿计算与部署在人、设备和组织数据附近的分布式系统结合起来。在这一模式下,云仍然不可或缺,但不再是运行实用 AI 的唯一场所。

这场分歧并非数据中心与设备之争,也不是美国与中国在又一个模型基准上的较量,而是集中式规模与运营分布之间的选择。美国正大力投资前一种路径,而其军队、制造商、医院和知识工作者则日益同时需要两者。

美国 AI 基础设施战略仍将规模等同于领导力

华盛顿已将 AI 基础设施变成一项以超大规模计算、能源生产和加快审批为核心的建设计划。

联邦政府的基础设施议程始于一个可以理解的前提:先进模型训练需要大规模专用处理器集群、高速网络、冷却设备和可靠电力。小型组织无法独立复现这些设施。

白宫在美国 AI 计划中明确阐述了这一前提。其基础设施计划呼吁发展国内半导体制造、新建数据中心、配套能源资源,并加快建设审批。

一项相关行政命令为符合条件的数据中心项目提供联邦支持。该命令将覆盖项目定义为:为 AI 训练、推理、模拟或合成数据生成新增负荷超过 100 兆瓦的设施。

这一门槛展现了华盛顿当前思维模式的规模:基础设施意味着用电需求可与大型工厂相当的工业园区。成功意味着在竞争国家扩张自身产能之前,让更多此类园区接入电网。

这一投资有充分理由。前沿实验室需要集中式算力来训练通用模型。云平台也让企业无需自购服务器或维护专用硬件,便可租用先进能力。

集中化还带来其他效率。运营商可以共享加速器、保持昂贵设备的高利用率,并在庞大设备群中协调模型更新。与数千台管理松散的设备相比,安全团队也能更一致地监控托管环境。

然而,这些优势并不意味着集中式产能就构成完整的国家架构。训练模型与在真实工作流中使用模型是不同的工程问题。前者奖励集中式算力,后者则往往取决于延迟、隐私、连接性和本地控制。

随着 AI 走出基于浏览器的聊天界面,这一区别愈发重要。集中式助手可以容忍短暂的网络延迟;而国防系统、工厂控制器、车辆、医疗设备或现场服务工具,可能需要在连接中断后继续工作。

当前的美国 AI 基础设施战略还假设,需求将持续回报最大的通用系统。这一判断仍然合理,但并非必然。更小的模型正变得足以胜任狭窄任务,特别是在组织提供可信的本地数据并限制所需输出时。

维护模型无需讨论哲学,也无需生成营销活动。它必须理解获批手册、识别相关部件、遵守权限,并在运营限制内作出响应。集中式前沿算力或许有助于创建这种模型,但完成后的服务并不总是适合部署在遥远的云端。

这正是基础设施争论背后的变化。美国不只是在选择建设多少数据中心,也在决定智能将在哪里运行、由谁控制,以及经济体系必须承受哪些故障。

电力扩建暴露了集中化的物理限制

集中式 AI 可以快速扩展软件,但其物理依赖扩张得更慢,并会给特定社区带来成本。

根据美国能源部的数据,美国数据中心在 2023 年消耗了约 176 太瓦时电力,约占全国用电量的 4.4%,高于 2018 年的 1.9%。

该部门的能源使用预测估计,到 2028 年,数据中心的耗电量可能介于 325 至 580 太瓦时之间,占全国用电量的比例可能达到 6.7% 至 12%。

这一宽泛区间本身就是一个重要警示。在尚不清楚究竟多少 AI 产能会转化为生产力之前,公用事业公司就必须规划发电厂、输电线路、变电站和用户电价。建设不足可能造成短缺,而过度建设则可能让用户为利用不足的资产买单。

国际能源署预计,到 2030 年,全球数据中心电力需求将达到约 945 太瓦时。其能源需求分析预计,美国和中国将贡献全球数据中心需求增长的近 80%。

全国层面的百分比可能掩盖本地负担。数据中心通常聚集在光纤资源充足、土地适宜、企业客户集中且已有云区域的地方。一个在整个美国电网上看似可控的项目,可能压垮某个公用事业辖区或输电走廊。

这些项目的节奏也并不匹配。AI 硬件和软件可以在数月内变化,而输电线路和大型发电项目则需要多年规划和建设。社区必须围绕由高度波动的技术市场塑造的需求预测,作出长期基础设施承诺。

这并不意味着美国应停止建设数据中心。训练能力、云服务、科学计算和共享企业工作负载都需要它们。暂停建设并不能保留任何与本地智能相关的战略利益。

更有力的结论是,并非每项工作负载都应默认交给远程超大规模设施。分布式 AI 基础设施可以减少重复的数据传输,在本地处理部分请求,并将集中式系统留给真正需要它们的任务。

这种架构类似分层网络。大型设施训练前沿模型并处理复杂请求;区域系统协调组织工作负载,本地设备则利用即时数据运行小型专用模型。

工作可根据敏感性、延迟、成本和可用连接性在这些层级之间流动。本地模型可以先回答常规问题,再在政策允许时将更困难的请求发送给更大的系统。

这种安排并不会消除电力消耗。边缘设备仍会耗能,低效的重复部署可能抵消部分收益。硬件生产同样会带来环境和供应链成本。

但分布式架构改变了所需产能的位置以及应用发生故障的方式。它可以降低对单一网络路径、供应商或设施的依赖,也让开发者能够让计算资源与任务相匹配,而不是将每项请求都视为前沿模型问题。

政治阻力使这种灵活性更具价值。社区已对电费、水资源使用、噪音、土地转换以及有限的长期就业岗位提出担忧。即便国家政策制定者认为这些项目具有战略紧迫性,这些担忧仍可能拖慢项目进展。

边缘 AI 战略无法替代公平电价、透明审批或负责任的水资源管理。但它确实降低了将每一座拟建超大规模园区都描述为未来所有 AI 应用不可或缺设施的压力。

美国需要大型数据中心。错误在于将其扩张视为衡量 AI 准备程度的完整标准。

分布式 AI 基础设施改变决策发生的位置

最有用的 AI 系统,往往是那个始终能在参与决策的工作人员、机器或数据旁可用的系统。

分布式 AI 基础设施将模型部署在设备、本地服务器、区域系统和云设施之中。边缘 AI 是指运行在靠近数据源的位置的部分,例如笔记本电脑、传感器、车辆、工厂计算机或组织的私有服务器。

Washington Examiner 发布的分布式 AI 论述以军事行动为例,具体说明了这种区别。在断连或受对抗环境下执行任务的部队,不能假定自己能够持续访问商业云。

飞行线上的飞机维修人员可能需要在通信受损时检索获批的技术文档。在排放限制下行动的舰载团队,可能无法将敏感的作战数据传输至远程服务。

灾区的医疗人员也面临类似约束。网络访问可能恰恰在快速支援最有价值时消失。本地推理,即在附近硬件上生成模型响应,使系统能够在可用数据和权限范围内继续运行。

民用组织也面临这些问题较不极端的版本。制造商不能在外部服务失去连接时暂停生产线。医院必须控制患者信息的流动,而律师事务所必须保护享有保密特权的材料。

知识工作者同样受益于本地控制。个人文档、会议记录和项目历史包含让助手发挥作用的上下文。持续将这些材料导出至多个云服务,会扩大隐私和治理问题。

个人知识库提供了本地数据机会的一个例子。当系统能够从用户自身工作环境中检索获批信息,而无需让每份文档都公开可访问时,它就会变得更相关。

这种架构也改变了专业化的经济逻辑。一个大型模型必须支持广泛的语言、推理、编程、图像和研究任务。较小的模型则可以专注于有限领域,使用受控词汇和已知数据源。

较小系统不会在每一项基准测试中超过前沿模型。但它并不需要这样做。只要能可靠、快速且在可预测的资源预算内完成被分配的工作流,它就是成功的。

这使分布式 AI 不只是云端 AI 的缩小版。本地模型可以利用设备状态、私密记录、传感器读数或组织专属规则,而远程通用模型无法安全地访问这些信息。

它们还可以限制离开设备的数据。本地系统可以先对敏感材料进行分类或摘要,再向云端发送精简后的请求。另一种部署方式则可能完全禁止传输,并接受通用能力较低的代价。

美国经济体系很适合这种多样性。初创企业可以构建专用模型,硬件供应商可以针对不同设备进行优化,企业则可以围绕自身的实际风险选择部署模式。

集中式平台仍可提供共同基础。它们能够训练模型、分发更新、支持复杂查询并协调设备集群。云端将成为支撑层,而非每一次决策都必须经过的路径。

这种平衡具有战略意义。一个仅围绕少数超大规模运营商构建的国家架构,会在技术和商业层面形成集中化。开发者将依赖供应商接口、使用政策、服务可用性以及不断变化的合同条款。

分布式架构创造了更多退出路径。组织可以独立运行部分工作负载、在供应商之间迁移,或在服务中断期间维持关键功能。若自动更新会扰乱受监管流程,它们也可以保留经验证的旧版模型。

这些优势说明,核心对立面并非云计算本身,而是因为模型开发起步于云端,就认定智能必须继续保持集中化的假设。

边缘 AI 战略也会带来安全与管理成本

将 AI 更贴近用户可提升韧性与隐私,但也分散了保护、更新和评估模型的责任。

如果忽视运营现实,边缘 AI 的论述可能显得过于理想化。超大规模云服务商拥有专门团队来修补系统、检测攻击、管理加密以及更换故障硬件。许多小型组织无法匹敌这种能力。

分发模型会形成规模更大、配置不一的设备集群。一些设备会错过更新、保留存在漏洞的软件,或在超出预期服役年限后继续运行。物理访问会给攻击者带来机会,而严格管控的数据中心可以限制这类机会。

本地数据并不会自动成为安全数据。运行在同一设备上的恶意软件可能检查模型输入、检索到的文档或生成的输出。即便数据从未离开建筑物,糟糕的权限设计仍可能暴露敏感记录。

模型治理也会变得更加困难。组织需要知道哪个版本的模型做出了某项决策、它访问了哪些来源,以及当时适用了哪些政策。在数千台偶尔联网的设备上维护这些记录并不容易。

专用模型还会带来另一项权衡。狭窄的范围能提升效率,但也可能掩盖模型在熟悉条件之外的性能失效。一个针对常见故障训练的维护助手,在异常损坏产生陌生传感器读数时,可能表现不佳。

因此,测试必须反映每一种部署环境。仅凭基准测试分数,无法证明一个系统是否适用于诊所、飞机、工厂或应急行动。运营方需要针对任务的评估、后备程序和明确边界。

互操作性构成另一项障碍。分布式 AI 网络需要通用方式来打包模型、验证更新、执行权限,以及在本地与云端系统之间转移工作。专有格式可能让去中心化变成另一种形式的锁定。

硬件限制依然真实存在。内存决定模型能够在本地运行到多大,而电池容量和发热会限制移动设备的持续使用。压缩可以缩小模型,但激进压缩有时会降低准确性或移除有用能力。

云端也依然更适合不规律的需求。为偶发的峰值工作负载购买本地硬件可能浪费资本。共享基础设施可将成本分摊给多个客户,并在无需每个组织预测最大需求的情况下提供容量。

这些限制削弱了任何“分布式 AI 应取代超大规模计算”的主张,但并未削弱混合架构的理由。相反,它们界定了让分布式架构具备可信度所需的标准和投资。

政府政策可以支持通用评估方法、安全更新系统、模型溯源以及可互操作的部署格式。采购可奖励那些能在连接质量下降时正常运行的系统,而不要求每项工作负载都必须离线运行。

组织应在选择基础设施之前对工作负载进行分类。前沿研究任务适合大型计算集群。敏感、重复且时间紧迫的任务可能适合本地系统,并可在复杂情况下升级至云端。

安全性比较还必须考虑集中式故障。一次云服务中断可能同时影响数千名客户。遭入侵的供应商账户或软件依赖关系,可能通过一条共同路径暴露许多组织。

集中化能让防御更加专业,但也可能放大一次成功故障的影响。分布式架构会产生更多端点,但能够遏制部分中断。两种结构都不会自动胜出。

正确的问题是,每种应用能够容忍哪一种故障模式。消费者写作工具或许可以接受暂时中断;战场、医疗、工业或基础设施系统则需要更具韧性的答案。

在采购机构和企业买家开始提出这个问题、而非默认选择云端之前,美国的 AI 基础设施战略仍将不完整。

三个信号将显示美国是否改变方向

AI 竞赛的下一阶段将以已部署的能力衡量,而不只是以采购的芯片数量或接入的兆瓦容量衡量。

第一个信号是联邦采购能够在不可靠连接条件下运行的系统。国防和应急响应合同可以将“边缘优先”的表述转化为可执行的技术要求。

买家应关注明确规定的离线功能、有文档记录的同步行为、本地权限控制以及经过测试的恢复程序。仅提及边缘部署、却没有可衡量要求的合同,不会改变整体架构。

一波经过验证的部署将强化分布式 AI 的论点。如果关键环境仍持续采购依赖云端的应用,则表明实际障碍依然大于倡导者所承认的程度。

第二个信号是受限硬件上的模型性能。较小模型需要在内存、能源、延迟和准确性等固定限制内完成有用任务。相比通用基准测试上的改进,真实工作流中的稳定表现更重要。

开发者应关注组织是否将狭窄的生产任务迁移到笔记本电脑、工作站、车辆和私有服务器上。部署数量、留存率和升级率将提供比演示视频更有力的证据。

如果本地模型能够处理日常工作,只将困难案例发送到云端,混合模式就证明了自身的经济价值。如果用户一再绕过它们而选择更大的远程系统,超大规模容量将继续保持当前主导地位。

第三个信号是基础设施政策是否超越更快建设数据中心的范畴。电网升级和新增发电能力仍有必要,但国家战略还应解决互操作性、安全模型分发和本地部署问题。

白宫当前的做法将大型设施及其电力供应定义为战略基础设施。更广泛的计划则会将韧性软件、可信硬件和分布式推理也视为基础设施。

国际发展将进一步凸显这项检验。中国能够通过集中式机构调动资本、能源、产业政策和数据中心建设。仅在集中式规模上竞争,会迫使美国进入一场奖励这些制度优势的较量。

美国的优势同样体现在其他方面。它拥有竞争性市场、多元化的硬件公司、强大的研究机构、企业软件专长,以及愿意采用专用工具的客户。分布式 AI 基础设施让这些参与者拥有更多贡献空间。

美国仍应训练前沿模型,并建设其所需的设施。科学研究、国家安全和商业竞争都依赖这种能力。放弃集中式计算将意味着放弃既有优势。

然而,只建设最大的系统,会将必要投入与最终目标混为一谈。目标不是积累最多的服务器,而是让可靠智能在美国机构需要采取行动的任何地方都可获得。

这一结果需要有意识地部署工作负载。敏感信息在可行时应留在本地。时间关键型功能应能在网络失效时继续运行。复杂任务则应在其额外能力足以证明依赖性合理时,接入集中式模型。

因此,美国的 AI 基础设施战略需要两条协调推进的路径。一条扩展前沿计算及为其提供支撑的能源系统。另一条则将更小、受治理的系统分布到整个经济体中。

对于开发者和企业买家而言,眼下的行动很简单:检查每一项 AI 工作负载会在哪里失效。测试连接消失、供应商改变条款、敏感数据无法离开本地,或延迟变得不可接受时会发生什么。

这些答案将揭示,另一份云服务合同究竟能解决问题,还是只会推迟问题。美国已经在基础设施上全速冲刺。问题在于,它的智能是否能抵达决策真正发生的地方。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page