OpenAI 的《永恒互补》称,执行力才是 AI 真正的经济考验
OpenAI 于 10 月 1 日发布了《The eternal complement》,认为先进 AI 的决定性贡献或许出现在一个重要想法诞生之后。这篇文章将关注点从机器生成的发现,转向把发现变为可运行系统所需的日常执行工作。
这种区分提出了一个更尖锐的经济问题。更强的推理能力本身无法造出药物、工厂、电网或科学仪器。进步还需要验证、协调、文档记录、融资、建设、维护,以及无数鲜少受到公众关注的决策。
因此,OpenAI 的论点挑战了人们对通用人工智能的一种常见想象。关键的较量不只是人类创造力与机器智能之间的竞争,而是充足的想法与实现这些想法所需的制度、劳动力、资本和实体系统之间的竞争。
原文以宏大的文明视角呈现了这种关系。它追问,AI 是否会在实体世界艰难追赶之际不断深化知识。其答案较少取决于惊艳的展示,而更多取决于可靠的后续落实。
OpenAI 通过《永恒互补》改变了什么
OpenAI 已将 AI 讨论的重心从生成答案,转向完成这些答案所催生的工作。
大多数公共讨论将智能视为推动进步的稀缺投入。在这种观点下,先进模型通过产出更有力的假设、设计、证明、软件和战略建议来加速发现。一旦智能变得更便宜,经济与科学增长也应随之加快。
《The eternal complement》使这一过程变得更复杂。一个有价值的想法,只有在有人检验假设、获取资源、协调专家、满足规则并建成相应系统后,才算真正完成。即便最初的洞见是正确的,每一步仍可能成为瓶颈。
文章中的视觉内容以一种格外明确的方式展现了这一论点。一幅插图将标有“天才”“资本”和“官僚体系”的丝带交织在一起。另一幅则将通往知识的三条路径区分开来:从第一性原理推理、在既有数据中发现理论,以及收集新数据。
这些路径对实体世界的依赖程度并不相同。模型可以以极高速度基于现有信息进行推理,但无法独立生成验证理论所需的每一项观察结果。新证据往往需要传感器、实验室、实地研究、临床试验或基础设施。
这正是执行力成为经济变量,而非行政附带事项的原因。更快的构思可能让更多项目争夺同一批设备、许可、专业知识和管理注意力。智能或许会先暴露约束,而非立刻消除它们。
这一论点也重新界定了何为有意义的 AI 进步。一个提出十项可信实验的模型创造的是潜在价值;一个帮助实验室筛选、运行、记录并复现实验的系统,创造的则是已实现的价值。
OpenAI 的框架不只适用于实验室工作。以改进后的电池设计为例,研究人员必须表征材料、建立退化模型、采购原料、准备生产流程、通过安全测试,并将成果整合进车辆或电力系统。
每项活动都包含日常的智力劳动。团队需要比对文档、协调需求、准备报告、追踪决策、审查证据并更新计划。这些任务很少看起来像突破性科学,但其中的延误可能拖慢整个项目。
建筑领域也呈现相同模式。更好的设计若没有估算、检查、采购、排期以及跨工种协调,就无法变成建筑。AI 的影响取决于它能否支持这些相互关联的活动,同时不引入不可接受的错误。
尽管其讨论尺度带有推测性,这篇文章仍值得审视。OpenAI 并未发布产品,也没有推出基准测试;它提出了一套框架,用以判断先进 AI 是否会转化为广泛的物质进步。
这一框架比基准领先更为严格。它追问模型能否在漫长、相互依赖的工作流中运行,而其中的错误会不断累积。它还追问,组织能否围绕更快的推理重塑自身,同时不失去问责机制。
这种重要变化在概念上发生,却具有现实意义。AI 提供商日益需要证明,其系统能够将工作推进至完成。生成一个有说服力的答案,只是这项考验的第一阶段。
更好的想法出现后,日常工作为何更有价值
当想法变得更容易生成时,验证和实施会因仍然稀缺而变得更有价值。
经济学家将互补投入描述为:当另一种投入变得更充足时,其价值也会提升的资源。软件曾增加对某些技术、管理和组织能力的需求。先进 AI 可能会在推理与执行之间形成类似关系。
假设一个研究团队不再获得五个可行假设,而是获得数百个。团队并不会因此自动拥有更多实验室能力。它仍需对假设排序、设计有效测试、监控结果,并决定哪些失败值得再试一次。
瓶颈可能向下游转移。科学家花在寻找可能方向上的时间减少,而花在判断哪一方向经得起证据检验上的时间增加。实验室运营、研究管理和数据质量变得更为关键。
同样的逻辑也适用于企业内部。AI 可以起草产品需求、分析客户访谈、提出营销方案或生成代码。每一项产出仍会进入一个由预算、依赖关系、安全审查、法律义务和相互竞争的优先事项构成的系统。
日常并不意味着微不足道。许多日常任务保留了作出困难决策所需的背景。会议记录、实验日志、事故历史和此前的权衡,可以防止团队反复重新讨论已经解决的问题。
这正是用于知识融合的工具能够支持执行的地方。目标不是用检索取代判断,而是在人员和智能体经历更长流程时,让相关证据始终保持连接。
行政能力同样重要。许可、合规、采购和文档记录在模型推理面前可能显得缓慢,但这些职能往往承载着无法简单消失的安全约束与公共责任。
AI 可以帮助减少其中不必要的摩擦。它可以比对申请材料、标记缺失信息、汇总证据,并准备常规函件。对于具有法律或实体后果的决策,人类主管机构仍将保留责任。
困难之处在于工作流的可靠性。一个小型起草错误可以很快纠正;而采购、设计和测试决策序列中一个未被察觉的错误,可能在任何人意识到根源之前影响后续阶段。
这使持续完成任务成为比单次精彩回复更强的衡量标准。METR 的研究人员一直在研究,AI 智能体能以多高的可靠性完成不同时长的任务。他们的任务时域研究凸显了简短演示与长期自主工作之间的差距。
更长的工作会带来更多上下文丢失、错误假设和恢复失败的机会。它还要求智能体能识别何时缺少外部信息。仅有自信无法替代一次测量、批准或实体检查。
因此,执行也包括知道何时不应继续推进。有效的系统必须暴露不确定性、保留来源信息,并在恰当时刻请求人工审查。缺少这些控制措施的速度,可能让项目迅速驶向错误方向。
OpenAI 的论点还意味着,人类技能将形成不同的市场。负责定义目标、解读模糊证据和管理后果的人仍不可或缺。将数字化计划连接到实验室、工厂、医院、施工现场和公共基础设施的工作人员亦是如此。
一些日常知识型任务将变得更加自动化。然而,由此产生的大量提案可能会提升对可信执行者和机构的需求。他们的角色将从产出每一份中间文档,转向监督规模更大的机器辅助工作流。
这种转变不会均匀发生。拥有干净数据、清晰流程和强大审查体系的组织可以更快整合智能体。记录碎片化的组织可能获得更多产出,却无法取得相当的执行能力。
在这种环境下,可搜索的知识库变得具有相关性。它可以减少重复调查,并帮助审查者追溯跨文件的决策。但它无法解决权属不清或证据缺失的问题。
因此,《永恒互补》首先是一种组织层面的论述,之后才是文明层面的论述。它预测,更强的智能会提高严谨协调的回报。忽视这种互补关系的公司,可能会发现自己被无法安全实施的想法所包围。
真正的较量是充足想法与稀缺执行力之间的竞争
主要冲突并非人类对抗 AI,而是迅速扩张的可能性对抗缓慢适应的执行系统。
这一对手之所以重要,是因为它改变了谁将面临压力。研究人员、管理者、监管机构和基础设施提供者都会面对更多潜在项目。他们的回应决定 AI 是增加已完成的工作,还是仅仅增加未完成的工作。
AI 公司首先面临压力。模型开发商一直通过基准分数、多模态功能、编码表现和推理效率展开竞争。这些指标仍然重要,但它们无法完整反映系统在重要组织内部的表现。
采购方日益需要能够维持状态、使用工具、遵循控制措施并从失败中恢复的系统。他们还需要审计轨迹,以显示智能体做了什么、使用了哪些证据,以及人员在何处介入。
模型提供商正通过智能体系统作出回应,即能够规划并执行多个相互关联行动的软件。尚未解决的问题是,随着工作流变得更长、环境变得更不可预测,这些系统能否保持可靠。
企业面临第二重压力。它们无法仅通过在未改变的流程旁增加一个聊天机器人来获取价值。它们必须决定哪些步骤可以自动化、审批应设在何处,以及当智能体出错时谁对结果负责。
即使模型访问成本变得更低,这种重新设计仍会带来实际成本。团队需要评估数据、安全控制、集成能力和培训。他们还需要时间识别那些原本非正式地存在于资深员工判断中的流程。
政府和受监管行业面临相关挑战。更快的提案生成可能增加对审查、认证和许可的需求。如果这些系统维持不变,AI 或许会加快工作抵达队列的速度,却不会加快队列本身的处理速度。
移除所有控制措施并不是严肃的解决方案。临床研究、环境审查、财务核查和工程标准之所以存在,往往是因为失败会将成本施加给那些并未选择承担风险的人。更好的目标是消除不必要的重复和糟糕的信息流动。
物理能力构成了另一项约束。AI 系统设计实验的速度可以快于实验室实际开展实验的速度。它提出电网项目的速度,也可以快于公用事业公司获得设备、并网审批和施工劳动力的速度。
斯坦福大学的 AI Index 记录了模型成本下降,同时采用率和投资不断扩大的趋势。这些趋势强化了文章的前提:数字智能的扩散速度可能快于制度和基础设施的变化速度。
然而,智能充裕并不意味着物质投入也充裕。半导体需要制造产能。能源系统需要发电与输电能力。生物学需要在受控条件下进行实验。空间科学需要耗时数年研发的仪器。
OpenAI 通过 James Webb Space Telescope 和 Dyson sphere 的图像说明了这种张力。两者都代表嵌入庞大支持系统中的智能。仅凭一个出色的公式,任何一者都无法成为现实。
James Webb telescope 依赖数十年的工程设计、测试、制造、国际协调与部署规划。它如今的科学产出,既体现了概念上的雄心,也体现了长期积累的执行能力。这种结合正是文章的核心经济对象。
一个不断改进模型、却忽视落地实施的文明,可能在理论上愈发深刻,却在应用上日益狭窄。OpenAI 将这种可能性与“广度文明”相对照:后者扩大物质层面的覆盖范围,却没有实现理解能力的同步增长。
富有成效的路径需要深度与广度兼备。模型可以拓展设计和解释的深度空间。人类制度、机器与供应链则必须拓展社会能够可靠建造之物的范围。
这一框架也挑战了关于经济会瞬间转型的预测。即使是能力极强的 AI,也会进入由旧软件、谈判达成的合同、固定资产、职业规范和社会阻力构成的经济体系。适应是在这些系统中推进,而非绕过它们。
这并不意味着先进 AI 不重要,而是意味着其影响的时间更难预测。能力可以迅速提升,而可测量的生产率变化可能较慢;随后,在组织完成配套投资后再加速。
结果可能类似于早期的通用技术。电力在企业围绕电动机重组生产之后,才带来了最大的工厂效率提升。计算机也需要新的流程、技能和管理实践,其收益才得以广泛显现。
AI 的不同之处在于,它能够帮助设计自身所需的配套流程。Agents 可以编写集成代码、记录工作流程,并协助评估。但它们仍然在组织内部运行,而组织必须授权变革并承担后果。
因此,这是一场动态竞争。稀缺的执行能力起初限制了 AI 的影响;AI 随后又帮助扩展执行能力,从而暴露下一个物理、制度或人力瓶颈。
决定进步速度的将是这一循环,而非一次模型发布。胜者未必拥有最多的想法,而是能够将更多可靠想法转化为经验证结果,同时不让错误以同样速度扩大。
OpenAI 的论点无法证明什么
这篇文章提出了一个有用的理论,但并未证明当前 AI 能够可靠地管理其所指出的执行层。
OpenAI 对将先进 AI 描绘为广泛进步的引擎有直接利益。因此,其论点应被视为一项战略论述,而非证明所需能力已经存在的独立证据。
当前模型通常在输入明确、边界清晰的任务上表现良好。现实中的执行远没有这么有序。需求会变化,记录会冲突,人们会产生分歧,工具会失效,关键的信息也可能始终处于无法访问的上下文之外。
Agents 也可能生成看似合理的错误。当某个输出会自动触发后续行动时,这一弱点就更为严重。一个错误假设可能穿过多个环节,直到审查者发现结果不一致才被察觉。
评估仍然困难,因为组织关心的是结果,而不是流畅的中间文本。一个 coding agent 可能交付可运行的功能,却同时积累安全债务。一个 research agent 可能准确总结论文,却选取了带有偏见的证据集。
长流程还需要记忆。系统必须保留承诺事项、未解决的问题,以及此前决策背后的理由。更多上下文并不能自动解决这一问题,因为无关材料可能掩盖真正重要的证据。
问责制带来了另一层不确定性。人类员工受职业期望、汇报关系和法律框架约束。自主系统则将责任分散到开发者、部署者、运营者、数据提供方和组织之间。
这种责任分配可能减缓高风险场景中的采用。医院、公用事业公司、银行和公共机构需要的不只是总体准确率。它们还需要系统在异常条件下可预测的行为,以及系统失效时清晰的处置流程。
经济学证据同样支持谨慎态度。Daron Acemoglu 的宏观经济分析认为,AI 在短期内对生产率的影响,取决于哪些任务在经济上变得可自动化。仅凭能力方面的新闻标题,并不能决定总体收益。
这些收益如何分配,与其总量同样重要。如果 AI 辅助高技能管理者、同时替代常规劳动者,工资和议价能力可能出现分化。如果它支持一线员工,生产率收益可能更广泛地扩散。
国际劳工组织的就业分析强调了转型以及自动化。不同职业受到影响的程度不同,而岗位设计决定了技术究竟是帮助员工,还是从其职责中移除任务。
OpenAI 的框架将这种制度选择留作开放问题。常规执行可能成为先进智能的宝贵互补要素,同时许多常规岗位仍会发生重大变化。经济层面的互补性,并不能保证每位劳动者都拥有安全感。
还存在低估需求的风险。更便宜、更快速的执行会鼓励组织尝试更多项目。即使每个项目的效率更高,这种反弹效应仍可能增加能源使用、基础设施需求和监管工作量。
安全带来了进一步的复杂性。如果 AI 压缩了一个想法到其实施之间的时间,社会识别滥用行为的时间也会减少。更快的执行有利于医学研究和工程工作,但也可能加速有害活动。
因此,控制措施必须以执行速度运行。静态政策和偶发审计将难以应对会执行数千项行动的 agents。组织需要持续监控、范围受限的权限,以及可靠中止工作流的方法。
文章最大的未知之处,在于数字工作与物理工作之间的边界。模型已经能够直接影响软件。它们进入实验室、医院、工厂和基础设施的路径,则需要机器人、传感器、标准以及值得信赖的人类操作员。
机器人技术可能缩小这一边界,但物理环境仍然充满变量。放错位置的物体、受损的部件或意外的测量结果,都可能打破在模拟中看似完整的计划。物理世界的恢复比重新生成文本困难得多。
如果 agents 能够在漫长、混乱、且需外部验证的工作中取得进展,OpenAI 的论点就会更有说服力。如果进步仍集中于短期数字任务,它的论点就会被削弱。这一区别值得通过测量而非假设来判断。
读者也不应将“常规工作”理解为忽视专业知识的许可。经验丰富的专业人士往往通过看似重复的行动作出困难判断。自动化可见步骤,可能移除原本保障流程安全的隐性检查。
正确的问题并不是 AI 能否完成一次任务,而是一个社会技术系统能否反复产出更好的结果。该系统包括模型、工具、数据、人员、激励机制以及围绕它的规则。
下一代经济将奖励完成闭环的系统
经济回报将属于那些能够将发现、决策、行动、测量和纠正连接成可靠闭环的系统。
当前许多 AI 部署只优化了这一闭环中的一个环节。模型起草代码、总结研究、准备设计或生成计划。周边组织仍必须验证输出,并将其带入实际执行。
下一阶段将连接更多环节。一个 agent 可以收集证据、提出行动建议、执行获批步骤、观察结果并修订计划。每增加一个环节,潜在价值和潜在失效风险都会提升。
完成闭环之所以重要,是因为反馈会将一个看似合理的答案转化为经过检验的知识。生成的假设价值尚不确定。实验能够产生证据,而复现则显示该证据能否在不同条件下依然成立。
软件提供了最清晰的早期例子。代码可以在数字环境中生成、执行、测试、检查和修订。反馈循环相对较快,尽管安全性和可维护性仍需要人工监督。
科学工作推进得更慢。一个 agent 可以协助文献综述和实验设计,但仪器与生物过程会施加真实的时间约束。阴性结果必须被准确记录,以免后续系统重复失败的路径。
制造业又增加了一层复杂性。设计必须满足公差、材料可用性、安全规则和生产经济性。AI 生成的部件可能在技术上有效,却不适合进行可靠的大规模制造。
因此,执行型 AI 的价值将体现在运营指标中。组织应追踪完整周期时间、缺陷率、返工、事故和采用情况。统计生成文档或 agent 行动的数量,只能揭示活动,而非进展。
管理激励也必须随指标改变。如果团队因部署 agents 而获得奖励,他们可能自动化可见任务,却没有改善完整流程。如果他们因经验证结果而获得奖励,就会关注瓶颈与控制措施。
这为专用模型和工具创造了机会。通用模型可以提出计划,而领域系统则验证计算或执行规则。结构化软件可以约束那些不应依赖开放式语言生成的行动。
人工审查也会变得更有针对性。人们不必批准每一项无害的格式调整。他们应将精力集中于不可逆行动、证据薄弱的情况、异常条件,以及带来法律或物理后果的决策。
最强大的实施方案很可能会把自主性与升级机制结合起来。Agents 在明确边界内处理熟悉案例。它们将模糊或高风险案例转交给人,同时保留审查所需的证据与推理过程。
这种设计将人类注意力视为稀缺的互补资源。它不会将专家浪费在每一个常规步骤上,而是在不确定性或后果足以证明成本合理时使用他们的判断力。
构建这些闭环的公司将获得复利式优势。每个完成的项目都会产生关于失败模式和有效干预措施的更清晰数据。这些证据能够改进未来的评估、工具和工作流设计。
跳过衡量环节的公司反而可能让错误不断累积。流畅的输出会营造效率提升的印象,但隐性的返工却在增加。只有当项目错过期限,或客户遭遇故障时,这种差距才会显现。
公共机构面临同样的选择。它们可以利用 AI 提高文书处理量,也可以围绕已完成的成果重新设计服务。后者需要跨越组织边界的数据共享、清晰流程和保障措施。
这正是为什么“永恒的互补”指向一种执行经济。价值将转向那些能够将机器推理与可靠机构和实体能力结合起来的人。模型很重要,但周边系统决定了实际影响。
在“永恒的互补”之后应关注什么
三个信号将表明 OpenAI 的论点是否正从一个吸引人的理论变为经济现实。
第一个信号是模型在长期、独立评估任务中的表现。模型演示应让位于涉及数小时或数天工作的测量。评估者应纳入不断变化的条件、工具故障,以及迫使智能体寻求澄清的要求。
如果这些测试表现有所提升,将强化 AI 能够扩展执行能力的主张。若表现停滞,则意味着充裕的推理能力仍会在持续协调过程中失效。
第二个信号是 AI 在科学和工业领域获得经验证的采用。关于合作伙伴关系的公告并不足够。有价值的证据应包括更短的实验周期、更少的返工、更高的质量,或在可比资源条件下完成更多项目。
这些结果必须经得起独立审查。公司自然会发布有利的案例,而失败的试点项目很少获得同等关注。采购方应询问:工作流的哪些部分发生了改变,以及错误成本是如何衡量的。
第三个信号是对模型之外互补要素的投资。关注实验室、机器人技术、能源系统、数据基础设施、员工培训和监管现代化。这些投资将揭示,组织是否预期数字智能会创造真实的执行需求。
互补性投资的增长将支持 OpenAI 的论点。若仍然只关注模型访问权限,则会暴露战略表述与运营规划之间的不匹配。
未来一段时间还应进一步厘清收益如何分配。生产率可以提高,同时劳动者却失去对工作节奏、监控方式或岗位设计的控制。负责任的部署需要劳动者参与,并提供可信的技能适应路径。
对开发者而言,眼下的教训是应在完整工作流中评估系统。不要将一次成功的工具调用误认为任务已经完成。应测试恢复能力、升级处理、来源追溯,以及对缺失信息的处理方式。
对企业采购方而言,教训在于组织本身。在购买更多生成能力之前,先找出最慢且经过验证的交接环节。更快的模型无法修复模糊的责任归属,也无法修复无人理解的审批流程。
对知识工作者而言,机会在于完成闭环。利用 AI 减少搜索和准备时间,然后将注意力投入测试、判断和后果评估。持久的优势并不在于产出更多草稿。
“永恒的互补”最终在宏大的愿景中提出了一个克制的观点。先进智能只有融入进步的日常机制时才最具价值。这套机制包括记录、审查、实验、工具、机构和人。
下一代经济将揭示,AI 能否强化这些互补要素,还是只会用更多可能性将其淹没。读者应关注已经完成的成果,而非戏剧化的演示。你所在组织中,哪一个工作流仍在阻碍一个好想法变成经验证的结果?



