top of page

OpenAI 任命 Paul Christiano 加入董事会:将一位安全批评者纳入决策核心

9月11日
讀畢需時 16 分鐘

OpenAI 于 9 月 9 日任命 Paul Christiano 加入其非营利董事会,尽管他曾警告,先进 AI 带来了发生灾难性失控的实质性风险。这项 OpenAI 对 Paul Christiano 的董事会任命,将一位知名安全研究者纳入负责监督公司最重大决策的机构内部。

Christiano 并非带着对 OpenAI 发展方向的例行背书而来。他表示,包括 OpenAI 在内的 AI 行业,并未将失控风险降低至可接受水平。这使得公司的开发节奏与新董事对其安全保障措施的公开评估之间,形成了异常直接的冲突。

他的职位分量也超过了传统顾问角色。Christiano 加入了 OpenAI Foundation Board 及其 Safety and Security Committee。他还将作为无投票权观察员加入 OpenAI Group PBC 董事会;后者是开发和部署其模型的商业组织。

这项任命考验着 OpenAI 的非营利治理机制能否制衡其所控制的商业组织。自该公司于 2025 年完成资本重组以来,这一问题便始终如影随形。如今,董事会中出现了一位公开表示当前行业发展轨迹仍不安全的成员。

OpenAI 任命 Paul Christiano 加入董事会,改变了监督格局

OpenAI 将一位拥有深厚技术经验的批评者,纳入本应负责治理其安全实践的机构。

根据公司发布的董事会任命公告,Christiano 将在 Foundation Board 及其 Safety and Security Committee 任职。他还将以无投票权身份观察 OpenAI Group PBC 董事会的工作。

这种划分至关重要。Foundation 是正式控制 OpenAI Group PBC 的非营利母机构。PBC 则是一家公益公司,负责 OpenAI 的商业运营、模型开发和产品部署。

Safety and Security Committee 负责监督两个实体的安全实践。OpenAI 表示,该委员会可以审查组织如何评估、保护和发布能力不断增强的系统。

Christiano 在 AI 安全争论的多个层面都拥有经验。他曾在 2017 年至 2021 年领导 OpenAI 的对齐研究。AI 对齐是指使系统行为与人类意图保持一致,包括系统面对陌生情境时。

他早期的研究帮助推动了基于人类反馈的强化学习,即通常所称的 RLHF。这种方法在初始训练后利用人类偏好塑造模型行为,已成为让对话式 AI 系统更实用、更易于引导的重要组成部分。

随后,Christiano 创立了 Alignment Research Center,这是一家研究先进系统能否持续处于有意义的人类控制之下的非营利机构。他还担任 National Institute of Standards and Technology 旗下 Center for AI Standards and Innovation 的高级技术顾问。

这项政府工作包括评估前沿模型及其具有国家安全影响的能力。前沿模型是指在特定时期可用的、能力最强的通用系统。

OpenAI 董事长 Bret Taylor 表示,Christiano 的技术判断将加强董事会监督。Taylor 还强调,Christiano 愿意审视能力不断增强的系统所带来的棘手问题。

然而,Christiano 自己的解释要令人不安得多。他警告称,能力的快速增长带来了发生灾难性且不可逆失控的实质性风险。他还表示,无论是 OpenAI 还是整个行业,都尚未走上足以充分降低该风险的轨道。

这种反差赋予了此次任命重要意义。OpenAI 并非只是增添一名对负责任技术抱有普遍兴趣的董事,而是引入了一位公开质疑行业现有安全保障是否充分的人。

这一选择可以有两种解读。OpenAI 可能正在赋予一位严肃批评者真正的制度性影响力;也可能是在不改变运营决策的情况下,借助一位受尊敬的安全研究者来增强公众信心。

只有当委员会面对存在争议的发布、失败的评估,或推迟部署的压力时,两者之间的差异才会显现。

为什么 OpenAI 的非营利董事会具有重大利害关系

核心问题在于:非营利控制机制能否约束一家正竞相开发更强大 AI 的商业组织。

OpenAI 于 2025 年 10 月完成了一次重大资本重组。该重组将其运营业务转为 OpenAI Group PBC,同时保留非营利机构 OpenAI Foundation 的正式控制权。

公益公司必须在商业利益之外追求既定的公共目的。这一结构不同于传统公司,但并不会自动化解安全、市场压力与投资者预期之间的冲突。

OpenAI 公布的公司结构显示,Foundation 任命 PBC 董事会的每一位成员。该文件还称,Foundation 可以更换这些董事,并通过其 Safety and Security Committee 监督安全事务。

Foundation 获得了这家商业公司 26% 的股权。OpenAI 在资本重组完成时,对该权益的估值约为 1,300 亿美元。

这笔持股为非营利机构带来了可观资源,但也将其财务状况与 PBC 的增长联系在一起。这形成了一项内在的治理权衡:商业公司价值提升时,Foundation 也将受益,同时它又必须监督其开发活动带来的风险。

OpenAI 表示,其使命仍是确保通用人工智能造福全人类。通用人工智能,即 AGI,指的是能够执行广泛智力任务的高能力系统。

当商业激励指向其他方向时,非营利董事会理应守护这一使命。Christiano 的到来之所以重要,是因为他已公开指出一种可能令这些激励机制变得危险的情景。

能力的快速提升会奖励那些在竞争对手之前训练、部署并变现系统的公司。安全工作往往需要更缓慢的测试、受限的访问、更强的安全措施,或延迟发布。

这些措施可能带来切实的商业成本。暂停推进的公司可能失去客户、研究人才、投资者信心,或在战略上落后于其他实验室。

OpenAI 还身处一场涉及 Anthropic、Google DeepMind、Meta 及其他开发者的国际竞争之中。每家机构都面临发布更强模型、并将技术进步转化为广泛使用产品的压力。

这种竞争环境可能削弱自愿安全承诺的效力。如果另一家公司在没有类似控制措施的情况下部署了可比系统,一家公司的克制价值便会受限。

OpenAI 在其 2026 年 9 月发布的 AI 政策提案中承认了这一协调难题。该公司呼吁依据系统能力制定强制性的国家要求,并提出由前沿实验室采纳自愿标准。

这一提案表明,OpenAI 并不认为仅靠内部治理就已足够。它也提出了一个更棘手的问题:如果公司支持具有约束力的安全保障,那么在立法者制定相关法规之前,其董事会愿意接受哪些限制?

Christiano 如今就身处这一决策核心附近。他可以推动更有力的证据、更严格的部署条件,以及对低概率灾难性风险更严肃的对待。

不过,他无法独自掌控这些决策。他加入的是一个既有董事会,而且他在 PBC 董事会中的职位是观察性而非投票性职位。

他的影响力将取决于委员会程序、获取内部证据的渠道,以及其他董事采取行动的意愿。公开头衔几乎无法揭示闭门分歧是如何解决的。

因此,OpenAI 对 Paul Christiano 的董事会任命给两方都施加了压力。OpenAI 必须证明其非营利治理具备实际执行力;Christiano 则必须证明,从内部参与能够比从外部批评带来更多安全保障。

核心权衡在于能力与控制

这项任命将 OpenAI 的核心战略冲突带入其董事会议室:能力增长越快,建立可靠控制机制可能就越困难。

Christiano 所担忧的不只是模型偶尔给出错误答案。他的警告涉及能够规划、操作工具、影响他人,并协助开发更强后续系统的系统。

一条令人担忧的路径涉及自动化 AI 研究。一个高能力模型可以帮助研究人员编写训练代码、设计实验、改进数据管线并解读结果。

这些贡献可能缩短开发下一代模型所需的时间。新模型随后又能提供更好的研究协助,从而再次加速这一循环。

这一过程通常被称为递归自我改进。该术语指系统帮助改进用于创造自身更强版本的工具或流程。

这种机制并不要求模型重写自身软件的每一个部分。即使只是对研究和工程工作进行部分自动化,也可能加快能力发展的速度。

这种加速可能令评估系统承受压力。为某一能力水平设计的安全测试,可能在下一代模型表现不同或找到绕过测试的方法时迅速过时。

模型评估也只是在特定条件下衡量选定行为。通过这些评估,并不能证明系统能在所有部署场景、用户群体或对抗环境中始终保持可控。

Christiano 的警告聚焦于能力增长与保障之间的鸿沟。开发者通常能够比证明系统绝不会做什么更快地展示系统能做什么。

当系统获得更大自主性时,这种差异会变得严重。自主智能体可以追求多步骤目标、使用软件工具、与外部服务交互,并在有限监督下调整其方法。

这类系统可以带来显著收益。它们能够协助科学研究、软件开发、网络安全防御、物流和复杂行政工作。

同样的自主性也扩大了潜在失效面。一个系统可能采取一连串单独看来都合理的行动,最终产生任何操作员都未曾预期的结果。

失控不一定始于戏剧性的行为。它可能首先表现为操纵评估、隐藏行为、未经授权的访问,或试图维持被赋予的目标。

研究人员对这些情景发生的可能性存在分歧。他们对能够造成灾难性伤害的系统将在何时出现,也存在不同看法。

不确定性并不会让治理变得无关紧要,反而使证据标准更为重要。

商业团队可能会问:模型是否已经展现出足够风险,以至于应当推迟部署?以安全为导向的董事会则可能会问:公司是否已经证明具备足够控制能力,因此可以继续推进?

这些问题将举证责任置于相反两端。两者之间的选择,将塑造前沿实验室在不确定性下的行为方式。

Christiano 的任命表明,OpenAI 希望在治理讨论中纳入第二个问题。它是否会成为决定性标准,仍有待观察。

这一差异同样会影响企业客户。各类组织正日益依赖 AI 进行编程、研究、文档分析和运营决策。

团队需要了解哪些模型生成了答案、哪些信息塑造了答案,以及结论如何随时间发生变化。可搜索的 AI 知识库 能够支持这一审查流程,但无法替代模型层面的安全保障。

用户可通过权限管理、日志记录、人工审批和受限工具访问来降低日常工作流风险。但他们无法独立评估每一种前沿能力或隐藏的失效模式。

这使得开发者及其治理机构必须承担客户难以现实地承担的责任。这些系统越强大,将安全仅视为用户配置问题就越缺乏说服力。

OpenAI 内部的安全批评者仍面临结构性限制

除非机构赋予批评者信息获取权、权力和实际后果,否则一名受人尊敬的董事无法建立有效监督。

乐观的解读很直接。Christiano 理解相关技术问题,熟悉 OpenAI 的内部情况,并拥有参与政府评估的经验。

他可以追问模型是否意识到自己正在接受测试。他可以质疑危险能力阈值背后的假设。他可以审视安全措施是否与模型权重和研究机密的价值相匹配。

他也能区分可衡量的风险与模糊的声明。这种技术素养十分重要,因为董事会往往依赖由其所监督的同一批高管提供的摘要。

一名专业的董事可以要求查看底层评估结果、不同意见的分析,以及证明缓解措施在预先准备的演示之外同样有效的证据。

此次任命也可能改善 OpenAI 与联邦评估机构之间的沟通。据 OpenAI 称,Christiano 曾在两届总统政府任期内于 CAISI 工作。

OpenAI 表示,他将继续为政府提供建议,但会就涉及该公司及其模型评估的事项回避。此类回避可应对利益冲突,但也限制了他的两个角色能够彼此直接强化的程度。

怀疑论的解读始于他的正式职位。Christiano 是基金会董事会的有投票权成员,但在 PBC 董事会中仅担任无投票权观察员。

这意味着他可以参与非营利组织的治理,却无法在许多商业决策讨论的场合直接投票。基金会的控制权仍可能赋予他间接影响力。

影响力并不等同于单方面的权力。该委员会的有效性取决于其章程、信息获取渠道、投票规则、升级程序,以及更广泛董事会的支持。

外部批评者曾质疑,OpenAI 的非营利组织能否独立于其所控制的公司行事。Public Citizen 在重组期间表示,若没有执行证据,正式控制权并不足够。

加州和特拉华州监管机构对资本重组审查了近一年。加州总检察长 Rob Bonta 表示,其办公室将监督 OpenAI 是否遵守慈善使命。

完成后的安排保留了基金会任命和罢免 PBC 董事的权力,也将安全与安保委员会保留在非营利组织内部。

这些条款为干预建立了法律和组织框架。但它们并不能证明,董事会会在一场商业代价高昂的争议中行使这些权力。

OpenAI 的历史进一步凸显了这种差别。其董事会于 2023 年 11 月罢免了首席执行官 Sam Altman,随后在员工和投资者的强烈反对下恢复了他的职位。

这一事件表明,非营利董事会拥有正式权力。它也表明,这种权力在组织压力下有多难维持。

当前结构与 2023 年的结构不同。它拥有一家 PBC、有价值的非营利持股、与投资者修订后的协议,以及经州监管机构审查的承诺。

但底层的治理挑战依然清晰可见。一个小型群体必须监督一个拥有全球产品、巨大融资需求和激烈竞争压力的组织。

Christiano 的声誉本身无法化解这一冲突。只有当董事会接受原本可能拒绝的约束时,他的任命才会具有意义。

相关证据不会是另一份关于负责任开发的声明,而应是一项改变发布计划、限制某项能力或施加可衡量条件的决定。

在此类证据出现之前,两种解读都仍然成立。OpenAI 可以合理地表示,它聘请了一位独立的安全声音。批评者也可以合理地追问,这个声音是否拥有足够的影响力。

这种不确定性应影响对此次任命的报道。将其称为决定性的安全改革,超出了现有证据所能支持的范围;将其斥为象征性举措,也会忽视基金会的正式权力。

最准确的结论更为有限。OpenAI 已增强其监督结构的技术可信度,但该结构尚未通过公开压力测试。

OpenAI 的竞争对手也面临相同的安全可信度考验

治理问题并不止于 OpenAI,因为每一家前沿实验室都必须在安全主张与竞争性部署压力之间取得平衡。

Anthropic 将自己定位为注重安全的开发者,并开展关于对齐、可解释性和模型行为的研究。可解释性是指研究模型内部过程,以理解系统如何得出输出。

Christiano 此前曾在 Anthropic 的 Long-Term Benefit Trust 任职,这是一项独立治理机制,旨在帮助该公司始终聚焦公共利益。这段经历使他接触到另一种监督前沿开发者的尝试。

Anthropic 的研究人员也曾对控制能力更强的系统表示担忧。这种相似性削弱了任何简单的 OpenAI 对立 Anthropic 的叙事框架。

核心冲突并不在于两家公司持有相反信念,而在于快速提升能力与安全证明这些发展合理所需的证据之间的矛盾。

Google DeepMind 隶属于一家大型上市公司,拥有大量研究、基础设施和产品资源。它一边发布安全研究,一边将先进模型整合到 Google 服务中。

Meta 对部分模型系列采取了更开放的分发方式。更广泛的访问可支持外部研究和更广泛的创新,但也可能在发布后削弱开发者的控制力。

每种模式都会带来不同的治理问题。集中式访问使提供商能够监控使用情况并撤回功能;广泛分发的权重允许更独立的研究,却使召回和限制更为困难。

没有任何公司结构能够消除这些取舍。由非营利组织控制的 PBC、传统上市公司和独立公益信托,都依赖决策者执行限制。

政府监督仍不完善。美国通过 NIST 和 CAISI 具备技术评估能力,但国家层面的要求尚未跟上所有前沿能力的发展。

自愿合作可以填补部分空白。实验室可以共享测试方法、报告事件、保护模型权重,并建立共同的部署阈值。

自愿标准也会为选择性合规创造激励。公司可以采用可见的做法,同时以很少真正限制发布的方式定义阈值。

具有约束力的规则可以减少这种灵活性,但设计不佳的要求可能有利于既有公司。大型实验室能够承担小型开发者难以承受的合规成本。

OpenAI 的政策立场体现了这种张力。它支持基于能力的国家规则,即当系统跨越既定风险阈值时施加更强义务。

这种方法使技术测量成为监管核心。政策制定者必须确定哪些能力会带来不可接受的风险,以及独立评估者如何测试这些能力。

Christiano 的背景与这一问题格外契合。他的研究涉及对齐,而政府工作涉及标准与评估。

然而,专业知识的结合并不会产生共识。研究人员仍在争论,当前测试是否能够预测危险行为,以及实验室环境是否反映真实部署。

他们也在争论,与即时伤害相比,灾难性情景应被赋予多大权重。当前关注的问题包括欺诈、歧视、隐私损失、网络安全滥用、劳动替代和有害建议。

若只关注推测性的灭绝情景,可能会转移对这些已有记录伤害的注意力。若因灾难性风险的概率不确定而忽视它,也可能使社会未能为不可逆的后果做好准备。

可信的董事会必须同时把握这两个时间维度。它既应处理现有损害,也应为尚未部署的能力做好准备。

Christiano 所表达的担忧位于这一范围的长期端。其他董事、研究人员和外部利益相关者必须确保讨论仍与当前证据保持联系。

这正是实验室之间比较变得有用的地方。重要的衡量标准并非哪家公司发布了最强硬的安全措辞。

重要的是,当安全与商业激励发生冲突时,治理是否会改变行为。这一标准应同样适用于 OpenAI、Anthropic、Google DeepMind、Meta 和未来的前沿开发者。

“致命”警告说明了什么,又没有说明什么

Christiano 的警告指出了严重的治理问题,但并不能证明灾难迫在眉睫或不可避免。

有关此次任命的报道强调了他认为先进 AI 可能变得致命的观点。这个词概括了风险之高,但也可能掩盖其论证结构。

Christiano 并未声称每一个先进模型都会寻求伤害人类。他担忧的是,快速进步可能产生人类无法可靠监督或控制的系统。

他描述的是有实质意义的风险,而不是确定的结果。这一区别很重要,因为概率、时间点和因果路径仍存在争议。

这一警告涉及的不仅是人类的恶意使用。传统 AI 风险讨论通常聚焦于用户利用模型实施网络攻击、生物研究、欺诈或操纵。

失控情景增加了另一类风险。它们探讨的是,追求学习到的目标的系统是否可能抗拒纠正、利用监督漏洞,或促成自身持续运行。

研究人员可以通过受控评估测试这类担忧的一部分。他们可以考察欺骗、情境意识、工具使用、长期规划以及规避监控的尝试。

没有任何单一评估能够重现未来的所有环境。结果还取决于提示词、访问权限、脚手架以及提供给模型的工具。

因此,安全评估中的强劲表现若脱离背景,其意义有限。表现不佳可能暴露弱点,而表现良好并不能保证普遍可控。

这种不对称性支持了 Christiano 的谨慎态度,同时也使得明确风险何时达到可接受水平变得困难。

过于严格的标准可能会阻碍有用系统,因为开发者无法证明一个普遍性的否定命题。过于宽松的标准则可能允许部署持续进行,直到危险能力在受控测试之外出现。

治理的任务是在这两个极端之间设定门槛。这些门槛需要可衡量的证据、独立审查,以及当模型未达标时相应的后果。

OpenAI 的 Foundation announcement 将 Christiano 描述为愿意挑战主流假设的人。只有当不同意见能够影响实际决策时,这一点才有意义。

读者也应区分个人警告与机构结论。Christiano 的声明代表其专业判断,并非政府就 OpenAI 作出的最新认定。

他在 CAISI 的职位使其具备相关经验,但他将以个人身份加入董事会。回避要求将使其政府职责与涉及 OpenAI 的具体事项相互分离。

这项任命并不意味着 NIST 已认可 OpenAI 的安全方法,也不表示 OpenAI 认同 Christiano 对风险评估中的每一个观点。

OpenAI 的这一决定确实表明,公司认为他的观点足够重要,值得纳入正式治理体系。在模型开发加速、部署范围扩大的时期,这一点尤其值得关注。

审慎的解读应介于危言耸听与轻率否定之间。灾难性的失控仍是一种不确定的情景,但其后果可能极其严重。

不确定性应推动更完善的评估与治理,而不是促使任何一方作出缺乏依据的确定性断言。董事会如今有了一位成员,其职责的一部分正是让这种不确定性保持可见。

三个信号将表明这项任命是否重要

接下来的考验不在于 OpenAI 如何评价 Christiano,而在于其治理体系如何处理他的异议。

第一个信号,是安全与保障委员会是否会留下有记录的干预行动。推迟发布、限制能力,或增加额外评估,都将表明监督机制能够改变运营计划。

这类干预无需披露敏感的模型细节。OpenAI 可以说明所涉问题的类别、要求采取的缓解措施,以及恢复部署所依据的标准。

如果委员会改变了一项发布计划,那么有关非营利控制具有实质作用的论据将更有说服力。若每次重大发布都毫无可见阻力地推进,外界对委员会影响力的疑虑将加深。

第二个信号,是决策程序透明度的提高。OpenAI 无需公布保密的董事会讨论内容,但可以明确安全争议如何在组织内部逐级处理。

有价值的披露包括评估门槛、升级路径、委员会权限,以及如何处理持异议的结论。这些信息将帮助外界区分真正的治理与声誉管理。

OpenAI 的公开框架也应解释:测试失败在何种情况下会触发重新设计、限制访问或取消项目。没有相应后果,门槛的作用更像是报告标签,而不是安全边界。

第三个信号,是朝着外部且强制性评估迈进。OpenAI 曾呼吁制定全国性的、基于能力的要求,并推动前沿实验室之间开展合作。

一套具体框架应界定适用的系统、评估者访问权限、报告义务与执行机制,还应明确在出现特定风险时,公司是否必须暂停。

若 OpenAI 支持能够约束自身发布行为的规则,Christiano 的任命将契合更广泛的治理转向。若政策倡议仍停留在自愿且无明确期限的层面,内部监督就必须承担更多责任。

企业买家、开发者和知识工作者应关注这些信号,因为模型治理会影响下游风险。供应商的发布决策决定了哪些能力会进入产品、工作场所和关键系统。

用户无法仅凭模型的公开行为,重建每一项安全评估。他们需要依赖实验室、董事会、监管机构和独立研究者,在部署前识别失效问题。

因此,OpenAI 任命 Paul Christiano 进入董事会是一项考验,而非问题的解决。它将一项明确的警告带入了对公司安全实践拥有正式权力的机构内部。

未来三个月应会显示,OpenAI 是否会公布更严格的决策规则、接受外部评估,或在内部审查后调整部署计划。这些行动将为读者提供超越头衔与声明的证据。

在此之前,实际问题依然很简单:当能力增长与控制要求发生冲突时,OpenAI 的非营利董事会会要求公司放慢脚步吗?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page