top of page

Paul Christiano 加入 OpenAI Foundation 董事会,安全监督面临最严峻考验

2天前
讀畢需時 15 分鐘

Paul Christiano 在警告 AI 能力发展速度超过行业安全保障措施后,加入 OpenAI Foundation 董事会。这项于 9 月 9 日作出的任命,将一位长期从事对齐研究的研究者纳入控制 OpenAI 商业实体的非营利机构。它也带来了一个迫在眉睫的考验:一名内部批评者能否将安全担忧转化为可执行的监督机制?

Christiano 将加入负责监督 OpenAI 整体安全实践的 Foundation 安全与保障委员会。他还将担任 OpenAI Group PBC 董事会的无投票权观察员。这一区别至关重要,因为参与商业决策讨论并不等同于拥有对其作出决定的权力。

此次任命发生在 OpenAI 于 2025 年 10 月重组公司架构之后。非营利性 Foundation 保留控制权,而运营公司转变为一家公益公司。因而,Christiano 加入的是位于商业业务之上的机构,而不是外部咨询小组。

他的回归也承载着历史意义。Christiano 曾在 2017 年至 2021 年间领导 OpenAI 的对齐研究,并参与开发了基于人类反馈的强化学习。RLHF 是一种利用人类偏好来塑造模型行为的训练方法。此后,他创立了 Alignment Research Center,并转入政府部门从事前沿模型评估工作。

核心冲突并非 OpenAI 与另一家实验室之间的对立,而是 OpenAI 的安全承诺与部署能力日益强大系统所带来的运营压力之间的矛盾。Christiano 的任命增强了这场冲突一方的专业力量,但当安全与部署优先级出现分歧时,它并未决定哪一方会胜出。

Paul Christiano 以两个不同角色加入 OpenAI Foundation 董事会

这项任命让 Christiano 在掌控公司的非营利机构拥有投票权,并能了解商业子公司的事务,但在后者没有投票权。

OpenAI 的董事会任命公告赋予 Christiano 三项相互关联的职责。他加入 OpenAI Foundation 董事会,进入其安全与保障委员会,并以无投票权身份观察 OpenAI Group PBC 董事会。

这些角色不应被视为可以相互替代。Foundation 控制 OpenAI Group PBC,并持有该公司的重要股权。因此,其董事会处于治理架构的最高层。

Group PBC 董事会更接近运营公司的商业和部署决策。Christiano 的观察员职位可以让他了解这些决策的背景。然而,无投票权的定位限制了他在该董事会中的直接正式权力。

他在安全与保障委员会中的职位可能是整套安排中最具影响力的部分。OpenAI 表示,该委员会负责对整个组织的安全与保障实践进行治理监督。这一范围明确涵盖 Group PBC。

Christiano 将与委员会主席 Zico Kolter 共事,后者是 Carnegie Mellon University 教授,专长为机器学习和 AI 安全。OpenAI 并未将 Christiano 介绍为委员会的新领导人,而是将他的对齐与评估经验纳入现有监督架构。

这一时机经过审慎选择。OpenAI 表示,过去一年中能力快速进步,而对齐仍然困难。对齐意味着,即使 AI 系统的能力和自主性不断增强,其行为仍与人类目标保持一致。

Christiano 表示,在这些条件下,委员会的职责更加重要,也更具挑战性。他的表述指出了问题,但并未声称问题已经解决。更强的模型可以带来新的益处,同时也可能推翻此前关于监控和控制的假设。

此次任命还包含一项利益冲突管理规定。Christiano 仍担任联邦 Center for AI Standards and Innovation(CAISI)的高级技术顾问。该中心隶属于 National Institute of Standards and Technology。

OpenAI 表示,Christiano 将在政府职位中回避所有与 OpenAI 有关的事务和模型评估。这种隔离是必要的,因为 CAISI 审查前沿系统及相关国家安全风险。政府评估机构若同时参与某家公司的治理,就无法可信地评估该公司。

这一回避安排处理了一项潜在冲突,但也限制了他不同职位之间的信息流动。他的政府工作可以为其对标准和评估方法的一般判断提供参考,但不能成为从两个立场处理 OpenAI 具体事务的渠道。

OpenAI 的说明仍留下若干实际问题未解。它没有说明 Christiano 的任期、他的委员会投票安排,或他参加 Group PBC 会议的频率。它也没有指出他的任命已经改变了哪一项部署决定。

这些缺失并不意味着该角色只是象征性的。它们明确了下一步必须衡量的内容。Paul Christiano 在 OpenAI 所担任角色的重要性,将取决于有记录可查的决策、获取证据的渠道,以及委员会的结论是否改变部署条件。

为什么 OpenAI 的安全治理如今面临更大压力

Christiano 加入的背景是,能力增长使自愿安全流程越来越难以与商业战略区分开来。

前沿实验室面临一个反复出现的激励问题。一家公司可以认识到严重风险,同时仍担心部署放缓会让竞争对手受益。当安全建议带来真实的商业成本时,内部治理最为重要。

这正是承诺与执行之间的主要张力所在。公开政策可以规定评估程序和风险类别。只有在艰难的发布决策中,领导层遵循这些规定,它们才具有意义。

OpenAI 的Preparedness Framework描述了一套用于评估严重风险的分层流程。安全咨询小组会在采取保障措施后评估剩余风险,并向公司管理层提出建议。该框架让董事会委员会拥有知情权,并允许其审查决策或要求提供信息。

这一结构形成了多个检查点。技术团队测试系统,专家评估剩余危害,管理层作出部署决策,而董事会负责监督。每个检查点都可能发现前一层遗漏的问题。

然而,这一结构也分散了责任。咨询小组提出建议,而非独立治理公司。管理层仍保有重要决策权,而董事会委员会则从监督位置审查流程。

当职责保持清晰时,责任分散可以支持审慎决策。但当每个群体都依赖另一个群体的判断时,它也可能模糊问责。Christiano 的价值将部分取决于他是否能将技术证据转化为明确的治理回应。

他的经历适合这项任务。在 OpenAI,他研究了从人类反馈中学习的方法。在 Alignment Research Center,他专注于理论性的对齐问题。在政府部门,他参与了涉及具有国家安全影响能力的评估工作。

这一组合横跨安全流程的三个环节。研究探究哪些失效方式可能发生。评估考察模型是否显现预警信号。治理决定组织如何利用这些结果。

大多数专家的职业生涯主要局限于其中一个领域。Christiano 曾在这三个领域都有过工作经历,尽管专业知识并不会自动带来制度影响力。他在委员会中的角色仍必须在 OpenAI 的规则和报告渠道内运作。

压力也不只存在于 OpenAI 内部。Anthropic、Google DeepMind 及其他前沿开发者都发布了各自的风险框架和模型评估。每家公司使用不同的术语、阈值和决策结构。

这些差异使比较变得复杂。企业买家不能假定两个名称相似的风险类别会产生等同的发布标准。研究人员也难以判断一家公司公开的框架是否符合其内部实践。

因此,OpenAI 的安全治理影响的不只是一家公司的声誉。其选择可能塑造整个行业对独立评估、事件报告和董事会责任的预期。当 OpenAI 披露竞争对手所缺乏的更强控制措施时,后者将面临质疑。

反向的动态同样存在。若竞争对手发布更详细的评估结果,也可能促使 OpenAI 提高透明度。当公司必须为具体程序辩护,而不是给出宽泛承诺时,治理竞争就能提高标准。

Christiano 的加入提升了 OpenAI 技术监督的可信度,但可信度并非最终产出。关键成果是:当公司有强烈理由发布产品时,仍能保持可靠的决策流程。

这项任命将对齐研究与董事会决策联系起来

Christiano 的独特贡献,在于他能够将模型行为转化为董事会可以据此采取行动的问题。

AI 对齐研究往往看似远离公司治理。它研究欺骗性行为、薄弱监督、奖励操纵和失控等问题。董事会通常处理预算、管理层问责、法律风险和组织风险。

前沿 AI 缩短了这些领域之间的距离。关于模型能否规避监控的技术判断,可能成为部署问题。而部署问题随后可能成为董事会监督事项。

Christiano 早期的工作有助于解释 OpenAI 为何选择他。他参与开发了 RLHF,后者成为使语言模型更实用、更具响应性的核心技术。该方法收集人类偏好数据,并训练模型倾向于给出人们认为更理想的回答。

RLHF 改善了模型在实际中的行为,但并未解决对齐问题。模型可能在测试中产生受偏好的回答,却无法在陌生条件下可靠地追求人类目标。人类评估者也可能难以判断超出自身专业能力的工作。

Christiano 后来专注于这个更困难的监督问题:人们如何评估那些人类无法直接验证任务执行情况的系统?开发者又如何在模型学会隐藏危险能力之前发现它们?

这些问题推动了 Alignment Research Center 的工作。ARC 还孵化了一个评估团队,该团队在成为独立组织 METR 之前曾测试前沿系统。这项评估团队拆分公告记录了涉及 GPT-4、Anthropic 的 Claude 以及英国前 Foundation Model Taskforce 的工作。

这段经历为 Christiano 提供了一个有用的参照点,可用于比较内部与外部评估。公司测试能够接触尚未发布的模型、详细的系统信息和保密的保障措施。独立评估者则能够提供方法论上的距离,并挑战实验室内部形成的假设。

任何一种方法单独来看都不够。外部团队可能无法接触最终系统或其部署环境。内部团队则可能面临进度压力,或逐渐习惯于公司的既有假设。

一个严肃的董事会必须追问这些弱点如何相互作用。它应当了解评估者是否获得了足够的访问权限,保障措施是否在贴近现实的条件下接受了测试,以及尚未解决的发现是否未经修改地传达给了决策者。

Christiano 可以推动提出这些问题,但他无法亲自完成每一项评估。良好的治理并不依赖某一位专家复现技术团队的工作,而是依赖建立能够揭示分歧与不确定性的汇报要求。

这正是 Paul Christiano 在 OpenAI 的角色不同于传统科学任命之处。OpenAI 并不只是新增了一位支持 AI 安全的研究人员,而是引入了一位以质疑现有方法能否监管比评估者更强大系统而闻名的人士。

他独立的公开立场至关重要。获任后,Christiano 表示,他认为能力快速加速存在引发灾难性且不可逆的失控的重大风险。他还表示,包括 OpenAI 在内的整个行业,目前尚未走上将这一风险降至可接受水平的轨道。

这一表述由他的公开账号披露,并不是对公司的例行背书,而是对他即将加入的基准现状的批评。

OpenAI 任命一位批评者,可以被解读为愿意加强内部挑战机制;也可以被解读为在担忧不断升温之际安抚外界的一种努力。两者的区别,只会通过后续的治理结果显现。

这一任命为 AI 对齐研究带来了一项具体检验。该领域多年来一直在识别可能的失效模式并提出评估方案。Christiano 现在所处的位置,将参与决定这些证据如何传达到掌握控制权的董事会。

核心权衡在于权力与访问权限

Christiano 将获得极为广泛的访问权限,但公开记录并未表明他能够单独阻止一项存在争议的模型发布。

董事会任命往往会带来超出其正式机制所能支撑的信心。一位备受尊敬的安全研究人员进入决策室,能够改善提问、证据和讨论质量,但这并不意味着某一位成员掌握最终决定权。

按照其任命的通常含义,Christiano 在 Foundation Board 拥有投票权;作为 Group PBC 董事会观察员,他并无投票权。OpenAI 尚未宣布赋予他对部署事项的个人否决权。

委员会更广泛的权力也需要谨慎解读。OpenAI 表示,Safety and Security Committee 负责管理整个组织的安全与安保实践。其公开框架描述了监督、审查和信息获取权。

这些职能可能具有实质性影响。一个能够获得完整证据的委员会可以要求作出解释,并将尚未解决的风险上报。它还可以要求领导层为无视既定程序承担责任。

但监督不同于自动阻止发布。公开文件并未披露每一项内部升级规则或委员会投票情况,也未说明当管理层倾向部署而安全审查人员反对时,分歧将如何解决。

OpenAI 较新的治理框架正式明确了安全、准备度、安保、法律审查和董事会监督方面的角色。制度化能够减少模糊性,但该框架仍是由公司自行设计的系统。

因此,质疑者提出的问题很直接:当约束变得代价高昂时,这一流程是否还能约束公司?答案无法从 Christiano 的履历或任命公告的措辞中得出。

相关证据可以包括:被推迟的发布、委员会审查后新增的保障措施,或管理层无法悄然豁免的书面阈值。也可以包括对严重分歧的公开披露,以及最终决策背后的推理说明。

不公开每一项评估细节有其正当理由。危险能力报告可能泄露会助长滥用的方法;安全发现可能暴露漏洞;过早披露也可能干扰修复工作。

保密不应成为沉默的通用解释。OpenAI 可以披露决策类别、治理行动、汇总发现,以及既定阈值是否被触发,而无需公布具有操作层面危险性的细节。

Christiano 的无投票权观察员角色带来了另一项权衡。参与 Group PBC 的讨论,可以帮助他了解产品计划、部署约束和商业压力。然而,观察员依赖董事会愿意及时提供完整材料。

他在 Foundation Board 的角色,使他能够在控制层面要求获得答复。这一路径的有效性将取决于会议实践、委员会授权范围以及其他董事的支持。

OpenAI 的结构增加了复杂性。Foundation 控制 Group PBC,而投资者和员工则在运营公司中拥有重大的经济利益。公益公司必须在股东利益之外追求其声明的公共目标,但两者之间的张力并不会消失。

2025 年资本重组后,Microsoft 对 Group PBC 的投资约为 1,350 亿美元,按转换后稀释口径计算约占 27%。这一数字反映了围绕 OpenAI 部署选择的金融利益规模。

这并不能证明投资者主导安全决策,却说明了为什么治理机制必须在异常巨大的经济压力下仍能发挥作用。推迟一个重大系统可能影响合作伙伴关系、基础设施规划、产品路线图和竞争定位。

OpenAI Foundation 的控制权旨在该环境中维持使命导向的权威。Christiano 的任命增强了控制董事会可获得的安全专业能力,但并未消除谨慎与速度之间的根本冲突。

这正是核心权衡:访问权限让批评者能看到更多信息并更早介入;权力则决定这些介入能否在存在争议的决策中延续下去。

安全专家不能替代可问责的系统

这一任命值得关注,但 OpenAI 的安全表现仍必须能够在一位董事的声誉之外得到衡量。

组织有时会通过招募与缺失价值相关联的个人,来回应对其制度的批评。发生安全失误,就引入安全负责人;出现治理争议,就任命独立董事;出现安全风波,就聘请受尊敬的安全研究人员。

这些任命可能带来真正的改变,也可能将期望集中在一位缺乏实现目标所需人员、信息或授权的人身上。

Christiano 带着显著优势进入这一角色。他曾在 OpenAI 工作,因此了解其研究文化;他拥有独立评估和政府标准方面的经验;他也曾公开批评行业的既有发展轨迹。

这些特质能够使委员会讨论更加尖锐,帮助董事区分令人安心的指标与真正对模型构成挑战的测试,也能改善事故发生后提出的问题。

但个人专长也可能造成依赖。如果其他董事将判断交由专家,安全就可能成为一个人的职责领域,而不是董事会共同承担的义务。强有力的委员会应当分散足够的知识,使每位成员都能理解重大风险决策。

人员配置同样重要。董事通常依赖内部团队和外部顾问完成细致的技术工作。委员会需要能够独立获取专家意见、评估结果、事故数据和不同意见。

这些信息应在发布变得难以逆转之前送达董事会。迟来的监督会让治理沦为事后审查:它或许能解释发生了什么,却无法改变部署决定。

吹哨人和升级渠道是另一项检验。研究人员必须能够提出关切,而不完全依赖其汇报关系。董事会需要有流程接收这些关切,并区分技术分歧与不当行为或报复。

OpenAI 并未将 Christiano 的任命与新近公布的升级渠道挂钩,也未宣布新的外部审计要求。这些缺失应当防止读者将此次任命视为更广泛改革的证据。

与其他 AI 开发者的比较进一步说明了这一点。Anthropic 采用 Responsible Scaling Policy,将能力阈值与保障措施关联起来;Google DeepMind 已发布 Frontier Safety Framework。这些系统各不相同,但都面临同一个验证问题。

公司自行制定政策,衡量自家的模型,并且通常控制向公众发布的证据。独立评估可以减少这种循环性,尤其是在评估者获得早期访问权限和充足测试时间时。

这一任命让 OpenAI 拥有了一位同时理解研究与政府两方面独立评估的董事。下一个问题是,OpenAI 是否会扩大评估者的权力,还是仅从 Christiano 与这项工作的关联中获益。

企业客户应当关注这一差别。他们越来越多地在软件开发、分析、客户服务和内部决策支持中部署 AI。前沿实验室的发布纪律,成为这些客户运营风险的一部分。

开发者也应当关注,因为模型变更可能改变智能体行为、工具使用方式和安全假设。知识工作者同样应当关注,因为保障措施会影响处理敏感文档和具有重大影响建议的系统的可靠性。

团队可以通过让模型输出始终与源材料和机构背景相连,来改善自身控制措施。可检索的AI 知识库有助于用户审查证据,但无法弥补模型提供商层面的失效。

责任仍然是分层的。提供商必须评估并治理自己的系统;企业买家必须在实际工作流中测试这些系统;用户必须为错误会带来重大后果的决策保留审查流程。

Christiano 的任命影响的是第一层。如果它能够带来更清晰的证据,证明提供商自身的控制措施能在压力下发挥作用,其价值将最为显著。

Paul Christiano 在 OpenAI 履职后值得关注的事项

三个信号将表明这一任命是否改变了治理:框架修订、可见的委员会干预,以及更强的独立评估。

第一个信号是 OpenAI 对安全框架进行实质性修订。有意义的变化应明确谁可以暂停部署、分歧如何传达至 Foundation Board,以及哪些决定必须接受委员会审查。

仅有修订本身并不能证明执行。如果它将宽泛的监督措辞转化为具体的决策权,将增强这一任命的重要性。模糊的补充则会削弱这种解读。

尤其应关注对快速提升的自主能力的处理。能够在更少监督下完成更长任务的模型,会带来更棘手的评估问题。治理框架应说明,当旧测试不再能够捕捉这些风险时,OpenAI 将如何更新阈值。

第二个信号是:有证据表明安全与保障委员会改变了一项实际决策。这些证据无需披露敏感技术细节。OpenAI 可以披露委员会审查曾推迟发布、要求增加保障措施,或触发监控条件。

此类披露将证明 OpenAI 的安全治理能够影响时间表和产品。若持续发布政策却没有可识别的干预实例,委员会的实际影响力仍将难以确定。

事件报告也应归入这一信号。故障能够揭示部署后的升级机制是否有效。有效的报告应在不助长滥用的前提下,说明故障类别、治理响应及纠正措施。

第三个信号是更广泛地采用真正独立的评估。OpenAI 已与外部评估机构合作,但关键变量在于访问权限、介入时机和发布权。

评估者需要获得足够的模型访问权限,才能测试现实中的失效模式。他们也需要在部署决策尚未最终确定之前拥有充足时间。此外,即使公司持不同意见,评估者也需要有可信的方式报告尚未解决的担忧。

更强有力的安排将支持这样一种判断:Christiano 正在将其评估经验与董事会实践相结合。围绕狭窄基准设计的有限合作则会削弱这一判断。

读者还应关注他的回避机制。涉及 OpenAI 的政府事务必须与其企业职责保持分离。清晰处理这一界限,将同时保护 CAISI 的公信力和 Foundation 的治理。

Paul Christiano 加入 OpenAI Foundation Board 之际,安全相关表述已相当丰富,但可由外部验证的控制机制仍然稀缺。他的技术背景使这项任命不只是一次常规人事变动。他对行业的批评也让董事会拥有了一个并非始于机构自我安抚的声音。

不过,这项任命应以结果而非象征意义来衡量。委员会是否能及早获得令人不安的证据?它能否施加影响发布的条件?OpenAI 是否会展示监督何时改变了一项决策?

这些问题将决定 Foundation 是增强了问责机制,还是仅仅扩充了顾问阵容。

对于开发者、企业买家和 AI 用户而言,务实的做法是跟踪这三个信号,而不是将这项任命视为一项已经完成的安全改革。关注未来的框架更新、评估访问权限以及有记录可查的委员会干预。如果这些机制变得更加清晰,Christiano 的回归将标志着 OpenAI 治理前沿风险方式的转变。若它们依然不透明,安全承诺与部署压力之间的核心张力仍将无法化解。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page