Sam Altman 的 AI 风险言论划清了 OpenAI 与 Anthropic 的界线
OpenAI CEO Sam Altman 在 10 月 4 日接受了一项鲜明的权衡:只要人们能够保有使用这项技术的权利,一些有害的 AI 事件就是可以容忍的。Sam Altman 的 AI 风险论点并非随口预测失败终将发生,而是公开主张:即使可预见滥用、诈骗和安全事件,仍应允许广泛部署。
Altman 也为这一立场划下了明确边界。他表示,OpenAI 不会接受灾难性风险,包括人类对 AI 失去实质控制。他的论点因此建立在部署前区分可管理伤害与不可接受危险之上:控制前一类风险,且不让它滑向后一类。
这一区分让 OpenAI 与 Anthropic 在 AI 政策中最关键的问题上形成对立。两家公司都支持保障措施、测试和一定程度的政府参与。然而,对于能力日益增强的系统仍可被广泛使用时,社会应容忍多大程度的不确定性,双方看法不同。
这场争论并不只是关于 AI 是否安全,而是关乎谁来界定可接受的风险、谁来承担后果,以及开发者在发布系统前应提供多少证据。这些问题如今关系到每一家围绕 AI 构建关键工作流的企业、开发者和知识工作者。
Sam Altman 的 AI 风险言论明确了这种权衡
Altman 将行业中默认的一项交换条件变成了明确的政策立场:访问权和个人自主权,足以证明容忍一些非灾难性伤害是合理的。
在接受 Politico 科技通讯 Decoded 采访时,Altman 表示,世界应以接受一些不良后果为代价,换取 AI 带来的益处。他将这种容忍直接与人们保有自主权及广泛使用技术的机会联系起来。
Reuters 的报道将诈骗、大规模黑客攻击和滥用列为这项争议性权衡中的例子。Altman 拒绝以将控制权集中于一家 AI 实验室为代价,来消除这些后果。
他的推理始于一个熟悉的科技政策问题:一个系统可以带来显著的整体收益,同时也会促成个别的欺诈、错误或滥用事件。若要消除每一起事件,可能需要采取同样会阻碍正当用途的限制措施。
Altman 相信,用户产生的有益活动将远多于有害活动。基于这一判断,OpenAI 倾向于采用他所说的较轻监管方式。这种方法允许技术广泛使用,同时依靠保障措施、监控、执法以及社会提升韧性的能力。
这番表态之所以重要,是因为它用更具体的立场取代了关于平衡创新与安全的模糊措辞。OpenAI 承认,其偏好的部署模式无法防止每一起有害事件。它主张,要求零伤害将带来不可接受的代价。
这并不意味着 OpenAI 认为所有风险都可以容忍。Altman 将滥用和犯罪活动,与涉及失控的灾难性失败区分开来。他一再表示,后者需要更严格的保障措施,并在必要时放缓开发。
由此形成了两个风险阈值。在较高阈值以下,社会接受事件发生,同时开发者和机构持续改善防御能力。超过该阈值后,公司必须阻止开发或部署,直到能够有力证明人类仍保持控制。
困难之处不在于提出这些阈值,而在于决定一个类别在哪里结束、另一个类别从哪里开始。
大规模欺诈活动或许可以依据现有法律起诉,但高度智能的自动化系统可能将其规模扩大到常规执法能力之外。网络工具可能协助防御研究人员,继而帮助攻击者入侵关键基础设施。
同一种底层能力可以在有益和有害的情境之间转换。访问控制、监控、模型行为和用户意图决定了实际结果。
因此,Altman 的论点不仅需要对整体收益抱持乐观,还需要具备能在可管理事件演变为系统性失败前侦测伤害升级的制度能力。即使在较轻监管模式下,这一责任也部分落在 OpenAI 身上。
这番表态也留下了一个重要问题尚未回答:如果社会必须接受一些有害事件,谁来决定哪些伤害仍属可接受范围?
开发者可以估算整体收益,但未必承担欺诈、歧视、安全漏洞或职业替代造成的损失。对一个平台而言可容忍的失败率,对受影响的个人来说仍可能是毁灭性的。
Altman 已阐明 OpenAI 的理念,但尚未提出一套公开公式来分配其代价。
OpenAI 与 Anthropic 对谁应承担不确定性存在分歧
OpenAI 与 Anthropic 的冲突,根本上关乎不确定性应由用户和机构承担,还是留在受控的开发环境中。
Altman 表示,尽管 OpenAI 与 Anthropic 存在共识领域,两者之间仍有“很大差距”。当两家公司分别描述前沿 AI 带来的风险时,这种距离就更加清晰。
前沿模型是接近当前最高可用能力水平的系统。这类模型能够进行复杂推理、使用软件工具,并在更长的工作流中采取行动。随着能力扩展,其行为也可能变得更难评估。
Anthropic 围绕结构化安全承诺,以及在保障措施跟不上时愿意放缓部署,建立了其公众形象。其安全路线图描述了涵盖安全、对齐、评估和政策的技术目标。
这一框架将更大比例的不确定性置于开发者的控制之内。在让用户和机构接触行为尚未充分理解的系统之前,公司应测试、约束或延后该系统。
OpenAI 同样会进行评估并实施部署保障措施。不过,Altman 的言论更强调公众访问、实验以及个人决策。社会在有用应用同步发展的过程中学习管理问题。
两种立场都不等同于毫无限制的部署,也不等同于永久暂停。区别在于,当证据仍不完整时,默认应如何应对。
Anthropic 的方法倾向于在广泛接触前要求更强的证据。OpenAI 的较轻监管立场则允许更多接触,除非系统带来可信的灾难性危险。这些默认选择可能导致不同的发布时间表、访问规则和监管提案。
这场分歧也反映了对权力集中的竞争性理论。Altman 主张,若通过将先进 AI 置于一家实验室控制下来防止滥用,本身会制造不可接受的危险。一家私营公司将事实上决定谁能获得这项技术的益处。
这种担忧不容忽视。限制高能力模型可能强化既有实验室、限制独立研究,并使较小公司依赖少数供应商。它还可能使政府和公众更难了解重要系统。
然而,广泛访问带来的能力扩散速度快于问责机制的发展。组织可能在审计机构、监管者、保险公司和法院形成可靠评估方式之前就部署 AI。用户可能只有在系统进入敏感工作流之后,才发现其失效模式。
Anthropic 的谨慎同样无法消除权力集中。若一家公司主张只有少数开发者能够安全处理先进系统,也可能巩固自身地位。安全规则可能成为较小竞争者难以承担的壁垒。
Associated Press 的分析指出,安全论述除了反映真实风险担忧外,也可能推进政治和商业目标。领先实验室可以影响那些只有自己特别具备能力满足的标准。
这并不会否定它们的警告,而是意味着其政策建议应与其宣称的意图分开评估。
最强有力的监管设计应避免两个极端。它不应让实验室在缺乏审查的情况下自行将其工作标为安全,也应避免赋予既有公司对先进能力的永久控制权。
独立评估、事件报告和基于能力的规则提供了一条可能的中间道路。它们可以根据系统能够做什么来设定义务,而非根据由哪家公司开发。
争议仍未解决,因为可靠的评估方法仍在发展。在它们改进之前,两种做法都需要人们信任出售访问权的公司所作出的决定。
真正的分歧在于普通伤害与灾难性风险
只有当普通滥用能够被及早、可靠且独立地与灾难性风险区分开来时,OpenAI 的立场才站得住脚。
Altman 并不认为每一种收益都能证明每一种危险是合理的。9 月,他在联合国安全理事会表示,即使只是很小的失控概率也不可接受。
他的联合国发言描述了两大危险:其一,是系统发展过快,以致人们无法理解或阻止;其二,是过多权力集中在一家公司、政府或小团体手中。
这构成了 Sam Altman AI 风险立场背后的核心张力。OpenAI 希望既避免失控,也避免将 AI 置于狭窄机构控制之下的安全制度。
公司的首选路径取决于风险分类。由 AI 制造的诈骗可能被视为使用新工具实施的传统犯罪;能够自主开发针对关键基础设施攻击手段的系统,则属于更严重的类别。
当规模改变伤害的性质时,边界便变得模糊。一条欺骗性信息属于普通风险;数百万条由系统自动生成并适配的个性化信息,则可能挑战现有执法体系的承载能力。
网络安全也面临同样的问题。能够识别软件漏洞的模型可以帮助防御者修复漏洞;在不同的访问权限和指令下,这种能力也可能帮助攻击者利用大量系统。
OpenAI 的Preparedness Framework跟踪包括网络安全、生物威胁和 AI 自我改进在内领域的严重风险。该框架区分高能力与关键能力,并要求系统跨越这些阈值时采取更强的保障措施。
这一框架很重要,但它并未解决治理问题。OpenAI 内部的安全咨询小组审查证据,并建议保障措施是否已充分降低严重风险。公司领导层保留最终部署决定权。
这种结构提供了专业审查,但并非完全独立。评估风险的公司同时控制产品时间表,并从部署中获益。
OpenAI 表示,外部评估和公开报告可以强化这一流程。其治理材料呼吁进行第三方测试、发布模型报告、开展事件响应,并接受董事会安全委员会的监督。
当外部人士获得有意义的访问权限时,这些机制才更具可信度。评估者需要足够的时间、系统访问权限和技术信息,才能测试真实场景下的行为。受限的演示无法揭示模型、工具、记忆和网络之间的每一种危险互动。
时机同样重要。在部署后发布的独立报告能够告知公众,却无法阻止首次有害发布。有效的监督必须在访问范围扩大之前影响决策。
第二项挑战涉及部署后的学习。Altman 的方法假定,社会能够发现并纠正非灾难性故障。这要求快速报告,并愿意在证据发生变化时修改或撤回系统。
许多 AI 事件仍难以比较,因为各家公司披露它们的方式不同。用户可能无法识别与模型相关的故障,组织也可能犹豫是否报告数据泄露或代价高昂的失误。因此,监管机构获得的只是对总体危害的不完整视图。
较为宽松的制度必须以更强的透明度作为补偿。否则,公司可以将反复出现的危害归类为孤立事件,而外部人士则缺乏挑战这一结论所需的数据。
关键问题并不是零风险是否存在。它并不存在。问题在于,开发者能否发现那些熟悉的危害何时正在叠加,形成新的系统性危险。
较宽松的监管仍需可衡量的问责机制
只有当被接受的风险类别具备可执行的边界、可见的证据以及对受影响者的补救措施时,接受一定风险才是合理的。
Altman 的论点类似于围绕许多通用技术形成的社会契约。汽车、药品、金融系统和互联网在带来巨大收益的同时,也会造成真实伤害。社会对它们进行监管,却不要求绝对安全。
不过,这些契约包含衡量故障并分配责任的制度。车辆面临设计标准、召回、事故调查和责任追究。药品则需要证据、不良事件报告以及持续监测。
AI 治理仍缺乏定论。能力评估尚无统一标准,而当开发者加入工具、指令或新的数据连接时,模型行为可能发生变化。一个单独看来安全的系统,嵌入实际工作流程后可能表现不同。
这对自主代理尤其相关。代理是一种能够利用工具规划并执行多项行动的 AI 系统。其风险取决于权限、周边软件以及错误行动造成的后果。
聊天机器人出错或许只会给一名用户带来不便。若代理能够访问电子邮件、代码仓库、财务记录或生产系统,同样的错误就可能演变为组织层面的事件。
因此,在各国政府解决这一更宏大的问题之前,企业不能将 OpenAI AI regulation debate 视为抽象的政策分歧。它们必须决定,在赋予 AI 系统多少权限方面应设定何种界限。
实际控制措施包括限制权限、对重大行动要求人工批准、记录活动日志,以及测试恢复程序。组织还应将低风险的生产力任务,与涉及资金、基础设施、法律决策或个人数据的行动分开。
这些措施并不要求拒绝广泛访问。它们承认,访问模型与获得行动许可是两项不同的决定。
知识工作者面临相关挑战。AI 可以总结文档、检索上下文并起草决策,但看似自信的输出可能掩盖缺失的证据。用户在依赖某项主张前,需要访问其背后的源材料。
可检索的个人知识库可以帮助保留这条证据链。它无法确保 AI 的回答正确,却能让人们更容易依据已知文档核查主张。
政策层面的对应概念是可追溯性。开发者应披露系统测试了哪些内容、哪些保障措施仍在生效,以及哪些类型的事件会触发干预。监管机构需要足够的信息,才能比较承诺与实际观察到的行为。
问责还必须包括补救措施。如果 AI 赋能的诈骗伤害了消费者,关于总体收益的宽泛表述几乎无法带来慰藉。受害者需要报告渠道、调查以及追回损失的机制。
开发者不应自动为涉及其系统的每一起恶意行为承担责任。然而,可预测的滥用模式所带来的义务,比罕见且不可预见的误用更强。
一家观察到反复规避行为的公司,不能无限期地将每起事件描述为孤立的用户违规。它必须改进控制措施,或解释为何继续开放访问仍有正当性。
政府也承担相应角色。规则应针对可衡量的能力和有害行为,而非规定某一种技术设计。它们也不应仅因公司维持内部安全计划便给予豁免。
Associated Press近期报道的一项自愿协议包括内部控制、外部审计和董事会层面的审查。这些措施构成了有用的框架,但自愿承诺依赖于一致的执行与披露。
审计的力度取决于其范围、访问权限和后果。监管机构和客户需要知道,审计人员能否质疑发布决策,以及未解决的发现是否会推迟部署。
OpenAI 的较宽松方法可以支持真正的问责。宽松监管不能意味着对风险的隐形接受,或责任界定不清。
OpenAI 自身的安全承诺令其论点承压
对 Altman 最有力的挑战,恰恰来自 OpenAI 自己发出的警告:前沿系统需要异常严格的控制。
OpenAI 近期以需要超越普通消费者保护的措辞描述能力日益增强的模型。其安全出版物讨论了自主行为、网络能力、监控、遏制以及失去控制的可能性。
这些担忧未必与 Altman 的立场矛盾。他区分了严重滥用与灾难性危险,并支持对后者采取更强干预。然而,当公司一面警告非同寻常的风险,一面反对更严格监管时,这一区分在政治上会变得困难。
公众必须信任 OpenAI 能够判断模型何时越过界限。这种信任取决于证据,而非一再保证公司理解自身责任。
Altman 曾对联合国表示,公司不应取代民主程序。他还呼吁建立共同的国际标准、事件报告机制,以及用于评估保障措施的共享方法。
这些立场比“较宽松的监管”这一表述所暗示的更具干预性。OpenAI 似乎支持针对前沿风险的规则,同时抵制限制访问或规定发布时间表的广泛限制。
这可以构成一套连贯的政策。狭窄而严格的规则可以适用于灾难性能力,而现有法律和有针对性的保障措施则处理一般滥用。
然而,这一模式会激励人们将不确定风险归类在最高门槛之下。灾难性认定可能延迟发布、增加成本,并引发监管审查;一般风险认定则保留灵活性。
因此,独立评估至关重要。开发者应提供技术证据,但不应对分类拥有排他性权力。
OpenAI 的框架还包含竞争调整条款。该公司表示,如果另一家开发者在没有相当保障措施的情况下发布高风险系统,它可能会调整要求。它承诺在这样做之前公开确认并进行审查。
这一条款反映了真实的协调问题。一家负责任的公司无法控制每一位竞争对手的行为。如果危险能力仍可在其他地方获得,严格的单边保障措施可能失效。
它也可能引发一场潜在的安全竞赛。每家公司都可以将另一家开发者的发布视为风险环境已经变化的证据。标准随后会通过一连串各自理性的决定而被削弱。
Anthropic 倾向的回应是在这种螺旋开始前加强协调。OpenAI 的回应则更强调在竞争环境下仍能保留访问权限的保障措施。
两条路径都无法消除商业压力。投资者、客户、员工和政府都会奖励先进能力。安全团队所在的机构,都有强烈动力去发布产品并确立市场领导地位。
这正是为什么公开承诺必须与可观察的行动相连。公司应说明评估何时推迟了发布、出现了哪些缺陷,以及哪些变更解决了这些问题。
OpenAI 表示,当保障措施落后时,它曾放缓开发。这是相关证据,尤其是在配合技术文档的情况下。不过,外部人士仍需要足够细节,才能评估最终控制措施是否解决了最初的危险。
对 Altman 论点的怀疑性解读很直接。“一些坏事”可以变成一个灵活类别,容纳除可见灾难之外的每一种失败。
更站得住脚的解读则更为狭窄。常规法律和适应性保障措施处理有边界的滥用,而严格的能力门槛则阻止后果不可控的系统。
未来 OpenAI 的决定将决定哪一种解读更符合现实。这次采访确立了一种理念,但部署选择将揭示其实际边界。
三个信号将检验 Sam Altman 对 AI 风险的立场
下一项检验是,OpenAI 是否会将其风险理念转化为外部人士能够在危害累积之前评估的发布规则。
第一个信号是独立模型评估的质量。OpenAI 一直支持第三方评估,但有意义的独立性需要访问权限、时间和权威。
应关注评估者是否测试完整系统,而非孤立模型。工具使用、记忆、网络访问和组织权限,能够改变同一底层能力的后果。
还应关注披露的时机。在广泛部署前公布的评估能够影响发布决策;事后发布的报告主要记录公司已经做出的选择。
强有力的独立测试将强化 Altman 的主张,即灾难性风险可以与可接受风险区分开来。访问受限或报告延迟则会削弱这一主张。
第二个信号是 OpenAI 如何报告真实事件。其较宽松的立场假定,社会能够在不放弃广泛访问的情况下从失败中学习。
这种学习需要对欺诈、安全漏洞、未经授权的行动、有害操纵和规避保障措施采用一致的分类。它还需要足够细节,以识别跨产品和用户反复出现的模式。
原始事件数量无法说明全部情况。更多用户自然会带来更多报告,而更好的检测能力可能暂时让表现看起来更糟。有效披露应包括严重程度、复发情况、受影响的能力以及公司的应对措施。
一份透明的遏制与纠正记录将支持 OpenAI 的论点。披露稀少则会使公众无法判断所谓有边界的危害是否仍然有边界。
第三个信号是 OpenAI 与 Anthropic 之间的政策差距。尽管双方在访问范围和监管力度上存在分歧,但两家公司近期都支持安全测试和一定程度的政府监督。
具体的立法立场比访谈更能清楚地揭示差异。应关注每家公司如何回应强制评估、事件报告、审计人员访问权限、责任认定,以及政府延迟发布的权力。
如果 OpenAI 支持可强制执行的灾难性风险阈值,同时反对广泛的访问限制,其立场将显得前后一致。如果它同时反对访问限制和独立执法,“较轻监管”就更像是自我监管。
Anthropic 也面临自身的考验。它必须证明,更严格的控制措施能够降低风险,而不只是巩固最大型实验室的优势。当较小开发者的系统不具备前沿级能力时,安全要求也应当是其能够实现的。
更广泛的讨论不应将任何一家公司视为中立的裁判。两者都拥有重要的技术知识、商业利益以及偏好的监管结果。
开发者和企业买家应追踪这些信号,因为政策最终将影响产品访问、合规义务和系统设计。等到最终立法出台才采取行动,会让组织暴露于它们其实早已了解的风险之中。
他们可以先根据后果对 AI 的使用进行分类。起草、搜索和摘要需要核验。金融操作、生产变更以及涉及人员的决策,则需要更严格的审批和审计控制。
团队还应保留 AI 生成工作周围的来源上下文。结构化的 AI 工作流可以将证据、决策和生成的摘要关联起来,以便日后审查。
Sam Altman 关于 AI 风险的论点要求社会接受不完美,但不接受灾难。这是一个合理的目标,但并非完整的治理体系。
决定性的问题是,OpenAI 能否在部署前界定可接受的伤害,在之后检测风险升级,并将这两项判断都交由可信的外部审查。在此之前,广泛访问仍是一项政策选择,其成本远远超出了作出这一选择的公司所能承担的范围。
组织现在应当提出一个实际问题:如果 AI 系统明天在你的工作流中失效,你能否识别发生了什么、限制损害,并在不依赖模型提供商保证的情况下恢复?



