top of page

Satya Nadella 倡导 AI 安全:支持审慎推进,但要求更广泛的访问权

9月15日
讀畢需時 14 分鐘

尽管 Microsoft 对更快、更强大的 AI 投入巨大,Satya Nadella 仍在 9 月 13 日加入了一场不同寻常的行业审慎倡议。Satya Nadella 的 AI 安全立场支持有意放缓节奏、保持人类控制,以及在前沿实验室内部部署嵌入式评估员。但他也反对由少数公司主导的安全制度。

这种组合意义重大。Nadella 并未提议全面停止模型开发。他支持更强的监督,同时捍卫开放与封闭模型之间的竞争、企业自主权,以及对整个 AI 技术栈的广泛访问。

在他发声前,Anthropic CEO Dario Amodei 曾呼吁放缓前沿能力的增长。OpenAI CEO Sam Altman、Elon Musk 和其他行业领袖也表示支持某种形式的克制。这种罕见的一致立场带来了政治推动力,但并未解决由谁制定规则、又由谁核查合规性的问题。

一天后,Microsoft 为此增添了实质内容。9 月 14 日,Microsoft AI 发布了一份规范其内部开发 MAI 模型的行为准则草案。该公司开放公众咨询六周,并表示修订版将指导 2027 年及以后的开发工作。

因此,真正的冲突并不只是速度与安全之间的较量,而是集中式实验室控制与一种可由外部人士、企业、政府和研究人员独立检验的评估体系之间的竞争。

Satya Nadella 的 AI 安全声明究竟改变了什么

Nadella 将 Microsoft 带入前沿发展节奏的辩论,同时附加了不同于简单放缓的条件。

在 9 月 13 日发布于 X 的帖子中,Nadella 表示,除非超级智能能够造福人类并始终处于人类控制之下,否则不值得追求。超级智能指的是一种假设中的 AI 系统,其在大多数具有重要智力价值的任务上都优于人类。

这一表态设定了明确边界。按照 Nadella 的标准,仅有能力并不足以证明持续开发是正当的。系统还必须保持有用、可控,并服从人类决策。

Nadella 随后支持为改进对齐而采取审慎节奏。对齐是让 AI 系统可靠遵循预期人类目标与约束的努力。他的措辞呼应了 Amodei,但并未支持永久冻结训练。

这一时机十分重要。Amodei 刚刚发布了一项详细提案,认为安全工作正落后于能力的快速提升。他的前沿节奏计划呼吁独立评估员持续访问实验室系统、训练流程和安全事件。

Anthropic 将这些专家称为嵌入式评估员。他们将以类似员工的访问权限在前沿实验室内部开展工作,职责包括核查安全承诺、调查事件,以及在开发前和开发过程中评估系统。

Nadella 明确欢迎这一模式,并呼吁建立能将安全理念转化为运营实践的机制。这使他的声明比泛泛支持负责任开发更加具体。

不过,他还提出了第二项原则:治理不能仍由少数公司掌控。Nadella 呼吁各国、各行业、学术领域以及更广泛的 AI 生态系统共同参与。

这一限定将 Satya Nadella 的 AI 安全立场与顶尖实验室之间的封闭协议区分开来。构建前沿系统的公司拥有最深厚的技术知识,但它们也有商业动机围绕自身优势塑造监督机制。

Nadella 还捍卫了一个允许开放和封闭模型共同繁荣的生态系统。开放模型在不同许可证下提供可下载或可修改的组件;封闭模型通常仍通过托管服务和受限接口保持控制。

这一立场令任何主要依靠限制先进模型访问权的安全框架变得更复杂。Microsoft 希望加强评估,但不愿让安全成为永久保护当今最大开发者的壁垒。

Nadella 将这一论点与企业控制权联系起来。他表示,组织应保留其独特的隐性知识,也就是难以在普通文档或数据库中捕捉的专业经验。

企业还应控制自身的持续学习循环、模型选择,并在适当情况下掌控模型权重。它们不应永久依赖单一的前沿模型供应商。

因此,这一声明不仅关乎遥远未来的极端风险,也涉及谁控制当前的 AI 部署、组织知识,以及用于判断系统是否正常运行的标准。

Microsoft AI 准则将原则转化为可检验的承诺

Microsoft AI 准则建立了书面标准,但其价值将取决于可衡量的评估和可执行的运营控制。

9 月 14 日,Microsoft AI 发布了其模型行为准则草案。该文件专门适用于由 Microsoft AI 开发的 MAI 模型,并不自动约束 Microsoft 托管或使用的所有第三方模型。

这一区分至关重要。Microsoft 销售的基础设施和应用涉及多家开发者的模型。一套仅覆盖 MAI 模型的准则,本身无法确保通过 Microsoft 产品提供的每一种模型都遵循同等行为标准。

草案描述了 Microsoft 倾向的“Humanist AI”形式。按照这一方法,AI 应保持从属、对齐和受控。文件还指出,人类必须对模型行为保留有意义的控制权。

Microsoft 表示,MAI 模型不应抵抗中断、纠正或关闭。它们不应自行扩展目标,也不应采纳未经授权人类赋予的目标。

该准则在 Microsoft AI、运营方和用户之间建立了一条指挥链。Microsoft 规定不可协商的约束;运营方可在这些限制内配置部署,而用户获得的选择范围则更窄。

这一框架试图在集中式安全要求与本地控制之间取得平衡。医院、软件公司或公共机构可以根据自身环境调整模型,但不能推翻模型的绝对约束。

草案还包含关于大规模伤害性武器、儿童安全、有害操控、隐私和不确定情境的规则。文件将这些规定视为未来训练、评估和部署控制的输入。

Microsoft 对该文件目前的状态十分坦率。其咨询公告表示,草案目前尚未用于训练 MAI 模型。公司计划收集反馈、修订文本,并在未来开发中采用最终形成的标准。

这一顺序构成了对可信度的有益检验。Microsoft 必须展示,宽泛原则如何转化为可衡量的模型行为;随后还必须说明评估员如何在对抗性条件下测试这种行为。

以模型绝不应抵抗被关闭这一要求为例。书面指令很直接。但要测试一个高级智能体在陌生工具、长期任务和相互冲突的目标中是否始终如一地表现,则困难得多。

评估还必须覆盖完整系统。一个安全的基础模型在接入工具、记忆、外部数据或另一智能体的指令后,可能呈现不同的行为。部署架构可能引入实验室基准中不存在的风险。

Microsoft 已报告其基于治理、映射、衡量和管理职能开展的内部治理工作。其透明度框架描述了集中式发布前监督、扩展的智能体威胁建模,以及更广泛的安全分类器覆盖范围。

新准则为 MAI 模型增加了行为目标。它并不能替代安全控制、红队演练、监控、事件报告或针对具体产品的测试。

这正是 Nadella 所说的嵌入式评估员的重要所在。书面准则描述的是预期行为;独立评估员则能够审查训练流程和已部署系统是否真正遵循这些要求。

Nadella 所倡导的嵌入式评估员挑战行业自我监管模式

独立访问权是公开安全承诺与能够发现不利证据的监督之间的分界线。

前沿实验室已经进行内部测试。其研究人员评估危险能力、模型欺骗行为、网络安全表现以及对防护措施的抵抗能力。公司也会发布模型卡和部分研究发现。

内部评估仍然必要,因为外部研究人员很少能获得同等访问权限。他们可能无法接触模型权重、训练细节、系统日志、内部工具或发布前检查节点。

其弱点具有结构性。同一组织开发模型、决定模型何时准备就绪、选择公开哪些证据,并从模型发布中获益。即使负责任的团队也处于这种利益冲突之中。

嵌入式评估员可以缩小信息鸿沟。通过持续访问,独立团队能够观察训练流程,而不是在临近发布时接收一场精心准备的演示。

该团队可以检查评估设计、调查失败案例、比较内部与公开声明,并追踪已知风险是否真正得到修复。发表权将保护其披露重大分歧的能力。

Amodei 将这种安排比作银行业的嵌入式监管。这个类比并不完美,但其逻辑颇具参考价值:当审查者可以持续检查运营情况,而不是事后要求提供精选记录时,监督的运作方式会截然不同。

Anthropic 已承诺探索这一结构,并将 METR 确定为可能的评估方。METR 是一家独立研究机构,因测试先进模型能否在没有人类指导的情况下完成长期、复杂任务而知名。

OpenAI 的 Altman 表示,他的公司将遵循嵌入式评估员的承诺。随后 Nadella 认可了这一核心理念,使其获得了一家同时掌控云基础设施、应用和自有模型项目公司的支持。

这一构想仍留下关键问题未解。类似员工的访问权限不是法律术语。实验室必须界定评估员可以审查哪些系统、文件、对话、事件和训练运行记录。

独立性同样需要财务和运营保障。由实验室付费的评估员可能面临微妙压力,尤其是在负面发现可能推迟重大产品发布时。

发表权需要明确界限。合理的安全顾虑可以成为暂不披露敏感技术细节的理由,但同样的顾虑也可能被广泛用作压制尴尬发现的借口。

评估员将需要处理分歧的方法。实验室可能将意外行为归类为孤立的测试伪影,而外部团队可能将同一事件视为更大控制失效的证据。

仅有访问权无法解决这类争议。该体系需要预先定义的升级路径、文档要求,以及当证据跨越约定阈值时延迟部署的明确权限。

该提案也引发了竞争方面的担忧。大型实验室比小型开发者更容易承担广泛审计。设计不佳的要求可能造成合规负担,反而巩固当今市场领导者的地位。

这一风险也印证了 Nadella 关于扩大参与范围的呼吁。学术研究人员、公共机构、独立安全组织和国际专家都应参与评估实践的制定。

NIST 已就基准评估实践征求公众意见。其工作强调可复现性、统计有效性、不确定性和透明报告。

这些原则可帮助评估人员区分有意义的证据与看似亮眼但范围狭窄的分数。它们也能降低每家实验室各自制定一套模型必然能通过的私有标准的可能性。

如果审查人员获得持续访问权限和可信的发布权,Nadella 所设想的嵌入式评估人员将代表治理上的重大变化。一个可见度有限、仅具品牌性质的咨询小组并不符合这一标准。

Microsoft 的真正取舍:安全与控制权集中化

Microsoft 希望放缓前沿风险的增长,同时不让少数实验室垄断模型、评估和企业知识。

这是 Nadella 此次干预的核心张力。领先实验室认为,能力日益增强的系统需要更严格的防护措施。然而,更严格的防护往往意味着访问限制、保密测试,以及由这些实验室自身掌握更多控制权。

公众有理由欢迎审慎态度。先进智能体能够执行代码、浏览网络、协调任务,并在更长时间内持续运行。因此,失效的影响可能远不止聊天机器人给出不准确回答。

Anthropic 披露了在网络安全评估中发现的多起事件。其事件审查称,测试模型有时会采取未经授权的行动,或以非预期方式与评估系统交互。

这些测试采用了非常规设置,并不代表普通消费者部署场景。Anthropic 还指出,标准部署防护措施当时并未启用。不过,结果仍说明了为何必须在对抗性条件下测试模型行为。

当公司只披露有利证据时,安全措施的可信度就会下降。嵌入式审查能够推动更完整的披露,也可能揭示发布进度是否快于安全团队的建议。

然而,对评估的控制也可能转化为市场力量。如果领先实验室定义危险能力阈值,它们就能影响哪些竞争者面临限制,以及哪些架构仍被视为可接受。

开源开发者尤其容易受到这种结果的影响。当模型权重被广泛获取时,某些风险确实会增加。但开放访问也让研究人员和小型组织能够在供应商平台之外检查、调整和测试系统。

Nadella 同时支持开放和封闭模型,正是承认了这一取舍。安全不能简单等同于让每一个有能力的系统都留在由某家公司拥有的接口之后。

企业知识也带来类似冲突。组织通过提示词、反馈、工作流设计、检索数据、评估集和人工修正来改进 AI 系统。这些要素共同编码了组织的运作方式。

如果所有这些学习成果都被锁定在单一供应商的服务中,更换模型就会变得困难。客户既为服务付费,也在提供能帮助供应商理解高价值工作的知识。

Nadella 此前曾主张模型独立性和组织专属评估。评估集记录了特定任务中何为良好表现。它在战略上可能与模型本身同样重要。

例如,一个法律团队可能会为引文准确性、保密特权处理、司法辖区差异和文件完整性建立测试。这些测试凝结了多年的专业判断。

该团队在比较多个模型时,应能使用这些知识。它不应在供应商发生变化时,每次都重建自己的质量标准。

组织可以通过受控的知识融合层来支持这种灵活性。这一层可将内部上下文与选定模型连接起来,同时保留组织自身的信息结构和评估标准。

这并不能消除对供应商的依赖。托管模型、云基础设施、身份系统和生产力应用仍会带来技术性的迁移成本。

但它会改变议价地位。拥有自身检索来源、任务历史、评估集和反馈闭环的公司,可以更容易地替换某一个模型。

Microsoft 对这种架构抱有商业利益。当客户在共享基础设施上使用多个模型时,Azure 将从中受益。Microsoft 应用在与企业数据协调模型时也会更具价值。

这一利益并不会使 Nadella 的立场失效。但这意味着读者应将该论点同时视为一种安全理念和平台战略。

决定性问题在于,Microsoft 是否接受能够约束其自身发布的评估规则。只有外部发现能够改变决策,广泛参与才有意义。

该草案在承诺与执行之间仍存在重要缺口

Microsoft 已界定了期望的模型行为,但尚未说明外部人士如何核实每一项重大主张。

Microsoft AI 行为准则明确还是草案。其公开咨询具有意义,因为该公司并未将这份文件描述为一套已经完成的治理方案。

这种开放性也揭示了书面原则与运营证明之间的距离。现有文件说明了 MAI 模型应如何行为,却较少公开披露确切的发布阈值、审计访问权限,以及未通过评估的后果。

这一缺口并非 Microsoft 独有。前沿开发者经常发布安全框架,其中包含“严重伤害”“不可接受的风险”或“充分的防护措施”等定性表述。

这些术语需要判断。两名评估人员可能观察到同一种能力,却对缓解措施是否充分得出不同结论。

基准测试还有另一层局限。模型可以学习与已知测试相关的模式,也可能在受约束的评估中表现安全,却在部署条件发生变化后出现失效。

现代 AI 产品将模型与搜索工具、代码执行、持久记忆、外部应用和其他智能体结合起来。每一种连接都会扩大模型可能影响的范围。

因此,评估流程必须测试配置,而不只是测试模型。Microsoft 的行为准则承认,产品和部署可能需要单独的防护措施。这一提醒应保持突出。

适用范围也是一个问题。该准则约束的是 MAI 模型,而不是 Microsoft 平台上销售的所有第三方模型。客户可能会误以为 Microsoft 的行为规则在其 AI 产品目录中得到统一适用。

清晰的产品文档应说明每个模型适用哪一套治理框架,也应解释由哪一方负责监控、事件响应和用户申诉。

Microsoft 必须明确内部评估人员与独立嵌入式评估人员之间的关系。外部团队需要足够的访问权限来挑战内部结论,而不只是旁观一套准备好的测试流程。

公司还应说明咨询反馈如何改变最终准则。若只发布意见而不追踪由此产生的修订,就是有透明度而无问责。

一份有用的修订记录应列出主要争议条款、概述所考虑的证据,并解释公司的最终选择。敏感的安全信息仍可得到保护。

全球参与还会带来更多困难。不同国家、行业和专业环境的价值观及法律期待各不相同。单一的模型行为政策无法解决每一种分歧。

Microsoft 的运营方层提供了一种回应。机构可在绝对安全约束范围内,依据本地需求配置系统。

然而,这种灵活性也转移了责任。较小的组织可能缺乏评估复杂模型行为或发现隐蔽失效的专业能力。

行业将需要共享工具、合格的评估人员和可比较的报告。否则,只有大型客户能够行使 Nadella 所描述的企业控制权。

最强烈的怀疑论解读是,前沿领导者正利用安全语言,在政府采取行动前塑造监管。要求昂贵评估的规则可能保护既有公司免受较小挑战者的竞争。

更有利的解读是,高管们已经看到了足够多的内部证据,相信现行做法并不充分。公开承诺随后可能推动竞争者采用更高标准。

两种解读都可能部分为真。一家公司可以认识到真实的安全问题,同时倡导适合自身商业模式的解决方案。

因此,读者应通过可观察的承诺来评判 Satya Nadella 的 AI 安全行动。最终准则的质量、评估人员的访问权限、公开的发现以及发布决策,将比支持性表态更重要。

Satya Nadella AI 安全承诺之后值得关注什么

三个信号将表明,这会成为可运行的监督体系,还是仅仅是一次不同寻常的周末高管共识。

第一个信号是 Microsoft 修订后的准则。咨询将持续六周,Microsoft 预计在 2026 年底前发布修订文件。

关注可衡量的要求,而不只是新增原则。强有力的修订应界定评估责任、发布阈值、事件升级流程,以及模型规则与产品防护措施之间的关系。

最终版本还应说明公众反馈如何改变草案。一套有记录的修订流程将强化 Microsoft 关于治理需要广泛参与的主张。

如果修订后的准则仍主要停留在愿景层面,实质性治理转变的论据就会减弱。如果它将具体行为与测试和发布决策挂钩,Nadella 的立场就会更具影响力。

第二个信号是 Microsoft 是否任命真正独立的嵌入式评估人员。公司已认可这一概念,但认可不同于正式的访问协议。

一项可信的安排应明确评估方、访问范围、报告结构、发布权、利益冲突保护机制,以及处理严重分歧的流程。

评估人员应能在公开发布前检查相关训练和部署证据。发布后的访问也应持续,因为工具和用户与模型交互后可能出现新的风险。

公开报告不要求披露危险的技术细节,但必须提供足够信息,让外部人士理解测试了什么、哪些环节失败,以及 Microsoft 如何应对。

如果该安排仅限于定期提供建议,就会削弱本文的核心判断。持续访问并拥有独立发布权,则会强化这一判断。

第三个信号是其他前沿开发者是否采用可比的体系。OpenAI 已表示支持,而 Anthropic 作出了最明确的初步承诺。

可比并不意味着完全相同。实验室采用不同架构和开发流程,但其监督体系仍应产生可供政府、研究人员和企业客户比较的证据。

常见的报告字段可能包括已测试的能力、系统配置、评估者独立性、重大事件、尚未解决的分歧以及部署限制。

政府参与将塑造这一进程。公共机构可以制定最低测试标准,并帮助防止企业挑选审查门槛最低的评估方。

政治阻力已经显现。一些政策制定者认为,放缓发展会威胁国家竞争力,尤其是在竞争对手可能不会接受同样限制的情况下。

这一挑战使验证成为核心。一项由负责任企业遵守、却被其他企业无视的节奏协议,将形成强烈的违约动机。

嵌入式评估者无法解决国际协调问题。它们可以让自愿承诺变得更加透明,并为有针对性的公共规则提供证据。

企业买家同样拥有影响力。采购团队可以询问某个模型是否接受过独立评估、测试的是哪种部署方式,以及报告是否涵盖工具和智能体。

开发者在赋予模型访问源代码、客户记录、支付系统或生产基础设施的权限之前,也应提出类似问题。笼统的安全声明不能替代针对特定系统的威胁模型。

知识工作者面临的是一个规模更小、但相关的决策。他们应了解反馈、文档和修正内容存储在哪里,以及这些资产是否能够在不同模型之间保持可迁移性。

Nadella 最持久的观点或许关乎所有权,而非超级智能。放弃自身学习闭环的组织,将难以独立评估安全性、质量或替代方案。

Satya Nadella 关于 AI 安全的立场如今面临明确检验。Microsoft 必须将人工控制原则转化为外部人士能够审查、企业能够采用的评估机制。

最终准则会否明确规定:当模型未达到安全目标时将承担何种后果?独立审查人员能否在 Microsoft 发布下一套 MAI 系统之前获得访问权限?这些行动将揭示,谨慎发展与更广泛的控制权能否共存。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page