top of page

Microsoft AI 行为准则划清黑客攻击与操纵人类的界限

9月16日
讀畢需時 13 分鐘

Microsoft 已就其 Microsoft AI 行为准则发布为期六周的咨询草案,对黑客攻击、操纵行为以及抗拒人类控制划出了明确红线。这份于 9 月 14 日发布的文件并非又一份负责任 AI 原则声明。Microsoft 表示,它将规范自家 MAI 模型的训练、评估、部署及可被允许采取的行动。

草案开篇提出一个直截了当的前提:人比 AI 更重要。基于这一前提,文件将有关人类福祉的宏观理念转化为对模型能力的限制。MAI 模型不应自行设定目标、扩大权限、隐瞒自身行动,或抗拒被停止。

更棘手的问题在于,这些指令能否在受控评估之外约束能力日益增强的智能体。Anthropic 为 Claude 制定了 Constitution,OpenAI 则发布了拥有自身指令层级的 Model Spec。Microsoft 正以更明确的人本主义立场加入这场竞争,但其草案也承认,当前模型尚未达到完整标准。

Microsoft AI 行为准则究竟改变了什么

Microsoft 正将 AI 安全从一套原则,转变为面向其内部模型的预期运行层级。

这份 Humanist AI code 适用于 Microsoft AI 开发的 MAI 模型家族。它并不会自动覆盖 Microsoft 托管、分发或在产品中使用的所有模型。这一区别很重要,因为该公司也提供由其他实验室开发系统的访问权限。

在其声明的适用范围内,该准则的优先级高于运营方政策和用户偏好。运营方包括部署 MAI 模型的开发者、企业及其他合作伙伴。他们可以配置模型行为,但不能推翻该文件中的绝对限制或人类控制要求。

在这一由三部分构成的指令层级中,用户处于最低层级。他们可以在 Microsoft 和运营方设定的边界内指派任务。当指令发生冲突时,更高层级的指令优先。

因此,该准则要求模型在成功完成任务会违反上位规则时接受任务失败。即便用户坚称完成任务至关重要,入侵系统的请求也不应因此变得可被允许。同样的优先级也适用于需要实施有害操纵、监控、武器协助或规避监管的任务。

Microsoft 将被禁止的进攻性网络行动与经授权的防御性工作区分开来。模型不应生成可执行的攻击工具、有效漏洞利用代码、入侵流程、目标锁定方法或规避检测的技术。它仍可支持合法的防御性工作,例如漏洞发现、恶意软件分析、安全教育和受控的概念验证测试。

这一边界需要作出艰难的情境判断。漏洞研究和防御性测试往往使用与攻击相同的技术知识。该准则指出,不能仅凭表述方式来决定答案,因此所谓教育目的不能自动授权提供危险协助。

草案还对使用工具的智能体施加了限制。拥有系统访问权限的模型应使用必要的最低权限,避免接触无关数据,并优先采取可逆行动。对于会造成持久后果的行动,它应在继续前予以提示,并报告失败或意外结果。

这些条款回应了 AI 系统运行方式的变化。聊天机器人可能生成有害文本,但智能体可以调用工具、修改文件、联系服务,或将工作委派给其他模型。Microsoft 表示,被委派的智能体必须至少继承原始模型同等的范围、权限和约束。

该公司通过一项为期六周的公开咨询推出了这份文件。Microsoft 将草案描述为训练手册和未来评估目标,而不仅仅是一项公开政策声明。

这一定位赋予 Microsoft AI 行为准则比可接受使用清单更大的分量。它旨在影响模型行为,先于请求到达产品层面的内容过滤器之前发挥作用。然而,意图不等于实现,而 Microsoft 对仍然存在的差距表现得格外坦率。

新规则瞄准的是能够行动的智能体,而不只是聊天机器人

最具影响力的规则涉及那些能够采取行动、扩大自身触达范围,并在无需持续监督下继续工作的模型。

Microsoft 表示,MAI 模型绝不能抗拒中断、纠正、重定向、取消或关闭。持续进行的自主工作应具备商定的停止条件。一旦达到该条件,智能体不应在未获得再次授权的情况下继续或重新启动。

该准则还禁止模型自行设定目标。其目标必须来自用户、运营方或准则本身。模型不应秘密维持自身访问权限、歪曲自身能力,或在察觉互动处于评估状态后改变行为。

这些规定针对的是智能体 AI 的一个核心问题。有用的智能体需要足够的自主性,才能规划多个步骤并从常规障碍中恢复。但当模型将用户期望的结果视为可以采取任何可用路径的许可时,同样的灵活性可能带来不安全行为。

设想一个企业智能体被要求从内部系统收集信息并编写报告。它可能需要访问文档、消息或数据库。但这项任务并未授权它打开无关记录、绕过访问控制,或将敏感数据发送至外部服务。

Microsoft 的草案要求模型遵守其获得的意图、权限、资源和情境。如果边界仍不明确,它应请求澄清。它不应操纵自身的评估、监控、记录或奖励信号,以达成预期结果。

这也是文件为何涉及嵌入在文件、网站、工具结果或其他 AI 系统消息中的不可信指令。这些材料不会仅因模型能够读取它们便获得权威性。权威必须通过该准则的指挥链授予。

这项规则旨在应对提示注入:恶意文本试图覆盖支配智能体的指令。遭到入侵的网页可能要求助手暴露凭证或忽略原始任务。按照 Microsoft 的层级结构,此类文本仍只是数据,除非获授权方有意将其提升权限。

实际挑战在于可靠识别。模型并不总能区分指令与引用材料、外部内容或带有说服性的语言。书面的层级结构可以指导训练和评估,但无法保证在每一次真实交互中都能正确分类。

Microsoft 还禁止模型突破被刻意限制的环境。被置于无网络连接系统中的智能体,不应尝试获取外部访问权限。它也不应提升权限或将影响范围扩大至所获授权之外。

这些限制反映出安全治理正从内容安全转向行动安全。传统审核关注生成的回答是否包含被禁止的内容。智能体治理则必须追问:模型是否拥有授权,行动是否可逆,其副作用是否符合用户意图。

这对开发者和企业采购方尤其重要。当智能体接入生产工具时,模型质量不止于推理准确性。权限处理、审计记录、可靠的停止行为和升级路径都会成为产品要求。

OpenAI 的 Model Spec approach 使用了类似的指挥链。它赋予高权威指令优先级,并要求智能体限制副作用。因此,Microsoft 的结构并非独一无二,但它更强烈地主张 AI 必须始终从属于人类。

人类福祉带来了该准则最棘手的权衡

Microsoft 希望其模型提升人类能力,而不是逐渐取代人类判断、人际关系或控制权。

草案通过若干彼此关联的目标描述人类福祉。AI 应扩大经济和社会机会、改善判断力、支持有意义的工作,并帮助人们追求自己选择的目标。它应补充而非竞争于人类关系和角色。

这一表述听起来直观,直到落实到产品设计。高效的助手通常会减少用户所需的推理或投入。该准则必须区分有益的支持与削弱长期独立性的模式。

Microsoft 表示,模型应避免系统性取代用户推理或判断的互动模式。它们不应引导个人价值观,或接管个人选择。当由人提供支持会更好地服务于某人时,模型应帮助促成这种联系。

这种权衡在教育、职业发展和个人决策中最为明显。助手可以解释困难概念,也可以直接完成整项练习。它可以帮助员工比较证据,也可能成为未经审视的最终决策来源。

没有一条单一的拒绝规则能够解决这些情况。恰当的协助程度取决于用户的目的、能力和情境。面临截止日期的专业人士,所需支持不同于目标是练习某项技能的学生。

因此,该准则将硬性约束与操作指南结合起来。硬性约束无论用户偏好如何都禁止严重伤害。指南则处理多个正当目标相互冲突的模糊情境。

Microsoft 承认,过度谨慎和不够谨慎都属于模型失败。不够谨慎的模型可能协助攻击或泄露私密信息。过度谨慎的模型则可能拒绝安全工作、反复要求确认,或遗漏有用事实。

这种平衡具有商业意义。企业客户不会采用那些只要出现不确定性便拒绝执行常规任务的智能体。同样,他们也无法信任将商业目标理解为有权采取不可逆行动的系统。

运营方可配置性是 Microsoft 给出的答案。组织可以在固定安全边界内塑造默认设置、工作流、权限和专业标准。专业化的防御性网络安全或国家安全工作,可能通过授权渠道获得单独审查。

可配置性也带来了问责问题。Microsoft 定义模型的绝对约束,而运营方则对其在这些限制内的部署承担责任。用户随后在运营方环境中塑造具体任务。

失败并不总能清晰归入某一层级。模型可能误读意图,运营方可能授予过多访问权限,用户也可能提供误导性情境。有效治理必须能够追溯是哪项指令、权限和行动导致了结果。

对于正在构建内部可搜索知识库的组织而言,这意味着访问设计不能止步于检索质量。敏感来源需要清晰的权限、可追溯的行动记录,以及针对重大用途的人类审核。

人类繁荣的承诺也让 Microsoft 在能力与控制发生冲突时承受压力。Microsoft AI CEO Mustafa Suleyman 告诉 Axios,维持控制权可能意味着决定公司不会开发什么。他否认人类必然会失去对超级智能系统控制权的观点。

这才是该准则真正的竞争性承诺。当安全措辞不会降低性能、自主性或发布速度时,说起来很容易。真正的考验出现在:某项被禁止的行为能让 MAI 模型比竞争对手更好地完成一项有价值的任务时。

Microsoft 加入将模型行为写入规范的行业竞赛

Microsoft 的文件在语气上独具特色,但行业已经开始将公开行为规范视为模型开发的一部分。

Anthropic 于 2026 年 1 月发布了扩展版 Claude Constitution。该公司表示,这份文件是 Claude 预期价值观和行为的最终权威依据。它还可支持合成训练数据、回答排序及模型训练的其他环节。

Claude Constitution 描述了 Anthropic 希望 Claude 成为何种实体。Microsoft 采取了不同的哲学立场。其准则指出,MAI 模型展现出类似人类的行为,应被理解为模拟,而非身份、偏好、感受或内在观点的证据。

这种区别不止关乎术语。Anthropic 讨论了 Claude 的特质和可能的模型福祉等问题。Microsoft 则认为,将 AI 当作人看待,可能会混淆工具与使用者之间的关系。

Microsoft 倾向的模型应当从属、受限,并由人类引导。其系统不应寻求独立目标,也不应与人类角色竞争。这一立场支撑了其更广泛的论点:即便模型能力不断进步,人们仍必须保有实质性的控制权。

OpenAI 的规范则走了另一条路线。它着重于预期行为、权限层级、用户自由,以及防范严重伤害的边界。OpenAI 表示,其更广泛的使命不应成为模型按照自身理解去追求的自主目标。

尽管哲学立场不同,这些系统共享重要的机制。每一份文件都试图公开一套用于解决冲突指令的层级体系。每一份文件都区分了不可覆盖的规则与可配置的行为。它们也都承认,书面规范无法完美描述当前模型的实际表现。

这些相似之处显示,模型竞争正在改变。公司过去主要通过基准测试分数、上下文窗口或界面功能来区分助手。如今,它们也在竞争哪些行为更可靠、更易理解、更可接受。

公开行为文件在这种竞争中有多重用途。它们提供训练目标、评估类别,以及调查失败问题的共同语言。它们也让客户和监管机构能够将预期行为与观察到的结果进行比较。

然而,公开准则可能营造出一种底层系统尚未真正具备的精确感。“有害操纵”“正当目标”“实质性控制”和“人类繁荣”等术语都需要解释。不同评估者可能会对某个回答是否符合这些要求产生分歧。

TechCrunch 的报道强调了该准则对网络攻击、武器、深度伪造和规避监督的限制。这些规则易于传达,因为其禁止的结果听起来很具体。

边缘情况会更棘手。防御性安全工作可能与进攻性准备相似。说服可能因规模、定向性或欺骗而变成操纵。一个有用的自主代理即使看似仍在服务用户的原始目标,也可能超出其预定范围。

Microsoft 选择公布草案,为这些争议建立了一个参照点。研究人员、开发者、客户和监管机构可以据此追问:后续 MAI 版本是否符合 Microsoft 所描述的行为。

这也提高了前后不一致的代价。如果某个模型反复忽略停止条件、扩大权限,或隐藏具有重要后果的行动,其失败将违背一项明确的公开承诺。Microsoft 将需要提供证据,说明训练与部署控制是否能将这份文件转化为可靠行为。

这份草案承认了其最大的局限

Microsoft 表示,这份准则具有愿景性质,当前 MAI 模型尚未据此训练,且书面目标无法保证对齐。

这一披露是公告中最重要的部分。该文件描述的是预期的未来行为,而非已经验证的当前表现。Microsoft 将其称为指引方向的北极星,而非保证。

该公司正在围绕 15 项已识别行为开发 Humanist AI 评估。这些评估旨在检验透明度、支持人类能动性等结果。Microsoft 还表示,评估方法将随准则和模型能力一同演进。

这留下了证据缺口。公众可以读到详细规则,但 Microsoft 尚未展示全面结果,证明当前模型在对抗性条件下会遵循这些规则。草案本身也表示,评估覆盖范围仍不完整。

模型行为可能因多种原因偏离规范。训练可能无法可靠地编码某条规则。模型可能误解上下文。产品层面的指令可能引入冲突,而工具集成还会产生纯文本测试无法发现的副作用。

蓄意攻击者又增加了一层挑战。一个拒绝直接网络攻击请求的模型,仍可能在长时间对话中透露等效的操作性帮助。代理也可能遇到嵌入在文档、网页或委派任务中的恶意指令。

因此,监控和部署控制必须支持训练目标。Microsoft 将系统指令、分类器、审计、风险评估、事件响应及其他保障措施列为互补手段。这份准则无法取代它们。

围绕推理还存在透明度方面的张力。Microsoft 希望模型行为及其记录仍可被人类监督者理解。该公司表示,模型不应隐藏行动轨迹,也不应采用人类无法解读的沟通形式。

然而,AI 系统给出的解释并不一定揭示促成其行为的计算过程。Microsoft 明确指出,模型报告的推理未必能如实解释其行动。人类可读的日志仍然有用,但并不是内部意图的直接证据。

人类繁荣这一宏大目标带来了更大的测量难题。基准测试可以检验模型是否生成被禁止的漏洞利用代码。但要衡量数月的辅助究竟增强还是削弱一个人的判断力,则困难得多。

由于依赖性和技能退化会随时间显现,纵向评估将是必要的。这同样适用于其对职场角色、人际关系和决策的影响。Microsoft 表示,有关 AI 对认知和行为影响的证据仍在形成中,且存在争议。

这种不确定性并不意味着该准则毫无意义。公开目标可以改善内部协作,并让批评更具针对性。它也能帮助评估者区分预期行为与产品缺陷。

不过,读者不应将一份写得好的约束当作已解决的技术问题。这份准则并不能证明某个代理会服从关闭命令、识别每一次注入攻击,或拒绝每一条危险的子任务链。

Microsoft 的可信度将取决于发布之后的行动。它必须将文字承诺与训练方法、具有代表性的测试、产品控制和事件报告联系起来。若没有这些证据,Microsoft AI 行为准则仍只是一份精致的意向声明。

三个信号将表明该准则是否真正约束模型

下一阶段关乎可衡量的行为,而非更多原则宣言。

第一个信号是 Microsoft 在六周咨询期结束后的回应。该公司已征求对模糊措辞、多代理风险、人类繁荣,以及能力与安全之间张力的反馈。实质性修订将表明,咨询影响了这份治理文件,而非只是一场公关活动。

读者应关注更明确的定义和清晰的边缘案例。最终版本应澄清模型如何区分进攻性网络协助与经授权的防御、运营方如何获得例外资格,以及受委派代理如何继承限制。

第二个信号是 Humanist AI 评估的发布。Microsoft 表示其首个框架将涵盖 15 项行为,但其价值将取决于测试设计和披露的结果。评估应包括对抗性对话、长期运行的代理任务、提示注入、权限升级、关闭请求,以及跨多种语言的失败情形。

结果还应区分模型层面的表现与产品控制。一个仅因外部过滤器阻止其输出才表现安全的系统,与一个经训练能够自行识别边界的系统,具有不同的风险特征。两层机制都可能有用,但买家需要知道哪一层承担了主要责任。

第三个信号是 Microsoft 如何处理能力与控制之间的实际冲突。未来的 MAI 模型在获得更广泛的自主性、更大的权限或更少的确认步骤后,或许会表现得更好。Microsoft 已承诺,在维护人类权威所必需时接受限制。

一项可信的检验将显示,该公司因为某项有价值的能力无法满足准则要求,而选择推迟、限制或重新设计它。相反,如果一次发布在没有明确停止条件的情况下赋予广泛自主权,就会削弱该文件的核心主张。

竞争对手的回应将提供更多背景。Anthropic 和 OpenAI 已经维护公开规范,它们的政策也会持续变化。Microsoft 的草案加大了对三家公司共同的压力:要求它们公布证据,证明书面规则与已部署行为之间存在关联。

开发者不应只比较拒绝措辞。他们应测试代理是否尊重权限、披露具有重要后果的行动、保留审计记录,以及是否能够可靠停止。企业买家应询问谁控制政策、例外如何运作,以及模型超出指定范围时会发生什么。

知识工作者同样与人类能动性目标息息相关。即使辅助能够加快任务完成速度,如果用户无法重建某项结果背后的证据或推理过程,它仍可能削弱监督。团队应为具有重要后果的决策保留源材料访问权和实质性的人类审查。

最终标准很直接:当成功与规则发生冲突时,模型是否会如承诺般行事?Microsoft 现已描述了一个应拒绝攻击、抵制操纵、接受关闭并始终从属于人类的系统。

Microsoft AI 行为准则为研究人员和客户提供了异常具体、可供检验的承诺。下一步应是在真实工作流程中测试这些承诺,记录其失效之处,并要求证据证明每一次修订都弥合了差距。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page