中国人工智能安全治理框架3.0将重点转向智能体与控制
中国于9月14日发布《中国人工智能安全治理框架》3.0版,这是该框架三年内的第三次修订。该文件延续了中国以风险为基础的治理模式,但将关注点转向人工智能智能体、现实世界系统,以及人类失去控制的风险。这一变化意义重大,因为人工智能正从生成答案转向执行行动。
国家网络安全标准化委员会,简称TC260,在济南举行的2026年中国国家网络安全宣传周开幕期间发布了该框架。国家互联网信息办公室(CAC)指导了其制定工作。
该文件并非一部新法律,也不会自动对人工智能公司施加新的处罚。它的重要性来自其他方面。TC260框架能够影响技术标准、测试实践、行业指引,以及监管机构对开发者和服务提供商提出的预期。
3.0版发布之际,距该框架纳入更广泛的社会和伦理风险已过去一年。中国如今正将同一治理模式延伸至能够使用工具、访问文件、与其他服务通信,并在更少直接监督下采取行动的系统。
这形成了核心张力。中国希望人工智能在企业和公共服务中扩大应用,同时坚持让自主性不断增强的系统保持可预测、可追溯,并能够接受人类干预。
中国人工智能安全治理框架3.0有哪些变化
该框架将自主行动,而非更出色的对话能力,视为下一轮人工智能部署周期的决定性安全问题。
根据框架官方发布,TC260保留了早期版本中的三项要素:风险分类、技术应对措施和综合治理。它更新了这一结构中的风险内容,并调整了建议的应对方式。
这种延续性很重要。3.0版并非对中国既有做法的否定,而是试图将同一做法应用于拥有更广泛访问权限、更长运行周期,以及在聊天窗口之外产生更大影响力的系统。
该文件指出,人工智能应用正从专业场景扩展到主流使用。它列举了工作助手、个人助手和支持智能体的手机等示例,也区分了回答问题的系统与执行任务的系统。
人工智能智能体是能够感知信息、保留上下文、作出决策、调用工具并朝着目标执行步骤的系统。这些能力能够减少日常工作,但也会带来更长的潜在故障链条。
聊天机器人可能给出错误答案。智能体则可能接受该答案、打开一项服务、更改记录、发送信息,或在人员察觉错误前触发另一项流程。
因此,3.0版对智能体风险作出了更明确的处理。其人工智能智能体风险管理附件覆盖系统全生命周期,从开发和部署直至运行和退出。
该框架要求组织审查智能体读取什么内容、信任哪些指令、能够调用哪些工具,以及其行动是否仍处于用户请求的范围内。这些问题关注的是输出背后的过程,而不只是输出本身。
这一区别改变了安全评估的方式。即使最终报告看似准确,智能体也可能在生成过程中泄露了机密数据。即使一笔已完成的交易表面上有效,恶意指令也可能已将工作流中的某一步重定向。
提示词注入说明了这一问题。提示词注入攻击会在人工智能系统处理的内容中植入隐藏或欺骗性的指令。浏览网页的智能体可能将这些指令理解为命令,即使用户从未批准它们。
该框架还讨论了受损插件、被操纵的工具响应、过度权限和不可靠记忆带来的风险。当系统能够在未经确认的情况下采取行动时,每一项弱点都会变得更加严重。
具身智能也受到更多关注。这一术语涵盖与能够感知或影响现实世界的机器相连的人工智能,包括机器人、车辆和工业设备。
一旦软件能够控制实体设备,网络安全故障就可能演变为安全事故。一条被操纵的指令可能影响移动、生产、访问控制或设备运行。
该文件还将递归式改进和自我加速发展列为需要保持警惕的问题。它并未声称当前系统已经脱离人类控制,而是认为更快速的自主优化值得持续测试与监督。
最终形成的是一个通过新型运行现实加以阐释的人工智能安全框架。模型行为依然重要,但权限、工具、连接、记忆和物理访问如今也被纳入安全边界之内。
中国为何再次更新人工智能治理手册
连续三年发布表明,中国将人工智能治理视为一个不断演变的技术过程,而不是一份可以多年保持不变的政策文件。
TC260于2024年9月发布第一版。该版本梳理了涉及模型、算法、数据、系统、网络安全、物理安全、认知和伦理的风险。
第一版框架确立的原则至今仍塑造着这一系列。它在优先推动创新的同时,呼吁采取包容、审慎、风险导向和合作式的治理。
2.0版于2025年9月15日发布。它保留了原有结构,但增加了一类衍生风险,即因人工智能广泛使用而产生的更广泛后果。
这些风险包括对就业、社会结构、资源需求、教育、人际关系和环境的影响。第二版还更明确地增加了可信使用和防止失控的原则。
关于第二版框架的官方解读称,其中包含14项综合治理措施和4项安全指引。它还将科技伦理更牢固地纳入人工智能生命周期之中。
3.0版在这一基础上发展,而非另建一套分类体系。其发布时间反映出部署对象已发生多大变化。
许多生成式人工智能产品曾以孤立界面的形式运行。用户输入提示词,模型返回文本,然后由人们决定下一步行动。这种分隔正在消失。
智能体如今可以搜索内部文档、调用软件接口、编写代码、操作浏览器、准备消息,并协调多步骤任务。即便是有限程度的自主性,也会增加系统在人类检查节点之间作出的决策数量。
中国2026年的政策工作已预示这一转变。5月,CAC、国家发展和改革委员会以及工业和信息化部发布了人工智能智能体实施指引。
智能体指引将智能体定义为具备自主感知、记忆、决策、交互和执行能力的系统。该指引还列出了覆盖科研、产业、消费服务、公共福利和社会治理的19个应用场景。
该文件在强调安全、可控和标准化发展的同时推动应用。3.0框架则为同一方向提供了更广泛的风险管理层。
这就是为何此次更新不只是年度政策维护。中国正试图在智能体成为敏感领域常规基础设施之前,确立相应的安全预期。
该框架将政府、金融、教育、广播、医疗保健和应急管理列为需要行业专项指引的领域。单一的横向规则无法涵盖这些环境中故障所造成的不同后果。
不可靠的购物助手或许只会浪费消费者的时间。不可靠的医疗或应急管理系统则可能影响涉及健康、公共资源或即时安全的决策。
因此,中国人工智能治理将通用原则与更细化标准的规划结合起来。该框架描述风险,后续标准则可将其中选定部分转化为审计机构和测试组织能够评估的要求。
这种分层结构也使政策能够在不重写每一项具有约束力规则的情况下进行调整。监管机构可以随系统行为变化更新技术指引,随后将选定控制措施纳入标准或行业法规。
对企业而言,这一节奏带来了实际负担。为文本模型设计的安全审查,可能无法覆盖使用外部工具的智能体。为一次部署设计的审查,也可能在权限、集成或运行规模发生变化后变得不完整。
3.0版通过敏捷治理应对这一问题。风险评估应考虑应用场景、系统智能水平和部署规模,并随这些条件变化而调整。
连续年度发布所传递的政策信息不难理解。部署能力更强的系统,意味着必须重新审查安全论证,即使底层模型名称保持不变。
核心权衡是创新与可验证控制之间的平衡
中国希望组织部署有用的智能体,但也要求它们证明自主性在整个任务过程中始终受到边界约束。
该框架将创新描述为优先事项,并支持包括监管沙盒在内的受控试验。监管沙盒允许选定产品在有限条件下运行,同时由主管部门和开发者观察风险。
与此同时,该文件要求系统始终处于人类控制之下。一旦智能体能够选择工具和中间行动,这两个目标就不一定天然一致。
约束严格的智能体更容易监控,但灵活性较低。授权范围广泛的智能体能够完成更多任务,却也带来更大的攻击面和更多通往非预期行为的路径。
以工作场所研究助手为例。它可能搜索内部笔记、浏览公共网站、比较记录,并准备建议。单独评估时,每一项能力看起来都很合理。
风险出现在它们的组合中。公共网页可能包含隐藏指令,要求智能体检索机密材料。广泛的文件访问权限可能使其照做,而对外连接则可能暴露结果。
防止这一链条,不能只过滤智能体的最终文本。开发者必须将可信指令与不可信内容分离,最小化权限,验证工具调用,并记录行动以供后续审查。
该框架呼吁加强监测、预警、应急响应和测试。它还支持建立漏洞数据库,以及涉及开发者、服务提供商和技术机构的信息共享机制。
这些措施指向一种以证据为基础的控制模式。企业应能够说明系统访问了什么、哪项决策触发了行动,以及人类何时能够将其停止。
这种预期给开发者、企业采购方和运营者带来了压力。开发者必须在智能体架构中构建安全防护措施。采购方必须评估整个部署,而不是依赖模型提供商的安全声明。
运营者同样需要明确的责任边界。当模型提供商、应用开发者、插件供应商、云服务和客户共同影响同一工作流时,责任可能变得碎片化。
框架 3.0 将责任分配给模型和算法开发者、服务提供商及用户。然而,宽泛的责任表述并不会在复杂故障发生后自动化解争议。
供应链让问题更加棘手。一个智能体可能依赖开源模型、第三方检索软件、外部 API 和企业数据系统。任何组件中的漏洞都可能影响最终行为。
该框架承认开源与闭源模型存在不同风险。由于由单一提供商控制其安全机制,闭源系统可能限制外部审计和定制。
开源模型允许更广泛的检查与适配,但安全防护措施可能被移除或绕过。更新也可能无法触达每一份经过修改或私有部署的副本。
两种方式都无法免除治理工作。闭源提供商必须提供有关控制措施的实质性证据,而开源部署则需要本地测试、配置管理和安全更新计划。
同样的权衡也体现在模型准确性上。幻觉,即看似合理却缺乏可靠证据支持的输出,在智能体将其作为行动依据时会变得更加危险。
团队无法仅靠在输出下方添加警告来解决这一问题。他们需要要求提供权威证据、阻止缺乏依据的行动,或将高影响力决策转交给人工处理的机制。
这些控制措施会降低速度并增加运营成本,也可能限制使智能体具备吸引力的自主性。这正是《中国人工智能安全治理框架 3.0》背后的核心权衡。
该文件并不要求每个系统接受完全相同的处置。其风险分级方法会考虑应用场景的重要性、系统的智能水平以及使用规模。
这种方法比在所有场景中一律施加最高级别控制更具可操作性,但也引出了关于阈值的棘手问题。
组织必须判断,一个普通助手何时会成为高影响力智能体;还必须确定哪些权限会带来实质性风险,以及哪些行动需要确认。
该框架提供了方向,但许多运营层面的答案将取决于后续标准、行业规则和评估方法。在这些机制出台之前,企业必须在自身技术环境中解读宽泛原则。
框架并不等同于可执行的规则手册
该文件释放了监管优先事项的信号,但其本身并未为每个 AI 智能体建立完整的合规测试标准。
TC260 是中国国家网络安全标准化机构。其技术文件可影响监管、采购、评估和正式标准,但其法律效力取决于文件本身及与之关联的规则。
框架 3.0 最适合被理解为一份治理地图。它识别风险类别,并建议技术与制度层面的应对措施。它并不取代适用法律或强制性标准。
中国已经针对部分生成式 AI 服务制定了具有约束力的规则。《生成式人工智能服务管理暂行办法》主要适用于在中国大陆境内向公众提供的服务。
其他要求可能涉及算法备案、安全评估、个人信息、数据安全、内容治理和行业监管。相关义务取决于提供商、服务、用户和部署环境。
一项已定稿的国家标准提供了有益对照。中国的 GB/T 45654-2025 涵盖生成式 AI 服务的基本安全要求,包括训练数据安全、模型安全和防护措施。
一份英文标准译文指出,该标准支持备案、登记、测试和评估。它适用于提供商,并可为监管机构和第三方评估者提供指导。
该标准比这一宽泛框架更具体。它讨论了训练数据、生成内容、模型安全和安全评估的程序。
即便如此,外部分析人士仍质疑,在模型竞争快速发展的过程中,严格措施能否被持续一致地执行。对于仍停留在框架层面的建议,这种不确定性更大。
3.0 版本要求定期测试潜在的技术失控风险。然而,该版本并未建立通用测试套件、公开评分,或用于判定智能体是否安全的统一阈值。
可控性、可信使用和灾难性风险等术语同样需要可衡量的定义。缺少这些定义时,两个组织可能都声称合规,却采取了截然不同的防护措施。
独立访问是另一项尚未解决的问题。闭源模型可能阻止外部研究人员审查内部控制措施。开源部署在被修改和再分发后,则可能难以盘点。
事件透明度将与部署前测试同样重要。一家公司可能通过了定期评估,却仍会在整合新工具或修改系统指令后遭遇故障。
AI 行业的公开报告仍不均衡。缺乏可比较的事件数据时,监管机构和采购方难以判断哪些控制措施在实验室条件之外真正有效。
该框架建议共享有关漏洞、缺陷、风险和事件的信息。建立有用的报告机制将需要明确的提交规则,以及防范不完整披露的保障措施。
跨境协调是该文件的另一项宏大内容。3.0 版本支持将联合国作为全球 AI 治理的核心渠道,并呼吁建立危机管理机制。
这一目标面临政治和技术障碍。各国政府在国家安全、内容规则、隐私、知识产权、开源模型以及国家可接受的数据访问范围方面存在分歧。
即使各方共同担忧危险能力,也无法保证会就证据达成一致。不同国家可能采用不同的评估、威胁模型和披露要求。
因此,应将该框架中的国际表述理解为一种政策立场,而非全球已实现一致的证明。其影响力将取决于中国是否发布可用的测试方法,并支持互惠的技术合作。
还有一种风险是,宽泛的安全措辞可能成为小型开发者的障碍。大型公司可以为法务团队、审计、红队测试、监控和事件响应提供资金。
较小的实验室可能难以满足同样的预期,尤其是在标准快速变化时。沙盒和共享测试资源或许可以减轻这一负担,但其可及性将至关重要。
持怀疑态度的解读很直接。框架 3.0 准确识别了若干新兴风险,但识别风险比落实措施更容易。
它的真正价值将由后续的标准、评估、报告系统和执法实践来衡量。缺少这些机制时,可控性仍是一项目标,而非经验证的属性。
中国 AI 治理如今已延伸至模型之外
政策边界正日益覆盖整个运行环境,包括数据、记忆、工具、基础设施、用户和实体设备。
早期的 AI 治理讨论通常围绕训练数据集和模型输出展开。这些议题依然重要,但智能体使其周边系统同样变得关键。
当开发者修改系统指令、检索来源、记忆、插件或可用工具时,模型的行为可能发生变化。基础模型可能保持不变,但部署会获得新的风险。
这意味着,单独的模型评估无法认证一个智能体产品。测试必须涵盖组装完成的系统,以及人们使用它的条件。
该框架建议在研究、开发、部署、运营和退役的全生命周期实施安全要求。退役之所以重要,是因为产品关闭后,旧凭证、存储的记忆和已连接服务仍可能处于暴露状态。
数据治理仍是核心关切。该文件要求在训练、标注、使用和输出的全过程中保护个人信息,并在适当情况下进行去标识化处理。
它还强调了政府和金融等领域的重要数据与核心数据。运行于这些行业的智能体能够比人工用户更快跨越信息边界,特别是在权限从已连接账户继承时。
记忆引入了另一层问题。持久化智能体记忆可以改善连续性,但也可能保留错误、敏感或被恶意植入的信息。
安全部署需要规定智能体存储什么、保留信息多久,以及谁可以查看或删除这些信息。记忆不应成为一种在用户不知情的情况下塑造后续行动的隐形记录。
工具治理同样重要。开发者需要为高影响力操作设置允许列表、权限限制、行动预览、交易边界和强身份验证。
智能体不应仅因某一工作流偶尔需要高权限,就被授予永久管理员访问权。临时且针对具体任务的授权可降低错误或攻击造成的损害。
人工监督同样需要精确设计。如果用户无法理解拟议行动,或者频繁提醒导致自动批准,确认框的作用就微乎其微。
有效干预需要及时且相关的信息。用户需要看到智能体计划做什么、将使用哪些数据,以及该行动会带来什么后果。
日志记录同时支持监督和调查。记录应捕捉工具调用、数据访问、权限变更、模型决策和人工批准,同时避免创建另一个不受控制的敏感信息存储库。
该框架对具身 AI 的关注进一步提高了风险。实体系统需要安全的后备状态、环境限制,以及在通信或感知失效时停止运行的方式。
仓储机器人、实验室系统或联网车辆不能仅依赖基于文本的拒绝机制。安全必须存在于软件、硬件、操作程序和物理控制中。
网络安全团队还面临双重角色。正如该框架所承认,AI 可以自动化代码审查、漏洞发现、攻击检测和修复。
攻击者也可以利用相同能力提升恶意活动的速度和规模。智能体系统可以在较少直接输入下串联侦察、利用和数据处理。
这推动防御从被动响应转向持续监控。组织需要评估自身智能体的行为,并检测来自外部的 AI 辅助攻击。
更广泛的范围使中国 AI 治理与各市场中逐渐显现的一项普遍经验保持一致:安全取决于模型如何被连接和使用,而不仅是模型孤立状态下能够做什么。
对于企业采购方而言,这改变了采购问题。当产品能够访问内部记录或发起交易时,基准分数和模型卡并不足够。
采购方应询问智能体可以访问哪些工具、权限如何授予、外部内容是否被视为不可信,以及行动如何撤销。
他们还应询问提供商是否披露事件并支持独立测试。精致的界面无法替代运营证据。
知识工作者也面临着规模更小但类似的挑战。用于整理研究资料或准备报告的助手,仍需要可靠的来源边界,以及对私密材料的清晰处理方式。
良好的信息实践已成为 AI 安全的一部分。团队需要可追溯的来源、审慎的访问控制,以及与每项任务后果相匹配的审查步骤。
这并不意味着要拒绝自动化,而是要将智能体视为工作流程的参与者,为其明确权限并确保其行为可被观察。
三个信号将表明 Framework 3.0 是否真正具备约束力
下一阶段取决于可衡量的标准、真实的事件报告和行业特定控制措施,而非又一份原则声明。
第一个信号是发布具体的智能体测试标准。这些标准应明确针对提示注入、工具滥用、权限升级、记忆污染和任务控制权丧失的评估流程。
清晰的测试将增强该框架的可信度。它们会为开发者提供共同目标,也让采购方能够基于类似证据比较安全声明。
模糊的评估措辞则会削弱这一结果。如果每家提供商都自行选择测试和阈值,市场将收到大量声明,却几乎无法进行横向比较。
第二个信号是一个能够正常运作的事件与漏洞报告系统。Framework 3.0 呼吁建立涉及开发者、提供商和技术机构的数据库及信息共享机制。
一个有用的系统应公开类别、报告时间表、修复预期,以及足够多的匿名化细节,以便其他方改进防御措施。它还应区分轻微错误与严重安全事件。
一致的报告机制将支持该框架的敏捷治理模式,因为主管机构可以根据已观察到的失败案例更新控制措施。零散或难以获取的报告,则会让政策继续依赖假设性的风险。
第三个信号是行业特定的落地实施。政府、金融、教育、医疗保健、媒体和应急管理,对于自主性和人工审查需要不同的门槛。
行业指引应明确哪些智能体操作需要审批、哪些数据来源仍应受限,以及组织必须保留哪些证据。采购要求可能会成为这些控制措施的早期实施路径。
详细的行业规则将表明,该框架正从国家战略走向运营实践。笼统的指引则会将关键决定留给专业能力参差不齐的个别组织。
国际协调值得关注,但这是一项更长期的考验。危机协议需要在重大事件发生前,就联系人、证据、保密性和响应程序达成一致。
最直接的证据将来自国内实施。中国现已连续三年发布三版 AI 安全治理框架。
这一节奏显示出重视,但重复本身并不能证明有效性。关键问题在于,在智能体部署进一步扩散之前,最新风险能否转化为可测试的要求。
开发者应关注 TC260 的工作计划、标准草案和公开征求意见文件。企业采购方则应跟踪监管机构是否开始在评估或采购过程中引用智能体控制措施。
知识工作者应留意产品层面的权限变化。能力更强的助手将越来越多地请求访问文件、账户、通信内容和业务系统。
China AI Safety Governance Framework 3.0 作出了明确判断:AI 安全不能再止步于模型的回答。它必须覆盖从用户请求到系统执行操作之间的每一个环节。
未来一到三个月应会揭示这一判断是否获得可操作的细节。请关注智能体测试方法、事件共享规则和行业控制措施,它们将把宽泛原则转化为证据。
在授予 AI 助手更广泛权限之前,请问三个问题:它可以访问什么、它可以改变什么,以及你如何让它停止?这些答案将表明,可控 AI 是否真正存在于实践中,而不只是停留在纸面上。



