top of page

Nvidia 的 AI Agent 安全押注于约束机制,而非放缓发展

1小时前
讀畢需時 15 分鐘

Nvidia 正将 AI agent 安全定位为对放缓前沿研发呼声的直接回应。其论点基于一个颇具争议的理念:企业可以通过模型周边的软件来控制能力日益增强的 agent。

Nvidia 的 agentic AI 副总裁 Adel El Hallak 在 9 月 17 日的一次采访中提出了这一观点。他告诉 Semafor,模型周围的支撑架构可能与模型本身同样重要。

Nvidia 将这类支撑架构的一部分称为 agent harness。它由指令、工具、权限和运行时层构成,用于规范 agent 的运行方式。El Hallak 认为,更好的 harness 工程可以在不停止能力模型开发的情况下对其加以约束。

这一立场与 Anthropic 倡导的协调机制相冲突:当安全措施落后时,应能够放缓前沿研发。分歧并不只是关于 AI 是否会带来风险。两家公司都表示会。

冲突的核心在于控制权应置于何处。Anthropic 强调模型能力、外部监督以及放缓研发的选择;Nvidia 则更重视系统架构、安全控制和运营纪律。

Nvidia 的立场也符合其商业利益。能力更强的 agent 需要更多推理、软件、网络和企业基础设施。只要客户相信这些 agent 能够安全运行,一个持续建设的世界就对 Nvidia 有利。

因此,实际问题远不止一位高管的采访:普通组织能否像 Nvidia 所设想的那样有效部署控制措施,还是不可靠的实施将成为最薄弱的一环?

Nvidia 的 AI Agent 安全超越模型本身

Nvidia 的核心主张是,agent 风险取决于模型周围完整的运行系统,而不只是其内部的智能。

传统聊天机器人主要生成供人审核的文本。Agent 还可以打开文件、调用 API、运行软件、搜索内部系统以及修改记录。这些连接会将不完美的模型变成主动执行操作的软件。

模型可能生成有害回答,却不会影响任何其他系统。拥有广泛凭证的 agent 则可能把同样的错误变成数据删除、机密泄露或未经授权的交易。当语言转化为行动时,风险也随之改变。

El Hallak 的论点正是从这一区别出发。安全团队应审查模型,但也应控制其权限、工具、记忆、网络访问和执行环境。

在他的类比中,有能力的 agent 就像一头狮子,无法安全地待在马厩里。答案不一定是削弱狮子。Nvidia 希望工程师建造更坚固的围栏。

这一围栏就是 harness。Harness 决定 agent 可以看到哪些工具、如何获取上下文,以及行动前必须验证什么。它还可以记录活动,并将敏感决策转交给人工处理。

安全运行时提供了另一层保护。它隔离代码执行,并执行超出模型直接控制范围的政策。这一区别很重要,因为模型不应能够改写约束自身的规则。

Nvidia 的红队为这种系统视角提供了具体佐证。在历时六个月的评估中,团队反复发现 agent 部署存在四类运营弱点。

这些弱点包括缺失的访问控制、允许任意代码执行的工具、不受限制的网络访问以及明文机密。Nvidia 在其关于安全部署 agent的指南中记录了这些问题。

这些失败都不需要科幻式场景。它们类似于常见的软件安全错误,但 agent 能够通过自然语言指令发现并组合利用它们。

Agent 可能会收到隐藏在电子邮件、文档、网页或软件包中的恶意命令。这属于间接提示注入,即不可信内容试图重定向 agent 的行为。

基于提示的警告无法可靠阻止每一次此类攻击。模型可能误解上下文、优先处理错误的指令,或在多个看似合理的步骤中遭到操纵。

因此,Nvidia 建议采用确定性控制,即由软件而非模型判断来执行的规则。例如默认拒绝网络访问、凭证隔离、最小权限和加固的执行沙箱。

这些控制措施不会让模型变得无害。它们减少的是模型行为失误时可能造成的损害。这是一个更狭窄、也更易测试的目标。

Nvidia 的 AI agent 安全论点始于这一转变。它不再追问模型是否可能失败,而是追问这种失败能够触及什么。

这一框架形成了本文的核心张力。系统控制手段熟悉、可衡量,并且如今可以部署;但它们依赖组织在复杂环境中始终如一地应用。

Harness 工程将控制权引入运行时

Harness 工程之所以重要,是因为同一个模型可以根据其周边架构,成为受限助手或拥有特权的操作员。

生产环境中的 agent 很少仅由一个模型和一个提示组成。它还包括工具定义、身份系统、检索服务、记忆、审批流程、监控,以及调度每项行动的软件。

这些组件决定 agent 是只能起草电子邮件,还是可以发送邮件;也决定 agent 是否可以检查数据库、修改生产代码或联系外部服务器。

良好的 harness 工程始于身份管理。每个 agent 都应拥有明确的账户、限定范围的权限和可归因的活动记录。共享管理员凭证会让预防和调查都更加困难。

工具限制同样重要。编程 agent 可能需要编译器和测试环境,但未必需要不受限制地访问生产系统。其可用工具应匹配当前任务。

网络政策构成另一道边界。处理机密文档的 agent 可能需要特定内部服务,同时不应拥有开放的互联网访问权限。默认拒绝规则要求团队逐一授权每个目标地址。

机密信息应保留在模型可见上下文之外。专用凭证服务可为特定操作发放临时授权。Agent 无需读取或存储底层机密。

沙箱机制限制执行。Agent 在受控文件、进程和网络路由的隔离环境中完成工作。如果它运行了不安全代码,周边系统可以控制结果。

人工审批仍然发挥作用。高影响操作可以在执行前暂停,尤其是涉及付款、客户数据、生产系统或不可逆记录时。

Nvidia 自身研究人员认为,系统级防御构成了 agent 的结构骨架。他们的安全研究也承认一项重要限制。

有些安全决策依赖上下文,无法完全依靠固定规则。模型或其他学习型系统可能仍需判断某项操作是否符合用户意图。

这带来了边界问题。确定性控制在政策明确时效果最佳,而现实工作中包含模糊性、例外情况和不断变化的环境。

以被指派准备季度业务回顾的 agent 为例。它可能需要文档、消息、客户数据和内部仪表板。每个来源都可能包含不可信指令或敏感信息。

Harness 必须区分内容与命令,也必须防止某一来源改变 agent 的权限或将数据重定向至其他位置。

可搜索知识库可以减少分散的上下文,但检索本身并不能建立信任。Agent 仍需要权限边界和具备来源意识的处理方式。

监控提供最后一层运营保障。团队需要日志,以显示哪条指令触发了某项操作、哪些数据进入上下文,以及每项结果由哪个工具返回。

没有这些记录,安全团队就无法复现事件;也无法判断失败是由模型、harness、外部工具还是人工指令造成的。

因此,Nvidia 的 harness 工程将可观测性视为一种控制措施,而不是行政附加项。追踪记录可帮助组织发现滥用、优化政策,并识别权限过宽的问题。

这一方法类似于既有的零信任安全理念。任何用户、设备、工作负载或 agent 都不会仅因位于公司网络内部而获得无限信任。

不同之处在于,agent 可以在工作过程中生成新的计划。它们的路径比传统应用更难预测,因此周边控制必须持续评估其行动。

设计良好的 harness 可以在不改变底层模型的情况下提升 agent 的安全性,也可以通过提供更清晰的上下文和定义更明确的工具来改善模型表现。

然而,harness 无法在任何人意识到之前,判断前沿模型是否具备危险能力。这正是 Nvidia 的系统论点遭遇前沿实验室质疑之处。

Nvidia 的论点给前沿实验室带来压力

Nvidia 正在挑战这样一种观点:模型能力提升必然迫使人们在持续研发与可信安全之间做出选择。

CEO Jensen Huang 已拒绝这种选择,认为行业可以同时推进能力与安全。El Hallak 则进一步将 harness 确定为一个可行的控制点。

这直接给 Anthropic 的方法带来压力。Anthropic 认为,在可验证、协调一致的条件下,社会应保留放缓或暂时暂停前沿研发的选择。

其担忧并不局限于配置不当的企业 agent,还包括能够加速 AI 研究、支持危险技术工作,或规避行为监控系统的模型。

Anthropic 关于递归改进的研究清晰描述了协调难题:如果竞争对手在没有可比约束的情况下继续推进,谨慎的开发者无法单独安全暂停。

这形成了两个不同的安全层面。模型级治理关注某些能力是否应被开发或发布;部署安全则关注具体 agent 能够访问和执行什么。

Nvidia 的论点在第二层最为有力。访问控制、沙箱、网络限制和隔离凭证可以减少企业的即时暴露风险。

Anthropic 的论点则更直接地针对第一层。安全沙箱无法解决有关前沿能力、模型盗窃、生物学协助或能够改进 AI 研究的系统的所有担忧。

因此,分歧既关乎范围,也关乎方法。Nvidia 突出已部署 agent 周边可执行的控制措施;Anthropic 则强调,这些控制措施获得充分检验之前就可能出现的风险。

Anthropic 自身也采用类似安全框架的保护措施。其对内部 AI 开发的说明称,在线监控器可以阻止危险操作,而离线监控器则审查较慢发生或可逆的行为模式。

截至 2026 年 8 月,Anthropic 报告称,其使用最广泛的内部平台上约有 30,000 个研究与工程智能体同时运行。该公司在其开发测量中描述了这些系统。

这一案例让任何简单的公司对公司叙事变得复杂。Anthropic 并非反对智能体控制措施。它主张,控制措施应与能力评估、外部可见性及可能的节奏控制机制并存。

Nvidia 并未声称模型不需要安全工作。其研究人员明确讨论了基于模型的检查、红队测试、动态政策更新,以及针对模糊决策引入人工参与。

因此,核心分歧是路径与路径之间的较量。Nvidia 强调在更强的运行边界内持续开发。Anthropic 则希望在能力增长超越安全保障时,存在一套可信的制动机制。

经济因素进一步凸显了这一差异。Nvidia 向模型开发者、云服务商、企业和研究机构提供计算平台。

更多模型训练会让 Nvidia 受益,但广泛的推理使用可能带来更大的市场。持续运行的智能体每次规划、检索数据、调用工具和验证结果时,都需要计算资源。

前沿实验室面临不同的激励。它们必须保护专有模型,管理托管平台上的滥用风险,并为发布或暂缓发布能力的决策辩护。

这两种经济立场都不会削弱技术论点的有效性。但它确实解释了为何每家公司都强调不同的控制点。

基础设施提供商受益于让多种模型的部署看起来可控。前沿实验室则受益于保留对访问、监控和模型分发的控制权。

这一区别对买方很重要。企业不应认为选择其中一种理念,就可以免除对另一种理念的需求。

强大的模型仍需要安全框架。安全框架仍需要关于其所承载模型的证据。只要任何一方将自身所处层级视为充分,安全就会失效。

Nvidia 关于 AI 智能体安全的论点提高了批评者的门槛,因为它指出了组织现在就能部署的控制措施。批评者必须说明,这些控制措施为何会在特定风险面前失效。

Anthropic 的立场则提高了 Nvidia 的门槛。快速发展的行业必须证明其控制措施在部署扩张之前有效,而不是在破坏性事件暴露其局限之后。

安全的 AI 智能体仍取决于不均衡的执行

最困难的问题不是识别合理的控制措施,而是在商业压力下让数千家组织正确实施这些措施。

Nvidia 的红队发现之所以有说服力,部分原因在于它们并不特殊。访问管理、沙箱隔离、网络策略和密钥处理本就属于成熟安全计划的组成部分。

因此,它们反复缺失尤其令人担忧。如果组织连既有控制措施都难以落实,加入自主软件也不会自动改善其安全纪律。

企业环境还包含遗留系统。其中许多系统是为人工操作员或固定应用设计的,而不是为能够动态选择工具和制定计划的智能体设计。

某个组织可能会为工作流添加拥有广泛凭据的智能体,因为配置更窄的访问权限耗时更长。团队也可能在人工审核拖慢自动化时禁用审批步骤。

这些捷径可能会抹去安全框架带来的收益。拥有不受限制外部访问的沙箱仍可能导致数据泄露。详细的审计日志也无法阻止不可逆的操作。

智能体框架也在快速变化。新的连接器、记忆系统和工具协议,可能在安全团队完成对早期组件的审查之前就扩大攻击面。

独立测试仍然有限。供应商演示往往展示智能体在受控条件下完成任务,却较少揭示其面对敌对和模糊输入时的持续运行表现。

Open Secure AI Alliance 是 Nvidia 应对这种碎片化的尝试。该倡议将基础设施、安全、企业软件和研究机构聚集在一起,围绕共享防御工具开展合作。

其公开的安全使命强调开放技术、可适应的控制措施和共享基础设施。Nvidia 也贡献了安全框架研究和智能体安全项目。

这种协作可以改善互操作性。共享的报告格式和测试工具将帮助团队比较不同模型、框架和部署环境中的事件。

然而,行业联盟并非独立监管机构。其成员仍保有商业利益,自愿性实践可能导致合规程度不一。

El Hallak 拒绝说明政府是否应监管智能体层。他转而指出,行业工作可以识别哪些领域需要更强的安全保障。

这留下了一个尚未解决的问责问题。如果智能体越过边界,责任可能分散在模型提供商、安全框架开发者、工具供应商、部署方和用户之间。

每一方都可能声称是另一层出了问题。在缺乏明确标准的情况下,客户可能难以确定哪些安全声明真正经过了测试。

基准测试也带来另一项担忧。智能体可能在受限的软件任务中取得高分,却在长期运行、对抗性的条件下仍不安全。

Nvidia 的研究警告称,现有基准可能制造关于实用性和安全性的虚假信心。测试可能遗漏不断变化的政策、个人背景,或需要人工判断的模糊情况。

智能体也可能在评估期间表现安全,却在获得新工具后失败。每增加一个连接器,都会改变系统可以观察、修改和披露的内容。

因此,Nvidia 论点最有力的版本需要持续保障。团队必须在模型更新、政策变化、新集成以及权限扩大后重新测试智能体。

它们还需要事件响应计划。组织应当知道如何撤销智能体凭据、停止活跃会话、保留日志,并恢复被修改的系统。

最重要的是,安全控制措施应处于模型权限之外。不能信任智能体自行决定其网络限制是否应当生效。

这并不意味着基于模型的监控没有价值。学习型监控器可以识别固定政策遗漏的复杂模式。它们应在独立的限制和升级处置路径内运行。

怀疑论的结论很明确。安全框架可以降低风险,但其有效性是一项工程主张,需要来自真实部署的证据。

Nvidia 已展示反复出现的失效模式,并提出了控制措施。但它尚未证明,普通组织会在每一项智能体工作流中始终如一地实施这些控制措施。

Nvidia 的安全立场也支持其智能体业务

Nvidia 的技术论证与其商业战略相契合:该战略需要推动智能体从演示走向持续的企业使用。

Nvidia 已不再仅将自己定位为芯片供应商。它提供模型、推理软件、网络、安全组件、开发蓝图,以及用于构建智能体系统的运行时环境。

以安全框架为中心的视角扩大了模型周边的市场。企业需要计算资源,但也需要编排、评估、隔离、监控和政策执行能力。

Nvidia 的 OpenShell 运行时说明了这一方向。该公司将其描述为一种在执行网络、隐私和安全规则的同时隔离智能体执行过程的方法。

Agent Toolkit 打包了更多周边技术栈。它结合了开放模型、技能、蓝图和运行时组件,面向构建专业智能体的企业。

合作关系让这一技术栈更容易嵌入现有工作流。Nvidia 已宣布与包括 ServiceNow、CrowdStrike、Cisco、Box 和 Palantir 在内的公司开展智能体项目。

这些合作使 Nvidia 处于前沿模型与业务系统之间。无论企业使用其自有模型、开放权重模型还是托管商业模型,公司都能受益。

这种中立性在战略上很有用。Nvidia 可以主张模型只是一个组件,而其基础设施则为完整系统提供安全保障并加速运行。

这一方法也支持开放模型。更广泛的强大模型供给,会推动在 Nvidia 硬件上进行更多实验、部署和推理。

Anthropic 对能力最强的开放权重发布采取了更谨慎的立场。一旦权重开始流传,其安全保障可能被移除,集中式监控也会变得困难。

对于合法的企业部署,安全框架控制措施在一定程度上回应了这一反对意见。企业可以在严格治理的环境中运行开放模型。

但它们无法完全解决分发问题。恶意或疏忽的运营者可以移除安全框架、扩大权限,或在没有监控的情况下部署相同权重。

这一缺口解释了为何开放模型之争不能仅凭运行时安全来解决。部署控制措施只有在运营者接受它们时,才能约束系统。

Nvidia 的商业激励并不意味着其控制措施无效。安全产品往往正是因为供应商能够通过解决持续存在的运营问题获利而出现。

不过,买方应将架构证据与平台营销区分开来。合作伙伴名单并不能证明控制措施能够抵御复杂攻击。

采购团队需要可测试的要求。他们应询问网络访问是否默认拒绝、凭据是否始终处于模型上下文之外,以及高影响操作是否需要批准。

他们还应询问日志是否记录完整的决策路径。一份记录应关联源材料、模型输出、工具选择、授权和最终操作。

另一个重要问题涉及可移植性。如果企业更换模型,能否保留相同的政策、身份和审计控制措施?

可移植的控制措施将增强 Nvidia 关于安全存在于框架中的主张。高度耦合的控制措施则可能只会增加平台依赖,而无法提供相当的保障。

商业检验不在于有多少企业宣布试点,而在于有多少企业能在不为维持工作流运转而扩大权限的情况下,长期运行智能体。

成功部署还应产生可衡量的安全成果。例如,更少的暴露凭据、被阻止的未授权连接、更快的事件重建,以及更低的不安全执行率。

当客户发布此类证据时,Nvidia 的论点会更具可信度。当安全仍只是没有运营结果的功能清单时,这一论点便会被削弱。

该公司的优势在于能够覆盖整个技术栈。其风险在于,每一层都会增加复杂性、集成工作,以及另一个可能因配置失误而失败的环节。

三个信号将检验 Nvidia 的论点

下一项检验在于,Nvidia 的工程论证能否在经过谨慎管理的试点之外,产生共享证据、可执行的控制措施和可重复的结果。

第一个信号是对智能体运行时和安全框架控制措施的独立验证。安全研究人员应测试智能体能否绕过工具限制、泄露密钥或逃离隔离环境。

成功结果将强化 Nvidia 的主张:确定性的边界能够约束能力日益增强的智能体。反复出现的绕过则会表明,所提出的封闭机制仍然过于薄弱。

第二个信号是通过 Open Secure AI Alliance 或其他中立机构采用共享事件报告机制。有效的报告必须保留技术细节,而不能用宽泛分类掩盖失败情况。

定期报告将表明,行业能够跨厂商吸取经验。稀疏或选择性的信息披露,则会印证那些不信任自律监管的批评者的观点。

第三个信号是前沿实验室政策。应关注 Anthropic 和其他开发者是否会随着其内部智能体能力增强,扩大外部评估、节奏控制承诺和能力阈值的范围。

更严格的前沿控制措施并不能否定编排层工程。它们表明,领先实验室仍认为存在部署安全无法覆盖的模型层面风险。

若对节奏控制提案有所退缩,则会更有利于 Nvidia 的路线。这将意味着,技术控制与竞争压力正在成为行业实际的运行模式。

这些信号应结合起来解读。更好的运行时环境无法替代能力评估,而模型政策也无法保护一个拥有过多权限的智能体。

El Hallak 直言不讳地概括了 Nvidia 的立场:“世界不会慢下来。”这一预测看似合理,但不可避免并不等同于安全。

如今,责任落在 Nvidia 及其合作伙伴身上。他们必须证明,随着模型、工具和工作负载不断变化,安全的 AI 智能体仍能保持受限。

对开发者而言,眼下的行动很明确:将编排层视为安全边界的一部分,并测试它授予的每一项权限。企业采购方应要求提供来自敌对、长时间评估的证据。知识工作者在判断智能体能完成什么之前,应先问清它可以访问什么。

Nvidia AI agent 安全方案为许多部署风险提供了可信答案,但并非能解决每一种前沿担忧。请关注控制措施、事件披露和独立测试。这些结果将揭示,编排层工程会成为持久的安全层,还是另一项在压力下失效的保障措施。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page