top of page

CTC 与 West Point 联手以 AI 安全工具应对模型窃取

9月13日
讀畢需時 14 分鐘

CTC 已加入 West Point 的 Robotics Research Center,共同开发一款能够抢在对手之前攻击机器学习模型的 AI 安全工具。该合作聚焦模型窃取和隐私泄露——这两类风险往往难以通过传统软件测试得到有效衡量。这也赋予 CTC AI 安全工具一项高要求的任务:将研究型攻击转化为可重复的证据,以支持国防决策。

该项目的核心是在更广泛评估系统中的一条模型窃取管线。Concurrent Technologies Corporation,即 CTC,表示,该管线将自动执行开发测试与评估任务,考察模型架构、训练方法和防御技术如何应对不同的窃取攻击。

这一构想听起来很直接,但标准异常严格。有效的防御评估不能只是证明攻击已经运行,还必须衡量攻击恢复了什么内容、比较不同配置下的结果,并说明模型是否仍适合其任务。

这一要求使项目直面其主要对手:主观、劳动密集型的 AI 安全测试。现有评估通常依赖专家审查重构数据,并判断攻击是否成功。这种方法很难在大量架构、数据集和访问条件之间重复开展。

CTC 和 West Point 正试图让这项工作更加系统化。他们面临的挑战是证明自动化能够扩展安全测试,同时不会将关键背景隐藏在一个看似便利的评分背后。

CTC AI 安全工具将模型窃取转化为测试

该合作将模型窃取视为可衡量的工程问题,而非假设性的警示。

CTC 于 2026 年 9 月 9 日宣布与 U.S. Military Academy 的 Robotics Research Center 建立合作关系。根据项目公告,该团队正在设计一条机器学习模型窃取管线,用于自动化开发测试与评估。

模型窃取是指攻击者获取模型相关信息、复现其行为,或暴露其训练数据特征的攻击。NIST 将模型提取定义为一种获取模型架构或参数细节的隐私攻击。相关的模型反演攻击则尝试重构与原始训练数据相似的信息。

这些区别很重要,因为造成的损害可能超出知识产权范畴。被窃取的模型可能泄露设计选择、决策边界或专门能力。反演攻击则可能暴露模型从作战数据中学习到的敏感模式。

当系统处理军事影像或其他受限信息时,风险会更加严重。模型并不需要逐字返回一条已存储的训练记录,才能泄露有价值的信息。重构出的类别特征可能揭示系统识别什么,以及它如何区分目标。

CTC 表示,其管线将有助于识别哪些架构和训练技术更容易受到隐私泄露影响。该项目还将测试包括差分隐私和对抗训练在内的防御措施。

差分隐私是一种数学方法,用于限制任一单独训练样本对可观察结果产生的影响程度。对抗训练则在开发过程中让模型接触经操纵的样本,使其能够更好地抵御相关攻击。两种防御措施都无法消除所有风险,并且都可能影响模型效用。

因此,该评估系统不仅应比较攻击是否成功。它还必须支持跨模型、攻击和防御措施的实验,同时保留足够细节,让专业人员理解结果。CTC 表示,为此正将专有代码库整合为模块化、可重新配置的组件。

CTC 的 2025 财年年度报告将这一更广泛的系统称为 PROTECT。报告称,该公司正与 West Point 共同开发 PROTECT,以实现开发测试与评估工具及指标的自动化和规模化。

这一较早的表述说明,9 月的公告并非一个未经探索概念的起点,而是对已经纳入 CTC 开发组合的研究路径所作的公开说明。

该公告没有披露合同金额、交付时间表、实际运营客户或部署日期,也没有说明系统在使用该工具后需要通过何种认证流程。目前,最明确的交付成果是一条实验性评估管线,而不是通用的安全认证标志。

这一边界很重要。CTC 和 West Point 正在构建用于生成隐私风险证据的机制,并未声称一次评估就能证明每一种国防模型都安全。

紧张关系由此开始。可扩展工具可以扩大测试覆盖面,但当使用者忽略评分背后的假设时,标准化输出也可能制造虚假的信心。

为什么国防 AI 需要可重复的安全证据

国防项目需要既能跟上模型开发速度、又能产出供指挥官和评估人员审查质疑的证据的测试。

压力来自机器学习在影像分析、信息优先级排序、自治支持和作战决策支持系统中日益广泛的应用。每次部署都会带来数据、架构、硬件、任务条件和攻击者访问方式的新组合。

传统软件保障仍然必不可少,但它无法覆盖整个机器学习攻击面。一个项目可以修补已知软件漏洞,却仍部署一个通过输出暴露敏感信息的模型。它也可能通过平均准确率阈值,却依然容易受到精心设计查询的攻击。

美国军方已将这一测试缺口视为制度性问题。其负责任 AI 实施路径要求在 AI 能力的整个生命周期中开展测试、评估、验证和确认。

该路径还呼吁采用能够检测自然退化和对抗攻击的工具,并描述了一个共享测试生态系统,其中包括用于衡量可信度和置信度的指标。CTC 的项目契合这一方向,因为它旨在将一种难以应对的攻击类别转化为可重复的实验。

直接压力落在项目经理、测试机构和模型开发人员身上。他们必须在相关攻击方法持续变化的同时,判断系统是否已准备就绪;还需要记录为何选择特定防御措施,以及剩余风险为何。

手动评估可能成为瓶颈。模型反演结果可能包含需要专家检查的重构图像。一名评估人员可能将某张图像视为明显的隐私失败,另一名则可能只看到模糊的相似性。

这种分歧并非小小的工作流程问题。它使得不同测试团队和开发周期之间难以比较,也使得判断缓解措施究竟降低了风险,还是仅改变了重构数据外观,变得更加复杂。

规模带来另一个问题。用一种攻击测试一种架构只能得出狭窄的结果。一个可信的项目可能需要考察多种架构、访问条件、攻击方法、数据集和防御配置。

即使尚未将任务环境纳入考量,组合数量也会迅速增长。人工审查无法完全消失,但当每项实验都需要定制化解读时,其成本会越来越高。

CTC AI 安全工具通过将工作组织为管线来应对这一压力。管线可以运行攻击、捕获输出、计算指标,并通过统一流程保留配置细节。这种结构有助于比较,也使模型发生变化后重新运行评估更加容易。

可重复性对采购监督同样重要。当审查人员能够将安全声明追溯到明确的模型版本、攻击假设、数据集和测量方法时,这一声明才更有价值。缺少这种可追溯性,良好结果对已部署系统的说明意义可能有限。

West Point 提供了军事背景与技术研究相结合的能力。其 Robotics Research Center隶属于 Department of Electrical Engineering and Computer Science。该中心支持机器人和自主系统研究,并设有 Laboratory for Artificial Intelligence Research and Engineering。

CTC 则带来了应用研究、系统工程和测试经验。这样的组合颇具价值,因为对抗性机器学习处于研究与运行保障之间。攻击方法必须具有技术可信度,而输出结果也必须能被作出项目决策的人使用。

这一合作并未消除核心难题。国防机构必须决定,对于特定任务而言,多少证据才算充分。用于行政分类的模型,与支持时间敏感型作战决策的模型,所带来的后果并不相同。

可重复的评估有助于团队以一致方式提出这一问题,但无法在缺乏人工判断的情况下回答任务风险问题。

模型反演揭示了手动测试为何举步维艰

模型反演难以评估,因为重构输出无需完美复现原始数据,也可能暴露具有实际意义的信息。

这项合作背后的研究让其机制更加清晰。2025 年 9 月,Tyler Shumaker、Jessica Carpenter、David Saranchak 和 Nathaniel D. Bastian 发表了一项关于自动化模型反演评估管线的研究。

他们的已发表研究将模型反演描述为:通过利用输入、内部表征和模型输出之间的关系,尝试重构训练信息。攻击者可能利用预测结果、置信度评分、梯度或其他可获取的信息。

访问条件会塑造攻击方式。在白盒场景中,攻击者对目标拥有广泛的了解,可能包括梯度和参数。在黑盒场景中,攻击者可能只能看到通过接口返回的输出。

访问受限并不保证安全。研究人员指出,现代攻击可以将优化方法与生成式方法及公开数据相结合。即使无法完整访问内部信息,这些辅助资源也可能帮助攻击者生成可识别的重构结果。

该论文聚焦一个核心测量问题。人类观察者可能难以解读反演结果,其判断也可能具有主观性。模糊的重构图像仍可能保留类别特定信息,帮助攻击者理解目标模型。

作者提出了四个用于量化隐私损失的对抗风险维度。他们将模型反演方法与视觉语言模型相结合——后者能够联合处理图像和文本——以支持自动化分析。

该管线使用视觉语言模型进行零样本分类和图像描述。零样本分类要求系统在当前评估中没有任务特定示例的情况下识别类别。图像描述则将视觉内容转换为文本,以支持进一步比较。

这种方法改变了评估者的任务。流程不再仅依赖个人的视觉印象,而是可以衡量重建样本是否保留了有助于识别类别或描述敏感内容的信息。

研究人员还考察了重建信息能否支持替代模型。替代模型试图模仿目标系统的行为。若重建数据有助于训练出有效的替代品,攻击就提取出了具有实际操作价值的知识。

这正是模型窃取与模型反演彼此重叠、却并不完全相同的原因。一种攻击可能寻求架构细节或参数;另一种可能瞄准训练信息。两者都可能帮助对手复现能力、研究弱点,或降低构建竞争系统的成本。

该论文在一个被描述为军事应用中典型场景的计算机视觉图像分类环境中,对该流程进行了基准测试。它测试了多种反演方法和多种视觉语言模型配置。公开摘要并未证明该方法在每种数据类型或任务中都取得了同等效果。

这项工作在 2025 年北约科学技术组织举办的军事系统 AI 安全与保障研讨会上获得最佳论文奖。CTC 报道称,该活动收到 60 份摘要,接收其中 30 份用于论文或演示,并收到 23 篇完整论文。

这一认可支持其研究贡献,但并不构成对 PROTECT 的实际运行验证。经过评审的论文能够证明某种方法在实验范围内具备技术趣味性和可复现性,但并不能说明该方法面对机密模型或陌生部署条件时的表现。

该机制也引入了依赖关系。当一个模型评估另一个模型的信息泄露时,评估者必须了解审查模型本身的错误。视觉语言模型可能错误分类图像、忽略细微的重建结果,或在更新后作出不同反应。

因此,自动化并未消除主观性,而是转移了其中一部分。原本直接用于判断重建图像的人类判断,可能会重新出现在指标选择、提示词设计、阈值设定和评估模型选择中。

这种转变仍可能有价值。明确列出的假设比未记录的印象更容易审查。流程可以记录所选评估器、攻击设置和决策阈值,供日后复核。

关键问题在于,用户是否将这些设置视为证据的一部分。若他们只关注最终风险标签,该工具可能会过度压缩不确定性。

自动化带来了新的安全权衡

该工具的价值取决于它能否让不确定性可见,而不是把不完整的测试变成令人安心的评分。

NIST 的对抗性 ML 分类体系按生命周期阶段、攻击者目标、能力、知识与数据模态组织攻击类型。其中涵盖模型提取,以及重建、成员推断、投毒、规避和其他威胁。

这种广度说明了 CTC AI 安全工具面临的第一项局限:强有力的模型反演评估并不等同于完整的对抗性 AI 评估。一个模型可能抵抗重建攻击,却仍容易受到操纵输入、投毒训练数据、后门或供应链入侵的影响。

第二项局限涉及威胁假设。当对手能够获取系统参数时,黑盒测试可能低估被攻陷系统面临的风险;若部署架构阻止了相当程度的交互,白盒测试则可能高估远程攻击者实际可获得的访问权限。

因此,测试设计者必须将每种攻击与可信的实际运行场景相联系。他们应记录攻击者掌握的信息、可用接口、允许的查询次数,以及可获得的辅助数据。

第三项局限是指标有效性。四个风险维度比单一视觉评分提供了更丰富的视角,但决策者仍需要证据证明这些维度与有意义的损害相关。指标应当能够区分无害的相似性与会改变对手能力的信息披露。

当训练数据具有敏感性时,这种验证尤为困难。研究人员可能无法公开具有代表性的数据集、运行中的模型细节或真实的攻击结果。公共基准可以支持方法开发,却可能遗漏受限环境中最关键的特征。

差分隐私带来了自身的权衡。更强的隐私保护可以减少泄露,但也可能影响准确性或增加训练复杂度。正确的平衡取决于任务后果、数据敏感性和可用替代方案。

对抗训练同样具有条件性。它可以提高模型对训练中所呈现攻击模式的抵抗力,但不会自动泛化到未来所有技术,还可能形成一种循环:防御者针对昨天的测试进行优化。

模块化流程提供了一种应对方式。团队可以随着领域发展添加攻击方法、模型和指标。CTC 表示其组件可重新配置,这应能支持多样化的实验设计。

模块化也扩大了验证负担。每个新增组件都可能改变结果或引入依赖关系。更新后的视觉语言评估器即使目标模型没有任何变化,也可能改变风险评分。

版本控制和溯源因此变得至关重要。测试报告应标明目标模型、攻击实现、评估器、数据集、配置和软件修订版本。否则,两个带有相同标签的评估未必具有可比性。

安全团队还必须保护评估环境。模型窃取流程包含攻击代码、目标接口、实验数据以及可能敏感的发现。围绕该系统的薄弱控制措施,可能为其评估的资产创造新的访问路径。

该公告未描述访问控制、隔离、部署架构或评估数据的处理规则,也没有说明 PROTECT 是否将在断开网络的环境中运行。对于早期公开公告而言,这些遗漏可以理解,但它们阻碍了对实际运行准备程度作出结论。

另一个不确定性是目标用户。研究人员可以容忍复杂配置和模糊输出;项目办公室和运行测试团队通常需要有文档支持的程序、稳定的接口,以及与需求挂钩的决策阈值。

从研究流程迈向共享测试资源,需要的不只是封装代码。它还需要培训、治理、基准维护,以及对结果提出异议的流程。用户需要知道测试何时不适用,以及何时必须由专家介入。

还存在评估被“刷分”的风险。一旦评分影响采购或部署,开发者就有动力针对该测试进行优化。模型可能在已知测试套件中表现良好,却没有获得更广泛的韧性。

独立评估能够降低这种风险。轮换攻击方法、将开发基准与验收测试分离也同样有效。公开材料并未说明 CTC 或 West Point 将如何处理这些问题。

这些局限没有一项意味着自动化是糟糕的目标。它们界定了自动化能够提升保障水平的条件。最强版本的 PROTECT 应当产出结构化证据、保留不确定性,并让重复测试成本低廉。

较弱的版本则会生成一个经过精致包装的标签,其背后的假设仍难以审查。该项目的重要性取决于最终出现的是哪一种版本。

三个信号将表明 PROTECT 是否超越研究阶段

下一项考验不是再作出关于安全 AI 的宽泛承诺,而是证明 PROTECT 能够在原始实验之外支持可重复的决策。

第一个信号是发布详细的技术资料,将 2025 年研究流程与更广泛的 PROTECT 架构联系起来。CTC 已披露该项目的重点、模块化设计和预期防御能力,但尚未发布完整的系统规范或评估协议。

一份有价值的发布材料应解释该工具支持哪些攻击、四个风险维度如何计算,以及如何呈现评估器的不确定性。它还应界定模型反演、模型提取与更广泛评估套件之间的关系。

这些信息将强化该项目的核心主张。它将表明这项合作正在把经过评审的方法转化为工程流程,而不是为孤立实验冠以一个新名称。

若发布内容只提供汇总评分,则会削弱其说服力。安全专家需要足够的细节来复现结果、识别无效假设,并比较不同时间的评估。

第二个信号是在更多架构、数据类型、访问条件和防御方法中进行验证。已发表的工作聚焦于计算机视觉和图像分类。这是一个有意义的国防应用案例,但并不代表军事组织部署的所有模型。

未来评估应展示白盒与黑盒访问条件下结果如何变化,也应比较未受保护的模型与采用差分隐私、对抗训练或其他缓解措施的版本。

最具说服力的证据应包括失败案例。可信的评估项目应披露其指标在哪些情况下变得不稳定、自动化评估器在哪些情况下与专家意见不一致,以及攻击在哪些情况下超出流程范围。

此类报告将通过界定工具的运行边界来增强信心。相反,若声称对无关模型具有一致有效性,则会引发疑问:该评估是否真正捕捉了任务特定风险。

第三个信号是在正式测试环境中的采用。公告提到了 CTC 和 West Point 的 RRC,但没有指出任何采用该评估的采购项目、运行测试组织或已部署系统。

一项具有明确验收标准的试点,将表明输出是否能帮助实际决策者。评估者应能够将发现结果关联到缓解措施、需求和有文档记录的部署选择。

实际运行中的采用还会暴露实验室研究无法解决的工作流问题。团队必须决定由谁配置攻击、由谁审查结果、评估需要多长时间,以及模型更新后如何处理。

如果 PROTECT 成为定期生命周期测试的一部分,该项目更广泛的论点将获得支持。这将表明,对抗性 AI 评估能够从专家研究走向可重复的项目实践。

若采用仍局限于研究演示,该方法依然可以为该领域作出贡献。然而,它尚未解决使这项合作引人注目的制度性测试瓶颈。

即使从不接触国防系统,开发者和企业买家也应关注这一点。当模型处理专有文件、客户记录、医学影像或内部运营数据时,商业团队面临着相同的根本问题。

他们需要了解暴露的接口是否泄露训练信息,以及缓解措施在现实访问条件下是否有效。他们还需要在模型、提示词和周边应用发生变化后仍有价值的测试记录。

CTC AI 安全工具指向了一项实用标准:将隐私攻击视为带有明确假设的可重复测试。这一原则超越了军事采购领域,可为供应商审查、模型选择、内部红队测试和部署关卡提供参考。

更严峻的教训同样重要:自动化评估不能取代威胁建模或可追责的人工审查。它只是为这些流程提供了更一致的证据基础。

应关注正式发布的 PROTECT 方法论、更广泛的基准测试结果,以及具名的运营试点项目。这些信号共同将表明,CTC 和 West Point 究竟是构建出了可复用的保障体系,还是打造了一项有效但仍有后续工作要做的研究工具。

正在评估敏感 AI 的团队现在也应提出同一个问题:他们的安全主张能否经受可重复的模型窃取测试?如果答案依赖于非正式判断或单一基准测试,那么证据尚未成熟。PROTECT 的进展之所以重要,是因为它检验了这一差距能否在不将复杂风险简化为误导性标签的前提下得以弥合。

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page