GSA LLM 最终规则缩小适用范围,但仍对 AI 承包商提出严格要求
GSA LLM 最终规则将于 2026 年 10 月 19 日生效。其适用范围有所收窄,但受覆盖的联邦 AI 承包商仍须履行大量合规义务。
美国总务管理局如今将重点放在以下系统:大型语言模型功能构成实质性特征,且政府数据会直接输入模型或由模型直接产生。内部后台工具和附带的 AI 功能可能不受该条款约束。
这一变化回应了科技行业对早期草案最强烈的一些反对意见。不过,最终文本仍优先于相冲突的商业协议,适用于相关分包商,并对数据安全、文档记录、事件报告、模型变更和合同收尾提出详细要求。
结果是一种权衡,而非全面退让。GSA 降低了普通软件被纳入 AI 专属合同制度的可能性。但向政府销售实际 LLM 产品的供应商,仍须提供许多商业部署通常无需具备的运营可见性。
GSA LLM 最终规则采用两部分适用范围测试
最终条款聚焦于政府有意采购的 AI 系统,而非所有恰好使用 LLM 的承包商系统。
GSA 通过《通用服务采购条例》类别偏离发布了第 552.239-7001 条款,即《大型语言模型人工智能系统内数据的基本保障》。类别偏离允许机构在完成常规编纂前先行采用采购条款。
该变化体现在 GSA 对最终条款的 9 月更新中。该更新属于 RGO-2026-01 的一部分,后者是该机构采购法规的一项更大规模改革。
该条款适用于同时满足两项条件的情况。首先,GSA 必须正在采购 LLM、生成式助手、聊天机器人、智能体系统、由 LLM 驱动的生产力工具,或其他 LLM 功能具有实质性的类似产品。
其次,政府数据必须直接提交给 LLM,或由 LLM 产生。第二项条件将合规负担与实际模型交互相关联,而不是取决于承包商技术栈中是否存在某种 AI。
这比 6 月提案的范围明显更窄。拟议文本通常适用于政府数据将由 LLM 处理的情况,这种表述可能涵盖支撑系统和附带用途。
最终条款还包含自动失效表述。除非合同官另有说明,只要 LLM 的使用限于政府无法访问的内部业务、后台、运营或履约支持系统,该条款就不施加义务。
第二项排除针对 LLM 功能仅属附带或辅助性质的商业产品。当 AI 并非产品的主要目的、合同要求、政府可访问的功能,或政府数据的处理方时,该排除适用。
这些区别对于在提供其他服务时使用生成式 AI 的承包商至关重要。一家咨询公司可能使用内部助手协助组织工作,却并未将该助手出售给 GSA。传统软件产品也可能包含可选 AI 功能,而该机构从未启用它。
这些情形如今有了更充分的排除依据。不过,最终条款并未让所有内部 AI 工作流都不受监管。承包商仍需判断,政府数据是否进入了已采购、可访问或合同要求的 LLM 功能。
政府数据的定义也变得更精确。受覆盖的数据输入是由政府或代表政府提交的数据,而不只是为政府创建的数据。元数据和日志不属于受覆盖的数据输出。
这一调整缩小了受条款管控的信息范围。但它并未免除数据映射的需要,因为提示词、检索内容、生成回复、嵌入向量和微调材料仍可能跨越受覆盖的边界。
因此,这些排除更像分类规则,而非一概豁免。供应商需要证明政府采购了什么、可访问哪些功能、数据流向何处,以及 LLM 是否对交付的服务作出了实质性贡献。
官方文本还带来了一个解释问题。其自动失效段落列举了后台排除和附带功能排除,但没有明确以“和”或“或”将两者连接。
这种起草方式使人不确定:任一条件是否可单独排除该条款,还是必须同时满足两项条件。合同官可能需要在征集或谈判过程中澄清答案。
实际启示很直接。承包商不应仅因某项 AI 功能存在,就假定它受到覆盖;也不应认为将某项功能称为附带功能便能解决问题。
工作说明书、产品描述、系统架构和实际数据流,比产品标签更具分量。这是 GSA LLM 最终规则带来的第一个重大变化。
NIST 框架取代四类僵化的供应链角色
GSA 从固定供应商标签转向生命周期任务,但主承包商仍须负责识别每一个受覆盖参与方。
6 月提案将 LLM 供应链划分为四种明确角色:开发商、系统运营商、系统集成商和服务提供商。每种角色均有相应配套条款及规定的下传义务。
下传是指主承包商必须在与分包商的协议中纳入相关政府要求。当另一家公司实际处理技术或数据时,这能防止义务止步于第一层合同关系。
最终条款以美国国家标准与技术研究院发布的AI 风险管理框架中的任务描述,取代了这四个正式类别。
所引用的任务涵盖 AI 设计、AI 开发、AI 部署以及运营和监控。其中包括定义系统需求、构建模型、集成组件、将系统投入生产,以及在上线后评估输出等工作。
这种方法更能反映现代 AI 产品的构建方式。一家公司可以托管模型,另一家公司可以提供检索基础设施,第三家公司则可以将系统连接到政府工作流。
传统角色标签可能掩盖这些重叠职责。基于任务的测试关注每个参与方实际做什么,以及其在此过程中是否处理政府数据。
当分包商执行这些任务,并收集、处理、存储、保留、用于训练、用于微调或以其他方式处理政府数据时,主承包商必须向其下传适用要求。
这类表述覆盖的不只是模型开发商。云服务商、托管公司、系统集成商、检索供应商、评估服务商和托管运营合作伙伴,都可能进入合规链条。
该条款要求在选择和监督这些分包商时尽最大努力。承包商可以依赖证明、可独立验证的证据、模型卡、系统卡、安全文档、审计材料和相关认证。
现有材料只要能够合理证明合规,即可满足要求。承包商无需仅为满足该条款而创建重复记录。
不过,主承包商仍须将这些材料与受覆盖系统关联起来。通用安全认证并不能自动说明供应商是否会利用政府提示词进行训练、保留生成输出,或支持必要的数据删除。
最终文本对完全开放模型和开源 LLM 组件给予特殊处理。承包商无需将有关来源、所有权、司法管辖权或外国控制的条款下传至这些组件。
GSA 对完全开放模型的定义,比营销中常见的宽泛“开源 AI”表述更严格。其架构、权重、相关代码以及训练、验证和测试数据集,均须在适当许可下可供公众查验。
开放权重模型并不会仅因其参数可下载而获得同样分类。若相应代码和数据仍不可获得,GSA 会将该系统与完全开放模型区别对待。
这一差异会影响尽职调查。开放组件可通过公开可用的权重、技术报告、模型文档和训练数据披露进行记录。并不总是需要单独的合同专属证明。
开放权重模型仍须接受有记录的尽最大努力审查。承包商必须考量模型的文档、测试、技术报告及其在合同履行中的角色。
与 6 月的分类体系相比,NIST 结构给予承包商更大灵活性。但它也要求承包商更准确地维护供应链地图。
主供应商不能只是为每家公司分配一个标签后便不再过问。它必须了解各方执行哪些生命周期任务、各方处理哪些政府数据,以及适用条款的哪些段落。
当商业 AI 服务变更其子处理方、托管地点或模型系列时,这项工作会变得困难。合同团队需要在履约期间始终保持一致的工程和采购记录。
因此,最终条款以持续的事实分析取代僵化分类。这一结构更具适应性,但对复杂部署而言未必更轻松。
扩大的知识产权保护并不保留所有商业条款
承包商对既有技术保有更强权利,但在与供应商协议冲突时,政府条款仍享有优先权。
知识产权是 GSA 早期方案中争议最大的部分之一。3 月草案包含广泛的政府许可和限制措施,令依赖可复用商业技术的供应商感到担忧。
6 月版本改变了这一结构,但行业忧虑仍在持续。最终条款如今为合同签订前创建,或为更广泛商业用途独立开发的材料增加了更明确的保护。
政府不取得承包商既有商业产品、专有技术或面向多个客户使用的材料的所有权。该确认涵盖软件、配置、工作流、文档、模型、脚本、技术方法和专有技术。
当服务生成的信息、分析数据、知识库内容及相关材料符合既有或独立开发的商业资产条件时,也受到保护。
这种保护承认 AI 合同的一项核心特征:供应商很少只为一个政府客户构建完整模型及其支撑平台。它们会在许多部署中调整和复用通用基础设施、工作流、评估和技术组件。
最终文本还缩小了对源自政府数据的改进成果的转让范围。只要通用能力提升不纳入、揭示、披露或源自受覆盖的政府信息,相关权利仍归承包商所有。
这一例外降低了普通平台改进自动成为政府财产的风险。供应商可以完善通用排程方法或提高系统可靠性,而不会仅因相关学习发生在联邦项目期间就被迫放弃该成果。
当改进直接依赖政府数据时,边界就会变得更难界定。微调、检索索引、专用评估集或领域特定工作流,可能将可复用的工程能力与源自客户的信息结合在一起。
承包商需要在争议发生前记录这一区别。独立的代码库、数据血缘记录、模型清单和变更历史,可以证明某项改进究竟是通用性的还是政府特定的。
该条款还扩大了背景数据的概念。承包商可以保留其拥有、控制或获得许可的合格信息的所有权,其中包括用于开发或改进 LLM 的材料。
此前的措辞是指原始形式的背景数据。取消这一限制,意味着合格材料在履约期间经过修改或增强后,承包商仍可继续保有其所有权。
不过,IP 改进并未保留所有标准商业条件。最终条款指出,它是对现有《联邦采购条例》和 GSAR 条款的补充,但在与商业协议冲突时仍具有优先效力。
这一规则可能与普通云服务和 AI 合同发生冲突。标准供应商条款通常会限制审计访问权限,规定单方面的模型变更权,允许利用客户交互改进服务,或界定广泛的数据保留做法。
当 GSA 条款另有规定时,联邦合同不能安全地依赖这些默认条款。主承包商必须在向政府承诺合规之前审查其上游供应商协议。
这一问题对转售商和集成商最为突出。他们可能要向 GSA 对某项义务负责,而底层模型供应商并未在合同中接受该义务。
转售商可能承诺在重大模型变更前提前通知,却没有从供应商处获得相应承诺。它也可能接受超出供应商标准技术控制范围的政府删除要求。
因此,扩大的 IP 保护仅解决了商业冲突中的一部分问题。供应商获得了更清晰的所有权边界,但仍必须协调政府要求与每一家重要供应商的运营条款。
与早期草案相比,最终规则更有利于承包商,但它并未把联邦 LLM 采购变成普通的软件订阅。
数据控制与事件报告仍具实质分量
一旦某系统被纳入适用范围,缩小后的范围并不会削弱该条款的约束力,尤其是在政府信息流经模型、嵌入和分包商时。
受覆盖的承包商不得将政府数据用于为其他客户或商业目的训练或微调 LLM。它们也不得将其用于广告或出售给第三方。
这些限制要求技术隔离,而不仅仅是一份隐私声明。供应商需要控制措施,防止政府提示词、输出和检索内容进入通用训练或产品改进流水线。
加密、访问控制、日志记录、保留期限和删除程序,都会成为支持合规的证据的一部分。承包商还需要留存记录,说明信息在其自身系统和分包商环境中的存放位置。
检索增强生成带来了特定挑战。这种技术会在响应时向模型提供选定的外部信息,通常通过嵌入和向量数据库实现。
即使基础模型从未在这些信息上训练,相关支持性存储也可能包含政府材料。因此,承包商必须管理周边应用,而不仅仅是基础模型。
合同收尾也带来相关问题。项目结束时,相关嵌入、微调权重、已存储的输入、输出和衍生工件可能需要删除或返还。
在分布式系统中,删除可能很困难。备份、复制数据库、遥测流水线、评估环境和灾难恢复副本,都可能在主应用删除数据后继续保留这些数据。
可信的收尾计划需要预先识别这些位置。等到合同结束时才处理,可能会发现某家供应商无法在不干扰共享系统的情况下隔离或删除单一客户的信息。
最终条款还保留了针对受覆盖事件的 72 小时报告窗口。触发条件较 6 月提案更窄;后者可能覆盖广泛承包商网络中任何位置发生的事件。
现在,相关事件必须影响用于该合同的 LLM,并可能影响政府数据的保密性、完整性或可用性。这使该义务与实际合同风险更加一致。
72 小时时限从承包商实际获知相关事件后开始计算。承包商应明确谁可以获得该信息,以及信息如何从工程师或供应商传递至主承包商的政府合同团队。
当 FedRAMP、Cybersecurity and Infrastructure Security Agency 或其他联邦报告包含实质等同的信息,并且同时送达合同官时,即可满足该条款要求。
这一安全港减少了重复报告。但它并未消除协调需求,因为承包商必须确认现有报告包含 GSA 所要求的信息。
该条款还要求在实际获知重大违规后发出通知。若某项违规已经造成,或可合理预期将造成,对履约、政府权利、安全、保密性、法律合规或合同管理的重大损害,则该违规属于重大违规。
这一标准要求迅速作出法律和技术判断。团队需要共享的升级流程,因为工程师可能先发现数据暴露,却尚不清楚其是否达到合同规定的重大性门槛。
模型变更增加了另一项运营负担。政府可能期望获得有关影响可信赖性、安全性或运营完整性的变更通知和访问权限。
对于托管 AI 服务,模型更新可能频繁发生,且不受客户控制。依赖快速变化的商业端点的承包商,需要从供应商处获得合同化的通知,并建立测试更新后模型的流程。
这些义务说明了为何更窄的适用性测试如此重要。条款范围外的公司可以避免一套要求严格的控制体系;范围内的公司则面临横跨安全、产品管理、法律审查、采购和 AI 评估的义务。
报道的承包商工作负担包括 120 天披露截止期限、事件报告、收尾删除、重大模型更换前通知以及政府评估权。
并非每个承包商都会以同样的方式承受每项义务。部署设计、分包商关系、系统授权以及合同官的指示都会影响实施方式。
尽管如此,受覆盖的供应商应将该条款视为一项工程要求。仅凭政策文件无法证明其对训练流水线、数据存储、模型版本、访问日志或删除操作具有控制能力。
偏见标准收窄,但政府测试仍然存在
GSA 以“合理努力”标准取代了详细的意识形态规则,减少了一项合规争议,却未解决模型质量将如何衡量的问题。
6 月提案包含广泛的“无偏见 AI 原则”。它要求系统真实、中立且无党派,同时限制通过训练数据、提示词、检索来源和其他配置选择施加意识形态影响。
这些规定反映了 2025 年 7 月的一项联邦采购命令,该命令要求各机构采购符合求真和意识形态中立原则的 LLM。
行业组织和民间社会组织质疑,这些理念是否能够转化为客观的合同测试。模型输出会因提示词、上下文、采样设置、检索信息和系统配置而变化。
最终条款删除了大部分规定性框架。取而代之的是,承包商必须采取合理努力,在用户请求事实信息或分析时,设计、训练和配置受覆盖的 LLM,使其优先考虑准确性、科学探究和客观性。
“合理努力”比保证中立行为更具弹性。它承认概率模型无法承诺在每一种提示词下都具备完美准确性或给出一致答案。
修订后的措辞还删除了不得嵌入党派或意识形态判断的明确禁令。它不再建立与早期偏见框架特别绑定的同等持续监控要求。
这是实质性的让步。它降低了单次存在争议的响应自动构成合同违约的风险。
不过,合理努力仍需要证据支撑。承包商可能需要评估计划、记录在案的系统提示词、基准测试结果、已知局限性报告、模型卡和补救记录。
政府仍保留评估已部署系统的能力。承包商不能假定其关于准确性或客观性的内部声明会在未经测试的情况下得到接受。
这正是 NIST 框架不只是供应链术语体系的原因。其生命周期方法将测试、评估、验证和确认视为贯穿设计、开发、部署和运营的持续活动。
没有任何单一基准能够决定通用模型是否准确或客观。其性能会因领域、语言、检索来源、工具和政府使用场景而变化。
用于文件摘要的采购需要测试遗漏、引用保真度以及受限材料的处理。面向公众的助手则需要检查事实性、拒答行为、无障碍性、隐私和缺乏依据的建议。
智能体系统带来额外风险,因为它们能够调用工具或采取行动。其评估必须覆盖工作流逻辑和授权边界,而不仅仅是生成文本的质量。
该条款允许政府随时暂停使用受覆盖的 LLM。此前的措辞更直接地将暂停与尚未解决的性能问题联系起来。
这一更广泛的权利带来了商业不确定性。即使技术上合规的系统,也可能在机构调查某项问题期间面临运营中断。
最终条款还改变了退役责任。它将这些成本与在收到不符合该条款的通知后发生的终止联系起来,而不再仅限于违反早期无偏见 AI 规定的情形。
承包商对这些退役成本的责任上限为受影响任务订单或交付订单的 25%。重新采购成本和开发替代系统的成本不计入该计算。
这一上限为供应商提供了更明确的限制。然而,暂停或终止仍可能造成声誉损害、收入损失,以及超出规定退役金额的工程开支。
最大尚未解决的问题是评估一致性。不同机构、合同官和技术团队可能使用不同的提示词、数据集或阈值。
一个模型可能在通用基准上得分良好,却仍无法胜任专门的政府工作流。它也可能提升事实准确性,却因过于频繁地拒答而变得不那么实用。
因此,承包商应将评估与采购的具体使用场景相结合。相比宽泛的营销评分,更重要的是证明已部署配置在具有代表性的政府任务中的实际表现。
最终文本明智地避免承诺一种不可能实现的绝对中立状态。其“合理努力”标准仍为争议留下空间,例如哪些评估是恰当的,以及何种表现才算可接受。
三个信号将表明该规则是否有效
接下来的考验在于实施:合同官、主承包商和模型提供商必须将该条款转化为可操作的合同与工程实践。
第一个信号是,GSA 在 10 月 19 日之后将如何适用由两部分组成的适用范围测试。征求文件应明确 LLM 功能是否具有实质性,以及政府数据是否会直接输入系统或从系统中输出。
清晰的判定将强化这样一种观点:GSA 确实缩小了该规则的适用范围。若仅因附带的 AI 功能就将其例行纳入合同,则会削弱这一结论,并重新造成最终文本试图消除的不确定性。
承包商应关注征求文件是否说明了该条款适用的原因。他们还应研究合同官如何解读两项自动失效条件。
第二个信号是分包商条款传导的质量。主承包商需要订立与 NIST 生命周期任务以及各供应商所处理数据相匹配的协议。
模型提供商和云平台将面临压力,需要提供适用于政府采购的条款,涵盖数据保留、训练限制、事件通知、模型变更、评估访问和删除。
标准化补充协议将使小型集成商更容易遵守要求。若大型供应商拒绝接受这些条款,联邦市场机会将集中于拥有更强谈判能力或专门政府产品的供应商。
开源和开放权重模型构成另一项考验。最终条款区分了拥有完整公开资料的模型,以及仅发布权重的产品。
承包商需要证明其分类在技术上准确无误。关于“开放性”的模糊营销措辞,不应取代对许可证、源代码可用性、数据集和文档的核查。
第三个信号是 GSA 如何处理模型评估与不合规问题。合理努力提供了灵活性,但这种灵活性需要可重复的测试和相称的补救措施。
政府评估应反映所采购的使用场景、已披露的配置、现有证据和已知技术限制。单一的对抗性提示不应自动界定复杂部署的整体表现。
与此同时,供应商不应将模型的可变性当作控制薄弱的借口。他们可以记录测试套件、评估数据集、人工审查阈值、检索来源和补救决策。
正在准备投标的机构应在合同谈判开始前建立一套证据材料。其应包括架构图、数据流图、分包商清单、数据保留计划、模型变更程序、评估结果和合同收尾计划。
可搜索的技术档案可帮助团队在工程、安全、采购和法律审查之间关联这些材料。该系统仍必须遵守合同对政府数据施加的限制。
GSA 的 LLM 最终规则比其前身更为收窄,但绝非轻量级要求。其核心交换是:在政府有意采购 LLM 系统时,以更清晰的边界换取更深入的问责。
对于 AI 承包商而言,眼下的问题并非他们是否在某处使用生成式 AI,而是政府是否购买该能力、政府数据是否会接触它,以及每一位参与者是否都能证明合规。
在 10 月 19 日之前,供应商应依据自身实际架构和合同检验这一答案。如果提供商明天变更模型,主承包商能否识别影响、通知 GSA、保全证据并保护政府数据,而无需临时应对?



