top of page

透明组织提起申诉,EPA AI 影响评估仍处保密状态

2小时前
讀畢需時 15 分鐘

尽管联邦规定要求各机构在部署此类系统前记录相关风险,EPA 仍未公开其高影响力 AI 工具的最终评估。这一拒绝如今引发行政申诉,也直接检验着联邦 AI 透明度。

环境责任公共雇员组织(Public Employees for Environmental Responsibility,简称 PEER)与自由信息组织(Free Information Group,简称 FIG)于 2026 年 9 月 15 日宣布提起申诉。两组织在 3 月依据《信息自由法》(Freedom of Information Act)提交的请求,要求获取有关 AI 在化学品评估中应用的记录,其中包括与七种化学品相关的筛查工具。

EPA 确认,其公开的 AI 清单和最终影响评估属于应予回应的记录。不过,该机构以审议过程特权为由扣留了这些评估,并称对于请求中另外 13 个类别未找到相关记录。

这一回应引发的冲突已不止于一宗记录争议。联邦政策一方面推动快速采用 AI,另一方面要求对影响健康、安全和权利的系统施加额外管控。EPA 的 AI 影响评估本应揭示,在算法输出进入具有重大影响的机构决策前,这些管控措施是否有效。

尚未解决的问题并非 EPA 是否使用 AI。其公开计划和清单已确认这一点。问题在于,机构以外的人士能否评估其相关保证背后的证据。

EPA AI 影响评估申诉瞄准最终记录

该申诉同时质疑 EPA 扣留评估的决定,以及其记录检索范围似乎存在的局限。

PEER 和 FIG 于 2026 年 3 月 5 日提交了最初请求。根据其申诉公告,该请求涉及 EPA 在化学品评估中使用 AI 的情况,以及其针对七种化学品开展的筛查工作。

这些组织所要求的并不只是 AI 项目的一般清单。他们还请求获取有关工具选择、测试、性能、防护措施,以及 AI 可能在化学品评估中发挥何种作用的文件。

EPA 表示,仅找到两类相关材料。其中一类是该机构已公开发布的 2025 年 AI 用例清单;另一类则是一套针对高影响力 EPA AI 工具的最终影响评估。

这些评估并未公开。EPA 援引了审议过程特权,这一保护通常适用于机构作出决定前形成的内部沟通材料。

争议部分围绕“最终”一词展开。最终评估可能包含与内部审议相关的分析、建议或其他材料。仅凭标题并不能决定其中每一部分是否都符合扣留条件。

不过,这一标题为请求方提供了明确的审查依据。如果评估记录了已完成的测试、已采纳的管控措施、最终风险判定或事实发现,这些组织认为 EPA 不应将其完全视为保密审议材料。

FOIA 争议通常要求机构将豁免内容与可合理分割、无需豁免的信息区分开来。这意味着核心问题不一定是全面公开或完全保密。EPA 可能需要回答,其是否能够公开事实性章节、摘要、结论或经删节的版本。

检索工作本身也是另一个争议点。据报道,EPA 对另外 13 个涉及更广泛 AI 治理和化学品筛查实践的类别,没有找到相关记录。

这一结果并不能证明记录缺失,也不能证明 EPA 的检索工作不充分。机构可以公开讨论项目,而不一定会形成请求方预期的每一份文件。

不过,这一缺口值得审视。EPA 已发布 AI 战略,设有治理机构,追踪用例,并讨论过在整个机构工作中扩大 AI 应用。一次记录检索却返回如此有限的细节,这使该机构的公开项目与其文件记录之间出现张力。

PEER 执行董事 Tim Whitehouse 将问题置于公共问责的框架下。他认为,纳税人为这些工具提供资金,而其输出可能影响健康、安全和权利。

FIG 合伙人 Kevin Bell 将这些工具描述为以代码表达的政策。他担忧的是,即使最终决定在形式上由人类签署,自动化建议仍可能塑造机构的结果。

该申诉并未证明 EPA 的系统不安全、存在偏见,或正在主导化学品决策。它要求该机构公开足够的证据,让外部人士能够评估这些可能性。

这一区别十分重要。要求公开的最有力理由,并不依赖于事先证明算法造成了损害。其依据在于:当公众无法检查评估、防护措施或测试过程时,识别错误会变得困难。

联邦规则要求的不只是 AI 清单

项目清单只能表明 AI 的存在,而影响评估应说明一个具有重大影响的系统是否适合承担被赋予的角色。

EPA 的公开AI 用例清单对用例作出了宽泛定义。它可以包括为支持机构使命、决策、服务或公共利益而设计、开发、采购或使用的系统。

该机构的 2025 年清单最初于 2026 年 2 月 10 日发布,之后又进行了更新。EPA 还发布了一份涵盖常见 AI 使用形式的综合报告。

清单提供了有用的基础信息。它们可以识别项目的目的、开发阶段、技术类别、负责部门、供应商参与情况及影响分类。

但它们不一定会披露批准部署所依据的证据。简短描述无法说明测试数据是否代表真实运行条件、不同人群之间的错误率是否存在差异,或审查人员是否质疑过项目团队的假设。

OMB 备忘录 M-25-21 正是区分了这一点。它将高影响力 AI 定义为:其输出构成对权利或安全产生重大影响的决策或行动的主要依据之一的系统。

人类参与并不会自动使系统脱离这一类别。机构必须考虑 AI 输出的实际功能,以及决策过程对其依赖的程度。

根据联邦 AI 政策,各机构必须在部署高影响力 AI 用例前完成影响评估,并应在适当情况下于系统整个生命周期内更新该评估。

所需分析范围广泛,包括预期用途、预期收益、数据质量、模型能力、对隐私和公民权利的潜在影响、重新评估程序、直接成本及独立审查。

测试必须预判现实世界中的结果,而不能只依赖实验室表现。机构还需要建立程序,以便在部署后发现并解决性能下降的问题。

这些要求使 AI 影响评估比清单条目提供的信息更丰富。评估应当将系统声称的收益与证据、局限性、监督机制,以及愿意承担剩余风险的明确责任人联系起来。

这一区别解释了为何 EPA AI 影响评估成为申诉的核心。EPA 发布的清单确认了相关活动,但不能替代高影响力部署所要求的详细分析。

OMB 的政策也包含重要限制。并非每个 AI 辅助工作流程都属于高影响力,即使它在敏感项目内部运行。

帮助科学家查找论文的搜索工具可能仍属于辅助性质。根据工作人员如何使用其输出,对化学品进行监管关注度排序的模型则可能具有更大影响。

因此,同一项技术在不同工作流程中可能获得不同分类。背景、权限、数据和人类依赖程度,比模型的营销标签更重要。

这为合理分歧留下了空间。EPA 可能认为某一工具只是支持研究,并非对重大决策的主要依据。批评者则可能认为,同样的排序或建议在实践中具有决定性,因为员工很少偏离它。

影响评估应当记录这一边界。若无法获取其推理依据,外部人士就无法判断 EPA 测试的是一个真正具有辅助性质的系统,还是采用了低估其影响力的狭义定义。

更快的化学品审查提高了隐性假设的代价

AI 可以帮助 EPA 整理科学证据,但当筛查选择悄然决定哪些证据得到关注时,速度就可能变得危险。

化学品评估要求科学家处理大量且不均质的信息。研究可能在物种、暴露途径、剂量、结果、质量以及与人类健康的相关性方面存在差异。

机器学习和自然语言处理可帮助对研究进行分类、提取信息、识别相关记录,或确定审查材料的优先顺序。这些功能能够减少重复性工作,并帮助专家在不断扩大的证据基础中导航。

然而,筛查并不中立。模型的排序可能影响审查人员优先查看哪些研究、哪些记录获得更仔细的关注,以及哪些明显缺口会触发进一步研究。

假阳性可能浪费时间。假阴性则可能更为严重,因为相关证据可能永远无法送达负责评估危害的专家手中。

风险取决于工作流程设计。作为第二个检索渠道使用的模型,与用于将文件排除在进一步审查之外的模型,带来的风险敞口不同。

这正是“AI 辅助”这类宽泛标签透露的信息很少的原因。读者需要知道,系统是在检索、总结、排序、排除、预测,还是提出建议。

他们还需要知道哪些数据用于训练或评估该工具。科学文献中存在发表偏倚、术语不一致、不完整摘要,以及数十年来不断变化的研究方法。

化学品名称也带来额外复杂性。同一种物质可能有多个名称,而关系密切的化合物则可能具有实质性不同的性质。

理想情况下,EPA 的评估应说明系统如何处理这些情况。它还应描述验证样本、相关误差指标、人工审查程序,以及性能低于预期时的应对措施。

申诉中引用的公开证据并未证明 EPA 已将最终化学品风险决策委托给 AI 系统。PEER 和 FIG 表示,该机构尚未说明 AI 工具是否进入监管决策流程,以及这些工具如何配置。

这一核实缺口应始终处于核心位置。若没有证据表明其承担这一角色,将实验性筛查工具描述为自动化监管者并不准确。

同样,仅因流程中某处仍有人类参与,就过早驳回这一担忧也并不妥当。自动化偏见——即过于轻易接受系统建议的倾向——即使正式权限仍掌握在员工手中,也可能影响结果。

人员配置和时间压力会增加这种风险。当审查人员面对数千条记录时,一份优先级列表可能成为审查在实践中的实际形态。

AI 也可以提升一致性。相较于在不同截止期限下工作的团队,一个有文档记录的模型或许能更统一地应用筛查标准。

这种潜在益处进一步强化了开展可衡量评估的理由。EPA 应能够证明,该工具是否以可接受的比例发现相关证据,以及人工审查人员能否识别其错误。

因此,这场争议并非技术与人工审查之间的简单较量。它关乎透明的自动化,与其影响无法被独立审查的自动化之间的区别。

EPA 自身的计划表明,该机构将 AI 视为远不止一项小型试验。其 2027 财年预算材料称,AI 将支持规则制定和许可相关工作,包括对数以万计的公众意见进行分类。

该预算申请了 2.022 亿美元和 730 个全职等效岗位,以推进 AI 能力建设。这一数字覆盖的是更广泛的项目,而不只是化学品筛查或高影响系统。

但这也说明,治理记录为何在当下至关重要。适用于试点项目的监督机制,未必能自动扩展至规则制定、许可、执法和科学评估等领域。

EPA 承诺设置管控措施,但将证据留在内部

EPA 已发布的治理架构听起来颇为严肃,但被扣留的评估文件包含检验该架构是否改变实际运营决策所需的证据。

EPA 的 AI strategy 描述了三个治理小组。执行层 AI 治理委员会负责制定方向,而 AI 小组委员会则负责制定政策并维护用例清单。

更广泛的实践社群为数据科学家和项目工作人员提供了交流反馈与运营经验的渠道。该组织本身并不是治理机构。

该战略称,EPA 纳入了美国国家标准与技术研究院的 AI 风险管理框架。它还将试点、监测、反馈循环、培训、网络安全审查和法律咨询列为保障措施。

对于高影响系统,EPA 表示,其 AI 小组委员会负责监督旨在应对潜在负面影响的管控措施。这些都是联邦 AI 治理中合理的组成部分。

但该战略并未展示这些管控措施在特定系统上的实际表现。它无法揭示独立审查人员是否发现尚未解决的缺口、测试是否覆盖了现实的失效模式,或领导层是否在面对技术异议时仍接受了相关风险。

这些信息应存在于项目层面的记录中。因此,影响评估正是 EPA 的总体治理承诺应与运营证据相衔接之处。

即便相关法律豁免最终适用,扣留这些文件仍会造成可信度问题。公众被要求信任一套程序,而其中最具信息价值的输出仍无法获取。

EPA 无需公开源代码、受保护的个人数据、网络安全细节或保密商业信息,也可以缩小这一差距。它可以发布经删节的评估、评估摘要、模型卡、失效类别或以通俗语言说明的风险决策。

它还可以解释为何某一特定系统符合高影响标准。如果某项工具会影响健康或安全决策,该机构应说明相关决策、其输出所扮演的角色,以及承担问责责任的官员介入的环节。

反过来,EPA 也应解释为何一项表面上敏感的用途不被认定为高影响。这将有助于厘清,该系统究竟只是提供轻微的行政支持,还是在塑造具有重大后果的结果。

联邦政府更广泛的记录表明,信息披露不完整并非 EPA 独有的问题。一项 2026 年 Brookings 分析发现,各机构在 2025 年记录了超过 3,600 个 AI 用例。

高影响系统占总数的 12.3%,即 445 个用例。但该分析发现,已部署的高影响用例中,超过 85% 缺少部分有关风险管控措施的必需公开信息。

这些清单发现并不能证明各个机构未开展内部评估。它们表明,随着具有重大影响的 AI 不断扩张,公开报告尚未跟上步伐。

同一分析指出了一项重要政策转变。早期指南涵盖控制或显著影响结果的系统。M-25-21 目前则聚焦于其输出作为决策主要依据的系统。

这种表述可能会缩小受覆盖的类别。即使 AI 大幅塑造了决策者能够获得的证据,机构也可能主张 AI 只是为更广泛的人类流程提供信息。

风险在于出现问责缺口。一个系统可能重要到足以改变工作流程,却仍低于对“主要依据”的严格解释门槛。

EPA 承认其持有最终评估文件,表明它已将至少部分工具归为高影响。然而,现有回复并未透露这些工具的名称、功能或部署状态。

这种不确定性应当阻止任何一方作出一概而论的主张。这些记录可能显示了审慎的测试和克制的部署;也可能暴露出缺口、未解决的风险或不明确的责任归属。

披露之所以有价值,正是因为两种结果都仍有可能。

上诉检验的是保密性,而非 EPA AI 的准确性

即使请求方胜诉,虽然会提升透明度,但这本身并不能证明 EPA 的工具准确无误或被不当部署。

行政 FOIA 上诉要求机构重新考虑其最初的回应。审查办公室可以维持该决定、推翻该决定,或要求进行更广泛的检索并追加披露。

当前挑战仍处于这一阶段。尚无法院裁定 EPA 不当扣留了相关评估,上诉公告所呈现的是请求方对于争议的叙述。

EPA 在保护部分内部审议内容方面具有正当利益。决策者需要空间来测试观点、讨论风险并否决初步结论,而无需将每一次交流都变成最终政策。

AI 评估也可能包含安全敏感描述、个人信息、采购细节或保密数据。负责任的披露程序必须兼顾这些利益。

更棘手的问题在于,这些顾虑是否足以证明应完整扣留最终文件。当一个机构能够披露保障措施的存在,却屏蔽所有显示这些保障措施如何被应用的证据时,公共问责就会变得薄弱。

平衡的发布方式可以保留受保护段落,同时公开决策记录。有用的信息字段包括工具用途、负责办公室、部署状态、评估设计、已知限制、监测计划和升级处理流程。

独立审查尤其值得关注。OMB 要求由未参与开发的审查人员识别疑虑或缺口。

这一要求有意制造组织层面的摩擦。项目团队往往专注于预期收益,而独立审查人员则应检验假设并审视失效模式。

公众并不需要看到每一条内部意见,才能判断这一保障措施是否发挥作用。公众需要足够的信息,以了解提出了哪些疑虑,以及负责问责的官员如何处理这些疑虑。

披露也存在流于形式的风险。机构可能发布经过修饰的摘要,却省略阈值、不利发现或未解决的分歧。

原始技术细节则带来相反的问题。一份冗长文件可能看似透明,却仍让受系统影响的人难以理解。

因此,有效的联邦 AI 透明度需要分层设计。简短摘要应解释决策及其后果,而技术文档则应支持专家审查。

结构化清单字段应随着时间推移将这些材料连接起来。稳定的标识符将帮助研究人员追踪系统是否从试点转为部署、是否改变影响分类,或是否获得更新后的评估。

EPA 的公开清单目前提供了一个起点。被请求的评估将补充项目列表无法提供的风险证据。

政府范围内的审计进一步强化了建立这种关联的必要性。美国政府问责局发现,在选定的 11 个机构中,报告的生成式 AI 用途从 2023 年的 32 项增至 2024 年的 282 项。

联邦 AI 审查还将政策合规、技术资源、预算和快速变化的技术列为反复出现的管理挑战。

这些发现并未评估存在争议的 EPA 工具。它们说明,随着机构添加系统的速度快于治理实践成熟的速度,仅依赖内部保证将变得愈发困难。

这项上诉也为采用 AI 的企业带来一项实际启示。清单、审查委员会或政策文件,并不能证明已部署系统符合所宣称的标准。

组织需要可追溯的证据,将每个用例与其数据、测试、限制、监测、负责人和风险决策关联起来。否则,治理将沦为一系列与实际运行软件脱节的承诺。

EPA 所处的位置尤其敏感,因为科学评估可能为规则、暴露限值、许可选择和执法重点提供依据。错误可能通过影响社区、劳动者、企业和生态系统的决策不断传导。

这并不意味着每个 EPA 模型都需要公开源代码或无限制访问其数据。它意味着,对输出的审查力度应随其后果的重要性而提升。

三个信号将显示联邦 AI 监督是否真正有牙齿

下一项检验在于 EPA 是否发布有意义的证据,而不是是否再发表一份支持负责任 AI 的高层声明。

第一个信号是 EPA 对行政上诉作出的决定。若完全推翻原决定,请求方将可获取相关评估,但仍须遵守其他适用的删节规定。

部分发布或许更有可能。其价值取决于删节后仍可见的内容。

有用的回应应保留有关用途、评估、限制、独立审查和监测的事实。若页面大多被扣留标记占据,核心问责问题仍将无法解决。

该决定还应回应记录检索问题。EPA 可以解释其审查了哪些办公室、系统、保管人和检索词,而不暴露受保护内容。

如果该机构找到额外的治理或化学品筛查记录,这将强化请求方关于首次检索不完整的论点。若它记录了一次审慎检索后仍未发现任何内容,关注点则转向 EPA 是否创建了充分的记录。

第二个信号是 EPA AI 清单的下一次修订。读者应关注新识别的高影响系统、变化的部署阶段、稳定的项目标识符,以及风险管理摘要的链接。

EPA 的公开页面称,该机构会持续维护这份清单。更新可以揭示存在争议的系统是否仍在运行,以及化学评估项目是否以可识别的描述出现。

分类变化将很重要。被重新归类为较低风险的高影响工具,应附有与其运营角色相对应的清晰理由。

反向变化同样重要。开始影响监管或健康相关决策的试点项目,应触发更严格的测试、监测和披露。

第三个信号是 M-25-21 在政府范围内的执行情况。OMB 可以通过问责审查和年度清单报告请求相关文件。

有关认定和豁免的公开摘要将显示,联邦 AI 规则是否会产生超越机构自我报告的后果。若反复出现缺口却没有纠正措施,该政策的可信度将被削弱。

国会、监察长和政府问责局(GAO)也可以审查各机构是否在部署前完成了必要评估。他们的工作能够检验那些公开清单无法完全呈现的记录。

对开发者而言,这起案件说明,部署场景与模型设计同样重要。一个用于整理文件的分类器,一旦其排序决定专家会看到哪些证据,便可能产生重大影响。

对企业采购方而言,这也揭示了仅依赖供应商声明或治理核对清单的不足。采购方需要与自身数据、用户和决策流程相对应的评估记录。

知识工作者也应关注这一问题,因为人工审查并不保证独立判断。审查人员需要拥有时间、权限以及可获得的证据,才能质疑自动化建议。

因此,EPA AI 影响评估争议既是对机构记忆的考验,也是对公众获取信息权利的考验。各机构必须记录:为何批准某个系统、审查人员当时掌握了什么信息,以及由谁接受了剩余风险。

没有这些记录,后续调查人员可能难以还原自动化工作流如何影响一项决策。当模型变更、员工离职和分散的文档抹去背景信息时,私营组织同样会面临这一问题。

此次上诉不会决定所有联邦 AI 是否值得信赖。但它可能确立一个原则:高影响分类背后的证据,是否仍然只对作出该分类的机构可见。

关注上诉裁决、下一份 EPA 清单以及 OMB 的执法记录。如果这些信号带来具体证据,联邦 AI 监管将更容易接受检验;如果它们只带来政策表述,政府最具影响力的系统仍将主要只对自身负责。

 
 

免费开始

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)M-Chip Mac

你的 AI 工作伙伴

remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page