DHS 扩大 AI 用于 FOIA 处理,但人工审查才是真正的考验
- Olivia Johnson

- 7月31日
- 讀畢需時 14 分鐘
美国国土安全部计划扩大 AI 辅助的 FOIA 处理能力,此前该部门在 2025 财年结束时仍有 245,572 份待处理申请。该部门表示,自动化能够减少行政工作,并帮助员工应对不断增长的公共记录申请量。矛盾很直接:只有在检索、分类和删减结果仍然准确的前提下,更快的处理才有价值。
DHS 在该财年收到超过 100 万份《信息自由法》申请。虽然处理数量接近这一规模,但待处理库存仍从年初的 221,068 份申请增至更高水平。该部门称,其正式积压量相当于收到申请总数的 16%。
这些数字说明了为何联邦机构将自动化视为不止于实验的工具。然而,DHS 正在考虑让 AI 参与影响公众能获得哪些记录的决定。因此,这项计划是一场问责考验,而不只是一个办公室现代化项目。
该部门已列出一项部署前的使用场景,用于识别和删减敏感内容。美国海关与边境保护局也在使用可从审查人员决策中学习、并按相关性对记录分类的文件审查软件。民权倡导者警告称,这些系统可能会复制现有的过度删减模式,同时压缩细致人工审查的空间。
DHS 正在让 AI 更深入地进入 FOIA 工作流程
关键变化不在于 DHS 使用软件,而在于 AI 正在更接近具有实质影响的审查决定。
DHS 多年来一直使用电子工具接收申请、管理案件、共享文件、删除重复内容及交付记录。这些功能取代了人工处理,但未必会决定公众能够看到什么。较新的使用场景则进一步介入文件识别和删减。
该部门的年度 FOIA 报告称,其隐私办公室正持续开发并部署用于处理申请的新技术。DHS 预计将在未来一年推出更多自动化工具。该部门将目标描述为提升效率并消除重复性的行政工作。
这一描述涵盖了范围广泛的潜在功能。自动化系统可能填写案件字段、检测重复文件、将扫描页面转换为可检索文本,或将记录转交给正确的办公室。每项功能都能节省时间,而无需替代法律判断。
文件相关性则更为敏感。只要一份记录属于申请人的检索范围,它就是相关记录,即使其中部分信息之后必须被豁免公开。如果系统错误地将其归类为无关,申请人可能永远不会知道它曾经存在。
删减又带来一层风险。FOIA 允许机构依据具体法定豁免条款扣留信息,其中包括涉及国家安全、执法和个人隐私的保护。适用这些豁免通常需要语境、法律解释,以及对可预见损害的判断。
DHS 已确定一项旨在简化敏感材料识别和删减流程的 AI 使用场景。根据其公开清单,该部门将这一计划中的使用场景归类为非高影响。该分类很重要,因为根据联邦 AI 政策,高影响系统面临更严格的风险管理预期。
清单显示,该系统仍处于部署前阶段。这意味着公开记录尚未说明 DHS 将在多大范围内使用它、哪些组件将参与,或员工会采纳其建议的比例。
另一项工具已经是整体图景的一部分。DHS 将 RelativityOne 列为用于知识检索的商业 AI 系统。美国海关与边境保护局的一项隐私分析则更具体地描述了其作用,包括支持及时回应 FOIA 申请。
在 CBP 的 FOIA 部门内,该平台可以从审查人员的决定中学习,并将文件标记为相关或无关。这种技术通常被称为技术辅助审查,即软件利用人工标注的示例,对更大规模的文件集合进行排序或分类。
技术辅助审查并不总是意味着自主决定是否公开。审查人员可以利用预测结果为文件排序、识别可能的重复项,或将注意力集中于不确定的分类。公开文件未明确一些重要细节,包括员工何时必须核验标签,以及 DHS 如何衡量错误。
这一空白构成了核心张力。DHS 将 AI 描述为对负担过重员工的支持,但一些已有记录的能力可能会影响哪些文件能送达这些员工手中。效率取决于减少人工步骤;问责则取决于了解哪些步骤不能被安全移除。
申请数量说明了 DHS 为何推进自动化
DHS 面临的工作量问题足以让自动化具有吸引力,甚至无需将人员压力纳入计算。
该部门在 2025 财年开始时有 221,068 份待处理 FOIA 申请。此后,它又收到超过 100 万份新申请,并处理了接近同等数量的申请。然而,DHS 最终仍有 245,572 份待处理申请,全年增加了 24,504 份。
待处理申请和正式积压并不相同。当一项申请在适用的法定答复期限后仍未解决时,才会形成积压。DHS 表示,其积压量占收到申请总数的 16%,尽管待处理库存总量超过 245,000 份。
这一区别很有用,但并不会让运营挑战变得微不足道。每个待处理案件仍需要跟踪、沟通、检索、审查或交付。复杂申请可能涉及大量电子邮件、移民档案、执法记录、视频,或分散在多个组成机构的材料。
DHS 长期承担着联邦 FOIA 工作量中异常庞大的一部分。其下属机构包括美国海关与边境保护局、美国移民与海关执法局、联邦紧急事务管理局、运输安全管理局以及美国公民及移民服务局。
其中多个组成机构保存着人们因迫切的个人或法律原因而需要的记录。移民申请可能涉及个人的官方档案。与灾害相关的申请可能涉及紧急事件后政府作出的决定。记者和监督机构则寻求政策记录、合同、通信和执法数据。
因此,对速度的需求不止关乎便利。延迟提供记录可能影响诉讼、新闻报道、移民程序、历史研究,或公众对现行政策的监督。
联邦劳动力变化进一步增加了压力。据最初报道援引的数据,在第二届特朗普政府开始后,超过 600 名政府信息专员离开联邦服务体系,其中近 100 人来自 DHS。
政府信息专员这一职业类别包括许多处理 FOIA 申请的员工。由于岗位职责各不相同,人员离职并不直接等同于 FOIA 处理能力出现同等幅度的下降。不过,联邦劳动力数据显示,原本已面临不断增长记录工作量的机构,正受到更广泛的人员缩减影响。
经验丰富的审查人员减少会形成艰难循环。剩余员工接手更多案件,管理者寻求更快的工具,审查人员用于检查自动化结果的时间则更少。原本旨在缓解压力的技术,随后可能更难得到适当监督。
DHS 并非唯一经历这一转变的机构。美国国家档案馆下属政府信息服务办公室报告称,18.6% 的受访机构在 FOIA 处理中使用了 AI 或机器学习。这一发现表明相关采用已经开始,尽管大多数机构仍未报告使用这些工具。
其他部门也在探索类似功能。美国卫生与公众服务部曾描述涉及自动化工作流功能、文件发现平台和 AI 概念验证的工作。国防部门官员也研究过将智能体式、生成式和预测式 AI 用于 FOIA 业务。
这正在成为政府范围内对需求上升和人员受限的回应。DHS 因其处理量、敏感记录和执法职责而格外突出。在这样的环境中出现错误,可能同时影响个人申请人和更广泛的公共监督。
核心权衡是速度与可审查判断之间的取舍
AI 可以加快发现流程,却不具备 FOIA 决定所需的法律判断。
有些任务具备相对明确的自动化条件。光学字符识别可以将扫描页面转换为可检索文本。重复内容检测可以避免审查人员反复阅读同一封电子邮件线程。语言识别和文件转换则可以为审查做好准备。
检索辅助也能帮助员工找到狭窄关键词查询可能遗漏的记录。机器学习系统可识别相关概念、对可能相关的文件进行排序,并将相似材料分组。当一个案件包含数千份文件时,这些能力很有价值。
美国公民自由联盟高级工作人员律师 Cody Venzke 在最初报道中承认了这一潜力。他表示,AI 可能加快文件发现,并降低宽泛申请遗漏相关材料的概率。
他的警告关乎接下来会发生什么。删减并不只是模式匹配练习。审查人员必须识别一项法律豁免,将其适用于具体材料,并考虑公开是否会造成可预见的损害。
语境会改变答案。某个姓名可能在一份记录中需要保护,但在另一份记录中已经公开。描述内部审议的段落可能包含仍应公开的、可分离的事实信息。一项执法技术可能在某一时刻很敏感,但之后已广为人知。
模型可以根据既往示例分配标签,但过去的标签并不一定正确。机构的答复反映了法律解释、风险偏好、诉讼历史和审查人员习惯。用这些答复训练模型,可能会以更大规模复制相同倾向。
这种担忧尤为重要,因为机构经常被指责对记录过度删减。一名过度谨慎的人工审查人员可能会在一个案件中隐藏过多信息。一个接受数千项谨慎决定训练的系统,则可能将这种行为应用到数千个案件中。
电子隐私信息中心法律研究员 Abigail Kunkler 认为,基于既有答复训练的自动化系统会反映既有的删减模式。她担心的不仅是 AI 模型偶尔会失败,而是该系统会将机构偏好扣留信息的倾向标准化。
相反的错误同样重要。模型可能无法识别个人数据、安全信息或受法律保护的细节。这可能暴露个人信息,或损害调查。因此,机构有合理理由将系统调校得更加谨慎。
然而,为谨慎而进行的调优会使错误偏向不披露。申请人很难发现某条记录在审查前被分类器排除。它们可以质疑看得见的删节,但无法质疑从未收到、甚至不知道存在的文件。
这种不对称性使响应性分类尤为重要。假阳性会将无关文件发送给审查人员并耗费时间。假阴性则可能悄然将一份符合响应条件的记录排除在流程之外。
DHS需要能够反映这种差异的评估指标。单一准确率评分可能掩盖有害的失败模式。该部门应分别追踪遗漏的响应性记录、不必要的审查、错误的删节建议以及暴露的敏感信息。
测试也需要真实的数据。基于干净样本文档评估的系统,在扫描页面、手写笔记、电子邮件链、附件、音频转录文本或包含多种语言的记录上,表现可能不同。DHS各组成部门都会处理这些格式。
AI最有价值的用途是让系统保持辅助角色。它可以为文件排序、建议删节,并解释哪些模式触发了建议。受过培训的员工将确认记录是否具有响应性,并作出最终的不公开决定。
这种结构保留了人的权力,但前提是审查具有实质性。要求员工点击批准按钮,并不能形成有意义的监督。审查人员需要有足够的时间、培训和系统信息来质疑建议。
DHS尚未充分说明其保障措施
公开清单列出了AI能力,但没有提供足够证据来判断其控制措施。
DHS将其计划中的敏感内容识别和删节用例归类为非高影响。这一决定限制了与该系统相关的风险管理要求。然而,公开信息并未充分说明该用例为何获得这一分类。
联邦政策定义在此很重要。一个系统可以影响获取政府信息的途径,而无需就福利、执法或个人自由作出决定。这个较窄的角色可能使其不属于正式的高影响类别。
不过,较低的正式分类并不意味着较低的公共问责风险。FOIA是审查行政机构的主要法律机制之一。改变搜索或删节方式的工具,可能塑造记者、诉讼当事人、研究人员和公民对政府活动的了解。
DHS描述之间的差异值得关注。通用商业清单将RelativityOne归类为知识检索系统。CBP的隐私分析描述了一项从审查人员处学习并独立标记文件相关性的功能。
两种描述在技术上都可能准确。知识检索包括查找和分类文件。然而,较宽泛的标签并未传达将一条记录排除在进一步审查之外的重要性。
Cato Institute高级研究员Patrick Eddington认为,这种差异掩盖了最可能需要更严格审查的能力。他的批评指向一个清单设计问题:一个通用类别可以满足披露要求,却未能说明实际操作中的决定。
DHS应公布每种工具在每个阶段所发挥的作用。说明应区分搜索、优先级排序、响应性分类、删节建议、最终批准和质量保证。将这些功能统称为“处理”会妨碍有意义的评估。
该部门还应说明人工审查门槛。每一个无关标签都会得到核验,还是只核验样本?软件能否在没有逐行批准的情况下发布已删节文件?当模型表示低置信度时会发生什么?
审计记录是另一个缺失部分。一个可辩护的系统应保留模型版本、输入集合、分类结果、审查人员修改和最终结果。这些记录将帮助DHS调查错误,并回应行政申诉或诉讼。
申诉程序必须考虑自动化辅助。质疑搜索不充分的申请人需要知道机构是否使用了机器学习。审查该搜索是否充分的法院,需要关于系统如何配置和监督的证据。
采购带来了进一步的不确定性。DHS发布了意向通知,拟将一份包含AI功能的定制FOIA软件合同授予Deloitte。意向通知表明该部门计划采取的采购路径,并不能证明已完成部署或已测得性能。
该计划中的软件紧随一场联邦FOIA技术展示活动,该活动包括近40家供应商。根据活动摘要,近85%的供应商重点展示了AI功能,包括音频遮蔽、删节、相关性扫描、字段填充和面向公众的聊天机器人。
供应商的兴趣表明DHS将拥有选择。它并不表明这些工具符合共同的准确性、安全性或可解释性标准。产品演示很少能复现争议性申请中出现的文件质量和法律模糊性。
合同条款可以将保障措施转化为可执行要求。DHS可以要求针对具有代表性的记录进行测试、披露模型变更、报告事件、保留审计日志、确保可访问性,并限制对政府数据的二次使用。
该部门还可以在更广泛部署前要求独立评估。测试应包括公民自由专家、经验丰富的FOIA专业人员、档案官员、安全人员以及频繁申请者的代表。
缺少这些细节,公众只能从简短的清单说明和采购通知中推断保障措施。对于旨在支持一项透明度法律的系统而言,这并不足够。
AI FOIA删节需要可衡量的人工监督
只有当DHS衡量人们是否发现系统错误时,人工审查才具备可信度。
机构常以“人始终参与其中”来回应对AI的担忧。这句话听起来令人安心,但它描述了许多不同的运行模式。审查人员可能检查每一份文件、核查一小部分样本,或仅在系统标记不确定性后才介入。
DHS应为每项功能定义审查模式。行政自动化可以在常规质量检查下运行。响应性分类需要更严格的验证,因为假阴性可能隐藏记录。删节建议在发布前需要法律审查。
抽样可以支持质量保证,但样本必须反映风险。随机检查可能遗漏含有重要响应性材料的罕见文件。DHS应对低置信度预测、异常格式、敏感主题和涉及广泛公共利益的案件进行过度抽样。
该机构还需要一个基线。不与既有人工程序进行比较,它就无法证明改进。衡量指标应包括处理时间、审查人员工作量、遗漏记录、被撤销的删节、申诉结果和诉讼结论。
仅靠速度会得出误导性的结果。一个通过排除更多文件而更快结案的系统,看似高效,却可能减少披露。DHS需要成对指标,同时显示及时性和完整性。
删节准确性不只是统计页面上的黑框数量。该部门应审查每项不公开是否具有有效豁免依据、非豁免信息是否得到合理分离,以及机构是否适用了可预见损害标准。
还应衡量审查人员的行为。自动化偏见发生在人员对系统建议赋予过高权重时。当审查人员工作量很高,或认为软件已经完成困难分析时,这种偏见可能增加。
界面设计可以降低这一风险。系统应展示支持性文本和置信度信息,而不能将其答案呈现为既定结论。审查人员应记录他们为何接受或拒绝敏感建议。
培训同样重要。员工需要理解模型评估什么、在哪些方面表现不佳,以及源材料的变化如何影响结果。仅有法律培训无法解释机器学习的失败模式。
DHS在2024年邀请约500名来自其FOIA处理中心的员工参加一项虚拟培训计划。课程包括讨论AI和机器学习在FOIA处理中的应用。这是一个有用的起点,但部署需要持续、针对具体工具的准备。
独立监督可以检验控制措施是否能承受运营压力。监察长、National Archives的FOIA申诉专员、国会委员会和法院,在评估机构透明度方面都扮演不同角色。
申请人也能提供证据。遗漏记录、不一致删节或异常狭窄搜索的模式,可能揭示汇总性能数据遗漏的问题。DHS需要建立流程,将这些投诉与系统评估关联起来。
该部门应披露重大事件。如果模型遗漏响应性记录或暴露受保护信息,DHS应记录范围、纠正措施和预防性变更。悄悄修复一项申请,会让潜在风险继续存在。
公开报告不需要披露敏感记录或专有代码。DHS可以公布测试方法、汇总结果、审查要求和错误类别。这些披露将使外部人士能够评估治理,而不暴露运营秘密。
更广泛的教训适用于FOIA之外。一个机构不能仅仅在自动化之后设置批准步骤,就弥补熟练员工的减少。有意义的监督需要拥有时间、权力、培训和证据的人员。
三个信号将表明该计划是否改善信息获取
下一项检验是DHS是否公布运营证据,而不是是否宣布更多AI工具。
第一个信号是更详细的AI清单。DHS应说明哪些组成部门使用每个系统、哪些处理阶段采用自动化,以及哪些决定需要人工确认。它还应解释其影响分类的依据。
更清晰的披露将强化该部门的效率论证。它们将表明DHS已将低风险文书任务与影响记录获取的决定区分开来。又一项关于“知识检索”的笼统描述将削弱信心。
第二个信号是Deloitte采购及任何后续任务订单的结构。该采购通知应促成涵盖准确性测试、审计追踪、人工审查、模型变更、数据保护和事件报告的要求。
包含可衡量控制措施的合同,将把公开承诺转化为供应商义务。主要聚焦吞吐量和部署速度的合同,则会将风险转移给FOIA员工和申请人。
第三个信号是在即将到来的报告周期中的表现。DHS应披露,在处理质量保持稳定的同时,待处理清单是否从245,572份下降。申诉撤销、诉讼结论和得到证实的搜索投诉,可以为结案总数提供重要的制衡。
只有在自动化改善获取渠道时,较小的积压量才能支持DHS的论点。更快的回应若伴随着更广泛的删节或遗漏记录,就意味着行政工作有所进展,却没有带来更强的透明度。
公众还应关注人员配置。FOIA Ombudsman report显示,AI 的采用正在各政府机构间扩散。但这并不能证明软件能够取代经验丰富的档案专业人员。
如果专业人员持续流失,DHS 可能难以提供其保障措施所假定的审查能力。如果该部门维持训练有素的团队,并将自动化用于准备和优先级排序,这些工具就更有可能安全地减少重复性工作。
最可信的结果不会是一个完全自动化的 FOIA 办公室,而是一套能够找到更多相关记录、消除常规处理环节,并让员工投入更多时间进行法律分析的系统。届时,DHS 应公布足够的证据,让外部人士能够核实这一结果。
FOIA 自动化值得审视,恰恰因为这项技术处于透明度流程之中。一个隐蔽的错误可能决定哪些政府行为继续不为人知。这使得可审计性成为一项核心功能,而非可有可无的合规层。
DHS 现在有机会为 AI 辅助公共记录处理建立一套可行模式。该部门应明确人工权责,测试现实的故障模式,并报告速度指标之外的结果。
随着部署推进,请求者、记者和监督团体应提出三个问题:AI 会影响哪些决策,由谁核查这些决策,以及有哪些证据表明这些核查有效?答案将决定 DHS 是在减少延误,还是仅仅将信息扣留自动化。


