top of page

DHS AI FOIA 涂黑承诺提速,却可能加深保密

9月29日
讀畢需時 14 分鐘

尽管机器能否作出可靠的信息披露判断,现有证据仍很有限,DHS 计划利用 AI 为每年 10 万至 14 万宗公共记录请求提出涂黑建议。DHS AI FOIA 涂黑计划承诺缩短处理时间,但也可能让过度扣留信息变得更快、更便宜,也更难由请求者提出质疑。

美国国土安全部表示,在记录离开机构之前,员工将审核相关建议。这一保障措施至关重要,因为《信息自由法案》(Freedom of Information Act,FOIA)要求作出结合具体情境的法律判断。模型可以识别姓名或身份证明号码,却无法独立判断披露一场政策讨论是否会造成法律上可识别的损害。

这不是技术与纸质官僚体系之间的较量。真正的冲突在于处理效率与有实质意义的公众获取权之间。联邦机构面对的人数记录请求量,已令人工审核人员难以应对。然而,政府尚未证明,在法律允许披露的情况下,自动化建议会始终倾向于披露。

这个问题在 DHS 尤其重要。根据联邦涂黑计划引用的联邦数据,该部门在 2025 财年处理了近 100 万宗请求。其中只有 2.3% 在未作涂黑的情况下提供了记录。即便自动化只影响其中一部分工作量,其假设也将塑造记者、研究人员、律师和普通公民能够了解多少联邦活动。

DHS AI FOIA 涂黑实际会做什么

眼下的变化并非自主审查,而是自动化建议以极大规模进入法律审核流程。

美国海关与边境保护局作为 DHS 下属机构,计划在 FOIA 处理过程中使用 Google 人工智能和机器学习工具。该系统将识别可能符合扣留条件的内容,并向政府员工建议涂黑。

涂黑是指在发布记录前移除其中的一部分,通常是遮盖文本、图像、音频或视频。当信息属于 FOIA 豁免范围,或其他法律禁止披露时,机构便会进行涂黑。常见示例包括个人数据、机密材料、执法信息以及某些内部审议内容。

DHS 的说明称,自动化应能缩短处理时间。该部门还表示,工作人员将审核每个案件,确保请求者收到准确完整的信息。这些表述意味着,最终决定仍由人类负责。

然而,计划中的规模改变了这种审核在实践中的含义。DHS 预计将把 AI 应用于占其提交请求超过 10% 的类别。该部门估计,这一范围约为 10 万至 14 万宗请求。

审核机器建议,并不一定等同于作出新的独立决定。繁忙的员工可能从模型标出的段落开始,并重点确认这些内容。这种工作流程可能产生自动化偏见,即因为系统的输出显得系统化或具有权威性而倾向于接受它。

当模型处理范围超出显而易见的个人信息时,这一区别就变得至关重要。识别社会保障号码遵循相对稳定的模式。对一封讨论尚未完成政策的电子邮件适用豁免,则需要理解文件作者、目的、时间、受众,以及它与最终决定之间的关系。

DHS 尚未公开说明,其系统在多大程度上仅处理简单的模式匹配,而非此类结合情境的决定。它也未披露全面的性能结果、错误率、测试记录、训练示例或推翻建议的比例。

其他部门也在进行试验。据报道,内政部使用 Microsoft 技术定位可能受律师—客户保密特权保护的材料。卫生与公众服务部曾介绍一个用于审核和涂黑大规模文件集合的概念验证系统。司法部表示,多个下属部门已在使用自动化搜索和审核功能。

因此,这一趋势并不局限于 DHS 的一次部署。联邦机构正在政府记录与请求获取这些记录的人之间,建立一层机器辅助机制。尚未确定的是,这一层机制会帮助审核人员找出可披露信息,还是会鼓励他们移除更多信息。

这种不确定性使一次运营升级成为对政府透明度的考验。

联邦机构为何现在要自动化 FOIA

AI 正在进入 FOIA 领域,因为请求量和记录集合已超出许多机构现有审核系统的承载能力。

FOIA 赋予公众向行政分支机构请求记录的权利。它不适用于国会、联邦法院或大多数直接向总统提供建议的办公室。每个受其覆盖的机构都必须查找相关记录、审查这些记录、适用任何合法豁免,并发布所有可合理分离的非豁免材料。

当一宗请求涵盖数千封电子邮件、附件、消息、视频、电子表格和扫描文件时,这一过程就会变得缓慢。审核人员必须找出重复内容、识别相关材料、咨询其他办公室、保护合法保密事项,并保留一切依法可以发布的内容。

根据司法部的年度 FOIA 数据,2025 财年,联邦政府各机构共处理创纪录的 160 万宗请求,较前一年增长 9%。

技术能够应对这项工作中的若干机械性环节。光学字符识别可将扫描页面转换为可搜索文本。去重可移除重复的电子邮件链。实体识别可定位姓名、电话号码、地址和其他反复出现的模式。分类系统可以优先处理看似与请求相关的文件。

这些用途的风险并不相同。如果替代方案是不完整的人工搜索,那么在记录集合中检索相关记录可以扩大获取范围。自动遮盖语言则会影响公开发布内容的实质。

联邦官员多年来一直在探索这一区别。2026 年 5 月,首席 FOIA 官员委员会、国家档案馆政府信息服务办公室以及司法部举办了第三届 NexGen FOIA Tech Showcase。

政府的技术展示活动征集用于电子取证、案件处理、无障碍发布、公共阅览室和自动化涂黑的工具。拟议系统涵盖纸质文件、数字内容、视频、音频和结构化数据。

此次活动延续了 2022 年和 2024 年的类似展示,也反映了联邦 FOIA 咨询委员会的一项建议:鼓励机构就 AI 辅助处理向业界征求信息。

采用程度仍然有限,但正在增加。国家档案馆最新的FOIA 评估报告发现,2025 年,20.6% 的受访联邦机构使用 AI 或机器学习来协助搜索或整理记录,高于前一次评估中的 18.6%。

同一份报告发现,80% 的机构使用电子取证工具进行 FOIA 搜索,而 2020 年这一比例为 72%。这些数字表明,在生成式 AI 成为主导性的技术话题之前,机构已在自动化文件工作。

积压问题确实存在。延迟获取可能使准确的信息失去价值。一份在选举、法院争议、政策辩论或公共紧急事件之后才发布的记录,可能来得太晚,无法为问责提供参考。

因此,当自动化帮助工作人员定位文件、移除重复内容或识别显然受保护的个人数据时,它可以服务于开放。更快的处理并非毫无意义的好处。

危险在于,机构将速度视为衡量成功的主要指标。结案的请求不一定是得到充分回应的请求。一份充满不必要黑框的快速答复,可能比一份较慢但经过审慎审核的披露更缺乏公共价值。

因此,核心绩效问题不能是系统每小时处理多少页,而必须是:在何种程度的人类审查后,有多少合法信息抵达公众手中,又出现了多少错误。

效率承诺遭遇信息披露难题

同一套既能加快正当涂黑的系统,也可能放大政府现有的过度扣留倾向。

DHS 在 2025 财年处理了 994,992 宗 FOIA 请求。其中,只有 2.3% 的已完成案件在未作涂黑的情况下发布了记录。约 40% 的案件发布了部分涂黑的记录。

其余请求因多种原因结案。一些依据法定豁免获得完全拒绝。在许多案件中,该部门表示未找到相关记录。其他请求则被撤回、转交他处,或因程序原因结案。

这些类别并不能证明存在不当行为。DHS 负责移民、边境执法、网络安全、应急管理、运输安全和保护行动。其记录通常包含个人数据,以及与执法或国家安全相关的信息。

不过,基准情况很重要。DHS 并非将自动化建议引入一个以广泛、未经涂黑披露著称的系统,而是将其引入一个完整发布本已罕见的系统。

AI 可能将这个系统推向任一方向。设计完善的模型或许能帮助员工隔离受保护的姓名,同时发布段落其余部分。这将支持法律所要求的:将豁免信息与公众可以获得的材料分开。

校准不佳的模型则可能因一句话看似包含受保护语言而标记整个段落。如果员工接受这一建议,系统就会连同可能敏感的文本一起隐藏非豁免的背景信息。

模型还会犯两种不同类型的错误。假阴性会遗漏本应受保护的信息,可能暴露私人或机密材料。假阳性则会将依法可披露的信息标记为应移除。

政府的激励机制并不会平等对待这两类错误。意外披露可能立即引发安全事件、隐私投诉或纪律问题。不必要的涂黑通常只会加重请求者负担,他们必须通过申诉或诉讼提出挑战。

这种失衡会鼓励采取保守设置。一个为避免意外发布而优化的系统,很可能标记更多材料。在时间压力下工作的人工审核人员随后可能批准这些建议,因为扣留在机构层面显得更安全。

结果可能形成一条通向保密的棘轮。每项模型建议单独看来都显得谨慎,但在数十万宗请求中,累积效应可能移除大量原本经更审慎审核后会被发布的信息。

自动化也能带来一致性,但一致性并不必然意味着公平。模型可以在整个机构内采用对法律的狭隘解读,也可能复现用于配置或训练它的记录中那些前后不一的决定。

FOIA 决定往往取决于机构历史。如果过去的审查人员经常对某类讨论内容予以扣留,学习其工作成果的系统可能会将这种做法视为常规答案。模型并不知道,早先的决定是出于审慎的法律分析、过时的指引,还是习惯性的过度删节。

这会形成一个反馈循环。先前的扣留决定影响自动化建议,审查人员接受这些建议,获批的输出随后又成为支持未来自动化决定的证据。

政府唯有通过有意的评估才能打断这一循环。各机构需要包含豁免材料和可公开材料的测试集合。独立审查人员应衡量假阳性、假阴性,以及在有效删节周围被一并损失的非豁免文本数量。

人工推翻数据同样重要。如果员工几乎从不否决模型建议,监督可能徒有其名。如果审查人员频繁增加或移除删节,系统可能并未如承诺的那样节省大量人力。

DHS 表示人类仍将参与其中。但它尚未说明这种参与是否独立、人员是否充足、是否有记录,以及是否接受质量检查。在这些细节公开之前,效率方面的说法仍不完整。

AI 无法仅凭模式判断可预见的损害

模型可以识别语言模式,但 FOIA 要求机构将每一项扣留决定与具体且可合理预见的损害联系起来。

国会通过 2016 年《FOIA 改进法案》强化了这一要求。机构通常只有在合理预见披露将损害相关豁免所保护利益时,才可以扣留豁免信息;如果其他法律禁止公开,也可以扣留相关信息。

可预见损害标准防止机构将每一项技术上可适用的豁免视为自动指令。一份文件可能落在某项豁免的范围内,却仍缺乏保密的实质理由。

司法部的披露指引要求各机构考虑具体语境。相关因素可能包括记录的年代、此前的官方披露、其敏感性及用途。当潜在损害不明确时,机构应咨询了解情况的工作人员。

这项工作与实体识别有根本区别。模型可以找到一个人的姓名,但仅凭姓名无法判断披露是否会侵犯隐私、暴露机密来源、揭示公务行为,或重复已公开的信息。

同样的挑战也适用于审议过程特权。这项保护可涵盖反映机构内部咨询的某些决策前沟通,但并不允许机构隐藏每一份草稿、建议或内部电子邮件。

研究人员曾针对这一问题测试机器学习。Jason R. Baron、Mahmoud F. Sayed 和 Douglas W. Oard 汇集了克林顿总统档案中的材料,并训练分类器识别可能具有审议性质的段落。

他们的机器学习研究发现,当训练和评估遵循一致的审查人员解读时,系统表现最佳。当审查人员、记录保管人或主题发生变化时,表现会减弱。

在后续公开讨论中,Baron 将这些方法描述为:在区分与审议过程特权相关材料方面,准确率约为 70%。在一致条件下公布的结果显示,F1 指标介于 70% 至 83% 之间。F1 分数结合了模型找到多少相关段落,以及其正向分类有多大比例是正确的。

这些结果对分流工作很有用,但不足以支持无人监督的法律决定。在 70% 的表现水平下,相当一部分段落将被错误分类。

研究也揭示了一个更深层的问题:人工审查人员并不总能就同一段文字是否符合扣留条件达成一致。基于一名审查人员解读训练的系统,可能难以应对另一名审查人员以不同方式适用法律的情况。

这种分歧不仅仅是技术噪声。它反映了 FOIA 的语境性特征。法律判断取决于记录所代表的内容、政府已经披露了什么,以及公开会带来何种具体损害。

因此,DHS 所需要的不只是站在自动化流程末端的一名人工审查员。有意义的审查需要足够的时间、权力和信息,来否决模型的建议。员工还必须审查,是否可以通过更窄范围的删节来保护合法利益。

机构应为每一项自动化建议保留审计记录。该记录应明确系统标记了哪些段落、为其关联了何种豁免、员工修改了什么,以及最终决定为何满足可预见损害标准。

请求人不需要获取敏感训练数据或系统安全细节,但确实需要获得可理解的信息,了解自动化工具如何影响其所请求的记录。缺乏这种可见性会使上诉更加困难,因为请求人无法区分律师的判断与模型辅助下的默认决定。

黑箱建议绝不应仅因人类点击了批准,就在页面上变成黑箱。

只有改变结果时,人工审查才是一项保障

除非机构衡量人员是否真正质疑自动化建议,否则“人类参与回路”这一说法几乎没有保护作用。

DHS 表示员工将审查 AI 辅助案件。联邦 FOIA 监察机构也警告,AI 和机器学习无法取代关于豁免与可预见损害的专业判断。

这是正确的正式立场。其有效性将取决于工作流程设计。

如果审查人员在任何建议标记出现前先看到完整文件,便可以形成独立判断。如果系统呈现的是一页已被建议删节覆盖的文件,这些标记就会形成锚定效应。审查人员随后必须为移除保护措施辩护,而不是决定是否应当增加一项。

这种差异看似只是程序问题,却改变了疑虑的走向。在第一种流程中,不确定性可以有利于披露;在第二种流程中,不确定性有利于保留模型的黑箱。

人员配置带来另一项限制。机构采用自动化,可能恰恰是因为没有足够人员处理工作量。如果同样的人手短缺让审查人员只能用几分钟检查每一项结果,正式的人类批准就会沦为吞吐量检查点。

绩效目标可能会加剧这种压力。管理者可能衡量已结案件数、已处理页数或积压减少量。这些数字容易统计,而通过审慎审查保留了多少非豁免信息则更难观察。

有效的监督计划应采用多项指标。机构应将机器辅助决定与独立审查样本进行比较,跟踪员工移除建议删节、缩小删节范围,或补充系统遗漏保护措施的频率。

它们还应测试不同文件类型的结果。一个能可靠识别标准化表格中护照号码的工具,在政策电子邮件、手写笔记、电子表格、录音访谈或历史文件上的表现可能很差。

测试必须涵盖两类错误的后果。假阴性可能暴露受保护的信息,假阳性则可能剥夺公众获取信息的机会。若将隐私和安全错误视为唯一有意义的失败,就会把过度删节嵌入评估流程。

机构应公布汇总结果。有用的披露包括:使用 AI 处理的请求数量、涉及的豁免、抽样错误率、审查人员推翻率,以及处理时间的变化。

公开报告不会泄露个别请求中的敏感内容,但能确立该工具究竟表现为助手,还是未获承认的决策者。

上诉提供了另一项证据来源。如果 AI 辅助案件导致更多行政上诉成功,这一趋势将表明系统或其审查流程扣留范围过宽。机构应将这些结果与传统人工审查案件进行比较。

法院最终也将发挥作用。FOIA 诉讼往往要求机构通过声明或 Vaughn 索引说明删节依据;Vaughn 索引是一份将被扣留材料与所主张豁免相联系的文件。自动化工具不会减轻这一法律负担。

如果机构无法在不笼统援引模型的情况下解释披露为何会造成损害,其理由就应当失败。无论由哪家供应商提供软件,政府始终须对最终决定负责。

因此,供应商监督也是公共问责的一部分。合同应允许政府测试、保留日志、记录模型变更,并防止敏感记录被重新用于无关训练。机构还必须了解,系统投入生产后更新是否会改变其行为。

政府使用 AI 删节的最强版本,是帮助员工定位可能敏感的内容,同时保留其独立的法律判断。最弱版本,则是将过度删节转变为一种可重复执行、并在末端附有人类签名的工作流程。

DHS 描述的是前一种版本。区分它与后一种版本所需的证据尚未公开。

三个信号将显示该系统是否服务于开放原则

下一项考验不在于 DHS 是否部署 AI,而在于该部门能否证明,这项技术在不暴露受保护材料的前提下,公开了更多依法应公开的信息。

第一个信号是运营透明度。DHS 应清楚说明哪些请求类别使用自动化建议、由哪些模型执行工作,以及它们支持哪些豁免。

该说明应区分基础模式识别与语境化法律分类。定位一个身份证明号码,与评估内部政策讨论,风险并不相同。若将二者合并在一个“AI”标签之下,将妨碍有意义的审查。

该部门还应披露汇总绩效指标。假阳性率将显示系统多常建议隐藏本可公开的材料;假阴性率则表明系统多常忽略受保护的信息。

审查人员推翻率将揭示人类是否行使独立判断。接近零的比率可能意味着工具极其准确;但更有可能的是,它会引发对自动化偏见、审查时间有限,或抑制员工修改建议的激励机制的疑问。

第二个信号是已公开记录的质量。处理时间应缩短,但公开范围不应缩小。研究人员可以比较部署前后完全公开、部分公开和完全拒绝公开的比例。

这些类别并不完美。删去一个词与十页黑框都可能被计为部分公开。因此,DHS 应审查具有代表性的文件样本中,已公开的响应性文本所占比例。

行政上诉将提供另一项衡量标准。涉及机器辅助删节的成功挑战增加,将削弱该部门的论点。若公开结果保持稳定或有所改善,同时延误时间缩短,则将支持其效率论证。

第三个信号是可执行的问责机制。申请人需要知道自动化何时对答复产生了实质影响。机构申诉工作人员和法院则需要留存记录,说明每项建议如何进入最终决定。

国会、监察长和美国国家档案馆应审查:在模型标记某段内容后,DHS 是否独立适用了“可预见损害”标准。他们还应评估供应商控制措施、数据安全、模型更新,以及防止反馈循环的保护机制。

这些保障措施无一要求拒绝自动化。FOIA 办公室需要更好的检索、去重、文件转换和审查工具。相关记录在积压中多年无人处理,并不会改善公众获取信息的权利。

然而,更快的删改并不等于更快的公开。前者移除信息,后者则让公众及时获取法律允许公开的一切信息。

这一差异应指导对 DHS AI FOIA 删改措施的每一次评估。该部门可以通过公布审计方法、错误衡量指标、人工覆盖数据以及公开前后的结果,来验证其做法。

记者、研究人员、律师及其他申请人应关注这些指标,而不是将更短的处理时间视为成功的证明。当机构给出笼统解释,或似乎扣留了超出必要范围的信息时,他们也应通过行政申诉提出异议。

AI 可以帮助识别公开信息与受保护信息之间的边界,但不应悄然将这条边界推向保密。决定性的问题很简单:当 DHS 加快流程后,美国人会获得更多可用信息,还是只会更早收到那些被涂黑的页面?

 
 

免费开始使用

一款本地优先的AI助手

为了获得更好的人工智能体验,

remio 目前仅支持Windows 10+ (x64)和M-Chip Mac 。

你的 AI 工作伙伴

和 remio 一起高效工作

规划、创作、交付

一站式完成

bottom of page