五角大楼 AI 测谎计划将自动化置于经验证准确性之前
五角大楼的 AI 测谎计划拟在五年内投入 3,030 万美元,以升级一项科学基础仍备受争议的技术。这项计划名为 Polygraph+ 或 Polygraph Next,将把非接触式生理感测与人工智能、机器学习及自动评分相结合。
国防反情报与安全局(DCSA)希望在 2027 财年以 642.1 万美元启动该项目。其预算申请中列出了现场测试、独立验证研究、原型评估、集中式数据存储以及决策支持工具。
这听起来像是一项工程计划,但它最棘手的问题并非工程技术。传感器可以更精确地测量生理变化,却无法据此证明这些变化意味着欺骗。
因此,围绕 Polygraph Next 的矛盾远不止于一次常规设备升级。五角大楼希望在解决这些评估究竟能够可靠推断什么之前,先实现可信度评估的自动化与规模化。
历史比较至关重要。一项具有里程碑意义的美国国家科学院评估发现,传统测谎仪在某些特定调查中的表现优于随机猜测,但距离完美仍相去甚远。对于员工筛查,该评估得出的结论则严厉得多:无辜者的人数可能远超真正的安全威胁。
新系统承诺带来更好的一致性、速度和可追溯性。然而,公开预算文件并未给出准确率目标、可接受的假阳性率、已发布的验证方案或部署门槛。
这些缺失的信息将决定 Polygraph Next 最终是成为更好的研究工具,还是更快地产生可疑结论的方式。
五角大楼 AI 测谎计划将建设什么
Polygraph Next 是一项获得资助的研究提案,而非一台准确性已获验证的成品测谎设备。
五角大楼的 Polygraph Next 预算将该项目纳入 DCSA 的研究、开发、测试与评估项目组合。文件显示,该申请日期为 2026 年 4 月。
拟议时间表列出,2027 财年将投入 642.1 万美元。后续计划金额包括:2028 年 644.9 万美元、2029 年 615.8 万美元、2030 年 566.0 万美元,以及 2031 年 565.4 万美元。
这些年度金额合计为 3,034.2 万美元。文件将完成成本和项目总成本均标注为“持续中”,意味着这份五年申请未必代表最终上限。
研究预算表中没有列出该项目此前年度的支出。因此,2027 财年将是这项具体计划拟议的启动时间点。
DCSA 将 Polygraph+ 和 Polygraph Next 作为同一现代化计划的替代名称。其既定目标是提高联邦可信度评估的准确性、可靠性、可用性和可追溯性。
该计划包含多个拟议组成部分。其中之一是自动评分,即由算法评估信号并协助生成结论。另一项是远距感测,即无需将传统传感器直接附着于受测者身上即可测量生理活动。
该机构还提议建设集中式存储和分析能力。这一部分将汇集检查数据,用于评估、比较和潜在的模型开发。
DCSA 表示将开展独立验证研究、现场测试和原型评估。它还将情报与安全应用研究实验室以及橡树岭国家实验室列为研究合作伙伴。
这些细节勾勒出一条开发路径,但几乎没有揭示最终运行模式。文件并未说明部署后的系统将使用哪些生理信号。
文件同样没有明确 AI 是会推荐评分、分类检查结果、标记异常,还是直接影响人员决策。这些角色所带来的风险截然不同。
帮助识别存在噪声的传感器的算法,与给一个人贴上欺骗标签的算法,并不等同。同样,由受训考官审查的决策辅助工具,也不同于高度自动化的筛查系统。
该计划的近期范围是联邦人员审查和内部威胁检测。这些场景涉及可能需要接触敏感信息的雇员、申请者、军人和承包商。
这一背景提高了风险。一项错误输出可能导致安全许可延迟、调查方向偏移、职业生涯受损,或使无辜者受到更多怀疑。
该申请也不等同于拨款。国会仍掌握拟议资金是否可用的决定权,并可能修改金额、条件或报告要求。
目前,Polygraph Next 最适合被理解为一项政府研究与采购计划。它拥有目标、拟议预算和机构合作伙伴,但尚未公开展示其性能表现。
为什么人员审查如今承受压力
该计划针对的是实际存在的运营负担,尽管其拟议解决方案在科学上仍未尘埃落定。
DCSA 在联邦审查体系中占据核心位置。它开展背景调查,并支持政府大部分部门针对机密信息访问权限作出的决策。
其国家可信度评估中心负责制定培训标准,并就测谎政策向国防和情报官员提供建议。该中心的可信度评估使命还包括技术支持、研究、测试、项目监督和审计。
这一机构职责使 DCSA 有明确理由推进工具现代化。传统检查需要训练有素的人员、受控环境、传感器准备、访谈和结果解读。
这些要求限制了处理能力,也可能造成考官、地点、设备和测试条件之间的差异。
非接触式传感器承诺提供更简便的设置。自动评分承诺带来更一致的分析。集中式数据则承诺更强的审计与可追溯性。
每项目标都具有运营价值。然而,没有任何一项目标能够证明系统可以准确区分欺骗与焦虑、恐惧、困惑、愤怒或普通的生理波动。
更广泛的审查体系已经面临老旧技术和现代化延迟的压力。DCSA 正在开发 National Background Investigation Services 平台,以取代旧系统并支持全政府范围的改革。
一项 2026 年的人员审查评估发现,DCSA 每年开展约 200 万项背景调查。该评估还发现,该机构仍未为完成其重大技术项目制定可靠时间表。
同一份评估报告称,持续审查警报数量从 2023 财年每季度约 3 万条,上升至 2025 财年第三季度超过 10 万条。持续审查通过自动化记录核查,识别需要审查的情况变化。
这一增长说明了核心挑战。自动化可以收集和标记更多信息,但当系统产生大量警报时,也会带来更多工作。
Polygraph Next 进入这一环境,成为另一种可能的筛选工具。如果它能提升信号质量并减少评分不一致,或许能帮助调查人员集中注意力。
如果其分类校准不佳,结果可能恰恰相反。它可能生成额外警报、强化薄弱的怀疑,并扩大人工审查人员的工作量。
因此,压力落在 DCSA、安全许可申请者以及寻求合格人员的机构身上。DCSA 需要更快的流程,而申请者需要准确且可解释的决定。
雇主同样需要可预测的安全许可时间表。在政府完成所需审查前,国防承包商无法将部分雇员安排到涉密工作岗位。
安全官员则面临相反的风险。推进过快可能使机构更容易遭受间谍活动、未经授权的信息披露、胁迫或其他内部威胁。
这正是更快的检测器听起来颇具吸引力的原因。它似乎能在不降低审查力度的前提下提高效率。
但只有基础分类值得信赖时,速度才有帮助。更快地处理模糊的生理信号,并不会自动带来更好的安全保障。
因此,Polygraph Next 必须满足两项标准:它既要减少运营摩擦,也必须证明其输出能在真实条件下改善决策。
第二项标准更难实现。它需要证明在不同人群、环境、提问形式、医疗状况和压力水平下,系统的误差表现如何。
缺少这些证据,五角大楼就可能将处理能力误作准确性。二者并不可互换。
Polygraph Next 如何在未解决推断问题的情况下使用 AI
AI 可以使生理信号评分标准化,但无法让这些信号只代表谎言。
传统测谎仪记录呼吸、心血管活动和皮肤电导等变化。考官会比较不同问题下的反应,并判断某些差异是否暗示欺骗。
Polygraph Next 拟在这一流程中加入 AI 和机器学习评分。机器学习会从样本中识别统计模式,并将这些模式应用于新数据。
这种方法或许能够减少部分考官之间的差异。算法可以在数千段信号中应用同一套数学规则。
它还可以结合一个人难以轻松评估的更多变量。时序、信号形态、反应持续时间和跨传感器之间的相关性,都可能影响评分。
远距感测改变了数据收集方式。系统不再完全依赖附着式设备,而可能从一定距离获取部分生理测量数据。
预算文件并未确认最终的传感器配置。因此,除非接触式生理监测之外,对具体方案作出进一步描述都为时过早。
不过,这种架构形成了一条清晰的推断链。传感器首先测量物理反应,软件再从该反应中提取特征。
随后,模型将这些特征转化为评分或建议。最后,考官或官员在安全背景下解读这一输出。
错误可能在每一个环节进入。传感器可能捕捉到噪声,模型可能学习到不可靠的相关性,而决策者可能赋予结果过高权重。
最大的难题存在于测得反应与所声称心理状态之间。生理唤醒增强可能伴随欺骗,但也可能伴随对不被相信的恐惧。
如实陈述的申请者可能会对指控作出强烈反应。欺骗者则可能保持冷静,或使用改变记录模式的反制措施。
美国国家科学院的测谎科学评估在现代机器学习普及之前就已研究过这一问题。其核心科学警告至今仍然适用。
生理反应并不只对应欺骗。这意味着改进后的分类器可以变得更一致,却不一定更有效。
设想一个基于既往测谎测试训练的模型。历史标签可能来自测谎员判断、供述、案件结果或实验室指令。
每种标签来源都有弱点。测谎员判断可能复现该方法本身的假设,而供述则可能无法获得或并不完整。
实验室实验能提供更清晰的真实标签,因为研究人员知道谁接到了撒谎指令。然而,模拟的谎言很少会带来真实安全审查中那样的后果。
模型也可能学会走捷径。它们可能将训练数据中的动作、说话风格、健康状况、人口统计特征或测试环境与标签关联起来。
在单一数据集内表现优异,并不能消除这种担忧。系统必须能适用于新受试者、新地点、新测谎员以及现实的基础发生率。
基础发生率描述目标状况在受测人群中的普遍程度。在人员筛查中,严重违反安全规定者理论上应当极为罕见。
这种罕见性使假阳性尤为重要。即使一项测试在均衡实验中看似准确,也可能在低患病率的劳动力群体中误判大量无辜者。
AI评分层无法逃脱这一数学规律。恰恰相反,自动化使校准变得更为重要,因为它能以更大规模应用相同的阈值。
可解释性带来了另一项挑战。调查人员需要知道,某一评分究竟反映了有意义的反应、较差信号质量、异常生理状况,还是模型自身的局限。
笼统的置信度评分无法提供这一答案。高模型置信度可以与高度自信但错误的分类同时存在。
AI最站得住脚的角色应当是狭窄且可检验的。它或许可以改善质量控制、检测损坏的测量数据,或将评分一致性与经过训练的测谎员进行比较。
一个被宣传为AI测谎仪的系统,则提出了范围广得多的主张。它暗示可观测生理信号与欺骗之间存在可靠联系,而研究人员尚未证实这种联系。
核心权衡在于一致性与有效性
Polygraph Next 可以让评估更加统一,却也可能让未经证实的推断显得更具权威性。
DCSA最有力的实际论据关乎标准化。当流程能在不同测谎员和地点间产生可比记录时,联邦项目将从中受益。
自动化评分可以记录哪些测量数据影响了输出结果。集中式系统可以保存记录,并支持后续审计。
这些功能可能减少任意性差异。它们也可能揭示旧流程未能捕捉到的不一致执行模式。
然而,一致性并不等于准确性。一把刻度错误的尺子每次都能产生相同的误差。
这一区别很重要,因为计算机生成的分数往往带有客观性的表象。即使其科学含义仍不确定,官员也可能倾向于遵从数值结果。
“AI”这一标签会放大这种效应。用户可能以为系统发现了微妙的欺骗信号,实际上它学习的只是训练数据特有的相关性。
五角大楼的公开文件称,该项目将包含独立验证。这是一项重要承诺,但独立性不只是另行指定一个团队。
评估人员需要获得方法、数据集、错误定义和测试条件的访问权。他们还必须能在不受项目压力的情况下公布不利发现。
验证应将特定事件调查与广泛筛查区分开来。两种应用涉及不同的人群、问题、激励机制和统计权衡。
美国国家科学院、工程院和医学院指出,测谎仪在某些特定事件中能够实现高于随机水平的区分。它也发现,筛查方面的证据较弱,并警告不要依赖测谎仪作出员工安全决策。
这一差异应从一开始就塑造 Polygraph Next。单一的头条准确率数字会掩盖那些错误后果最严重的应用场景。
系统也需要清晰的决策边界。在其局限性得到理解之前,研究评分不应悄然成为不利行动的依据。
联邦政策历来将测谎结果视为更广泛流程的一部分。调查人员可以利用测谎来引导访谈,或发现需要进一步审查的问题。
如果自动化输出直接流入其他审查系统,Polygraph Next 可能模糊这一边界。集中式分析可以使一项评分具有可移植性和持续性。
可移植性能提高效率,但也会扩大错误的后果。一项存疑结果可能伴随申请人经历多轮审查、岗位分配或不同机构。
预算文件将可追溯性列为一项益处。恰当的可追溯性应当显示谁使用了评分、它如何影响决策,以及后续证据是否支持该评分。
它还应让官员能够更正记录。否则,集中式数据可能比起保存问责机制,更擅长永久保留错误。
隐私是这项权衡的另一部分。生理数据可能泄露超出测谎员所提问题范围的信息。
这些文件并未公开说明保存期限、访问规则、模型训练授权或二次使用限制。在大型数据集积累之前,这些政策值得审查。
网络安全同样重要。集中存放可信度评估结果的资料库将包含敏感个人信息和国家安全信息。
DCSA已经管理着包含大量背景调查数据的系统。加入生理记录和模型输出,将进一步提升该环境的敏感性。
政府还必须考虑对抗性行为。激励程度很高的受试者可能研究测试方法,并试图操纵自身反应。
DCSA明确指出,反制措施是现有技术面临的问题。然而,机器学习并不会自动击败它们。
在已知反制措施上训练的模型或许能检测熟悉的模式。对手则可通过开发训练分布之外的技术作出回应。
这会在检测与规避之间形成军备竞赛。因此,对提升韧性的主张必须针对具有适应能力的参与者进行测试,而不能只依赖配合的志愿者。
该项目的核心权衡如今已很清楚。自动化可以让流程更快、更一致,也更便于审计。
与此同时,它也可能规模化假阳性、掩盖不确定的假设,并为存在争议的判断披上一层数字化外衣。技术治理必须与其传感器和模型同步推进。
独立验证必须证明什么
决定性测试不在于 Polygraph Next 是否能识别实验室模式,而在于它能否在不伤害无辜者的前提下改善真实决策。
五角大楼应首先界定预期用途。为质量保证而构建的模型,所需证据不同于用于建议作出欺骗认定的模型。
公开文件应明确输出结果是建议性的还是决定性的。还应说明官员是否可以推翻这些结果,以及如何审查这些推翻决定。
接下来是真实标签。研究人员需要一种可信的方法,判断哪些参与者存在欺骗行为,哪些是在如实作答。
实验室指令提供了已知标签,但真实性有限。现场案件具备真实性,却往往缺乏确定标签。
严肃的验证计划必须承认这种张力。它应分别报告结果,而非将不相同的数据集合并为一个有利指标。
评估必须包括灵敏度和特异度。灵敏度衡量系统识别目标案例的频率,而特异度衡量它正确排除非目标案例的频率。
这些数值应与假阳性率、假阴性率和不确定结果一同公布。剔除不确定案例,可能会让性能看上去优于用户的实际体验。
结果还应在现实发生率下报告。筛查获得一般安全许可的劳动力群体,与评估聚焦调查中的嫌疑人,在数学上并不相同。
假设一个模型在数量相等的欺骗和如实作答受试者中接受测试。其报告的准确率可能显得令人印象深刻,因为样本被人为均衡了。
在实际筛查中,严重欺骗行为可能更为罕见。此时,即使假阳性率不高,也可能产生远多于有效检出的无辜标记。
评估人员必须测试不同人口群体和健康状况。生理基线可能随着年龄、药物、残障、压力、睡眠以及许多其他因素而变化。
重点并不是要求生理状态完全相同,而是确定系统的错误是否在不同群体中分布不均。
远程感测需要针对光照、距离、动作、衣着、皮肤特征、摄像头位置和环境干扰单独测试。当采集条件变化时,模型可能失效。
地点层面的测试至关重要。一个受控实验室得出的结果,不应成为全国部署的依据。
该项目还应在对抗性条件下测试反制措施。参与者需要具备更接近真实规避系统尝试的激励和准备。
人为因素同样值得关注。当软件给出自信评分时,测谎员可能变得不那么警惕。
研究人员将此称为自动化偏见,即即使存在相互矛盾的证据,仍倾向于偏好机器建议的倾向。仅靠培训并不总能消除它。
适当的研究应比较有无算法辅助时的决策。这种设计可以表明系统是否提升了人类表现,还是仅仅改变了信心程度。
它还应衡量下游结果。一个有用的系统必须改善调查、减少不必要的后续跟进,或支持稳健的安全许可决策。
如果更快的测谎造成更多申诉、重复访谈、人员配置延误或调查陷入死胡同,就不能证明其成功。
透明报告将增强信心。至少,DCSA应发布测试方案、人群描述、评估指标、已知局限和治理规则。
国家安全项目无法公开每一项操作细节。然而,保密不应阻止独立专家评估一项影响人员决策的技术的基本有效性。
外部复现将提供最有力的保障。模型应当经得起未参与构建、且对采购没有利害关系的研究人员测试。
这一要求对专有系统尤为重要。供应商可以保护源代码,同时仍支持受控的第三方评估。
政府还应预先定义失败阈值。否则,机构可能在事后解读好坏参半的结果,并在证据薄弱的情况下继续开发。
某一阈值可以规定特定使用场景下可接受的最高假阳性率。它也可以禁止仅依据自动化输出采取不利行动。
历史记录证明了这种谨慎的必要性。美国国家科学院、工程院和医学院警告说,进一步改进传统技术可能只能带来有限的准确率提升。
Polygraph Next 值得接受公平的实证检验。但它不应被默认认为,新传感器和机器学习已经解决了底层科学问题。
三个信号将揭示 Polygraph Next 的走向
资金措辞、验证设计和采购范围将揭示,这一项目是继续停留在研究阶段,还是走向运营判断。
第一个信号是国会对2027财年预算的回应。立法者可以批准所请求的642.1万美元、削减或拒绝该请求,或附加报告条件。
在没有评估要求的情况下提供全额资金,将给予 DCSA 较大的内部塑造项目空间。将资金与独立审查挂钩,则会把科学验证置于更核心的位置。
拨款延迟同样会产生影响。它可能压缩测试周期,或将里程碑推迟到后续财年。
第二个信号是验证方案的发布。读者应关注是否明确列出评估终点、是否采用真实人群、是否说明基础发生率假设,以及是否分别呈现筛查与特定调查的结果。
若方案主要聚焦实验室分类,其大规模部署的可信度将会降低。具备透明误差报告的现场验证,则会增强该项目的说服力。
对“准确性”的定义尤其值得关注。任何排除结论不确定的检测,或将无关使用场景合并计算的结果,都应接受严格审视。
第三个信号是早期合同与原型的范围。采购公告或许会显示 DCSA 希望获取哪些传感器、分析平台和决策功能。
一份仅针对测量研究的有限合同,会让项目维持在探索性框架内。若系统旨在将评分输入实际审查流程,治理问题的紧迫性就会随之上升。
合同措辞还可能明确数据所有权。政府需要拥有审计模型、保存评估记录以及调查性能失误的权利。
在任何人将 Polygraph Next 视为可实际运行的五角大楼 AI 测谎仪之前,这些信号都应当出现。现有记录仅支持一个更有限的结论。
五角大楼已指出,缓慢、差异较大且日益老化的评估方法确实存在问题。它提出将现代传感器与算法作为改进路径。
但它尚未证明,AI 能够从生理活动中可靠地推断欺骗行为。这一主张必须经过检验,而非被直接写入项目名称之中。
研究人员、联邦雇员、承包商和公民自由倡导者应关注证据标准,而非设备的先进程度。更好的测量只有在支撑有效结论时才有意义。
随着首批资金决策落地,一个问题应当引导这场讨论:Polygraph Next 会检验 AI 是否能改善可信度评估,还是在围绕该假设构建系统时便已默认它能够实现改善?



