펜타곤의 AI 거짓말 탐지기 계획, 입증된 정확성보다 자동화에 앞서 나서다
펜타곤의 AI 거짓말 탐지기 계획은 과학적 기반을 둘러싼 논쟁이 여전히 첨예한 기술을 현대화하기 위해 5년간 3,030만 달러를 요구한다. Polygraph+ 또는 Polygraph Next로 불리는 이 프로그램은 비접촉식 생리 신호 감지에 인공지능, 머신러닝, 자동 채점을 결합한다.
Defense Counterintelligence and Security Agency, 즉 DCSA는 2027회계연도에 642만1,000달러로 이 사업을 시작하려 한다. 예산 요청서에는 현장 시험, 독립 검증 연구, 프로토타입 평가, 중앙집중식 데이터 저장, 의사결정 지원 도구가 포함돼 있다.
이는 공학 프로젝트처럼 들리지만, 가장 어려운 문제는 공학이 아니다. 센서는 생리적 변화를 더 정밀하게 측정할 수 있지만, 그러한 변화가 기만을 뜻한다는 점까지 입증하지는 못한다.
따라서 Polygraph Next를 둘러싼 긴장은 일상적인 장비 업그레이드보다 훨씬 크다. 펜타곤은 이러한 평가가 무엇을 신뢰성 있게 추론할 수 있는지 해결하기에 앞서 신뢰성 평가를 자동화하고 확대하려 한다.
역사적 비교가 중요하다. 획기적인 National Academies 검토는 기존 폴리그래프가 일부 특정 조사에서 우연보다 나은 성과를 보이지만, 완벽과는 거리가 멀다고 결론지었다. 실제 보안 위협보다 무고한 사람이 훨씬 많을 수 있는 직원 심사에 대해서는 훨씬 더 엄격한 결론을 내렸다.
새 시스템은 더 높은 일관성, 속도, 추적 가능성을 약속한다. 그러나 공개 예산 문서에는 정확도 목표, 허용 가능한 위양성률, 공개된 검증 프로토콜 또는 배치 기준이 제시돼 있지 않다.
이 누락된 정보는 Polygraph Next가 더 나은 연구 도구가 될지, 아니면 의심스러운 결론을 더 빠르게 만들어내는 수단이 될지를 결정할 것이다.
펜타곤 AI 거짓말 탐지기 프로그램이 구축하려는 것
Polygraph Next는 입증된 정확도를 갖춘 완성형 탐지기가 아니라, 자금이 배정된 연구 제안이다.
펜타곤의 Polygraph Next 예산은 이 프로젝트를 DCSA의 연구·개발·시험·평가 포트폴리오에 포함한다. 문서는 해당 요청의 날짜를 2026년 4월로 명시한다.
제안된 일정에는 2027회계연도 642만1,000달러가 기재돼 있다. 이후 계획 금액은 2028년 644만9,000달러, 2029년 615만8,000달러, 2030년 566만 달러, 2031년 565만4,000달러다.
이를 모두 합하면 연간 수치는 3,034만2,000달러에 이른다. 문서는 완료까지의 비용과 총 프로그램 비용을 “continuing”으로 분류하는데, 이는 5년간의 요청액이 반드시 최종 상한선을 뜻하지는 않는다는 의미다.
연구 예산 표에는 이 프로젝트의 전년도 지출이 나타나지 않는다. 이는 2027회계연도가 이 특정 프로그램의 제안된 시작 시점임을 뜻한다.
DCSA는 Polygraph+와 Polygraph Next를 동일한 현대화 노력의 대체 명칭으로 제시한다. 명시된 목표는 연방 신뢰성 평가의 정확성, 신뢰성, 사용성, 추적 가능성을 개선하는 것이다.
이 프로그램에는 여러 계획된 구성 요소가 있다. 하나는 알고리즘이 신호를 평가하고 평가 결과 도출을 지원하는 자동 채점이다. 또 하나는 피험자에게 기존 센서를 직접 부착하지 않고 생리 활동을 측정하는 원거리 감지다.
이 기관은 중앙집중식 저장과 분석도 제안한다. 이 구성 요소는 평가, 비교 및 잠재적 모델 개발을 위해 검사 데이터를 수집한다.
DCSA는 독립 검증 연구, 현장 시험, 프로토타입 평가를 수행할 것이라고 밝혔다. 또한 Applied Research Laboratory for Intelligence and Security와 Oak Ridge National Laboratory를 연구 파트너로 지목했다.
이러한 세부 사항은 개발 경로를 보여주지만, 최종 운영 모델에 대해서는 거의 드러내지 않는다. 문서는 배치된 시스템이 어떤 생리 신호를 사용할지 설명하지 않는다.
또한 AI가 점수를 권고할지, 검사를 분류할지, 이상 징후를 표시할지, 또는 인사 결정에 직접 영향을 미칠지도 명시하지 않는다. 이 역할들은 매우 다른 위험을 수반한다.
잡음이 많은 센서를 식별하는 데 도움을 주는 알고리즘은 사람을 기만적이라고 분류하는 알고리즘과 동일하지 않다. 마찬가지로, 훈련된 검사관이 검토하는 의사결정 지원 도구는 대체로 자동화된 심사 시스템과 다르다.
프로그램의 즉각적인 범위는 연방 인사 검증과 내부자 위협 탐지다. 이러한 환경에는 민감한 정보에 접근해야 할 수 있는 직원, 지원자, 군인, 계약업체 인력이 포함된다.
이 맥락은 위험을 높인다. 잘못된 결과는 보안 인가를 지연시키거나, 수사 방향을 바꾸고, 경력을 훼손하거나, 무고한 사람을 둘러싼 의심을 키울 수 있다.
이 요청은 예산 배정과도 다르다. 제안된 자금의 사용 가능 여부는 여전히 의회가 결정하며, 금액·조건·보고 요건을 변경할 수 있다.
현재로서는 Polygraph Next를 정부의 연구 및 조달 계획으로 이해하는 것이 가장 적절하다. 야심, 제안된 예산, 기관 파트너는 갖추고 있지만, 공개적으로 입증된 성능은 없다.
인사 검증이 지금 압박을 받는 이유
이 프로그램은 실제 운영 부담에 대응하지만, 제안된 해결책은 여전히 과학적으로 확정되지 않았다.
DCSA는 연방 검증 체계에서 핵심적인 위치를 차지한다. 이 기관은 배경 조사를 수행하고 정부 전반의 기밀 정보 접근 결정에 필요한 지원을 제공한다.
National Center for Credibility Assessment는 교육 기준을 설정하고 국방 및 정보 관계자에게 폴리그래프 정책에 관한 자문을 제공한다. 이 센터의 신뢰성 평가 임무에는 기술 지원, 연구, 시험, 프로그램 감독, 감사도 포함된다.
이러한 제도적 역할은 DCSA가 도구를 현대화해야 할 분명한 이유를 제공한다. 기존 검사는 숙련된 인력, 통제된 조건, 센서 준비, 인터뷰, 해석을 필요로 한다.
이 요건들은 처리량을 제한한다. 또한 검사관, 장소, 장비, 시험 조건에 따른 차이를 만들 수 있다.
비접촉식 센서는 더 단순한 설정을 약속한다. 자동 채점은 더 일관된 분석을 약속한다. 중앙집중식 데이터는 더 강력한 감사와 추적 가능성을 약속한다.
각 목표에는 운영상 가치가 있다. 하지만 그 어느 것도 시스템이 기만을 불안, 공포, 혼란, 분노 또는 일반적인 생리적 변동과 정확하게 구별할 수 있음을 입증하지는 않는다.
더 광범위한 검증 체계는 이미 노후 기술과 지연된 현대화의 압박을 받고 있다. DCSA는 기존 시스템을 대체하고 정부 전반의 개혁을 지원하기 위해 National Background Investigation Services 플랫폼을 개발하고 있다.
2026년 인사 검증 검토는 DCSA가 매년 약 200만 건의 배경 조사를 수행한다고 밝혔다. 또한 이 기관이 주요 기술 프로그램 완료를 위한 신뢰할 수 있는 일정을 여전히 갖추지 못했다고 지적했다.
같은 검토는 지속적 검증 경보가 2023회계연도 분기당 약 3만 건에서 2025회계연도 3분기에는 10만 건 이상으로 증가했다고 보고했다. 지속적 검증은 검토가 필요한 변화를 식별하기 위해 자동화된 기록 확인을 사용한다.
이 증가는 핵심 과제를 보여준다. 자동화는 더 많은 정보를 수집하고 표시할 수 있지만, 시스템이 대량의 경보를 생성하면 업무도 늘어난다.
Polygraph Next는 이러한 환경에 또 하나의 잠재적 필터로 진입한다. 신호 품질을 개선하고 일관성 없는 채점을 줄인다면, 조사관이 주의를 집중해야 할 대상에 도움이 될 수 있다.
분류가 잘 보정되지 않는다면 정반대의 결과를 낳을 수 있다. 추가 경보를 생성하고, 취약한 의심을 강화하며, 인간 검토자의 업무량을 늘릴 수 있다.
따라서 압박은 DCSA, 보안 인가 지원자, 그리고 자격을 갖춘 인력을 찾는 기관에 가해진다. DCSA에는 더 빠른 절차가 필요하지만, 지원자에게는 정확하고 설명 가능한 결정이 필요하다.
고용주 역시 예측 가능한 보안 인가 일정을 필요로 한다. 국방 계약업체는 정부가 요구되는 검증을 완료하기 전까지 일부 직원을 기밀 업무에 배치할 수 없다.
보안 관계자들은 반대되는 위험에 직면한다. 너무 빠르게 움직이면 기관은 간첩 행위, 무단 정보 공개, 강압 또는 기타 내부자 위협에 취약해질 수 있다.
이 때문에 더 빠른 탐지기는 매력적으로 들린다. 이는 심사를 줄이지 않으면서 효율성을 제공하는 듯 보인다.
그러나 속도는 기저의 분류가 신뢰할 수 있을 때에만 도움이 된다. 모호한 생리 신호를 더 빨리 처리한다고 해서 자동으로 보안이 향상되지는 않는다.
따라서 Polygraph Next는 두 가지 기준을 충족해야 한다. 운영상 마찰을 줄여야 하며, 현실적인 조건에서 그 결과가 의사결정을 개선한다는 점을 입증해야 한다.
두 번째 기준이 더 어렵다. 서로 다른 사람, 환경, 질문 형식, 의학적 상태, 스트레스 수준에서 발생하는 오류에 관한 증거가 필요하다.
그러한 증거가 없다면 펜타곤은 처리량을 정확도로 오인할 위험이 있다. 두 지표는 서로 바꿔 쓸 수 없다.
추론 문제를 해결하지 못한 채 AI를 사용하는 Polygraph Next
AI는 생리 신호의 채점을 표준화할 수 있지만, 그러한 신호가 거짓말만을 고유하게 나타내도록 만들 수는 없다.
기존 폴리그래프는 호흡, 심혈관 활동, 피부 전도도 등의 변화를 기록한다. 검사관은 질문 간 반응을 비교하고, 특정 차이가 기만을 시사하는지 해석한다.
Polygraph Next는 이 과정에 AI와 머신러닝 채점을 추가할 것을 제안한다. 머신러닝은 사례에서 통계적 패턴을 식별하고 그 패턴을 새 데이터에 적용한다.
이 접근 방식은 검사관 간 변동의 일부를 줄일 수 있다. 알고리즘은 수천 개의 신호 구간에 동일한 수학적 규칙을 적용할 수 있다.
또한 사람이 쉽게 평가하기 어려운 것보다 더 많은 변수를 결합할 수 있다. 타이밍, 신호 형태, 반응 지속 시간, 센서 간 상관관계 모두가 점수에 영향을 줄 수 있다.
원거리 감지는 수집 방식을 바꾼다. 시스템은 부착 장비에 전적으로 의존하는 대신, 일부 생리 측정치를 멀리서 얻을 수 있다.
예산은 최종 센서 구성을 명시하지 않는다. 따라서 비접촉식 생리 모니터링을 넘어선 구체적 설명은 시기상조다.
그럼에도 이 아키텍처는 명확한 추론 사슬을 만든다. 센서는 먼저 물리적 반응을 측정한다. 소프트웨어는 그 반응에서 특징을 추출한다.
그다음 모델은 이러한 특징을 점수 또는 권고로 변환한다. 마지막으로 검사관이나 관계자가 보안 맥락에서 그 결과를 해석한다.
오류는 모든 단계에서 발생할 수 있다. 센서는 잡음을 포착할 수 있고, 모델은 신뢰할 수 없는 상관관계를 학습할 수 있으며, 의사결정자는 결과에 과도한 비중을 둘 수 있다.
가장 큰 어려움은 측정된 반응과 주장되는 정신 상태 사이에 있다. 각성 증가는 기만과 동반될 수 있지만, 믿어주지 않을 것이라는 두려움과도 동반될 수 있다.
진실한 지원자도 혐의에 강하게 반응할 수 있다. 기만적인 사람은 침착함을 유지하거나 기록된 패턴을 바꾸는 대항 수단을 사용할 수 있다.
National Academies의 폴리그래프 과학 검토는 현대 머신러닝이 일반화되기 전에 이 문제를 검토했다. 그 핵심적인 과학적 경고는 여전히 적용된다.
생리적 반응은 기만에만 배타적으로 대응하지 않는다. 이는 개선된 분류기가 더 일관될 수는 있어도 더 타당해지는 것은 아니라는 뜻이다.
과거 검사 데이터를 바탕으로 학습된 모델을 생각해 보자. 과거의 라벨은 검사관의 판단, 자백, 사건 결과 또는 실험실 지시에서 비롯될 수 있다.
각 라벨 출처에는 약점이 있다. 검사관의 판단은 해당 방법의 가정을 되풀이할 수 있고, 자백은 얻을 수 없거나 불완전할 수 있다.
실험실 실험은 연구자가 누가 거짓말하라는 지시를 받았는지 알기 때문에 더 명확한 정답 데이터를 제공한다. 그러나 모의 거짓말은 실제 보안 적격성 검사에서 따르는 결과를 거의 수반하지 않는다.
모델은 지름길도 학습할 수 있다. 학습 데이터의 라벨과 움직임, 말투, 건강 상태, 인구통계학적 특성 또는 검사 환경을 연관 지을 수 있다.
하나의 데이터셋에서 높은 성능을 보인다고 해서 이런 우려가 해소되지는 않는다. 이 시스템은 새로운 대상자, 새로운 장소, 새로운 검사관, 그리고 현실적인 기저 발생률에서도 작동해야 한다.
기저 발생률은 검사 대상 집단에서 목표 상태가 얼마나 흔한지를 뜻한다. 인사 보안 심사에서는 중대한 보안 위반자가 드물 것으로 추정된다.
이러한 희소성은 거짓 양성을 특히 중요하게 만든다. 균형 잡힌 실험에서 정확해 보이는 검사라도 유병률이 낮은 직장에서는 많은 무고한 사람에게 경고를 표시할 수 있다.
AI 점수화 계층도 이 수학에서 벗어날 수 없다. 오히려 자동화는 동일한 기준값을 더 큰 규모에 적용할 수 있기 때문에 보정의 중요성을 더 높인다.
설명 가능성도 또 다른 과제다. 조사관은 점수가 의미 있는 반응, 낮은 신호 품질, 특이한 신체 상태 또는 모델의 한계 중 무엇을 반영하는지 알아야 한다.
일반적인 신뢰도 점수로는 그 답을 제공할 수 없다. 모델의 높은 신뢰도는 확신에 찬 오분류와 공존할 수 있다.
AI의 가장 방어 가능한 역할은 좁고 검증 가능한 범위에 있을 것이다. 품질 관리를 개선하거나, 손상된 측정값을 탐지하거나, 훈련된 검사관과 비교해 점수화의 일관성을 평가할 수 있다.
AI 거짓말 탐지기로 홍보되는 시스템은 훨씬 더 광범위한 주장을 한다. 이는 관찰 가능한 생리 반응과 기만 사이에 신뢰할 수 있는 연결이 존재한다는 의미이지만, 연구자들은 이를 확립하지 못했다.
핵심 상충 관계는 일관성과 타당성이다
Polygraph Next는 평가를 더 균일하게 만들 수 있지만, 검증되지 않은 추론을 더 권위 있어 보이게 만들 수도 있다.
DCSA의 가장 강력한 실무적 주장은 표준화에 관한 것이다. 연방 프로그램은 절차가 검사관과 장소 전반에서 비교 가능한 기록을 만들어 낼 때 이점을 얻는다.
자동화된 점수화는 어떤 측정값이 결과에 영향을 미쳤는지 기록할 수 있다. 중앙화된 시스템은 기록을 보존하고 사후 감사를 지원할 수 있다.
이러한 기능은 자의적인 편차를 줄일 수 있다. 또한 기존 절차가 포착하지 못했던 일관성 없는 시행 패턴을 드러낼 수도 있다.
그러나 일관성이 정확성을 의미하지는 않는다. 눈금이 잘못된 자는 매번 똑같은 오류를 낼 수 있다.
이 구분은 컴퓨터가 생성한 점수가 흔히 객관적으로 보이기 때문에 중요하다. 과학적 의미가 여전히 불확실한 경우에도 당국자는 수치 결과에 의존할 수 있다.
“AI”라는 명칭은 이런 효과를 증폭할 수 있다. 사용자는 시스템이 미묘한 기만 신호를 찾아냈다고 생각할 수 있지만, 실제로는 학습 데이터에 특화된 상관관계를 배웠을 수 있다.
국방부의 공개 문서는 이 프로젝트에 독립 검증이 포함될 것이라고 밝힌다. 이는 중요한 약속이지만, 독립성은 별도의 팀을 배정하는 것 이상을 요구한다.
평가자는 방법론, 데이터셋, 오류 정의 및 시험 조건에 접근할 수 있어야 한다. 또한 프로그램의 압력 없이 불리한 결과를 공개할 수 있어야 한다.
검증은 특정 사건 검사와 광범위한 선별 검사를 구분해야 한다. 두 활용 사례는 서로 다른 집단, 질문, 유인 및 통계적 상충 관계를 수반한다.
미국 국립아카데미는 일부 특정 사건에서 폴리그래프가 우연 이상으로 구별할 수 있다고 결론지었다. 그러나 선별 검사에 대한 근거는 더 약하다고 보았고, 직원 보안 결정에 폴리그래프에 의존하지 말라고 경고했다.
이 차이는 처음부터 Polygraph Next의 설계에 반영되어야 한다. 하나의 헤드라인 정확도 수치는 오류가 가장 중요한 활용 사례를 가릴 수 있다.
이 시스템에는 명확한 의사결정 경계도 필요하다. 연구용 점수가 그 한계가 이해되기 전에 불이익 조치의 근거가 되어서는 안 된다.
연방 정책은 역사적으로 폴리그래프 결과를 더 폭넓은 절차의 한 요소로 다뤄 왔다. 조사관은 검사를 활용해 면담을 이끌거나 추가 검토가 필요한 사안을 식별할 수 있다.
자동화된 결과가 다른 심사 시스템으로 직접 흘러 들어간다면 Polygraph Next는 그 경계를 흐릴 수 있다. 중앙화된 분석은 점수를 이식 가능하고 지속적인 것으로 만들 수 있다.
이식 가능성은 효율을 높이지만 오류의 결과도 키운다. 의심스러운 결과는 지원자를 여러 검토, 배치 또는 기관에 걸쳐 따라다닐 수 있다.
예산 문서는 추적 가능성을 장점으로 언급한다. 적절한 추적 가능성은 누가 점수를 사용했는지, 그것이 결정에 어떻게 영향을 미쳤는지, 그리고 이후 증거가 이를 뒷받침했는지를 보여줘야 한다.
또한 당국자가 기록을 정정할 수 있어야 한다. 그렇지 않으면 중앙화된 데이터는 책임성보다 실수를 더 효과적으로 보존할 수 있다.
프라이버시도 이 상충 관계의 또 다른 부분이다. 생리 데이터는 검사관이 질문한 내용 이상의 정보를 드러낼 수 있다.
문서는 보존 기간, 접근 규칙, 모델 학습 권한 또는 2차 사용 제한을 공개적으로 설명하지 않는다. 대규모 데이터셋이 축적되기 전에 이러한 정책은 면밀한 검토를 받아야 한다.
사이버 보안 역시 중요하다. 신뢰성 평가를 중앙에 보관하는 저장소에는 민감한 개인정보와 국가안보 정보가 담기게 된다.
DCSA는 이미 광범위한 신원조사 데이터를 담은 시스템을 관리하고 있다. 여기에 생리 기록과 모델 결과가 추가되면 해당 환경의 민감성은 더 커질 것이다.
정부는 적대적 행동도 고려해야 한다. 강한 유인을 가진 대상자는 검사 방법을 연구하고 자신의 반응을 조작하려 할 수 있다.
DCSA는 현행 기술의 문제로 대응책을 명시적으로 지목한다. 그러나 머신러닝이 이를 자동으로 무력화하는 것은 아니다.
알려진 대응책으로 학습된 모델은 익숙한 패턴을 탐지할 수 있다. 적대자는 학습 분포 밖의 기법을 개발하는 방식으로 대응할 수 있다.
이는 탐지와 회피 사이의 군비 경쟁을 만든다. 따라서 향상된 회복탄력성 주장은 협조적인 자원봉사자뿐 아니라 적응적으로 대응하는 참가자를 대상으로 시험해야 한다.
이제 프로그램의 핵심 상충 관계가 분명해진다. 자동화는 절차를 더 빠르고, 더 일관되며, 더 감사하기 쉽게 만들 수 있다.
동시에 거짓 양성을 대규모로 확산시키고, 불확실한 가정을 숨기며, 논쟁적인 판단에 수치적 외관을 부여할 수 있다. 이 기술의 거버넌스는 센서와 모델의 발전과 보조를 맞춰야 한다.
독립 검증이 입증해야 할 것
결정적인 시험은 Polygraph Next가 실험실 패턴을 인식하는지 여부가 아니라, 무고한 사람에게 해를 끼치지 않으면서 실제 의사결정을 개선하는지 여부다.
국방부는 먼저 의도된 활용 목적을 정의해야 한다. 품질 보증을 위해 구축된 모델에는 기만 판정을 권고하는 모델과 다른 근거가 필요하다.
공개 문서는 결과가 자문용인지 결정적 판단용인지 명시해야 한다. 또한 당국자가 이를 재정의할 수 있는지, 그러한 재정의가 어떻게 검토되는지도 설명해야 한다.
다음은 정답 데이터다. 연구자에게는 어떤 참가자가 기만적이었고 어떤 참가자가 진실했는지를 알 수 있는 신뢰할 만한 방법이 필요하다.
실험실 지시는 알려진 라벨을 제공하지만 현실성은 제한적이다. 현장 사건은 현실성을 제공하지만 확실한 라벨이 없는 경우가 많다.
진지한 검증 프로그램은 이 긴장을 인정해야 한다. 서로 다른 데이터셋을 하나의 유리한 지표로 합치기보다 결과를 별도로 보고해야 한다.
평가에는 민감도와 특이도가 포함돼야 한다. 민감도는 시스템이 목표 사례를 얼마나 자주 탐지하는지를, 특이도는 비목표 사례를 얼마나 자주 정확히 제외하는지를 측정한다.
이 값들은 거짓 양성률, 거짓 음성률 및 판정 불가 결과와 함께 제시돼야 한다. 판정 불가 사례를 제외하면 사용자가 실제로 경험하는 것보다 성능이 더 좋아 보일 수 있다.
결과는 현실적인 유병률 조건에서도 보고돼야 한다. 일반 보안 인가 인력을 선별하는 일은 집중 수사에서 용의자를 평가하는 일과 수학적으로 다르다.
가령 모델이 기만적 대상자와 진실한 대상자를 같은 수로 구성해 시험됐다고 가정해 보자. 표본이 인위적으로 균형을 이루기 때문에 보고된 정확도는 인상적으로 보일 수 있다.
실제 선별에서는 중대한 기만이 훨씬 더 드물 수 있다. 이 경우 적당한 수준의 거짓 양성률조차 유효한 탐지보다 훨씬 많은 무고한 경고를 낼 수 있다.
평가자는 다양한 인구집단과 건강 상태를 시험해야 한다. 생리적 기준선은 나이, 약물, 장애, 스트레스, 수면 및 수많은 다른 요인에 따라 달라질 수 있다.
핵심은 동일한 생리 반응을 요구하는 것이 아니다. 시스템의 오류가 집단별로 불균등하게 나타나는지를 확인하는 것이다.
원격 감지는 조명, 거리, 움직임, 의복, 피부 특성, 카메라 위치 및 환경적 간섭에 대해 별도 시험이 필요하다. 수집 조건이 바뀌면 모델은 실패할 수 있다.
장소 단위 시험은 필수적이다. 하나의 통제된 실험실에서 나온 결과가 전국적 배치를 정당화해서는 안 된다.
프로그램은 적대적 조건에서 대응책도 시험해야 한다. 참가자에게는 시스템을 실제로 무력화하려는 시도에 더 가까운 유인과 준비가 제공돼야 한다.
인적 요인도 동등하게 주목받아야 한다. 소프트웨어가 확신에 찬 점수를 제시하면 검사관은 경계를 늦출 수 있다.
연구자들은 이를 상반된 증거가 있어도 기계의 권고를 선호하는 경향인 자동화 편향이라고 부른다. 교육만으로는 이를 항상 없앨 수 없다.
적절한 연구는 알고리즘 지원이 있는 경우와 없는 경우의 결정을 비교해야 한다. 이러한 설계는 시스템이 인간의 성과를 개선하는지, 아니면 단지 확신만 바꾸는지를 보여줄 수 있다.
하류 결과도 측정해야 한다. 유용한 시스템은 조사를 개선하거나, 불필요한 후속 조치를 줄이거나, 건전한 보안 인가 결정을 지원해야 한다.
더 많은 이의 제기, 반복 면담, 인력 배치 지연 또는 수사상 막다른 길을 만든다면 더 빠른 검사가 성공을 입증하지는 못한다.
투명한 보고는 신뢰를 강화할 것이다. 최소한 DCSA는 시험 프로토콜, 대상 집단 설명, 평가 지표, 알려진 한계 및 거버넌스 규칙을 공개해야 한다.
국가안보 프로그램은 모든 운영 세부 사항을 공개할 수는 없다. 그러나 기밀성은 인사 결정에 영향을 미치는 기술의 기본 타당성을 독립 전문가가 평가하지 못하게 하는 이유가 되어서는 안 된다.
외부 재현은 가장 강력한 안전장치를 제공할 것이다. 모델은 이를 만들지 않았고 조달에 이해관계가 없는 연구자의 시험을 견뎌야 한다.
이 요건은 독점 시스템에 특히 중요하다. 공급업체는 소스 코드를 보호하면서도 통제된 제3자 평가를 지원할 수 있다.
정부는 실패 기준도 사전에 정의해야 한다. 그렇지 않으면 기관은 사후에 혼재된 결과를 해석하며 약한 근거에도 개발을 계속할 수 있다.
기준값은 특정 활용 사례에서 허용되는 최대 거짓 양성률을 명시할 수 있다. 또한 자동화된 결과만을 근거로 한 불이익 조치를 금지할 수도 있다.
역사적 기록은 이러한 신중함을 정당화한다. 미국 국립아카데미는 기존 기법을 더 정교화하더라도 정확도 향상은 아마도 제한적일 것이라고 경고했다.
Polygraph Next는 공정한 실증 시험을 받을 자격이 있다. 그러나 더 새로운 센서와 머신러닝이 이미 근본 과학 문제를 해결했다는 가정을 받을 자격은 없다.
Polygraph Next의 향방을 보여줄 세 가지 신호
예산 문구, 검증 설계 및 조달 범위는 이것이 연구에 머무를지 운영상 판단으로 나아갈지를 드러낼 것이다.
첫 번째 신호는 의회의 2027회계연도 대응이다. 의원들은 요청된 642만1,000달러를 제공하거나, 삭감하거나, 거부하거나, 보고 조건을 붙일 수 있다.
평가 요건 없는 전액 지원은 DCSA가 프로그램을 내부적으로 폭넓게 설계할 여지를 줄 것이다. 독립적 검토와 연계된 지원은 과학적 검증을 보다 중심에 두게 될 것이다.
예산 배정이 지연되는 경우도 중요하다. 시험 일정이 압축되거나 주요 이정표가 이후 회계연도로 밀릴 수 있다.
두 번째 신호는 검증 프로토콜의 공개다. 독자들은 명시된 평가 지표, 현실적인 대상 집단, 기저율 가정, 그리고 선별 검사와 특정 조사에 대한 별도 결과를 살펴봐야 한다.
주로 실험실 분류에 초점을 맞춘 프로토콜은 광범위한 배치에 대한 신뢰를 약화시킬 수 있다. 오류 보고가 투명한 현장 검증은 프로그램의 타당성을 강화할 것이다.
“정확도”의 정의는 특히 많은 것을 드러낼 것이다. 결론을 내릴 수 없는 검사를 제외하거나 서로 관련 없는 활용 사례를 결합한 결과는 면밀히 살펴볼 필요가 있다.
세 번째 신호는 초기 계약과 프로토타입의 범위다. 조달 공고를 통해 DCSA가 어떤 센서, 분석 플랫폼, 의사결정 기능을 확보하려 하는지 확인할 수 있다.
측정 연구에 한정된 계약이라면 프로젝트는 탐색적 단계에 머물게 된다. 점수를 운영상 신원 심사에 반영하도록 설계된 시스템이라면 거버넌스 관련 질문의 시급성이 커질 것이다.
계약 문구는 데이터 소유권도 명확히 할 수 있다. 정부는 모델을 감사하고, 평가 기록을 보존하며, 성능 실패를 조사할 권한이 필요하다.
누구든 Polygraph Next를 실제로 작동하는 Pentagon AI 거짓말 탐지기로 간주하기 전에 이러한 신호들이 나타나야 한다. 현재 기록이 뒷받침하는 결론은 더 제한적일 뿐이다.
Pentagon은 느리고, 편차가 크며, 노후화된 평가 방식에 실제 문제가 있음을 확인했다. 또한 개선을 위한 경로로 현대적 센서와 알고리즘을 제안했다.
그러나 AI가 생리적 활동으로부터 기만을 신뢰성 있게 추론할 수 있다는 점은 입증하지 못했다. 이 주장은 프로그램 이름에 내재화하기보다 검증해야 한다.
연구자, 연방 직원, 계약업체, 시민자유 옹호자들은 장비의 정교함이 아니라 증거의 기준을 지켜봐야 한다. 더 나은 측정은 타당한 결론을 뒷받침할 때만 의미가 있다.
첫 번째 지원 결정이 내려지면서, 한 가지 질문이 논의를 이끌어야 한다. Polygraph Next는 AI가 신뢰성 평가를 개선하는지 검증할 것인가, 아니면 그 개선을 전제한 채 시스템을 구축할 것인가?



