top of page

펜타곤 AI 환각, 미군 작전 직전까지 몰고 가며 검증 실패 드러내

5일 전
12분 분량

펜타곤의 AI 환각은 미군 작전 계획을 촉발할 뻔했고, 당국자들이 허위 화물 주장 하나를 발견하기 전에는 항공기까지 이미 출격한 상태였던 것으로 전해졌다. 정보 보고서는 중동에 있던 중국 선박이 핵무기 프로그램용 부품을 실었다고 주장했다. 더 심층적인 검토가 작전을 중단시키기 전, 무장 인원은 해당 선박에 승선할 준비를 하고 있었던 것으로 알려졌다.

문제의 정보는 단순히 부정확한 수준이 아니었다. CNN이 보도하고 제휴사를 통해 배포된 허위 정보 보고서에 따르면, 챗봇은 선박 화물 명세서에 기재된 물질을 잘못 식별했다. 특수작전사령부 분석가는 시스템에 공개 출처 자료와 기밀 신호정보를 결합해 달라고 요청한 바 있다.

이후 분석가는 AI를 다시 사용해 결론을 표준 정보 보고서 형식으로 정리했다. 이 두 번째 단계는 근거 없는 주장을 확립된 군사 산출물처럼 보이는 형식과 구조로 포장했다. 그 결과 문서는 이란과의 전쟁 중 지휘 체계를 통해 유통됐으며, 당시 의사결정은 이미 속도와 불확실성의 영향을 받고 있었다.

당국자들은 계획된 요격 직전에 문제를 발견했다. 펜타곤과 미 특수작전사령부 태평양은 이 사건에 대해 공개적으로 논평하지 않았다. 챗봇의 정체, 실제 화물, 그리고 마침내 오류를 드러낸 정확한 검증 절차는 공개되지 않은 상태다.

따라서 핵심 쟁점은 하나의 오답보다 더 크다. 군은 정보 수집부터 행동까지 걸리는 시간을 단축하기 위해 AI를 활용하려 한다. 그러나 그러한 압축은 분석가들이 가정에 이의를 제기하고, 출처를 검토하며, 증거와 생성된 문장을 구분하는 중간의 멈춤을 없앨 수 있다.

AI 환각이 미군 작전 계획을 촉발할 뻔한 과정

이 실패는 분석과 제시라는 두 개의 AI 지원 단계를 거쳐 확산됐다.

사건은 중국 선박의 화물 명세서와 관련된 정보에서 시작됐다. 기초 보고는 하와이에 본부를 두고 인도태평양 지역 전반의 특수작전을 감독하는 미 특수작전사령부 태평양에서 비롯된 것으로 전해졌다.

한 분석가는 해당 보고에 대해 신원이 공개되지 않은 챗봇에 질의했다. 시스템은 공개 출처 정보와 정부가 보유한 기밀 신호정보를 결합했다. 공개 출처 정보는 공개적으로 접근 가능한 자료에서 수집한 정보를 뜻하며, 신호정보는 가로챈 전자 통신이나 방출 신호에서 얻는다.

이후 모델은 선박에 실린 물질을 잘못 식별했다. AI 환각은 그럴듯해 보이지만 근거가 없거나, 부정확하거나, 조작된 출력이다. 대규모 언어 모델은 그럴 가능성이 높은 단어의 순서를 생성하므로, 자신감 있는 표현이 기저 주장의 진실성을 입증하지는 않는다.

분석가는 그 차이를 포착하지 못한 것으로 보인다. 챗봇의 결론은 해당 선박이 중동을 거쳐 핵 프로그램용 부품을 운반했다는 평가의 토대가 됐다. 사건에 정통한 한 인물은 완성된 보고서가 전적으로 허위였다고 설명한 것으로 전해졌다.

같은 기술은 이어 두 번째 역할을 했다. 보도된 아찔한 사례에 따르면, 분석가는 AI를 이용해 조사 결과를 표준 형식의 정보 보고서로 변환했다. 이 형식은 군사 정보를 받고 이를 바탕으로 행동하는 당국자들에게 익숙했다.

이 두 번째 사용이 중요한 이유는 형식이 제도적 신뢰성을 만들어낼 수 있기 때문이다. 챗봇 창 안의 의심스러운 문장은 잠정적으로 보인다. 그러나 같은 문장이 공식 문서 안에 있으면 검토와 출처 확인을 거쳐 작전에 사용할 준비가 된 것처럼 보일 수 있다.

보고서는 진행 중인 분쟁 상황에서 군 전체로 퍼졌다. 지휘관들은 중국 선박을 요격할 준비에 나섰다. 두 소식통은 무장한 미군 인원이 선박 승선을 준비하고 있었다고 전했고, 다른 소식통들은 군용 항공기가 이미 출격한 상태였다고 말했다.

당국자들은 이후 보고서를 더 면밀히 검토했고 AI 지원 오류를 발견했다. 미군이 선박에 승선하기 전 계획된 작전을 중단했다. 현재까지의 보도는 누가 최종 검토를 요청했는지, 또는 어떤 증거가 화물 주장을 반박했는지는 밝히지 않았다.

이런 누락된 세부 사항은 완전한 재구성을 어렵게 한다. 분석가가 도구를 오해했는지, 불확실성 지표를 무시했는지, 또는 적절한 검토 절차 없이 업무를 수행했는지는 여전히 불분명하다. 챗봇이 독립적으로 확인할 수 있는 출처를 인용했는지도 알 수 없다.

그러나 알려진 순서는 추적 가능성의 문제를 드러낸다. 지휘 체계는 모델이 어떻게 결론을 냈는지에 대한 충분히 가시적인 설명 없이 정제된 결론을 받았다. 문서의 형식은 그 증거상 한계보다 더 효과적으로 전달됐다.

이 사건은 인간 감독에 대한 단순한 정의에도 의문을 제기한다. 인간이 질의를 시작하고, 출력을 검토하고, 보고서를 작성하고, 이를 배포했다. 다른 인간들은 대응을 계획했다. 인간의 참여는 모델의 오류가 무력 사용 결정 직전까지 나아가는 것을 막지 못했다.

이 구분은 생성형 AI를 도입하는 모든 조직에 중요하다. 사람이 생성된 주장을 독립 검증 없이 받아들인다면 “인간 개입”은 큰 의미가 없다. 효과적인 감독에는 특정 책임자, 정의된 검증 절차, 접근 가능한 출처 자료, 그리고 프로세스를 중단할 권한이 필요하다.

결국 이 사건에는 중단 장치가 작동했다. 당국자들이 선박 승선 전에 보고서를 검토했기 때문이다. 그러나 그 검토는 항공기가 이미 출격하고 인원이 행동을 준비한 뒤에 이뤄졌다. 막판에 작동하는 안전장치는 재앙을 막을 수 있지만, 동시에 취약한 시스템을 드러낸다.

더 빠른 AI를 향한 펜타곤의 추진이 압박을 만들었다

이번 아찔한 사례는 의사결정 속도를 군사적 우위로 보는 도입 전략 속에서 발생했다.

미군은 이미지 분석, 물류, 정비, 위협 탐지를 포함해 수년간 알고리즘 시스템을 활용해 왔다. 생성형 AI는 문서를 요약하고, 보고서를 작성하며, 대규모 자료를 검색하고, 다양한 형식의 정보를 결합할 수 있어 이러한 의제를 확장했다.

2026년 1월, 피트 헤그세스 국방장관은 AI 가속 전략을 발표했다. 이 전략은 더 빠른 실험, 더 적은 관료적 장벽, 그리고 부처 전반에서 선도 모델에 대한 더 폭넓은 접근을 요구했다.

한 우선 과제는 캠페인 계획부터 킬 체인 실행까지의 활동을 포괄하는 AI 기반 전장 관리와 의사결정 지원이었다. 킬 체인은 표적을 식별하고, 추적하고, 선정하고, 교전하는 과정이다. 이 체인을 압축하면 비슷한 속도로 의사결정을 내리는 상대보다 우위를 확보할 수 있다.

국방부는 또한 고도화된 AI 시스템을 군인 및 민간 인력의 손에 쥐여주려 했다. 이 접근법은 분산형 실험을 선호하며, 부대와 인력이 하나의 중앙 프로그램을 기다리지 않고 활용 사례를 찾도록 한다.

분산화는 유용한 작전 지식을 만들어낼 수 있다. 물류 장교는 중앙 기술 부서가 놓칠 수 있는 공급 문제를 이해한다. 정보 분석가 역시 어떤 문서 집합, 보고 흐름, 반복 업무가 귀중한 시간을 소모하는지 안다.

동일한 모델은 거버넌스를 더 어렵게 만든다. 서로 다른 사령부는 서로 다른 제품, 구성, 데이터 출처, 운용 규칙을 사용할 수 있다. 시스템별 신뢰성도 달라질 수 있으며, 사용자는 허용 가능한 사용 방식에 대해 일관되지 않은 교육을 받을 수 있다.

CNN 보도에 따르면, 군과 정보 공동체 전반에서 사용되는 다양한 AI 시스템을 포괄하는 단일 검증 기준은 없었다. 이는 모든 사령부에 통제 장치가 없다는 뜻은 아니다. 다만 공통의 접근 권한이 공통의 검토 관행을 보장하지는 않는다는 점을 보여준다.

선박 사건은 도입 압박이 공식 정책 변화 이전에도 인간의 행동을 바꿀 수 있음을 보여준다. AI가 더 빠른 결정을 위한 수단으로 홍보되면, 분석가들은 속도를 가치 있는 결과로 해석할 수 있다. 그러면 신중한 지연은 전문적 판단이 아니라 저항처럼 느껴질 수 있다.

젊은 분석가들은 채팅 인터페이스 사용에 특히 익숙할 수 있지만, 익숙함이 자동으로 부주의를 의미하지는 않는다. 더 큰 위험은 상반되거나 불완전한 증거에도 기계가 생성한 답을 선호하는 경향인 자동화 편향에 있다.

대규모 언어 모델은 유창하게 소통하기 때문에 이 위험을 키운다. 기존 분석 도구는 점수, 경보 또는 경직된 데이터베이스 결과를 반환했을 수 있다. 챗봇은 출처를 연결하고, 질문을 예상하며, 유능한 동료처럼 들리는 일관된 서사를 만들어낼 수 있다.

출력이 긴급한 위협 평가를 뒷받침할 때 유창성은 특히 위험해진다. 산재한 정보를 마주한 분석가는 불확실성을 하나의 설명으로 정리해 주는 시스템을 반길 수 있다. 글쓰기 도구로서의 모델 유용성은 사실 권위로서의 약점을 감출 수 있다.

압박은 검토자에게도 미친다. AI 지원 워크플로는 더 짧은 시간에 더 많은 보고서를 만들 수 있지만, 조직에는 여전히 그 주장을 검토할 사람이 필요하다. 검토 역량이 생산량과 함께 늘지 않는다면, 속도는 병목을 하류로 옮길 뿐이다.

GovAI 연구원이며 전 미 육군 장교인 제이크 스테클러는 군인들이 대규모 언어 모델에 내재한 불확실성을 이해해야 한다고 경고했다. 그는 그 결과가 생사와 관련되기 때문에 표적화, 정보 분석, 작전 계획이 특히 민감한 영역이라고 지적했다.

스테클러는 군이 AI를 포기해야 한다고 주장하지 않았다. 그는 안전장치가 위험 수준에 부합한다면 적절한 환경에서 도구가 도움이 될 수 있다고 말했다. 그의 우려는 도입 속도를 다른 모든 것보다 우선시하면 군인들의 신뢰를 훼손하는 사건이 발생할 것이라는 점이었다.

이 경고는 중단된 작전 하나를 넘어서는 전략적 비용을 시사한다. 인력이 AI 시스템이 위험한 주장을 생성하는 모습을 보면, 이후 유효한 출력마저 거부할 수 있다. 부실한 배치는 과신과 불신을 모두 만들어 지휘관들이 이 기술이 언제 주목할 가치가 있는지 판단하기 어렵게 할 수 있다.

속도 대 검증이 진정한 군사 AI 경쟁이다

주된 상대는 미국과 특정 AI 공급업체의 대결이 아니라, 더 빠른 분석과 방어 가능한 증거의 경쟁이다.

군사 조직에는 의사결정 시간을 줄여야 할 강한 이유가 있다. 센서는 인간 팀이 수동으로 검토할 수 있는 양보다 더 많은 정보를 생산한다. 적대 세력은 활동을 은폐하고, 기만을 퍼뜨리며, 탐지와 대응 사이의 지연을 악용한다.

AI는 분석가가 이미지, 통신, 화물 명세서, 보고서, 공공 기록 전반의 관계를 찾아내도록 도울 수 있다. 또한 자료를 번역하고, 문서를 비교하며, 이전 평가를 검색하고, 시간 압박 속에서 사람이 놓칠 수 있는 불일치를 드러낼 수 있다.

선박 사건이 이러한 장점을 없애는 것은 아니다. 이는 생성과 검증이 별개의 기능으로 남아야 함을 보여준다. 시스템은 가설 제시를 도울 수 있지만, 같은 시스템이 자신의 제안을 검증하거나 정제된 문구 뒤에 불확실성을 숨겨서는 안 된다.

이 경우 그 분리는 실패했다. 챗봇은 먼저 화물 평가를 작성하는 데 도움을 주었다. 이후 AI는 그 평가를 신뢰할 수 있는 문서로 만드는 데 기여했다. 두 번째 상호작용은 독립적인 증거를 추가하지 않은 채 첫 번째 상호작용의 권위를 강화했다.

더 안전한 워크플로는 각 주장과 이를 뒷받침하는 출처 간의 연결을 유지해야 한다. 검토자는 원본 적하목록 항목, 관련 감청 정보, 번역본이 있다면 그 내용, 그리고 이러한 항목이 핵 관련 부품과 연결되는 추론을 확인할 수 있어야 한다.

신뢰도 표기에도 명확한 의미가 필요하다. 모델이 생성한 확률은 출처의 품질, 일치 여부, 가정, 지식 공백, 대안적 설명을 반영하는 분석적 신뢰도를 대체할 수 없다. 증거 자체가 불확실한 상황에서는 수치적 정밀성이 오해를 불러일으킬 수 있다.

펜타곤은 이미 이 문제에 적합해 보이는 원칙을 갖고 있다. 펜타곤의 윤리적 AI 원칙은 시스템이 책임 있고, 공정하며, 추적 가능하고, 신뢰할 수 있으며, 통제 가능해야 한다고 규정한다.

추적 가능성은 관련 인력이 해당 기술, 그 방법론, 데이터 출처를 이해할 것을 요구한다. 신뢰성은 명확히 정의된 용도 안에서의 시험을 요구한다. 통제 가능성은 의도하지 않은 결과를 탐지하거나 피할 수 있고, 행동이 안전하지 않게 될 때 중단할 수 있는 시스템을 요구한다.

보도에 따르면 이 아차사고는 이러한 운영 목표 각각과 충돌했다. 검토자들은 보고서가 AI의 도움을 받아 작성됐다는 사실을 즉시 파악하지 못했다. 이 도구는 고위험 정보 업무에서 잘못된 결론을 냈다. 조직은 작전을 중단했지만, 준비가 상당히 진행된 뒤였다.

이러한 괴리가 반드시 원칙이 공식적으로 무시됐다는 뜻은 아니다. 신원이 공개되지 않은 챗봇이 이 용도로 승인되지 않았을 수도 있고, 분석관이 기존 절차를 벗어났을 수도 있다. 공개 보도만으로는 이 가능성을 해소할 수 없다.

하지만 원칙만으로는 워크플로를 통제할 수 없다. 사용자가 질의를 제출하거나, 주장을 이전하거나, 평가를 공개하는 순간에 집행 가능한 메커니즘이 필요하다. 교육 문서는 제품 설계와 의무적 검토 관문을 대신할 수 없다.

실용적인 통제 수단 중 하나는 생성형 AI가 정보 산출물에 기여할 때마다 눈에 띄는 공개를 요구하는 것이다. 이 공개에는 모델, 버전, 질의 시각, 데이터 환경, 영향을 받은 문서 부분이 명시돼야 한다.

또 다른 통제 수단은 검증되지 않은 생성형 주장들이 작전 보고에 들어가는 것을 금지하는 것이다. 분석관은 모든 중요한 주장을 모델 요약과 독립적인 출처에 연결해야 한다. 뒷받침되지 않는 문구는 가설로 명확히 표시된 상태를 유지해야 한다.

중대한 결과를 초래할 수 있는 보고서에는 2인 검증도 요구할 수 있다. 두 번째 분석관은 생성된 서술에 의존하지 않고 원본 증거를 검토해야 한다. 이 접근법은 형식, 긴급성, 또는 계급이 불확실한 문구를 받아들여진 사실로 바꾸는 가능성을 줄일 수 있다.

레드팀 점검은 또 하나의 층을 제공한다. 검토자나 별도 시스템에 평가를 반증하고, 대안적인 화물 해석을 식별하며, 적하목록과 보고서 사이의 공백을 찾는 과제를 부여할 수 있다. 목표는 자동적인 기각이 아니라 구조화된 이견 제시다.

감사 로그도 마찬가지로 중요하다. 챗봇이 기밀 신호정보와 오픈소스 정보를 결합했다면, 조사관은 입력값, 검색 결과, 프롬프트, 출력, 수정, 인용에 대한 기록을 필요로 한다. 그러한 추적 기록이 없으면 조직은 실패를 설명하거나 안전장치를 개선할 수 없다.

이런 통제 수단에는 시간과 노동 비용이 든다. 이것이 핵심적인 상충 관계다. 검증 과정이 지나치게 오래 걸리면 정보는 무의미해질 수 있고, 너무 빠르게 진행되면 거짓이 행동으로 이어질 수 있다.

올바른 균형은 결과의 중대성에 따라 달라져야 한다. 일상적인 행정 업무에 쓰이는 초안 작성 보조 도구에는 외국 선박의 승선에 영향을 미치는 모델과 같은 통제가 필요하지 않다. 위험 등급은 접근, 시험, 기록, 승인 요건을 결정해야 한다.

군 지도자들은 AI를 의사결정자가 아니라 의사결정 지원 도구로 자주 설명한다. 이러한 표현은 인간이 독립적 판단을 내릴 만큼 충분한 증거를 제공받을 때에만 정확하다. 모델의 결론만 보는 사람은 정보에 근거한 결정을 내리는 것이 아니라 출력을 승인하는 것이다.

기존 안전장치는 오류를 충분히 일찍 막지 못했다

핵심 불확실성은 이것이 한 분석관의 실패였는지, 아니면 더 광범위한 검증 공백의 증거인지에 있다.

공개 보도는 몇 가지 중요한 질문에 답하지 못한다. 당국은 챗봇을 식별하지 않았기 때문에 독자는 그 의도된 목적, 보안 통제, 검색 설계, 성능 이력을 평가할 수 없다.

이 시스템이 상용 모델이었는지, 정부 호스팅 모델이었는지, 맞춤형 인터페이스였는지도 불분명하다. 한 전직 당국자는 CNN에 많은 내부 시스템이 상용 제품과 매우 유사했다고 말했다. 그러나 이 관찰만으로는 어떤 기술이 이 사례를 처리했는지 알 수 없다.

이 구분은 중요하다. 안전한 배포는 문제의 일부만 해결하기 때문이다. 기밀 환경 안에 모델을 호스팅하면 민감한 데이터를 보호할 수 있다. 그렇다고 생성된 답변이 정확해지거나 환각이 사라지는 것은 아니다.

검색 증강 생성은 질의 중 모델에 문서를 제공함으로써 일부 오류를 줄일 수 있다. 그러나 여전히 올바른 자료를 검색하고, 이를 적절히 해석하며, 불확실성을 정직하게 표현하는 데 달려 있다. 문서가 존재하더라도 모델은 이를 잘못 읽을 수 있다.

보도는 허위 결론에 인용이 수반됐는지도 설명하지 않는다. 인용이 있었다면 관련 없는 구절이나 주장을 뒷받침하지 않는 출처를 가리켰을 수 있다. 인용이 없었다면 해당 평가는 즉각적인 검증 대상이 됐어야 한다.

챗봇이 모호한 화물 설명을 특정한 무기 관련 결론으로 바꿨는지도 알 수 없다. 번역 오류, 약어, 불완전한 적하목록, 이중용도 부품은 생성형 AI가 없어도 선박 정보 분석을 복잡하게 만들 수 있다.

실제 화물은 공개되지 않았다. 이는 민감한 수집 방법이나 작전 세부 사항을 보호하지만, 독립적인 평가를 제한한다. 외부 관찰자는 자격을 갖춘 분석관에게 이 오류가 얼마나 명백했어야 하는지 판단할 수 없다.

펜타곤의 대응도 또 하나의 공백이다. 원래 보도가 나온 당시 국방부와 태평양 특수작전사령부 모두 공개 설명을 제공하지 않았다. 어떤 공식 설명도 징계 조치, 절차 변경, 공식 조사에 대해 밝히지 않았다.

이 침묵은 사건이 여전히 주로 익명 출처 보도에 기반하고 있음을 뜻한다. 여러 매체가 이 내용을 반복했지만, 대부분은 같은 CNN의 기초 조사 보도로 거슬러 올라간다. 기본 서사는 관련 기관들로부터 상세한 공개 확인을 받지 못했다.

따라서 신중함이 필요하다. 증거는 이 사건을 정통한 4개 출처가 설명한 심각한 아차사고로 보도하는 것을 뒷받침한다. AI 시스템이 독립적으로 작전을 지시했거나 군사 자산을 직접 통제했다고 주장하는 것은 뒷받침하지 않는다.

공개적으로 설명된 모든 단계에서 인간이 책임을 졌다. 한 분석관이 도구를 선택하고 보고서를 배포했다. 당국자들은 이 보고서를 실행 가능한 것으로 받아들였다. 다른 인력은 결국 이를 문제 삼고 임무를 중단했다.

이러한 인간의 사슬은 기술적 실패의 중요성을 줄이지 않는다. 다만 책임이 어디에 속해야 하는지를 바꾼다. 관련 시스템에는 챗봇, 그 인터페이스, 분석관, 검토 절차, 지휘 인센티브, 보고서의 제도적 위상이 포함된다.

미국 정부회계감사원은 2025년 연방 AI 검토에서 이미 관련 우려를 기록했다. 국방 당국자들은 조사관에게 생성형 시스템이 그럴듯하지만 잘못된 출력을 만들고 거짓 확실성을 조성할 수 있다고 말했다.

검토는 또한 모델이 답변을 생성하는 방식에 관한 투명성이 제한적이라고 지적했다. 일부 사용자는 이러한 출력을 해석하는 데 필요한 전문성을 갖추지 못했고, 엄격한 보안 요건은 민감한 임무 분야에서의 시험을 복잡하게 만들었다.

이러한 발견은 선박 사례의 작전상 결과가 유난히 심각했더라도, 그 사건을 덜 놀랍게 만든다. 중심적인 기술적 한계는 이미 알려져 있었다. 실패는 그 한계가 정보 생산 사슬을 통과하도록 허용한 데서 비롯됐다.

펜타곤은 공식적인 책임 있는 AI 지침을 유지해 왔으며, 팀의 위험 평가를 돕기 위한 도구도 공개했다. 그러나 툴킷만으로는 모든 사령부, 공급업체, 모델, 즉흥적 사용 사례에 걸친 준수를 보장할 수 없다.

바로 여기에서 분산 배포가 거버넌스 과제를 만든다. 현지 팀에는 유연성이 필요하지만, 고위험 출력에는 부대마다 달라지지 않는 최소 통제가 필요하다. 승선 작전이 한 사령부가 우연히 다른 사령부보다 강력한 프롬프트 지침을 사용하느냐에 달려서는 안 된다.

회의적인 질문은 추가 정책이 존재할지 여부가 아니다. 지휘관이 실제 작전 중 준수를 검증할 수 있는지 여부다. 효과적인 거버넌스는 모델 로그, 출처 인용, 검토 서명, 기록된 신뢰도 판단처럼 눈에 보이는 증거를 남겨야 한다.

이 사건은 더 나은 모델을 완전한 해결책으로 취급해서는 안 된다는 경고이기도 하다. 오류율은 낮아질 수 있지만 고영향 실패는 여전히 가능하다. 수백만 번 사용되는 모델은 드문 실수를 중요해질 만큼 자주 만들어낼 수 있으며, 특히 사용자가 긴급한 의심을 확인하는 출력만 선택할 때 그렇다.

교육은 필요하지만 마찬가지로 불완전하다. 인력은 자신감 있는 표현이 검증된 정보와 같지 않다는 점을 이해해야 한다. 또한 위기 상황에서 기억에 전적으로 의존하는 대신 위험한 행동을 어렵게 만드는 시스템이 필요하다.

따라서 군은 그 실수를 보상한 조건을 검토해야 한다. 분석관이 더 빨리 보고서를 내라는 압박을 받는다면, 경고 배너를 하나 더 추가한다고 인센티브 문제가 해결되지는 않는다. 무력 사용으로 이어질 수 있는 경우 지도자들은 검증에 필요한 시간을 보호해야 한다.

펜타곤이 배웠는지를 보여줄 세 가지 신호

다음 시험대는 군이 가까스로 피한 작전을 AI 워크플로 전반의 측정 가능한 변화로 전환하는지 여부다.

첫 번째 신호는 개별 분석관을 넘어서는 발견을 담은 공식 사후 검토다. 신뢰할 수 있는 검토는 모델의 역할, 누락된 검증 단계, 지휘 결정, 그리고 최종적으로 작전을 중단시킨 통제를 식별할 것이다.

펜타곤은 절차적 실패를 설명하기 위해 기밀 정보를 공개할 필요가 없다. AI 지원 공개, 모델 기록 보존, 생성된 주장 검증에 관한 기준을 공개할 수 있다. 요약된 설명만으로도 지도자들이 이 사건을 체계적 문제로 보는지 확인할 수 있다.

조사가 사용자 오류에만 초점을 맞춘다면, 이 글의 핵심 판단은 더 강해진다. 한 분석관을 탓하는 것은 도입 압박, 불균등한 기준, 설득력 있는 생성 텍스트의 동일한 조합을 그대로 남겨둘 것이다.

국방부가 워크플로 실패를 식별하고 시정 조치의 책임자를 지정한다면, 그 판단은 약해진다. 이러한 조치는 기존 거버넌스 구조가 또 다른 아차사고가 이만큼 진전되기 전에 학습할 수 있음을 시사할 것이다.

두 번째 신호는 AI 지원 정보 분석과 작전 계획을 위한 국방부 전반의 검증 규칙이다. 가장 강력한 정책은 저위험 초안 작성과 고위험 분석을 구분하고, 무력 사용 결정 전에 독립적인 출처 확인을 요구할 것이다.

그 규칙은 누가 주장을 검증하는지와 그들이 어떤 증거를 검토해야 하는지를 명시해야 한다. 인간을 계속 참여시켜야 한다는 일반적인 요건은 보도된 과정 전체에 이미 인간이 관여했기 때문에 이 사건을 해결하지 못할 것이다.

운영 시스템은 이 규칙을 직접 강제할 수 있다. AI 생성 자료가 포함된 보고서는 자격을 갖춘 검토자가 모든 중대한 주장을 확인할 때까지 눈에 띄는 라벨을 유지하도록 할 수 있다. 라벨 제거에는 단순한 서식 변경이 아니라 감사 가능한 승인이 필요하다.

이러한 정책은 AI가 생성한 요약도 다뤄야 한다. 선박 사례는 초안 작성이 자동으로 저위험 작업이 되는 것은 아님을 보여준다. 요약이 지휘관들이 의존하는 문서가 되면, 그 제시 방식은 기초 분석만큼이나 강하게 행동에 영향을 미칠 수 있다.

펜타곤이 지휘 체계와 기밀 등급 전반에 걸쳐 통일된 통제 체계를 도입한다면, 이는 속도가 더 이상 추적 가능성보다 우선하지 않는다는 신호가 될 것이다. 검증이 계속 파편화된 상태로 남는다면, 유사한 오류는 절차가 가장 취약한 부대를 통해 퍼질 수 있다.

세 번째 신호는 일반적인 모델 정확도 이상을 측정하는 운용 시험이다. 국방부는 현실적인 시간 압박, 불완전한 데이터, 확증편향을 유도하도록 설계된 시나리오에서 인력이 뒷받침되지 않는 주장을 탐지하는지 시험해야 한다.

평가에서는 출처 귀속, 보정, 답변 보류도 검토해야 한다. 보정은 신뢰도가 실제 정확도와 일치하는지를 측정한다. 답변 보류는 증거가 불충분할 때 시스템이 명확하게 답변을 거부하는 것을 의미한다.

실험실에서 환각을 덜 생성하는 모델이라도 사용자가 남아 있는 환각을 알아차릴 수 없다면 운용 환경에서는 실패할 수 있다. 따라서 적절한 측정 단위는 챗봇만이 아니라 인간-기계 팀이다.

시험에는 적대적 데이터도 포함해야 한다. 상대는 AI 보조 분석에 영향을 미치기 위해 공개 출처, 화물 기록, 이미지 또는 통신을 조작할 수 있다. 기밀 데이터와 공개 데이터를 결합하는 시스템은 심어진 오픈소스 자료에 부당한 신뢰성을 부여할 수 있다.

결과가 군사 능력을 노출할 필요는 없다. 펜타곤은 실패 범주, 시정 비율, 그리고 시스템이 특정 용도에 대해 정의된 기준을 충족했는지를 보고할 수 있다. 투명한 지표는 군 장병이 어떤 도구에 제한적인 신뢰를 둘 만한지 이해하는 데 도움이 될 것이다.

이 세 가지 신호는 국가 안보를 넘어 중요하다. 기업들은 이미 AI를 활용해 계약서를 요약하고, 사고를 평가하며, 재무 문서를 준비하고, 내부 지식을 검색하고 있다. 세련된 결과물은 누군가 기초 증거를 확인하기도 전에 조직 전체로 퍼질 수 있다.

팀은 생성된 종합과 검증된 사실 사이의 경계를 분명하게 유지해야 한다. 또한 특히 요약이 안전, 규정 준수, 고용 또는 재무 결정에 영향을 미칠 때 중요한 주장 뒤에 있는 출처를 보존해야 한다.

지식 도구는 출처 자료를 결론에 연결해 두어 부담을 줄일 수 있다. 그러나 검색과 정리는 책임을 소프트웨어에 이전하지 않는다. 중대한 행동을 승인하는 사람은 여전히 관련 증거를 검토해야 한다.

보도된 AI 환각은 여러 단계의 인간 참여가 생성된 주장 하나에 충분히 이른 시점에 이의를 제기하지 못했기 때문에 미군 작전 계획 수립을 거의 촉발할 뻔했다. 막판의 성공적인 검토는 확전을 막았지만, 그것이 절차가 제대로 작동했다는 증거가 되어서는 안 된다.

더 유용한 질문은 다음의 의심스러운 보고서가 항공기가 출격하고 승선팀이 집결하기 전에 차단될 것인지다. 공개 검토, 강제력 있는 검증 규칙, 현실적인 시험에 주목해야 한다. 이러한 변화가 없다면, 더 빠른 군사용 AI는 의사결정 시간뿐 아니라 설득력 있는 답변이 거짓임을 발견할 기회까지 계속 압축할 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page