top of page

Ivanti AI 보안 가이드는 시간을 단축했지만, Claude Skill은 세부 정보를 지어냈다

9월 13일
12분 분량

Ivanti는 Claude 기반 패치 분석 skill이 세부 정보를 지어냈다고 공개했다. 이 도구는 반복 업무 시간을 수 시간에서 수 분으로 줄였지만, 개발 과정에서 Microsoft Office 에디션을 혼동하고 Adobe의 릴리스 주기를 반복해서 잘못 해석했다.

이 고백이 중요한 이유는 이 결과물이 Microsoft의 월간 Patch Tuesday 이후 보안팀이 취약점 우선순위를 정하는 데 사용되기 때문이다. 인용된 취약점이 모두 실제 존재하더라도, 그럴듯한 허구 정보는 어떤 시스템을 먼저 주의 깊게 살펴봐야 하는지를 왜곡할 수 있다.

Ivanti는 인적 승인 절차를 도입하고 6월 차트에서 Claude의 역할을 공개적으로 명시했다. CrowdStrike와 Palo Alto Networks 역시 중요한 보안 자동화 과정에 사람을 참여시키지만, 두 회사 모두 유사한 허구 생성을 적발한 사례를 공개적으로 설명하지는 않았다.

따라서 이 이야기는 단순히 하나의 모델이 실수한 문제보다 더 큰 의미를 지닌다. 이는 벤더가 AI가 운영 가이드에 어떤 영향을 주는지, 검토자가 실제로 무엇을 확인하는지, 어떤 오류가 보이지 않은 채 남는지를 공개할지에 대한 시험대다.

Ivanti AI 보안 가이드는 수개월간의 수정 끝에 프로덕션에 도입됐다

Ivanti는 개발자들이 학습 과정에서 지어낸 정보나 혼동된 세부 사항을 반복적으로 발견한 뒤에야 Claude skill을 프로덕션에 도입했다.

Ivanti의 엔드포인트 보안 제품 관리 부사장인 Chris Goettl은 약 10년간 수동으로 수행해 온 프로세스를 중심으로 이 skill을 구축했다. 이 도구는 공개된 벤더 권고문과 Ivanti 자체 스프레드시트를 수집한 뒤, 회사의 위협 위험 우선순위 지정 방식을 적용한다.

이 맥락에서 skill은 AI 모델에 제공되는 재사용 가능한 지침, 출처, 워크플로 규칙의 집합을 뜻한다. 이는 모델이 모든 벤더의 공개 체계를 독립적으로 이해한다는 의미는 아니다.

Goettl은 벤더별로 시스템을 학습시켰다. 비교적 구조화된 입력을 제공하는 다운로드 가능한 스프레드시트가 있었기 때문에 Microsoft가 먼저였다. Adobe는 모델이 개별 페이지와 변경되는 레이아웃을 해석해야 했으므로 다른 접근 방식이 필요했다.

이 차이는 중요한 약점을 드러냈다. 이 skill은 Adobe의 릴리스 주기를 반복해서 잘못 생성했다. 또한 Microsoft가 여러 제품군으로 구분하는 Microsoft Office 에디션을 혼동했다.

이는 문체상의 결함이 아니었다. 릴리스 주기와 제품 식별은 분석가가 비정상 활동, 영향받는 소프트웨어, 패치 긴급성을 해석하는 방식에 영향을 미친다. 잘못된 패턴을 담은 매끄러운 요약도 팀을 잘못된 방향으로 이끌 수 있다.

Goettl은 답변이 명백히 근거가 없어 보였을 때 시스템에 이를 추궁했다고 설명했다. AI-assisted pipeline에서 밝힌 그의 설명에 따르면, Claude는 지어낸 내용에 참조 가능한 근거가 없음을 인정했다.

Ivanti는 이 skill이 공개 벤더 권고문과 회사가 관리하는 스프레드시트만 사용한다고 밝혔다. 고객 데이터는 처리하지 않으며, 생성된 모든 결과물은 사람이 승인할 때까지 초안으로 남는다.

시니어 제품 관리자 Todd Schell은 이전에 수작업으로 작성된 두 달치 브리핑을 대상으로 시스템을 재실행했다. Ivanti는 98% 일치율을 보고하면서도, 남아 있는 예외 사례가 있음을 인정했다.

이 수치는 신중하게 해석할 필요가 있다. VentureBeat는 원본 데이터, 평가 방식, 오류 분류 체계, 재실행 결과를 독립적으로 감사하지 않았다. 또한 일치율만으로 생성된 결과물에 관련된 모든 취약점이 포함됐다는 사실이 입증되지는 않는다.

첫 프로덕션 실행은 Goettl이 휴가 중이던 2026년 8월에 이뤄졌다. 이전에는 직원 두 명이 각각 약 4시간씩 필요했던 스프레드시트 작업이 30분 이내에 완료된 것으로 전해졌다.

더 광범위한 월간 워크플로는 Patch Tuesday마다 합계 약 48시간을 소모해 왔다. Ivanti는 이 작업이 Goettl과 Schell의 합산 근무 시간 중 최소 5%를 차지했다고 추정했다.

운영상의 이점은 쉽게 이해할 수 있다. 기계는 두 명의 전문가가 스프레드시트 전체에서 필드를 수동으로 복사하는 것보다 대규모 릴리스를 더 빠르게 수집, 정규화, 분류할 수 있다.

그러나 Ivanti는 이 프로세스에서 전문가를 제거하지 않았다. 회사는 전문가의 역할을 모든 행을 작성하는 업무에서 기계가 만든 초안을 검토하는 업무로 바꿨다.

이 구분은 핵심 갈등을 정의한다. 자동화는 수작업 구축을 줄여 시간을 절약하지만, 신뢰할 수 있는 보안 가이드는 여전히 인간의 판단과 출처 수준의 검증에 의존한다.

Ivanti는 더 광범위한 보도가 나오기 전에도 눈에 띄는 공개 문구를 남겼다. June Patch Tuesday 게시물은 한 차트가 작성자가 설계한 프롬프트와 Goettl의 데이터세트를 사용해 Claude로 생성됐다고 명시했다.

그 캡션을 요구한 규정은 없었다. 문구를 규정한 일반적인 업계 표준도 없었다. 이 공개 문구는 더 폭넓은 검토를 받기 전 약 3개월 동안 공개 상태로 유지됐다.

개발 실패 사례가 알려지자 이 조용한 캡션은 의미를 갖게 됐다. 이는 AI 생성 산출물을 특정 모델, 인간 작성자, 날짜, 정의된 데이터세트와 연결했다.

이는 일반적인 “AI assisted” 표기보다 더 높은 수준의 투명성이다. 그러나 어떤 행이 검토됐는지, 완전성을 어떻게 측정했는지, 게시된 위험 등급이 독립 검증을 받았는지는 여전히 드러나지 않는다.

Patch Tuesday 데이터 문제는 자동화의 매력을 높였다

즉각적인 압력은 규모가 커지고 표준화 정도가 낮아졌으며 각 벤더의 해석에 더 많이 의존하게 된 Patch Tuesday 프로세스에서 비롯됐다.

2026년 9월 8일 Microsoft는 여러 보안 연구자가 최대 규모의 Patch Tuesday라고 설명한 업데이트를 공개했다. 그러나 같은 릴리스를 분석한 조직들 사이에서도 공개된 총계는 크게 달랐다.

Tenable은 중요도 critical 104건과 important 860건을 포함해 964개의 취약점을 집계했다. September analysis는 패치가 제공되기 전에 실제 공격에 악용된 취약점 2건도 확인했다.

Ivanti는 973건을 집계했다. Senserva는 다른 추적기와 같은 권고문 중심 방식을 사용하지 않고 지식 베이스 문서에 취약점을 매핑했기 때문에 1,169건을 집계했다.

Tenable과 Senserva의 총계 차이는 205개 취약점이었다. 이 격차는 Ivanti가 인용한 이전 Patch Tuesday 최다 기록인 2025년 10월의 175개 취약점을 넘어섰다.

이러한 차이가 AI 모델의 오류를 입증하는 것은 아니다. 범위, 중복 항목, 제품 변형, 권고문 경계, 지식 베이스 매핑에 관한 정당한 선택에서 비롯될 수 있다.

다만 이는 단일 월간 총계를 중립적인 사실로 취급할 수 없는 이유를 보여준다. 이제 모든 공개 집계는 파싱 방식과 해당 집합에 무엇이 포함되는지에 대한 정의를 반영한다.

Microsoft는 Security Update Guide에서 하나로 통합된 월간 CVE 목록을 더 이상 제공하지 않으면서 이 문제를 심화시켰다. Rapid7은 July patch review를 준비하는 과정에서 이 변화를 문서화했다.

이제 각 보안 벤더는 Microsoft가 제공하는 데이터로부터 릴리스를 재구성해야 한다. 이 재구성에는 결정론적 코드, 수동 분석, AI 모델 또는 이 세 가지의 조합이 사용될 수 있다.

결정론적 파서는 명시적인 규칙을 따르며 동일한 입력에 대해 동일한 결과를 낸다. 대규모 언어 모델은 일관되지 않은 페이지를 더 유연하게 해석할 수 있지만, 근거 없는 관계를 생성할 수도 있다.

이러한 상충 관계는 결과물이 단순한 집계가 아닐 때 특히 중요해진다. 보안팀에는 실제 악용, 공개 여부, 심각도, 자산 노출도, 비즈니스 중요성을 기반으로 한 우선순위 지정이 필요하다.

잘못된 집계는 보고를 혼란스럽게 만들 수 있다. 잘못된 우선순위는 제한된 패치 적용 역량을 공격자가 이미 악용 중인 위협에서 멀어지게 할 수 있다.

Ivanti의 웨비나 브리핑에는 매달 500명에서 700명의 참석자가 참여하는 것으로 전해졌다. 이 참가자들이 모든 권고를 곧바로 프로덕션에 적용하는 것은 아니지만, 청중 규모는 각 우선순위 결정의 영향력을 크게 만든다.

시간 압박도 현실적이다. 보안팀은 공격자가 행동하기 전에 거의 1,000개의 항목을 여유 있게 검토할 수 없다.

CrowdStrike는 공개 proof of concept와 관련된 관찰된 악용 사례의 88%가 48시간 이내에 시작됐다고 보고했다. proof of concept는 취약점 악용 방법을 보여주는 공개 코드 또는 기술 문서다.

연방 요구사항은 더 촉박할 수 있다. CISA의 Binding Operational Directive 26-04는 연방 민간 기관에서 최고 위험 취약점에 대해 3일의 조치 기한을 설정했다.

이러한 조건에서 벤더가 수집과 예비 분류를 자동화할 강한 유인을 갖는 것은 당연하다. 완벽한 수동 검토를 기다리는 일 자체가 위험을 초래할 수 있다.

문제는 조직이 AI를 사용해야 하는지 여부가 아니다. 가속화가 핵심 취약점을 누락하지 않았고, 제품 매핑을 손상시키지 않았으며, 약한 신호를 과도하게 끌어올리지 않았음을 입증할 수 있는지가 문제다.

Ivanti의 경험은 이 증명이 유창함에서 나올 수 없는 이유를 보여준다. 모델의 잘못된 결과물은 전문가의 인식과 직접적인 추궁이 필요할 만큼 설득력 있어 보였다.

따라서 보안 구매자는 양쪽에서 압박을 받는다. 더 빠른 가이드가 필요하지만, 빠르고 잘 작성된 브리핑에 완전하거나 정확히 우선순위가 매겨진 항목 집합이 담겨 있다고 가정할 수는 없다.

진정한 전환점은 허구 생성이 아니라 공개다

놀라운 점은 Claude가 세부 정보를 지어냈다는 사실이 아니라, Ivanti가 그 실패를 설명하고 눈에 보이는 인적 검토 절차를 유지했다는 점이다.

대규모 언어 모델은 학습 데이터와 제공된 맥락을 바탕으로 그럴듯한 순서를 예측해 텍스트를 생성한다. 모든 문장이 제공된 출처에 대응된다는 보장을 본질적으로 제공하지는 않는다.

흔히 환각이라고 불리는 허구 생성은 모델이 근거 없는 정보를 마치 출처에 기반한 것처럼 제시할 때 발생한다. 이 워크플로에서 실패는 잘못된 벤더 패턴과 혼동된 소프트웨어 제품군으로 나타났다.

이러한 약점은 범용 AI 시스템에서 이미 잘 알려져 있다. 중요한 것은 이 약점이 보안 권고를 생성하는 파이프라인 내부에 배치됐다는 점이다.

소비자용 챗봇의 오류는 독자의 시간을 낭비시킬 수 있다. 운영 가이드에서 취약점 행 하나가 누락되면 노출된 시스템의 조치가 지연될 수 있다.

Ivanti의 공개가 이 위험을 없앤 것은 아니다. 대신 위험을 검토 가능한 상태로 만들었다.

회사는 최소 한 개의 공개 그래픽에 모델 이름과 인간의 책임 소재를 연결했다. Goettl은 또한 학습 중 어떤 문제가 발생했으며, 왜 검토 절차가 여전히 필요한지를 설명했다.

이 정도의 구체성은 고객이 더 나은 질문을 하도록 돕는다. 고객은 모델 지원 수집과 자율적 우선순위 지정을 구분할 수 있으며, 어느 단계가 인간의 검증을 받는지 물을 수 있다.

이 고백은 일반적인 신뢰 메시지도 복잡하게 만든다. 벤더는 AI 기능을 발표할 때 대개 정확도 향상, 처리 속도, 분석가 생산성을 강조한다.

개발 실패는 동등한 주목을 받는 경우가 드물다. 이러한 불균형은 구매자가 알려진 실패 모드가 아니라 가장 좋은 벤치마크를 기준으로 워크플로를 평가하게 만든다.

Ivanti가 보고한 98% 일치율은 이 위험을 보여준다. 이 수치는 안심시키는 듯 들리지만, 실제 의미는 나머지 차이에 무엇이 포함됐는지에 달려 있다.

중요하지 않은 서식 차이와 실제 악용 중인 취약점의 누락은 같은 비중으로 다뤄져서는 안 된다. 유용한 평가는 운영상 결과에 따라 오류를 분류해야 한다.

완전성은 정확성과 별도로 다뤄져야 한다. 검토자는 눈에 보이는 행에서 잘못된 심각도나 형식이 잘못된 설명을 발견할 수 있지만, 누락된 행은 쉽게 알아차릴 수 없다.

이는 인간 검토 서사에 가장 날카로운 도전 과제다. 생성된 결과물을 읽는 일은 이를 권위 있는 소스 목록과 대조하는 일과는 다르다.

독립 가상 최고정보보안책임자이자 IEEE 선임 회원인 Kayne McGladrey는 고객에게 파이프라인에 대한 서면 설명이 필요하다고 주장했다. 그는 공급업체가 모델이 어디에서 작동하는지, CVE를 어떻게 파싱하는지, 누가 결과물을 검토하는지, 얼마나 많은 내용이 소스 검증을 받는지 설명해야 한다고 말했다.

그의 비판은 인간의 서명을 요구하는 데 그치지 않았다. 이전에 인간이 작성한 월간 결과물과 재실행해 비교하면 유사성은 측정할 수 있지만, 현재 월의 정확성을 입증할 수는 없다.

인간 검토자 역시 모델의 사각지대를 공유할 수 있다. 둘 다 눈에 보이는 항목에 집중한다면, 검토가 시작되기 전에 사라진 항목은 어느 쪽도 발견하지 못한다.

따라서 관련 기준은 추적 가능성이다. 공개된 각 권고안은 권위 있는 입력 자료와 연결되어야 하며, 각 권위 있는 입력 자료에는 처리 결과가 기록되어야 한다.

두 번째 방향이 특히 중요하다. 이는 검토를 “이 초안이 그럴듯해 보이는가?”에서 “모든 소스 항목을 설명할 수 있는가?”로 전환한다.

바로 이 지점에서 체계적인 knowledge blending이 패치 작업을 넘어 의미를 갖는다. 소스 결합은 워크플로가 출처를 보존하고 충돌을 감추지 않고 드러낼 때에만 유용하다.

Ivanti의 공개는 출발점이지 완성된 기준은 아니다. 이는 AI가 참여했고 알려진 환각 사례가 검토 프로세스에 반영됐다는 사실을 구매자에게 알린다.

하지만 행 단위 계보, 독립적인 위험 등급 테스트, 거짓 음성률, 또는 자동으로 대조된 소스 자료의 비율을 공개적으로 입증하지는 않는다.

그럼에도 이 인정은 경쟁사에 압박을 가한다. 검증 체인을 설명하지 않은 채 AI 지원 보안 가이드를 홍보하는 공급업체는 이제 Ivanti보다 고객에게 더 적은 정보를 제공하게 된다.

이 역전은 불편하지만 건설적이다. 모델의 실패를 공개적으로 인정하는 일은 프로세스 성숙도의 증거가 될 수 있는 반면, 침묵은 뛰어난 통제를 감추고 있을 수도, 아무런 통제가 없음을 감추고 있을 수도 있다.

인간 검토는 누락된 증거를 찾을 수 있을 때에만 작동한다

검토 설계가 누락, 근거 없는 주장, 고영향 분류 오류를 겨냥할 때에만 검토자는 가치를 더한다.

Ivanti의 워크플로는 Claude의 초안과 공개 브리핑 사이에 사람을 둔다. 모델이 우선순위를 자동으로 공개하도록 허용하는 것보다 안전하다.

그러나 “human in the loop”는 품질 측정치가 아니라 설계 설명이다. 그 효과는 사람이 무엇을 보고, 무엇을 확인하며, 무엇을 중단시킬 수 있는지에 달려 있다.

문서를 훑어보는 검토자는 어색한 표현, 잘못된 제품군에 배정된 익숙한 제품, 또는 그럴듯하지 않은 릴리스 패턴을 식별할 수 있다. Goettl의 전문성은 학습 과정에서 이러한 눈에 보이는 이상 징후를 포착한 것으로 보인다.

더 어려운 실패는 조용한 누락이다. 파서나 모델이 취약점에 대한 행을 전혀 만들지 않는다면, 최종 스프레드시트만 검토하는 검토자는 명백한 경고를 받지 못한다.

더 강력한 시스템에는 언어 모델 외부의 대조 통제가 필요하다. 결정론적 검사는 소스 식별자를 비교하고, 일치하지 않는 레코드를 표시하며, 중복 CVE를 감지하고, 공급업체별 예상 항목 수를 계산할 수 있다.

그런 다음 모델은 해석이 필요한 작업을 맡을 수 있다. 권고문을 요약하거나, 일관되지 않은 설명을 정규화하거나, 전문가 승인을 위한 위험 범주를 제안할 수 있다.

이 구분은 기계에 서로 다른 책임을 부여한다. 코드는 완전성과 재현성을 보호하고, 모델은 모호한 언어와 우선순위 맥락을 지원한다.

또한 더 명확한 실패 신호를 만든다. 생성된 서술이 세련돼 보여도 대조 불일치는 공개를 중단시킬 수 있다.

위험 등급 검증에도 유사한 엄격함이 필요하다. 시스템은 항목이 해당 순위를 받은 이유, 그 결정을 뒷받침한 소스 사실, 인간 검토 후 달라진 내용을 기록해야 한다.

그 기록이 없다면 최종 승인은 책임 소재를 확립할 뿐, 품질에 관한 증거는 제한적으로만 제공한다. 검토자가 모든 권고안을 검토했는지, 아니면 최고 위험 행만 표본으로 확인했는지는 보여줄 수 없다.

Ivanti는 알려진 익스플로잇, 공개 공시, 비정상적인 물량 신호가 에스컬레이션을 촉발한다고 말한다. 이는 합리적인 규칙 집합이지만, 공개 보고는 그 적용을 독립적으로 검증하지 않는다.

Adobe와 Office의 실패는 공급업체별 테스트가 왜 중요한지도 보여준다. Microsoft 스프레드시트에서 잘 작동하는 워크플로도 다른 발행자가 웹페이지, 다른 명명 규칙 또는 불규칙한 릴리스 일정을 사용할 경우 실패할 수 있다.

따라서 평가는 각 데이터 소스와 각 변환 단계를 포괄해야 한다. 혼합 평균은 강력한 Microsoft 성능 뒤에 취약한 공급업체 커넥터를 숨길 수 있다.

CrowdStrike는 Fal.Con 2026에서 다른 검토 패턴을 설명했다. 보도에 따르면 이 회사의 “human on the loop” 접근 방식에서는 분석가가 에이전트와 병행해 동일한 탐지를 처리한 뒤 판정을 비교한다.

병렬 작업은 순차적 검토가 놓치는 불일치를 드러낼 수 있다. 또한 한 사람이 이미 완성된 초안을 확인하는 워크플로보다 더 많은 인간의 노력을 유지한다.

Palo Alto Networks는 2026년 2월 사전 구축된 에이전트와 고영향 작업을 위한 승인 게이트를 갖춘 Cortex XSIAM AgentiX를 선보였다. 이 회사의 agentic SOC design 역시 자동화된 결정이 더 큰 결과를 초래하는 영역에서 인간 통제를 유지한다.

어느 설계도 누락된 입력 문제를 자동으로 해결하지는 않는다. 인간과 에이전트는 모두 불완전한 피드를 바탕으로 추론할 수 있으며, 승인 게이트는 잘못된 증거에 근거한 작업을 승인할 수 있다.

그럼에도 이 비교는 형성 중인 합의를 보여준다. 주요 공급업체들은 고영향 보안 운영에서 제한 없는 자율성을 수용 가능한 기본값으로 여기지 않고 있다.

이 합의는 업계 용어가 지원과 자율성을 자주 흐리기 때문에 중요하다. 브리핑 초안을 작성하는 시스템은 패치를 배포하거나, 장치를 격리하거나, 인시던트를 종료하는 시스템과 실질적으로 다르다.

구매자는 각 AI 작업을 되돌릴 수 있는 정도와 잠재적 피해에 매핑해야 한다. 영향이 낮은 요약은 프로덕션 시스템을 변경하는 결정에 비해 더 가벼운 통제를 허용할 수 있다.

또한 실제 실패 사례의 증거를 요구해야 한다. 일치율만 보고하는 벤치마크는 오류가 표현, 범위, 심각도 또는 누락과 관련됐는지를 감춘다.

Ivanti가 알려진 환각을 포착한 사례는 단순한 정확도 주장보다 더 유용한 정보를 제공한다. 이는 시스템이 신뢰할 수 없게 된 구체적 조건을 식별한다.

해결되지 않은 질문은 프로덕션 통제가 학습 중 발견된 실패뿐 아니라 새로운 실패 모드도 감지하는지 여부다. 공급업체 사이트는 바뀌고, 분류 체계는 진화하며, 이례적인 릴리스는 어제의 파싱 가정을 무효화할 수 있다.

인간 검토는 여전히 필요하지만, 측정 가능한 통제 시스템 안에 있어야 한다. 그렇지 않으면 이 표현은 가장 위험한 오류가 발견 가능한지 입증하지 못하는 안심 장치가 될 수 있다.

Ivanti의 인정은 모든 보안 공급업체의 기준을 높인다

보안 공급업체들은 이제 단순히 AI를 사용한다고 밝히는 것을 넘어, AI가 고객 대상 우선순위에 정확히 어떤 영향을 미치는지 공개해야 한다는 압박을 받고 있다.

Ivanti만 보안 분석을 자동화하는 것은 아니다. CrowdStrike, Palo Alto Networks 및 다른 공급업체들은 탐지, 조사, 분류, 대응 워크플로에 모델과 에이전트를 도입하고 있다.

여기서 드러난 경쟁상의 차이는 투명성이다. Ivanti는 모델을 명시하고, 입력을 설명하며, 알려진 환각 패턴을 식별하고, 공개에는 인간 승인이 필요하다고 설명했다.

VentureBeat는 CrowdStrike나 Palo Alto Networks에서 이에 필적하는 공개적인 환각 사례 공개를 찾지 못했다고 보도했다. 이 부재가 해당 시스템이 실패했다거나 통제가 더 약하다는 사실을 입증하는 것은 아니다.

이는 고객에게 비교 가능한 정보가 부족하다는 뜻이다. 한 공급업체는 실패 이력의 일부를 공개한 반면, 다른 업체들은 주로 아키텍처와 보호 조치를 설명한다.

공개는 어려운 인센티브 문제를 만든다. 실수를 보고하는 기업은 성공적인 평가만 공개하는 경쟁사보다 덜 신뢰할 만해 보일 수 있다.

보안 조달은 증거에 보상함으로써 이 인센티브를 뒤집을 수 있다. 구매자는 모든 공급업체에 같은 질문을 하고, 답변이 없는 경우 해결되지 않은 통제 공백으로 취급할 수 있다.

첫째, 고객은 어떤 산출물이 AI로 생성되는지 물어야 한다. 답변은 수집, 파싱, 요약, 점수화, 권고, 자동화된 작업을 구분해야 한다.

둘째, 완전성을 어떻게 검증하는지 물어야 한다. 유효한 답변은 누락된 행, 중복 레코드, 소스 변경 및 수집 실패를 다뤄야 한다.

셋째, 누가 결과를 검토하고 그 검토가 무엇을 포괄하는지 물어야 한다. 명시된 승인 역할도 유용하지만, 문서화된 체크리스트와 감사 추적은 더 강한 보증을 제공한다.

넷째, 하나의 정확도 비율이 아니라 오류 범주를 요청해야 한다. 구매자는 실패가 문법, 제품 귀속, 익스플로잇 상태, 심각도 또는 포함 여부에 영향을 미치는지 알아야 한다.

이러한 요청은 관련된 결정의 중요성에 비례한다. 패치 팀은 모든 문제를 동시에 해결할 수 없기 때문에 우선순위 지정을 활용한다.

9월 릴리스는 규모 문제를 보여준다. Tenable은 964개의 CVE를 식별했고, Ivanti는 973개를 식별했으며, Senserva는 다른 집계 방식으로 1,169개를 식별했다.

구매자가 모든 공급업체에 완전히 동일한 수치를 요구할 필요는 없다. 다만 각 공급업체는 범위를 설명하고, 권고안을 해당 범위와 대조해야 한다.

같은 논리는 위험 등급에도 적용된다. 공급업체는 익스플로잇 가능성, 노출도, 비즈니스 맥락을 서로 다르게 평가할 수 있지만, 그러한 판단은 추적 가능해야 한다.

투명성은 공급업체를 불공정한 비교로부터도 보호한다. 문서화된 방법론은 두 합계가 한 시스템의 조용한 데이터 손실이 아니라 정의된 범위의 차이 때문에 다르다는 점을 보여줄 수 있다.

이 문제는 사이버 보안을 넘어선다. AI로 생성된 모든 연구, 규정 준수 브리핑, 재무 요약 또는 운영 보고서에는 표면 검토가 놓칠 법한 그럴듯한 누락이 포함될 수 있다.

보안 분야에서는 CVE에 식별자와 권위 있는 권고문이 존재하기 때문에 이 문제가 특히 잘 드러난다. 이러한 구조는 공급업체에 완전성을 테스트할 실질적인 방법을 제공한다.

덜 구조화된 증거를 다루는 조직은 더 어려운 과제에 직면한다. 그럼에도 출처, 충돌 감지, 누락 자료에 대한 명시적 처리가 필요하다.

따라서 Ivanti의 접근 방식은 충분하지는 않지만 주목할 만하다. 이 공개는 침묵보다 더 많은 정보를 고객에게 제공하지만, 보고된 통제 조치에도 여전히 중요한 검증 질문이 남아 있다.

회사의 과거 보안 맥락은 면밀한 검토를 특히 중요하게 만든다. 패치 가이드를 평가하는 고객은 모델의 효율성뿐 아니라 Ivanti가 위험을 정확하게 전달하는 능력도 평가할 것이다.

그 검토는 증거에 기반해야 한다. 여기서 논의한 Claude skill은 공개 패치 데이터를 분석했으며, 보도에 따르면 고객 환경에 접근하지는 않았다.

이는 자율형 복구 에이전트가 아니었다. 사람의 공개 책임 아래 정기 브리핑을 위한 초안을 생성했다.

이러한 범주를 혼동하면 사건을 과장하게 된다. “인간이 확인했다”는 이유로 환각을 축소하면 통제 과제를 과소평가하게 된다.

균형 잡힌 결론은 이 두 극단 사이에 있다. Ivanti는 실질적으로 더 빠른 프로세스를 만들고, 실제 모델 실패를 포착하며, AI 개입을 공개하고, 전문가 검토를 유지했다.

하지만 그 프로세스가 누락된 모든 취약점을 포착하거나 모든 우선순위 결정을 독립적으로 검증한다는 사실을 공개적으로 입증하지는 못했다. 이제 고객이 Ivanti와 경쟁사에 요구해야 할 기준이 바로 그것이다.

AI 패치 가이드가 신뢰를 얻는지 보여줄 세 가지 신호

다음 시험대는 벤더들이 광범위한 인간 감독을 가시적이고 반복 가능하며 출처를 완전하게 포괄하는 검증으로 전환하는지 여부다.

첫 번째 신호는 2026년 10월 13일 다음 Patch Tuesday와 함께 나타날 것이다. 분석가들은 공개된 총계, 범위 정의, 알려진 악용 레이블, 비정상적인 벤더 데이터의 처리 방식을 비교해야 한다.

Ivanti의 결과물이 출처 간 불일치를 명확히 설명하면서도 신속성을 유지한다면, 감독형 자동화에 대한 주장은 더욱 설득력을 얻는다. 설명되지 않는 누락이나 매핑 오류가 발생한다면 그 주장은 약화될 것이다.

두 번째 신호는 Ivanti 또는 경쟁사들의 더 상세한 공개다. 유용한 문서는 모델이 작동하는 위치, 완전성을 보호하는 결정론적 통제 수단, 인간 승인이 필요한 의사결정을 명시해야 한다.

이 정보는 투명성이 경쟁 표준이 될 수 있다는 주장을 강화할 것이다. 광범위한 “human in the loop” 표현에 계속 의존한다면 핵심 검증 공백은 해소되지 않는다.

세 번째 신호는 운영 환경 평가에서 나오는 증거다. 벤더들은 악용 가능한 고객 세부 정보를 노출하지 않으면서 오류 범주, 출처 포괄 범위, 검토자 재정의, 영향이 큰 거짓 음성을 보고해야 한다.

이러한 증거는 시스템이 새로운 형식과 엣지 케이스를 접한 뒤 개선되는지 보여줄 것이다. 집계된 일치도만으로는 그 질문에 답할 수 없다.

CrowdStrike의 신속한 악용 관련 보고서는 왜 이 작업이 완전히 수동 처리로 돌아갈 수 없는지를 설명한다. 해당 악용 조사 결과는 방어자들이 종종 계속 줄어드는 대응 시간 창 안에서 활동한다는 점을 보여준다.

따라서 바람직한 결과는 자동화 축소가 아니다. 권고가 사람이나 시스템을 움직이기 전에 그 근거를 검토할 수 있는 자동화다.

보안 리더에게 실질적인 대응은 AI를 사용하는 모든 외부 가이드라인 출처를 목록화하는 것이다. 모델이 계산, 해석, 순위 지정 또는 실행 중 무엇을 하는지 물어야 한다. 각 역할은 서로 다른 실패 경로를 만들기 때문이다.

그런 다음 벤더의 검토 주장을 한 가지 어려운 질문으로 검증하라. 생성된 초안에 한 번도 나타나지 않은 취약점은 이 프로세스가 어떻게 탐지하는가?

답이 누락된 무언가를 사람이 알아차리는 데 의존한다면, 통제는 불완전하다. 출처 대조, 예외 처리, 기록된 인간 의사결정이 포함된다면 워크플로는 더 신뢰할 만하다.

Ivanti AI 보안 가이드라인은 이제 이 논의를 위한 공개 사례 연구를 제공한다. Claude skill은 상당한 분석가 시간을 절약했지만, 개발 과정에서 세부 정보를 지어냈고 회사는 이러한 실패를 고려해 설계해야 했다.

이 공개가 자동적인 신뢰를 얻어야 하는 것은 아니지만, 주목할 가치는 있다. 고객에게는 검토할 구체적인 약점을 제공하고, 경쟁사에는 뛰어넘을 수 있는 투명성 기준을 제시한다.

다음 AI 지원 보안 브리핑에 의존하기 전에 모델의 역할, 출처 완전성 점검, 검토자의 실제 업무를 물어보라. 그 답은 어떤 헤드라인 정확도 점수보다 더 많은 것을 드러낼 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page