top of page

Amazon Google 보안 추진, AI 버그 현실 점검에 직면

Amazon Google 보안 파트너들은 냉혹한 경고를 중심으로 한 AI 방어 경쟁에 합류했지만, 조사 대상 취약점 중 실제 환경에서 악용된 비율은 1.3%에 불과했다.

이 수치는 VulnCheck가 공개적으로 AI 지원 발견으로 분류된 1,061건을 분석해 도출했다. 연구진은 이 발견들을 통제된 환경 밖에서 관측된 공격 증거와 대조했다.

이 결과는 Anthropic의 Project Glasswing을 둘러싼 Amazon Google 보안 캠페인의 핵심 가정에 도전한다. AI는 결함을 빠르게 찾아낼 수 있지만, 발견 자체가 곧바로 효과적인 공격으로 이어지는 것은 아니다.

Anthropic은 여전히 긴급 대응이 필요하다는 강력한 근거를 제시한다. Claude Mythos Preview 시스템은 오픈소스 프로젝트를 스캔하면서 23,019건의 취약점 후보를 식별했다. 회사는 이 가운데 6,202건이 높음 또는 심각도 등급을 받을 만하다고 추정했다.

이처럼 막대한 수치는 AI가 생성한 익스플로잇이 곧 대량으로 쏟아질 것이라는 전망을 형성해 왔다. 그러나 현재 공개 기록은 다른 전환 과정을 보여준다.

AI는 사람이 검증, 공개, 패치, 우선순위 지정을 수행할 수 있는 속도보다 더 빠르게 잠재적 보안 발견을 늘리고 있다. 공격자는 기술적 약점을 신뢰할 수 있는 작전으로 전환하는 더 어려운 과제에 여전히 직면한다.

이 차이는 방어자가 집중해야 할 지점을 바꾼다. 당장의 문제는 단순히 AI가 더 많은 버그를 찾는다는 데 있지 않다. 보안팀이 늘어나는 머신 생성 증거 속에서 중요한 노출을 가려내야 한다는 데 있다.

악용 데이터가 이야기를 바꾼다

AI 지원 발견은 취약점 수를 늘렸지만, 관측된 악용률을 높이지는 않았다.

VulnCheck는 Project Glasswing과 Berkeley Vulnerability Research Initiative에 귀속된 취약점 1,061건을 조사했다. 이후 이를 자사의 Known Exploited Vulnerabilities 데이터베이스와 비교했다.

회사는 실제 환경에서의 악용이 확인된 취약점 14건을 발견했다. 공개된 악용 분석에 따르면, 이는 검토 그룹의 1.3%에 해당한다.

VulnCheck는 이 비율이 더 광범위한 취약점 데이터세트의 비율과 거의 동일하다고 밝혔다. 따라서 AI가 발견한 결함은 전통적 방식으로 발견된 결함보다 악용될 가능성이 더 높아 보이지 않았다.

이 비교가 중요한 이유는 취약점 발견과 악용이 서로 다른 역량을 측정하기 때문이다. 스캐너는 예상된 보안 경계를 위반할 수 있는 코드 동작을 식별한다.

작동하는 익스플로잇은 실질적인 조건에서 그 동작을 유발해야 한다. 흔히 완화 조치를 우회하고, 가치 있는 시스템에 도달하며, 대상 구성 전반에서 안정적으로 작동해야 한다.

실제 공격자들은 경제성도 평가한다. 이들은 접근권, 개발 시간, 노출 위험, 이용 가능한 대상, 그리고 확보할 수 있는 데이터나 제어권의 가치를 고려한다.

많은 결함은 이 기준을 통과하지 못한다. 일부는 로컬 접근, 특이한 구성 또는 공격자가 이미 보유해야 하는 권한을 요구한다. 다른 일부는 유용한 제어권을 제공하지 못한 채 충돌만 일으킨다.

취약점은 기술적으로 유효한 상태를 유지하면서도 운영상 가치는 거의 없을 수 있다. 심각도 점수만으로 범죄자들이 이를 무기화하는 데 투자할지 설명할 수는 없다.

Project Glasswing에서는 이 구분이 특히 중요하다. Anthropic은 Mythos Preview가 1,000개가 넘는 오픈소스 프로젝트에서 23,019건의 후보를 만들어냈다고 밝혔다.

VulnCheck가 검토한 공개 데이터에서 Project Glasswing 발견 중 공개된 Common Vulnerabilities and Exposures 기록이 된 것은 126건에 불과했다. 실제 환경에서 악용이 확인된 사례는 단 한 건이었다.

이보다 좁은 비교가 나머지 후보들이 무해하다는 것을 증명하지는 않는다. 조정된 공개 절차는 소프트웨어 유지관리자가 패치를 배포할 수 있을 때까지 일부 세부 정보를 의도적으로 비공개로 유지한다.

다만 후보 수가 검증된 취약점 결과를 대체할 수 없다는 점은 보여준다. 더구나 얼마나 많은 발견이 신뢰할 수 있는 공격 도구가 되었는지를 측정할 수도 없다.

VulnCheck 연구원 Patrick Garrity는 현재의 영향이 실제적이지만 제한적이라고 설명했다. 그는 AI가 발견한 취약점이 전통적 방식으로 발견된 취약점보다 본질적으로 더 악용하기 쉬운 것은 아니라고 주장했다.

이 발견은 중요한 분모 문제도 드러낸다. Project Glasswing의 후보 총수에는 최고 등급의 발견뿐 아니라 중간 및 낮은 심각도의 이슈도 포함된다.

공개 CVE 수는 더 나중 단계에 해당한다. 이러한 기록은 일반적으로 검증, 조정, 그리고 영향을 받는 제품과 약점을 기술할 충분한 기술적 명확성을 요구한다.

확인된 악용은 이보다도 더 높은 기준을 요구한다. 누군가가 실제 표적을 상대로 해당 취약점을 실제로 사용했다는 신뢰할 수 있는 증거가 필요하다.

이런 단계를 단서 없이 비교하면 오해를 낳는다. 각 단계가 서로 다른 증거를 걸러내기 때문에, 대규모 후보 풀이 매우 적은 악용 건수와 공존할 수 있다.

따라서 1.3%라는 비율은 안전 신호가 아니라 현실 점검이다. AI는 발견의 공급을 바꿨지만, 평균적인 운영 가치를 바꾸기 전이라는 뜻이다.

Amazon Google 보안 파트너들에게는 여전히 신속히 움직일 이유가 있다

낮은 관측 악용률이 Amazon Google 보안팀과 다른 Project Glasswing 파트너들이 직면한 위험을 없애지는 않는다.

Anthropic은 선정된 방어자들에게 Claude Mythos Preview에 대한 조기 접근 권한을 제공하기 위해 Project Glasswing을 도입했다. 초기 참가자에는 Amazon Web Services, Google, Apple, Microsoft, Cisco, Nvidia 및 기타 인프라 제공업체가 포함됐다.

이 프로젝트는 약 50개 파트너로 시작했다. Anthropic은 이후 15개국 이상에서 약 150개 추가 조직으로 접근 권한을 확대하고 있다고 밝혔다.

참가자들은 비슷한 역량이 널리 제공되기 전에 Mythos Preview를 이용해 내부 및 오픈소스 코드를 검사한다. Anthropic은 이를 비대칭적 방어 우위라고 부른다.

회사의 우려는 명확하다. AI 시스템은 인간 연구팀이 수동으로 조사할 수 있는 것보다 훨씬 많은 코드 경로를 검사할 수 있다.

미래의 공격자는 조정된 공개 규칙을 따르지 않고도 같은 규모를 적용할 수 있다. 또한 명확한 상업적 표적이 있는 인터넷 노출 소프트웨어에 스캔을 집중할 수도 있다.

현재의 악용률은 모든 비공개 활동이 아니라 공개 증거를 설명한다. 범죄 집단은 성공적인 제로데이 작전을 신뢰성 있게 발표하거나 기술적 방법을 공개하지 않는다.

따라서 확인된 악용 건수는 일부 활동을 과소평가하게 된다. 발견이 대응 조치 기간 동안 기밀로 유지될 때 불확실성은 더 커진다.

최근 사건은 AI 지원 공격 작업이 더 이상 벤치마크에만 국한되지 않음을 보여준다. Google은 범죄자들이 알려지지 않은 소프트웨어 취약점을 식별하는 과정에서 AI 모델을 사용한 것으로 보이는 활동을 차단했다고 보고했다.

방어자들이 개입했기 때문에 이 작전으로 보고된 피해는 없었다. 그러나 이 사례는 범죄 행위자들이 실제 취약점 워크플로에 AI를 시험하고 있었다는 증거를 제공했다.

실험과 확장 가능한 악용 사이의 격차는 여전히 크다. 탐지된 작전 한 건이 공격자들이 전체 과정을 자동화할 수 있음을 입증하지는 않는다.

그렇다고 방어자들이 악용 통계가 오를 때까지 대비를 미룰 수는 없다. 공개 확인은 대개 침해, 포렌식 조사 또는 공급업체 공개 이후에야 이뤄진다.

Amazon은 다른 운영 관점에서 같은 문제에 접근한다. RuleForge 시스템은 취약점 정보와 개념 증명 코드를 탐지 규칙으로 변환한다.

Amazon은 이 시스템이 규칙 생성 생산성을 336% 향상했다고 밝혔다. 별도의 평가기는 진양성 탐지를 유지하면서 오탐을 67% 줄였다.

이러한 주장은 독립 벤치마크가 아닌 Amazon 자체의 RuleForge 결과에서 나온 것이다. 그럼에도 이 아키텍처는 방어자가 발견을 넘어 AI를 활용할 수 있는 방식을 보여준다.

RuleForge는 수집, 생성, 평가, 검증 작업을 전문 에이전트들 사이에 나눈다. 사람 검토자는 배포 전 규칙 승인에 대한 책임을 계속 가진다.

이 워크플로는 공개된 취약점과 운영 가능한 방어 사이에 놓인 빠진 중간 단계를 겨냥한다. 버그를 찾았다고 해서 자동으로 텔레메트리, 탐지, 패치 또는 배포 지침이 만들어지는 것은 아니다.

Google은 CodeMender와 Gemini 3.5 Flash Cyber를 통해 더 빠른 발견과 개선 조치를 추구하고 있다. 이 특화 모델은 대규모 코드베이스 전반에서 취약점을 찾아 검증하고 패치하도록 설계됐다.

Google은 해당 모델이 V8 평가에서 고유한 확인 이슈 55건을 찾아냈다고 밝혔다. 보고된 구성에서 Mainline Gemini는 47건, Claude Opus 4.6은 36건을 발견했다.

모델 구성과 안전 정책이 다르기 때문에 제공업체 벤치마크는 신중하게 해석해야 한다. Google도 일부 경쟁사 결과가 자체 보고된 것이라고 지적한다.

그럼에도 방향은 분명하다. 주요 기술 기업들은 스캔을 검증 및 복구와 연결하는 시스템을 구축하고 있다.

1.3%의 악용률이 이러한 투자를 무효화하지는 않는다. 대신 그 근거를 버그 수 집계에서 신뢰할 수 있는 증거와 배포된 방어 사이의 시간 단축으로 옮긴다.

발견은 저렴해졌지만, 악용은 여전히 사슬로 남아 있다

핵심적인 변화는 AI가 발견 병목을 약화시켰지만 악용 병목을 제거하지는 못했다는 점이다.

현대 코드베이스에는 수백만 줄의 코드, 외부 의존성, 오래된 인터페이스, 문서화되지 않은 가정이 포함된다. AI 에이전트는 이 검색 공간을 나누고 많은 가설을 병렬로 검증할 수 있다.

Anthropic은 독립 보안 기업들이 자사 오픈소스 스캔에서 나온 높음 또는 심각 후보 1,752건을 평가했다고 보고했다. 이 가운데 1,587건은 유효한 진양성이었다.

90.6%의 검증률은 검토된 하위 집합에서 시스템이 무작위 잡음 이상의 결과를 냈음을 시사한다. 검토자들은 1,094건을 높음 또는 심각도 이슈로 확인했다.

이 결과는 Anthropic의 발견 주장을 뒷받침한다. 다만 검토되지 않은 나머지 모든 후보가 같은 비율로 전문가 분석을 통과할 것이라는 점까지 입증하지는 않는다.

또한 확인된 결함이 공격자에게 동일한 수준으로 유용하다는 것을 보여주지도 않는다. 악용은 더 길고 예측하기 어려운 사슬에 달려 있다.

첫째, 공격자는 취약한 구성 요소를 이해하고 도달 가능한 표적이 이를 사용하는지 판단해야 한다. 영향을 받는 코드 경로가 비활성화된 상태라면 라이브러리 결함의 가치는 거의 없다.

둘째, 공격자는 필요한 입력을 제어해야 한다. 일부 버그는 공개 요청을 통해 도달할 수 있지만, 다른 버그는 인증이나 로컬 실행을 요구한다.

셋째, 악용은 가치 있는 효과를 만들어야 한다. 서비스를 충돌시키는 것은 코드 실행, 자격 증명 탈취 또는 신뢰 경계 침범과 크게 다르다.

넷째, 익스플로잇은 소프트웨어 버전과 배포 설정 간 차이를 견뎌야 한다. 불안정한 기법은 유용한 접근을 제공하기 전에 공격자를 노출시킬 수 있다.

마지막으로 공격자는 익스플로잇을 작전에 통합해야 한다. 여기에는 인프라, 표적 선정, 지속성, 권한 상승, 증거 제거 방법이 필요하다.

AI는 모든 단계를 지원할 수 있지만, 지원이 자율성과 같은 것은 아니다. 모델은 환경 세부 사항이 바뀌면 실패하는 그럴듯한 코드를 생성할 수 있다.

모델은 신뢰도 보정에도 어려움을 겪는다. Amazon은 별도의 판정기가 출력을 평가하기 전까지 자사의 규칙 생성 모델이 거의 모든 후보를 긍정적으로 평가한다는 사실을 발견했다.

같은 경향은 취약점 연구에도 영향을 미친다. 모델은 경로를 불가능하게 만드는 조건을 놓친 채 경고할 만한 경로를 설명할 수 있다.

Anthropic은 독립적인 검증을 통해 그 약점을 해결하려 했다. Anthropic이 보고한 진양성률은 신중하게 설계된 도구와 전문가 검토가 상당한 수준의 노이즈를 통제할 수 있음을 시사한다.

그러나 이 검토 과정은 새로운 처리 용량 한계를 만든다. 중대한 발견 사항마다 재현, 영향 분석, 유지관리자와의 소통, 수정, 배포 테스트가 필요하다.

Anthropic은 심각도 높음 또는 치명적 Mythos 발견 사항을 패치하는 데 평균 2주가 걸린다고 밝혔다. 일부 유지관리자는 충분한 검토 역량이 없다며 공개 속도를 늦춰 달라고 회사에 요청했다.

바로 이 지점에서 보안 부담이 이동한다. 기계 기반 발견은 대기열을 늘리지만, 그 대기열이 더 안전한 소프트웨어로 전환되는 속도는 여전히 인간 조직이 결정한다.

오픈소스 프로젝트는 가장 뚜렷한 불일치에 직면한다. 널리 사용되는 패키지도 수백 건의 복잡한 비공개 보고서를 처리할 수 없는 소규모 팀에 의존하는 경우가 많다.

엔터프라이즈 팀은 자체 저장소에 대해 더 나은 통제권을 갖는다. Anthropic은 Claude Security 사용자가 제품 출시 후 첫 3주 동안 2,100건이 넘는 취약점을 패치했다고 밝혔다.

이 주장은 소유권과 배포 접근성이 개선 기간을 단축할 수 있음을 시사한다. 다만 해당 발견 사항이 얼마나 심각했는지, 제안된 패치 중 얼마나 많은 수가 수정이 필요했는지는 보여주지 않는다.

따라서 이 메커니즘은 성숙한 엔지니어링 프로세스를 갖춘 조직에 유리하다. 팀이 이미 자산, 담당자, 종속성, 배포 경로를 파악하고 있을 때 AI는 작업을 가속할 수 있다.

자산 인벤토리가 취약한 조직은 어떤 시스템이 중요한지 모른 채 더 많은 발견 사항을 받게 된다. 그 결과 백로그가 커지고 실제 위협에 대한 대응은 느려질 수 있다.

실제 위험은 트리아지와 패치 역량의 부족이다

AI 기반 취약점 발견은 발견 건수가 검증 및 개선 역량보다 빠르게 증가할 때 위험해진다.

보안 프로그램은 이미 수천 건의 스캐너 결과, 종속성 경고, 구성 경고, 침투 테스트 발견 사항을 관리하고 있다. AI는 더 큰 규모와 불확실한 보정 수준을 가진 또 하나의 원천을 추가한다.

기계가 생성한 모든 발견 사항을 긴급하게 취급하는 팀은 검토 인력을 소진하게 된다. AI 결과물을 노이즈로 치부하는 팀은 드물지만 영향이 큰 공격 경로를 놓칠 수 있다.

이는 정확도 문제를 만든다. 방어자는 기술적 심각도, 접근 가능한 자산, 공격자의 관심, 신뢰할 수 있는 악용 증거가 결합된 소수의 사례를 식별해야 한다.

전통적인 심각도 점수는 이 판단의 일부만 다룬다. 격리된 테스트 시스템의 치명적 결함은 외부에 노출된 게이트웨이의 더 낮은 등급 결함보다 당장의 위험이 작을 수 있다.

위협 인텔리전스는 활발한 스캔, 공개된 익스플로잇 코드, 범죄자들의 논의, 관측된 공격에 관한 증거를 더한다. 자산 맥락은 취약한 구성요소가 가치 있는 서비스 내부에 존재하는지 보여준다.

가장 강력한 워크플로는 이러한 신호를 결합한다. 중복되는 발견 사항을 제거하고, 도달 가능성을 검증하며, 엔지니어에게 작업을 전달하기 전에 담당자를 지정한다.

Google의 위험 기반 취약점 청사진은 취약점 심각도, 자산 중요도, 현재 위협 증거를 함께 고려할 것을 권고한다.

이 모델은 원시적인 발견 건수의 핵심 약점을 해결한다. 가장 긴 목록을 만든 도구에 보상하는 대신, 어떤 발견 사항을 먼저 조치해야 하는지를 묻는다.

VulnCheck 수치도 이 접근법을 뒷받침한다. 2026년 상반기 동안 이 회사는 전체 소프트웨어 시장에서 이미 악용된 것으로 알려진 취약점 495건을 식별했다.

콘텐츠 관리 시스템은 이 사례의 약 3분의 1을 차지했다. 네트워크 엣지 장비 역시 여전히 흔한 표적이었다.

이러한 제품은 접근 가능하고 널리 배포되어 있으며 초기 침투에 가치가 있기 때문에 공격자를 끌어들인다. 이들의 악용 경제성은 종종 잘 알려지지 않은 내부 구성요소보다 높다.

보안 책임자는 AI 결과를 패치 지연의 허가로 해석해서는 안 된다. 대신 세 개의 별도 대기열을 구분해야 한다.

첫 번째 대기열은 확인된 실제 악용 사례를 다룬다. 위협이 이미 존재하므로 이러한 결함은 즉각적인 격리, 탐지, 개선이 필요하다.

두 번째는 신뢰할 수 있는 악용 경로가 있는, 검증되고 도달 가능한 취약점을 다룬다. 관측된 공격이 없더라도 팀은 이를 신속히 패치해야 한다.

세 번째는 검증되지 않은 후보 또는 도달할 수 없는 자산의 발견 사항을 다룬다. 이들도 검토가 필요하지만, 증거에 근거한 위협을 밀어내서는 안 된다.

이 구조는 발견 급증으로 모든 이슈가 하나의 심각도 범주로 평준화되는 일을 막는다. 또한 유지관리자에게 공개 일정 협상에 활용할 수 있는 방어 가능한 근거를 제공한다.

낮은 악용 비율 뒤에는 또 다른 위험이 있다. 비율이 안정적으로 유지되더라도 절대 건수는 크게 증가할 수 있다.

AI가 유효한 취약점을 10배 더 찾아낸다면, 일정한 악용률도 악용 사례를 10배 더 만들어 낸다. 백분율은 이러한 규모 효과를 가릴 수 있다.

검토된 데이터 역시 초기 기간을 반영한다. 공격자가 새로운 도구를 채택하고, 신뢰할 수 있는 하네스를 구축하며, 이를 정찰 시스템에 통합하려면 시간이 필요하다.

Anthropic의 가장 강력한 사이버 모델에 대한 공개 접근은 여전히 제한되어 있다. 이 제한은 현재의 악용 데이터가 광범위한 오용에 대해 무엇을 보여줄 수 있는지를 줄인다.

Anthropic은 일반적인 Mythos 접근을 위한 충분히 강력한 안전장치를 아직 만들지 못했다고 인정한다. 회사는 통제된 방어 프로그램을 확대하는 한편 배포를 제한하고 있다.

이 접근은 즉각적인 노출을 줄이지만 측정 과제를 만든다. 제한된 모델로는 일반적인 범죄 집단이 동등한 역량을 갖게 될 경우 어떻게 행동할지 드러낼 수 없다.

따라서 회의적인 결론은 좁게 유지되어야 한다. 현재 증거는 AI가 발견한 취약점이 본질적으로 악용될 가능성이 더 높다는 점을 보여주지 않는다.

미래 시스템이 같은 비율을 유지할 것이라는 점도 입증하지 못한다. 또한 기존 악용 사례가 모두 발견되었거나 공개적으로 귀속되었다고 보장할 수도 없다.

가장 강력한 정책 대응은 공황도 안일함도 아니다. 고급 사이버 모델에 대한 접근이 확대되기 전에 규모 확장이 가능한 검증 및 패치 시스템을 구축하는 일이다.

Google의 특화 모델은 역량의 상한을 높인다

Google의 최신 사이버 모델은 오늘날의 안심할 만한 악용률이 영구적인 전망이 될 수 없는 이유를 보여준다.

Gemini 3.5 Flash Cyber는 취약점 발견, 검증, 패치 생성을 위해 미세 조정된 경량 모델이다. Google은 정부기관과 신뢰할 수 있는 파트너에게 CodeMender를 통한 제한적 접근을 제공할 계획이다.

이 모델의 설계는 더 큰 범용 모델을 한 번 호출하는 방식에 의존하기보다, 반복적이고 비용이 낮은 탐색을 강조한다. 여러 에이전트가 발견 사항을 결합하기 전에 코드 경로를 검사한다.

Google은 이 접근법이 하나의 분석 단계로는 탐색 공간을 감당할 수 없는 복잡한 저장소에 적합하다고 말한다. 또한 커밋과 릴리스 중 빈번한 스캔을 지원한다.

회사는 더 눈에 띄는 내부 테스트 결과를 보고했다. Gemini 3.5 Flash Cyber는 Google Cloud 시스템을 검사해 2시간 안에 공개 API의 원격 코드 실행 결함을 발견했다.

Google은 이 모델이 민감한 프로덕션 서비스에서 메모리 손상 문제도 발견했다고 밝혔다. 이후 테스트된 조건에서 완전히 신뢰할 수 있는 익스플로잇을 생성했다.

Google의 사이버 모델 결과에 따르면, 해당 익스플로잇은 Address Space Layout Randomization 및 Write XOR Execute 보호를 우회했다.

Address Space Layout Randomization은 공격을 어렵게 만들기 위해 메모리 위치를 변경한다. Write XOR Execute는 메모리가 동시에 쓰기 가능하고 실행 가능해지는 것을 막는다.

두 제어를 모두 우회하려면 의심스러운 소스 코드를 식별하는 것 이상이 필요하다. 이는 시스템을 더 어려운 검증 및 익스플로잇 개발 단계에 가깝게 만든다.

이 결과는 통제된 방어 프로그램 안에서 회사가 보고한 시연에 머문다. Google은 영향을 받은 시스템이나 외부 재현에 충분한 세부 정보를 공개하지 않았다.

그럼에도 익스플로잇이 현 모델의 범위를 벗어난다는 안심할 만한 주장을 약화시킨다. 더 적절한 결론은 익스플로잇 역량이 제약된 조건에서 불균등하게 존재한다는 것이다.

Google에는 또 다른 특별한 이점도 있다. 보안 팀은 내부 코드, 프로덕션 맥락, 과거 퍼징 결과, 상세한 취약점 데이터베이스에 접근할 수 있다.

이 정보는 외부 공격자가 얻을 수 있는 것보다 에이전트에 더 나은 근거를 제공한다. 또한 회사가 실제 시스템을 기준으로 모델 출력을 검증하는 데 도움이 된다.

공격자는 다른 장점을 지닌다. 노출된 제품에 집중하고, 유출된 소스 코드를 재사용하며, 패치를 분석하고, 더 높은 실패율을 감수할 수 있다.

공격 캠페인은 모든 발견 사항을 이해할 필요가 없다. 충분히 가치 있는 표적을 상대로 신뢰할 수 있는 하나의 경로만 있으면 된다.

이 비대칭성은 VulnCheck의 발견에도 Amazon Google 보안 노력이 여전히 관련성을 지니는 이유를 설명한다. 업계는 현재의 공격만 측정하는 것이 아니라 역량 확산에 대비하고 있다.

Project Glasswing은 Mythos 수준의 시스템이 일반적으로 접근 가능해지기 전에 선택된 조직이 핵심 소프트웨어를 강화할 시간을 제공한다. Google도 유사한 제한적 공개 접근법을 취하고 있다.

그러나 통제된 접근이 전체 전략이 될 수는 없다. 오픈 모델, 특화 도구, 개선된 에이전트 프레임워크는 계속해서 역량 격차를 좁힐 것이다.

따라서 방어자는 노출을 지속적으로 줄이는 시스템이 필요하다. 취약한 코드가 프로덕션에 도달한 뒤 또 하나의 경고를 추가하는 것보다, 릴리스 전에 스캔하는 편이 더 큰 가치를 제공한다.

자동화된 패치 제안은 개선 기간을 단축할 수 있지만, 인간은 인증, 메모리 처리, 암호화, 신뢰 경계에 영향을 주는 변경 사항을 검토해야 한다.

승리하는 방어 아키텍처는 모델 기반 발견을 재현 가능한 증거와 연결한다. 이어 그 증거를 테스트된 패치, 배포 책임, 공격 텔레메트리와 연결한다.

이는 취약점 수를 세는 것보다 더 까다로운 기준이다. 동시에 측정 가능한 보안 결과와 가장 밀접하게 연결된 기준이기도 하다.

균형이 이동하는지 보여줄 세 가지 신호

다음 단계는 악용 증거, 개선 처리량, 특화 사이버 모델에 대한 접근을 통해 측정될 것이다.

첫 번째 신호는 AI에 귀속된 취약점이 알려진 악용 카탈로그에 진입하는 비율이다. VulnCheck의 현재 1.3% 결과는 유용한 초기 기준선을 설정한다.

전체 취약점 비율을 지속적으로 웃도는 증가는 AI가 유난히 매력적인 표적을 만든다는 주장을 강화할 것이다. 안정적인 비율은 발견량 해석을 뒷받침할 것이다.

여기서 귀속의 품질이 중요하다. 연구자들은 AI가 발견한 취약점과 인간 또는 기존 스캐너가 약점을 찾은 뒤 AI로 개발한 익스플로잇을 구분해야 한다.

이들은 정책상 의미가 서로 다른 역량이다. 부정확한 라벨링은 증거가 허용하는 범위보다 논쟁의 어느 쪽이든 더 강해 보이게 만들 수 있다.

두 번째 신호는 Project Glasswing의 공개 개선 원장이다. 독자는 얼마나 많은 후보가 검증된 권고문, 패치, CVE, 또는 종결된 오탐으로 이어지는지 지켜봐야 한다.

Anthropic의 Glasswing 업데이트는 검토된 일부 사례에서 강력한 검증 결과를 보고했다. 그러나 전체 후보 백로그는 공개 CVE 수보다 여전히 훨씬 많았다.

더 빠른 패치율은 공개 및 개선 시스템이 발견 속도를 따라잡고 있음을 보여줄 것이다. 백로그가 확대되면 인간의 처리 역량이 주요 보안 제약이 되었다는 점을 확인하게 될 것이다.

패치 품질은 수량만큼 중요하다. 성급한 수정은 회귀를 초래하거나, 대체 공격 경로를 열어 두거나, 공격자가 익스플로잇을 재구성할 수 있을 만큼 충분한 정보를 공개할 수 있다.

따라서 연구자들은 패치 공개뿐 아니라 배포와 검증도 추적해야 한다. 수정은 유지관리자가 릴리스하고 운영자가 설치한 뒤에야 사용자를 보호한다.

세 번째 신호는 Mythos, Gemini Flash Cyber 또는 유사한 특화 모델에 대한 접근성이 확대되는지 여부다. Anthropic과 Google은 현재 가장 민감한 기능에 대한 접근을 제한하고 있다.

접근성이 넓어지면 고도화된 사이버 에이전트가 더 큰 사용자 집단에서 어떻게 작동하는지를 처음으로 유의미하게 검증할 수 있다. 동시에 안전장치와 신원 확인에 대한 압박도 커질 것이다.

접근성이 확대되더라도 확인된 악용 사례가 늘지 않는다면, 현재의 현실 검증은 더 설득력을 얻는다. 반대로 악용이 빠르게 증가한다면 오늘의 낮은 비율은 도입 지연으로 보이게 될 것이다.

Amazon, Google 및 그 파트너들은 결과 기반의 측정치도 더 많이 공개해야 한다. 유용한 지표로는 검증된 발견 사항, 패치까지 걸린 시간, 배포된 수정 조치, 차단된 공격 등이 있다.

후보 건수는 여전히 탐색 범위를 평가하는 데 유용하다. 하지만 보안 프로그램이 실제 위험을 줄였는지 측정하기에는 충분하지 않다.

개발자에게 주는 교훈은 AI 보안 도구에 재현 가능한 증거를 요구해야 한다는 점이다. 발견 사항에는 영향을 받는 코드, 도달 가능한 조건, 영향 범위, 그리고 검증 가능한 수정 방안이 포함되어야 한다.

엔터프라이즈 구매자에게는 기존 자산 및 워크플로와의 통합이 우선이다. 담당 주체나 맥락 없이 경고만 더 많이 생성하는 도구는 운영 위험을 높일 수 있다.

오픈소스 유지관리자에게는 공개 시점 조절과 자금 지원을 받는 검토 역량이 더 큰 관심을 받아야 한다. 이제 AI 시스템은 자원봉사자 커뮤니티가 감당할 수 있는 속도보다 훨씬 빠르게 작업을 만들어낼 수 있다.

Amazon과 Google의 보안 연합은 신빙성 있는 미래의 위협에 대응하고 있다. 그러나 현재의 증거는 즉각적인 위기가 자동화된 대규모 악용이 아니라 과부하 상태의 방어 파이프라인임을 보여준다.

이 구분은 투자, 제품 설계, 정책 수립에 반영되어야 한다. 팀에는 우선순위가 없는 경고를 줄이고, 발견부터 수정까지 이어지는 검증된 경로가 더 많이 필요하다.

향후 몇 달 동안 악용 비율, 패치 적체, 특화 모델 접근성을 주시해야 한다. 이 신호들을 함께 보면 AI가 공격의 경제성을 바꾸는지, 아니면 주로 발견량만 늘리는지를 알 수 있다.

모든 보안 팀이 던져야 할 실질적인 질문은 간단하다. 더 큰 대기열이 중요한 발견 사항을 가리기 전에, 조직이 가장 중대한 문제를 검증하고 수정할 수 있는가?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page