top of page

Palo Alto Networks Unit 42 AI Defense, 상시 가동으로 전환… 그러나 증명은 계속되어야 한다

9월 25일
11분 분량

Palo Alto Networks는 Unit 42 AI Defense를 상시 가동 서비스로 전환해, 정기 평가를 지속적 멀티모델 공격형 테스트로 대체했다. 9월 22일 출시된 이 서비스는 기계 속도의 공격과 예정된 스캔, 수동 검토, 지연된 조치를 중심으로 운영되는 보안 프로그램 사이에서 점점 커지는 격차를 겨냥한다.

공식 명칭이 Unit 42 Continuous Frontier AI Defense인 이 서비스는 특화 AI 모델과 인간 공격 보안 전문성을 결합한다. 고객 환경이 변화함에 따라 애플리케이션, API, 클라우드 인프라, 코드 저장소, 네트워크 자산을 테스트한다. Palo Alto Networks는 이 시스템이 개별 취약점을 공격 경로로 연결해, 침입자가 중요한 시스템에 도달할 수 있는 방식을 드러낼 수도 있다고 설명한다.

이 약속으로 Palo Alto Networks는 에이전트 기반 방어 체계를 구축하는 Microsoft, CrowdStrike, Google 및 기타 보안 제공업체와의 더 광범위한 경쟁에 뛰어들게 됐다. 그러나 결정적인 경쟁은 공급업체 간의 대결이 아니다. 여전히 수동적이고 분절돼 있으며 느린 기업의 조치 프로세스와 지속적 발견 간의 경쟁이다.

Unit 42 AI Defense, 평가에서 지속적 테스트로 전환

중요한 변화는 또 하나의 AI 어시스턴트가 아니다. Palo Alto Networks는 공격 보안 테스트를 지속적 기업 서비스로 전환하고 있다.

Unit 42는 2026년 4월 원래의 Frontier AI Defense 서비스를 선보였다. 이 서비스는 특정 시점의 노출 분석과 고객 방어 체계 개선을 위한 보안 청사진 제공에 초점을 맞췄다.

새로운 지속적 테스트 서비스는 예정된 평가를 넘어 이 접근 방식을 확장한다. 기준선을 수립하고, 변화를 모니터링하며, 새 테스트를 실행하고, 발견 사항을 검증한 뒤 환경 변화에 따라 추가 테스트를 촉발한다.

Palo Alto Networks는 이 제품을 에이전틱 공격 보안 서비스라고 설명한다. 여기서 에이전틱은 소프트웨어가 텍스트 권고만 생성하는 대신 여러 단계로 이뤄진 보안 작업을 수행할 수 있음을 뜻한다.

이 서비스는 Anthropic의 Claude Mythos 5, OpenAI의 GPT-5.6-Cyber 및 오픈 웨이트 모델을 사용한다. 독자적인 오케스트레이션 계층은 Palo Alto Networks가 각 작업에 가장 적합하다고 판단한 모델로 서로 다른 작업을 라우팅한다.

이러한 역할 분담은 보안 테스트가 여러 종류의 문제를 포함하기 때문에 중요하다. 의심스러운 코드 탐지, 애플리케이션 탐색, 구성 평가, 취약점을 공격 경로로 연결하는 작업에는 각기 다른 역량이 필요하다.

그런 다음 Unit 42는 해당 모델들 주변에 인간 전문가를 배치한다. 컨설턴트들은 발견 사항을 검토하고, 취약점의 악용 가능성을 시험하며, 그 결과로 도출된 공격 경로를 바탕으로 수정 우선순위를 정한다.

이 제품은 자체 개발 및 타사 웹 애플리케이션, API, 클라우드 환경, 소스 저장소, 네트워크 자산을 포괄한다. 이러한 범위는 현대의 공격이 하나의 보안 도구 안에 머무르지 않고 경계를 넘나드는 방식을 반영한다.

취약한 웹 애플리케이션은 자격 증명을 노출할 수 있다. 그 자격 증명은 클라우드 서비스에 대한 접근을 열 수 있고, 이는 다시 민감한 데이터나 또 다른 ID 시스템에 대한 접근으로 이어질 수 있다.

첫 번째 취약점만 보고하는 스캐너는 더 큰 결과를 놓칠 수 있다. Continuous Frontier AI Defense는 연결된 경로를 모델링한 다음, 방어자가 어느 연결 고리에 먼저 주의를 기울여야 하는지 보여주는 것을 목표로 한다.

이 서비스는 코드 수준의 지침과 가상 패치 권고도 제공할 수 있다. 가상 패치는 취약한 소프트웨어 자체를 변경하지 않고 악용을 차단하는 보완 통제 수단이다.

Palo Alto Networks는 고객이 이 서비스를 별도의 가상 패치 기술과 함께 사용할 수 있다고 말한다. 공식 소프트웨어 수정안이 아직 없거나 즉시 배포할 수 없는 경우에 이 옵션은 중요하다.

회사에 따르면 이 서비스는 연간 구독을 통해 전 세계에서 제공된다. 포함되는 모델 조합은 구독에 따라 달라지지만, 모든 구성은 멀티모델 오케스트레이션 계층을 사용한다.

따라서 이번 출시는 Unit 42 서비스를 세 가지 측면에서 변화시킨다. 테스트는 지속적으로 바뀌고, 모델 선택은 동적으로 전환되며, 발견 사항은 반복적인 검증 및 조치 주기에 반영된다.

그 결과는 전통적인 취약점 스캔보다 상시 운영되는 레드팀에 더 가깝다. 기업 규모에서 실제로 그처럼 작동할지는 여전히 핵심 질문이다.

멀티모델 설계가 진정한 제품 베팅이다

Palo Alto Networks는 모델 다양성이 단일 프론티어 모델이 놓칠 수 있는 보안 취약점을 찾아낼 수 있다고 베팅하고 있다.

회사의 논리는 자체 테스트에서 확인한 한계에서 출발한다. Palo Alto Networks는 Axios에 복잡한 고객 환경에서 개별 모델 하나가 찾아낸 취약점은 40%를 넘지 못했다고 밝혔다.

Claude Mythos 5와 GPT-5.6-Cyber가 찾아낸 취약점은 10% 미만의 경우에만 겹쳤다. 이 수치는 공급업체의 테스트에서 나온 것이며, 이에 상응하는 독립 검증을 받지는 않았다.

그럼에도 보고된 격차는 이러한 아키텍처를 설명한다. 단일 모델 서비스는 해당 모델의 사각지대, 거부 패턴, 학습 한계, 선호 방식까지 그대로 물려받게 된다.

멀티모델 하니스는 관찰된 강점에 따라 작업을 배정할 수 있다. 한 모델은 소스 코드를 검사하고, 다른 모델은 실행 중인 애플리케이션을 탐색하거나 클라우드 구성을 평가할 수 있다.

오픈 웨이트 모델은 또 다른 선택지를 제공한다. 이들은 더 좁은 작업에 맞게 조정하거나, 제한형 모델과 다른 운영 제약 아래 배포할 수 있다.

독립적인 출시 보도는 지속적으로 탐색하고 수정안을 권고하는 시스템을 설명한다. 또한 개별 취약점을 실행 가능한 공격 경로로 결합하려 시도한다.

두 번째 단계가 핵심이다. 보안팀은 이미 처리할 수 있는 양보다 많은 발견 사항을 받고 있으며, 또 다른 자동화 스캐너는 위험을 줄이지 못한 채 잡음만 늘릴 수 있다.

공격 경로 검증은 더 유용한 질문을 던진다. 여러 취약점을 결합해 중요한 자산, ID 또는 관리 기능에 도달할 수 있는지를 시험한다.

Unit 42의 인간 전문가는 이 과정에 계속 참여한다. 이들의 역할은 모델 발견 사항을 검증하고, 신뢰할 수 있는 공격자 행동을 시뮬레이션하며, 그럴듯한 공격 경로와 이론적 조합을 구분하는 것이다.

이러한 인간 계층은 생성형 AI의 근본적인 문제도 다룬다. 모델은 설득력은 있지만 부정확한 설명, 불완전한 증거 또는 재현할 수 없는 절차를 생성할 수 있다.

유용한 서비스라면 반드시 증적을 보존해야 한다. 보안팀에는 영향을 받은 자산, 시험한 경로, 관찰된 동작, 증거 및 제안된 조치가 필요하다.

이 기록은 평가 이후에도 유지돼야 한다. 팀에는 발견 사항을 담당자, 과거 결정, 코드 변경, 예외 및 재테스트 결과와 연결하는 검색 가능한 지식 기반이 필요하다.

이러한 연속성이 없으면 상시 테스트는 계속 쌓여 가는 백로그가 될 수 있다. 더 많은 발견이 자동으로 더 나은 보안을 의미하지는 않는다.

Palo Alto Networks는 내부적으로, 그리고 100건이 넘는 Unit 42 고객 참여를 통해 이 접근 방식을 6개월간 테스트했다고 밝혔다. 또한 개발 및 방법론 작업에 1,700만 달러를 투자했다고 보고했다.

회사는 내부 배포 과정에서 이 서비스가 3주 만에 1년치 노출로 규정한 문제를 찾아냈다고 말한다. 이 비교는 눈에 띄지만, 발표문은 기초 기준이나 심각도 분포를 공개하지 않는다.

고객 평가에서 회사는 이전 Frontier AI Exposure Analysis가 테스트한 모든 조직에서 노출을 발견했다고 말한다. 이 발견 사항 중 37%를 높음 또는 심각 수준으로 분류했다.

Palo Alto Networks는 또한 대부분의 노출이 자체 개발 애플리케이션에서 비롯됐다고 밝혔다. 타사 애플리케이션에서 발견된 문제의 3분의 2 이상에는 알려진 Common Vulnerabilities and Exposures 식별자가 없었던 것으로 전해진다.

CVE는 문서화된 소프트웨어 취약점에 부여되는 공개 식별자다. CVE가 없다는 것은 알려지지 않은 결함, 구성 문제 또는 표준 취약점 데이터베이스 밖의 약점을 의미할 수 있다.

이러한 결과는 기존 스캐너를 넘어선 테스트의 필요성을 뒷받침한다. 하지만 얼마나 많은 발견 사항이 고유하고 재현 가능하며 궁극적으로 조치됐는지는 입증하지 않는다.

따라서 멀티모델 아키텍처는 차별화 요소이자 첫 번째 측정 과제다. 구매자는 추가 모델 범위가 오탐을 늘리지 않으면서 누락되는 위험을 줄인다는 증거를 필요로 한다.

기계 속도 보안은 모든 주요 공급업체에 압박을 높인다

Unit 42 AI Defense는 경쟁사에 자사 에이전트가 탐지 후 경고를 요약하는 데 그치지 않고 노출을 방지할 수 있음을 입증하라는 압박을 가한다.

이번 출시는 보안 기업들이 채팅 인터페이스에서 여러 시스템을 넘나들며 조사하고, 판단하고, 조치할 수 있는 에이전트로 전환하는 가운데 이뤄졌다. Palo Alto Networks는 그 전환을 공격형 노출 관리에 적용하고 있다.

Microsoft는 Project Perception을 통해 관련된 경로를 택하고 있다. 이 회사는 소프트웨어 취약점을 식별하고, 우선순위를 정하고, 패치하기 위한 사이버 특화 모델과 에이전트를 도입했다.

Microsoft는 자사 아키텍처가 더 작은 특화 모델과 더 큰 프론티어 시스템을 결합한다고 말한다. 작은 모델은 일반적인 분석을 처리하고, 큰 모델은 더 어려운 작업을 맡는다.

이 접근 방식은 Palo Alto Networks의 라우팅 전략과 닮았지만, Microsoft는 개발자, ID, 엔드포인트 및 클라우드 제품 전반에 에이전트를 통합할 수 있다. 자사의 보안 모델 플랫폼은 거버넌스와 지속적 학습도 강조한다.

CrowdStrike는 보안 운영 센터에 집중하고 있다. 이 회사의 Charlotte AI 시스템은 Falcon 플랫폼 전반에서 조사, 위협 헌팅, 관리형 대응을 위한 에이전트를 조율한다.

회사의 에이전틱 SOC 전략은 엔드포인트 텔레메트리와 운영 맥락에서 출발한다. Palo Alto Networks는 노출 발견과 공격자 시뮬레이션에 더 가까운 지점에서 시작한다.

Google Cloud 역시 위협 탐지, 조사, 클라우드 보안, 조치 워크플로에 에이전트를 내장하고 있다. 그 강점은 클라우드 맥락, 위협 인텔리전스 및 Google의 모델 포트폴리오 접근성에서 나온다.

이 제품들은 겹치는 부분이 있지만 상호 대체 가능하지는 않다. 보안 운영 에이전트는 활동을 조사하는 반면, 공격형 테스트 에이전트는 악용 가능한 취약점을 능동적으로 찾는다.

이 범주들은 결국 수렴할 가능성이 높다. 발견은 조치로 이어지고, 조치에는 검증이 필요하며, 활성화된 사고는 예방적 테스트가 놓친 노출을 드러내는 경우가 많다.

이러한 수렴은 데이터 접근을 둘러싼 경쟁 압력을 높일 것이다. 에이전트는 코드, ID, 구성, 네트워크 관계, 티켓 및 런타임 동작을 볼 수 있을 때 더 잘 작동한다.

이는 기존 기업 플랫폼을 보유한 공급업체에도 유리하게 작용한다. 이들은 모든 통합을 처음부터 구축하지 않고도 AI 발견 사항을 기존 통제, 워크플로 또는 시행 지점에 연결할 수 있다.

Palo Alto Networks는 네트워크, 클라우드 보안, 보안 운영, ID 및 사고 대응을 아우르는 제품을 보유하고 있다. Unit 42는 이 포트폴리오에 인간 전문성과 위협 인텔리전스를 더한다.

따라서 이 서비스는 컨설팅과 소프트웨어 사이의 가교 역할을 할 수 있다. 컨설턴트는 공격 경로를 검증하고, 플랫폼 제품은 탐지, 조치 또는 보완 통제를 지원할 수 있다.

그 설계는 상업적 이점을 만들지만, 동시에 회의론의 원인이기도 하다. 취약점을 발견한 공급업체가 해결책의 일부로 자사 포트폴리오 제품을 추천할 수 있기 때문이다.

고객은 증거, 조치 우선순위, 제품 추천 사이의 명확한 분리를 요구하게 될 것이다. 영향을 받은 시스템이 다른 공급업체의 제품이더라도 발견 사항은 유용해야 한다.

Palo Alto Networks는 자사 제품뿐 아니라 타사 자산도 테스트에 포함한다고 밝혔다. 구매자는 혼합 환경에서도 통합, 증거 품질, 조치 지침이 일관되게 유지되는지 확인해야 한다.

더 광범위한 압박은 보안 공급업체에만 국한되지 않는다. 사내 레드팀, 침투 테스트 기업, 취약점 관리 제공업체도 자동화된 발견을 넘어 인간 전문성이 어디에서 가치를 창출하는지 설명해야 한다.

인간 테스터는 여전히 창의성, 비즈니스 맥락, 모호한 행동에 대한 판단을 제공한다. 또한 네트워크에 연결된 에이전트가 관찰할 수 없는 사회적 프로세스와 조직적 가정도 평가할 수 있다.

AI 에이전트는 반복성, 규모, 지속성을 제공한다. 다음 분기 평가를 기다리지 않고도 의미 있는 변경이 있을 때마다 재테스트할 수 있다.

성공적인 모델은 두 강점을 결합할 것이다. 지속적인 자동화가 반복적인 기술 업무를 처리하고, 인간 전문가는 불확실한 경로, 비즈니스 영향, 더 높은 위험의 의사결정에 집중해야 한다.

지속적인 발견, 느린 조치와 충돌하다

이 서비스의 성패는 고객이 에이전트가 찾아낸 속도에 거의 맞춰 검증된 노출을 해결할 수 있는지에 달려 있다.

Palo Alto Networks는 축소되는 방어 시간을 중심으로 이 제품을 설명한다. Unit 42의 연구에 따르면 최초 접근부터 데이터 유출까지 관찰된 가장 빠른 경로는 72분으로 줄었다.

이 회사의 인시던트 대응 데이터는 750건이 넘는 고위험 조사 사례를 포괄한다. 이에 따르면 공격 속도는 전년 대비 4배 증가했다.

Unit 42는 조사한 공격의 87%가 최소 두 개의 공격 표면을 넘나들었다고도 밝혔다. 일부 인시던트는 최대 10개 전선에 걸친 활동을 포함했다.

같은 보고서에 따르면 신원 관련 취약점은 조사 사례의 89%에서 나타났다. 신원 기반 기법은 최초 접근의 65%를 차지했으며, 악용된 취약점은 22%를 차지했다.

이는 Unit 42의 대응 활동에서 나온 공급업체 자체 생성 통계다. 상당한 규모의 인시던트 집합을 설명하지만, 모든 조직이나 전체 위협 환경을 대표하지는 않는다.

이러한 단서를 고려하더라도, 정기 테스트가 왜 압박을 받는지 보여 준다. 인프라, 코드, 계정, 종속성이 매일 바뀌는 상황에서 분기별 평가는 제한적인 보호만 제공한다.

지속적인 테스트는 노출이 생긴 시점과 발견 시점 사이의 간격을 줄일 수 있다. 그러나 그 이후에 이어지는 모든 승인, 개발, 배포, 조달 절차를 독자적으로 단축할 수는 없다.

확인된 애플리케이션 결함은 여전히 엔지니어링 팀의 코드 변경을 필요로 할 수 있다. 클라우드 구성 오류는 상충하는 운영 요구사항을 가진 여러 담당자가 관여할 수 있다.

노출된 신원은 자격 증명 교체, 접근 권한 재설계, 이전 활동 조사를 요구할 수 있다. 타사 취약점에는 고객이 통제할 수 있는 해결책이 없을 수도 있다.

가상 패치는 일부 상황에서 임시 보호를 제공할 수 있다. 그러나 보완 통제에는 테스트, 모니터링, 소유권, 영구적 조치 계획이 필요하다.

이것이 이번 출시의 핵심적인 상충 관계를 만든다. 발견을 개선하는 동일한 시스템이 조치 역량이 고정된 팀을 압도할 수 있다.

따라서 보안 리더는 단순 발견 건수보다 처리량을 평가해야 한다. 관련 지표에는 검증까지의 시간, 할당까지의 시간, 완화까지의 시간, 종료 확인까지의 시간이 포함된다.

재발률도 중요하다. 다음 배포에서 사라지는 수정은 지속 가능한 보안 개선이 아니다.

또 다른 유용한 지표는 노출 기간이다. 중요한 발견 사항이 해결되지 않은 채 새 발견 사항이 쌓인다면 지속적인 발견의 가치는 제한적이다.

제품의 티켓팅 통합 기능은 증거를 기존 워크플로로 옮기는 데 도움이 될 수 있다. 통합이 올바른 팀의 소유권 수락이나 조치에 필요한 충분한 맥락 제공을 보장하지는 않는다.

각 티켓에는 영향을 받은 자산, 신뢰할 수 있는 공격 경로, 비즈니스 결과, 검증 증거, 권장 통제가 설명되어야 한다. 또한 확인된 악용 가능성과 모델 추론을 구분해야 한다.

우선순위 지정은 팀이 계획을 세울 수 있을 만큼 안정적으로 유지되어야 한다. 이해 가능한 증거 없이 위험 점수가 바뀐다면 개발자와 인프라 소유자는 해당 대기열을 신뢰하지 않을 것이다.

이 신뢰 문제는 취약점 관리에서 익숙한 문제다. 보안팀은 종종 스캐너 적용 범위를 측정하는 반면, 엔지니어링 팀은 오탐과 경쟁하는 마감일을 통해 시스템을 경험한다.

상시 테스트는 발견 사항을 지속적으로 생성할 수 있기 때문에 위험을 높인다. 구매자는 범위, 중복, 억제, 에스컬레이션, 재테스트를 위한 통제를 요구해야 한다.

또한 자율적 조치가 어디에서 멈춰야 하는지도 결정해야 한다. 패치 권고, 티켓 생성, 코드 변경, 프로덕션 트래픽 차단은 운영상 매우 다른 위험을 수반한다.

성숙한 배포 환경은 결과에 따라 권한을 설정할 것이다. 저위험 재테스트는 자동으로 실행할 수 있지만, 프로덕션 변경에는 명시적 승인과 롤백 계획이 필요하다.

결과물은 폐쇄 루프여야 한다. 발견, 검증, 할당, 조치, 재테스트, 증거 보존이다.

이 루프가 없다면 Unit 42 AI Defense는 보안 업무에서 가장 눈에 띄는 부분만 최적화할 위험이 있다. 더 빠르게 문제를 식별하면서도 더 어려운 조직적 병목은 그대로 남길 수 있다.

자율성 주장은 독립적인 증거를 필요로 한다

가장 큰 불확실성은 최첨단 모델이 취약점을 찾을 수 있는지 여부가 아니다. 허용할 수 없는 위험이나 잡음을 만들지 않고 지속적으로 운영될 수 있는지가 관건이다.

Palo Alto Networks는 여러 의미 있는 내부 결과를 공개했다. 그러나 외부인이 핵심 성능 주장을 재현할 수 있을 만큼 충분한 방법론을 공개하지는 않았다.

구매자는 단일 모델의 40% 한계치 뒤에 있는 취약점 구성을 아직 알지 못한다. 정밀도, 재현율, 오탐률, 미탐률에 대한 상세한 수치도 부족하다.

두 모델 간 중복률이 10% 미만이라는 보고는 특히 중요하다. 이는 다양성을 시사하지만, 낮은 중복률은 일관성 없는 테스트나 유효한 발견에 대한 서로 다른 정의를 반영할 수도 있다.

독립적 평가는 어느 설명이 더 지배적인지 검증해야 한다. 또한 멀티모델 시스템이 숙련된 인간 팀이나 기존 도구보다 더 의미 있는 공격 경로를 찾아내는지 테스트해야 한다.

에이전트형 보안 시스템의 벤치마킹은 정적 테스트가 빠르게 노후화되기 때문에 어렵다. 모델은 공개 테스트 데이터를 흡수할 수 있는 반면, 실제 기업 환경에는 변화하는 권한, 맞춤형 애플리케이션, 문서화되지 않은 종속성이 존재한다.

테스트 시스템 자체도 위험 요소가 될 수 있다. 공격형 에이전트는 시스템을 탐색하고, 작업을 실행하며, 증거를 수집하기 위한 도구와 접근 권한을 부여받는다.

이 접근에는 엄격한 경계가 필요하다. 에이전트는 최소 권한 원칙에 따라, 즉 할당된 작업에 필요한 권한만 받아야 한다.

모든 작업은 기록되어야 한다. 고위험 작업에는 사람의 승인이 필요해야 하며, 행동이 승인된 범위를 벗어날 경우 환경은 신속한 격리를 지원해야 한다.

미국 국립표준기술연구소는 AI 에이전트가 새로운 보안 우려를 제기한다는 광범위한 합의를 확인했다. 해당 기관의 에이전트 보안 조사 결과는 기존 사이버보안 관행이 에이전트 시스템에 맞게 조정되어야 한다고도 설명한다.

이러한 우려는 자율적인 공격형 테스트에 직접 적용된다. 프롬프트 인젝션, 손상된 도구, 오염된 저장소, 잘못 지정된 대상은 승인된 에이전트의 방향을 바꿀 수 있다.

모델은 민감한 소스 코드나 구성 데이터를 외부 서비스에 노출할 수도 있다. 구매자는 데이터 보존, 모델 접근, 지역별 처리, 학습 정책에 대해 명확한 답변을 받아야 한다.

멀티모델 설계는 이러한 질문을 더 복잡하게 만든다. 모델마다 서로 다른 데이터 처리 요구사항, 배포 경계, 운영상 제약이 있을 수 있다.

Palo Alto Networks는 인간 전문가가 발견 사항과 공격 경로를 검증한다고 밝혔다. 공개 발표는 테스트 시스템 자체의 승인 관문, 모델 격리, 고객 감사 접근, 인시던트 절차에 대해서는 상세한 내용을 덜 제공한다.

그렇다고 통제가 없다는 뜻은 아니다. 잠재 고객은 거버넌스 세부 사항을 구현 시의 각주가 아니라 제품 평가의 일부로 다뤄야 한다는 의미다.

평가한 모든 고객에게서 노출이 나타났다는 주장에도 맥락이 필요하다. 충분히 광범위한 평가는 구성 취약점, 지원되지 않는 구성요소, 발생 가능성이 낮은 문제를 찾아낼 수 있다.

심각도 라벨만으로는 비즈니스 중요도를 보여 줄 수 없다. 기술적으로 치명적인 취약점이 강력한 통제 뒤에 있을 수 있는 반면, 보통 수준의 신원 결함이 치명적인 공격 연쇄를 가능하게 할 수 있다.

검증된 경로는 고립된 심각도보다 더 나은 신호를 제공한다. 그럼에도 고객은 재현 가능한 증거와 접근 권한, 공격자 역량, 환경 상태에 관한 명시적 가정을 요구해야 한다.

또한 시스템이 파괴적 테스트를 어떻게 처리하는지 물어야 한다. 안전한 시뮬레이션은 데이터를 손상시키거나, 서비스를 중단하거나, 타사 약관을 위반하지 않으면서 악용 가능성을 입증해야 한다.

타사 애플리케이션은 또 다른 경계를 제시한다. 고객은 계정이나 통합을 통제할 수 있지만, 제공업체 인프라를 대상으로 공격적인 테스트를 수행할 권한은 없을 수 있다.

따라서 범위 관리는 자산, 작업, 시간 수준에서 이뤄져야 한다. “기업 전체”를 테스트할 수 있는 광범위한 권한은 자율 시스템에 충분히 정밀하지 않다.

이번 출시를 가장 안전하게 해석하는 방식은 신중한 평가다. Palo Alto Networks는 신뢰할 만한 아키텍처와 주목할 만한 내부 증거를 제시했지만, 독립적으로 확립된 성능 기준을 제시한 것은 아니다.

이러한 격차는 새로 출시된 서비스에서 일반적이다. 구매자가 공급업체 결과를 보편적으로 입증된 성과로 오인할 때에만 문제가 된다.

상시 방어가 효과적인지 보여 줄 세 가지 신호

다음 단계는 관련 모델 수가 아니라 조치 결과, 독립 검증, 경쟁사의 대응으로 평가되어야 한다.

첫 번째 신호는 고객의 조치 성과다. Palo Alto Networks는 고객이 지속 서비스 도입 후 검증된 공격 경로를 더 빠르게 종료하는지 공개해야 한다.

유용한 지표에는 중간값 기준 검증 시간, 완화 시간, 종료 시간, 재테스트 후 재발 여부가 포함된다. 심각도 건수만으로는 보안이 개선됐는지 보여 주지 못한다.

노출 기간의 감소는 회사의 주장을 강화할 것이다. 해결되지 않은 발견 사항의 대기열이 늘어난다면 발견 속도가 고객 역량을 앞지르고 있음을 시사한다.

두 번째 신호는 독립적인 기술 평가다. 연구자나 고객은 대표적인 애플리케이션, 클라우드 환경, 코드베이스, 신원 시스템 전반에서 멀티모델의 이점을 재현해야 한다.

이 작업은 오탐, 놓친 발견 사항, 모델별 고유 기여도, 증거 품질을 보고해야 한다. 또한 에이전트 결과를 인간 테스터 및 기존 보안 제품과 비교해야 한다.

일관된 개선은 Palo Alto Networks의 오케스트레이션 논지를 뒷받침할 것이다. 환경별로 큰 차이가 난다면 구매자에게 더 좁은 배포 기대치가 필요하다는 점을 보여 줄 것이다.

세 번째 신호는 경쟁사가 자율적 발견을 조치와 어떻게 연결하는지다. Microsoft, CrowdStrike, Google, 그리고 전문 보안 기업들은 모두 에이전트를 운영 워크플로에 더 깊이 도입하고 있다.

신뢰할 수 있는 경쟁적 대응은 지속적인 테스트, 거버넌스가 적용된 조치, 혼합 기술 환경 전반의 검증을 결합할 것이다. 또 하나의 대화형 어시스턴트로는 같은 문제를 해결할 수 없다.

경쟁 압력은 투명성도 개선할 것입니다. 구매자는 모델 동작, 권한, 데이터 처리, 인간의 감독, 그리고 개선 조치 결과에 관한 비교 가능한 근거가 필요합니다.

Palo Alto Networks는 실제 불일치를 지적했습니다. 공격자는 정찰과 익스플로잇을 자동화할 수 있는 반면, 많은 방어 조직은 여전히 예정된 평가와 수동으로 배정되는 티켓을 기다립니다.

Unit 42 Continuous Frontier AI Defense는 지속적이고 멀티모델 기반의 테스트로 이 불일치에 대응합니다. 이 아키텍처는 단일 모델만으로는 충분한 범위를 파악할 수 없으며 인간의 검증이 여전히 중요하다는 점을 인정합니다.

더 어려운 시험은 발견 이후에 시작됩니다. 기업은 공격용 에이전트가 새로운 위험을 만들지 않도록 하면서, 발견 사항을 책임 주체가 명확하고 승인받았으며 검증되고 지속 가능한 변경으로 전환해야 합니다.

Palo Alto Networks Unit 42 AI Defense를 평가하는 보안 리더는 대표 환경 하나에서 시작해 전체 개선 조치 루프를 측정해야 합니다. 검증된 경로, 오탐, 해결 완료 시간, 재발, 그리고 인간 검토에 드는 노력을 추적해야 합니다. 또한 테스트 에이전트에 부여한 모든 권한을 문서화해야 합니다.

의사결정은 데모에서 우려스러운 결함이 발견되는지에 좌우되어서는 안 됩니다. 대부분의 광범위한 평가는 결국 그러한 결함을 찾아냅니다. 결정적인 질문은 이 서비스가 유효한 발견 사항을 조직의 현재 프로세스보다 더 빠르게, 반복적으로 더 안전한 시스템으로 전환할 수 있는지입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page