Anthropic Cyber Verification Program, 접근성 확대했지만 Claude의 핵심 안전장치 제거
Anthropic은 일반적인 안전장치가 제거될 경우 복잡한 공격형 사이버 보안 작업을 수행할 수 있는 세 가지 고급 Claude 모델의 접근성을 확대했다. Anthropic Cyber Verification Program은 이제 Claude Opus 5.5, Claude Sonnet 5.5, Claude Mythos 5.1 및 향후 출시 모델까지 포괄한다. 승인된 조직은 일반 Claude 사용자가 차단되는 작업에 이들 모델을 활용할 수 있다.
이번 변경은 Anthropic이 일반 접근으로는 의도적으로 제공하지 않았던 AI 역량으로 향하는 통제된 경로를 연다. 보안팀은 악성코드를 조사하고, 취약점을 찾으며, 승인된 침투 테스트를 수행할 수 있다. 그중 더 제한된 집단은 전력망, 항공 운항, 통신, 은행, 정부 서비스와 연결된 시스템을 시험할 수 있다.
이는 단순한 제품 접근성 발표가 아니다. Anthropic은 신원 확인, 조직 통제, 모니터링 및 정부 검토가 모델 경험에 내장된 제한을 대체할 수 있는지 시험하고 있다. OpenAI도 고급 사이버 모델에 대한 단계적 접근 정책을 추진해 왔으며, 미국 정부 관계자들은 최첨단 시스템의 사용 주체를 결정하는 데 더 큰 역할을 맡고 있다.
핵심 질문은 더 이상 AI가 사이버 방어자를 지원할 수 있는지 여부가 아니다. Anthropic은 초기 파트너들이 Claude 모델과 관련 스캐닝 작업을 통해 검증된 취약점 13만4,000건 이상을 발견했다고 말한다. 더 어려운 질문은 제공업체가 공격자가 결국 악용할 수 있는 특권 경로를 만들지 않으면서 안전장치를 선택적으로 해제할 수 있는지다.
Anthropic Cyber Verification Program, 세 가지 접근 수준 개설
Anthropic은 하나의 광범위한 안전 경계를 점진적으로 더 허용적인 세 가지 접근 수준으로 대체하고 있다.
확대된 검증 프로그램은 승인된 사용자를 Defense Access, Red Team Access, Specialized Access로 구분한다. 각 수준은 서로 다른 범위의 활동을 허용하고, 상이한 자격 요건을 적용한다.
Defense Access는 사고 대응, 보안 운영, 악성코드 분석, 취약점 검증 및 방어 연구와 같은 작업을 지원한다. 적격 신청자는 기업, 대학, 비영리단체, 정부 기관, 오픈소스 유지관리자, 신뢰할 수 있는 공개 기록을 갖춘 개인 연구자를 포함할 수 있다.
이 프로그램에는 다양한 규모의 핵심 인프라 운영자도 포함된다. Anthropic은 지역 병원과 지방 공공시설 같은 조직을 구체적으로 언급한다. 회사는 합법적인 방어팀 다수가 자격을 갖출 것으로 예상하며, 며칠 안에 이들 신청에 답변하는 것을 목표로 한다고 밝혔다.
Red Team Access는 한 단계 더 나아간다. 조직이 소유하거나 시험 권한을 가진 시스템을 대상으로 한 승인된 침투 테스트와 적대적 훈련을 허용한다. 내부 레드팀, 정부팀, 보안 컨설팅 기업 및 침투 테스트 업체가 신청할 수 있다.
이 수준의 조직은 추가 자격 확인과 보안 통제를 충족해야 한다. Anthropic은 검토에 수주가 걸릴 것으로 예상한다. 회사가 더 허용적인 등급 요청을 검토하는 동안 신청자는 Defense Access를 받을 수 있다.
Red Team Access에도 여전히 한계는 있다. Claude는 물리적 피해나 광범위한 장애와 연관된 행동을 차단해야 한다. Anthropic은 랜섬웨어 배포, 물리 시스템 손상, 고위험 안전 시스템 테스트를 제한 활동으로 제시한다.
Specialized Access는 가장 많은 사이버 제한을 해제한다. 이는 실패 시 인명에 위험을 초래하거나 주요 시장을 교란할 수 있는 시스템을 시험할 권한을 가진 조직을 위해 마련됐다.
대상에는 항공 운항 시스템, 전력망, 통신 네트워크, 은행 간 이체 인프라, 정부 행정 시스템이 포함된다. Anthropic은 모든 Specialized Access 조직을 미국 정부와 함께 심층 검토한다고 밝혔다.
기존 Project Glasswing 회원은 현재 모델에 대해 새 승인을 받을 필요 없이 이 수준으로 이동한다. Project Glasswing은 Anthropic이 일부 인프라 제공업체와 보안 조직에 가장 강력한 사이버 역량에 대한 접근을 제공하기 위해 운영하는 통제된 이니셔티브다.
따라서 이 프로그램은 검증된 이메일 주소나 표준 엔터프라이즈 계약 이상의 요소에 의존한다. 모델 접근을 신청자의 신원, 기관 내 역할, 테스트 권한, 기술 통제 및 의도된 대상과 연결한다.
조직은 모니터링 조건도 수용해야 한다. Anthropic은 일반적으로 잠재적 오용을 탐지할 수 있도록 데이터 보존을 요구한다. 데이터 미보존 약정으로 Fable 5.1 또는 Mythos 5.1을 이용하던 기존 사용자는 프로그램에 가입하는 동안 일시적으로 이러한 보호를 유지할 수 있다.
Anthropic은 Enterprise Frontier Safeguards라는 또 다른 옵션을 계획하고 있다. 회사는 이 시스템이 오용 통제와 참여 조직이 관리하는 클라우드 스토리지를 결합할 것이라고 밝혔다. 이 시스템이 도입되기 전까지는 민감한 코드나 사고 증거를 다루는 팀에게 데이터 거버넌스가 여전히 중요한 절충 요소로 남는다.
가장 중요한 구분은 권한이다. 동일한 기술적 행동도 대상과 운영자의 허가 여부에 따라 방어적 검증이 될 수도, 불법 침입이 될 수도 있다. 이 프로그램은 Claude의 제한을 완화하기 전에 그러한 맥락을 확립하려 한다.
이 설계는 이 기사의 핵심 긴장을 만든다. Anthropic은 고위험 사이버 활동이 모든 사람에게 안전해졌다고 주장하지 않는다. 대신 검증된 기관은 통제된 접근 시스템 아래에서 더 강력한 역량을 받을 수 있다고 주장한다.
Claude의 사이버 역량은 이미 성과를 내고 있다
이번 확대는 고급 Claude 모델이 수개월에 걸친 취약점 작업을 훨씬 짧은 조사로 압축할 수 있다는 증거를 따른다.
Anthropic은 Project Glasswing 파트너들이 2026년 4월부터 7월 사이 최소 12만9,000건의 검증된 소프트웨어 취약점을 발견했다고 밝혔다. 별도의 오픈소스 스캐닝 작업에서는 4월부터 10월 사이 검증된 취약점 5,500건을 추가로 확인했다.
이 발견 중 3만3,000건 이상은 심각 또는 고위험 등급을 받았다. 회사는 수치에 33개 파트너의 보고서만 포함돼 있어 전체 효과가 과소평가됐을 가능성이 높다고 밝혔다.
이 데이터에는 중요한 한계도 있다. 참가자들은 발견 사항을 확인하고 분류하는 데 서로 다른 방법을 사용했다. 절반 미만이 패치된 취약점 수를 공개했으며, 이는 대개 수정 작업이 진행 중이었기 때문이다.
취약점을 발견하는 것은 이를 수정하는 것과 동등하지 않다. 보안팀은 문제를 재현하고, 심각도를 평가하며, 영향을 받는 소프트웨어를 식별하고, 유지관리자에게 통지하고, 패치를 만들고, 수정 사항을 시험한 뒤 안전하게 배포해야 한다.
모델은 발견 속도를 높일 수 있지만, 이후 단계를 관리하기는 더 어렵게 만들 수 있다. 자동화 시스템이 사람이 검증할 수 있는 속도보다 더 빠르게 발견 사항을 생성하면, 보안팀은 더 큰 분류 대기열과 더 긴 미해결 노출 기간에 직면한다.
Anthropic은 이전 Glasswing 확대 과정에서 이러한 병목을 인정했다. 회사는 검증, 공개 및 패치가 초기 취약점 발견보다 더 큰 제약이 됐다고 밝혔다.
이 압박은 더 광범위한 접근 프로그램을 설명하는 데 도움이 된다. 소수의 중앙 관리 집단만으로는 모든 병원 네트워크, 오픈소스 패키지, 결제 시스템, 공공시설 플랫폼 또는 정부 애플리케이션을 점검할 수 없다. 운영자는 자신의 환경을 이해하고 현실적인 테스트를 승인할 수 있으므로 직접 접근이 필요하다.
잠재적 이점은 소프트웨어 스캐닝을 넘어선다. 고급 모델은 공격 경로를 재구성하고, 낯선 악성코드를 분석하며, 가능한 패치를 생성하고, 방어자가 시스템을 변경한 뒤 테스트를 반복할 수 있다.
Pacific Northwest National Laboratory와의 협력은 그 작동 방식을 보여준다. 연구진은 Claude가 네트워크 환경에서 통제된 행동을 수행할 수 있도록 하는 도구와 지침의 집합인 에이전트 스캐폴드를 만들었다.
팀은 이를 활용해 정수 시설의 사이버-물리 모델을 대상으로 공격을 모사했다. Anthropic의 인프라 연구에 따르면, 이 시스템은 수주가 아닌 3시간 만에 공격을 재구성했다.
이 테스트에는 이전 모델인 Claude Sonnet 4가 사용됐다. 한 실행에서 준비된 Windows User Account Control 우회 방식이 실패했다. Claude는 실패를 감지하고 시뮬레이션 공격을 계속하기 위해 다른 알려진 기법을 선택했다.
이러한 적응력은 실제 환경이 문서화된 절차처럼 정확히 작동하는 경우가 드물기 때문에 방어자에게 가치가 있다. 동시에 접근이 위험해지는 이유이기도 하다. 실패한 단계에서 회복할 수 있는 모델은 공격자가 정적인 지침을 넘어 나아가도록 도울 수 있다.
새 프로그램은 합법적인 팀이 그러한 행동을 재현할 수 있을 만큼의 자유를 제공하는 것을 목표로 한다. 기본 코드 검토와 패치는 일반적으로 접근 가능한 Claude 모델을 통해 계속 제공된다. 더 상호작용적이고 다단계인 작업에는 실제 침입 활동과 유사하므로 검증이 필요하다.
이 경계는 계속 정의하기 어려울 것이다. 취약점 분석은 흔히 무해한 코드 검사로 시작해 익스플로잇 체인으로 발전한다. 사고 대응자는 공격자의 기법을 차단하기 전에 이를 재현해야 할 수 있다.
Anthropic의 답은 모든 요청을 텍스트만으로 판단하기보다 운영자와 대상을 평가하는 것이다. 이러한 전환은 모델 수준 필터링과 함께 신원, 거버넌스, 법적 권한을 핵심 안전 메커니즘으로 둔다.
사이버 안전장치 제거는 Claude가 완료할 수 있는 작업을 바꾼다
Anthropic의 자체 테스트는 접근 계층이 단지 불편을 줄이는 수준이 아니라, Claude가 공격 작업을 완료할 수 있는지 여부를 결정한다는 점을 보여준다.
회사는 현실적 제약 아래 다단계 사이버 작업을 계획하고 실행하는 능력을 평가하는 벤치마크인 CyScenarioBench로 Claude Opus 5.5를 평가했다. 각 접근 수준에서 10개 과제 각각에 대해 다섯 번의 시도를 수행했다.
프로그램 접근이 없을 때 Claude는 첫 프롬프트에서 모든 작업을 차단했다. 따라서 일반적으로 제공되는 경험에서는 운영자가 선의의 의도를 가졌는지와 관계없이 평가가 진행되지 못했다.
Defense Access에서는 약간 더 많은 활동이 허용됐지만, 안전장치는 완료 전 50개 시행 중 46개를 여전히 중단했다. 네 가지 작업만 성공했다. 이는 전체 공격 시뮬레이션보다 조사, 대응 및 취약점 작업을 위해 설계된 계층과 부합한다.
Red Team Access는 다른 결과를 냈다. 안전장치 차단은 발생하지 않았고, Claude는 50개 시행 중 34개를 완료했다. 68%의 완료율은 안전장치 없이 달성한 67.6% 결과와 사실상 같았다.
이 수치는 Anthropic이 무엇을 제공하는지 명확히 한다. 승인된 레드팀은 더 큰 요청 할당량을 갖춘 표준 Claude 경험을 받는 것이 아니다. 이들은 이 평가에서 제한 없는 성능에 근접하는 모델 행동에 접근할 수 있다.
Specialized Access는 안전에 민감한 시스템의 승인된 테스트를 허용함으로써 한 단계 더 나아간다. 실패한 테스트가 물리적 운영, 공공 서비스 또는 금융시장에 영향을 줄 수 있어 일반적인 레드팀 접근에도 제한이 남는 시나리오를 위한 것이다.
이 구조는 계산된 절충이다. 강력한 보편적 필터는 오용을 막을 수 있지만, 방어자가 견뎌야 할 공격을 연습하지 못하게 할 수도 있다. 이러한 필터를 광범위하게 제거하면 두 집단 모두의 접근이 늘어난다.
Anthropic은 기관 검증이 차별화 요소가 될 수 있다고 본다. Defense 사용자는 지속적인 제한이 적용되는 가운데 폭넓은 자격을 얻는다. Red Team은 더 심층적인 심사를 거치지만 차단은 더 적게 받는다. 소수의 조직은 정부와의 공동 심사를 통해 전문화된 액세스를 얻는다.
안전성 분류기는 여전히 시스템의 핵심이다. 분류기는 금지된 행동을 판별하기 위해 요청과 응답을 평가하는 별도의 모델 또는 제어 계층이다. 기반 Claude 모델이 계속 진행할 수 있는 역량이 있더라도 상호작용을 중단시킬 수 있다.
Anthropic은 이러한 제어 장치가 사이버 요청을 명백히 금지된 활동, 고위험 이중용도 작업, 저위험 이중용도 작업, 일반적인 방어 작업 등 여러 범주로 구분하는 방식을 설명해 왔다. Anthropic이 공개한 분류기 프레임워크 역시 악의적 운영자와 방어적 운영자가 때로는 거의 동일한 기법을 사용한다는 점을 인정한다.
이러한 모호성은 자동화된 필터가 프롬프트만으로 추론할 수 있는 범위를 제한한다. 지속성 확보, 자격 증명 추출, 탐지 회피를 요청하는 내용은 대상과 승인 여부에 관한 신뢰할 수 있는 정보가 없다면 위험해 보인다.
검증 프로그램은 세션이 시작되기 전에 그 누락된 맥락을 제공한다. 사용자를 승인된 조직, 액세스 수준, 계약상 의무, 모니터링, 그리고 허용된 시스템의 명확한 범위와 연결한다.
그러나 검증이 기술적 위험을 없애는 것은 아니다. 계정은 침해될 수 있다. 직원은 권한을 넘을 수 있다. 계약업체는 권한 변경이 제때 반영되지 않은 채 액세스를 잃을 수 있다. 승인된 인프라는 승인되지 않은 시스템에 연결될 수 있다.
모니터링은 의심스러운 사용을 탐지할 수 있지만, 모델이 유용한 공격 경로를 생성한 뒤에야 탐지가 이뤄질 수 있다. 속도 제한과 대상 제어는 노출 범위를 줄일 수 있으나, 숙련된 운영자는 흔히 도구와 계정에 작업을 분산한다.
이 벤치마크는 구조화된 시나리오의 일부 표본만 평가한다. 68%의 완료율은 Claude가 낯선 소프트웨어, 맞춤형 산업 장비, 또는 사회공학을 수반한 연쇄 공격에서 어떻게 작동할지를 입증하지 않는다.
Anthropic의 증거가 뒷받침하는 결론은 더 제한적이다. 액세스 제어는 등급별로 의미 있게 다른 행동을 만들어낼 수 있으며, 고급 Claude 모델은 제한이 완화될 때 다수의 사이버 작업을 완료할 수 있다.
이러한 통제가 대규모 환경에서도 신뢰성을 유지하는지는 확인되지 않았다. 지원자 풀이 초기 Glasswing 코호트를 넘어 확대될수록 이 질문은 더욱 중요해진다.
정부 심사는 보안을 더하고 권한을 집중시킨다
미국 정부는 최첨단 사이버 모델의 액세스 제어 시스템에서 단순한 외부 규제자가 아니라 구성 요소가 되고 있다.
Anthropic은 모든 Specialized Access 조직을 검토할 때 정부와 협력한다고 말한다. 이러한 체계는 공직자에게 어떤 기관이 비행 시스템, 전력망, 금융 인프라 및 기타 민감한 대상을 상대로 Claude를 사용할 수 있는지 결정하는 역할을 부여한다.
이 파트너십에는 실무적 논리가 있다. 정부 기관은 기밀 위협, 국가 인프라, 수출 통제, 규제 대상 시스템에 대한 공격이 초래할 운영상 결과를 이해한다. 또한 민간 모델 제공업체가 단독으로 평가할 수 없는 법적 권한을 확인할 수 있다.
최근 사건은 이 관계가 얼마나 발전했는지를 보여준다. 보도에 따르면 Anthropic은 미국 정보기관과 협력해 기밀 정부 시스템을 상대로 Mythos 모델을 시험했다.
한 관계자는 Associated Press에 해당 모델이 몇 시간 안에 일부 취약점을 식별했다고 말했다. 이 관계자는 취약점 식별이 Mythos가 같은 기간에 이를 실제로 악용했다는 뜻은 아니라고 강조했다.
Mark Warner 상원의원은 6월 청문회에서 이 결과를 더 극적으로 설명했다. 그는 국가안보국과 U.S. Cyber Command 수장의 설명을 인용하며, 이 시스템이 몇 시간 안에 시험 대상 기밀 환경의 거의 전부에 진입했다고 말했다.
NSA와 Anthropic은 기밀 시험의 세부 사항 확인을 거부했다. 공개된 설명 간의 차이는 광범위한 주장에 신중하게 접근해야 할 이유다.
정부 개입은 갈등도 낳았다. 6월 Trump 행정부는 최첨단 모델 출시를 국가안보 심사 대상으로 삼고 일부 Anthropic 시스템에 대한 액세스를 제한했다.
Anthropic은 외국 국적자의 액세스에 관한 지침 이후 Fable 5와 Mythos 5를 일시적으로 철회했다. 정부는 이후 일부 사이버 방어 담당자와 인프라 제공업체를 대상으로 Mythos의 제한적 배포를 승인했다.
OpenAI도 GPT-5.6 Sol에 대해 유사한 심사를 받았다. 두 회사는 처음에는 최신 시스템을 소규모 그룹에만 제한했고, 상용 AI 모델에 대한 액세스는 국가안보 정책의 사안이 됐다.
지지자들은 이례적으로 강력한 사이버 시스템에는 이례적으로 신중한 출시 절차가 필요하다고 주장할 수 있다. 모델 제공업체는 정보 위협을 완전히 파악하지 못하며, 정부 역시 관련된 모든 최첨단 모델을 독자적으로 개발할 수는 없다.
비판자들은 책임성이 더 낮은 체계를 본다. Lori Trahan 하원의원은 명확한 법률, 절차 또는 감독 구조 없이 정치 임명직 인사들이 회사별로 누가 액세스를 받을지 결정하고 있다고 주장했다.
이 비판은 확대된 Anthropic Cyber Verification Program에도 적용된다. 정부 참여는 민감한 대상에 대한 심사를 개선할 수 있지만, 기준이 완전히 공개되지 않은 절차에 권한을 집중시키기도 한다.
미국 밖의 조직에는 또 다른 우려가 있다. Anthropic은 이전에 Glasswing을 15개국 이상 파트너로 확대했으며, 그중 다수는 자국 시장을 넘어선 이용자층에 서비스를 제공했다.
핵심 소프트웨어는 세계적으로 연결돼 있다. 오픈소스 유지관리자, 클라우드 제공업체, 칩 제조사, 통신 장비 공급업체, 금융 네트워크는 일상적으로 국경을 넘는다. 한 정부의 안보 우선순위에 크게 좌우되는 시스템은 불평등한 액세스를 만들 수 있다.
따라서 가장 강력한 사이버 모델은 지정학적 관계를 통해 배분되는 전략적 자원이 될 수 있다. 이는 조직에 민간 제공업체의 규칙과 정부의 국가안보 요건을 모두 충족하라는 압박을 가할 것이다.
이 프로그램에는 명확한 이의제기 절차, 일관된 기준, 감사 가능한 액세스 철회 절차, 제외 대상에 관한 투명한 보고가 필요하다. 이러한 요소가 없으면 검증은 점점 더 중요한 방어 기술을 위한 불투명한 라이선스 체계가 될 위험이 있다.
Anthropic은 이 프로그램을 영구적인 공공정책으로 제시하지 않았다. 더 강력한 보호장치가 개발되는 동안 통제된 액세스를 가교 수단으로 설명한다. 그럼에도 임시 시스템은 이후 대체하기 어려운 운영상 선례를 만드는 경우가 많다.
방어 우위는 발견이 아니라 패치에 달려 있다
Claude가 방어자에게 우위를 제공하려면 조직이 공격자들이 같은 발견을 재현하기 전에 취약점을 수정해야 한다.
Anthropic이 밝힌 목표는 균형을 방어 쪽으로 옮기는 것이다. 인프라 운영자는 기술적 세부 사항을 공개하기 전에 자체 시스템을 점검하고, 패치를 배포하며, 사고 대응을 조율할 수 있기 때문에 이 목표는 직관적으로 들린다.
공격자에게는 다른 이점이 있다. 가장 취약한 대상을 선택하고, 성공한 기법을 재사용하며, 여러 관할권에서 활동하고, 기관의 승인 절차보다 더 빠르게 움직일 수 있다.
고급 모델은 양측을 모두 증폭시킬 수 있다. 방어자는 수백만 줄의 코드를 스캔하고 위험한 결함의 우선순위를 정할 수 있다. 공격자는 유사한 추론을 활용해 노출된 서비스에 침투할 간과된 경로를 찾을 수 있다.
누가 이득을 보는지는 시간 격차가 결정한다. 비공개로 발견돼 신속히 패치된 취약점은 보안을 개선한다. 수개월짜리 수정 대기열에 접수된 결함은 방어자가 먼저 찾았더라도 공격자에게 여전히 유용하다.
따라서 Anthropic의 취약점 총계는 완전한 방어 성과가 아니라 발견을 측정한다. 검증된 발견 134,000건 이상은 상당한 연구 산출을 보여준다. 하지만 영향을 받은 시스템 중 얼마나 많은 곳이 여전히 노출돼 있는지는 알려주지 않는다.
회사는 참여 파트너 중 절반 미만만이 패치 수치를 공개했다고 말한다. 이처럼 빠진 분모는 발견 속도가 수정 속도를 앞지르는지 독립적으로 평가하기 어렵게 한다.
대량의 자동화된 발견은 운영상 문제도 만들 수 있다. 유지관리자는 결함을 재현하고, 영향을 이해하며, 실제로 악용 가능한 문제와 이론적 약점을 구분할 만큼 충분한 증거가 필요하다.
우선순위가 부실한 보고서는 자원봉사 기반 오픈소스 프로젝트를 압도할 수 있다. 수정책이 나오기 전에 상세한 익스플로잇 정보가 너무 많은 조직을 거치면 공개 위험이 커질 수 있다.
확대된 프로그램은 지원자에게 더 큰 책임을 부여한다. 보안팀에는 취약점 관리 프로세스, 격리된 시험 환경, 액세스 로깅, 명확한 에스컬레이션 경로, 그리고 수정 배포 권한이 필요하다.
지속 가능한 기록도 필요하다. AI 지원 조사는 긴 가설 사슬, 도구 출력, 코드 변경, 의사결정을 생성할 수 있다. 검색 가능한 엔지니어링 지식 베이스는 모델의 결론을 검증된 사실로 취급하지 않으면서도 팀이 이러한 맥락을 보존하도록 도울 수 있다.
인간의 검토는 여전히 필요하다. 모델은 시스템 경계를 오해하거나, 안전하지 않은 수정안을 제안하거나, 실제 운영 조건에서는 성립하지 않는 패턴을 식별할 수 있다. 산업 시스템에는 일반적인 소프트웨어 벤치마크가 포착하지 못하는 물리적 제약도 있다.
Specialized Access는 이러한 위험을 높인다. 비행 제어 환경, 전력망 관리 시스템 또는 은행 간 네트워크에 대한 잘못된 조치는 데이터 손실을 넘어서는 결과를 낳을 수 있다.
Anthropic은 물리적 피해나 대규모 혼란을 유발할 수 있는 활동에 대해서는 하위 수준에서 실시간 제한이 계속된다고 말한다. Specialized 사용자는 업무상 그러한 시나리오를 시험해야 하는 경우가 있기에 더 적은 차단을 받는다.
따라서 이 프로그램은 조직이 겉보기에 적법한지만 판단해서는 안 된다. 대상 격리, 모델 행동 제약, 시험 감독, 실패 복구, 이상 징후 보고 역량을 평가해야 한다.
정부 심사는 이 평가를 뒷받침할 수 있지만, 운영 규율은 현장에 남아 있다. 모델 제공업체는 전력회사 연구실이나 기밀 네트워크 안의 모든 명령을 감독할 수 없다.
경쟁은 압박을 더한다. OpenAI 역시 통제된 프로그램을 통해 고급 사이버 모델을 제공하고 있다. 제공업체들이 어떤 시스템이 더 많은 공격 작업을 완료하는지로 경쟁한다면, 액세스 제한은 상업적 불이익이 될 수 있다.
안전성만으로 경쟁한다면 방어자는 차단이 적고 공격 시뮬레이션 성능이 더 좋은 모델을 선택할 수 있다. 이는 검증을 보완적 수단으로 설명하면서 통제를 완화할 유인을 만든다.
Anthropic의 계층형 구조는 이 압박을 관리하려는 신뢰할 만한 시도다. 그러나 근본적인 충돌을 해소하지는 못한다. Claude를 정교한 공격자에 맞서 유용하게 만드는 동일한 역량이 검증 실패의 결과를 더욱 중대하게 만든다.
방어 우위는 모델 벤치마크가 아니라 수정 결과에서 드러날 것이다. 발견된 취약점의 원시 수치보다 패치율, 수정 소요 시간, 재발률, 예방된 사고가 더 중요하다.
통제된 액세스의 효과를 보여줄 세 가지 신호
다음 시험대는 Anthropic이 검증을 약화시키거나 미해결 발견으로 방어자를 압도하지 않고 참여를 확대할 수 있는지다.
첫 번째 신호는 등록 품질이다. Anthropic은 많은 Defense Access 신청을 며칠 내 검토할 수 있는 반면, Red Team Access는 수주가 걸릴 수 있다고 말한다. 신원, 권한, 보안 검사가 일관되게 유지될 때에만 신속한 승인이 유용하다.
회사는 총 신청 건수, 승인 비율, 검토 기간, 철회 건수, 주요 거부 사유를 공개해야 한다. 민감한 참여자를 식별하지 않고도 시스템이 책임감 있게 확장되는지 보여줄 수 있다.
모니터링 역량이 뒷받침되지 않은 채 접근 권한만 급격히 늘어난다면 Anthropic의 주장은 설득력을 잃을 것이다. 검토 기준이 안정적으로 유지되고 오용 비율이 낮다면 그 주장은 더욱 강화될 것이다.
두 번째 신호는 발견된 취약점과 수정된 취약점의 관계다. Anthropic이 공개한 파트너 발견 사례 129,000건과 오픈소스 발견 사례 5,500건은 탐지 성과의 기준선을 제공한다.
향후 보고에서는 확인된 발견 사항을 중복 보고, 이의가 제기된 보고, 이미 폐기된 소프트웨어에 영향을 미친 취약점과 구분해야 한다. 또한 패치를 받은 문제의 수와 해당 패치가 배포된 시스템에 얼마나 신속하게 적용됐는지도 공개해야 한다.
패치 적용률이 높아진다면 최첨단 모델이 방어 측면의 우위를 만든다는 주장을 뒷받침할 수 있다. 반대로 심각하지만 해결되지 않은 문제의 적체가 늘어난다면, 자동화된 탐지가 문제를 해결하기보다 조직적 병목을 드러내고 있다는 의미일 수 있다.
세 번째 신호는 Anthropic이 최초의 심각한 접근 실패를 어떻게 처리하는지다. 어떤 검증 시스템도 정상 운영 상황에서만 평가되어서는 안 된다.
계정 탈취, 무단 대상 지정, 분류기 우회 또는 실제 시스템과의 의도치 않은 상호작용은 이 프로그램의 대응 역량을 시험하게 된다. 중요한 지표에는 탐지 시간, 격리, 통지, 권한 철회, 그리고 이후 이루어진 변경 사항이 포함된다.
일부 기술적 세부 사항이 기밀로 남더라도 투명한 사고 보고는 신뢰를 구축할 수 있다. 침묵은 외부 조직이 프로그램 참여의 실제 위험을 평가하기 어렵게 만들 것이다.
Enterprise Frontier Safeguards 역시 이 신호에 영향을 미칠 것이다. Anthropic은 계획 중인 시스템이 개인정보 보호와 오용 방지를 결합하면서도, 자격을 갖춘 조직이 자체 클라우드 환경에서 정보를 유지할 수 있게 할 것이라고 밝혔다.
이 방식은 민감한 코드와 사고 데이터를 모델 제공업체로 전송하는 데 대한 우려를 해소할 수 있다. 다만 통제 기능이 고객 관리 환경마다 다르게 작동한다면 중앙 집중식 모니터링은 더 어려워질 수도 있다.
경쟁사의 움직임은 배경 요소에 속하지만 Anthropic의 선택에 영향을 미칠 것이다. OpenAI의 통제된 사이버 배포는 구매자와 규제기관에 접근, 감독, 사고 대응을 비교할 또 하나의 모델을 제공할 것이다.
경쟁사가 더 폭넓은 접근 권한을 제공한다면 Anthropic은 승인을 앞당겨야 한다는 압박을 받을 수 있다. 다른 곳에서 중대한 오용 사건이 발생하면 더 엄격한 요건으로 방향을 틀 가능성도 있다.
독자들은 Anthropic Cyber Verification Program을 최첨단 사이버 역량이 이제 안전하다는 증거로 받아들여서는 안 된다. 이는 신원과 통제 수단이 위험을 낮춘다는 이유로 알려진 기관에 더 적은 제한을 부과할 수 있다는 어려운 전제에 기반한 실시간 거버넌스 실험이다.
이 전제는 검증할 수 있다. Anthropic은 접근 수준이 Claude의 행동을 바꾼다는 것을 보여주는 벤치마크 결과를 공개했다. 또한 통제된 배포에서 대규모의 검증된 발견 사례가 나왔다고 보고했다.
부족한 증거는 대규모 운영에 관한 것이다. 정당한 요청이 얼마나 자주 차단되는지, 승인된 조직 중 몇 곳이 규칙을 위반하는지, Anthropic이 의도된 범위를 벗어나 사용되는 계정을 얼마나 효과적으로 탐지하는지는 아직 알 수 없다.
개발자와 보안 책임자는 유사한 접근 시스템이 사이버 보안을 넘어 확산될 수 있으므로 이 프로그램을 주시해야 한다. 생물학, 금융 또는 자율 연구 역량을 갖춘 최첨단 모델 역시 검증된 사용자와 승인된 환경에 연계된 권한을 필요로 할 수 있다.
엔터프라이즈 구매자는 접근 등급이 기술적으로 무엇을 바꾸는지 물어야 한다. 또한 데이터 보존, 모니터링, 사고 공개, 직원 권한 부여, 모델이 생성한 행동에 대한 책임도 검토해야 한다.
지식 노동자에게 더 넓은 교훈은 고도화된 AI에 대한 접근이 언제나 일률적인 제품 업데이트 형태로 제공되지는 않는다는 점이다. 가장 강력한 기능은 사용자가 누구인지, 어떤 기관의 지원을 받는지, 어떤 시스템을 시험할 권한이 있는지에 점점 더 좌우될 수 있다.
Anthropic은 그러한 미래를 더 가까이 가져왔다. 이 프로그램은 더 많은 방어 담당자에게 고급 Claude 사이버 역량에 대한 접근을 제공하는 한편, 다른 모든 사람에게는 더 강한 제한을 유지한다.
결과는 눈에 띄는 취약점 건수보다 체계적인 수정 조치와 책임 있는 감독에 더 크게 좌우될 것이다. Anthropic은 검증된 접근이 더 안전한 인프라를 만든다는 점을 보여줄 충분한 증거를 공개할 것인가, 아니면 첫 번째 중대한 실패가 검증 자체가 가장 취약한 안전장치임을 드러낼 것인가?



