Anthropic, Google, OpenAI의 가드레일이 공격적 사이버보안 연구를 늦추고 있다
- Aisha Washington

- 2일 전
- 12분 분량
Anthropic, Google, OpenAI의 안전 통제는 이제 어려운 시험대에 올랐다. 연구자들은 더 엄격해진 가드레일이 승인된 공격적 사이버보안 업무를 방해하고 있다고 말한다. 이 제한은 악의적 해킹을 겨냥하지만, 같은 통제가 취약점 검증, 리버스 엔지니어링, 익스플로잇 개발까지 차단할 수 있다.
여러 공격 보안 연구자가 반복적인 거부와 일관되지 않은 결과를 설명하면서 이 충돌은 더욱 외면하기 어려워졌다. 이들의 업무는 범죄자가 악용하기 전에 알려지지 않은 결함을 찾아내는 것으로, 통제된 개념 증명 개발이 수반되는 경우가 많다.
문제는 단순히 AI 기업이 위험한 요청을 거절한다는 데 있지 않다. 연구자들은 시스템이 승인된 테스트와 실제 공격을 구분하는 데 어려움을 겪는다고 말한다. 이 모호성은 지연을 만들고 재현성을 제한하며, 민감한 업무를 로컬에서 호스팅하는 오픈 모델로 밀어낸다.
OpenAI와 Anthropic은 이러한 마찰을 줄이기 위한 검증 프로그램을 도입했다. Google 역시 멀웨어, 인프라 교란, 안전 필터 우회와 관련된 생성형 AI 사용을 제한한다. 이 정책들은 미국의 주요 AI 기업들이 이중용도 사이버 역량에 어떤 경계를 설정하고 있는지 보여준다.
핵심 분쟁은 모델 거부에 대한 일상적인 불만보다 더 날카롭다. 공격 보안과 방어 보안에는 종종 동일한 기술적 단계가 필요하다. 모델은 자신의 맥락에 제시된 코드, 명령 또는 취약점만으로 작업자의 승인을 언제나 식별할 수는 없다.
이 때문에 프런티어 연구소는 비용이 큰 두 가지 오류 사이에서 선택해야 한다. 관대한 모델은 공격자가 더 빠르게 움직이도록 도울 수 있다. 지나치게 신중한 모델은 방어자가 동일한 약점을 이해하고 수정하지 못하게 할 수 있다.
연구자들: 정당한 사이버 업무까지 차단되고 있다
즉각적인 변화는 사이버 가드레일이 명백히 악의적인 요청뿐 아니라 실무 연구 워크플로까지 중단시킨다는 점이다.
7월 23일 사이버보안 조사는 취약점을 찾고 익스플로잇을 개발하는 연구자들의 불만을 기록했다. 여러 연구자는 프런티어 모델이 승인된 업무 중 정당한 요청을 거절하거나 일관되지 않은 답변을 내놓았다고 말했다.
공격 보안이란 소유자의 허가를 받아 공격자 관점에서 시스템을 테스트하는 것을 뜻한다. 여기에는 침투 테스트, 익스플로잇 검증, 레드 팀 운영, 일부 리버스 엔지니어링이 포함된다.
이런 활동은 일반적인 코드 검토가 놓치는 약점을 드러낼 수 있다. 의심스러운 코드 경로는 연구자가 실제로 도달하고 악용할 수 있는지 확인한 뒤에야 실행 가능한 사안이 된다.
NCC Group의 수석 과학자인 Chris Anley는 TechCrunch에 모델에게 버그 악용을 요청하면 해당 문제가 수정 대상인지 확인할 수 있다고 말했다. 이 단계에서의 거부는 단순히 편의성을 없애는 데 그치지 않는다. 기업이 수정 우선순위를 정하는 데 도움이 되는 증거 구축 과정을 중단시킬 수 있다.
Anley는 이 기술을 도구이자 무기가 될 수 있는 망치에 비유했다. 그의 더 넓은 요점은 기술적 중복성에 관한 것이다. 익스플로잇에 유용한 지침은 취약한 코드가 실제 위험을 만든다는 점을 입증하는 데도 필수적일 수 있다.
이러한 중복성은 특히 제로데이, 즉 발견 당시 영향을 받는 벤더가 알지 못하는 취약점에서 중요해진다. 연구자들은 결함을 이해하기 전에 실행 흐름을 추적하고, 메모리를 조작하거나, 비정상적인 입력을 구성해야 하는 경우가 많다.
연구자들은 공격을 재현하고 있기 때문에 이 단계들은 공격자 행위와 닮아 있다. 분류기는 의심스러운 용어, 코드, 명령을 본다. 그러나 업무를 정당하게 만드는 계약이나 실험실 승인은 보지 못할 수 있다.
스마트폰 부품 제조업체의 한 연구자는 TechCrunch에 Anthropic의 도구가 검증 프로그램 밖에서는 취약점 발견에 거의 쓸모없어졌다고 말했다. 이 연구자는 시스템이 보안 관련 작업을 감지하면 멈췄다고 했다.
RemoteThreat의 CEO Chris Thompson은 또 다른 실패 양상을 설명했다. 그는 가드레일이 세션마다 다르게 작동했으며, 완화된 제한을 제공하는 검증 프로그램 내에서도 그랬다고 말했다.
이러한 일관성 부족은 취약점 연구가 반복 가능한 실험에 의존하기 때문에 중요하다. 연구자는 결과가 대상 시스템, 테스트 방법, 또는 모델의 변화하는 개입 중 어디에서 비롯됐는지 판별해야 한다.
정책 집행이 명확한 설명 없이 바뀌면 모델은 또 하나의 통제되지 않는 변수가 된다. 시간은 취약점 분석에서 프롬프트 재작성과 거부 원인 진단으로 옮겨간다.
이 제한이 모든 실무자에게 똑같이 영향을 미치는 것은 아니다. 제로데이를 찾고 익스플로잇을 개발하는 Giuseppe Cali는 TechCrunch에 가드레일이 자신의 업무를 방해하지는 않았다고 말했다.
Cali는 초기 리버스 엔지니어링과 보조 도구 구축에 AI를 사용한다. 실제 취약점 발견과 무기화는 스스로 통제하는데, 그 업무를 즐기기 때문이기도 하다.
그의 경험은 이 비판의 중요한 한계를 보여준다. 연구자들이 프런티어 모델에 위험이 낮은 보조 작업을 맡길 때도 모델은 유용할 수 있다. 워크플로가 악용 가능성, 페이로드 동작 또는 운영 테스트에 가까워질수록 충돌은 심해진다.
따라서 현재 논쟁은 AI가 보안 분야에서 가치를 지니는지 여부가 아니라 특정 역량에 대한 접근을 다룬다. 모델은 가장 엄격한 정책 경계를 넘지 않고도 코드를 요약하고, 함수를 설명하고, 테스트를 제안하거나, 문서화를 지원할 수 있다.
문제는 연구자가 모델에게 이러한 단계들을 연결해 달라고 요청할 때 발생한다. 그 연결은 가능한 결함이 검증된 보안 발견 사항이 되는 지점인 경우가 많다.
Anthropic과 Google의 정책이 공격과 방어를 깔끔하게 분리할 수 없는 이유
Anthropic, Google 및 다른 프런티어 연구소의 정책은 프롬프트만으로는 신뢰성 있게 해결할 수 없는 분류 문제에 직면해 있다.
Anthropic은 실시간 안전장치가 금지된 사용과 고위험 이중용도 활동을 차단한다고 말한다. 금지 범주에는 랜섬웨어 개발이나 대규모 데이터 유출처럼 정당한 방어적 가치가 거의 없는 행위가 포함된다.
고위험 이중용도 범주는 더 복잡하다. Anthropic은 취약점 악용과 공격 보안 도구 개발을 명시적으로 포함하는데, 둘 다 정당한 방어 목적에 활용될 수 있다.
영향을 받는 Claude 모델에서는 이러한 요청이 기본적으로 차단된다. 검증된 사용자는 Anthropic의 Cyber Verification Program, 즉 CVP를 통해 조정을 신청할 수 있다.
Anthropic은 승인된 실무자도 차단을 경험할 수 있다고 말한다. 회사는 적격 신청자를 잘못 거절할 수 있으며, 승인된 사용자도 정당한 업무에서 제한을 받을 수 있음을 인정한다.
이 인정은 핵심 기술 과제를 반영한다. 모델은 침투 테스터와 범죄자로부터 동일한 익스플로잇 개발 지침을 받을 수 있다. 눈에 보이는 차이는 대개 요청된 작업이 아니라 승인 여부다.
Google의 금지된 사용 정책도 멀웨어, 인프라 악용 또는 안전 필터 우회를 용이하게 하는 생성형 AI 콘텐츠를 금지한다. 교육적, 과학적 또는 공익적 이점이 피해를 능가하는 경우에는 예외를 허용한다.
예외 조항은 맥락을 인정하지만, 대규모로 맥락을 집행하는 일은 여전히 어렵다. 사용자는 이를 증명하지 않고도 대상 시스템을 소유한다고 주장할 수 있다. 정당한 연구자 역시 해당 제품의 인프라를 통제하지 않은 채 작업할 수 있다.
OpenAI는 사이버 역량이 본질적으로 이중용도라고 설명한다. 방어 및 공격 워크플로가 같은 지식과 기술의 상당 부분에 의존한다고 말한다.
회사는 2025년 동안 사이버 성능이 가파르게 상승했다고 보고했다. 사이버 회복력 계획에 따르면, 자사 모델의 깃발 뺏기 성과는 8월 27%에서 11월 76%로 증가했다.
깃발 뺏기 과제는 의도적으로 취약하게 만든 대상을 활용하는 통제된 보안 훈련이다. 정찰, 리버스 엔지니어링, 익스플로잇, 권한 상승 등의 기술을 테스트한다.
OpenAI는 원격 제로데이 익스플로잇을 개발하거나 복잡한 침입을 지원할 수 있는 모델을 예상하기 위해 더 높은 역량 임계값을 사용한다. 이러한 궤적은 회사가 모든 사이버 요청을 일반적인 코딩 요청처럼 취급하지 않는 이유를 설명한다.
Google DeepMind도 모델 개발 수준에서 유사한 위험 기반 접근법을 취했다. 안전 프레임워크에는 역량 평가와 단계적 완화 조치가 필요한 영역으로 사이버보안이 포함돼 있다.
이 정책들은 현실적인 우려에 대응한다. 유능한 모델은 전문 지식을 압축하고, 반복 작업을 자동화하며, 도구를 조율할 수 있다. 방어자가 활용할 수 있는 동일한 효율성은 악용에 필요한 노력을 낮출 수 있다.
그러나 공격적인 프롬프트 필터링은 신원과 승인 문제에 대한 둔감한 대응이다. 기술적 콘텐츠만으로는 사용자의 목적에 대한 강한 증거를 제공하지 못한다.
단순한 표현도 오해를 부를 수 있다. 정당한 평가에서 shellcode, exploit, persistence, credential extraction 같은 용어가 등장하기 때문에 무해한 프롬프트에도 이런 표현이 포함될 수 있다.
악의적인 요청은 정제된 언어를 사용할 수 있다. 공격자는 자격 증명 탈취를 계정 복구로 설명하거나, 익스플로잇을 호환성 테스트로 위장할 수 있다.
분류기는 코드, 의도, 대상, 계정 이력, 주변 활동을 평가해야 한다. 그럼에도 법적 승인을 검증하는 것이 아니라 확률적 판단을 내린다.
탐색적 연구 중에는 오탐이 특히 발생하기 쉽다. 연구자들은 의심스러운 코드 경로가 무엇으로 이어질지 언제나 알 수 있는 것은 아니다. 실제 취약점을 식별하기 전에 여러 공격 가설을 시험해야 할 수 있다.
이 불확실성은 처음부터 명확히 정의된 방어 목적을 기대하는 시스템과 충돌한다. 연구 과정은 위험해 보이는 기술 작업이 시작된 뒤에야 그러한 설명을 만들어내는 경우가 많다.
검증된 접근은 도움이 되지만 마찰을 없애지는 못한다
검증 프로그램은 알려진 방어자의 접근을 개선하지만, 제한 없는 예측 가능한 연구 워크플로를 보장할 수는 없다.
Anthropic의 CVP는 정당한 고위험 사이버 업무를 위한 신청 기반 프로그램이다. 회사는 영업일 기준 2일 이내에 검토 결정을 내리는 것을 목표로 한다고 말한다.
승인은 특정 조직과 연결된다. 연구자는 다른 워크스페이스를 사용하거나 여전히 금지된 활동을 마주할 경우 차단될 수 있다.
이용 가능 여부도 플랫폼에 따라 다르다. Anthropic은 현재 Amazon Bedrock 또는 Google Vertex AI를 통해서는 CVP를 이용할 수 없다고 밝힌다. Claude를 사용하는 타사 애플리케이션도 참여하지 않을 수 있다.
이러한 구분은 운영상의 복잡성을 만든다. 보안팀은 클라우드 제공업체, 워크스페이스 구성 또는 소프트웨어 통합 방식에 따라 서로 다른 대우를 받을 수 있다.
프로그램에는 데이터 보존 요건도 있다. Anthropic은 데이터 보존을 사용하지 않는 조직에 보존을 활성화한 별도 워크스페이스를 만들 것을 권고한다.
이 조건은 가드레일을 넘어선 두 번째 문제를 제기한다. 공격적 연구에는 기밀 소스 코드, 패치되지 않은 취약점, 독점 펌웨어, 그리고 침해를 가능하게 할 수 있는 정보가 자주 포함된다.
계약상 보호가 존재하더라도 이러한 자료를 호스팅 모델에 전송하는 일은 수용하기 어려운 노출을 만들 수 있다. 따라서 일부 연구자는 벤더가 결함을 패치하기 전까지 프런티어 서비스를 피한다.
Paolo Stagno Crowdfense 최고기술책임자는 TechCrunch에 자신의 팀이 리버스 엔지니어링에 프런티어 모델을 사용한다고 밝혔다. 다만 취약점을 찾거나 익스플로잇을 만드는 데에는 사용하지 않는다.
Stagno는 민감한 취약점 정보가 유출되거나 데이터가 향후 학습에 흡수될 수 있다는 우려를 언급했다. 익스플로잇 작업에는 자료를 제공업체에 전송할 필요가 없는, 로컬에서 운영되는 오픈 모델을 사용한다.
OpenAI의 trusted cyber access 시스템은 여러 역량 수준을 사용한다. 표준 액세스는 일반적인 방어 작업을 지원하며, 검증된 액세스는 승인된 작업에 대해 일부 제한을 완화한다.
보다 특화된 액세스는 익스플로잇 개발, 침투 테스트, 리버스 엔지니어링, 레드팀 활동을 포함한 공격적 테스트를 다룬다. 한 액세스 수준의 승인이 모든 사이버 특화 모델에 대한 권한을 자동으로 부여하는 것은 아니다.
OpenAI는 이 프로그램이 모든 안전장치나 거부를 없애지는 않는다고도 밝힌다. 액세스는 승인된 사용자, 내부 워크플로, 그리고 조직이 소유하거나 테스트 권한을 가진 시스템으로 계속 제한된다.
이러한 조건은 타당하다. 제공업체가 검증을 어떤 대상이든 공격할 수 있는 포괄적 허가로 안전하게 해석할 수는 없다.
그러나 이 조건들은 검증만으로 연구 문제를 완전히 해결하지 못하는 이유도 보여준다. 권한 부여는 세분화돼 있다. 하나의 시스템, 하나의 기간, 하나의 테스트 방법 또는 하나의 고객 프로젝트에만 적용될 수 있다.
일반적인 계정 수준 승인은 모든 범위 변경을 포착할 수 없다. 지속적인 문서 검토는 더 많은 지연을 초래하고 추가 고객 정보를 노출하게 된다.
OpenAI는 앞서 신뢰 프로그램이 수천 명의 검증된 방어 담당자와 핵심 소프트웨어를 보호하는 수백 개 팀에 도달했다고 밝혔다. 이 규모는 수요를 보여주지만, 오탐이나 포기된 워크플로를 측정하지는 않는다.
부족한 성과 지표는 실무적인 것들이다. 연구자들은 승인된 요청이 얼마나 자주 차단되는지, 이의 제기에 얼마나 오래 걸리는지, 모델 업데이트 사이에서도 결정이 안정적으로 유지되는지를 알아야 한다.
또한 유용한 설명도 필요하다. 일반적인 안전 메시지만으로는 트리거가 대상, 코드 동작, 요청한 출력물, 또는 누적된 계정 활동 중 무엇이었는지 알 수 없다.
이 정보가 없으면 사용자는 프롬프트 문구를 바꿔가며 실험하게 된다. 연구자가 정당한 결과만 원하더라도 이런 행동은 우회 시도로 보일 수 있다.
더 나은 집행은 전체 운영 환경에 초점을 맞춰야 한다. 제공업체는 신원 검증을 격리된 실행 환경, 대상 허용 목록, 속도 제한, 감사 로그, 통제된 네트워크 액세스와 결합할 수 있다.
이 모델은 보안 훈련을 위한 격리 환경인 사이버 레인지와 유사하다. 프롬프트 분류만으로 판단하는 것보다 더 강한 권한 증거를 제공한다.
또한 인프라에 더 큰 책임을 부과한다. 제공업체는 격리된 것으로 알려진 대상이 외부 시스템으로 연결되는 교두보가 될 수 없음을 확인해야 한다.
이 접근법이 모든 연구자를 포괄하지는 못한다. 독립 전문가와 소규모 컨설팅 업체는 엔터프라이즈 중심 프로그램이 요구하는 조직 문서를 갖추지 못할 수 있다.
보안 연구는 오랫동안 공급업체와 공식적 관계 없이 제품을 조사하는 외부 연구자들의 혜택을 받아왔다. 고급 액세스를 쉽게 검증 가능한 대형 기관으로 제한하면 이 커뮤니티가 축소될 수 있다.
그 결과는 이중 계층 시스템이 될 것이다. 대기업은 특화 모델과 지원을 받는 반면, 독립 연구자들은 소비자용 도구, 로컬 오픈 모델 또는 수작업 방식에 의존하게 된다.
가드레일은 민감한 작업을 오픈 모델로 밀어내고 있다
호스팅된 프런티어 모델이 예측 불가능해지거나 기밀 작업에 부적합해지면, 연구자들은 오픈 모델을 로컬에서 실행할 이유를 갖게 된다.
여러 연구자는 미국 프런티어 서비스가 공격적 작업을 거부할 때 다운로드 가능한 모델로 돌아간다고 TechCrunch에 말했다. Thompson은 특히 GLM 같은 중국 오픈 모델을 지목했다.
로컬 배포는 통제 구조를 바꾼다. 연구자들은 모델 버전을 선택하고, 프롬프트를 보존하며, 외부 연결을 끄고, 취약한 코드를 자체 하드웨어에 보관할 수 있다.
또한 공급업체가 호스팅 서비스를 업데이트한 뒤에도 실험을 재현할 수 있다. 고정된 모델 체크포인트는 안전장치가 예고 없이 바뀔 수 있는 서비스보다 더 일관되게 동작한다.
그렇다고 모든 오픈 모델이 선도적인 호스팅 모델의 추론 품질에 맞먹는다는 뜻은 아니다. 연구자들은 역량, 컨텍스트 처리, 하드웨어 요구사항, 도구 통합을 비교해야 한다.
오픈 모델은 운영자에게 더 많은 보안 책임도 이전한다. 제대로 격리되지 않은 에이전트는 안전하지 않은 명령을 실행하고, 비밀 정보를 노출하거나, 프로덕션 시스템에 도달할 수 있다.
그럼에도 로컬 통제는 두 가지 불만을 동시에 해결한다. 제공업체 수준의 거부를 없애고, 미공개 취약점 데이터를 외부 서비스로 보내야 할 필요를 줄인다.
이 조합은 벤치마크 우위보다 더 중요하다. 다소 성능이 약한 모델이라도 민감하고 재현 가능한 워크플로 전반에서 계속 사용할 수 있다면 더 유용할 수 있다.
이 변화는 미국 AI 기업에 전략적 긴장도 만든다. 엄격한 안전장치는 자사 플랫폼에서의 오용을 줄일 수 있지만, 동시에 정당한 전문가들을 자사 거버넌스 밖의 시스템으로 유도한다.
그 연구자들은 다른 모델 생태계에 피드백, 통합 기능, 워크플로 지식을 제공하게 된다. 이들의 사용은 제한이 더 적은 모델 주변의 도구를 개선할 수 있다.
이는 가드레일이 인터넷을 덜 안전하게 만든다는 증거는 아니다. 공격자들은 검증된 방어 담당자들이 무엇을 선택하든 오픈 모델을 사용할 수 있다.
그러나 방어 담당자의 이동은 호스팅된 제한이 책임 있는 사용자에게 우위를 보존한다는 주장을 약화시킬 수 있다. 그 우위는 해당 사용자들이 의미 있는 작업을 완료할 수 있을 때만 중요하다.
OpenAI는 악의적 역량 증강을 제한하면서 방어 담당자에게 더 나은 도구를 제공하는 전략을 내세운다. Anthropic도 검증된 전문가를 위해 조정된 안전장치를 제공한다.
두 목표 모두 조정된 액세스에 달려 있다. 위험해 보이는 행동을 거의 모두 차단하는 통제는 악용을 줄일 수 있지만, 방어 담당자에게 약속된 역량까지 없앨 수 있다.
이동 압력은 명시적인 거부를 넘어선다. 보존 요건, 플랫폼 제외 조항 또는 불명확한 이의 제기가 기밀 프로젝트를 복잡하게 만들면 호스팅 모델은 매력을 잃을 수 있다.
컨설팅 회사는 서로 다른 권한 경계를 가진 여러 고객을 지원할 수 있다. 하나의 보존된 작업 공간 안에서 고객들의 소스 코드와 조사 결과를 무심코 섞을 수는 없다.
독립 연구자는 제작사에 연락하기 전에 널리 배포된 제품을 조사할 수 있다. 이 사람은 권한을 증명하는 고객 계약을 항상 제시할 수 있는 것은 아니다.
버그 바운티 프로그램은 공개된 규칙 아래 테스트를 허용하지만, 모델 제공업체는 요청된 각 작업이 범위 내에 머무르는지 검증하지 못할 수 있다.
이런 상황은 기업 수준 심사의 한계를 드러낸다. 신뢰는 개인이나 조직에 부여되지만, 권한은 특정 작업에 부여된다.
로컬에서 운영되는 모델은 이 검증 공백을 피한다. 동시에 대규모 악용을 감지하고, 액세스를 중단하거나, 의심스러운 패턴을 조사할 수 있는 제공업체도 제거한다.
따라서 이 트레이드오프는 사라지기보다 이동한다. 호스팅 서비스는 감독을 제공하지만 마찰과 기밀성 우려를 만들 수 있다. 로컬 모델은 통제력을 제공하지만 중앙집중식 집행을 줄인다.
미국 프런티어 연구소들은 더 엄격한 거부 정책으로 오픈 모델의 가용성을 되돌릴 수 없다. 보다 현실적인 선택지는 책임 있는 호스팅 액세스를 로컬 대안보다 더 낫게 만드는 것이다.
이는 예측 가능한 정책, 더 빠른 이의 제기, 실질적인 개인정보 보호 통제, 통제된 익스플로잇을 위해 설계된 환경을 의미한다. 원시 모델 역량만으로는 보안 연구자들을 플랫폼에 머물게 할 수 없다.
연구자들의 비판에는 중요한 한계가 있다
공격적 연구자들은 실제 워크플로 실패를 지적하지만, 그들의 이해관계가 위험한 AI 역량을 얼마나 폭넓게 공개해야 하는지를 결정하지는 않는다.
일부 공격 보안 기업은 정부 고객을 위해 취약점을 발견, 확보 또는 판매한다. 이들의 작업이 항상 즉각적인 공개와 패치로 이어지는 것은 아니다.
TechCrunch가 인용한 저명한 연구자 Mark Dowd는 서방 정부에 제로데이를 판매한 바 있다. 그는 이러한 배경이 기업 제한에 대한 자신의 관점에 영향을 줄 수 있음을 인정했다.
정부는 대상이 계속 노출된 상태에서 정보기관이 이를 활용할 수 있기 때문에 공개되지 않은 취약점을 가치 있게 여긴다. 이 시장은 공격 연구와 공공 방어를 단순히 동일시하는 관점을 복잡하게 만든다.
모델 제공업체는 고객이 평판이 좋아 보이는지만 고려해서는 안 된다. 지원이 감시, 침입 또는 익스플로잇 비축을 확대할 수 있는지도 고려해야 한다.
법적 권한은 공익과 동일하지 않다. 정부가 승인한 작전도 취약점이 널리 사용되는 소프트웨어에 영향을 준다면 논란의 대상이 되거나 시스템적 위험을 만들 수 있다.
연구자들 사이에서도 AI가 얼마나 중심적인 역할을 맡아야 하는지에 대한 견해는 다르다. Cali의 워크플로는 유용한 지원이 자동화된 버그 발견이나 무기화 이전에 멈출 수 있음을 시사한다.
이 접근법은 가장 위험한 단계에서 인간의 판단을 보존한다. 또한 모델이 불완전한 아이디어를 재사용 가능한 공격 방법으로 바꿀 가능성도 낮춘다.
한편 제공업체의 위험 주장은 가정에 불과한 것이 아니다. OpenAI는 모델의 사이버 성능이 빠르게 향상됐다고 말하며, 세 연구소 모두 고급 사이버 역량을 심각한 안전 영역으로 다룬다.
모델이 더 오래 실행되는 에이전시를 갖추면서, 하나의 응답은 행동 순서보다 덜 중요해진다. 에이전트는 코드를 검사하고, 테스트를 생성하며, 명령을 실행하고, 실패를 평가하고, 계획을 수정할 수 있다.
이 역량은 판도를 바꾼다. 과거에는 짧은 악성코드 요청을 차단했던 거부가 이제 수천 건의 조율된 행동을 통제해야 할 수 있다.
또한 격리된 테스트를 필수로 만든다. 도구를 사용하는 에이전트는 텍스트 전용 어시스턴트가 도달할 수 없는 경계를 넘을 수 있다.
연구자들은 예측 가능한 액세스를 누릴 자격이 있지만, 제공업체는 주변 환경이 실패를 억제할 것이라는 증거를 필요로 한다. 검증만으로는 그 증거를 제공할 수 없다.
또한 정당한 사이버 작업을 위한 가드레일 품질에 대해 공개되고 표준화된 측정 기준도 없다. 일화는 실패 양상을 드러내지만, 전반적인 오탐률을 확립하지는 못한다.
TechCrunch 인터뷰는 다양한 조직과 워크플로를 다룬다. 이는 신뢰할 만한 경고 신호를 제공하지만, 보안 업계를 대표하는 조사 결과는 아니다.
제공업체 역시 승인된 사용자 경험에 관한 제한적인 데이터만 공개한다. 등록 인원은 도달 범위를 보여주지만, 작업 완료 여부나 모델의 유용성에 대해서는 거의 말해주지 않는다.
이러한 증거 공백은 양측이 자신의 주장을 과장하도록 부추긴다. 연구자들은 거부를 안전 정책이 자의적이라는 증거로 해석할 수 있다. 제공업체는 프로그램의 존재 자체를 정당한 액세스가 작동한다는 증거로 취급할 수 있다.
더 나은 평가는 여러 모델에서 현실적인 승인된 워크플로를 테스트해야 한다. 작업 성공률, 부적절한 거부, 안전하지 않은 준수, 일관성, 이의 제기 시간, 데이터 처리 요건을 측정해야 한다.
벤치마크에는 모호한 사례도 포함돼야 한다. 쉬운 방어 프롬프트와 노골적인 랜섬웨어 요청은 논쟁의 경계를 시험하지 못한다.
시나리오에는 사이버 레인지 내 익스플로잇 검증, 악성코드 리버스 엔지니어링, 버그 바운티 대상 분석, 안전한 개념 증명 개발 등이 포함될 수 있다.
독립 평가자들은 최고 위험 모델 계층에도 접근할 수 있어야 한다. 그렇지 않으면 검증이 실제로 문제를 해결하는지 살피지 못한 채 공개 제한만 측정하게 된다.
그 결과는 악용을 가능하게 하는 운영 세부사항을 공개해서는 안 된다. 집계 보고만으로도 통제가 시간이 지남에 따라 정당한 작업을 더 정확히 구분하는지 보여줄 수 있다.
그런 증거가 존재하기 전까지 강한 결론은 시기상조다. 가드레일이 일부 연구자에게 분명한 마찰을 일으키지만, 이를 제거하면 또 다른, 그리고 잠재적으로 더 큰 위험이 생길 수 있다.
실질적인 목표는 무제한 접근이 아니다. 현실적인 공격 테스트 조건에서도 유용성을 유지하는, 책임 있는 접근이다.
Anthropic, Google, OpenAI가 다음으로 입증해야 할 것
다음 단계는 워크플로 신뢰성, 통제된 실행, 그리고 책임 있는 연구자들이 관리형 플랫폼에 계속 남아 있는지를 기준으로 평가해야 한다.
첫 번째 신호는 검증 프로그램 내에서 측정 가능한 성과다. Anthropic과 OpenAI는 승인 소요 기간, 이의제기 결과, 정당한 이중용도 요청에 대한 오탐률을 공개해야 한다.
이 수치에는 모델, 접근 수준, 작업 범주 등의 맥락이 필요하다. 프로그램 전체를 아우르는 단일 비율은 익스플로잇 검증 과정의 심각한 문제를 가릴 수 있다.
Anthropic은 이미 CVP 신청을 영업일 기준 2일 이내에 결정하는 것을 목표로 한다고 밝혔다. 더 중요한 질문은 승인 이후에 어떤 일이 벌어지는가다.
검증된 연구자들이 여전히 이유를 알 수 없는 차단을 자주 겪는다면, 심사는 경계선만 옮겼을 뿐 워크플로 문제를 해결하지 못한 셈이다. 오탐률이 낮아진다면 조정된 보호 장치의 타당성은 더 강해질 것이다.
두 번째 신호는 통제된 연구 환경의 확산이다. 최첨단 연구소는 감사 가능한 도구, 제한된 네트워킹, 명확한 대상 승인 체계를 갖춘 격리 작업 공간을 제공할 수 있다.
이러한 환경에서는 외부 인프라에 대한 개방형 접근을 허용하지 않으면서도 모델이 위험해 보이는 작업을 수행할 수 있다. 또한 사고 검토를 프롬프트 수준의 추측보다 더 구체적으로 만들 수 있다.
성공하려면 클라우드 플랫폼과 서드파티 도구 전반의 지원이 필요하다. Anthropic의 현재 CVP 제공 범위 공백은 모델이 중개 채널을 통해 사용자에게 도달할 때 접근이 어떻게 끊길 수 있는지를 보여준다.
프라이버시 통제는 실행 통제만큼 중요할 것이다. 보안팀에는 추가 노출을 만들지 않으면서 독점 코드와 비공개 취약점을 처리할 수 있는 신뢰할 만한 선택지가 필요하다.
기업이 강력한 보존 정책 선택지와 사이버 레인지를 함께 제공한다면, 더 많은 연구자가 호스팅 모델 사용을 정당화할 수 있다. 보존이 계속 의무화된다면 민감한 작업은 계속 로컬 환경으로 이동할 것이다.
세 번째 신호는 연구자 행동이다. 공급업체는 저명한 공격 연구팀이 단순한 코드 요약을 넘어 익스플로잇 검증에 특화된 최첨단 모델을 사용하는지 살펴봐야 한다.
GLM 및 기타 다운로드 가능한 모델로의 이동이 계속된다면, 검증된 접근이 방어자에게 실질적 우위를 제공한다는 주장은 약해질 것이다. 안정적인 채택은 보호 장치가 사용 가능한 수준에 이르고 있음을 시사할 수 있다.
최근 연구자 계정이 주로 Anthropic과 OpenAI에 집중됐음에도 Google은 이 비교에 포함된다. Google의 정책과 최첨단 프레임워크도 같은 근본적 절충을 반영한다.
anthropic google 키워드 조합은 더 광범위한 시장 현실도 포착한다. 보안팀은 단순한 벤치마크 점수뿐 아니라 공급업체 전반의 거버넌스, 배포, 프라이버시, 접근성을 비교한다.
어떤 기업도 더 나은 거부 메시지만으로 이중용도 분류 문제를 해결할 수는 없다. 결정적인 개선은 신원, 환경, 승인, 모니터링, 그리고 실수를 바로잡기 위한 투명한 경로를 결합해야 한다.
개발자와 엔터프라이즈 구매자는 보안 업무에 AI 모델을 도입하기 전에 직접적인 질문을 던져야 한다. 어떤 작업이 강화된 보호 장치를 유발하는가? 승인된 사용자는 진행 중인 업무 중에도 이의를 제기할 수 있는가?
또한 보존 정책, 지역별 처리, 플랫폼 제공 범위, 감사 가능성, 모델 버전 안정성을 살펴봐야 한다. 이러한 세부 사항이 제품이 실제 보안 프로그램을 지원할 수 있는지를 결정한다.
공격 연구자들은 피해를 조장할 수 있는 자료를 공개하지 않으면서도 오탐 사례를 기록해야 한다. 비교 가능한 증거는 공급업체가 실패를 고립된 오용 사례로 치부하기 어렵게 만들 것이다.
한편 AI 기업은 정당한 요청을 거부하는 일을 안전성 결함으로 다뤄야 한다. 방어자를 무차별적으로 차단하는 시스템은 의도한 균형을 달성하지 못한다.
다가올 시험은 간단하다. Anthropic, Google, OpenAI는 공격자들이 이미 찾고 있는 역량에 대해 승인된 연구자에게 신뢰할 수 있는 접근을 제공하면서도 의미 있는 감독을 유지할 수 있을까?
검증 프로그램이 일관성과 기밀성을 갖추게 된다면, 관리형 최첨단 모델은 책임 있는 전문가를 붙잡아 둘 수 있다. 그렇지 않다면 이들 전문가는 제한이 더 적고 공급업체 감독도 약한 로컬 대안으로 계속 이동할 것이다.


