top of page

METR 보안 사고가 드러낸 60만 달러 규모의 AI 자격 증명 실패

METR는 공격자가 API 키를 탈취해 약 60만 달러 상당의 모델 크레딧을 사용한 뒤 두 건의 보안 사고를 공개했다. 첫 번째 공격은 비정상적인 트래픽과 반복적인 속도 제한 오류를 발생시켰음에도 3주 동안 이어졌다.

모델 개발사가 METR에 크레딧을 무상 제공했기 때문에 이 손실이 직접적인 청구서로 이어지지는 않았다. 이 사실은 재정적 영향을 제한했지만, 동시에 악용을 더 일찍 드러낼 수 있었던 지출 임계값도 없앴다.

METR 보안 사고의 의미는 한 연구 기관에 국한되지 않는다. 실험용 에이전트 대시보드는 클라우드 접근 권한, 활성 자격 증명, 공개 노출, 취약한 모니터링을 하나의 시스템에 결합했다. 이 조합은 인증 실패를 가치 있는 컴퓨팅 자원에 대한 장기 접근으로 바꿨다.

METR는 조사 결과 공격자가 가장 민감한 정보에 접근했다는 증거는 발견되지 않았다고 밝혔다. 그러나 두 번째 사고는 공개 연구 도구가 비공개 평가 데이터에 얼마나 가까이 접근했는지를 보여줬다. 두 사건은 중요도가 낮은 프로토타입에는 더 느슨한 보안 통제가 허용된다는 가정에 의문을 제기한다.

METR 보안 사고는 노출된 에이전트 대시보드에서 시작됐다

첫 번째 사고는 일반적인 인증 실패로 시작됐지만, AI 에이전트가 공개 접근에서 자격 증명 탈취로 이어지는 경로를 제공했다.

2026년 3월, 한 METR 연구원이 개인 Amazon EC2 인스턴스에 에이전트를 배포했다. EC2는 가상 서버를 임대하는 Amazon Web Services의 플랫폼이다. 연구원은 의도적으로 이 인스턴스를 인터넷에서 접근 가능하게 만들고 Google 인증 뒤에 배치했다.

이 애플리케이션에는 METR가 장애 시 허용(fail-open) 취약점이라고 부른 문제가 포함돼 있었다. 장애 시 허용 시스템은 인증 통제가 실패할 때 접근을 거부하는 대신 계속 작동한다. 이 사례에서 해당 실패는 인증을 조용히 비활성화했고, 대시보드를 며칠 동안 노출시켰다.

EC2 인스턴스에는 공개 모델용 METR 일반 접근 계정에 연결된 API 키도 있었다. API 키는 소프트웨어가 온라인 서비스 요청을 인증하는 데 사용하는 자격 증명이다.

METR의 보안 공개에 따르면, 공격자는 에이전트에 프롬프트를 입력해 해당 모델 제공업체 키를 공개하도록 했다. 이후 공격자는 SSH 키를 설치해 침해된 서버에 원격으로 지속 접근할 수 있는 수단을 만들었다.

이 순서는 중요하다. 공격자는 최첨단 모델의 안전장치를 우회하거나 새로운 AI 익스플로잇을 개발할 필요가 없었다. 최초 침입 지점은 안전하지 않은 상태로 실패한 일반적인 웹 애플리케이션 통제에서 비롯됐다.

그럼에도 에이전트는 결과에 영향을 미쳤다. 외부인이 인터페이스에 도달한 뒤 에이전트는 애플리케이션 자체 밖에서도 가치가 있는 자격 증명에 접근하거나 이를 재현할 수 있었다. 따라서 침해된 대시보드는 별도의 모델 제공업체 계정으로 이어지는 다리가 됐다.

METR는 공격자가 최근 등록된 웹사이트를 모니터링해 이 인스턴스를 발견했을 가능성이 있다고 본다. 인증서 투명성 기록은 발급된 웹 인증서를 공개적으로 기록하므로 새 도메인과 하위 도메인을 식별하는 데 도움이 될 수 있다.

이 조직은 공격자가 대규모 언어 모델과 에이전트 관련 용어를 찾기 위해 해당 기록을 검색했다고 판단한다. 이런 용어는 가치 있는 제공업체 자격 증명을 포함할 수 있는 실험용 서비스를 식별할 수 있다.

이 설명은 공개적으로 검증된 귀속이 아니라 METR의 평가에 해당한다. METR는 공격자, 모델 제공업체, 정확한 발견 인프라를 식별하지 못했다.

자격 증명을 획득한 뒤 침입자는 이를 3주 동안 사용했다. METR는 사용된 크레딧의 가치가 약 60만 달러에 달했을 것으로 계산했지만, 실제로 이 금액을 지불하지는 않았다.

사건에서 가장 눈에 띄는 숫자는 더 광범위한 실패 사슬의 주의를 분산시킬 수 있다. 공개 노출, 에이전트가 이용할 수 있는 자격 증명, 지속적인 호스트 접근, 불완전한 사용량 가시성은 모두 해결되지 않은 상태로 남아 있었다.

이 통제 수단 중 하나만 작동했어도 피해를 줄일 수 있었다. 인증은 접근을 거부할 수 있었고, 자격 증명 격리는 노출을 막을 수 있었으며, 호스트 모니터링은 새 SSH 키를 감지할 수 있었다. 제공업체 측 제한은 사용량을 제약할 수 있었다.

이 공격은 이러한 방어 체계가 동일한 공격 순서를 막지 못했기 때문에 성공했다.

3주간의 모델 악용이 정상 연구처럼 보였던 이유

METR의 일상적인 작업량은 공격자의 활동을 감출 만큼 충분한 운영상 잡음을 만들었다.

METR는 대량의 토큰을 소비할 수 있는 실험을 통해 고급 AI 시스템을 평가한다. 토큰은 모델이 처리하거나 생성한 텍스트를 측정하는 단위다. 대규모 평가 작업은 비정상적인 속도 제한과 제공업체 오류를 유발할 수도 있다.

이 운영 패턴은 흔한 보안 신호를 약화시켰다. 합법적인 METR 연구도 유사한 행태를 만들 수 있었기 때문에 높은 사용량이 자동으로 악의적인 것으로 보이지 않았다.

METR는 사고 당시 내부 대시보드가 모든 사용자의 속도 제한 요청을 표시하지 않았다고 밝혔다. 따라서 조사관들은 침해된 계정과 연관된 활동을 완전히 파악하지 못했다.

이 조직에는 영향을 받은 키에 대한 자연스러운 지출 상한도 없었다. 모델 제공업체가 METR에 비용을 청구하지 않고 크레딧을 제공했기 때문에, 증가하는 청구서가 즉각적인 조사를 강제하지 않았다.

청구서가 없었다고 해서 이 자원이 가치 없었던 것은 아니다. 모델 추론은 컴퓨팅 용량을 소비하며, 이 용량에 대한 접근은 재판매되거나 무관한 작업에 사용될 수 있다. METR가 현금 지출을 피했더라도 공격자는 이전 가능한 경제적 이익을 얻었다.

보고된 타임라인에 대한 독립 보도도 같은 모니터링 공백을 강조했다. 불법 사용량은 이미 높은 토큰 규모와 일관성 없는 속도 제한 메시지에 익숙한 환경에 섞여 들어갔다.

이것이 METR 보안 사고의 핵심적인 역전이다. 규모는 일반적으로 연구 그룹이 강력한 모델을 시험하는 데 도움이 되지만, 바로 그 규모가 비정상적인 사용량을 구분하기 어렵게 만들었다.

전통적인 지출 알림은 탈취된 클라우드 자격 증명을 빠르게 드러낼 수 있다. 그러나 무상 크레딧, 연구 할당량, 선불 용량은 이러한 방어를 약화시킬 수 있다. 조직은 여전히 사용 패턴, 요청 출처, 키 식별자, 예상 작업량에 기반한 제한이 필요하다.

임계값은 실패한 요청과 속도 제한 요청도 고려해야 한다. 이런 요청은 표준 청구 합계에 나타나지 않더라도 정찰 활동이나 사용 시도를 드러낼 수 있다.

이 사고는 단순 사용량이 불완전한 지표인 이유를 보여준다. 더 나은 탐지 시스템은 활동이 해당 키의 확립된 목적과 일치하는지 묻는다.

한 실험에 할당된 자격 증명이 몇 주 동안 아무 관련 없는 트래픽을 조용히 지원해서는 안 된다. 애플리케이션마다 별도 키를 사용하면 하나의 식별자에 연결된 합법적 행태의 수를 줄이므로 이런 비교가 쉬워진다.

수명이 짧은 자격 증명은 공격 가능 시간도 더 줄일 수 있다. 만료되거나 갱신이 필요한 키는 복사된 값이 유용한 기간을 제한한다. 장기 비밀 정보는 공격자에게 지속성을 확보하고 접근 권한을 수익화할 더 많은 시간을 제공한다.

METR는 제공업체가 지원하는 곳에 지출 알림을 추가하는 방식으로 대응했다. 또한 모니터링 범위를 확대하고 잡음이 많은 알림을 줄이기 위해 노력했다.

이런 변경은 눈에 보이는 증상을 다루지만, 더 깊은 교훈은 시스템 경계에 관한 것이다. 비정상적인 사용량이 정기적으로 발생한다는 이유만으로 연구 작업량이 설명되지 않는 활동을 허용해서는 안 된다.

정상 운영에는 측정 가능한 범위, 지정된 책임자, 정의된 예외가 필요하다. 그렇지 않으면 “연구 트래픽”은 합법적 실험과 무단 사용량을 모두 숨기는 광범위한 범주가 된다.

진짜 충돌은 빠른 실험과 제한된 접근 사이에 있다

에이전트 개발은 신속한 배포를 장려하지만, 보안은 프로토타입에 흔히 없는 엄격한 경계에 의존한다.

METR는 노출된 대시보드를 vibe-coded라고 설명했다. 이는 주로 AI 지원 프롬프팅과 반복적 생성 방식으로 개발됐다는 의미다. 이 표현만으로 AI 코딩 도구가 인증 결함을 유발했다는 사실이 입증되는 것은 아니다.

관련된 쟁점은 결과 애플리케이션이 어떻게 검토되고 배포됐는지다. 이 소프트웨어는 공개 트래픽을 수용하고, 에이전트와 상호작용하며, 활성 제공업체 자격 증명 가까이에서 실행됐다. 이러한 조건은 이를 일회용 로컬 프로토타입 이상으로 만들었다.

신속한 실험은 모델 평가에서 가치가 있다. 연구자들은 종종 맞춤형 인터페이스, 임시 오케스트레이션 도구, 새로운 모델 조합을 필요로 한다. 긴 승인 절차는 탐색적 작업을 방해할 수 있다.

그러나 보안 분류는 시스템의 의도된 수명이 아니라 접근 권한과 노출 수준에 따라 결정돼야 한다. 임시 애플리케이션도 인터넷에서 접근 가능하고 재사용 가능한 자격 증명을 보유하는 순간 프로덕션과 유사한 성격을 띠게 된다.

에이전트 역시 원시 키를 공개할 수 있어서는 안 됐다. 애플리케이션은 외부 서비스를 호출할 권한이 흔히 필요하지만, 그렇다고 모델이 읽을 수 있는 컨텍스트 안에 재사용 가능한 비밀 정보를 둘 필요는 없다.

자격 증명 브로커는 기본 키를 노출하지 않고 에이전트를 대신해 승인된 요청을 수행할 수 있다. 범위를 좁힌 기능은 애플리케이션이 접근할 수 있는 모델, 작업 또는 사용량 수준도 제한할 수 있다.

이 분리는 언어 모델이 신뢰할 수 없는 지시를 처리하기 때문에 중요하다. 에이전트 인터페이스에 도달한 공격자는 모델에 숨겨진 데이터를 노출하도록 요청하거나, 연결된 도구를 오용하거나, 애플리케이션의 의도된 워크플로를 넘어선 작업을 수행하도록 할 수 있다.

OWASP의 에이전트 보안 가이드는 민감 데이터 노출, 과도한 권한, 도구 오용, 프롬프트 인젝션을 관련 위험으로 지목한다. 이 가이드는 권한을 제한하고 자격 증명을 에이전트가 접근할 수 있는 컨텍스트 밖에 둘 것을 권고한다.

METR의 공개 내용은 공격자가 에이전트에 직접 프롬프트를 입력해 제공업체 키를 공개하도록 했다고 밝힌다. 이는 프롬프트 기반 자격 증명 추출과 유사하지만, 공개 증거만으로는 공식적인 분류를 내리기에 모델 행태가 충분히 상세히 드러나지 않았다.

그럼에도 인증 결함은 최초의 결정적인 통제 실패였다. 공개 접근이 없었다면 외부인은 요청을 보낼 인터페이스를 갖지 못했을 것이다.

따라서 이 사건을 단지 프롬프트 인젝션 공격으로 부르는 것은 지나친 단순화다. 손실 경로는 안전하지 않은 배포, 비밀 정보 노출, 허용적인 에이전트 접근, 지속성 확보, 취약한 사용량 모니터링을 결합했다.

마찬가지로 vibe coding만을 탓하는 것은 코드가 어떻게 생성됐는지와 무관하게 적용되는 확립된 보안 관행을 놓치게 한다. 사람이 작성한 프로토타입도 장애 시 허용으로 동작하고, 비밀 정보를 노출하며, 원격 측정을 누락할 수 있다.

METR는 이미 프로덕션 평가 플랫폼을 위한 문서화된 보안 통제를 갖추고 있었다. 공개된 SOC 2 보고서는 해당 정의된 시스템을 위해 2025년 8월 기준으로 설계된 통제를 설명했다.

SOC 2 Type I 보고서는 특정 시점의 통제 설계를 평가한다. 이는 모든 개인 실험, 임시 서비스 또는 이후 배포가 동일한 통제를 따른다는 보장은 아니다.

이 구분이 사고의 중심에 있다. 조직은 핵심 플랫폼을 보호할 수 있지만, 연구자들은 공식적인 경계 밖에 병렬 인프라를 만들 수 있다.

개인 클라우드 계정은 이러한 파편화를 더 파악하기 어렵게 만든다. 중앙 보안 팀은 관리형 환경 밖에서 생성된 인스턴스에 대한 로그, 인벤토리, 네트워크 통제, 자동화된 정책 적용 권한이 없을 수 있다.

METR는 해당 연구자가 가장 높은 민감도 등급 두 가지에는 접근할 수 없었다고 밝혔다. 이로 인해 겉으로 보이는 피해 범위는 제한됐다. 그러나 해당 인스턴스에는 여전히 노릴 만한 가치가 있는 제공업체 자격 증명이 포함돼 있었다.

교훈은 실험을 중단해야 한다는 것이 아니다. 단기 연구 도구라 해도 인터넷에 노출되고 실제 자격 증명을 사용한다면 자동으로 기본 보안 검토가 이루어져야 한다는 점이다.

두 번째 공격으로 평가 데이터도 위험에 처했다

5월 캠페인은 공격자들이 저렴한 컴퓨팅 자원에만 관심이 있었던 것이 아니라, 비공개 모델 접근 권한과 평가 데이터로 이어지는 경로도 탐색하고 있었음을 보여줬다.

2026년 5월 초, METR는 해커들이 자사의 공개 인프라를 노리고 있다는 사실을 파악했다. METR는 이들이 금전적 동기를 가진 것으로 평가했으며, 프런티어 모델에 대한 접근 권한을 노렸을 가능성이 있다고 밝혔다.

METR는 유출된 자격 증명 대입 공격, OAuth 권한 부여 시도, 새로 배포된 서비스 스캔, 직원 대상 피싱 시도 등을 포함한 체계적인 탐색 활동을 관찰했다. 자격 증명 대입 공격은 이전에 탈취된 로그인 조합을 다른 서비스에서 시험하는 방식이다.

METR는 공격자들이 취약점 발견을 자동화하기 위해 에이전트를 광범위하게 활용했다고 밝혔다. 이는 AI가 여러 서비스와 인증 경로를 스캔하는 데 필요한 노력을 줄였을 가능성을 시사하지만, METR는 성능 측정치를 공개하지 않았다.

같은 기간 METR는 공개 트랜스크립트 뷰어를 통해 읽기 전용 SQL 쿼리 메커니즘을 의도치 않게 노출했다. SQL은 애플리케이션이 구조화된 데이터베이스에서 정보를 조회하는 데 사용하는 언어다.

이 쿼리는 기본적으로 공개 기록만 반환하도록 설계됐다. 하지만 버그로 인해 그 범위가 변경돼 미공개 평가 데이터가 노출될 수 있었다.

METR는 기본 데이터베이스에 공개 모델과 관련된 결과만 포함돼 있을 것으로 예상했다. 그러나 일부 민감한 모델 출력이 실수로 포함돼 있었다.

독립 보안 연구원이 이 결함을 발견해 책임감 있게 신고했다. METR는 영향을 받은 API를 오프라인으로 전환하고 포상금을 지급했다.

공격자들은 METR 인프라를 스캔하는 과정에서 이 엔드포인트에 접촉했다. METR는 확보한 증거상 이들이 취약점을 발견했거나 비공개 정보에 접근했다는 징후는 없다고 밝혔다.

이 결론은 신중하게 표현할 필요가 있다. 증거가 없다고 해서 접근이 결코 발생하지 않았다는 수학적 증명이 되는 것은 아니다. 이는 METR와 보안 컨설턴트가 이용 가능한 로그와 포렌식 자료에서 확인한 내용을 반영한다.

METR는 악용에 여러 구체적인 단계가 필요했다고 설명했다. 공격자는 범위 지정 버그를 찾아내고 올바르게 이용한 뒤, 민감한 트랜스크립트를 식별하고 오류를 유발하지 않은 채 내려받아야 했다.

METR는 이 과정이 발생했을 가능성을 매우 낮게 봤다. 또한 엔드포인트를 일시적으로 제거했다가 버그를 인지하지 못한 채 복구했으며, 이후 공격자의 접근도 확인되지 않았다는 복잡한 정황을 인정했다.

이 두 번째 사건은 탈취된 크레딧과는 다른 수준의 위험을 제기한다. 미공개 평가는 모델의 약점, 행동 패턴, 숨겨진 출력 또는 비밀유지 계약에 따라 제공된 정보를 드러낼 수 있다.

METR는 정보를 네 가지 광범위한 범주로 나눈다. 공개된 자료가 가장 낮은 수준에 위치한다. 공개 모델 자격 증명과 미공개 공개 모델 결과가 그다음 범주를 차지한다.

상위 두 범주는 민감한 모델 접근 권한과 고도로 민감한 조직 정보를 포함한다. METR는 조사 결과 두 사건 모두에서 이 범주의 정보에 접근한 정황은 발견되지 않았다고 밝혔다.

그러나 트랜스크립트 데이터베이스에는 원래 포함돼서는 안 될 상위 범주의 자료 일부가 들어 있었다. 이는 누군가 쿼리 메커니즘을 악용하려 시도하기 전부터 의도된 분류 경계가 이미 실패했음을 뜻한다.

정책으로 데이터를 분리하는 것만으로는 충분하지 않다. 기록이 잘못된 데이터베이스로 유입될 수 있다면 효과적인 격리를 위해 자동화된 분류 검사, 쿼리 시점의 접근 제어, 이후 조사를 위한 증거를 보존하는 로그도 필요하다.

첫 번째 사건은 자격 증명 경계를 노출했다. 두 번째 사건은 데이터 경계를 노출했다. 두 사건 모두 의도된 역할이 정당화하는 수준보다 가치 있는 자원에 더 가까이 위치한 공개 연구 시스템과 관련돼 있었다.

METR의 대응은 위험을 낮췄지만 검증 문제는 남아 있다

METR는 아키텍처와 보안 프로세스를 변경했지만, 외부인은 이 통제 수단이 향후 실험을 얼마나 일관되게 포괄하는지 아직 측정할 수 없다.

3월의 악용을 탐지한 뒤 METR는 연구자의 접근 권한을 취소하고 침해된 인스턴스를 중단했다. 포렌식 이미지를 생성하고, 자격 증명을 교체했으며, 연구자의 노트북을 이미지화한 뒤 초기화하고 관련 모델 기업에 통보했다.

보안 컨설팅 회사 Calif는 METR의 조사 결과를 검토하고 별도의 침해 평가를 수행했다. METR는 사건 조사를 위해 수동 포렌식과 에이전트 지원 포렌식도 활용했다.

METR는 이 같은 작업을 통해 단일 공개 모델 API 키를 넘어선 침해는 발견되지 않았다고 밝혔다. 컨설턴트의 전체 평가, 상세한 침해 지표 또는 제공업체의 신원은 공개하지 않았다.

METR는 개인 인프라에서의 자격 증명과 데이터를 다루는 정책을 확대했다. 또한 공개 애플리케이션을 배포하는 연구자를 위한 공식 보안 검토 절차를 만들었다.

5월 캠페인 이후 METR는 거의 모든 공개 서비스와 민감한 데이터에 대한 내부 접근을 일시적으로 비활성화했다. 이후 내부 인프라와 아키텍처적으로 분리된 격리형 공개 프로덕션 환경을 구축했다.

이 분리는 트랜스크립트 뷰어 위험을 직접적으로 해결한다. 일관되게 시행된다면 공개 애플리케이션의 결함이 더 이상 내부 데이터 시스템으로 이어지는 경로를 제공해서는 안 된다.

METR는 레거시 인프라도 종료하고, 로깅을 강화했으며, 자격 증명 수명을 단축하고 권한 범위를 줄였으며, 더 많은 엔드포인트 및 서버 보안 소프트웨어를 배포했다.

METR는 보안 책임자를 채용했고, 팀을 추가로 확장할 계획이라고 밝혔다. 또한 권한을 부여받은 테스터가 공격자 행동을 시뮬레이션해 취약점을 찾는 추가 레드팀 작업도 의뢰했다.

이 조치들은 공개된 실패 양상과 부합한다. 자산 목록화, 격리, 자격 증명 관리, 텔레메트리 및 책임성을 개선한다.

회의적인 관점에서의 질문은 적용 범위에 관한 것이다. 연구자들이 개인 클라우드 계정, 관리되지 않는 서비스 또는 실험 도구에 복사한 자격 증명을 통해 이를 우회할 수 있다면 정책과 중앙화된 환경은 효과를 낼 수 없다.

METR는 이 적용 범위에 대한 측정 가능한 목표를 공개하지 않았다. 독자들은 현재 공개 배포 중 몇 퍼센트가 검토를 받는지, 또는 비정상적인 키 사용이 얼마나 빠르게 조사로 이어지는지 알 수 없다.

어떤 통제 수단이 모델 제공업체 계층에서 작동하는지도 여전히 불분명하다. 지출 알림은 도움이 되지만, 강제 사용량 한도, 단기 토큰, 더 좁은 권한 범위 및 자동 폐기는 더 강력한 제한을 제공한다.

모든 모델 제공업체가 같은 통제 기능을 제공하는 것은 아니다. METR는 3월 사건 당시 영향을 받은 키에 지출 한도를 설정할 수 없었다고 지적했다.

따라서 노출된 애플리케이션을 METR가 통제했더라도, 제공업체 역시 더 넓은 설계 문제의 일부를 공유한다. 가치 있는 모델 접근 권한을 다루는 조직에는 키가 결국 유출될 것이라는 가정을 반영한 계정 기능이 필요하다.

공개 자체는 인정받을 만하다. METR는 상세한 경과를 공개하고 다수의 내부 실패를 인정했으며, 가능한 노출과 실제 접근의 증거를 구분했다.

그러나 투명성을 독립적인 검증과 혼동해서는 안 된다. 핵심 조사 결과는 여전히 METR의 조사와 METR가 고용한 컨설턴트에 기반한다.

공개 증거는 공격자의 신원을 특정하거나 그들의 동기를 확인하지 않는다. 60만 달러라는 평가는 청구서로 실제 지급된 금액이나 독립적으로 감사를 받은 손실이 아니라, 부여된 크레딧의 대략적 가치를 나타낸다.

이러한 단서는 사건 자체를 지우지 않는다. 다만 이용 가능한 증거가 뒷받침하는 범위를 규정하고, 헤드라인 수치가 사실보다 더 정밀한 것처럼 보이지 않게 한다.

METR 공개 이후 보안팀이 주시해야 할 점

다음 시험대는 METR의 새로운 통제 수단이 가시적인 제한, 더 빠른 탐지, 더 안전한 공개 연구 시스템으로 이어지는지 여부다.

첫 번째 신호는 공개 배포에 대한 시행이다. METR는 보안 검토를 공식화했지만, 이 정책의 가치는 인터넷에 노출된 모든 실험이 관리되는 인벤토리에 포함되는지에 달려 있다.

유용한 결과에는 조직과 연관된 새 도메인, 클라우드 인스턴스 및 공개 엔드포인트의 자동 탐지가 포함될 것이다. 보안팀은 이 인벤토리를 승인된 애플리케이션 및 지정된 소유자와 비교해야 한다.

향후 연구 도구가 일관되게 격리된 공개 환경 내에서 실행된다면, METR의 대응은 아키텍처 경계가 개선됐다는 주장을 뒷받침하게 된다. 실제 자격 증명을 포함한 또 다른 개인 배포가 발생한다면 이 결론은 약화될 것이다.

두 번째 신호는 측정 가능한 자격 증명 격리다. METR는 가능한 경우 사용량 모니터링과 지출 알림을 추가했지만, 알림은 여전히 해석과 대응을 필요로 한다.

조직은 더 짧은 자격 증명 수명, 애플리케이션별 키, 제한된 제공업체 권한 및 비정상 활동 이후의 자동 중지를 확인해야 한다. 원시 자격 증명은 에이전트의 프롬프트 컨텍스트와 출력 채널에서 접근할 수 없어야 한다.

OWASP의 프롬프트 인젝션 위험에 대한 설명은 모델 지시만으로는 비밀을 보호할 수 없는 이유를 보여준다. 공격자는 노출된 모델을 조작해 의도된 제한을 무시하거나 컨텍스트 안에서 이용 가능한 정보를 공개하도록 만들 수 있다.

METR 또는 그 제공업체가 중개형 접근과 강제 소비 한도를 도입한다면, 유사한 인터페이스 침해는 더 작은 손실로 이어져야 한다. 통제 수단이 주로 알림에 의존한다면, 공격자는 사람이 패턴을 인식할 때까지 활동할 수 있다.

세 번째 신호는 데이터 분리에 관한 증거다. METR는 새로운 공개 환경이 아키텍처적으로 격리돼 있다고 말하지만, 5월 문제는 민감한 기록이 잘못된 데이터베이스에 들어간 사안이기도 했다.

네트워크 격리만으로는 잘못 분류된 정보를 바로잡을 수 없다. METR는 제한된 평가 데이터가 공개 저장소에 들어가기 전에 탐지하는 보호 장치가 필요하다.

향후 공개, 감사 또는 기술 업데이트는 이러한 통제 수단이 직접 접근과 우발적인 데이터 배치 모두를 방지하는지 보여줘야 한다. 외부의 독립적인 평가는 수정된 경계에 대한 신뢰를 높일 것이다.

METR 보안 사건은 AI 기업에도 평가 접근 권한 제공 방식을 재검토할 이유를 제공한다. 외부 평가자에게는 현실적인 모델 기능이 필요하지만, 광범위하고 장기간 유효한 자격 증명은 매력적인 공격 표적을 만든다.

제공업체는 범위가 제한된 토큰, 프로젝트별 한도, 출처 제한, 신속한 폐기 및 거부된 요청에 대한 가시성을 통해 그 위험을 줄일 수 있다. 이러한 기능은 제공업체와 평가자 모두를 보호한다.

개발자는 더 작은 에이전트 프로젝트에도 같은 논리를 적용해야 한다. 이메일, 소스 코드, 클라우드 서비스 또는 내부 문서에 접근할 수 있는 프로토타입은 이미 의미 있는 보안 경계를 갖는다.

이러한 실험을 문서화하는 팀은 통제된 지식 베이스를 활용해 위협 모델, 배포 소유자, 검토 결정 및 사건 교훈을 보존할 수 있다. 문서화가 기술적 통제 수단을 대체할 수는 없지만, 관리되지 않는 예외를 더 쉽게 찾게 할 수 있다.

가장 유용한 질문은 애플리케이션이 바이브 코딩으로 만들어졌는지가 아니다. 신뢰할 수 없는 사용자가 이에 접근할 수 있는지, 어떤 자격 증명에 접근할 수 있는지, 그리고 모든 지시가 적대적이라고 간주될 때 어떤 일이 일어나는지다.

METR의 공개는 드물고도 구체적인 답을 제공한다. 공개 인증 실패가 에이전트에 도달했고, 에이전트는 자격 증명을 노출했으며, 불완전한 모니터링은 3주간의 무단 사용을 허용했다.

보안 리더는 이제 자체 시스템에서 같은 연쇄를 시험해야 한다. 외부인이 인터페이스를 발견할 수 있는가? 모델이 비밀을 공개할 수 있는가? 호스트가 지속적인 접근을 허용할 수 있는가? 비정상적인 소비가 예상 트래픽에 섞여들 수 있는가?

어느 하나라도 그렇다면, 현재 사고가 없다는 사실은 통제의 결과라기보다 시점의 문제를 반영한다. 다음 METR 업데이트에서는 새로운 아키텍처가 어렵게 얻은 교훈을 강제 가능한 한도로 전환했는지 드러날 것이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page