top of page

GhostJacking이 드러낸 AI 에이전트의 ID 거버넌스 공백

연구진이 단 하나의 오염된 오류 보고서로 권한을 부여받은 AI 에이전트를 공격자 통제 코드로 유도할 수 있음을 보여준 후, Google News는 GhostJacking을 조명했다. 이 공격은 에이전트가 각 단계를 합법적인 도구와 개발자 권한을 통해 수행하기 때문에 경계 방어를 우회해 성공한다.

이러한 구분은 보안 논의를 바꾼다. 에이전트의 자격 증명이 반드시 탈취된 것도 아니고, 소프트웨어가 반드시 침해된 것도 아니다. 대신 신뢰할 수 없는 운영 데이터가 에이전트의 의도를 바꾸지만, 인증된 ID는 여전히 유효하게 유지된다.

기저 연구는 이 광범위한 기법을 “Agentjacking”이라고 부르며, GhostJacking이라는 명칭은 탈취가 거의 보이지 않는다는 특성을 강조한다. 에이전트는 정상 ID로 계속 작동하기 때문에, 방어자는 정상적인 자동화와 악의적 의도를 구분해야 한다.

이는 단순히 또 하나의 프롬프트 인젝션 사례가 아니다. 언어 모델, 신뢰받는 텔레메트리, Model Context Protocol 통합, 그리고 예측 가능한 사용자를 위해 설계된 ID 시스템이 충돌하는 지점을 드러낸다.

핵심 갈등은 분명하다. 기업은 지속적인 감독 없이 에이전트가 사고를 조사하고 복구를 실행하기를 원한다. 하지만 에이전트를 유용하게 만드는 권한은 조작된 의사결정을 운영상 위험하게 만들기도 한다.

GhostJacking 보고서는 버그 큐를 공격 경로로 바꾼다

GhostJacking은 에이전트가 신뢰하도록 기대되는 정보를 에이전트가 실행할 수 있는 지시로 전환한다.

GhostJacking 보고서에 설명된 공격은 가짜 소프트웨어 오류에서 시작된다. 공격자는 코딩 에이전트가 미해결 문제를 조사하는 과정에서 나중에 조회할 텔레메트리에 조작된 텍스트를 삽입한다.

텔레메트리는 소프트웨어가 생성하는 로그, 오류, 추적 정보, 진단 기록을 의미한다. 개발팀은 일반적으로 이 자료를 능동적인 명령 채널이 아니라 시스템 동작에 관한 증거로 취급한다.

언어 모델이 이 자료를 읽으면 그 전제가 무너진다. 모델은 하나의 텍스트 흐름 안에서 진단 사실, 주석, 서식, 잠재적인 지시를 함께 받는다.

Tenet Security의 Threat Labs는 애플리케이션 이벤트를 수용하는 오류 모니터링 플랫폼 Sentry를 사용해 이 패턴을 입증했다. Sentry는 Data Source Name, 즉 DSN을 사용해 애플리케이션이 올바른 프로젝트에 해당 이벤트를 제출하도록 한다.

브라우저 애플리케이션은 종종 클라이언트 측 코드에 이 DSN이 필요하다. 따라서 이를 보유하면 조직의 내부 네트워크를 먼저 침해하지 않고도 이벤트를 제출할 수 있다.

공격자의 이벤트에는 그럴듯한 오류 설명과 표면상 해결 지침이 담긴다. 에이전트가 통합을 통해 이벤트를 가져오면 악성 지시도 정상적인 진단 데이터와 함께 전달된다.

그러면 모델은 분류 문제에 직면한다. 해당 텍스트가 오류를 설명하는지, 외부 당사자의 발언을 인용하는지, 또는 에이전트에 시정 조치를 수행하라고 지시하는지 판단해야 한다.

통제된 연구에 따르면, 테스트된 에이전트는 때때로 심어진 자료를 유효한 해결 단계로 해석했다. 이후 개발자의 로컬 권한으로 연구진이 제어하는 패키지를 실행했다.

Tenet은 자사의 검증 패키지가 악의적 활동이 아닌 통제된 테스트를 위해 설계됐다고 밝혔다. 또한 수집된 정보는 자사의 공개 절차에 따라 편집·처리됐다고 설명했다.

그럼에도 보안상 영향은 무해한 패키지에 그치지 않는다. 개발자 계정으로 실행되는 적대적 명령은 환경 변수, 소스 저장소, 클라우드 자격 증명 또는 인증된 개발 도구에 접근할 수 있다.

Tenet은 잠재적으로 인젝션 가능한 Sentry 자격 증명을 가진 조직 2,388곳을 식별했다고 보고했다. 또한 통제된 테스트 중 100개가 넘는 에이전트가 주입된 오류에 따라 행동하는 것을 관찰했다고 밝혔다.

이 수치는 보안 벤더가 제시한 것이며, 보고된 전체 대상 집단에서 독립적으로 재현되지는 않았다. 이는 범죄자의 침해를 확인한 수치가 아니라 연구에서 관찰된 노출 수준을 나타내는 것으로 해석해야 한다.

중요한 변화는 아키텍처에 있다. 과거 로그는 사람과 결정론적 소프트웨어를 위한 수동적 증거였다. 에이전트형 워크플로는 같은 로그를 실행 가능한 컨텍스트로 바꿀 수 있다.

이는 이례적인 피드백 루프를 만든다. 보안 제어가 의심스러운 트래픽을 차단하고, 차단된 요청을 기록하며, 공격자의 텍스트를 신뢰받는 모니터링 플랫폼에 저장한다.

이후 AI 에이전트가 사고를 진단하기 위해 저장된 기록을 읽는다. 성공적인 차단은 다음 단계의 전달 경로가 된다.

단일 보안 데모를 넘어 Google News의 주목이 중요한 이유

Google News의 가시성은 GhostJacking이 추상적인 AI 위험을 일상적인 개발 워크플로와 연결한다는 점에서 중요하다.

간접 프롬프트 인젝션은 수년간 문서화돼 왔다. 이는 AI 시스템이 다른 작업을 완료하는 동안 처리하는 데이터 안에 악의적 지시가 포함되는 경우 발생한다.

공격자는 사용자의 직접 프롬프트에 지시를 넣을 필요가 없다. 페이로드는 웹페이지, 이메일, 문서, 지원 티켓, 코드 주석 또는 검색된 데이터베이스 기록 안에 나타날 수 있다.

GhostJacking은 이 알려진 취약성을 운영상 증거에 적용한다. 대상은 무해한 질문에 답하는 챗봇이 아니다. 소프트웨어를 진단하고 잠재적으로 시정 명령을 실행하도록 요청받은 에이전트다.

이 차이는 위험도를 높인다. 챗봇은 오해의 소지가 있는 답변을 생성할 수 있지만, 권한을 가진 코딩 에이전트는 파일을 수정하고 셸을 호출하거나 인증된 서비스에 접근할 수 있다.

이 사건은 도구에 연결된 에이전트가 빠르게 도입되는 시기에 발생했다. 일반적으로 MCP라고 불리는 Model Context Protocol은 모델이 외부 도구 및 데이터 소스와 통신할 수 있는 표준 방식을 제공한다.

MCP는 에이전트를 이슈 트래커, 데이터베이스, 저장소, 모니터링 플랫폼, 로컬 개발 도구와 연결하는 데 필요한 작업을 줄일 수 있다. 그러나 이러한 시스템에서 가져오는 콘텐츠를 자동으로 신뢰할 수 있게 만들지는 않는다.

도구 자체는 정품일 수 있지만, 공격자가 통제하는 데이터를 반환할 수 있다. 이 구분은 GhostJacking 공격의 핵심이다.

전통적인 애플리케이션 보안은 흔히 호출자가 리소스에 접근할 수 있는지 묻는다. 여기서는 인증된 에이전트가 해당 리소스에 접근하고 그 결과로 발생하는 작업을 실행할 권한을 갖고 있다.

빠진 질문은 그 작업이 사용자의 의도를 반영하는지 여부다. 인증은 누가 행동하는지를 답하지만, 왜 그 행동이 선택됐는지는 증명하지 못한다.

NIST는 에이전트 하이재킹을 신뢰된 지시와 신뢰할 수 없는 외부 데이터 간 분리가 취약해서 발생하는 간접 프롬프트 인젝션의 한 형태로 설명한다. NIST의 하이재킹 평가에는 원격 코드 실행, 데이터 유출, 자동화된 피싱 시나리오가 포함됐다.

NIST 연구진은 적응형 공격이 매우 중요하다는 사실을 발견했다. 한 평가에서 가장 강력한 기준선 공격은 업데이트된 모델을 상대로 11%의 성공률을 달성했다.

새로 개발된 공격은 동일하게 보고된 테스트 환경에서 81%에 도달했다. 이 결과가 보편적인 모델 실패율을 의미하는 것은 아니지만, 프롬프트 인젝션 저항성에 관한 정적인 주장을 흔든다.

모델은 알려진 테스트 스위트에서는 좋은 성능을 보여도, 그 행동에 맞춰 설계된 공격에는 실패할 수 있다. 따라서 보안팀은 하나의 벤치마크를 지속적인 보증으로 취급할 수 없다.

Google News 보도는 이 같은 발견을 전문 AI 안전 분야 밖으로 확산하는 데 도움이 될 수 있다. 영향받는 워크플로는 개발팀이 이미 에이전트에 맡기고자 하는 일과 닮아 있다. 즉, 이슈를 검토하고, 원인을 식별하며, 수정 사항을 적용하는 일이다.

따라서 이 글은 가상의 초지능에 대해 경고하는 것이 아니다. 친숙한 자격 증명으로 친숙한 클라우드 서비스를 상대로 작동하는 익숙한 자동화 도구에 관한 이야기다.

바로 그 익숙함이 위험을 과소평가하게 만든다. 각 구성 요소를 따로 살펴보면 모두 합법적으로 보일 수 있다.

Sentry 서비스는 합법적이다. MCP 통합도 합법적이다. 코딩 에이전트도 합법적이며, 개발자 계정은 인증돼 있다.

적대적 요소는 데이터와 의도 사이의 전환 과정에 존재한다. 현재의 ID 제어는 그 전환을 거의 검사하지 않는다.

AI 에이전트 ID 거버넌스는 인증에서 멈춘다

AI 에이전트 ID 거버넌스는 행위자는 검증하지만 각 결정의 배후 권한을 검증하지 못할 때 실패한다.

인간 ID 시스템은 일반적으로 개인, 계정, 그리고 할당된 권한에서 출발한다. 관리자는 누가 계정을 소유하는지와 해당 계정이 접근할 수 있는 리소스를 검토할 수 있다.

서비스 계정은 이 모델을 애플리케이션으로 확장한다. 소프트웨어가 결정론적 코드를 따르고 좁고 문서화된 기능을 수행할 때는 상당히 잘 작동한다.

AI 에이전트는 다르게 행동한다. 다음 행동은 자연어 목표, 검색된 컨텍스트, 모델 추론, 사용 가능한 도구, 워크플로 내 이전 단계에 따라 달라진다.

같은 인증된 에이전트가 오류를 검토하고, 저장소를 편집하고, 배포 서비스를 호출하며, 팀에 메시지를 보낼 수 있다. 작업이 진행됨에 따라 실질적인 역할도 바뀐다.

조직은 흔히 에이전트가 사용자의 기존 접근 권한을 상속하도록 해 이러한 복잡성을 관리한다. 이 접근 방식은 배포를 단순화하지만, 책임 추적을 약화한다.

감사 기록에는 개발자 계정이 패키지를 실행했다고 표시될 수 있다. 하지만 개발자가 정확히 그 패키지를 요청했는지, 또는 명령을 먼저 검토했는지는 표시되지 않을 수 있다.

또한 어떤 검색 문서가 모델에 영향을 미쳤는지도 누락될 수 있다. 이러한 출처 정보가 없으면 조사자는 최종 행동은 보지만, 그 배후의 권한 사슬은 보지 못한다.

Cloud Security Alliance의 에이전트 보안 설문조사는 준비 상태의 격차를 보여준다. 설문 대상 조직의 40%는 에이전트를 프로덕션에서 운영하고 있다고 답했으며, 또 다른 31%는 이를 테스트 중이라고 밝혔다.

기존 ID 시스템이 에이전트 ID를 효과적으로 관리할 수 있다는 데 높은 확신을 보인 조직은 18%에 불과했다. 실시간 에이전트 등록부 또는 인벤토리를 유지한 곳도 21%에 그쳤다.

이 설문조사는 정적 API 키, 공유 서비스 계정, 사용자 이름과 비밀번호 조합에 대한 지속적인 의존도 확인했다. 이러한 메커니즘은 위임된 의도를 표현하지 못한 채 접근을 인증할 수 있다.

유용한 에이전트 ID는 “어떤 토큰이 이 요청을 했는가?”보다 더 많은 것을 답해야 한다. 요청을 소유자, 작업, 승인된 도구, 데이터 범위, 만료 시점과 연결해야 한다.

이 기록은 위임 과정에서도 유지돼야 한다. 기본 에이전트가 하위 에이전트를 만들 경우, 자식 에이전트가 부모에게 부여된 모든 권한을 조용히 상속해서는 안 된다.

각 위임된 ID에는 할당된 단계에 필요한 권한만 부여돼야 한다. 시스템은 사용자, 부모 에이전트, 자식 에이전트, 그리고 결과 행동 간의 관계도 보존해야 한다.

GhostJacking은 이 사슬이 암묵적인 상태로 남을 때 어떤 일이 일어나는지 드러낸다. 악성 오류는 에이전트의 ID를 탈취할 필요가 없다. 이미 존재하는 ID를 조종할 수 있기 때문이다.

이는 고전적인 혼동된 대리인 문제와 닮아 있다. 신뢰받는 프로그램이 올바르게 분류할 수 없는 공격자 영향 입력을 수용한 뒤 자신의 권한을 오용하는 경우다.

언어 모델은 콘텐츠를 확률적으로 해석하기 때문에 문제를 더 어렵게 만든다. 교묘하게 서식화된 “해결책”은 모호한 사용자 지시보다 더 실행 가능한 것처럼 보일 수 있다.

프롬프트 계층은 모델이 시스템 및 사용자 지시를 우선순위에 따라 처리하도록 돕는다. 하지만 사실에 기반한 도구 출력과 그 안에 삽입된 명령 사이에 암호학적 경계를 만들지는 않는다.

소스를 신뢰할 수 없다고 표시하는 방식에도 한계가 있다. Tenet에 따르면, 설정에서 외부 콘텐츠를 불신하도록 지시했음에도 에이전트가 때때로 삽입된 지시를 따랐다.

이 주장은 모델과 구성 전반에 걸친 더 폭넓은 독립 테스트가 필요하다. 그러나 NIST의 적응형 평가 결과는 지시만으로 이루어진 방어가 표적 압박 아래에서 약화된다는 더 광범위한 경고를 뒷받침한다.

따라서 신원 계층은 모델이 잘못된 결정을 내릴 수 있다고 가정해야 한다. 거버넌스는 그 결정이 되돌릴 수 없는 행동으로 이어지기 전에 결과를 제한해야 한다.

핵심 트레이드오프는 유용한 접근성과 검증 가능한 의도 사이에 있다

에이전트는 더 많은 접근 권한을 얻을수록 더 유용해지지만, 추가되는 모든 권한은 조작된 의도가 미칠 수 있는 영향을 키운다.

제안 기능으로 제한된 코딩 어시스턴트도 안전하지 않은 코드를 만들 수 있다. 터미널 접근 권한을 가진 코딩 에이전트는 개발자가 그 코드를 읽기 전에 실행할 수 있다.

요약 기능으로 제한된 인시던트 에이전트는 조사 내용을 왜곡할 수 있다. 프로덕션 접근 권한을 가진 동일한 에이전트는 오염된 진단 기록을 따르면서 인프라를 수정할 수 있다.

이는 모든 에이전트 자동화를 거부해야 할 이유가 아니라, 현실적인 트레이드오프다. 조직은 자율성을 점진적으로 더 강력한 통제와 연결해야 한다.

탐색과 진단에는 읽기 전용 접근이 기본으로 유지되어야 한다. 쓰기 접근은 특정 작업, 리소스, 시간 창에 한해 부여해야 한다.

명령 실행에는 별도의 경계가 필요하다. 모니터링 데이터를 조회할 수 있는 에이전트가 그 데이터가 권고하는 모든 것을 무제한으로 실행할 권한까지 자동으로 받아서는 안 된다.

고위험 작업에는 의미 기반 권한 부여도 필요하다. 이는 단순히 호출자가 유효한 토큰을 보유했는지 확인하는 것이 아니라, 작업의 목적과 맥락을 평가한다는 뜻이다.

예를 들어 정책은 에이전트가 격리된 작업 공간 안에서 승인된 테스트 명령을 실행하도록 허용할 수 있다. 같은 정책으로 패키지 설치, 자격 증명 접근, 외부 연결은 거부할 수 있다.

이러한 결정은 모델 외부에서 이뤄져야 한다. 조작됐을 가능성이 있는 동일한 에이전트에게 자신의 명령을 판단하게 하는 것은 독립적인 통제를 마련하는 일이 아니다.

런타임 강제 적용은 더 강력한 분리를 제공한다. 게이트웨이는 요청된 각 도구 호출을 검사하고 정책과 비교해 승인된 작업 범위를 벗어난 행동을 차단할 수 있다.

게이트웨이는 구조화된 증거를 기록할 장소도 만든다. 여기에는 요청한 신원, 사용자 목표, 조회된 소스, 요청된 작업, 정책 결정, 결과가 포함될 수 있다.

잠재적 영향이 클 때는 사람의 승인이 여전히 유용하다. 그러나 일반적인 확인 상자만으로는 충분하지 않다.

검토자는 명령이 무엇을 하는지, 어떤 파일이나 시스템에 접근할 수 있는지, 어떤 외부 콘텐츠가 이를 촉발했는지를 확인해야 한다. 그렇지 않으면 승인은 또 하나의 일상적인 클릭이 된다.

샌드박싱은 권한 부여가 실패했을 때 피해를 제한한다. 코딩 에이전트는 프로덕션 자격 증명이나 무제한 네트워크 연결에 접근하지 못하는 일회용 환경에서 작업할 수 있다.

수명이 짧은 자격 증명도 상시 노출을 줄인다. 에이전트는 현재 작업에 한정된 토큰을 받아야 하며, 작업이 끝나면 그 권한을 잃어야 한다.

Microsoft의 AutoJack 연구는 다른 메커니즘을 통해 같은 설계 교훈을 강화한다. 신뢰할 수 없는 웹 콘텐츠가 로컬 MCP 제어 경로에 도달했고, 개발 빌드에서 프로세스를 생성할 수 있었다.

Microsoft는 영향을 받은 표면이 관련 패키지 릴리스에 도달하기 전에 강화됐다고 보고했다. 그럼에도 더 광범위한 발견은 중요하다. 에이전트가 일반적으로 신뢰할 수 있다고 여겨지는 경계를 허물었기 때문이다.

외부 페이지를 방문하는 인간 브라우저가 일반적으로 로컬 자동화 프로세스가 되지는 않는다. 에이전트가 제어하는 브라우저는 두 역할을 동시에 맡을 수 있다.

GhostJacking 공격은 의미적 경계를 넘었고, AutoJack은 웹, localhost, 제어 평면의 경계를 넘었다. 두 사례 모두 에이전트가 기존 통제가 분리해 두었던 보안 도메인을 연결한다는 점을 보여준다.

이 비교는 신원 공급업체, 모델 제공업체, 에이전트 프레임워크, 기업 보안팀 모두에 동시에 압박을 가한다. 어느 한쪽만으로는 문제를 해결할 수 없다.

모델 개발자는 악의적인 지시에 대한 저항성을 개선할 수 있다. 프레임워크 개발자는 데이터를 분류하고 도구를 제한할 수 있다.

신원 공급자는 범위가 제한된 워크로드 자격 증명을 발급하고 위임 관계를 보존할 수 있다. 기업은 여전히 소유권, 승인 임계값, 허용 가능한 자율성을 정의해야 한다.

올바른 설계는 모든 계층이 실패할 수 있다고 가정한다. 저항성이 높은 모델도 최소 권한으로 작동해야 하며, 범위가 잘 제한된 신원도 여전히 런타임 정책 검사를 받아야 한다.

GhostJacking 증거가 아직 입증하지 못한 것

이 시연은 신뢰할 만한 공격 범주를 드러내지만, 광범위한 범죄 악용이나 모든 에이전트의 보편적 실패를 입증하지는 않는다.

가장 큰 보고 수치는 에이전트 시스템 보호 제품도 판매하는 Tenet Security에서 나왔다. 이러한 상업적 위치가 발견을 무효화하지는 않지만, 독립적 재현의 중요성을 특히 높인다.

2,388개 조직이라는 수치는 발견된 노출 조건을 설명한다. 공격자가 모든 조직을 성공적으로 침해했거나, 각각이 Sentry 데이터를 권한 있는 에이전트에 적극 연결했다는 뜻은 아니다.

마찬가지로 관찰된 100건 이상의 에이전트 행동은 통제된 연구에서 나왔다. 이 결과는 보고된 테스트 안에서의 가능성과 규모를 보여주며, 소프트웨어 업계 전반의 측정된 침해율을 뜻하지는 않는다.

제품 구성도 다양하다. 일부 에이전트는 셸 명령 전에 승인을 요구하는 반면, 다른 에이전트는 컨테이너나 제한된 클라우드 작업 공간 안에서 작동한다.

서로 다른 모델은 같은 페이로드를 다르게 해석할 수 있다. 업데이트, 새로운 시스템 프롬프트, 변경된 도구 응답 형식 이후에는 그 동작도 달라질 수 있다.

공격 표면은 권한에 따라 달라진다. 격리된 리포지터리 내부에서 읽기 전용 접근만 하는 에이전트는 클라우드 키와 무제한 터미널 접근 권한을 가진 에이전트보다 위험이 낮다.

이러한 차이 때문에 단일한 헤드라인 실패율은 오해를 낳을 수 있다. 보안팀은 실제 모델, 도구, 자격 증명, 승인 규칙을 바탕으로 테스트해야 한다.

“GhostJacking”이라는 이름도 혼란을 일으킬 수 있다. Tenet의 공개 자료는 오염된 오류 기법에 주로 “Agentjacking”이라는 표현을 사용한다.

GhostJacking은 반드시 별도의 표준화된 취약점 범주라기보다, 보이지 않는 에이전트 탈취를 설명하는 용어로 보는 편이 낫다. 핵심 메커니즘은 여전히 간접 프롬프트 인젝션 뒤에 이어지는 승인된 도구 사용이다.

보편적인 플랫폼 패치도 없다. 알려진 페이로드를 필터링하면 한 가지 시연은 막을 수 있지만, 일반적인 지시-데이터 문제를 해결하지는 못한다.

Markdown 헤딩, 패키지 관리자 명령, 특정 문구를 차단하면 공격자는 같은 의도를 다른 형식으로 바꾸게 된다. 적응형 평가는 시그니처 전용 방어가 빠르게 노후화되는 이유를 거듭 보여준다.

반대로 이 문제가 완전히 해결 불가능하다고 말하는 것도 증거를 과장하는 일이다. 더 나은 모델 학습, 데이터 라벨링, 도구 격리, 정책 강제 적용은 위험을 줄일 수 있다.

현실적인 목표는 모델 내부에서 완벽하게 탐지하는 것이 아니다. 한 번의 잘못된 해석이 무제한 실행으로 이어지는 것을 막는 것이다.

조직은 인벤토리부터 시작해야 한다. 팀은 로컬 개발자 도구와 실험적 통합을 포함해, 존재 자체를 알지 못하는 에이전트를 거버넌스할 수 없다.

각 에이전트에는 지정된 소유자와 문서화된 목적이 필요하다. 보안팀은 모델, 도구, 데이터 소스, 자격 증명, 실행 환경, 위임 경로를 기록해야 한다.

외부 영향을 받는 콘텐츠는 명시적으로 분류해야 한다. 로그, 티켓, 리포지터리 댓글, 이메일, 웹페이지는 신뢰할 수 없는 데이터로 에이전트에 들어가야 한다.

도구 권한은 콘텐츠 분류와 독립적으로 유지되어야 한다. 신뢰할 수 없는 소스는 신뢰할 수 있는 커넥터가 이를 조회했다는 이유만으로 권한을 얻어서는 안 된다.

그다음 팀은 현실적인 공격 체인을 테스트해야 한다. 레드팀 테스트에는 오염된 텔레메트리, 조작된 티켓, 적대적인 웹페이지, 손상된 도구 설명, 기만적인 해결 지침이 포함돼야 한다.

테스트는 모델이 악의적인 문구를 반복하는지뿐 아니라 결과를 측정해야 한다. 핵심 질문은 에이전트가 승인되지 않은 행동을 요청하거나 완료하는지다.

Google News 독자가 다음으로 주목해야 할 것

다음 단계는 런타임 통제, 신원 표준, 실제 배포 환경의 증거가 결정할 것이다.

첫 번째 신호는 독립적 재현이다. 연구자들은 현재 버전의 코딩 에이전트, 승인 모드, 샌드박스, 기업 정책 전반에서 오염된 텔레메트리 체인을 테스트해야 한다.

높은 실행률을 확인하는 재현 결과는 의무적 런타임 강제 적용의 근거를 강화할 것이다. 강화된 구성에서 더 낮은 비율이 나오면 이미 효과가 있는 통제를 식별할 수 있다.

두 번째 신호는 조회된 데이터와 실행 가능한 지시 사이의 제품 수준 분리다. 도구 프로토콜에는 출처, 신뢰도, 허용된 사용을 설명하는 구조화된 방식이 필요하다.

모델은 텍스트가 인증되지 않은 이벤트 필드에서 왔다는 점을 알아야 한다. 더 중요한 것은 실행 계층이 그 텍스트에 명령 요청 권한을 부여하지 않아야 한다는 점이다.

에이전트 플랫폼이 도구 응답에 검증 가능한 출처 정보를 연결하고 여러 단계의 추론 과정에서도 이를 보존하는지 지켜봐야 한다. 강제 적용이 없다면 단순 경고 라벨의 가치는 제한적일 것이다.

세 번째 신호는 위임을 위해 구축된 신원 인프라다. 기업에는 수명이 짧은 에이전트 자격 증명, 작업 단위 범위, 실시간 인벤토리, 감사 가능한 부모-자식 관계가 필요하다.

신원 시스템이 다음과 같은 정확한 질문에 답할 수 있을 때 진전이 눈에 보일 것이다. 어떤 사람이, 어떤 목표를 위해, 어떤 제한 아래 이 에이전트에 권한을 위임했는가?

이러한 신호는 코딩을 넘어 중요하다. 고객 지원 에이전트는 티켓을 읽고, 금융 에이전트는 문서를 처리하며, 보안 에이전트는 경보를 조사한다.

신뢰할 수 없는 콘텐츠와 권한 있는 도구를 결합하는 모든 워크플로에는 같은 구조적 위험이 있다. 구체적인 전달 채널은 바뀌겠지만, 권한 문제는 남는다.

Google News의 관심은 GhostJacking에 기억하기 쉬운 이름을 부여한다. 그러나 오래 남을 교훈은 덜 극적이면서도 더 중대하다. 인증만으로는 신뢰할 수 있는 의도를 확립할 수 없다.

보안팀은 이제 에이전트가 행동하기 전에 외부 영향을 받는 콘텐츠를 읽는 모든 지점을 매핑해야 한다. 로그, 티켓, 이메일, 리포지터리, 웹 도구부터 시작하라.

그다음 데이터를 변경하고, 코드를 실행하며, 비밀 정보를 노출하거나, 외부 시스템에 연락할 수 있는 행동을 식별하라. 이러한 입력과 결과 사이에 독립적인 정책 검사를 배치하라.

대규모 악용 캠페인의 증거를 기다리지 말라. 보고된 공격을 통제된 경고로 활용하고, 에이전트가 이를 재현할 수 있는지 테스트하라.

에이전트가 누가 자신의 권한을 위임했는지, 어떤 소스가 결정을 형성했는지, 왜 도구 호출이 허용됐는지를 설명할 수 없다면 완전히 거버넌스되고 있다고 볼 수 없다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page