AI 에이전트가 확대하는 엔터프라이즈 보안 피해 범위
- Ethan Carter

- 8월 12일
- 11분 분량
이번 주 Google News는 뚜렷한 엔터프라이즈 충돌을 보여줬다. AI 에이전트의 권한은 더 넓어지는 반면, 이를 둘러싼 통제 체계는 여전히 불완전하다. BankInfoSecurity의 헤드라인은 이 우려를 운영 관점에서 포착한다. 이제 에이전트는 단순히 텍스트만 생성하지 않는다. 기록을 조회하고, 소프트웨어를 호출하며, 파일을 변경하고, 메시지를 보내고, 워크플로를 실행할 수 있다.
이 조합은 AI 실패의 의미를 바꾼다. 챗봇의 오류는 대개 대화 안에 머문다. 반면 에이전트의 오류는 연결된 모든 도구, 자격 증명, 데이터 저장소, 하위 시스템으로 퍼질 수 있다. 피해 범위는 하나의 손상되었거나 잘못된 행동으로 도달할 수 있는 전체 피해 규모를 측정한다.
따라서 핵심 경쟁 구도는 AI 역량과 기존 소프트웨어의 대결이 아니다. 에이전트 자율성과 엔터프라이즈 격리의 대결이다. 기업은 에이전트가 더 적은 중단으로 다단계 업무를 완료하기를 원한다. 보안팀은 에이전트가 제한된 ID, 최소 권한, 검증된 도구, 관찰 가능한 승인 경로를 통해 작동해야 한다고 본다.
Anthropic은 자사 배포 환경에서 같은 상충관계를 설명했다. 이 회사는 코딩 에이전트의 유용성이 높아지면서 내부 서비스를 중단시킬 수 있을 정도의 접근 권한이 일상화됐다고 밝혔다. 그러나 엔지니어들은 모델 수준의 안전장치만으로는 완전한 보호를 제공할 수 없다는 결론도 내렸다.
이러한 반전은 한 공급업체에만 국한되지 않는다. 더 나은 추론 능력은 명백한 실수를 줄일 수 있지만, 동시에 에이전트가 목표에 도달하는 더 많은 경로를 찾도록 돕는다. 이제 기업은 정보를 해석하고, 행동을 선택하며, 실행 중 계획을 조정하는 시스템을 보호해야 한다.
Google News의 경고가 실제로 바꾸는 것
소프트웨어가 미리 정의된 지시를 단순 실행하는 것이 아니라, 자신의 접근 권한을 어떻게 사용할지 결정할 수 있게 되면 보안 경계가 이동한다.
전통적인 자동화는 설계된 경로를 따른다. 급여 처리 스크립트는 지정된 기록을 가져와 정의된 계산을 수행하고, 알려진 대상에 결과를 기록한다. 권한이 과도할 수는 있어도 방어자는 여전히 예상되는 순서를 파악할 수 있다.
AI 에이전트는 요청과 행동 사이에 의사결정 계층을 도입한다. 목표를 해석하고, 이를 작업으로 나누며, 도구를 선택하고, 결과를 검토한 뒤 계획을 수정한다. 이러한 유연성은 가치를 만들지만 행동 예측 가능성도 낮춘다.
NIST는 에이전트 시스템을 실제 환경에 영향을 미치는 자율적 행동을 계획하고 수행할 수 있는 소프트웨어로 정의한다. 2026년 1월 발표한 에이전트 보안 정보 요청에서는 세 가지 뚜렷한 우려를 제시했다. 에이전트는 적대적 데이터를 처리할 수 있고, 오염된 모델에 의존할 수 있으며, 외부 공격자 없이도 보안을 훼손할 수 있다.
첫 번째 문제는 간접 프롬프트 인젝션이다. 공격자는 이메일, 웹페이지, 문서, 지원 티켓처럼 에이전트가 나중에 읽게 될 콘텐츠 안에 지시를 숨긴다. 에이전트는 이러한 악의적 지시를 자신에게 할당된 작업의 일부로 오인할 수 있다.
이는 사용자가 챗봇에 직접 규칙을 위반하라고 요청하는 것과는 다르다. 에이전트를 운영하는 사람은 악성 콘텐츠를 전혀 보지 못할 수도 있다. 메시지를 요약하거나 문서를 검토하는 일상적인 요청도 공격을 모델의 작업 컨텍스트로 가져올 수 있다.
두 번째 문제는 권한이다. 주입된 지시는 에이전트가 이용할 수 있는 접근 권한만큼만 영향을 미친다. 읽기 전용 리서치 에이전트는 조작된 정보를 반환할 수 있다. 이메일, 클라우드 스토리지, 코드 실행, 데이터베이스 권한을 지닌 에이전트는 데이터를 노출하거나 시스템을 변경할 수 있다.
세 번째 문제는 지속성이다. 일부 에이전트는 작업 전반에 걸쳐 메모리를 유지하거나 지식 저장소에서 이전 컨텍스트를 검색한다. 그러면 오염된 정보가 원래 세션 이후에도 남아 후속 의사결정에 영향을 줄 수 있다.
이러한 위험은 엔터프라이즈 콘텐츠를 실행 표면의 일부로 바꾼다. 보안팀은 전통적으로 문서에서 악성 코드를 검사한다. 이제는 문서 안의 일반 언어가 권한을 가진 소프트웨어 행위자를 우회시킬 수 있는지도 고려해야 한다.
Google News가 이 문제를 만든 것은 아니지만, BankInfoSecurity 경고를 집계함으로써 더 폭넓은 비즈니스 독자층에 이 변화를 드러냈다. 에이전트 보안은 더 이상 전문적인 모델 안전성 논의에만 머물지 않는다. 이제 ID, 애플리케이션 보안, 클라우드 아키텍처, 데이터 거버넌스, 사고 대응 프로그램에 포함돼야 한다.
이러한 발전은 책임의 구조도 바꾼다. 모델 제공업체는 악의적 지시에 대한 저항력을 개선할 수 있지만, 권한과 통합을 통제하는 것은 배포 기업이다. 커넥터 개발자는 도구의 행동을 통제한다. 보안팀은 모니터링을 정의하고, 비즈니스 소유자는 워크플로에 얼마나 많은 자율성을 부여할지 결정한다.
어느 한 참여자도 단독으로 위험을 억제할 수 없다. 도달 가능한 시스템은 하나의 사슬을 이루며, 가장 제약이 약한 고리가 가능한 피해의 상당 부분을 결정한다.
에이전트 ID가 핵심 압박 지점이 되고 있다
기업은 각 에이전트와 그 소유자, 그리고 접근 권한의 정확한 근거가 된 작업을 식별할 수 없다면 최소 권한 원칙을 강제할 수 없다.
BankInfoSecurity는 이전에 Entrust CIO Rishi Kaushal의 발언을 통해 이러한 ID 격차를 조명했다. 그는 에이전트에 고유한 ID, 정의된 권한, 감사 추적, 명확한 책임 소재가 필요하다고 주장했다. 이러한 요구사항은 기존 ID 관리 관행을 예측하기 어려운 행위자로 확장한다는 점에서 익숙하게 들린다.
어려운 부분은 실행이다. 직원은 일반적으로 안정적인 ID, 부서, 관리자, 직무를 가진다. 에이전트는 하나의 프로젝트를 위해 생성됐다가 다른 워크플로로 복제되고, 몇 시간 안에 추가 도구와 연결될 수 있다.
일부 배포 환경에서는 여러 에이전트가 하나의 서비스 계정을 공유한다. 다른 환경에서는 에이전트를 실행한 직원의 권한을 상속한다. 두 설계 모두 로그에 특정 에이전트와 위임된 작업이 아닌 광범위한 자격 증명만 표시되므로 추적 가능성을 약화한다.
에이전트 확산은 문제를 더욱 악화시킨다. Gartner는 2026년 4월, 평균적인 글로벌 Fortune 500 기업이 2028년까지 15만 개 이상의 에이전트를 사용할 것으로 예측했다. 이 회사는 이 전망치를 2025년의 15개 미만 에이전트와 대비했다.
이 예측은 실제 배포 수를 측정한 결과가 아니며, 도입 규모가 기대에 미치지 못할 수도 있다. 그럼에도 거버넌스 과제를 잘 보여준다. 소수의 애플리케이션을 위해 설계된 수동 검토 방식으로는 수천 개의 동적인 소프트웨어 ID를 추적할 수 없다.
따라서 모든 에이전트는 생성부터 폐기까지 고유하고 검증 가능한 ID를 가져야 한다. 이 기록에는 비즈니스 소유자, 기술 소유자, 승인된 도구, 데이터 범위, 운영 환경, 최대 행동 수준이 포함돼야 한다.
유용한 ID는 위임 컨텍스트도 보존해야 한다. 보안팀은 어떤 사람 또는 서비스가 작업을 할당했는지 알아야 한다. 또한 요청된 목적, 현재 워크플로 단계, 해당 권한에 부여된 조건도 파악해야 한다.
정적인 역할 기반 접근 통제로는 모든 질문에 답할 수 없다. 조달 에이전트는 공급업체 검토 중 계약서를 읽는 것이 정당할 수 있다. 하지만 에이전트가 관련 없는 캘린더 요약을 준비할 때까지 동일한 접근 권한이 유지돼서는 안 된다.
작업 기반 권한 부여는 이 격차를 좁힌다. 이는 정의된 목적과 제한된 기간 동안 에이전트에 특정 기능을 부여한다. 영향이 큰 행동에는 실행 시점에 별도의 ID 확인 또는 정책 판단을 요구할 수 있다.
NIST 산하 National Cybersecurity Center of Excellence는 확립된 ID 표준을 소프트웨어 및 AI 에이전트에 적용할 것을 제안했다. ID 개념 문서는 에이전트를 익명의 백그라운드 프로세스로 취급하기보다 식별, 권한 부여, 엔터프라이즈 사용 사례에 초점을 맞춘다.
이 접근 방식은 ID 공급업체, 클라우드 제공업체, 애플리케이션 개발자에게 압박을 가한다. 이들은 사람과 전통적인 워크로드를 중심으로 구축된 제품 전반에서 에이전트를 일급 행위자로 표현해야 한다.
이는 엔터프라이즈 구매자에게도 압박을 준다. 에이전트 플랫폼을 평가하는 팀은 모델 품질만 봐서는 안 된다. 구매자는 각 도구 호출에 식별 가능한 주체, 작업 목적, 강제 가능한 권한 범위가 포함되는지 알아야 한다.
감사 로그는 프롬프트와 응답 이상을 포착해야 한다. 에이전트가 어떤 데이터를 검색했는지, 어떤 도구를 호출했는지, 각 도구가 무엇을 변경했는지, 어떤 승인이 해당 행동을 허가했는지를 기록해야 한다.
이 증거는 사고 발생 시 중요하다. 조사자가 에이전트가 악성 문서를 처리했다는 사실만 알고 있다면 노출 범위를 측정할 수 없다. 이후 접촉한 모든 기록, 접근한 비밀 정보, 전송한 메시지, 변경된 시스템을 재구성해야 한다.
검색 가능한 내부 지식 시스템은 직원이 의사결정과 출처 컨텍스트를 보존하는 데 도움이 될 수 있다. 그러나 에이전트에 연결된 모든 AI knowledge base에도 명확한 신뢰 경계가 필요하다. 검색된 콘텐츠는 데이터이지 신뢰할 수 있는 권위가 아니다.
따라서 ID 문제는 인증보다 더 크다. 이는 출처, 소유권, 위임, 목적, 책임성을 포괄한다. 이러한 요소가 없다면 기업은 자동화가 행동했다는 사실은 알 수 있어도, 누가 왜 이를 승인했는지는 신뢰성 있게 설명할 수 없다.
더 유능한 에이전트는 더 어려운 보안 상충관계를 만든다
에이전트를 유용하게 만드는 접근 권한은 실수, 하이재킹 또는 손상된 도구가 얼마나 멀리 퍼질 수 있는지도 결정한다.
고립된 모델은 돈을 보내거나 프로덕션 환경을 변경할 수 없다. 개발자가 이를 데이터베이스, 브라우저, 코드 저장소, 커뮤니케이션 시스템, 비즈니스 애플리케이션에 연결한 후에야 운영상 가치를 갖게 된다.
각 연결은 도달 가능한 그래프를 확장한다. 이 그래프에는 직접 도구, 상속된 자격 증명, 검색된 데이터, 네트워크 대상, 공유 메모리, 다른 에이전트가 포함된다. 피해 범위는 하나의 통제가 실패한 뒤 접근 가능한 그래프의 부분이다.
명백한 대응은 민감한 행동을 할 때마다 사람에게 묻는 것이다. 그러나 잦은 프롬프트는 형식적인 절차가 될 수 있다. Anthropic은 원격 측정에서 Claude Code 사용자가 권한 요청의 약 93%를 승인했다고 보고했다.
이 수치는 Anthropic 자체 제품 데이터에서 나온 것이므로 모든 엔터프라이즈를 대표하지는 않는다. 하지만 승인 피로를 드러낸다. 소프트웨어가 사용자를 반복적으로 방해하면 많은 사람은 명령이나 대상을 주의 깊게 검토하지 않은 채 요청을 승인한다.
Anthropic의 격리 분석은 행동 감독과 환경적 제한을 구분한다. 행동 방어는 에이전트가 무엇을 선택하는지에 영향을 주려 한다. 환경 통제는 에이전트의 선택과 무관하게 도달할 수 있는 범위를 제한한다.
이 구분은 매우 중요하다. 시스템 프롬프트, 분류기, 학습, 모델 평가는 유해한 행동을 줄일 수 있다. 그러나 이러한 통제는 확률론적이므로 낯설거나 적응적인 공격을 놓칠 수 있다.
격리는 더 강한 경계를 설정한다. 샌드박스는 프로세스와 파일을 제한한다. 가상 머신은 워크로드를 분리한다. 이그레스 통제는 외부 네트워크 연결을 제한한다. 자격 증명 격리는 가치 있는 비밀 정보를 환경 밖에 둔다.
에이전트는 받지 못한 자격 증명을 유출할 수 없다. 읽기 전용 연결을 통해 프로덕션 데이터베이스에 기록할 수 없다. 아웃바운드 트래픽이 엄격한 허용 목록을 따를 때는 임의의 서버로 데이터를 보낼 수 없다.
이는 불편한 상충관계를 만든다. 가장 제한적인 환경이 대체로 가장 안전하지만, 유용성도 제한한다. 영구 작업 공간, 로컬 파일, 네트워크 접근 권한이 없는 에이전트는 많은 가치 있는 엔터프라이즈 작업을 완료할 수 없다.
가장 강력한 설계는 모델이 유능해 보인다는 이유만으로 광범위한 권한을 부여하지 않는다. 대신 업무를 여러 구획으로 분리한다. 각 구획에는 해당 단계에 필요한 데이터와 작업만 노출된다.
고객 지원 에이전트를 생각해 보자. 이 에이전트는 티켓을 읽고 관련 계정 정보를 조회해야 한다. 답변 초안을 작성할 수는 있지만, 실제로 그 답변을 전송하는 일은 별도의 역량에 해당한다.
환불을 실행하려면 한도가 명확히 정의된 또 다른 역량이 필요하다. 계정 소유자를 변경하거나 고객 데이터를 내보내는 작업에는 더 강력한 검증이 요구돼야 한다. 에이전트가 하나의 영구 자격 증명으로 이 모든 권한을 받아서는 안 된다.
같은 원칙은 코딩 에이전트에도 적용된다. 저장소를 읽는 일은 개발 브랜치를 수정하는 일과 다르다. 코드 병합, 시크릿 접근, 인프라 변경, 프로덕션 배포는 각각 별도의 신뢰 영역에 속해야 한다.
되돌릴 수 있는지도 중요하다. 기업은 검토와 취소가 쉬운 저영향 작업은 자동으로 진행하도록 허용할 수 있다. 되돌릴 수 없는 변경에는 더 엄격한 관문, 더 좁은 한도, 그리고 독립적인 기록이 필요하다.
이 프레임워크는 에이전트의 겉보기 의도에 대한 의존도를 낮춘다. 보안 정책은 요청된 작업, 신원, 리소스, 대상, 작업 맥락을 평가한다. 제어 체계가 모델의 진정성을 판단할 필요는 없다.
OWASP의 에이전트형 위험 프레임워크는 이러한 더 넓은 위협 모델을 반영한다. 해당 범주에는 목표 탈취, 도구 오용, 권한 남용, 메모리 오염, 안전하지 않은 통신, 연쇄적 장애가 포함된다.
이 범주들은 기존의 프롬프트 필터링만으로는 모든 부담을 감당할 수 없는 이유를 보여준다. 완전히 정상적인 사용자 요청도 침해된 도구를 실행시킬 수 있다. 안전한 도구도 오염된 콘텐츠를 반환할 수 있다. 정상적으로 작동하는 에이전트도 과도한 권한을 상속받을 수 있다.
핵심 보안 질문은 에이전트를 추상적으로 신뢰할 수 있는지가 아니다. 에이전트가 잘못된 결정을 내렸을 때도 주변 아키텍처가 안전하게 유지되는지다.
프롬프트 인젝션은 연쇄 실패의 첫 단계일 뿐이다
성공한 프롬프트 인젝션은 과도한 접근 권한, 취약한 격리 또는 누락된 검증으로 인해 그 지시가 실제 결과를 낳을 수 있을 때 기업 사고로 이어진다.
NIST는 에이전트 탈취를 신뢰할 수 있는 지시와 신뢰할 수 없는 데이터를 분리하지 못하는 실패로 설명한다. 현재의 에이전트 아키텍처는 종종 둘을 하나의 모델 컨텍스트 안에 결합한다. 이 설계는 자연어 콘텐츠가 계획 수립에 영향을 미치도록 만든다.
공격자는 리서치 에이전트가 방문하는 웹페이지에 숨겨진 지시를 넣을 수 있다. 악성 이메일은 어시스턴트에게 문서를 전달하라고 지시할 수 있다. 오염된 저장소 파일은 코딩 에이전트를 안전하지 않은 명령으로 유도할 수 있다.
에이전트가 악의적인 의도를 가질 필요는 없다. 공격자의 텍스트를 관련 권한으로 해석하기만 하면 된다. 그 결과 발생하는 도구 호출은 승인된 커넥터와 인증된 계정을 사용하기 때문에 기술적으로는 유효해 보일 수 있다.
NIST는 모의 업무 환경, 여행, Slack, 뱅킹 환경을 제공하는 연구 프레임워크 AgentDojo를 통해 이 패턴을 시험했다. 해당 탈취 평가에는 원격 코드 실행, 데이터베이스 유출, 자동화된 피싱 시나리오도 추가됐다.
이러한 테스트는 보편적인 침해율이 아니라 공격 경로를 보여준다. 결과는 모델, 도구, 공격 방식, 작업, 시도 횟수에 따라 달라진다. 기업은 하나의 벤치마크 점수를 보안 보장으로 해석하지 않아야 한다.
적응형 공격자는 이러한 신중함을 요구한다. 알려진 문구를 차단하는 방어 체계는 의역된 표현을 놓칠 수 있다. 한 번의 시도를 견디는 모델도 반복된 변형 공격에는 실패할 수 있다.
더 깊은 우려는 조합 가능성이다. 에이전트는 자체 권한과 취약점을 가진 다른 서비스를 자주 호출한다. 따라서 조작된 한 번의 결정이 뚜렷한 네트워크 경계를 넘지 않고도 여러 시스템을 가로질러 이동할 수 있다.
멀티 에이전트 워크플로는 또 다른 층을 만든다. 계획 에이전트가 한 에이전트에는 조사 업무를, 다른 에이전트에는 실행 업무를 위임할 수 있다. 신원과 메시지 무결성이 취약하다면 침해된 참여자가 지시나 결과를 허위로 전달할 수 있다.
메모리는 시간이 지나며 이 연쇄를 연장할 수 있다. 한 작업 중 저장된 허위 정책, 공급업체 연락처 또는 보안 예외는 이후 업무에 영향을 줄 수 있다. 조사관이 영향을 알아차리기 전에 원래의 악성 소스는 사라질 수 있다.
도구 공급망은 전통적인 소프트웨어 위험을 더한다. 에이전트 커넥터에는 취약한 코드, 안전하지 않은 기본 설정 또는 침해된 종속성이 있을 수 있다. 모델 안전장치는 이러한 결함을 고치지 못한다.
이러한 불확실성은 하나의 보안 제품이 에이전트 위험을 해결할 수 있다는 주장을 약화한다. 프롬프트 스캐너, 에이전트 게이트웨이, 신원 플랫폼, 관측성 도구, 샌드박스는 각각 문제의 일부를 다룬다. 어느 하나도 전체 연쇄를 단독으로 통제하지 못한다.
기업은 측정 격차에도 직면한다. 레드팀 보고서는 에이전트가 이후에 무엇에 접근할 수 있었는지 기록하지 않은 채 프롬프트 인젝션이 성공했다고만 밝힐 수 있다. 이런 결과는 비즈니스 영향에 대해 거의 말해주지 못한다.
유용한 테스트는 침해 이후의 영향 범위를 기록해야 한다. 조사관은 호출된 도구, 접근한 데이터, 노출된 자격 증명, 접촉한 대상, 완료된 변경 사항을 파악해야 한다. 이렇게 해야 이론적인 피해 반경을 관찰 가능한 결과로 연결할 수 있다.
테스트는 시도된 작업과 성공한 작업도 구분해야 한다. 모델이 금지된 송금을 요청할 수 있지만 정책 계층이 이를 차단할 수 있다. 이는 행동상의 실패이지만 격리에는 성공한 결과다.
반대로 에이전트는 비즈니스 경계를 넘는, 겉보기에는 무해한 요청을 만들 수도 있다. 기존 보안 모니터링은 자격 증명과 API 호출이 정당해 보인다는 이유로 이를 승인할 수 있다.
바로 이 지점에서 비즈니스 맥락이 필수적이다. 영업 분석 작업이 급여 데이터를 변경할 이유는 없다. 회의 어시스턴트가 클라우드 액세스 키를 생성해서는 안 된다. 정책은 작업을 할당된 목적과 연결해야 한다.
모호하거나 영향이 큰 사례에서는 사람의 검토가 여전히 가치 있지만, 검토자에게는 활용 가능한 증거가 필요하다. 일반적인 확인 대화상자는 출처, 대상, 영향을 받는 레코드, 되돌릴 수 있는지 여부를 보여주지 않는다.
의미 있는 점검 단계라면 에이전트가 외부 주소로 파일 5개를 보내려 한다고 명시할 수 있다. 파일, 수신자, 지시의 발단, 정책 예외를 식별해야 한다. 그러면 검토자는 정보에 기반한 결정을 내릴 수 있다.
기업은 일부 통제가 실패할 것이라는 점도 가정해야 한다. 사고 대응 계획에는 전체 공유 서비스 계정을 비활성화하지 않고도 하나의 에이전트 신원을 중지할 방법이 필요하다. 팀은 위임된 자격 증명을 폐기하고 영향을 받은 메모리를 격리해야 한다.
로그는 에이전트 세션 이후에도 유지되고 해당 환경과 독립적이어야 한다. 그렇지 않으면 침해된 프로세스가 방어자가 필요한 증거를 변경할 수 있다.
회의적인 결론은 분명하다. 공개 벤치마크나 공급업체의 발표 어느 것도 프롬프트 인젝션이 제거됐음을 입증하지 않는다. 보안은 하나의 모델 실패가 기업 전반의 사고가 되지 않도록 막는 중첩된 통제에 달려 있다.
세 가지 신호가 기업의 위험 억제 여부를 보여줄 것이다
에이전트 도입의 다음 단계는 자율성만이 아니라 더 좁은 권한, 측정 가능한 격리, 사고 증거로 평가받게 될 것이다.
첫 번째 신호는 에이전트 전용 신원에 대한 광범위한 지원이다. 클라우드 및 소프트웨어 플랫폼은 모든 민감한 요청에서 에이전트, 위임한 사용자, 비즈니스 소유자, 활성 작업을 식별할 수 있어야 한다.
이 정보는 커넥터 전반으로 전달돼야 한다. 도구 호출을 받는 애플리케이션은 공유 API 키만 봐서는 안 된다. 소프트웨어 행위자와 위임된 권한에 관한 검증 가능한 맥락을 받아야 한다.
공급업체가 이러한 맥락을 표준화한다면 기업은 여러 에이전트 플랫폼에 걸쳐 일관된 정책을 적용할 수 있다. 이는 신원이 에이전트 확산을 억제할 수 있다는 주장을 강화할 것이다. 공유 자격 증명에 계속 의존한다면 그 주장은 약화될 것이다.
NIST가 2026년 5월 실시한 공개 의견 검토에서는 기존 사이버보안 관행이 여전히 유효하지만 조정이 필요하다는 폭넓은 합의가 확인됐다. 보안 대응 요약에서는 구현 지침, 정보 공유, 표준에 대한 수요도 확인됐다.
두 번째 신호는 공급업체가 모델 안전성 점수만이 아니라 격리 결과를 공개하는지 여부다. 기업에는 에이전트가 악성 지시를 따랐을 때 어떤 일이 발생하는지를 측정하는 테스트가 필요하다.
유용한 보고서는 에이전트가 시크릿에 접근했는지, 레코드를 변경했는지, 승인되지 않은 대상에 연락했는지, 테넌트 경계를 넘었는지를 밝혀야 한다. 또한 모델의 저항성과 정책 집행, 환경 격리를 구분해야 한다.
이 증거는 조달 방식을 바꿀 수 있다. 구매자는 신뢰성에 관한 포괄적 주장 대신 도달 가능한 최대 피해를 기준으로 배포 방식을 비교할 수 있다. 보안팀도 각 비즈니스 워크플로에 대한 승인 기준을 정할 수 있다.
격리 아키텍처는 방어 세부 사항을 노출할 수 있으므로 공개는 계속 어려울 것이다. 그럼에도 공급업체는 악용 가능한 구성을 드러내지 않고도 방법론, 테스트 범주, 집계 결과, 독립 검토 결과를 공개할 수 있다.
이런 보고가 일반화된다면 기업이 피해 반경을 측정 가능한 엔지니어링 특성으로 다루고 있다는 주장을 뒷받침할 것이다. 공급업체가 계속 작업 성공률만 보고한다면 안전성 격차는 대체로 가려진 채 남는다.
세 번째 신호는 성숙한 에이전트 사고 보고의 첫 물결이다. 조직에는 사용자 오용, 모델 오작동, 외부 조작, 커넥터 침해, 권한 부여 실패를 구분하는 기록이 필요하다.
규제기관과 업계 단체는 공통 어휘를 마련하는 데 도움을 줄 수 있다. 그런 체계가 없으면 모든 사고는 고립된 일화가 되고, 기업은 원인이나 통제를 비교하기 어려워진다.
사고 보고서는 최초 진입 지점과 이후의 작업 경로를 식별해야 한다. 어떤 경계가 유지됐고 어떤 경계가 실패했는지, 자격 증명이나 메모리를 어떻게 복구했는지를 설명해야 한다.
더 나은 보고는 초기에는 더 많은 실패가 드러나면서 에이전트 보안이 더 나빠 보이게 할 수 있다. 그러나 그러한 투명성 역시 진전을 의미한다. 숨겨진 사고는 표준이나 방어 테스트를 개선할 수 없다.
따라서 Google News가 전한 BankInfoSecurity의 경고는 피할 수 없는 재앙의 예측이 아니라 아키텍처에 관한 이야기로 읽어야 한다. 기업이 추론 시스템을 실제 권한과 연결하기 때문에 에이전트는 노출 범위를 넓힌다.
격리는 여전히 가능하다. 이를 위해서는 분리된 신원, 작업에 묶인 권한, 구획화된 도구, 보호된 자격 증명, 제한된 네트워크, 신뢰할 수 있는 로그, 신중하게 설계된 승인 관문이 필요하다.
인벤토리도 필요하다. 보안팀은 등록 없이 사업 부서가 만든 에이전트를 관리할 수 없다. 모든 에이전트에는 소유자, 목적, 권한 프로필, 데이터 분류, 폐기 절차가 있어야 한다.
조직은 최대 손실이 제한되고 작업을 되돌릴 수 있는 워크플로부터 시작해야 한다. 신원, 정책, 환경 경계가 공격 상황에서도 유지된다는 테스트 결과가 나온 뒤에만 권한을 확대할 수 있다.
이 접근 방식은 때때로 배포 속도를 늦출 것이다. 그러나 피할 수 있었던 한 번의 사고가 전체 프로그램을 끝내는 일을 막아 도입을 지킬 수도 있다. 보안은 출시 전 마지막 검토가 아니라 통제된 사용을 가능하게 하는 운영 제약이 된다.
지식 근로자에게 이 문제는 일상 도구까지 이어진다. 이메일, 문서, 회의, 로컬 파일을 읽는 어시스턴트는 매우 개인적인 맥락을 가로질러 작동한다. 사용자는 어떤 소스에 접근할 수 있는지, 어떤 작업에 확인이 필요한지 알아야 한다.
개발자에게 관련된 단위는 더 이상 모델만이 아니다. 프롬프트, 메모리, 도구, 자격 증명, 런타임, 네트워크, 정책, 로그를 포함하는 완전한 에이전트 시스템이다.
기업 구매자에게 결정적인 질문은 간단합니다. 이 에이전트는 추론에 실패한 뒤에도 무엇을 할 수 있는가? 그 경계를 명확히 제시하지 못하는 공급업체는 제품의 실제 위험을 정의하지 못한 것입니다.
에이전트가 더 많은 워크플로에 도입되면서 Google News는 계속해서 극적인 사례를 노출할 것입니다. 독자는 가장 우려스러운 행동만 보지 말고, 그 배후의 권한을 살펴봐야 합니다. 해당 에이전트는 고유하게 식별되었는가, 범위가 제한되었는가, 격리되었는가, 관찰 가능한가? 다음 커넥터, 자격 증명 또는 승인을 부여하기 전에 이 질문들을 던지십시오. 가장 안전한 에이전트는 절대 실패하지 않겠다고 약속하는 에이전트가 아닙니다. 실패하더라도 그 영향이 멀리 퍼질 수 없는 에이전트입니다.


