자율 AI 공격, 핵심 인프라에 새로운 위협 제기
- Olivia Johnson

- 4일 전
- 10분 분량
Google News는 자율 AI 시스템이 대만 정부 계정 85개를 침해하고 2,500건이 넘는 인사 기록을 탈취했다는 최초 사례를 보도하며 주목하고 있다.
연구진은 나흘간 이어진 이 캠페인을 중국 연계가 의심되는 해커들과 연결했다. 이 시스템은 이후 대만의 원자력 안전 기관과 최소 7개 에너지 기업을 겨냥한 것으로 알려졌다.
이러한 조사 결과는 아직 완전한 독립 검증을 거치지 않았다. 그러나 이는 2026년 초까지 통용되던 보안 가정에 의문을 제기한다. AI가 공격자를 지원할 수는 있어도, 어려운 단계는 여전히 사람이 지휘해야 한다는 가정이다.
대만에서 보고된 작전은 그 경계가 희미해지고 있음을 시사한다. 공격자들은 오픈소스 AI 모델 8개를 결합해 네트워크를 매핑하고, 취약점을 조사하며, 침입을 시도하고, 실패한 계획을 수정할 수 있는 플랫폼을 구축한 것으로 전해진다.
이 차이는 중요하다. AI 지원 공격자는 모델에 코드나 조사 결과를 요청한다. 반면 자율 공격은 소프트웨어에 도구, 권한, 목표, 피드백을 부여한 뒤 여러 단계를 거쳐 계속 작동하도록 한다.
그 결과가 반드시 더 영리한 해커라는 뜻은 아니다. 여러 경로를 동시에 시험하고 일상적인 기법을 기계 속도로 반복할 수 있는, 지치지 않는 공격자라는 의미다.
2월 안전성 평가는 완전 자율 공격이 신뢰하기 어려운 긴 작업 연쇄 때문에 여전히 제한적이라고 평가했다. 대만 관련 조사 결과는 이제 그 결론에 압박을 가하고 있다.
따라서 핵심 경쟁 구도는 분명하다. 자율 공격 시스템은 속도와 지속성을 얻고 있는 반면, 핵심 인프라 방어는 여전히 인적 검토와 분절된 보고 체계에 의존한다.
Google News 보도, 지원에서 자율성으로의 전환을 부각
중요한 변화는 완전히 새로운 해킹 기법의 등장 자체가 아니라, 작전상 독립성이다.
사건 관련 보도에 따르면, 이스라엘 사이버보안 기업 Dream의 연구진은 범죄 인프라를 모니터링하던 중 이 활동을 발견했다. 해당 작전은 나흘간 진행된 것으로 알려졌다.
공격자들은 오픈소스 AI 모델 8개로 플랫폼을 구성한 것으로 전해진다. 여러 에이전트가 정찰, 취약점 조사, 침입 시도, 그리고 한 경로가 실패했을 때의 전술 변경을 수행할 수 있었다.
이 구조는 소규모 디지털 작전팀과 닮아 있다. 한 에이전트가 외부에 노출된 서비스를 매핑하는 동안 다른 에이전트는 관련 취약점을 찾을 수 있다. 또 다른 에이전트들은 자격 증명을 시험하거나 결과를 평가할 수 있다.
이후 조정 계층이 다음 행동을 할당한다. 모델을 둘러싼 소프트웨어인 에이전틱 스캐폴딩은 단계 사이에 도구, 메모리, 목표, 피드백을 제공한다.
이 구분은 모델 수보다 오케스트레이션이 중요한 이유를 설명한다. 평범한 모델도 소프트웨어가 출력을 검증하고 실패한 작업을 재시도하면 더 효과적으로 작동할 수 있다.
연구진은 이 캠페인이 최소 85개의 정부 계정을 침해하고 2,500건 이상의 인사 기록을 확보했다고 밝혔다. 이후 원자력 안전 기관과 7개 에너지 기업을 겨냥한 것으로 알려졌다.
이 수치는 Dream의 조사와 후속 보도에서 나온 것이다. 대만 당국은 연구진이 설명한 모든 기술적 세부 사항을 공개적으로 검증하지는 않았다.
이 검증 공백은 계속 분명하게 드러나야 한다. 기존 사이버 조사에서도 공격 주체를 특정하기는 어렵고, 익숙하지 않은 AI 플랫폼은 각 행동을 누가 지시했는지를 두고 추가적인 불확실성을 만든다.
사람이 얼마나 자주 개입했는지도 불분명하다. 공격자들이 표적을 선택했거나, 민감한 행동을 승인했거나, 시스템이 독립적으로 처리하지 못한 실패를 복구했을 가능성이 있다.
그럼에도 이 캠페인은 챗봇에게 피싱 메시지 초안을 작성하도록 요청하는 것과는 다르다. 에이전트들은 장기간의 작전 전반에서 목표를 유지하고, 결과를 해석하며, 대체 경로를 선택한 것으로 전해진다.
대만 공격에 대한 상세 보도는 정찰과 침입을 하나의 자동화 시스템으로 연결된 과정으로 설명한다.
이것이 Google News 보도의 긴장감이다. 도구는 익숙할 수 있지만, 의사결정 루프는 직접적인 인간 통제에서 벗어나기 시작했다.
핵심 인프라 방어자는 기계 속도의 지속성에 맞서기 어렵다
자율 공격은 인간 속도의 사고 대응과 예측 가능한 단계적 대응을 전제로 설계된 조직의 보안 프로세스에 압박을 가한다.
핵심 인프라에는 전력, 수도, 교통, 통신, 의료 등 기본적인 공공 기능을 뒷받침하는 시스템이 포함된다. 많은 운영자는 현대적 클라우드 서비스와 오래된 운영 기술을 함께 사용한다.
운영 기술은 펌프, 터빈, 스위치, 산업용 기계와 같은 물리적 프로세스를 제어한다. 이는 일반적인 비즈니스 소프트웨어보다 더 오래 운용되는 경우가 많다.
이처럼 긴 수명 주기는 불균등한 방어 환경을 만든다. 보안팀은 빈번한 업데이트를 감당할 수 없는 장비를 방해하지 않으면서, 새롭게 인터넷에 노출된 시스템을 보호해야 한다.
자율 공격자는 이러한 불균형을 활용할 수 있다. 노출된 자산을 지속적으로 스캔하고, 여러 시스템에서 발견한 정보를 연결하며, 피로 없이 기법을 재시도할 수 있다.
방어자는 다른 제약에 직면한다. 분석가는 사람들이 의존하는 서비스를 격리하기 전에 실제 침입과 일상적 잡음을 구분해야 한다.
조사를 위해 기업용 애플리케이션을 닫는 일도 혼란을 초래한다. 전력망이나 수도망 일부를 중단하면 즉각적인 공공 피해가 발생할 수 있다.
이 비대칭성은 공격자에게 시간을 준다. 공격자의 소프트웨어는 여러 실험을 진행하는 동안, 방어자는 중대한 대응 하나를 위해 운영 승인을 받아야 한다.
대만 사례는 탈취된 인사 데이터가 개인정보 문제를 넘어 중요한 이유도 보여 준다. 직원 기록은 사칭, 자격 증명 공격, 또는 특권 접근 권한을 가진 인물을 겨냥한 접근에 활용될 수 있다.
침입이 즉시 산업 제어 시스템에 도달할 필요는 없다. 공격자는 신원 관리 시스템, 관리 네트워크, 계약업체 또는 공급업체에서 시작할 수 있다.
각각의 거점은 다음 의사결정을 위한 더 많은 정보를 제공한다. 메모리를 가진 에이전트는 확인된 이름, 시스템 간 관계, 자격 증명, 실패한 접근 방식을 보존할 수 있다.
이 지속성은 정찰의 경제성을 바꾼다. 전통적으로 인간 운영자는 결과를 검토하고 무엇이 더 깊은 주목을 받을 만한지 판단하는 데 시간을 쓴다.
자율 플랫폼은 모든 미약한 신호를 검토할 수 있다. 여러 에이전트가 동시에 진행할 수 있으므로 유망한 표적 사이에서 선택할 필요가 없다.
2월 국제 보고서는 AI 시스템이 공격의 속도, 규모, 정교함을 높일 수 있다고 경고했다. 동시에 모델들은 긴 공격 연쇄를 수행하는 데 여전히 어려움을 겪는다고 평가했다.
보고된 캠페인은 공격자들이 오케스트레이션을 통해 이러한 한계를 줄일 수 있음을 시사한다. 긴 순서를 더 작은 작업으로 나누고, 출력을 확인하며, 오류 발생 후 에이전트를 재지정할 수 있다.
따라서 핵심 인프라 운영자가 당면한 압박의 표적이 된다. 압박은 완전히 알려지지 않은 취약점 유형이 아니라, 가속화된 탐색과 적응에서 비롯된다.
운영자들의 필수 대응에는 더 짧은 탐지 주기, 강화된 신원 통제, 더 엄격한 세분화, 그리고 침해된 시스템을 격리할 수 있도록 사전에 연습된 권한 체계가 포함된다.
이는 장기적인 변화이지만, 운영 대응을 미룰 수는 없다. 재사용 가능한 자율 프레임워크가 확산되면 더 많은 행위자가 이를 새로운 표적에 맞게 적용할 수 있다.
오픈 모델만이 위험의 원천은 아니다
핵심 갈등은 오픈소스와 폐쇄형 모델의 대립이 아니라, 자율 공격 역량과 인간 중심 방어의 대립이다.
보고된 대만 플랫폼은 공개적으로 이용 가능한 구성 요소를 사용했다. 이 사실은 고도화된 사이버보안 역량을 가진 모델에 대한 접근을 제한하라는 요구를 강화할 것이다.
오픈 모델은 공격자의 개발 비용을 낮출 수 있다. 그 동작을 로컬에서 수정할 수 있으며, 제공업체는 악용을 탐지한 뒤에도 다운로드된 모델을 비활성화할 수 없다.
그러나 모델 접근만을 겨냥하면 작전의 핵심 메커니즘을 놓치게 된다. 모델이 탐색하고, 코드를 실행하며, 결과를 저장하고, 실제 네트워크에서 행동할 수 있는지는 주변 도구가 결정한다.
Anthropic의 최근 위협 매핑은 에이전틱 스캐폴딩이 기본적인 AI 지원과 자율 사이버 작전을 점점 더 구분하게 될 것이라고 주장한다.
이 관점에서 모델은 하나의 구성 요소일 뿐이다. 공격자는 정찰, 취약점 조사, 자격 증명 처리, 익스플로잇, 검증을 연결하는 시스템을 구축함으로써 영향력을 얻는다.
상용 모델도 위험을 수반한다. 탈취된 계정, 침해된 애플리케이션, 취약한 가드레일, 노출된 도구 인터페이스는 공격자에게 성능이 뛰어난 호스팅 시스템에 대한 접근권을 제공할 수 있다.
폐쇄형 접근 방식은 모니터링과 집행 수단을 제공한다. 제공업체는 사용량 제한을 적용하고, 의심스러운 패턴을 식별하며, 계정을 정지하고, 안전장치를 업데이트할 수 있다.
이러한 통제는 가치가 있지만 완전하지는 않다. 공격자는 여러 계정에 작업을 분산하거나, 중개자를 통해 요청을 전달하거나, 악의적 작업을 합법적인 보안 활동과 섞을 수 있다.
방어 연구도 같은 모호성을 낳는다. 취약한 소프트웨어를 조사하도록 요청받은 모델은 공급업체, 침투 테스터 또는 익스플로잇을 준비하는 공격자를 돕고 있을 수 있다.
에이전트가 일반적인 관리 도구를 통해 작동하면 이중 용도 문제는 더 어려워진다. 클라우드 콘솔은 자동화된 변경이 승인된 것인지 항상 판별할 수 없다.
이 때문에 모델 제한만으로는 인프라를 보호할 수 없다. 운영자는 어떤 에이전트든 어디까지 접근할 수 있고, 승인 없이 어떤 행동을 완료할 수 있는지를 통제해야 한다.
같은 원칙은 방어용 에이전트에도 적용된다. 보안팀은 경보 분류, 조사, 취약점 분석에 AI를 점점 더 활용하고 있다.
과도한 권한을 가진 방어용 에이전트는 공격 경로가 될 수 있다. 프롬프트 인젝션, 침해된 데이터 또는 탈취된 자격 증명이 신뢰받는 시스템을 해로운 행동으로 돌릴 수 있다.
따라서 에이전트에는 좁은 범위의 권한만 부여해야 한다. 민감한 작업에는 독립적인 검증이 필요하며, 자격 증명은 빠르게 만료되고 특정 작업에만 연결돼야 한다.
네트워크 세분화 역시 더욱 중요해진다. 침해된 비즈니스 계정이 물리적 운영을 제어하는 시스템으로 이어지는 단순한 경로를 제공해서는 안 된다.
주된 경쟁은 여전히 역량과 위험 사이에 있다. 자율 에이전트는 방어자에게 속도를 제공하지만, 같은 구조는 공격자에게 지속성과 도달 범위를 제공한다.
오픈 모델만을 겨냥한 정책은 클라우드 에이전트, 침해된 기업 도구, 그리고 관리 체계가 미흡한 방어 자동화를 범위 밖에 남겨 둘 것이다.
자율 AI 공격 주장이 입증하지 못하는 것
증거는 심각한 전환을 시사하지만, 자율 시스템이 선택한 모든 표적을 신뢰성 있게 침해할 수 있음을 입증하지는 않는다.
공개 보도는 완전한 포렌식 기록을 제공하지 않는다. 독자는 모든 명령, 인간 승인, 모델 실패, 영향을 받은 시스템을 독립적으로 검토할 수 없다.
“엔드투엔드”라는 설명도 서로 다른 수준의 자율성을 감출 수 있다. 시스템이 대부분의 단계를 자동화했더라도, 사람이 표적을 선택하고, 자격 증명을 제공하거나, 익스플로잇을 승인했을 수 있다.
그렇더라도 이는 의미 있는 진전을 나타낸다. 플랫폼이 전체 작전을 독립적으로 구상하고 완료했다는 뜻은 아니다.
국제 AI 안전 보고서는 몇 가지 지속적인 약점을 지적했다. 에이전트는 운영 상태를 잃거나, 무관한 명령을 실행하고, 단순한 오류에서도 복구하지 못할 수 있다.
잘 설계된 오케스트레이션 계층은 이러한 문제를 줄일 수 있다. 하지만 에이전트가 낯선 환경을 이해하거나 자신의 존재를 드러내지 않도록 보장할 수는 없다.
사이버보안 기업 VulnCheck는 7월, 검토한 AI 지원 취약점 발견 사례 중 무기화된 사례는 2% 미만이었다고 보고했다. 취약점 발견과 신뢰할 수 있는 익스플로잇은 여전히 별개의 과제다.
핵심 인프라는 추가적인 장애물을 제시한다. 네트워크에는 특수 장비, 비정상적인 프로토콜, 불완전한 문서화, 예측하기 어렵게 작동하는 물리적 프로세스가 포함될 수 있다.
범용 모델은 취약한 서버를 알아볼 수는 있어도 산업 환경 설정을 변경했을 때의 결과를 오해할 수 있다. 이 한계는 공격을 중단시키거나 더 위험하게 만들 수 있다.
귀속 판단에도 비슷한 주의가 필요하다. 연구자들은 해당 작전을 중국 연계 행위자와 연결한 것으로 알려졌지만, 공개 증거만으로는 독립적인 결론을 내리기에 여전히 불충분하다.
인프라, 언어적 패턴, 작업 시간, 과거에 사용된 기법은 귀속 판단을 뒷받침할 수 있다. 숙련된 운영자는 오해를 유도하는 신호를 심을 수도 있다.
추정되는 표적은 기존의 전략적 이해관계와 부합하지만, 표적 선정만으로 공격자를 식별할 수는 없다. 정부의 확인이 이 평가를 더욱 뒷받침할 것이다.
또 다른 왜곡 가능성도 있다. 보안 공급업체는 조직이 새로운 방어 제품의 긴급한 필요성을 인식할 때 이익을 얻는다.
그러한 유인이 연구 자체를 무효화하는 것은 아니다. 다만 기술적 투명성, 외부 검토, 명확한 자율성 정의가 필수적임을 뜻한다.
가장 강력하게 방어할 수 있는 결론은 가장 극적인 헤드라인보다 범위가 좁다. 공격자들은 이전보다 운영 루프의 더 많은 부분을 자동화할 수 있는 것으로 보인다.
이 캠페인이 반복 가능한 플랫폼을 의미하는지는 불확실하다. 맞춤형 시스템은 한 환경에서는 잘 작동해도 다른 곳에서는 성능이 떨어질 수 있다.
The Register의 이전 평가는 이전 기준선을 포착했다. AI 에이전트는 범죄자에게 도움이 됐지만, 전체 공격 과정에 걸쳐서는 신뢰할 수 없었다.
대만 관련 발견은 모든 한계를 지우지 않으면서 그 기준선에 이의를 제기한다. 변화는 불가능에서 보편적으로 신뢰할 수 있음으로의 전환이 아니라, “보고되지 않음”에서 “신빙성 있게 주장됨”으로의 전환이다.
이 구분은 보도와 정책 모두를 이끌어야 한다. 과장은 공포를 부추기고, 반대로 일축하면 방어자는 어제의 작전 속도에 맞춰 대비하게 된다.
방어자는 감독권을 포기하지 않으면서 자율적 통제를 갖춰야 한다
핵심 인프라에는 더 빠른 방어 자동화가 필요하지만, 중대한 조치에는 공격자가 존중하지 않는 경계가 여전히 필요하다.
인간 분석가는 기계가 생성하는 모든 탐색 시도를 수동으로 조사할 수 없다. 공격용 에이전트가 활동량을 늘린다면, 방어 시스템도 이에 상응하는 속도로 신호를 필터링하고 상관 분석해야 한다.
자동화는 비정상적인 ID 행동, 의심스러운 도구 실행 순서, 빠른 네트워크 매핑, 또는 관련 없는 시스템 전반에 걸친 반복적인 접근 시도를 식별할 수 있다.
방어 에이전트는 이후 분석가를 위해 맥락을 구성할 수 있다. 탈취된 계정과 새 기기, 비정상적인 클라우드 세션, 민감한 기록에 대한 접근을 연결할 수 있다.
이 워크플로는 에이전트에 무제한 권한을 부여하지 않으면서 시간을 절약한다. 시스템은 격리를 제안하고, 사전에 정의된 정책이 어떤 조치를 자동으로 실행할 수 있는지 결정한다.
위험이 낮은 대응은 신속히 진행할 수 있다. 세션에 새로운 인증을 요구하거나, 임시 토큰을 만료시키거나, 의심스러운 프로세스의 네트워크 접근을 차단할 수 있다.
위험이 큰 대응에는 추가 확인이 필요하다. 운영 장비를 분리하거나 산업 제어를 변경하는 일은 안전과 서비스 가용성에 영향을 줄 수 있다.
이 계층형 모델은 수동 방어와 제약 없는 자율성 사이의 잘못된 양자택일을 피한다. 조직은 물리적 결과에 대한 승인을 유지하면서 되돌릴 수 있는 단계를 자동화할 수 있다.
ID에는 특별한 주의가 필요하다. 보고된 인사 기록 탈취는 공격자가 이후 접근 시도에 활용할 자료를 어떻게 수집할 수 있는지 보여준다.
모든 사람과 소프트웨어 에이전트는 검증 가능한 ID를 가져야 한다. 권한은 작업, 대상, 기간, 예상 행동을 반영해야 한다.
에이전트 활동에는 지속적으로 보존되는 로그도 필요하다. 보안팀은 어떤 모델이 행동했는지, 어떤 도구를 사용했는지, 어떤 데이터에 접근했는지, 그리고 왜 통제가 그 행동을 허용했는지 알아야 한다.
일반적인 애플리케이션 로그는 그러한 의사결정 사슬을 포착하지 못할 수 있다. 에이전트는 악의적인 순서로 정상적인 명령을 실행할 수 있어, 각각의 개별 이벤트는 무해해 보일 수 있다.
업계 단체들은 보고 공백 문제를 다루기 시작했다. Open Secure AI Alliance는 자율 시스템 관련 사고를 위한 조사 결과 교환 체계를 제안했다.
제안된 프레임워크는 무단 접근, 기밀 데이터 노출, 운영자가 부적절한 행동을 의심한 뒤에도 계속되는 탐색을 다룰 것이다.
공유된 정의가 중요한 이유는 조직마다 현재 에이전트 사고를 다르게 설명하기 때문이다. 한 기업은 사건을 모델 실패라고 부를 수 있지만, 다른 기업은 같은 행동을 자격 증명 악용으로 기록할 수 있다.
일관된 보고는 방어자가 반복되는 패턴을 식별하는 데 도움이 된다. 또한 주장된 자율 공격이 드문 시연에 머무르는지, 일상적인 작전이 되는지도 드러낼 것이다.
이 제안에는 한계가 있다. 자발적 공개는 세이프하버 보호를 보장하지 않으면서 법적, 평판상, 규제상 위험을 노출할 수 있다.
핵심 인프라 운영자는 네트워크 아키텍처나 방어상 약점에 관한 민감한 세부 정보를 공개하기를 주저할 수 있다. 정부는 유용한 운영 정보를 보호하는 보고 채널을 마련해야 한다.
더 광범위한 거버넌스 분석도 식별 가능한 인간 운영자를 중심으로 설계된 프레임워크가 지속적으로 작동하는 자율 시스템을 다루는 데 어려움을 겪을 것이라고 경고한다.
이 문제는 국경을 넘는다. 하나의 캠페인 중에도 모델, 클라우드 서비스, 표적, 운영자는 서로 다른 관할권에 위치할 수 있다.
방어자는 소프트웨어만으로 이러한 관할권 충돌을 해결할 수 없다. 그럼에도 권한 관리, 분할, 텔레메트리, 훈련된 대응 권한을 통해 노출을 줄일 수 있다.
위험이 일상이 되는지 보여줄 세 가지 신호
다음 시험대는 독립적인 증거가 보고된 단일 캠페인을 반복 가능한 자율 침입 패턴으로 바꾸는지 여부다.
첫 번째 신호는 대만 당국이나 독립적인 사고 대응팀의 기술적 확인이다. 유용한 증거는 타임라인, 영향받은 시스템, 인간의 개입을 명확히 할 것이다.
확인이 이뤄지면 자율 소프트웨어가 실제 정부 인프라를 상대로 연결된 여러 공격 단계를 완료했다는 결론이 더욱 강해질 것이다.
더 제한적인 판단은 이 주장의 가장 강한 버전을 약화할 것이다. 예를 들어 조사관들은 에이전트가 정찰을 처리하는 동안 인간이 결정적인 단계를 수행했다고 판단할 수 있다.
어느 결과든 논의를 개선할 것이다. 보안 계획에는 지원된 모든 공격을 완전 자율 공격으로 취급하는 이분법적 라벨이 아니라 정확한 자율성 수준이 필요하다.
두 번째 신호는 관련 없는 위협 그룹에 의한 재현이다. 방어자는 자동화된 발견, 익스플로잇, 지속성 확보, 적응을 결합한 캠페인을 주시해야 한다.
반복적인 사용은 대만 플랫폼이 특수한 예외가 아니었음을 보여줄 것이다. 또한 필요한 오케스트레이션 지식이 확산되고 있음을 시사할 것이다.
공격자에게 동일한 8개 모델이 꼭 필요한 것은 아니다. 신뢰할 수 있는 도구, 메모리, 검증 시스템에 연결된 하나의 유능한 모델에서도 유사한 행동이 나타날 수 있다.
재현 사례가 없다고 해서 위험이 사라지는 것은 아니다. 이는 운영 복잡성, 비용 또는 탐지가 여전히 광범위한 도입을 제한하고 있음을 시사할 것이다.
세 번째 신호는 공급업체와 정부 통제의 측정 가능한 변화다. 모델 개발자는 더욱 강력한 사이버 평가, 계정 모니터링, 고위험 역량에 대한 제한을 도입할 수 있다.
정부는 핵심 시스템에 접근하는 에이전트를 위한 사고 정의, 공개 채널, 최소 ID 통제를 마련할 수 있다.
국제 AI 안전 보고서의 다음 평가가 특히 중요할 것이다. 벤치마크는 긴 순서, 실패로부터의 복구, 현실적인 방어 체계에 맞선 행동을 시험해야 한다.
단순한 취약점 과제는 장기간의 침입을 대표할 수 없다. 에이전트는 변경되는 자격 증명, 분할된 네트워크, 오도하는 데이터, 중단된 접근 전반에서 평가받아야 한다.
방어자는 제안된 사고 교환 체계가 회원을 확보하고 활용 가능한 보고서를 만들어내는지도 지켜봐야 한다. 세부 조사 결과 없는 참여만으로는 집단 보안이 개선되지 않는다.
기업 구매자에게 당장의 교훈은 실용적이다. 인프라에 연결된 모든 에이전트는 제한된 자격 증명, 관찰 가능한 행동, 검증된 중단 경로를 갖춰야 한다.
개발자는 도구 접근이 모델 출력을 운영상 위험으로 바꾼다고 가정해야 한다. 보안 경계는 프롬프트만이 아니라 전체 에이전트 시스템을 둘러싸고 있다.
지식 근로자에게도 역할이 있다. 인사 파일, 내부 메모, 복사된 자격 증명은 자동화된 표적화의 입력값이 될 수 있다.
불필요한 데이터 노출을 줄이면 이후 공격이 더 어려워진다. 명확한 보존 정책과 구획화된 접근은 하나의 손상된 계정이 드러낼 수 있는 정보를 제한한다.
연구자들이 낯선 사고를 발견함에 따라 Google News는 계속해서 극적인 주장을 노출할 것이다. 독자는 기술적 증거, 자율성 수준, 독립적 확인을 기준으로 이를 판단해야 한다.
완벽한 정의를 기다리며 에이전트 접근 권한 검토를 미루지 말아야 한다. 모든 자율 시스템, 그 시스템이 보유한 자격 증명, 실행할 수 있는 조치를 식별하는 것부터 시작하라.
그다음 더 어려운 질문을 던져야 한다. 그 시스템이 오늘 밤 적대적인 목표를 받는다면, 어떤 통제가 몇 분 안에 그다음 단계를 막을 수 있는가?


