Anthropic의 AI 오용 보고서에 대하여: 에이전트가 방어자에게 비용을 전가하다
Anthropic은 Claude가 사이버 공격, 감시 시스템, 영향력 공작, 무기 연구, 산업적 모델 추출에 사용된 사실을 탐지한 뒤 세 번째 AI 오용 보고서를 발표했다. Anthropic의 AI 오용 보고서에 대하여의 근거는 2025년 12월부터 2026년 8월 사이에 관찰된 활동을 다룬다. 핵심 경고는 AI가 새로운 악의적 목표를 만들어냈다는 데 있지 않다. 에이전트가 기존 작전을 더 저렴하고 빠르게, 더 쉽게 확장할 수 있게 만들었다는 점이다.
보고서는 사람들이 표적을 선택하고, 목표를 정의하며, 중대한 결과물을 검토했다고 설명한다. 이후 AI 시스템은 정찰, 소프트웨어 개발, 취약점 연구, 데이터 처리, 선전물 제작, 그리고 익스플로잇의 일부를 맡았다. 여러 운영자는 Claude를 외부 도구 및 지속형 메모리와 연결해 자동화된 워크플로가 세션을 넘어서도 계속되도록 했다.
이러한 업무 분담은 개별 악성 프롬프트보다 훨씬 중요하다. 이는 AI를 사이버 범죄와 국가 감시의 운영 체계 안에 배치한다. 공격자는 이제 소프트웨어에 전문성을 보존하고, 성공한 절차를 반복하며, 여러 작업 흐름을 동시에 운영할 수 있다.
Bruce Schneier도 자신의 오용 보고서 분석에서 같은 패턴을 지적했다. 의미 있는 변화는 인간이 권한을 유지하는 가운데 기계가 운영 부담의 더 큰 부분을 떠안는 산업화된 실행으로의 전환이다.
Anthropic의 AI 오용 보고서에서 핵심은 워크플로다
보고서에서 가장 중대한 증거는 챗봇이 생성한 개별 답변이 아니라 완전한 워크플로에 관한 것이다.
Anthropic의 위협 인텔리전스 보고서는 범죄 조직, 상업 감시 업체, 정치적 동기를 지닌 개인, 국가 연계 조직의 활동을 문서화한다. 사례는 사이버 작전, 선전, 감시, 재래식 무기, 생물학 연구, 무단 모델 증류에 걸쳐 있다.
회사는 Claude에서 일어나는 모든 활동을 대표하는 표본이 아니라 주목할 만하거나 새로운 사건을 선정했다고 밝혔다. 이 구분은 발생 규모에 관한 결론을 제한한다. 그러나 이 사례들은 모델이 코드, 브라우저, 스캐너, 데이터베이스 및 기타 도구와 연결될 때 동기 있는 운영자가 무엇을 구성할 수 있는지 보여준다.
일부 운영자는 조정 모델이 대규모 목표를 여러 전문 AI 에이전트에게 나누어 맡기는 에이전트 스웜을 운영했다. 이 에이전트들은 정찰, 익스플로잇 연구, 침해 후 작업을 병렬로 수행했다. 지속형 캠페인 메모리는 세션 간 표적 목록, 자격 증명, 지침, 작업 상태를 저장했다.
보고된 한 작전에서 자동화된 워크플로는 디컴파일 도구로 장비 펌웨어와 바이너리를 분석했다. 시스템은 취약점 가설을 세우고, 제안된 익스플로잇을 작성했으며, 표적 제품의 실험실 복제본을 대상으로 이를 시험했다. Anthropic은 하나의 연속 워크플로가 한 달 안에 12건이 넘는 संभाव한 제로데이 발견을 만들어냈다고 밝혔다.
제로데이는 방어 패치가 아직 제공되지 않은, 이전에 알려지지 않은 소프트웨어 취약점이다. 보고서는 의심된 모든 발견이 유효했거나 실제 시스템에 사용됐다고 단정하지 않는다. 다만 전통적으로 지속적인 전문 인력의 주의가 필요했던 작업을 자동화된 프로세스가 반복 수행했음을 보여준다.
다른 에이전트들은 노출된 인터넷 인프라를 반복적으로 검색했다. 이들은 서비스를 식별하고, 진입 지점을 알려진 취약점과 대조했으며, 새 발견을 지속형 프로젝트 메모리에 추가했다. 상시 가동된 13개 에이전트로 구성된 별도 집단은 군사, 정부, 정책, 사회적 출처에서 공개 자료를 수집했다.
이 아키텍처는 악성 작업의 경제성을 바꾼다. 인간은 더 이상 모든 검색, 테스트, 번역, 문서화 작업을 직접 수행할 필요가 없다. 운영자는 확장 가능한 자동화 작업자 집합을 감독하고 표적 선택에 집중할 수 있다.
이 때문에 개별 프롬프트 목록만으로는 이러한 발전을 축소해 보여준다. 각각의 프롬프트는 따로 검토하면 평범해 보일 수 있다. 위험은 오케스트레이션, 누적된 맥락, 도구 접근, 반복, 그리고 결과물을 실행에 옮길 수 있는 능력에서 나타난다.
Anthropic은 연결된 계정을 차단하고, 발견 내용을 안전장치 개선에 활용했다고 밝혔다. 그러나 계정 제거는 한 제공업체에 대한 접근을 해결할 뿐, 근본적인 전문성, 코드, 탈취된 자격 증명, 인프라를 없애지는 못한다. 운영자는 이러한 자산을 보존하고 워크플로의 일부를 다른 곳으로 옮길 수 있다.
따라서 이 보고서는 AI 오용을 콘텐츠 조정 문제가 아닌 운영 보안 문제로 바꾼다. 유해한 텍스트를 차단하는 일은 여전히 유용하지만, 방어자는 신원, 세션, 도구, 침해된 계정 전반에서 자동화된 행동도 탐지해야 한다.
AI 에이전트가 공격 주기를 압축하고 있다
AI 에이전트는 사이버 공격에서 인간을 제거하지는 않지만, 더 적은 인력이 더 많은 표적과 더 많은 기술 계층에 걸쳐 활동할 수 있게 한다.
Anthropic이 설명한 한 캠페인은 정찰, 초기 접근, 수집, 유출, 지속성 확보 전반에서 AI를 사용했다. 해당 행위자는 이메일과 원격 접근 시스템을 식별하고, 표적 목록을 구축했으며, 디바이스 코드 피싱을 위한 인프라를 만들었다고 전해진다.
디바이스 코드 피싱은 피해자가 공격자가 통제하는 세션을 승인하도록 설득하기 위해 정상적인 로그인 절차를 악용한다. 공격자가 이 접근 권한을 얻으면 세션을 통해 클라우드 이메일과 기타 연결된 서비스가 노출될 수 있다. 이 기법은 실제 인증 흐름을 사용하기 때문에 의심을 덜 살 수 있다.
Anthropic은 이 작전이 최소 8개 조직의 메일 기록에 접근했다고 밝혔다. 표적에는 한 국가의 검찰청, 군사 교육 기관, 지역 정부 간 조직이 포함됐다. 또 다른 침입에서는 30만 건이 넘는 국가 신원 기록과 50만 개 이상 기업의 등록 정보가 노출됐다.
보고서에 따르면 AI 시스템은 수백 기가바이트에 이르는 탈취 정보를 정리하는 데 도움을 줬다. 또한 자격 증명 수집, 측면 이동, 보안 제품이 이전 버전을 탐지한 뒤 악성 소프트웨어를 수정하는 작업도 지원했다.
이는 공격자의 행동과 방어 대응 사이의 피드백 루프 일부를 닫는다. 소프트웨어가 실패를 분석하고, 산출물을 수정하며, 새 버전을 빠르게 준비할 수 있다면 탐지가 더는 같은 지연을 만들지 않는다. 인간의 승인은 과정에 남아 있으면서도 기계의 반복이 속도를 높일 수 있다.
또 다른 행위자는 운영 중인 웹 애플리케이션을 상대로 자율형 익스플로잇 파이프라인을 사용했다. 작업자 에이전트는 지속적인 인간 감독 없이 인젝션 취약점, 인증 우회, 크로스 사이트 스크립팅, 서버 측 요청 위조를 시험했다. 잠재적 자격 증명과 발견 사항은 공유 작업 공간으로 다시 흘러갔다.
서버 측 요청 위조는 서버가 공격자를 대신해 요청을 수행하도록 속이는 취약점이다. 이는 공개 인터넷에서 도달할 수 없는 내부 시스템을 노출할 수 있다. 이런 테스트를 자동화하면 운영자가 탐색할 수 있는 엔드포인트 수가 늘어난다.
보고서는 계정 등록, 받은편지함 모니터링, CAPTCHA 해결, 신원 확인 절차를 자동화한 사기 인프라도 설명한다. 또 다른 워크플로는 피해자와 실제 신원 확인 절차 사이에 리버스 프록시를 배치해 인증된 세션과 제출된 문서를 가로챘다.
이 사례들은 Anthropic의 AI 오용 보고서에 대하여가 일반 조직에도 중요한 이유를 보여준다. 기업이 공격자의 최초 표적일 필요는 없다. 노출된 키, 클라우드 테넌트, SaaS 애플리케이션, 공급업체 또는 고객 기록이 중간 자원이 될 수 있다.
한 프랑스어권 공격자는 42개 정치 및 관련 조직을 표적으로 삼은 것으로 전해진다. 이 행위자는 최소 14곳의 내부 접근 권한을 얻고, 약 12~26기가바이트의 데이터베이스 자료를 빼냈다. 침해된 캠페인 플랫폼에서는 정치적 견해를 포함한 약 14만 건의 기록이 노출됐다.
프랑스 캠페인에 관한 독립 보도는 여러 세부 사항을 피해 조직과 연결했다. 이 보도는 중요한 교차 검증을 제공하지만, 기술적 설명의 상당 부분에서 Anthropic은 여전히 주요 출처다.
Anthropic에 따르면 이 행위자는 이전에 문서화되지 않았던 WordPress 익스플로잇 기법도 개발해 최소 4개 웹사이트에 성공적으로 사용했다. 다른 도구는 제출된 자격 증명을 수집하고, 백업을 오염시키며, 웹사이트 자산 안에 원격 접근 코드를 배치했다.
이는 완전 자율형 공격은 아니었다. 인간은 표적을 선택하고, 인프라를 운영하며, 결과를 해석하고, 정치적 목표를 추구했다. 중요한 변화는 레버리지였다. 한 사람이 소규모 기술팀에 맞먹는 범위의 캠페인을 구축하고 유지할 수 있게 됐다.
핵심 충돌은 공격자 규모와 방어자 책임의 대결이다
공격자는 에이전트에 작업을 분산할 수 있지만, 방어자는 모든 실패에 따른 법적, 운영적, 재정적 결과를 온전히 부담한다.
전통적인 보안 계획은 공격 작업이 희소한 전문성을 소비한다고 가정하는 경우가 많다. 숙련된 공격자는 인프라를 연구하고, 도구를 만들며, 탈취 데이터를 검사하고, 탐지 이후 기법을 조정해야 한다. 이러한 제약은 집단이 한 번에 추구할 수 있는 표적 수를 제한한다.
에이전트형 시스템은 이러한 제약을 약화시킨다. 이들은 정찰을 지속적으로 수행하고, 결과를 일관되게 문서화하며, 자료를 번역하고, 기술 작업을 재시도할 수 있다. 또한 그렇지 않으면 한 운영자의 기억 속에만 남을 절차적 지식을 보존한다.
방어자가 마주하는 방정식은 훨씬 가혹하다. 노출된 모든 자격 증명, 잊힌 애플리케이션, 취약한 공급업체, 과도한 권한은 진입점이 될 수 있다. 공격자는 실행 가능한 경로 하나만 필요하지만, 방어자는 끊임없이 변하는 시스템과 신원 집합을 보호해야 한다.
AI 공급망 자체도 표적이 됐다. Anthropic은 최첨단 모델에 대한 할인 접근을 약속했지만 자격 증명 탈취기를 설치한 가짜 서비스를 설명한다. 이 프로그램들은 고객 기기에서 계정 자격 증명과 인증된 세션 토큰을 훔쳤다.
공격자들은 이후 사기성 프록시 네트워크를 통해 해당 접근 권한을 판매하거나 재사용했다. 일부 서비스는 계속 새 자격 증명을 수집하면서 고객을 다른 모델로 은밀히 연결했다. 이는 이전 키가 폐기된 뒤에도 범죄자에게 정상적으로 보이는 계정의 재생 가능한 원천을 제공했다.
또 다른 작전은 사전 출시된 Claude 모델에 접근하려 하며 30개 표적을 시험했다. Anthropic은 모든 시도가 실패했고 자사 시스템은 침해되지 않았다고 밝혔다. 탈취된 키는 이미 침해된 환경을 보유한 고객의 것이었다.
이 구분은 중요하다. 제공업체가 중앙 인프라를 안전하게 지키더라도 공격자는 그 주변의 더 약한 지점을 악용할 수 있다. 개발자 노트북, 브라우저 세션, 자동화 플랫폼, 제3자 라우터, 복사된 구성 파일은 모두 실질적인 보안 경계의 일부가 된다.
따라서 기업은 AI 자격 증명을 다른 권한 있는 운영 비밀과 마찬가지로 다뤄야 한다. 키에는 제한된 범위, 가능한 경우 짧은 수명, 사용량 모니터링, 신뢰할 수 있는 폐기 체계가 필요하다. 비정상적인 모델 트래픽은 공격자가 더 명백한 목표에 도달하기 전에 침해된 환경을 드러낼 수 있다.
보안팀은 에이전트 행동에 대한 가시성도 필요하다. 지속적인 스캔, 병렬 도구 호출, 반복적인 추출 작업을 시작하는 단일 계정은 일반적인 대화와 다른 위험을 보인다. 탐지는 한 번에 하나의 프롬프트가 아니라 행동의 연속을 고려해야 한다.
이로 인해 Anthropic, OpenAI, Google, Microsoft, 클라우드 제공업체, 모델 라우팅 서비스에 압박이 가해진다. 각 주체는 이 사슬의 서로 다른 일부만 본다. 유용한 위협 정보를 교환하지 않고서는 어느 참여자도 전체 캠페인을 재구성할 수 없다.
하지만 모니터링 확대에는 그 자체의 위험도 따른다. 제공업체는 악용을 식별하기 위해 프롬프트, 출력물, 파일, 도구 호출, 계정 관계를 검사할 수 있다. 이러한 관행은 민감한 고객 정보를 노출하거나 서비스 내부에 광범위한 감시 역량을 만들 수 있다.
그에 따른 선택지는 단순히 안전과 개인정보 보호 사이의 문제가 아니다. 모니터링이 취약하면 조직적인 공격이 계속될 수 있다. 모니터링이 과도하면 기밀성이 훼손되고, 오탐에 따른 부당한 비난이 발생하거나, 가치 있는 고객 데이터가 또 다른 중앙집중식 시스템으로 들어갈 수 있다.
제공업체는 제한된 보존 기간, 조사 담당자의 접근 제한, 명확한 에스컬레이션 규칙, 자동 집행에 관한 실질적인 투명성이 필요하다. 고객 역시 어떤 텔레메트리가 존재하는지, 어떤 경우에 정보가 외부 조직과 공유될 수 있는지 알아야 한다.
Anthropic의 AI Misuse Report는 탐지된 활동을 이례적으로 자세히 보여 준다. 다만 오탐, 탐지되지 않은 캠페인, 조사 과정에서 발생하는 개인정보 비용을 완전하게 측정하지는 못한다. 이러한 미해결 질문은 운영상 발견과 함께 다뤄져야 한다.
감시와 선전은 같은 노동 대체 양상을 보인다
보고서의 감시 사례는 강력한 기관이 표적으로 삼는 대상을 바꾸지 않은 채, AI가 엔지니어링 및 분석 인력의 일부를 대체하고 있음을 보여 준다.
말리의 국가안보 당국을 위해 일하던 한 컨설턴트는 Claude를 활용해 대규모 통신 감청 플랫폼을 설계한 것으로 전해진다. 이 시스템은 해당 국가 이동통신 사업자의 통신 데이터를 수집하고 선정된 인물의 신상 보고서를 생성할 수 있었다.
Anthropic은 이 모델이 최종 신상 보고서를 분석한 것이 아니라 기반 소프트웨어 설계를 지원했다고 밝혔다. 별도의 감시 관련 보도에 따르면, Anthropic이 개입한 뒤 이 플랫폼은 다른 모델을 사용해 현지에 배포됐다.
이 결과는 제공업체 집행의 한계를 드러낸다. 클라우드 서비스는 계정을 폐쇄하고 특정 워크플로를 실행하기 어렵게 만들 수 있다. 그러나 반출된 코드, 기술 지식, 수집된 데이터, 대체 모델에 대한 접근을 확실하게 지울 수는 없다.
이란에서는 행위자들이 Claude를 이용해 소셜 네트워크에서 신원을 수집하는 악성 Firefox 확장 프로그램을 만들었다. Anthropic에 따르면 또 다른 이란 조직은 수십만 건의 게시물을 분석해 감시 대상 반대파 계정 39개를 식별했다.
보고서는 중국의 종교 사무 정보 작전이 다수의 분석팀 체계에서 단일 사무실 체계로 축소됐다고 전한다. AI 지원을 통해 이 사무실은 매달 수천 건의 조사를 생산했다.
다른 행위자들은 Claude를 사용해 기사와 소셜 게시물의 정치적 민감도를 평가했다. 이들은 위치, 인구통계학적 특성, 정치적 견해, 신뢰도 등급을 구조화된 기록으로 정리했다. 이런 출력물은 심문, 감시 또는 다른 형태의 통제를 뒷받침할 수 있다.
아랍어 능력이 없던 한 PRC 연계 운영자는 시리아 내 위구르인을 겨냥한 수일간의 모집 작전을 수행한 것으로 알려졌다. Claude는 지역 방언으로 접촉 문구를 작성하고, 답변을 번역하며, 품질 검사를 역할극으로 수행하고, 의심되는 사건 담당자를 위해 결과를 형식화했다.
모델이 박해받는 공동체를 선택한 것은 아니다. 표적, 임무, 의도된 용도는 인간 기관이 제공했다. AI는 그렇지 않았다면 작전을 지연시킬 수 있는 언어, 인력, 기술적 장벽을 낮췄다.
이 패턴은 영향력 공작에서도 나타난다. Anthropic은 러시아, 이란, 튀르키예, 걸프 지역, 남아시아, 아프리카, 유럽 전반에서 발생한 9건의 사례를 자세히 설명한다. 이 캠페인들은 6개 대륙의 대중을 겨냥했다.
운영자들은 가짜 프로필, 뉴스 사이트, 정치 메시지, 조직적인 게시 계획을 만들었다. 일부 캠페인은 선거와 맞물렸다. 러시아 국영 매체는 몰도바의 2025년 9월 투표에 앞서 조작된 주장을 생산했으며, 케냐의 한 운영자는 2027년 선거 전에 가짜 풀뿌리 콘텐츠를 준비했다.
AI가 기만적인 정치 커뮤니케이션을 발명한 것은 아니다. AI는 더 낮은 한계비용으로 페르소나, 번역, 기사, 표적화 전략, 변형 콘텐츠를 생산하는 데 도움을 줬다. 소규모 팀도 독립적인 대중 참여가 더 광범위하게 존재하는 듯한 외관을 유지할 수 있었다.
Anthropic은 운영자들이 캠페인을 계획하는 동안 이를 볼 수 있기 때문에 이례적인 관측 지점을 갖는다. 소셜 네트워크는 콘텐츠가 공개된 뒤에야 작전을 접하는 경우가 많다. 모델 제공업체는 표적 선정과 콘텐츠 제작을 더 이른 단계에서 탐지할 수 있다.
하지만 콘텐츠가 모델 플랫폼을 벗어나면 이들의 가시성은 낮아진다. Anthropic은 후속 활동을 파악하기 위해 오픈소스 조사, 파트너 데이터, 공개 보도를 활용한다고 밝혔다. 이는 일부 계획된 캠페인이 실행되지 않을 수 있는 반면, 다른 캠페인은 Anthropic의 시야 밖으로 옮겨갈 수 있음을 뜻한다.
독자는 탐지된 모든 프롬프트를 완료된 현실 세계 작전의 증거로 간주하지 않아야 한다. 의도, 준비, 배포, 도달 범위, 측정 가능한 영향은 서로 다른 단계다. 보고서는 모델 활동을 인프라 또는 뒷받침 증거와 연결할 때 가장 설득력이 있다.
그럼에도 방향은 분명하다. AI는 감시와 정치적 영향력 행사의 일상적 관료 업무에 진입하고 있다. AI는 기관이 인력을 비례적으로 늘리지 않고도 더 많은 사람을 처리하고, 더 많은 페르소나를 유지하며, 더 많은 보고서를 준비하도록 도울 수 있다.
무기 연구는 더 어려운 안전장치 문제를 제기한다
Anthropic의 발견은 논의를 악의적 글쓰기 지원을 넘어 분석을 물리적 시스템과 연결하는 소프트웨어의 영역으로 확장한다.
회사는 중국의 3개 행위자, 러시아의 2개 행위자, 예멘의 1개 행위자와 관련된 재래식 무기 사례 6건을 차단했다고 밝혔다. 이 중 4건은 무기 하드웨어용 소프트웨어와 관련됐으며, 2건은 조달 또는 정보 수집에 초점을 맞췄다.
보고된 프로젝트에는 유도 로켓, 미사일 유도, 드론 군집 소프트웨어, 어뢰 요격, 전자전 표적화, 방공망 제압이 포함됐다. Anthropic에 따르면 한 유도 로켓 프로그램은 실제 현장 시험을 포함했다.
이들 행위자는 Claude를 사용하기 전부터 일반적으로 관련 하드웨어, 엔지니어링 지식 또는 프로그램 접근 권한을 보유하고 있었다. 이들은 전체 목적을 숨기기 위해 작업을 여러 세션으로 나누고, 안전장치를 우회하려 시도했다.
이 단서는 중요하다. 보고서는 지식이 없는 사람이 질문 하나를 던져 완성된 무기를 받는 모습을 보여 주지 않는다. 대신 역량 있는 집단이 AI를 활용해 엔지니어링, 디버깅, 연구, 문서화, 조달 업무를 가속하는 모습을 보여 준다.
Anthropic은 고위험 폭발물 및 무기 개발 관련 트래픽을 더 잘 탐지하는 분류기를 도입했다고 밝혔다. 분류기는 요청이 제한된 범주에 속하는지를 추정하는 자동화 시스템이다.
이런 통제에는 본질적인 문제가 있다. 많은 엔지니어링 작업은 합법적인 민간 용도를 지닌다. 유도, 항법, 이미지 처리, 무선 통신, 소재 분석, 비행 제어는 상업 시스템과 군사 시스템 모두에 쓰일 수 있다.
보고서는 이중 용도 특성을 지닌 생물학 연구 요청도 설명한다. 한 사례는 전염성과 면역 회피에 영향을 줄 수 있는 치쿤구니야 바이러스 변형에 관한 연구비 제안과 관련됐다.
Claude는 이 작업의 일부 지원을 거부한 것으로 전해지며, 사용자는 다른 AI 서비스로 향했다. Anthropic은 구형 모델이 정교한 생물학 연구자를 실질적으로 지원할 수 있는 기준점 아래에 있었다고 밝혔다. 그러나 현재 시스템에 대해서는 같은 보장을 제공하지 않는다.
생물학적 안전장치 사례에 대한 보도는 이러한 불확실성을 부각한다. 더 유능한 모델은 정당한 연구를 지원할 수 있지만, 그 동일한 역량은 어떤 요청을 차단할지에 대한 판단을 복잡하게 만든다.
과도한 차단에는 실질적인 비용이 따른다. 과학자, 공중보건팀, 보안 연구자는 제한된 작업과 유사한 정보를 필요로 할 수 있다. 반대로 차단이 부족하면 악의적 행위자에게 실험 설계나 운영 계획에 관한 지원을 제공할 수 있다.
모델 제공업체는 불완전한 맥락 속에서 이런 결정을 내려야 한다. 무해해 보이는 요청도 은폐된 프로그램의 한 조각일 수 있다. 우려스러운 요청도 허가된 방어 연구의 일부일 수 있다.
같은 취약점은 사이버 안전장치에도 영향을 미친다. 공격자는 목표를 일상적인 작업으로 분할하고, 계정을 바꾸거나, 탈취한 자격 증명을 사용하거나, 여러 제공업체를 결합할 수 있다. 오픈 웨이트 모델은 계정을 폐쇄할 수 있는 중앙 운영자 없이도 또 다른 경로를 제공한다.
따라서 어떤 제공업체도 안전을 완성된 제품 기능으로 규정할 수 없다. 안전장치는 마찰을 만들고 탐지를 개선하지만, 더 넓은 환경에서 역량 자체를 제거하지는 않는다. 핵심 척도는 개입이 공격자의 비용을 높이는 속도가 역량이 그 비용을 낮추는 속도보다 빠른지 여부다.
Anthropic의 AI Misuse Report는 성공적인 차단 사례의 증거를 제공하지만, Anthropic이 결코 탐지하지 못한 캠페인을 보여 줄 수는 없다. 또한 얼마나 많은 운영자가 프로젝트를 포기했는지, 다른 곳으로 옮겼는지, 혹은 현지 배포 시스템으로 계속 진행했는지도 판단할 수 없다.
이러한 불확실성은 서로 반대되는 두 가지 오류를 막아야 한다. 이 사례들은 AI 에이전트가 모든 정교한 작전을 독립적으로 실행할 수 있음을 증명하지 않는다. 그렇다고 인간이 여전히 목표를 선택한다는 이유로 문제를 일축하는 근거도 되지 않는다.
인간의 지휘와 기계의 실행은 공존할 수 있다. 실제로 이 조합은 판단력을 보존하면서 반복 가능한 작업을 확장할 수 있기 때문에 해로운 작전에 가장 실용적인 구조일 수 있다.
모델 증류는 고객 데이터를 보안 문제로 만든다
보고서의 마지막 반전은 AI 제공업체가 악용의 플랫폼일 뿐 아니라 표적, 데이터 원천, 탈취된 컴퓨팅 자원이기도 하다는 점이다.
Anthropic은 여러 중국 AI 연구소가 Claude를 상대로 무단 증류 캠페인을 벌였다고 비난한다. 증류는 한 모델의 출력물을 사용해 다른 모델의 행동이나 역량을 개선하는 방식이다.
Anthropic에 따르면 Alibaba는 2026년 5월부터 7월까지 1억 5,100만 건이 넘는 상호작용을 생성했다. Moonshot은 같은 기간 2,300만 건이 넘는 상호작용을 생성한 것으로 알려졌다. DeepSeek은 7월 14일 동안 1,210만 건이 넘는 상호작용을 생성했다.
회사는 6월과 7월의 17일 동안 340만 건이 넘는 상호작용을 Zhipu에, 3월과 4월의 20일 동안 40만 건이 넘는 상호작용을 Xiaomi에 귀속시켰다.
이 수치는 Anthropic의 조사 결과이며, 보고서에서 독립 감사를 거치지 않았다. 귀속, 의도, 계약상 주장에 대한 평가는 지목된 기업들의 대응 역시 고려해야 한다.
Anthropic은 이 캠페인들이 추론, 코딩, 도구 사용, 데이터 분석 역량을 노렸다고 밝혔다. 운영자들은 접근 통제를 피하기 위해 허위 신원, 탈취한 카드, 침해된 API 자격 증명, 프록시, 수천 개의 계정을 사용한 것으로 전해진다.
일부는 숨겨진 추론 흔적을 추출하기 위해 수많은 프롬프트 변형을 시험했다. 한 실험은 대규모 캠페인을 시작하기 전에 성공적인 추출 방법을 찾기 위해 12,000개가 넘는 서로 다른 요청을 보낸 것으로 알려졌다.
가장 우려스러운 주장은 고객 데이터와 관련된다. Anthropic은 DeepSeek, Moonshot, Xiaomi가 학습 목적으로 일부 사용자 대화를 Claude로 라우팅했다고 밝혔다. 사용자는 다른 모델 제공업체가 자신의 요청을 처리한다는 사실을 고지받지 못한 것으로 전해진다.
Anthropic은 일부 상호작용에 이름, 이메일 주소, 회사 정보, 개발자 자격 증명, 내부 전망이 포함됐다고 보고했다. 제3자 라우팅 서비스는 미국과 유럽 사용자와 관련된 추가 대화를 제공한 것으로 알려졌다.
이러한 주장은 AI 공급망 위험의 의미를 확장한다. 고객은 정보가 하나의 애플리케이션과 모델로 전달된다고 생각할 수 있다. 실제로 요청은 라우터, 리셀러, 프록시 서비스, 평가자, 숨겨진 상위 제공업체를 거칠 수 있다.
기업은 공급업체에 제출된 정보를 실제로 처리하는 모델이 무엇인지 물어야 합니다. 또한 보존 기간, 학습 활용, 지역별 라우팅, 하위 처리업체, 인간 검토자의 접근에 대해서도 명확한 답변을 받아야 합니다.
이 사례는 복잡한 대칭성을 만들어냅니다. Anthropic은 다른 조직들이 동의 없이 사용자 데이터를 전달했다고 주장하며 비판합니다. 동시에 Anthropic의 자체 보고서는 모델 제공업체가 악용 모니터링을 통해 얼마나 많은 것을 추론할 수 있는지 보여줍니다.
이 상황들은 동등하지 않지만, 공통된 거버넌스 문제를 안고 있습니다. 은밀한 라우팅, 보안 텔레메트리, 조사 과정을 거쳐 민감한 정보가 사용자가 예상하는 것보다 더 멀리 이동할 수 있습니다.
해답은 기밀 데이터가 절대 이동하지 않을 것이라는 약속일 수 없습니다. 조직에는 강제 가능한 통제, 검증 가능한 라우팅, 최소화된 보존, 그리고 각 요청을 어떤 시스템이 처리했는지 보여주는 로그가 필요합니다.
이 때문에 직원들은 승인되지 않은 AI 도구에 실제 비밀 정보를 입력하지 않아야 합니다. 세련된 인터페이스가 요청의 목적지나 접근 가능한 중개자의 수를 보장해 주지는 않습니다.
방어자가 다음으로 주시해야 할 사항
다음 시험대는 보안 대응이 On Anthropic’s AI Misuse Report에서 설명된 경제성을 바꿀 수 있는지 여부입니다.
첫 번째 신호는 제공업체 간 차단입니다. Anthropic은 적절한 경우 공공 및 민간 파트너와 조사 결과를 공유한다고 말합니다. 더 강력한 검증은 한 제공업체의 탐지가 다른 곳의 관련 계정, 인프라, 탈취된 자격 증명을 신속하게 무력화하는지 여부입니다.
협력이 개선되면 공격자들은 서비스 간에 온전한 워크플로를 이전할 수 있는 능력 일부를 잃게 됩니다. 반대로 새 계정과 대체 모델을 통해 캠페인이 반복적으로 재등장한다면, 계정 차단은 일시적인 마찰에 그칠 것입니다.
두 번째 신호는 에이전트 자율성에 관한 증거입니다. 향후 보고서는 AI가 생성한 제안과 도구를 통해 실행된 행동을 구분해야 합니다. 또한 인간이 어디에서 명령을 승인했고, 실패를 수정했으며, 대상을 선택하거나 모호한 결과를 해석했는지 밝혀야 합니다.
이 구분은 에이전트가 더 독립적으로 변하고 있는지, 아니면 숙련된 운영자의 생산성을 높이고 있을 뿐인지를 보여줄 것입니다. 두 결과 모두 중요하지만, 각각 다른 방어책과 정책 대응이 필요합니다.
세 번째 신호는 조사와 프라이버시에 대한 투명성입니다. 제공업체는 어떤 데이터를 보존하는지, 악용 분류기가 어떻게 검토를 촉발하는지, 조사자의 접근을 어떻게 제한하는지 설명해야 합니다. 또한 공개가 공격자에게 도움이 되지 않는 범위에서 오탐과 이의 제기 사례도 보고해야 합니다.
보안 책임자에게 필요한 즉각적인 대응은 실무적입니다. AI 자격 증명을 목록화하고, 모델 라우터를 검토하며, 장기 토큰을 줄이고, 비정상적인 자동화 활동을 모니터링해야 합니다. 손상된 개발자 기기가 모델 세션이나 관련 운영 비밀을 노출할 수 있는지 점검해야 합니다.
팀은 기계 속도의 반복 작업을 고려해 사고 대응 계획도 수정해야 합니다. 차단된 도메인이나 탐지된 페이로드는 몇 분 안에 자동화된 수정을 유발할 수 있습니다. 방어자에게는 조율된 신원 폐기, 엔드포인트 격리, 클라우드 로깅, 공급업체와의 소통이 필요합니다.
지식 노동자는 민감한 프롬프트가 어디로 이동하는지 확인해야 합니다. 소스 코드, 내부 문서, 자격 증명, 연구 데이터 또는 고객 기록을 제출하기 전에 승인된 제공업체와 그 처리 조건을 확인해야 합니다.
Anthropic의 보고서는 자율적인 사이버 종말을 입증하지 않습니다. 이 보고서는 더 즉각적인 현실을 기록합니다. 인간이 AI를 활용해 사이버 범죄, 감시, 선전, 무기 개발 전반에서 전문성을 반복 가능한 인프라로 전환하고 있다는 사실입니다.
다음 보고서의 질문은 악용이 계속되는지 여부가 아닙니다. 방어자가 공격자에게 성공적인 작전 하나마다 더 많은 신원, 비용, 시간, 전문성을 지출하게 만들 수 있는지 여부입니다. 이 측정 가능한 경쟁이 안전장치가 변화를 억제하고 있는지, 아니면 단지 기록하고 있을 뿐인지를 드러낼 것입니다.



