Tencent의 수정 이후에도 새로운 AI 보안 경쟁을 드러낸 WeChat 제로클릭 웜
Tencent는 연구진이 AI를 활용해 약 이틀 만에 첫 원격 코드 실행 익스플로잇을 개발한 뒤 구축한 WeChat 제로클릭 웜을 수정했다. WeWorm이라는 이름의 이 웜은 전화가 울리는 도중에도 테스트 계정을 탈취한 것으로 알려졌다. 이후 해당 계정으로 다른 연락처에 전화를 걸어 iOS와 Android 전반으로 확산을 이어갔다.
보안 기업 Calif는 7월에 취약점을 Tencent에 신고한 뒤 9월 8일 연구 내용을 공개했다. Tencent는 취약점을 확인하고 the New York Times에 문제를 수정했다고 밝혔다. Calif 역시 Tencent가 모든 사용자를 대상으로 해당 익스플로잇을 완화했다고 전했다.
이 수정으로 시연된 공격이 공개적 위기로 번어드는 것은 막았다. 그러나 더 큰 충돌은 해결되지 않았다. AI 시스템은 취약점 탐색, 익스플로잇 구축, 자동화된 공격 체인 연결에 필요한 시간과 노동을 줄이고 있다.
이러한 변화는 메시징 플랫폼이 취약점 대응의 모든 단계를 단축하도록 압박한다. 또한 AI 개발사에는 거의 동일한 기술적 워크플로우를 통해 방어자와 공격자 모두에게 활용될 수 있는 도구를 다루라는 압박을 가한다.
따라서 핵심 쟁점은 수정된 WeChat 결함 하나보다 크다. AI 지원 보안 연구는 이를 억제하기 위해 구축된 공개, 패치, 대중 경고 체계보다 더 빠르게 진전되고 있다.
WeChat 제로클릭 웜이 실제로 한 일
Calif의 통제된 시연에 따르면, WeWorm은 수신 전화를 계정 탈취와 자동 확산의 경로로 바꿨다.
제로클릭 익스플로잇은 대상의 의도적인 행동을 요구하지 않는다. 피싱과 달리, 누군가 링크를 열거나 파일을 내려받거나 비밀번호를 공유하는 데 의존하지 않는다.
Calif는 WeChat의 결함이 애플리케이션의 voice-over-IP 스택 내 메모리 손상과 관련됐다고 밝혔다. 메모리 손상 결함은 예기치 않은 데이터가 소프트웨어의 정보 저장 또는 처리 방식을 변경하게 한다. 적절한 조건에서는 이러한 손상으로 원격 코드 실행이 가능해질 수 있으며, 이는 공격자가 제어하는 명령이 표적 애플리케이션 내부에서 실행됨을 뜻한다.
연구진은 메시징 애플리케이션에 유사한 공격 표면이 존재할 수 있다는 이유로 기술적 세부 사항을 공개하지 않았다. Calif는 추가 방어 작업 이후 향후 컨퍼런스에서 더 완전한 분석을 발표할 계획이라고 밝혔다.
시연에는 세 대의 휴대전화가 사용됐다. Pixel 10a가 iPhone 17e에 WeChat 전화를 걸었고, iPhone은 벨이 울리는 동안 침해됐다. 감염된 iPhone은 이후 다른 Pixel 10a에 전화를 걸어 해당 기기의 WeChat 계정을 침해했다.
대상은 전화를 받을 필요가 없었다. Calif는 전화를 받아도 들리는 경고음이 발생하지 않았고 익스플로잇도 중단되지 않았다고 밝혔다. 적극적으로 전화를 거절하면 해당 시도는 막을 수 있었지만, 공격자는 나중에 다시 전화를 걸 수 있었다.
이 공격에는 중요한 제약이 있었다. 발신자는 대상의 WeChat 친구 목록에 있어야 했다.
이 요건은 알 수 없는 계정에서의 공격을 제한하지만, 웜과 같은 확산을 막지는 못한다. 신뢰받는 계정 하나가 침해되면, 이미 그 신원을 알고 받아들이는 사람들에게 전화를 걸 수 있다.
Calif는 익스플로잇에 성공하면 영향을 받은 WeChat 계정을 제어할 수 있다고 밝혔다. 공격자는 메시지를 읽고 보내며, 전화를 걸고, 피해자의 신원을 통해 행동할 수 있었던 것으로 알려졌다.
이러한 주장은 반드시 휴대전화 전체에 대한 제어가 아니라 애플리케이션 수준의 제어를 설명한다. Calif는 추가 Android 또는 iOS 취약점이 공격 체인을 기기 장악으로 확장할 수 있다고 밝혔다. 그러한 더 광범위한 결과에는 공개된 WeChat 문제 외에 별도의 결함이 필요하다.
이 구분은 중요하다. 침해된 메시징 계정은 대화를 노출하고 소유자를 사칭할 수 있다. 기기 전체가 침해되면 관련 없는 애플리케이션과 시스템 서비스 전반에 저장된 정보까지 접근할 수 있다.
Calif의 WeWorm 연구에 따르면, AI 시스템은 7월 중 어느 시점에 버그를 발견했다. 엔지니어링 팀은 7월 23일 이를 인지했고, 7월 24일 Tencent에 제출했다.
회사는 7월 30일 첫 Android 원격 코드 실행 익스플로잇을 완성했다. iOS 버전은 8월 2일, 다듬어진 크로스플랫폼 웜 시연은 8월 11일에 마쳤다.
공개된 이 타임라인은 두 календар일을 훨씬 넘는다. Calif의 더 짧은 개발 기간 주장은 전체 공개 절차가 아니라 첫 익스플로잇에 투입된 집중 작업 시간을 가리키는 것으로 보인다.
범죄자나 정보 기관이 실제 사용자를 상대로 이 특정 취약점을 사용했다는 증거는 나오지 않았다. Calif는 통제된 연구 환경에서 웜을 구축했으며, Tencent는 공개 전에 공격 경로를 수정했다.
그럼에도 시연은 보안 계산을 바꿨다. 제로클릭 진입점, 계정 제어, 신뢰된 연락처, 크로스플랫폼 확산을 하나의 작동하는 체인으로 연결했기 때문이다.
이 조합은 WeChat 제로클릭 웜을 단순한 개별 충돌이나 개념 증명보다 더 중대한 사례로 만들었다. 취약한 통신 기능 하나가 그 자체의 배포 네트워크가 될 수 있음을 보여줬다.
AI가 익스플로잇 개발의 시간을 바꾸는 이유
가장 중요한 주장은 AI가 독자적으로 웜을 발명했다는 점이 아니라, 과거 더 큰 전문가 팀과 연관됐던 작업을 압축했다는 점이다.
Calif는 연구진이 표적을 선정하고, 조사를 지휘하며, 결과를 안전하게 테스트했다고 밝혔다. AI는 그러한 인간 감독 아래 취약점 분석과 익스플로잇 개발 작업의 상당 부분을 수행했다.
이는 자율적 사이버전이 아니다. 경험 많은 연구진은 여전히 어디를 살필지 결정하고, 결과물이 유용한지 판단하며, 최종 공격 체인을 구성했다.
그러나 인간의 개입이 위험을 없애지는 않는다. 전문가가 통제권을 유지하더라도 시스템은 비용을 의미 있게 낮출 수 있다.
전통적으로 익스플로잇 개발은 여러 어려운 단계를 포함한다. 연구진은 비정상적인 소프트웨어 동작을 식별하고, 근본 버그를 분리하며, 그것이 보안 영향을 만드는지 판단하고, 이를 안정적으로 유발하는 코드를 구축해야 한다.
이어 서로 다른 기기, 운영체제, 메모리 레이아웃, 플랫폼 방어 체계를 고려해야 한다. 하나의 익스플로잇을 웜으로 바꾸려면 확산 로직과 운영 테스트도 추가된다.
AI는 코드 검토, 충돌 분석, 디버깅, 가설 생성, 반복적인 적응을 지원할 수 있다. 또한 전문가가 경쟁하는 접근법을 테스트하는 동안 여러 기술적 세부 사항을 맥락 속에 유지할 수 있다.
WeWorm 타임라인은 이러한 역량이 완전한 연구 워크플로우 전반에서 작동할 수 있음을 시사한다. AI는 발견에서 원격 코드 실행으로, 이어 크로스플랫폼 확산 시연으로 나아가는 데 도움을 준 것으로 알려졌다.
이는 챗봇에게 알려진 취약점을 설명해 달라고 요청하는 것과는 다른 기준이다. 연구진에 따르면 이 시스템은 공개되지 않은 결함을 찾아 무기화하는 데 기여했다.
Calif는 어떤 모델을 사용했는지, 얼마나 많은 프롬프트나 시도가 필요했는지, 연구진이 작업을 어떻게 나눴는지를 공개하지 않았다. 또한 독립 팀이 생산성 주장을 재현할 수 있는 증거도 내놓지 않았다.
이러한 공백 때문에 전통적인 익스플로잇 개발과의 명확한 비교는 어렵다. 이틀이라는 수치에는 준비 과정, 실패한 실험, 도구, 연구진이 축적한 전문성이 제외될 수 있다.
그렇더라도 Calif의 주장은 더 넓은 흐름과 맞아떨어진다. 보안 팀은 퍼징, 코드 분석, 취약점 발견, 익스플로잇 평가, 패치 생성에 모델을 적용하고 있다.
Google은 5월에 AI로 개발된 것으로 판단한 제로데이 익스플로잇을 사용하는 위협 행위자를 식별했다고 밝혔다. 제로데이는 방어자가 아직 패치할 시간을 갖지 못한 취약점이다.
회사의 AI 위협 조사 결과는 이 사례를 자사가 식별한 첫 번째 사례로 설명했다. Google은 공격자가 이 익스플로잇을 광범위한 캠페인에 사용할 의도가 있었다고 밝혔다.
Google은 AI 에이전트를 방어적으로도 사용한다. Big Sleep 프로젝트는 취약점을 찾아냈고, CodeMender는 모델을 소프트웨어 복구에 적용한다. Chrome 팀은 발견, 분류, 수정에 관련 시스템을 활용한다.
이는 WeChat 사례의 이면에 있는 핵심 경쟁을 만든다. 동일한 기술 범주는 익스플로잇 구축과 취약점 제거 모두를 가속할 수 있다.
공격자에게는 시스템으로 진입할 하나의 유용한 경로가 필요하다. 방어자는 널리 사용되는 서비스의 작동을 유지하면서 수많은 가능한 경로를 찾아 우선순위를 정하고 차단해야 한다.
AI는 방어자에게 더 많은 자동화를 제공하지만, 이러한 비대칭성을 없애지는 않는다. 또한 과거에는 더 큰 팀이나 전문 조직이 필요했던 기술 역량에 추가 공격자들이 도달하도록 도울 수 있다.
위험은 모든 초보자가 즉시 최고 수준의 익스플로잇 개발자가 된다는 데 있지 않다. 모델은 환각을 일으키고, 시스템 동작을 오해하며, 신뢰할 수 없는 코드를 생성할 수 있다. 어려운 표적에는 전문가의 판단이 여전히 결정적이다.
더 즉각적인 우려는 역량 있는 운영자와 관련된다. 경험 많은 연구자나 공격자는 AI를 활용해 더 많은 가설을 탐색하고, 일상 작업을 자동화하며, 충돌과 작동하는 익스플로잇 사이의 거리를 줄일 수 있다.
WeWorm은 초기 익스플로잇을 웜으로 전환하는 데 추가로 일주일이 걸린 것으로 알려졌다. 패치 체계는 대개 더 긴 조직적 타임라인에 따라 작동하기 때문에 이 기간은 중요하다.
플랫폼은 제보를 확인하고, 재현하고, 영향을 받은 버전을 식별하며, 완화책을 구축하고, 회귀를 테스트하고, 업데이트를 배포하고, 결과를 모니터링해야 한다. 이 과정의 실수는 정상적인 통신을 방해할 수 있다.
공격자의 워크플로우에는 그보다 적은 의무가 있다. 익스플로잇이 충분히 안정적으로 작동하면 운영자는 이를 사용하려 할 수 있다.
따라서 WeChat 제로클릭 웜은 시간과 날짜 단위로 측정되는 경쟁을 드러낸다. 발견, 검증, 배포, 모니터링을 가장 적은 지연으로 연결하는 쪽이 승리하는 경우가 많을 것이다.
신뢰된 연락처가 WeWorm의 배포 체계가 됐다
WeWorm은 WeChat의 사회적 신뢰 모델을 안전 경계에서 확산 메커니즘으로 전환했다.
기존 친구 관계가 필요하다는 점은 처음에는 취약점의 위험을 낮추는 것처럼 보일 수 있다. 실제로는 그 조건이 웜에 연결된 계정을 통한 구조화된 경로를 제공했다.
사람들은 낯선 이의 전화와 아는 연락처의 전화를 다르게 대한다. 메시징 플랫폼도 알 수 없는 계정에는 주지 않는 통신 권한을 신뢰된 계정에 부여한다.
WeWorm이 하나의 계정을 제어하게 되면, 이 확립된 신원을 통해 전화를 걸 수 있었던 것으로 알려졌다. 탈취에 성공할 때마다 도달 가능한 연락처 집합이 새로 생성됐다.
이 때문에 웜의 동작은 판도를 바꾼다. 일반적인 표적형 익스플로잇은 운영자가 각 피해자를 식별하고 접근해야 한다. 웜은 새로 침해된 시스템을 통해 다음 배포 시도를 자동화한다.
연구진은 수학적 확산 모델을 공개하지 않았다. the New York Times는 전문가들이 통제되지 않은 공격이 몇 시간 안에 수억 대의 기기에 도달할 수 있다고 봤다고 보도했다.
이 추정치를 관측된 결과로 받아들여서는 안 된다. Calif는 수억 개의 실제 계정이 아니라 세 대의 테스트 휴대전화에서 확산을 시연했다.
실제 확산은 연락처 관계, 플랫폼의 속도 제한, 사용자 활동, 익스플로잇의 신뢰성, 서버 측 탐지, 취약한 클라이언트 수에 따라 달라질 것이다. 네트워크 분할과 신속한 개입도 확산 속도를 늦출 수 있다.
그럼에도 WeChat의 규모는 제약된 확산 경로조차 심각하게 만든다. Calif는 이 서비스가 10억 개가 넘는 계정을 지원하며 중국 안팎의 커뮤니티에 서비스를 제공한다고 설명했다.
단 하나의 계정이 침해되었다고 해서 자동으로 모든 사람에게 도달하는 것은 아니다. 그러나 감염된 사용자가 가족, 동료, 고객, 비즈니스 파트너와 연결되면서 성공적인 웜은 여러 사회적 집단을 가로질러 확산될 수 있다.
크로스 플랫폼 작동은 이 경로를 넓힌다. iOS와 Android는 서로 다른 아키텍처와 보안 제어를 사용하기 때문에, 많은 모바일 익스플로잇 체인은 하나의 운영체제에서 멈춘다.
Calif의 시연은 WeChat 통화를 통해 Android에서 iOS로, 다시 Android로 이동했다. 표적 애플리케이션이 공통 공격 표면을 제공했으며, 연구진은 각 플랫폼에 맞춰 익스플로잇을 조정했다.
이는 해당 웜이 모든 iOS 또는 Android 방어 체계를 우회했다는 뜻은 아니다. 이는 해당 공격이 두 시스템 모두에서 WeChat 내부의 코드 실행을 달성한 것으로 보고됐다는 의미다.
메시징 플랫폼은 이전에도 통화 기반 공격을 겪었다. Meta는 스파이웨어 공급업체 NSO Group이 2019년 WhatsApp의 통화 시스템을 악용해 1,000명 이상의 사용자를 표적으로 삼았다고 밝혔다.
Meta의 이후 스파이웨어 소송은 응답하지 않은 통화가 왜 고가치 전달 채널이 될 수 있는지를 보여줬다. 사용자가 어떤 결정을 내리기 전에도 애플리케이션이 통화 데이터를 처리할 수 있기 때문이다.
WhatsApp 작전은 표적 감시와 연관돼 있었다. WeWorm은 통화 기반 익스플로잇을 자동화된 연락처 기반 전파와 연결한다는 점에서 다른 우려를 제기한다.
이 설계는 개념적으로 오래된 컴퓨터 웜과 닮았다. 당시 프로그램들은 다음 표적을 찾기 위해 네트워크를 스캔하거나 자격 증명을 재사용했다. WeWorm은 대신 소셜 그래프를 활용한 것으로 전해진다.
초기 기술 침해 이후에도 손상된 신원 정보가 계속 유용하게 쓰일 수 있기 때문에, 소셜 그래프는 특히 민감하다. 공격자는 피해자를 사칭하거나, 대화를 조작하거나, 최초 코드 실행을 넘어 관계를 악용할 수 있다.
종단 간 암호화는 이 문제를 해결하지 못한다. 암호화는 메시지가 엔드포인트 사이를 이동하는 동안 보호한다. 이미 장악한 엔드포인트를 통해 공격자가 콘텐츠를 읽는 것을 막을 수는 없다.
이 구분은 사용자와 기업 구매자 모두에게 중요하다. 안전한 전송 채널이 데이터를 처리하는 애플리케이션에 악용 가능한 코드가 없음을 보장하지는 않는다.
메시징 도구에 의존하는 조직은 해당 도구를 더 폭넓은 인시던트 계획에 포함해야 한다. 엔드포인트 침해 이후에는 계정 복구, 기기 격리, 신원 확인, 대체 커뮤니케이션 수단이 모두 중요하다.
팀에는 보안 결정과 대응 책임을 검색 가능한 형태로 기록해 둘 필요도 있다. 잘 관리된 엔지니어링 지식 베이스는 신속한 사고 발생 시 대응자가 이전 평가, 영향받은 시스템, 에스컬레이션 절차를 찾는 데 도움을 줄 수 있다.
교훈은 기업이 신뢰할 수 있는 연락처 사용을 중단해야 한다는 것이 아니다. 현대적 커뮤니케이션에는 신원 및 관계 기능이 필요하다.
교훈은 사용자가 상호작용하기 전에 신뢰가 복잡한 데이터 처리를 자동으로 승인해서는 안 된다는 점이다. 모든 수신 통화, 미리보기, 첨부 파일, 알림은 공격자가 연구할 수 있는 코드 경로를 만든다.
Tencent는 익스플로잇을 수정했지만, 공개 과정에는 공백이 남았다
Tencent는 시연된 공격을 차단한 것으로 보이지만, 사용자들은 무엇이 취약했는지 또는 노출 여부를 어떻게 평가했는지에 관한 공개 정보를 거의 받지 못했다.
Calif는 Tencent가 8월 21일 Android용 WeChat 8.0.77과 iOS용 8.0.76을 배포했다고 밝혔다. 연구진은 이 릴리스들이 버그를 완화했다고 평가했다.
8월 28일 Calif는 Tencent 서버에서 모든 사용자를 대상으로 자사 익스플로잇이 차단됐음을 확인했다. 서버 측 완화 조치는 모든 사용자가 업데이트를 설치할 때까지 기다리지 않고 클라이언트를 보호할 수 있다.
Calif의 타임라인에 따르면 Tencent는 9월 4일 해당 취약점의 원격 코드 실행 영향을 확인했다. Tencent 대변인 역시 New York Times에 회사가 문제를 수정했다고 말했다.
이는 중요한 방어 성과다. 공급업체가 연구진이 시연을 공개하기 전에 조치했음을 시사한다.
그러나 Calif의 연표에는 이례적인 순서도 포함돼 있다. 최초 보고 직후인 7월 25일부터 7월 28일까지 Calif의 WeChat 연구 계정이 차단됐다가 복구됐다.
공개 기록은 해당 차단이 왜 발생했는지를 확정하지 않는다. 추가 증거 없이 Tencent가 연구를 의도적으로 방해했다고 추론하는 것은 부적절하다.
Tencent의 공개 커뮤니케이션도 또 다른 미해결 문제로 남아 있다. 영향을 받은 릴리스는 상세한 보안 권고문이 아니라 일반적인 버그 수정 문구로 설명됐다.
9월 8일 기준, 이 취약점에 대한 공개 CVE 식별자는 확인되지 않았다. CVE는 방어자가 특정 결함을 추적하는 데 사용할 수 있는 표준화된 참조 정보다.
Tencent와 Calif 어느 쪽도 영향을 받은 모든 WeChat 버전을 공개적으로 식별하지 않았다. 따라서 사용자는 7월 또는 8월에 사용한 기기가 취약한 코드를 실행했는지 쉽게 판단할 수 없다.
Calif는 침해 지표도 공개하지 않았다. 이는 공격 이후 방어자가 검색할 수 있는 기술적 흔적을 뜻한다. 이 세부 정보가 없으면 사용자는 의심스러운 통화를 점검할 간단한 방법이 없다.
Tencent는 사용자가 침해됐다는 증거가 없다고 밝힌 것으로 전해진다. 이 표현은 공개 피해자가 없다고 해서 공격이 발생했다는 증거가 되지 않는 것처럼, 익스플로잇이 한 번도 발생하지 않았다는 것을 증명하지는 않는다.
책임 있는 결론은 더 제한적이다. 심각한 익스플로잇이 실험실 환경에서 시연됐고, Tencent가 이를 완화했으며, 확인된 악성 캠페인은 공개적으로 이 결함과 연결되지 않았다.
또 다른 불확실성은 비모바일 클라이언트와 관련된다. WeChat은 데스크톱 및 HarmonyOS 환경도 지원하지만, 공개된 연구는 iOS와 Android에 초점을 맞췄다.
두 회사는 동일한 VoIP 구성 요소 또는 관련 취약 코드가 다른 환경에도 존재했는지 밝히지 않았다. Calif가 예정한 기술 발표에서 그 범위가 명확해질 수 있다.
서버 측 차단 역시 면밀한 검토가 필요하다. Calif는 자사의 특정 익스플로잇이 더 이상 작동하지 않음을 확인했지만, 외부 연구자들은 아직 해당 완화 조치의 지속성이나 범위를 평가할 수 없다.
필터는 근본적인 안전하지 않은 코드를 제거하지 않은 채 알려진 하나의 메시지 패턴만 차단할 수 있다. 클라이언트 패치는 결함 코드를 더 직접적으로 해결할 수 있지만, 설치된 이후에만 가능하다.
Calif는 Tencent가 클라이언트 릴리스와 서버 제어를 모두 통해 버그를 완화했다고 말한다. 기술적 세부 사항이 공개되기 전까지 관찰자들은 어떤 계층이 지속적인 해결책을 제공하는지 독립적으로 판단할 수 없다.
이 검증 공백이 Tencent의 시기적절한 대응을 가려서는 안 된다. 회사는 7월 24일 최초 보고를 받았고, 8월 21일 언급된 모바일 버전을 배포했다.
그 기간은 많은 기업의 패치 주기보다 짧았다. 그러나 결함이 독립적으로 발견됐다면, 공개되지 않은 공격자가 위험을 초래하기에는 여전히 충분히 긴 시간이었다.
메시징 공급업체는 공개 과정에서 어려운 균형을 맞춰야 한다. 세부 정보를 너무 일찍 공개하면 사용자가 보호받기 전에 공격자가 작동하는 익스플로잇을 재현하는 데 도움이 될 수 있다.
정보를 너무 적게 공개하면 관리자는 노출 여부를 평가하거나 해결 조치를 확인할 수 없게 된다. 또한 독립 연구자가 수정 사항이 관련 공격 경로까지 포괄하는지 시험하는 것도 막을 수 있다.
더 나은 공개 기록에는 궁극적으로 영향을 받은 버전, 해결 세부 사항, 추적 식별자, 탐지 지침이 포함돼야 한다. 광범위한 완화 이후에는 더 깊은 기술 정보를 공개할 수도 있다.
보안 보도 역시 Tencent 권고문과 공개 검색 가능한 지표가 없다는 점을 언급했다. 이러한 누락은 이제 수정 이후의 상황을 규정하고 있다.
일반 사용자에게는 최신 WeChat 버전을 설치하는 것이 여전히 합리적이다. 설명하기 어려운 계정 활동, 메시지, 통화 역시 가능한 경고 신호로 여겨야 한다.
그러나 이 특정 시연은 일반적인 피싱 예방 조언으로 차단할 수 없다. 피해자는 아무것도 클릭할 필요가 없었기 때문에, 사용자 인식만으로는 충분한 방어가 아니었다.
따라서 책임은 주로 플랫폼 엔지니어링, 신속한 패치 배포, 서버 제어, 체계적인 취약점 연구에 있다. 사용자는 첫 번째가 아니라 최종 방어 계층을 맡는다.
진짜 경쟁은 AI 지원 공격과 AI 지원 방어의 대결이다
WeWorm은 무제한 배포나 보안 중심 AI에 대한 일괄적 제한 어느 하나만으로는 해결할 수 없는 트레이드오프를 보여준다.
Calif는 AI가 공격자가 악용하기 전에 방어자가 취약점을 찾을 기회를 제공한다고 주장한다. 해당 팀은 WeChat 결함을 책임 있게 보고하고, 완화 조치가 이뤄질 때까지 공개를 기다렸다.
이 결과는 방어적 활용의 근거를 뒷받침한다. Calif의 연구가 없었다면 메모리 손상 결함은 다른 주체에게 계속 악용 가능한 상태로 남았을 수 있다.
Google은 취약점을 찾아내고 수정에도 도움을 주는 AI 에이전트를 통해 비슷한 주장을 제시했다. Chrome 팀은 AI 지원 연구가 확대되면서 2026년 동안 버그 보고가 급격히 빨라졌다고 밝혔다.
현대 소프트웨어에는 수백만 줄의 자체 코드와 서드파티 코드가 포함돼 있기 때문에 방어의 규모가 중요하다. 사람의 검토만으로는 출시 전에 모든 상호작용을 점검할 수 없다.
AI는 의심스러운 함수를 우선순위화하고, 테스트 케이스를 생성하며, 크래시를 해석하고, 패치를 제안하는 데 도움을 줄 수 있다. 또한 취약점 보고서를 다른 곳의 유사 결함과 연결할 수 있다.
그러나 같은 기능은 버그를 무기화하는 데 필요한 노력을 줄일 수 있다. 코드 이해, 디버깅, 자동화된 실험에는 본질적인 충성 대상이 없다.
안전 제어는 악성코드에 대한 직접적 요청을 차단할 수 있지만, 숙련된 운영자는 작업을 더 작은 구성 요소로 나눌 수 있다. 오픈 모델, 수정된 시스템, 특화된 로컬 도구를 사용할 수도 있다.
Calif의 작업은 경험이 부족한 사람이 WeWorm을 재현할 수 있음을 입증하지는 않는다. 다만 경험 많은 연구자들이 AI가 정교한 개발 과정의 상당 부분을 수행했다고 믿는다는 점은 보여준다.
따라서 보안 산업에는 모델 제공업체의 주장 이상의 증거가 필요하다. 유용한 측정은 발견, 익스플로잇, 수정, 오탐률 전반에서 AI를 사용한 전문가 팀과 사용하지 않은 전문가 팀을 비교해야 한다.
이러한 평가는 신뢰성도 검토해야 한다. 무해한 크래시를 많이 찾는 모델은 절감하는 것보다 더 많은 방어 업무를 유발할 수 있다.
익스플로잇 자율성은 또 다른 핵심 측정 항목이다. 코드 제안을 제공하는 것, 연구자가 지시한 워크플로를 완수하는 것, 공격 대상을 독립적으로 선택하는 것 사이에는 의미 있는 차이가 있다.
WeWorm은 이 스펙트럼의 중간에 위치한다. 인간이 목표를 선택하고 작업을 감독했으며, AI는 여러 기술적으로 까다로운 단계를 가속한 것으로 전해진다.
연구자들은 공격 재현법을 공개하지 않으면서도 검증을 지원할 수 있을 만큼의 방법론을 공개해야 한다. 여기에는 모델 범주, 도구 접근 권한, 작업 시간의 정의, 인간 개입 비율 등이 포함될 수 있다.
공급업체 대응 시스템에도 그에 상응하는 현대화가 필요하다. AI 에이전트가 버그를 빠르게 찾아도, 보고서가 분류를 위해 몇 주씩 대기한다면 방어적 가치는 제한적이다.
플랫폼은 자동화된 재현, 심각도 평가, 패치 테스트, 조율된 배포를 통합해야 한다. 잘못된 보안 패치는 필수 서비스를 중단시킬 수 있으므로, 이러한 시스템에는 인간의 검토가 필요하다.
정부도 자체적인 트레이드오프에 직면한다. 합법적인 보안 연구를 제한하면 방어적 발견은 줄어드는 반면, 의지가 확고한 공격자는 대체 모델과 사설 도구를 계속 이용할 수 있다.
아무것도 하지 않는 것 역시 비용을 수반한다. 개발자는 일관된 평가, 접근 제어, 모니터링 없이 점점 더 강력한 사이버 시스템을 출시할 수 있다.
최선의 단기 대응은 수사적 대응이 아니라 운영적 대응이다. AI 연구소, 소프트웨어 공급업체, 클라우드 제공업체, 독립 연구자는 더 빠른 조율된 취약점 공개 채널이 필요하다.
또한 모델이 이전에 알려지지 않은 취약점을 발견하고 무기화할 수 있는지를 평가하기 위한 공동 표준도 필요하다. 공개된 과제에만 기반한 벤치마크로는 그 역량을 완전히 측정할 수 없다.
역사적 사례는 준비가 왜 중요한지를 보여준다. 통화 기반 스파이웨어, 메시징 파서 결함, 유출된 익스플로잇 도구는 현대 AI의 가속 없이도 이미 심각한 피해를 일으켰다.
2024년 모바일 위협 연구는 웜 형태로 확산 가능한 모바일 익스플로잇이 파괴적 네트워크 악성코드에 버금가는 결과를 낳을 수 있다고 경고했다. WeWorm은 이러한 우려를 뒷받침하는 구체적인 크로스플랫폼 사례다.
이제 달라진 점은 개발 속도다. 공격 워크플로가 수개월에서 수일로 단축된다면, 비공개 공개 기간과 패치 파이프라인 역시 그에 맞춰 단축돼야 한다.
방어자가 따라잡을 수 있는지를 보여줄 세 가지 신호
다음 시험대는 Tencent와 더 넓은 보안 업계가 한 번의 성공적인 수정 조치를 AI 가속형 익스플로잇 개발에 대응하는 반복 가능한 방어 체계로 전환할 수 있는지다.
첫 번째 신호는 Calif가 예고한 기술 발표다. 해당 분석은 취약한 구성 요소, 영향을 받는 버전, 익스플로잇 제약 조건, Tencent의 완화 조치가 얼마나 지속 가능한지를 명확히 해야 한다.
이후 독립 연구자들은 WeWorm이 제한적인 구현 실수에 의존했는지, 아니면 더 광범위한 VoIP 취약점 유형을 드러냈는지를 판단할 수 있다. 관련 결함의 증거가 발견된다면 업계 전반의 검토가 필요하다는 근거는 더 강해질 것이다.
제한적이고 잘 격리된 결함이라면 당면한 범위는 줄어든다. AI 개발이 주는 교훈까지 사라지는 것은 아니지만, 플랫폼 위험의 범위는 좁아진다.
두 번째 신호는 Tencent의 공개 보안 문서다. 상세한 권고문, CVE 기록 또는 탐지 지침은 사용자와 기업 방어자가 과거 노출 여부를 평가하는 데 도움이 된다.
명확한 문서는 Tencent가 Calif의 정확한 익스플로잇을 차단하는 수준을 넘어섰음을 보여줄 수도 있다. 반대로 침묵은 버전, 텔레메트리, 관련 클라이언트에 관한 중요한 질문을 남긴다.
세 번째 신호는 AI 지원 익스플로잇 생산성에 관한 독립적 증거다. Calif의 작업 시간 주장은 다른 전문 팀, 모델, 소프트웨어 표적과의 비교가 필요하다.
향후 보고서는 기계의 작업량과 인간의 전문성 및 사전 준비 작업을 구분해야 한다. 또한 실패한 시도, 재현 가능성, 신뢰할 수 있는 패치를 만드는 데 필요한 시간도 측정해야 한다.
여러 표적에서 일관된 결과가 나온다면 이 글의 핵심 판단은 더욱 설득력을 얻는다. 이는 AI가 한 숙련된 연구실 내부에서만이 아니라 업계 전반에서 공격의 시간을 압축했음을 보여줄 것이다.
Calif의 결과를 재현하지 못한다면 즉각적인 민주화에 관한 더 광범위한 주장은 약화될 것이다. 이는 WeWorm이 드문 전문성, 비공개 도구 또는 특히 다루기 쉬운 결함에 크게 의존했음을 시사한다.
개발자에게 실질적인 질문은 더 이상 AI가 보안 업무에 속하는지 여부가 아니다. 공격자와 방어자는 이미 실제 소프트웨어를 대상으로 이를 시험하고 있다.
기업 구매자는 공급업체에 유입 콘텐츠를 어떻게 격리하는지, 조용한 수정 조치를 얼마나 빠르게 배포하는지, 고객에게 취약점 공지를 어떻게 전달하는지를 물어야 한다. 또한 신뢰하던 계정이 악의적으로 변했을 때의 복구 절차도 시험해야 한다.
지식 근로자는 애플리케이션을 최신 상태로 유지하고, 비정상적인 요청은 다른 채널을 통해 확인해야 한다. 이러한 습관은 진정한 제로클릭 익스플로잇을 막을 수는 없지만 계정 탈취 이후의 2차 피해는 줄일 수 있다.
WeChat 제로클릭 웜은 문서화된 대규모 확산으로 이어지지 않았다. 이는 바람직한 결과이며, Tencent의 완화 조치는 인정받을 만하다.
그러나 경고는 여전히 심각하다. 보도에 따르면 AI는 소규모 연구팀이 숨겨진 통화 결함을 수주 안에 크로스플랫폼의 자기 전파형 계정 탈취 수단으로 전환하는 데 도움을 줬다.
다음 웜은 WeChat을 통해 오지 않을 수도 있고, 이를 발견한 이가 조정된 공개 절차를 따르지 않을 수도 있다. 보안팀은 또 다른 신뢰받는 애플리케이션이 공격자를 대신해 전화를 걸기 시작하기 전에, 지금 자신의 대응 시간을 점검해야 한다.



