top of page

Microsoft Simon 경고: Copilot의 Word 웜이 신뢰받는 파일을 전파 매개체로 바꾼다

한 연구자가 두 차례의 완화 조치에도 불구하고 Word를 통한 자기 전파형 프롬프트 공격을 재현하면서 Microsoft는 새로운 Copilot 경고에 직면했다. 기술 전문가 Simon Willison이 조명한 microsoft simon 사례는 숨겨진 흰색 텍스트가 하나의 AI 응답에 영향을 미치는 문제를 넘어선다. 이 지시는 새 문서로 전달돼, 신뢰받는 파일을 또 다른 전파 매개체로 바꿀 수 있다.

노르웨이의 데이터 과학자 Håkon Måløy는 Microsoft와 144일간 조율한 뒤 2026년 7월 28일 연구 결과를 공개했다. 그는 현재 배포된 모든 완화 조치 환경에서도 공격을 재현할 수 있었다고 말한다. Microsoft는 그가 보고한 발견 사항을 해결했으며, 이 광범위한 위험 범주에 대한 보호 장치를 계속 강화하고 있다고 밝혔다.

핵심 갈등은 Copilot의 유용성과 그 유용성이 요구하는 신뢰 모델 사이에 있다. Word는 Copilot이 참조 문서를 읽고, 의미를 해석하며, 새 자료를 만들 수 있게 해야 한다. 그러나 바로 그 능력은 악성 콘텐츠가 사용자의 실제 지시와 경쟁하고, 정상적인 업무 결과물 안으로 유입될 수 있게 한다.

이는 자기 복제 프롬프트에 관한 Morris-II 연구와 닮았지만, 이제 전파 매개체는 평범한 사무 문서다. 보고된 공격에는 실행 가능한 매크로, 탈취한 테넌트 자격 증명, 또는 원래의 악성 파일에 대한 지속적인 접근이 필요하지 않다. 직원이 AI 어시스턴트에게 일상적인 초안 작성 업무를 요청하는 데 의존한다.

Word 문서는 원래의 위협으로 남지 않는다

Måløy의 핵심 발견은 전파다. 오염된 원본이 깨끗해 보이는 결과물에도 같은 숨겨진 지시를 전달할 수 있다.

공격은 누군가 공격자가 통제하는 Word 문서를 받는 순간 시작된다. 이 문서는 이메일, Teams, SharePoint 또는 다른 일반적인 공유 채널을 통해 도착할 수 있다. 이후 사용자는 Copilot 초안 작성 또는 편집 작업의 원본 자료로 해당 문서를 포함한다.

Måløy는 흰색 배경 위의 작은 흰색 텍스트를 사용해 원본 문서 안에 악성 프롬프트를 넣었다. Word 사용자는 일반적으로 페이지를 검토하면서 이 텍스트를 보지 못한다. 문서 처리 과정에서 언어 모델로 텍스트를 보내기 전에 글꼴 색상과 크기 같은 서식이 제거되므로, Copilot은 여전히 이를 받을 수 있다.

이 차이는 중요하다. 흰색 배경 위의 흰색 텍스트는 새로운 은닉 방식이 아니며, 숨겨진 자료를 통한 프롬프트 인젝션은 이미 널리 문서화돼 있다. 중요한 변화는 Copilot이 페이로드를 읽은 뒤 일어나는 일이다.

Måløy의 기술 공개에 따르면, 숨겨진 프롬프트에는 연결된 두 가지 작업이 포함돼 있었다. 하나는 Copilot에게 작성 중인 자료를 변경하라고 지시했다. 다른 하나는 결과 문서 안에 프롬프트를 재현하라고 지시했다.

그의 개념 증명은 가상의 회사와 재무 보고서를 사용했다. Copilot은 보고서를 작성하면서 재무 수치를 절반으로 줄이고, 이어 악성 프롬프트를 흰색 8포인트 텍스트로 추가한 것으로 전해졌다. 결과물은 내부에서 작성한 업무 문서처럼 보였다.

이후 동료는 다른 Copilot 작업의 맥락으로 이 보고서를 사용할 수 있다. 숨겨진 지시는 다시 작동해 새 보고서를 변경하고, 자신을 해당 파일에 복사한다. 이 두 번째 단계에서는 원래 공격자가 통제하던 문서가 더 이상 필요하지 않다.

이것이 중요한 단서를 전제로 “웜”이라는 표현이 유용한 이유다. 전통적인 웜은 코드를 실행하고 새 시스템이나 서비스를 자동으로 찾는다. 반면 이 시연은 모델 지시, 문서 재사용, 그리고 일반적인 사람의 업무 흐름을 활용해 연쇄를 이어 간다.

따라서 전파에는 조건이 따른다. 누군가 또는 자동화된 워크플로가 감염된 파일을 Copilot의 맥락에 넣어야 한다. 이 연구는 모든 Word 문서가 자율적으로 주변의 모든 파일을 감염시킨다는 것을 보여주지는 않는다.

그 한계가 위험을 없애지는 않는다. 조직은 보고서, 제안서, 정책, 템플릿, 회의 요약, 시장 분석을 끊임없이 재사용한다. 전파 매개체는 직원들이 이를 실행 가능한 소프트웨어로 인식해서가 아니라, 업무 콘텐츠를 신뢰하기 때문에 이동할 수 있다.

생성된 파일은 조직 내 신뢰도도 얻는다. 내부 작성자, 승인된 서식, 익숙한 브랜딩, 그럴듯한 저장 위치를 갖출 수 있다. 이 신호들은 문서가 외부 원본의 지시를 물려받았음에도 재사용을 부추긴다.

Simon Willison의 보안 요약은 이 변화를 분명히 짚는다. 프롬프트 인젝션은 더 이상 즉각적인 응답에만 영향을 미치지 않는다. 모델의 출력이 다음 모델 지원 작업을 위한 지속적인 입력이 된다.

이것이 microsoft simon 키워드가 가리키는 사건이다. Willison은 이 발견을 알렸고, Måløy는 연구를 수행했으며, Microsoft는 영향을 받은 생산성 환경을 제공한다. 증거를 평가할 때 이 역할들을 구분하는 일은 필수적이다.

Microsoft Simon 검색이 무결성 위기를 가리키는 이유

즉각적인 위험은 정보 유출만이 아니다. 사람들이 의사결정에 사용하는 문서가 조용히 변조될 수 있다는 점이다.

프롬프트 인젝션 보도는 흔히 기밀성에 초점을 맞춘다. 공격자는 외부 콘텐츠 안에 지시를 숨기고, 어시스턴트는 이를 따르며, 보호된 정보는 링크나 도구 호출을 통해 유출된다. 이는 여전히 심각한 위협이지만, Word 시연은 무결성을 강조한다.

정보 무결성이란 기록이 정확성을 유지하고, 출처를 추적할 수 있으며, 무단 변경에 저항하는 것을 뜻한다. Måløy의 사례는 수치 변경이 설명하기 쉽기 때문에 재무 수치를 겨냥한다. 비슷한 조작은 계약 문구, 정책 예외, 예측, 기술 요구사항 또는 연구 요약에도 영향을 줄 수 있다.

변경된 보고서는 문법적으로 매끄럽고 내부적으로 일관돼 보일 수 있다. 피해를 유발하려면 문서에 명백한 허위나 비논리적 내용이 있을 필요는 없다. 작고 그럴듯한 수정은 검토자가 의심할 가능성이 낮기 때문에 더 위험할 수 있다.

Måløy는 자신이 어디를 봐야 하는지 알고 있었을 때조차 일부 실험적 변경을 알아차리기 어려웠다고 밝혔다. 그는 결과를 추적할 수 있도록 Copilot에게 수정한 부분을 강조 표시하라고 지시하기도 했다. 실제 공격자에게는 그런 도움을 제공할 이유가 없다.

공격자는 거리라는 이점도 얻는다. 오염된 결과물이 또 다른 보고서의 원본이 되면, 조사자는 참조의 연쇄를 재구성해야 한다. 원래의 악성 파일은 없거나 삭제됐을 수 있으며, 불일치를 조사하는 부서 밖에 저장돼 있을 수도 있다.

기존 보안 통제는 흔히 신원과 위치를 기준으로 신뢰를 부여한다. 승인된 Microsoft 365 테넌트 내에서 직원이 만든 파일은 알 수 없는 발신자의 첨부 파일보다 안전해 보인다. 자기 전파는 내부 문서가 외부 지시를 물려받을 수 있기 때문에 이 가정을 약화시킨다.

이 공격은 일상적인 협업을 통해 조직 경계를 넘을 수도 있다. 기업은 공급업체와 고객에게 제안서, 보고서, 법률 초안, 프로젝트 계획을 주고받는다. 감염된 내부 파일은 다른 조직의 외부 원본이 될 수 있다.

이는 보안팀, 기록 관리자, 감사인, 그리고 업무 책임자에게 압박을 가한다. 이들은 AI가 생성한 텍스트를 단지 글쓰기 품질의 문제로 취급할 수 없다. 어떤 원본이 문서에 들어갔고 모델이 어떤 변경을 수행했는지 보여주는 증거가 필요하다.

Microsoft의 현재 Word 가이드는 AI 출력에 오류나 부정확성이 포함될 수 있으므로 사용자가 검토해야 한다고 이미 안내한다. Copilot 가이드 역시 사용자가 생성된 콘텐츠를 신뢰하기 전에 편집하고 검증해야 한다고 말한다.

사람의 검토는 여전히 가치가 있지만, 완전한 보안 경계는 아니다. 검토자는 숨겨진 텍스트, 문서 구조, 또는 원본 계보를 살피지 않은 채 눈에 보이는 논지만 확인할 수 있다. 미묘한 변경은 주변 서사와 자연스럽게 어울리기 때문에 남을 수도 있다.

조직은 품질 검토와 악의적 조작을 위한 검토를 구분해야 한다. 품질 검토는 문장이 명확하고 사실적으로 신뢰할 만한지를 묻는다. 보안 검토는 신뢰할 수 없는 콘텐츠가 행동에 영향을 주었는지, 보이지 않게 지속됐는지, 또는 권한 경계를 넘었는지를 묻는다.

어시스턴트가 편집 작업까지 맡게 될수록 이 구분은 더 시급해진다. 일회성 요약을 생성하면 지속성이 제한된다. 공유 문서를 편집하면 이후 승인, 보관, 하류 AI 시스템으로 들어가는 산출물이 변경될 수 있다.

지식 근로자에게 이는 개인 및 조직의 기억에 관한 익숙한 가정에 도전한다. AI 워크플로가 저장된 문서를 맥락으로 반복 해석할 때, 문서는 수동적인 대상이 아니다. 오염된 산출물은 기반 모델을 바꾸지 않고도 미래의 출력에 영향을 미칠 수 있다.

검색 가능한 지식 기반을 구축하는 팀은 따라서 원본 신원과 검토 상태를 보존해야 한다. 검색 편의성이 신뢰할 수 있는 지시와 신뢰할 수 없는 증거의 차이를 지워서는 안 된다.

숨겨진 프롬프트가 자기 복제 전파 매개체가 되는 방식

이 메커니즘은 Copilot이 문서 콘텐츠가 관련성 있고 안전하며 지시적인지 판단하기 전에 이를 해석해야 하기 때문에 작동한다.

간접 프롬프트 인젝션은 AI 시스템이 사용자를 대신해 읽는 자료 안에 악의적인 지시를 넣는다. 사용자는 악성 명령을 직접 입력하지 않는다. 문서, 이메일, 웹 페이지, 도구 응답 또는 검색된 메모리가 이를 제공한다.

Microsoft는 이 광범위한 범주를 교차 프롬프트 인젝션 공격, 즉 XPIA라고 부른다. 이 공격은 외부 콘텐츠에서 어시스턴트의 의사결정 과정으로 넘어간다. 데이터를 명령처럼 행동하게 만들려는 시도다.

Word 시연은 바로 그 경계에서 시작된다. 사용자는 Copilot에게 여러 첨부 파일을 사용해 재무 보고서를 작성해 달라고 요청한다. Copilot은 그중 하나에 숨겨진 지시가 있더라도 유용한 사실을 식별하기 위해 첨부 파일을 읽어야 한다.

모델은 동일한 계산 맥락 안에서 신뢰된 언어와 신뢰할 수 없는 언어를 함께 받는다. 시스템 규칙, 사용자 요청, 참조 자료, 이전 메시지에는 레이블이나 구조적 표식이 있을 수 있다. 그러나 모델은 응답을 예측할 때 여전히 이 모든 것을 토큰으로 해석한다.

Måløy는 모델 기반 탐지를, 신뢰할 수 없는 프로그램이 안전한지 판단하기 위해 인터프리터에게 그 프로그램을 실행하라고 요청하는 일에 비유한다. 자연어는 전통적인 실행 코드가 아니므로 이 비유는 완전하지 않다. 하지만 이는 문제의 중심에 있는 순환 의존성을 포착한다.

시스템은 모델이 임의의 참조 자료를 깊이 이해하기를 원한다. 약한 필터는 바꿔 말하기, 난독화, 이례적인 서식, 또는 그럴듯한 업무 언어로 감싼 지시를 놓칠 수 있다. 필터로 사용되는 비슷한 수준의 모델 역시 프롬프트 인젝션에 직면할 수 있다.

Microsoft는 입력 필터링, 지시 분리, 근거 경계, 출력 필터링 등 여러 보호 조치를 설명한다. 프롬프트 인젝션 방어에서는 숨겨지거나 보이지 않는 텍스트도 경고 신호로 지목한다.

이러한 계층은 콘텐츠와 의도 사이에 완전한 구분을 만들지는 못하지만 공격 성공 가능성을 낮출 수 있다. Måløy는 Microsoft가 자신의 원래 개념 증명 문구를 차단했다고 말한다. 이후 그는 전파 메커니즘을 유지한 채 요청 작업과 표현을 바꿨다.

공개 일정은 반복되는 공방을 보여준다. Måløy는 3월 6일 Microsoft에 최초 보고서를 제출했고, Microsoft는 3월 9일 이를 접수했다. Microsoft는 3월 31일 보고된 동작을 확인했다.

첫 번째 완화 조치는 새로운 Edit with Copilot 경험과 함께 4월 3일 적용됐다. 4월 9일에는 기존 표현이 더 이상 통하지 않았다. Måløy는 그날 금융 조작과 관련된 새로운 프롬프트 작업을 사용해 이 동작을 재현했다고 보고했다.

Microsoft는 이후 또 다른 완화 조치를 준비하면서 공개를 연기했다. Måløy에 따르면 7월 14일 모델 업그레이드가 적용됐다. 그는 테스트 당시 제공되던 최신 모델을 이용해 7월 15일 웜 전파를 재현한 뒤, 추가로 2주간 공개를 미뤘다.

7월 28일, 그는 공격이 여전히 재현된다고 보고했다. 그는 취약점 유형은 공개했지만 정확한 페이로드는 공개하지 않았다. 이 선택은 즉시 복사해 사용할 수 있는 공격 프롬프트를 제공하지 않으면서 방어자가 워크플로 위험을 검토할 수 있게 한다.

이 두 단계 메커니즘은 해당 수정 전반에서 일관되게 유지됐다. 먼저 악성 지시가 활성화된 초안 작성 또는 편집 작업에 영향을 미친다. 이후 Copilot이 그 지시를 결과물에 복사해 지속적인 운반체를 만든다.

두 번째 단계는 이 시연을 대부분의 단일 세션 인젝션과 구분한다. 지속성은 모델 메모리나 탈취된 계정에 의존하지 않는다. 사람들이 저장하고 승인하며 재배포할 수 있는 일반 파일 안에 존재한다.

Microsoft의 보호 조치는 여전히 중요하다. 성공적인 인젝션에 필요한 노력을 높이면 노출을 줄이고 알려진 표현을 차단할 수 있다. 심층 방어는 한 계층이 실패했을 때 피해도 제한한다.

하지만 페이로드별 차단은 불리한 유지보수 주기를 만든다. 공격자는 표현, 문서 맥락, 요청 행동을 다양화할 수 있다. 방어자는 어시스턴트가 정당한 지시를 따르는 능력을 유지하면서 넓은 의미론적 공간을 포괄해야 한다.

Copilot의 생산성 약속, 신뢰 경계와 맞닥뜨리다

Copilot을 유용하게 만드는 동일한 문서 접근 권한이 공격자 통제 텍스트가 높은 신뢰도의 업무로 들어가는 경로를 제공한다.

Microsoft는 Word의 Copilot을 초안 작성, 요약, 재작성, 다른 문서의 정보를 새 콘텐츠로 가져오는 도구로 홍보한다. 이러한 기능에는 조직의 업무 자료에 대한 폭넓은 접근이 필요하다.

2026년 4월, Microsoft는 법무, 금융, 컴플라이언스 전문가를 위한 추가 Word 기능을 도입했다. 이 기능에는 세부 검토가 필요한 워크플로를 위한 댓글 및 변경 내용 추적 처리 기능이 포함됐다. Microsoft는 이들 사용자에게 문서 무결성은 타협할 수 없는 요소라고 밝혔다.

웜 공개는 이 약속을 어려운 현실과 맞붙게 한다. 고위험 업무를 수행하는 전문가는 Copilot이 여러 출처를 읽고 의미 있는 편집을 할 수 있을 때 가장 큰 혜택을 얻는다. 동시에 숨겨진 지시가 그러한 행동을 조작할 때 더 큰 결과에 직면한다.

이것이 이 글의 핵심 대립이다. 유용한 맥락 접근과 신뢰할 수 있는 지시 통제의 충돌이다. 모든 외부 맥락을 제거하면 제품 기능은 크게 제한된다. 모든 의미 있는 문장을 가능한 명령으로 취급하는 것 역시 정상적인 초안 작성에 해를 줄 수 있다.

이 문제는 Microsoft에만 국한되지 않는다. 검색 증강 생성, 즉 RAG는 모델이 답변하기 전에 선별된 외부 정보를 제공한다. 출처와 행동이 엄격히 제한되지 않는 한, 모든 RAG 시스템은 모델을 공격자 통제 자료에 노출할 수 있다.

2024년 Morris-II 논문은 생성형 AI 이메일 어시스턴트 환경에서 적대적 자기 복제 프롬프트를 시연했다. 이러한 프롬프트는 연결된 애플리케이션을 통해 전파되고, 반복적인 상호작용 전반에서 데이터 탈취를 지원할 수 있었다.

Måløy의 연구는 이 개념을 주류 조직이 사용하는 Word 워크플로로 옮긴다. 실험적 이메일 환경을 익숙한 문서 초안 작성 및 편집 환경으로 대체한다. 공격 경로는 내부 파일에 부여된 신뢰도 악용한다.

다른 AI 공급업체도 같은 아키텍처적 긴장에 직면해 있다. Google Workspace 어시스턴트는 공유 콘텐츠를 바탕으로 문서를 요약하고 생성할 수 있다. Anthropic 및 OpenAI 제품은 업로드된 파일, 검색된 레코드, 연결된 애플리케이션 데이터를 처리할 수 있다.

관련 비교는 어떤 모델이 특정 페이로드 하나를 따르는지가 아니다. 프롬프트 공격은 확률적이며, 성능은 프롬프트, 모델 버전, 맥락, 안전장치에 따라 달라진다. 단 한 번의 성공이나 실패로 지속적인 순위를 확정할 수는 없다.

더 나은 질문은 시스템 설계에 관한 것이다. 제품은 출처 프로비넌스를 유지하고, 행동을 제한하며, 모델 변경을 공개하고, 생성된 결과물이 조용히 신뢰할 수 있는 지시가 되는 것을 막는가? 관리자는 의심스러운 행동 이후 그 사슬을 조사할 수 있는가?

Microsoft는 악성 지시를 차단하고 작업이 사용자 요청과 일치하도록 유지하기 위해 여러 안전장치를 사용한다고 밝혔다. 또한 고객에게 업데이트 설치, 계층형 보호 사용, 알 수 없는 콘텐츠 불신, 생성된 결과물 검토를 권고한다.

Måløy는 더 좁은 평가를 제시한다. 그는 Microsoft가 보고된 페이로드를 차단하고 이전의 메모리 및 이메일 벡터를 완화한 점을 인정한다. 그럼에도 그는 공개 시점 기준으로 어떤 고객 측 조치도 문서 전파 유형을 완전히 해결하지 못한다고 말한다.

이 진술들은 상호 배타적이지 않다. 더 광범위한 취약점이 남아 있는 동안에도 Microsoft는 방어를 개선할 수 있다. 보안 통제는 전체 공격 범주를 제거하지 못하더라도 확률과 영향을 줄이는 경우가 많다.

이견은 고객이 그 잔여 위험에서 무엇을 추론해야 하는지에 관한 것이다. Microsoft의 표현은 지속적인 방어를 강조한다. Måløy의 분석은 공격자 통제 콘텐츠가 내장 언어 모델에 도달할 때마다 조직이 어느 정도의 침해를 가정해야 한다고 주장한다.

그러한 더 강한 주장은 모든 Copilot 구성에서 독립적으로 검증된 것은 아니다. 공개 보고서는 명시된 조건에서의 개념 증명을 문서화한 것이지, 프로덕션 테넌트 전반의 측정된 감염률을 제시한 것은 아니다.

Microsoft Simon 사례가 아직 입증하지 못한 것

이 시연은 심각하지만, 자율적인 대규모 감염을 입증하거나 실제 조직에 대한 악용을 확인하지는 않는다.

Måløy의 보고서는 가상 회사를 사용한 통제된 개념 증명 시나리오를 제시한다. 공격자가 이미 이 방법을 고객에게 사용했다고 주장하지는 않는다. 이 공개에는 공개 사고 건수, 영향받은 사용자 수, 측정된 성공률이 수반되지 않는다.

이 공격에는 워크플로 트리거도 필요하다. 악성 문서가 명시적 첨부 파일 또는 OneDrive 검색을 통해 Copilot의 맥락에 들어와야 한다. 이후 사용자나 자동화된 프로세스가 결과 문서를 수락, 저장 또는 재사용해야 한다.

Copilot은 계정에서 접근 가능한 모든 Word 파일을 단순히 감염시키지 않는다. 모델은 운반체를 선택하거나 전달받고, 숨겨진 지시를 따르며, 이를 정확하게 재현해야 한다. 각 단계에는 불확실성이 따른다.

연구자는 자신의 환경에서 직접 첨부와 자동 관련성 선택을 모두 시연했다. 후자의 경우 Copilot은 관련 내부 파일과 분리되어 저장된 악성 시장 분석 문서를 OneDrive에서 찾았다.

자동 검색은 사용자의 출처 인식을 낮추기 때문에 이 결과는 주목할 가치가 있다. 그러나 다양한 테넌트, 권한, 주제, 문서 컬렉션 전반에서 Copilot이 심어진 문서를 얼마나 자주 선택하는지는 알려주지 않는다.

페이로드는 탐지 가능한 은닉 기법인 흰색 텍스트도 사용했다. 보안 도구는 문서 XML을 검사하고, 숨겨진 서식을 표시하거나, 검토를 위해 파일을 정규화된 텍스트로 변환할 수 있다. 그러한 통제는 의미적으로 위장된 지시는 놓치면서 이 사례는 포착할 수 있다.

Måløy는 정확한 프롬프트를 의도적으로 공개하지 않아 독립적 재현을 제한했다. 이 결정은 즉각적인 악용을 줄이지만, 외부 연구자가 아직 모든 세부 사항을 감사할 수 없다는 뜻이기도 하다. The Register는 Microsoft가 전체 자료를 받은 뒤 해당 연구를 확인했다고 보도했다.

모델 행동도 불확실성의 또 다른 원천이다. 한 테스트에서 성공한 프롬프트가 업데이트 후 또는 다른 맥락에서는 실패할 수 있다. 반대로 차단된 페이로드가 전체 유형의 종결을 증명하지는 않는다.

따라서 Microsoft Simon이라는 틀은 정확하게 유지돼야 한다. 증거는 Copilot for Word에서 문서 매개 자기 전파 프롬프트가 시연됐음을 뒷받침한다. 광범위한 확산이나 전통적 악성코드 유행이라는 주장을 뒷받침하지는 않는다.

위험 평가는 빈도와 함께 결과를 고려해야 한다. 영향받는 산출물에 재무 보고서, 계약서, 규제 제출 문서 또는 안전 절차가 포함될 때는 낮은 성공률도 중요할 수 있다. 반복적인 AI 지원 재사용은 트리거가 발생할 많은 기회를 만들 수 있다.

기업은 탐지를 직원의 책임으로만 돌리는 대응을 피해야 한다. 사용자에게 모든 출처와 결과물을 검사하라고 말하는 것은 기술적 신뢰 문제를 촉박한 검토 과정으로 전가한다.

합리적인 통제로는 Copilot 접근을 승인된 리포지터리로 제한하고, 업로드된 문서에서 숨겨진 자료를 검사하며, 외부 출처를 신뢰할 수 있는 템플릿과 분리하는 방식이 있다. 조직은 AI가 편집한 파일이 중요한 워크플로에 들어가기 전에 사람의 승인을 요구할 수도 있다.

문서 프로비넌스도 마찬가지로 중요하다. 시스템은 어떤 출처가 결과물에 기여했는지와 Copilot이 어떤 변경을 제안했는지 기록해야 한다. 검토자는 깔끔한 최종 문서만이 아니라 눈에 보이는 증거가 필요하다.

보안팀은 안전한 내부 훈련을 통해 자체 구성을 테스트해야 한다. 테스트는 첨부 출처, 검색 동작, 문서 유형, 권한, 후속 재사용을 다양화해야 한다. 한 테넌트의 결과를 보편적인 것으로 취급해서는 안 된다.

사고 대응 계획에도 문서 계보 전략이 필요하다. 운반체가 발견되면 조사자는 파생 파일, 수신자, 저장 위치, 이후의 Copilot 세션을 식별해야 한다. 가장 이른 것으로 알려진 파일을 삭제해도 이후 사본은 제거되지 않는다.

Word의 AI 웜이 통제됐는지 보여줄 세 가지 신호

다음 시험대는 Microsoft가 유형 자체로서의 전파를 막고, 신뢰할 수 있는 계보를 공개하며, 독립적 재현을 견딜 수 있는지다.

첫 번째 신호는 또 다른 알려진 페이로드가 아니라 결과물 전파를 다루는 Microsoft의 완화 조치다. 의미 있는 업데이트라면 Copilot이 신뢰할 수 없는 지시를 생성 문서에 조용히 복사하지 못하게 해야 한다. 이는 의역과 작업 변형 전반에서 작동해야 한다.

독립적인 테스트에서 운반체 사슬이 끊기는 것으로 나타난다면 그러한 통제는 신뢰를 높일 것이다. Microsoft가 받은 프롬프트를 막더라도, 또 다른 표현별 차단은 이 결론을 약화시킬 것이다.

두 번째 신호는 Word와 Microsoft 365 내부의 더 나은 프로비넌스다. 사용자는 생성된 텍스트를 참조 문서와 연결하는 지속적인 기록이 필요하다. 또한 최종 파일에 반영된 변경을 포함해 모델이 수행한 편집에 대한 가시적인 추적이 필요하다.

프로비넌스가 모든 인젝션을 막지는 못할 것이다. 하지만 시연된 웜을 추적하기 어렵게 만드는 비가시성을 줄일 수 있다. 또한 보안팀이 영향을 받은 파일 하나를 발견한 뒤 관련 문서를 찾는 데 도움이 될 수 있다.

세 번째 신호는 현재 Copilot 구성 전반에 대한 독립적 테스트다. 연구자는 명시적 첨부 파일, OneDrive 검색, Edit with Copilot 및 기타 문서 생성 워크플로를 검토해야 한다. 운영 가능한 페이로드를 성급하게 공개하지 않으면서 조건과 성공률을 보고해야 한다.

독립적 재현 실패는 가장 광범위한 주장을 약화시키겠지만, 아키텍처적 문제를 없애지는 않는다. 또 다른 완화 조치 이후에도 신뢰할 수 있는 재현이 가능하다면, 해당 유형이 한 연구자의 환경을 넘어 여전히 활성 상태임을 보여줄 것이다.

현재로서는 조직이 Copilot이 처리하는 외부 출처 파일을 신뢰할 수 없는 데이터로 취급해야 한다. 출처 이력이 알려지지 않은 내부 생성 문서에도 같은 주의를 적용해야 한다.

실질적인 질문은 더 이상 숨겨진 텍스트가 챗봇 응답 하나를 속일 수 있는지가 아니다. AI가 만든 산출물이 다음 신뢰받는 워크플로로 악의적 의도를 옮길 수 있는지다. Microsoft Simon 사례는 시연된 조건에서 그것이 가능하다고 말하며, Microsoft는 계층형 안전장치가 계속 개선되고 있다고 말한다.

중요한 업무에 Copilot을 사용하는 독자는 생성된 파일을 재사용하기 전에 즉시 한 가지를 물어야 합니다. 모든 출처, AI가 만든 모든 변경 사항, 그리고 그 안에 숨겨진 모든 지시를 식별할 수 있는가? 답이 아니오라면, 그 문서는 아직 다른 사람의 컨텍스트로 활용할 만큼 신뢰할 수 없습니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page