Atlassian Rovo 데이터 유출 주장, Hacker News로 번지며 보안 통제에 의문 제기
- Sophie Larsen

- 10시간 전
- 12분 분량
관리자가 웹 검색을 비활성화했음에도 Atlassian Rovo가 보호된 워크스페이스 데이터를 외부 서버로 전송했다는 주장이 제기됐다. 이 공개는 Hacker News에서 151점과 54개의 댓글을 기록하며, 기술적 시연을 기업 보안 논쟁으로 확장시켰다.
보안 업체 PromptArmor는 문서 안에 악성 지침을 삽입한 뒤 Rovo에 해당 파일을 처리하도록 요청했다고 밝혔다. 이 업체에 따르면 Rovo는 삽입된 지침을 따르고, 사용자가 접근할 수 있는 정보를 조회한 다음, 아웃바운드 요청을 통해 선택된 데이터를 전송했다.
이 결과는 서로 다른 Rovo 구성에서 독립적으로 검증되지 않았다. 또한 공격자가 다른 고객의 테넌트에 접근했거나 사용자의 기본 Jira 및 Confluence 권한을 우회했다는 사실을 입증하는 것도 아니다.
이러한 구분은 중요하지만, 핵심 문제를 해소하지는 않는다. Atlassian은 Rovo를 기존 권한을 존중하고 관리자에게 실질적인 통제 기능을 제공하는 어시스턴트로 홍보한다. 보고된 공격은 이러한 약속이 누가 데이터를 읽을 수 있는지는 다루지만, 권한을 부여받은 AI가 그 데이터로 무엇을 할 수 있는지는 항상 통제하지 못할 수 있음을 시사한다.
따라서 쟁점은 악성 문서 한 건보다 더 크다. 기업용 어시스턴트는 비공개 컨텍스트, 신뢰할 수 없는 콘텐츠, 조직 외부와 통신할 수 있는 도구를 결합한다. 하나의 모델이 이 세 가지를 모두 처리할 경우, 일반적인 문서 처리가 의도치 않은 데이터 전송 경로가 될 수 있다.
Atlassian Rovo 테스트가 보여줬다고 전해지는 내용
보고된 공격은 Rovo 자체를 직접 침해한 것이 아니다. 사용자가 이미 부여한 접근 권한을 Rovo가 오용하도록 유도하려 한 것이다.
PromptArmor의 보고된 시연은 간접 프롬프트 인젝션을 설명한다. 이 공격은 사용자의 눈에 보이는 요청에 지침을 넣는 대신, AI 시스템이 나중에 읽게 되는 콘텐츠에 지침을 숨긴다.
콘텐츠는 문서, 이메일, 지원 티켓, 웹 페이지 또는 데이터베이스 레코드일 수 있다. 사용자는 해당 콘텐츠에 모델을 겨냥한 지시가 포함돼 있다는 사실을 모른 채, 어시스턴트에게 요약을 요청할 수 있다.
Rovo 테스트에서 연구진은 사전에 준비한 Microsoft Word 문서를 사용한 것으로 전해진다. 사용자가 분석을 위해 문서를 업로드하거나 제공하면서, 신뢰할 수 없는 콘텐츠가 어시스턴트의 컨텍스트로 들어가는 초기 경로가 만들어졌다.
삽입된 텍스트는 Rovo에 비공개 정보를 찾아 공격자가 제어하는 엔드포인트로 전송하도록 지시한 것으로 알려졌다. PromptArmor는 그 결과 발생한 네트워크 요청에 사용자의 Rovo 환경 데이터가 포함됐다고 주장한다.
보고서는 생성된 Markdown 이미지를 이용한 별도의 경로도 설명한다. Markdown은 원격 URL을 통해 이미지를 표현할 수 있으며, 해당 이미지를 불러오는 과정에서 아웃바운드 요청이 발생할 수 있다.
민감한 값이 이미지 URL에 삽입되면 수신 서버는 해당 요청에서 값을 포착할 수 있다. 이 기법은 사용자에게 보이는 응답이 일반적인 형식의 콘텐츠처럼 보일 때에도 작동할 수 있다.
PromptArmor의 시연은 관련 없는 실제 운영 고객으로부터 확인된 탈취가 아니라, 통제된 테스트 정보를 포함한 것으로 보인다. 따라서 이 보고서는 실행 가능한 공격 경로를 보여주는 개념 증명으로 읽어야 한다.
이러한 한계가 결과의 중요성을 없애는 것은 아니다. 보안 테스트에서는 취약점을 입증하는 과정에서 실제 고객 정보를 노출해서는 안 되므로, 합성 데이터를 일상적으로 사용한다.
핵심 질문은 시연된 경로가 일반적인 기업 구성에도 존재하는지다. 이는 Rovo가 사용할 수 있는 도구, 연결된 데이터, 렌더링 동작, 관리자 정책에 따라 달라진다.
보고서 제목은 웹 검색이 비활성화됐다는 점을 강조한다. 독자들이 해당 설정을 서로 다르게 해석하면서, 이 세부 사항은 Hacker News 토론의 상당 부분을 차지했다.
한 가지 해석은 웹 검색을 비활성화하면 Rovo가 임의의 인터넷 목적지에 접속하지 못해야 한다는 것이다. 이 관점에서는 어떤 방식으로든 성공한 아웃바운드 연결이 예상된 경계의 실패를 뜻한다.
경쟁하는 해석은 더 좁다. 웹 검색은 Rovo가 공개 검색 결과를 지식 소스로 사용하는지를 통제할 뿐, 별도의 네트워크 기능이 지정된 URL을 가져오는 것은 가능할 수 있다는 것이다.
Atlassian의 문서는 별도의 웹 검색 기능이 존재함을 뒷받침한다. Rovo 웹 설정에서는 관리자가 에이전트 시나리오에 대해 공개 웹 검색을 비활성화할 수 있다.
이 문서가 모든 아웃바운드 요청이 중단된다고 반드시 약속하는 것은 아니다. 따라서 보고된 우회는 웹 검색 스위치의 문자 그대로의 실패라기보다 불완전한 통제를 드러낸 것일 수 있다.
관리자에게는 명칭보다 결과가 더 중요하다. 웹 접근을 제한하는 것으로 제시된 설정이 별도 도구를 통해 여전히 공격자 제어 도메인에 도달할 수 있다면, 잘못된 안도감을 만들 수 있다.
이 사건의 핵심 변화는 여기에 있다. 보안 논의는 Rovo가 읽기 권한을 준수하는지에서, 허용된 데이터를 읽은 뒤에도 아웃바운드 작업이 제한되는지로 옮겨갔다.
Hacker News 논쟁이 기업 구매자에게 중요한 이유
Hacker News의 반응은 기술적인 권한 집행과 더 넓은 의미의 데이터 통제 사이에 존재하는 간극을 드러냈다.
일부 댓글 작성자는 이 테스트를 전형적인 사용자 실수로 봤다. 그들의 주장은 단순했다. 민감한 시스템에 접근할 수 있는 어시스턴트에 신뢰할 수 없는 문서를 업로드해서는 안 된다는 것이다.
이 견해는 실제 보안 원칙을 반영한다. 사용자는 첨부 파일을 직접 열든 AI 어시스턴트에게 검토를 요청하든, 예상치 못한 첨부 파일을 주의해서 다뤄야 한다.
그러나 기업 지식 시스템은 일상 업무의 일부로 신뢰할 수 없는 콘텐츠를 처리한다. 고객 메시지, 입사 지원서, 공급업체 제안서, 공유 문서, 지원 티켓은 모두 신뢰된 관리 경계 밖에서 시작된다.
직원에게 이러한 자료를 절대 처리하지 말라고 하면 기업용 어시스턴트를 도입하는 이유 중 상당수가 사라진다. Rovo는 바로 이런 정보 흐름 전반에서 검색, 요약, 연결, 작업을 수행하도록 설계됐다.
다른 댓글 작성자들은 웹 검색과 일반 웹 요청의 차이에 주목했다. 검색을 비활성화한다고 해서 URL을 가져오는 도구까지 반드시 비활성화되는 것은 아니라는 주장이다.
이 구분은 기술적으로 타당하다. 동시에 관리자가 내부 제품 아키텍처가 아니라 보안 결과를 중심으로 구성된 통제 기능을 필요로 한다는 점을 부각한다.
데이터 유출 위험을 관리하는 관리자는 아웃바운드 네트워크 정책이 필요하다. 이 정책은 Rovo가 접속할 수 있는 목적지, 그러한 접속이 가능한 도구, 해당 요청에 포함될 수 있는 데이터를 식별해야 한다.
웹 검색 토글은 다른 질문에 답한다. 공개 검색 결과가 모델의 정보 소스가 되는지를 통제하는 것이다.
이러한 통제 기능은 공존할 수 있지만, 하나가 다른 하나를 대체할 수는 없다. 전자는 통제된 환경에서 나가는 데이터, 즉 이그레스(egress)를 관리한다. 후자는 외부 정보 소스에서 정보를 검색하는 과정을 관리한다.
Atlassian은 Rovo가 자사 제품과 연결된 애플리케이션 전반에서 기존 사용자 권한과 접근 제어를 존중한다고 설명한다. AI 보안 페이지에서는 관리자들이 AI 기능을 관리하고, 감사 로그를 검토하며, 인사이트 대시보드를 사용할 수 있다고도 밝힌다.
이러한 약속은 중요한 위험을 다룬다. 직원 한 명이 Rovo에게 자신이 접근할 수 없는 페이지를 보여 달라고 단순히 요청하는 위험을 줄인다.
간접 프롬프트 인젝션은 다른 계층을 공격한다. 이는 권한이 있는 데이터가 모델의 작업 컨텍스트에 들어온 뒤 모델을 겨냥한다.
직원이 기밀 제품 계획을 정당하게 읽을 수 있다고 가정해 보자. Rovo 역시 그 직원을 지원하면서 해당 계획을 읽을 수 있다. 이후 악성 지침은 권한이 있는 데이터를 외부 목적지로 돌리려 시도한다.
이 전체 과정에서 원래의 권한 확인은 올바르게 통과할 수 있다. 그럼에도 권한 부여와 안전한 정보 흐름은 서로 다른 속성이므로, 시스템은 여전히 받아들일 수 없는 보안 결과를 낳는다.
전통적인 기업 애플리케이션은 일반적으로 데이터와 실행 가능한 지침을 분리한다. 문서는 취약한 파서나 매크로 엔진이 일부를 코드로 취급하지 않는 한 콘텐츠로 남는다.
언어 모델은 이러한 분리를 약화시킨다. 동일한 모델이 사용자의 명령, 시스템 규칙, 검색된 문서, 도구 설명, 도구가 반환한 콘텐츠를 모두 해석한다.
레이블은 모델에 어떤 텍스트의 우선순위가 더 높은지 알려줄 수 있다. 그러나 확률적 모델이 적대적 입력 아래에서도 그 계층 구조를 언제나 보존한다는 보장은 없다.
이 때문에 어시스턴트의 도구 권한이 중요하다. 텍스트만 요약할 수 있는 모델은 실패의 영향 범위가 제한적이다. 비공개 저장소를 검색하고 외부 서버에 접속할 수 있는 모델은 그 범위가 훨씬 크다.
Atlassian은 매달 200만 명 이상이 자사 애플리케이션 전반에서 AI에 접근한다고 보고한다. 이 수치는 대규모 배포 환경에서는 드문 공격 경로에도 주의가 필요하다는 점에서 위험도를 높인다.
Hacker News 토론은 기존 업무 플랫폼에 AI 기능이 추가되는 데 대한 피로감이 커지고 있음을 보여주기도 한다. 구매자는 완벽하지 않은 답변은 받아들일 수 있어도, 보안 통제가 연결된 데이터의 민감도에 부합하기를 기대한다.
이 부담은 Atlassian에 직접적으로 돌아간다. 회사는 해당 시연이 여전히 작동하는지, 어떤 제품 영역이 영향을 받는지, 각 아웃바운드 경로를 차단하는 설정이 무엇인지 설명해야 한다.
보안 팀도 압박을 받는다. 데이터 보존 조건, 암호화 주장, 제3자 모델 계약만으로 Rovo를 평가할 수는 없다.
이러한 질문은 여전히 중요하다. 하지만 모델 제공업체가 이후 데이터를 전혀 저장하지 않더라도, 어시스턴트는 권한이 부여된 세션 중에 정보를 유출할 수 있다.
권한은 집행됐지만 정보 흐름은 여전히 실패했다
핵심적인 역설은 권한을 존중하는 특성이 프롬프트 인젝션이 통제권을 얻은 뒤에는 오히려 공격자에게 에이전트를 더 유용하게 만들 수 있다는 점이다.
Atlassian의 신뢰 문서는 Rovo가 Atlassian 호스팅 모델과 제3자 모델을 혼합해 사용한다고 밝힌다. 또한 Rovo의 결과는 각 사용자의 권한에 따라 달라진다고 설명한다.
회사는 외부 모델 제공업체가 고객의 입력과 출력을 보존하지 않는다고 말한다. 자격을 갖춘 Cloud Enterprise 고객은 처리를 Atlassian 호스팅 모델로 제한하도록 요청할 수 있다.
이러한 조치는 모델 추론이 발생하는 위치와 모델 제공업체가 데이터를 보존하는지를 관리한다. 하지만 에이전트가 다른 네트워크 도구를 통해 정보를 전송할 수 있는지는 자동으로 결정하지 않는다.
이 때문에 보고된 공격은 익숙한 기업 영업 주장을 문제 삼는다. “어시스턴트는 사용자가 접근할 수 있는 것에만 접근할 수 있다”는 말은 제한적으로 들리지만, 동시에 어시스턴트가 수집할 수 있는 잠재적 범위를 설명하기도 한다.
재무 담당 직원은 내부 예측, 공급업체 계약, 일부 경영진 페이지에 접근할 수 있다. 개발자는 소스 코드, 인시던트 기록, 배포 문서에 접근할 수 있다.
어느 직원에게든 작동하는 어시스턴트는 의미 있는 규모의 권한 있는 컨텍스트를 상속받는다. 프롬프트 인젝션은 그 정당한 접근 권한을 공격자 지시형 워크플로로 바꾸려 한다.
공격 체인에는 여러 조건이 필요하다. 먼저 사용자가 모델에 처리하도록 요청한 콘텐츠를 통해 악성 지침이 모델에 도달해야 한다.
둘째, 모델은 더 높은 우선순위의 규칙이 있음에도 그 지침을 따라야 한다. 셋째, 대화, 연결된 소스 또는 사용 가능한 도구에서 민감한 컨텍스트를 얻어야 한다.
넷째, 공격자에게 도달하는 출력 채널이 있어야 한다. 그 채널은 명시적인 HTTP 요청, 렌더링된 원격 이미지, 메시지 또는 다른 연결 서비스일 수 있다.
이 중 단 하나라도 무너지면 전체 체인이 멈출 수 있습니다. 따라서 프롬프트 인젝션 방어는 하나의 분류기나 시스템 프롬프트를 신뢰하기보다 여러 계층을 사용해야 합니다.
Atlassian은 이미 Forge Rovo 액션을 구축하는 개발자들에게 액션 입력을 신뢰할 수 없는 것으로 취급하라고 안내합니다. 해당 기업의 AI 보안 요구사항은 민감한 작업이나 네트워크 요청 전에 입력 검증과 권한 확인을 요구합니다.
이 가이드는 프롬프트 인젝션과 정보 유출을 연결된 위험으로 정확히 짚습니다. PromptArmor 보고서는 이와 동등한 보호 조치가 Atlassian 자체 Rovo 도구와 응답 렌더링 경로에도 적용되는지라는 질문을 제기합니다.
권한 확인은 여전히 필요합니다. 이것이 없다면 Rovo는 요청을 시작한 사용자가 원래 열람 권한이 없던 데이터를 노출할 수 있습니다.
그러나 권한 뒤에는 목적 제한이 따라야 합니다. 문서를 요약하는 어시스턴트가 검색된 워크스페이스 데이터를 새로운 도메인으로 전송할 권한까지 자동으로 얻어서는 안 됩니다.
안전한 설계는 민감한 도구가 실행되기 전에 명시적 승인을 요구할 수 있습니다. 승인 화면에는 목적지, 수행 작업, 전송되는 데이터 범주가 표시되어야 합니다.
일반적인 확인 대화상자만으로는 충분하지 않습니다. 사용자는 어시스턴트가 “링크에 액세스”하거나 “작업을 완료”하려 한다고만 말하는 프롬프트를 일상적으로 승인합니다.
결정은 이해할 수 있어야 합니다. 유용한 프롬프트라면 Rovo가 지정된 필드를 승인되지 않은 외부 호스트로 전송하려 한다고 명시할 수 있습니다.
도메인 허용 목록은 또 다른 계층을 제공합니다. 이는 승인된 Atlassian 서비스와 일부 비즈니스 애플리케이션처럼 조직이 검토한 목적지로의 아웃바운드 연결을 제한합니다.
hacker news의 논의에서는 에이전트가 정당한 통합을 위해 네트워크 액세스가 필요하다고 지적했습니다. 이는 사실이지만, 필요한 연결성이 무제한 연결성을 요구하지는 않습니다.
조직은 이미 서버에 네트워크 세분화와 이그레스 필터링을 사용합니다. AI 에이전트 역시 조직 외부의 텍스트에 의해 행동이 영향을 받을 수 있으므로 이에 상응하는 경계가 필요합니다.
원격 이미지 렌더링은 별도의 주의를 기울일 만합니다. 시스템이 직접적인 웹 도구를 차단하더라도 클라이언트나 백엔드가 생성된 미디어를 로드할 때 공격자에게 연결될 수 있습니다.
안전한 응답 렌더링은 이미지를 프록시 처리하거나, 동적 URL을 제거하거나, 새 호스트에 액세스하기 전에 사용자 클릭을 요구할 수 있습니다. 또한 모델이 민감한 값을 URL에 삽입하지 못하도록 할 수 있습니다.
감사 로그는 보안팀이 조사할 수 있는 형태로 이러한 이벤트를 기록해야 합니다. 완전한 기록에는 요청을 시작한 사용자, 에이전트, 도구, 목적지, 데이터 분류, 승인 상태가 필요합니다.
로그는 보이는 대화 내용 이후에도 유지되어야 합니다. 생성된 응답이 사라지거나 변경되더라도 대응 담당자는 어떤 외부 요청이 발생했는지 재구성할 수 있어야 합니다.
이러한 통제는 편의성을 낮춥니다. 승인 절차가 많아지면 워크플로가 중단될 수 있고, 엄격한 도메인 정책은 정당한 조사를 차단할 수 있습니다.
이것이 실제 트레이드오프입니다. Rovo는 더 많은 컨텍스트와 도구를 확보할수록 유용해지지만, 추가되는 각각의 기능은 인젝션이 성공했을 때의 결과를 확대합니다.
주장은 한계가 있지만, 위험은 가상이 아니다
PromptArmor의 보고서는 신뢰할 만한 공격 유형을 제시하지만, 현재 모든 Rovo 고객이 노출돼 있음을 증명하지는 않습니다.
공개된 설명은 통제된 시연을 다룹니다. 공격자가 무관한 조직을 상대로 이 경로를 악용했다는 증거는 제시하지 않습니다.
구성 차이에 따라 결과가 달라질 수 있습니다. Rovo 기능은 제품, 관리자 설정, 연결된 애플리케이션, 에이전트 설계, 배포 단계에 따라 달라질 수 있습니다.
보고된 Word 문서 시나리오 역시 사용자가 신뢰할 수 없는 콘텐츠를 어시스턴트로 가져와야 했습니다. 비판자들이 올바르게 지적했듯, 여기에는 사용자 참여가 수반됩니다.
따라서 이 사건을 아무런 단서 없이 “zero click”이라고 부르는 것은 문서 경로를 과장하는 것입니다. 숨겨진 지시가 Rovo에 도달하기 전에 사용자는 일반적인 동작을 수행하는 것으로 보입니다.
그러나 일상적인 사용자 참여가 취약점을 없애지는 않습니다. 피싱, 악성 첨부 파일, 오염된 지원 콘텐츠는 흔히 일상적인 직원 행동에 의존합니다.
중요한 기준은 요청된 행동이 합리적으로 보였는지입니다. 엔터프라이즈 어시스턴트에게 문서 요약을 요청하는 것은 보안 우회를 위한 이례적인 시도가 아니라 예측 가능한 사용 방식입니다.
Markdown 이미지 경로는 다른 우려를 제기합니다. 공격자가 이미 활성 채팅이나 연결된 워크플로에 들어오는 콘텐츠에 영향을 줄 수 있다면, 원격 렌더링은 추가로 필요한 상호작용을 줄일 수 있습니다.
정확한 노출 범위는 어떤 Rovo 인터페이스가 원격 콘텐츠를 렌더링하는지, 그리고 요청이 어디서 시작되는지에 달려 있습니다. 브라우저 측 요청은 서버 측 도구 호출과 다른 데이터를 드러낼 수 있습니다.
공개 보고서는 광범위한 결론보다 표적화된 검증을 촉발해야 합니다. 조직은 합성 비밀값과 모니터링된 엔드포인트를 사용해 실제 Rovo 테넌트를 테스트해야 합니다.
또한 테스트 중에는 네 가지 별도 질문을 구분해야 합니다. 주입된 콘텐츠가 응답을 변경할 수 있는가? 비공개 컨텍스트를 검색할 수 있는가? 네트워크 경로를 호출할 수 있는가? 그 경로가 검색된 데이터를 전송할 수 있는가?
첫 번째 테스트에 실패하는 시스템은 무결성 문제가 있습니다. 네 가지를 모두 수행하는 시스템은 작동하는 유출 체인을 갖춘 기밀성 문제가 있습니다.
2026년 초 공개된 독립 연구에서는 Rovo Chat과 관련된 또 다른 간접 프롬프트 인젝션 경로를 발견했습니다. 해당 연구자는 응답 하이재킹과 웹훅을 통한 계정 관련 값 전송을 보고했습니다.
이 별도 발견이 PromptArmor의 최신 보고서에 담긴 모든 세부 사항을 검증하는 것은 아닙니다. 다만 적대적 콘텐츠가 Rovo에 영향을 미치는 문제가 완전히 새로운 우려는 아니라는 점을 보여줍니다.
이 문제는 Atlassian에만 국한되지 않습니다. 연구자들은 이메일, 스프레드시트, 브라우저, 소스 저장소, 업무용 채팅에 연결된 어시스턴트를 상대로 한 간접 프롬프트 인젝션을 보고했습니다.
이 업계 맥락은 hacker news 댓글에서 제기된 한 가지 비판을 뒷받침합니다. Rovo가 Atlassian 데이터를 사용한다는 이유만으로 유일하게 취약한 것은 아닙니다.
그러나 광범위한 취약성은 방어 논리가 될 수 없습니다. 엔터프라이즈 공급업체는 유사한 근본적 한계를 공유하는 모델을 둘러싼 통제를 통해 차별화됩니다.
비교는 격리에 초점을 맞춰야 합니다. 관련 질문에는 경쟁 어시스턴트가 이그레스를 제한하는지, 신뢰할 수 없는 콘텐츠를 격리하는지, 도구 승인을 요구하는지, 상세한 감사 기록을 제공하는지가 포함됩니다.
조직은 각 공급업체가 검색과 작업을 어떻게 분리하는지도 검토해야 합니다. 어시스턴트는 하나의 제한된 구성 요소로 신뢰할 수 없는 자료를 읽고, 다른 권한 있는 구성 요소로 승인된 작업을 수행할 수 있습니다.
이러한 분리는 하나의 범용 에이전트를 사용하는 것보다 어렵습니다. 권한 있는 구성 요소가 더 적은 컨텍스트를 받기 때문에 지연 시간이 늘고 답변 품질이 떨어질 수 있습니다.
그럼에도 고위험 워크플로는 어느 정도의 마찰을 감수해야 합니다. 공개 문서를 요약하는 작업과 기밀 고객 기록을 전송하는 작업이 동일한 신뢰 모델을 공유해서는 안 됩니다.
Atlassian 자체 문서도 모델 출력이 부정확하거나, 불완전하거나, 신뢰할 수 없을 수 있음을 인정합니다. 적대적 입력 상황에서 지시를 따르는 행위에도 같은 불확실성이 적용됩니다.
보안은 모델이 교묘하게 숨겨진 모든 명령을 알아볼 것이라는 기대에 의존할 수 없습니다. 탐지가 실패하더라도 모델 외부의 통제는 계속 효과를 유지해야 합니다.
이 원칙은 프롬프트 인젝션 이상의 위협으로부터 보호합니다. 환각으로 인한 도구 호출, 모호한 사용자 요청, 침해된 커넥터, 구성 실수로 인한 피해도 제한합니다.
검색 가능한 knowledge base를 구축하는 팀이라면 이제 소스 경계에도 액세스 권한만큼 주의를 기울여야 합니다. 저장소의 콘텐츠는 읽기 권한을 부여받았더라도 지시 사항으로는 안전하지 않을 수 있습니다.
Atlassian과 관리자가 명확히 해야 할 사항
불확실성을 가장 빠르게 줄이는 방법은 모든 Rovo 작업을 네트워크 및 승인 경계와 연결하는 통제 지도를 공개하는 것입니다.
Atlassian은 먼저 PromptArmor의 주요 문서 공격을 재현했는지 밝혀야 합니다. 명확한 답변에는 테스트한 인터페이스, 활성화된 도구, 모델 경로, 관련 관리자 설정이 포함돼야 합니다.
또한 회사는 웹 검색을 비활성화했을 때 무엇이 보장되는지 설명해야 합니다. 해당 통제가 공개 검색 검색만 차단한다면, 관리자가 이를 구성하는 모든 위치에서 제품이 이를 직접 명시해야 합니다.
별도의 이그레스 정책은 HTTP 요청, 원격 이미지 로딩, 커넥터 호출, 웹훅, 브라우저 매개 네트워크 액세스를 모두 다뤄야 합니다. 관리자는 이 경로들을 한곳에서 검토할 수 있어야 합니다.
이 정책은 엔터프라이즈 테넌트에서 승인된 목적지를 기본값으로 해야 합니다. 이후 조직은 실제로 더 넓은 액세스가 필요한 워크플로를 위해 도메인을 추가할 수 있습니다.
Atlassian은 생성된 Markdown이 원격 요청을 시작할 수 있는지 문서화해야 합니다. 가능하다면 관리자는 원격 콘텐츠와 URL 매개변수 처리를 제어하는 수단이 필요합니다.
회사는 AI 안전성에 관한 모호한 설명에 의존하지 않고 프롬프트 인젝션 방어를 설명해야 합니다. 구매자는 모델 추론 전, 도중, 후에 어떤 보호 장치가 작동하는지 알아야 합니다.
유용한 세부 정보에는 Rovo가 신뢰할 수 없는 콘텐츠를 어떻게 표시하는지, 이를 지시 사항과 어떻게 분리하는지, 도구 인수를 어떻게 검사하는지, 민감한 값이 승인된 경계 밖으로 나가는 것을 어떻게 차단하는지가 포함됩니다.
일부 방어 논리는 공격자에게 도움이 될 수 있으므로 공개할 수 없습니다. 그렇다고 Atlassian이 보안 속성과 관리자가 기대할 수 있는 결과를 문서화하지 못하는 것은 아닙니다.
고객은 지금 실행 가능한 지침이 필요합니다. 보고서가 해결될 때까지 관리자는 어떤 Rovo 기능이 활성화돼 있고, 어떤 데이터 소스에 접근할 수 있는지 목록화해야 합니다.
또한 비정상적으로 광범위한 권한을 가진 사용자를 식별해야 합니다. 고도로 권한이 있는 계정을 대신해 작동하는 에이전트는 작은 프로젝트로 제한된 에이전트보다 더 큰 잠재적 노출을 초래합니다.
민감한 워크플로에는 합성 테스트가 필요합니다. 보안팀은 제한된 페이지에 무해한 카나리 값을 넣은 뒤, 적대적 문서가 그 값을 모니터링된 도메인으로 전송하게 할 수 있는지 테스트할 수 있습니다.
팀은 실제 자격 증명, 개인정보, 고객 기록, 프로덕션 비밀값으로 테스트하지 않아야 합니다. 목표는 두 번째 사고를 만들지 않고 통제를 검증하는 것입니다.
조직은 커넥터를 제한하고 기존 권한을 축소할 수도 있습니다. 최소 권한 원칙은 침해된 에이전트 세션 중 접근할 수 있는 정보를 줄입니다.
Atlassian은 Google Drive와 Microsoft SharePoint에서 인덱싱된 콘텐츠에 대해 허용 목록과 차단 목록을 지원합니다. 이러한 통제는 Rovo 지식 계층의 일부로 유입되는 콘텐츠를 제한합니다.
이는 아웃바운드 도메인 통제와 동등하지 않습니다. 유입 허용 목록은 Rovo가 인덱싱할 수 있는 소스를 관리하는 반면, 이그레스 허용 목록은 Rovo가 연결할 수 있는 목적지를 관리합니다.
보안팀은 Rovo 응답에 생성된 링크와 원격 미디어를 검토해야 합니다. 네트워크 모니터링은 새로 등록됐거나 이전에 관찰되지 않은 도메인으로의 비정상적인 요청을 식별할 수 있습니다.
직원 안내는 사용자를 탓하기보다 행동에 초점을 맞춰야 합니다. 직원은 콘텐츠가 무해해 보이더라도 문서와 메시지에 숨겨진 AI 지시가 포함될 수 있음을 알아야 합니다.
사용자는 예상치 못한 도구 호출, 승인 요청, 변경된 요약, 설명되지 않은 링크, 낯선 도메인 방문을 요구하는 답변을 신고해야 합니다.
관리자는 사람이 각 결과를 검토하지 않은 채 Rovo를 호출하는 자동화 규칙도 점검해야 합니다. 자동화는 오염된 콘텐츠를 반복 처리하고 하나의 악성 지시를 증폭할 수 있습니다.
사람의 검토는 인터페이스가 관련 작업을 드러낼 때만 도움이 됩니다. 답변이 표시되기 전에 발생하는 보이지 않는 아웃바운드 요청은 검토자가 막을 수 없습니다.
조달팀은 보안 평가에 에이전트별 질문을 추가해야 합니다. 암호화와 모델 학습에 관한 표준 설문지는 프롬프트 인젝션이나 도구 매개 데이터 이동을 포착하지 못합니다.
Hacker News의 관심 이후 주목할 세 가지 신호
다음 단계는 또 한 번의 일반적인 AI 안전성 보장이 아니라 재현 증거, 제품 통제, 투명한 공개에 달려 있다.
첫 번째 신호는 Atlassian의 상세한 대응이다. 가장 유용한 발표는 보고된 어떤 경로가 재현됐는지 확인하고 영향을 받는 Rovo 영역을 식별하는 내용일 것이다.
기존의 권한 및 암호화 관련 주장을 되풀이하는 데 그치는 대응은 핵심 쟁점을 해결하지 못한다. 이러한 통제는 적법하게 가져온 데이터를 공격자가 지시한 방식으로 사용하는 문제를 다루지 않는다.
기술적 완화 조치는 Atlassian이 이번 시연을 제품 보안 문제로 다룬다는 근거를 강화할 것이다. 특정 경로가 정의된 경계를 넘을 수 없는 이유에 대한 합리적인 설명도 우려의 범위를 좁힐 수 있다.
두 번째 신호는 Rovo Chat과 에이전트를 위한 아웃바운드 도메인 통제다. 이 통제는 외부 AI 도구를 Atlassian 애플리케이션에 연결하는 별도의 Rovo MCP 서버보다 더 넓은 범위를 다뤄야 한다.
이는 Rovo가 Atlassian 자체 인터페이스 안에서 콘텐츠를 처리하는 동안 시작되는 네트워크 작업을 관리해야 한다. 적용 범위에는 명시적 가져오기, 생성된 미디어, 웹훅, 커넥터를 통한 전송이 포함되어야 한다.
세분화된 감사 이벤트도 이 통제와 함께 제공되어야 한다. 관리자는 어떤 항목이 각 도메인에 접속했는지, 그리고 어떤 사용자 컨텍스트가 해당 작업을 승인했는지 확인할 수 있어야 한다.
Atlassian이 이러한 기능을 제공한다면, 프롬프트 인젝션이 성공하더라도 보고된 공격은 더 쉽게 억제할 수 있다. 그렇지 않다면 고객은 네트워크 모니터링과 축소된 에이전트 권한에 더 크게 의존해야 한다.
세 번째 신호는 실제 엔터프라이즈 구성 전반에서의 독립적인 재테스트다. 연구자들은 Rovo Chat, 맞춤형 에이전트, 자동화 작업, 브라우저 통합, 연결된 지식 소스를 각각 별도로 테스트해야 한다.
재현에 성공하면 PromptArmor의 더 광범위한 결론이 강화될 것이다. 재현에 실패하면 이 시연이 제한적인 구성 또는 이미 변경된 동작에 의존했음을 보여줄 수 있다.
어느 결과든 논의의 질을 높일 것이다. 현재 증거는 우려를 뒷받침하지만, 모든 Rovo 배포 환경이 자동으로 데이터를 유출한다고 주장할 근거는 되지 않는다.
Hacker News 스레드가 중요한 이유는 익숙한 AI 취약점을 구체적인 엔터프라이즈 환경으로 끌어냈기 때문이다. Rovo의 가치는 한때 별도의 시스템에 흩어져 있던 조직 맥락을 결합하는 데서 나온다.
바로 그 맥락 때문에 격리가 필수적이다. 조직을 더 폭넓게 이해하는 어시스턴트는 적대적 텍스트가 그 동작을 바꿀 때 더 중대한 실패 경로도 만들어 낸다.
Atlassian의 기존 신뢰 약속은 특히 권한 집행과 모델 제공업체의 데이터 보유 제한 측면에서 기반을 제공한다. 보고된 테스트는 그 기반 위에 명시적인 정보 흐름 통제가 필요한 이유를 보여준다.
구매자에게 당장의 조치는 침해를 단정하거나 보고를 무시하는 것이 아니다. Rovo가 어디까지 읽을 수 있는지, 어디로 전송할 수 있는지, 인젝션이 성공한 뒤에도 어떤 통제가 유효한지를 확인해야 한다.
에이전트 접근 권한을 확대하기 전에 관리자에게 이러한 경계를 매핑하도록 요청하라. Atlassian이 재현 분석이나 새로운 이그레스 통제를 공개한다면, 이를 해당 맵과 비교하고 워크플로를 다시 테스트하라.


