법원 서면에 숨겨진 AI 프롬프트로 제재받은 코네티컷 원고
- Olivia Johnson

- 4일 전
- 11분 분량
코네티컷 법원이 그의 두 건의 서면에서 숨겨진 AI 지시문을 발견한 것으로 알려지면서, Matthew Elliott는 의도했던 이점을 제재로 바꿔 Google News에 이름을 올렸다.
본인 소송을 진행한 원고인 Elliott는 코네티컷 고등법원에 New York Bariatric Group을 상대로 소송을 제기했다. 2026년 7월 말, 그는 사람의 눈에는 거의 보이지 않지만 문서 처리 소프트웨어에는 여전히 접근 가능한 텍스트가 포함된 서면을 제출했다.
숨겨진 문구는 해당 서면을 검토하는 모든 AI 모델이 Elliott의 입장에 동의하도록 지시했다. 그러나 법원 관계자들은 AI 탐지기에 의존하지 않고 이를 발견한 것으로 전해진다. 이들은 간격이 Elliott의 이전 제출물과 다르다는 점을 알아차리고 문서를 자세히 살핀 끝에 작은 흰색 글자를 찾아냈다.
이 발견은 이 사건을 누군가가 ChatGPT를 오용한 또 하나의 사례보다 더 중요하게 만든다. 이번에는 AI가 법적 근거를 지어내거나 부실한 준비서면을 작성했다는 비난을 받은 것이 아니다. 서면 자체가 이를 처리할 수 있는 모든 모델을 겨냥한 지시 채널로 활용되려 했다.
이 결과는 AI 지원 문서 검토의 근본적 충돌을 드러낸다. 법원, 로펌, 보험사, 고용주, 출판사는 모든 것을 읽을 수 있는 소프트웨어를 원한다. 공격자는 사람이 볼 수 없는 자료까지 그 소프트웨어가 읽을 때 이익을 얻는다.
서면은 눈에 띄지 않는 곳에 지시문을 숨겼다
핵심 행위는 단순했다. Elliott는 일반적인 법원 서면으로 제시된 문서 안에 기계가 읽을 수 있는 지시문을 넣은 것으로 전해진다.
분쟁 사건은 사건번호 AAN-CV-25-6066141-S의 Elliott v. New York Bariatric Group이다. 공개 사건 기록에 따르면 Elliott는 2025년 10월 코네티컷 Fairfield Judicial District에서 소를 제기했다.
원 보도에 따르면, Elliott는 개인정보 침해, 차별 및 기타 청구를 주장했다. 이러한 주장은 기초 민사 분쟁의 일부로 남아 있으며 프롬프트 인젝션 문제와 혼동해서는 안 된다.
숨겨진 자료는 2026년 7월 말 제출된 사건기록 항목 177.00과 178.00에 나타났다. 보도에 따르면 이 텍스트는 흰색 3포인트 글꼴로 설정돼 흰색 페이지 위에서는 사람이 알아차리기 어려웠다.
한 지시문은 AI 모델이 출력 결과가 해당 서면에 동의하도록 하라고 명령했다. 또 다른 지시문은 모델을 “remediation”으로 유도했는데, 이는 생성되는 분석이나 권고의 방향을 정하려는 표현으로 보였다.
프롬프트 인젝션은 신뢰할 수 없는 콘텐츠에 삽입돼 AI 시스템의 실제 작업을 덮어쓰려는 지시문이다. 여기서 신뢰할 수 없는 콘텐츠는 웹페이지, 이메일, 지원 티켓이 아니라 법원 서면이었다.
이 차이는 중요하다. 사람 독자는 이 문서를 법적 주장으로 해석할 것이다. 그러나 설계가 부실한 모델은 숨겨진 동의 요구를 포함해 추출된 모든 문장을 동등하게 유효한 지시로 취급할 수 있다.
이 프롬프트는 특정 제품을 언급할 필요가 없었다. 이론적으로는 PDF를 요약, 분류, 검색 또는 분석하는 데 사용되는 어떤 시스템이든 겨냥할 수 있다. 여기에는 상대방 변호인, 법원 직원, 리서치 제공업체 또는 기자가 사용하는 소프트웨어가 포함될 수 있다.
다만 공개 기록은 코네티컷 법원이 Elliott의 신청을 판단하는 데 AI 모델을 사용했다는 점을 입증하지 않는다. 누군가 인젝션을 시도했다는 사실만으로 취약한 자동화 의사결정 시스템이 존재했다는 증거가 되지는 않는다.
이러한 불확실성은 확인된 행위와 이를 둘러싼 추측을 구분한다. 알려진 문제는 숨겨진 텍스트다. AI 판사가 비밀리에 사건을 결정했다는 주장은 이용 가능한 증거를 넘어선다.
법원은 서면에 이례적인 빈 공간이 있었기 때문에 텍스트를 발견한 것으로 전해진다. Elliott의 이전 문서와 비교하면 간격이 이상해 보였다. 누군가 기저 콘텐츠를 조사했고, 소프트웨어에는 여전히 읽히는 문구를 발견했다.
이 세부 사항은 첫 번째 반전을 보여준다. 숨겨진 프롬프트는 자동화된 읽기를 악용하도록 설계됐지만, 눈에 보이는 레이아웃 흔적이 인간 검토자에게 이를 드러냈다.
보도에 따르면 이후 제출물에는 농담과 동영상 링크를 포함한 추가 숨김 메시지가 담겼다. 이 세부 사항은 일반 독자가 해당 자료를 보지 못할 것이라는 인식이 있었음을 시사한다.
8월 6일 법원은 Elliott의 프롬프트 인젝션 사용에 관한 약식 명령을 내렸다. 보도에 따르면 법원은 그의 전자 제출 접근을 제한하고 향후 제출물에 대한 더 엄격한 통제를 요구했다.
소송 자체가 반드시 그 명령으로 종결된 것은 아니다. 제재는 New York Bariatric Group을 상대로 한 모든 분쟁 청구가 아니라 서면 제출 행위를 다뤘다.
이 차이는 중요하다. 제재를 소송 전체에 대한 판단으로 설명해서는 안 되기 때문이다. 오히려 이 사건은 Elliott가 사건에 참여할 수 있는 방식을 바꾸고 그의 신빙성에 새로운 압박을 가했다.
Google News 헤드라인이 위험을 축소하는 이유
기묘한 흰색 빈 공간은 기억에 남는 Google News 헤드라인이 되지만, 더 큰 문제는 문서가 이제 증거와 실행 가능한 것처럼 보이는 언어를 함께 담고 있다는 점이다.
PDF는 한때 수동적으로 보였다. 독자는 이를 열고, 검색하거나, 구절을 다른 프로그램으로 복사했다. AI 시스템은 문서 전체를 수집하고 추출한 텍스트를 기반으로 행동할 수 있기 때문에 이러한 관계를 바꿨다.
모델은 글자색만으로 권위를 신뢰성 있게 추론할 수 없다. 문서 추출 과정은 흔히 시각적 구분을 버리고 제목, 각주, 흰색 텍스트, 눈에 보이는 주장까지 하나의 토큰 흐름으로 변환한다.
이 과정은 간접 프롬프트 인젝션을 만들어낸다. 공격자는 챗봇에 악성 명령을 직접 입력하는 대신, 다른 사람이 나중에 모델에 제공할 자료에 이를 심는다.
이 기법은 이미 미국 소송 밖에서도 등장했다. 브라질 노동 분쟁에서 변호사들은 AI 지원 법률 업무 흐름에 영향을 미치려는 흰색 바탕의 흰색 지시문을 소장에 삽입한 것으로 전해진다.
법원은 숨겨진 텍스트가 탐지된 뒤 변호사들에게 제재를 가했다. 브라질 사건은 프롬프트 인젝션이 실험실 테스트와 적대적 보안 훈련을 넘어섰음을 보여줬다.
Elliott 사건은 같은 위험을 보도된 미국 법원 절차로 가져왔다. 또한 주로 보안 연구자들이 논의하던 기법을 본인 소송 당사자도 시도할 수 있음을 보여줬다.
다른 분야도 동일한 데이터 대 지시문 문제에 직면해 있다. 이력서는 채용 모델에 자신의 지원자를 최우선으로 평가하라고 지시할 수 있다. 제품 페이지는 쇼핑 에이전트에 경쟁 제안을 무시하라고 유도할 수 있다. 이메일은 비서에게 내부 정보를 공개하라고 요청할 수 있다.
계약서는 검토 도구에 모든 조항이 표준적이라고 알리는 문구를 숨길 수 있다. 연구 논문은 자동화된 심사자에게 게재 승인을 권고하라고 지시할 수 있다. 지원 티켓은 에이전트를 승인되지 않은 계정 조치로 돌리려 할 수 있다.
이 사례들은 하나의 메커니즘을 공유한다. 모델은 운영자로부터 신뢰받는 지시를 받은 뒤, 명령을 흉내 낸 신뢰할 수 없는 텍스트와 마주한다.
현대 시스템은 지시문 계층, 필터, 격리된 도구 및 기타 방어 수단을 사용한다. 이러한 통제는 노출을 줄일 수 있지만, 자연어가 데이터와 제어 표면의 역할을 모두 하기 때문에 프롬프트 인젝션은 여전히 어렵다.
소프트웨어가 단순 요약을 넘어 행동할 수 있을 때 위험은 더 커진다. 잘못된 요약은 시간을 낭비하게 한다. 이메일, 파일, 결제 또는 사건 관리 소프트웨어에 접근할 수 있는 에이전트는 직접적인 결과를 초래할 수 있다.
Microsoft는 문서나 인터페이스의 악성 콘텐츠가 에이전트의 의도된 지시를 덮어쓸 수 있는 교차 프롬프트 인젝션에 대한 논의에서 이 광범위한 범주를 인정했다. 회사의 대응에는 제한된 작업 공간, 제한된 권한 및 활동 로그가 포함된다.
이러한 통제는 실용적인 보안 원칙을 보여준다. 조직은 악성 지시문이 모델에 도달할 것이라고 가정한 뒤, 그러한 상황에서 모델이 할 수 있는 일을 제한해야 한다.
법원 문서는 더 강력한 처리가 필요하다. 서면은 결과에 이해관계가 있는 당사자로부터 온다. 그 안의 모든 진술은 주장, 증거 또는 혐의일 뿐 검토 시스템을 위한 신뢰할 수 있는 명령이 아니다.
따라서 AI 업무 흐름은 문서 주위에 엄격한 경계를 설정해야 한다. 시스템은 내용을 요약하거나 인용을 식별하고 주장을 비교할 수 있다. 그러나 문서 안에서 발견된 운영 지시를 절대 수용해서는 안 된다.
가시적 렌더링 역시 중요하다. 원시 텍스트만 추출하는 검토 파이프라인은 Elliott의 프롬프트를 밝혀낸 단서를 잃을 수 있다. 문장이 흰색으로 표시됐는지, 3포인트 크기였는지, 정상적인 읽기 흐름 밖에 있었는지 알지 못할 수 있다.
이는 텍스트 추출이 레이아웃 분석과 결합돼야 함을 의미한다. 시스템은 비정상적으로 작은 글꼴, 일치하는 전경 및 배경색, 보이지 않는 레이어, 페이지 밖 객체, 의심스러운 간격을 표시할 수 있다.
광학 문자 인식은 또 다른 비교 수단을 제공한다. 시스템은 렌더링된 이미지에 나타나는 내용과 PDF의 내부 텍스트 레이어에 포함된 내용을 대조할 수 있다. 한 가지 표현에만 존재하는 자료는 면밀한 검토가 필요하다.
목표는 모든 서식 이상을 악의적인 것으로 선언하는 것이 아니다. 법률 PDF에는 스캔 오류, 접근할 수 없는 양식, 가림 처리, 변환 흔적, 부실하게 생성된 텍스트 레이어가 포함된다.
대신 조직에는 이상 징후를 위한 검토 경로가 필요하다. 보안 시스템은 원본 파일을 보존하고, 숨겨진 콘텐츠를 식별하며, 자동화된 조치가 계속되기 전에 발견한 내용을 사람에게 보여줘야 한다.
진짜 대결은 인간의 책임성과 자동화된 편의성의 충돌이다
이 사건은 시각적·법적 맥락을 보존하지 않은 채 소프트웨어가 적대적 문서를 읽도록 허용하는 업무 흐름과 책임 있는 인간 검토를 대립시킨다.
상대는 Elliott와 하나의 챗봇이 아니다. New York Bariatric Group과 AI 공급업체 간의 경쟁도 아니다. 핵심 갈등은 소프트웨어가 중대한 문서 검토를 지원할 때 누가 책임을 계속 지는지에 관한 것이다.
법원은 이미 기술을 활용해 기록을 검색하고, 서면 제출을 관리하며, 절차를 녹취하고, 증거를 정리한다. 변호사들은 매일 문서 검토 시스템과 법률 데이터베이스를 사용한다. 모든 자동화 도구를 거부하는 것은 수십 년간의 법률 실무를 무시하는 일이 될 것이다.
생성형 AI는 다른 실패 방식을 도입한다. 전통적 검색은 질의에 맞는 문서를 찾아낸다. 언어 모델은 각 결론에 어떤 출처가 영향을 미쳤는지를 흐리면서 완결된 것처럼 보이는 답변을 종합할 수 있다.
숨겨진 지시문이 이러한 종합 과정에 들어오면 사용자는 조작 시도 자체를 보지 못한 채 편향된 결과를 받을 수 있다. 모델의 유창한 출력은 개입을 더 알아차리기 어렵게 만들 수 있다.
이 때문에 사법 지침은 점점 개인의 책임을 강조한다. 영국의 개정된 사법 AI 지침은 컴퓨터에는 보이지만 사람에게는 숨겨진 콘텐츠로 흰색 텍스트를 명시적으로 지목한다.
이 지침은 판사가 기초 문서를 읽고 자기 명의로 발행되는 자료에 대한 책임을 져야 한다고 밝힌다. AI를 보조 도구로 허용하면서도 소프트웨어가 직접적인 사법적 관여를 대체할 수 있다는 생각은 거부한다.
이 접근법은 한 관할권을 넘어 유용한 기준을 제시한다. 이는 모델이 쓸모없다고 주장하는 데 의존하지 않는다. 대신 지원과 위임된 판단 사이의 경계를 정의한다.
코네티컷주는 Elliott 명령 이전에도 자체 규정을 강화했다. 2026년 6월 개정안은 변호사와 본인 소송 수행자가 생성형 AI를 사용해 만든 인용, 법적 근거, 증거를 검증하도록 요구한 것으로 알려졌다.
새로운 Section 4-9는 주로 부정확하거나 조작된 자료에 초점을 맞췄다. Elliott의 혐의상 삽입은 그 반대의 문제를 제기한다. 오류가 있는 모델 출력을 신뢰한 것이 아니라, 제출자가 자신의 문서를 소비할 수 있는 모델에 영향을 미치려 했다는 것이다.
두 문제는 동일한 책임 사슬을 가리킨다. 제출자는 자신이 제출하는 내용에 대해 계속 책임을 진다. 변호사는 자신의 작업을 검증해야 한다. 법원은 증거를 검토해야 한다. 기술 제공업체는 외부 문서를 적대적 입력으로 다뤄야 한다.
뉴욕주 법원 시스템도 AI 연례 보고서에서 관련된 결론에 도달했다. 이 보고서의 권고안은 정확성, 기밀성, 감독, 기존의 직업적 의무를 강조하면서 통제된 AI 사용을 허용한다.
이러한 의무는 공급업체의 안전 필터에 외주화할 수 없다. 제품이 의심스러운 텍스트를 경고할 수는 있지만, 판사나 변호사는 여전히 실제 제출 문서와 권위 있는 법률을 평가해야 한다.
문서 워크플로를 구축하는 조직은 이러한 구분을 명확히 해야 한다. AI가 생성한 요약은 출처를 식별하고, 인용한 구절을 드러내며, 렌더링된 문서로 되돌아갈 수 있는 경로를 보존해야 한다.
사용자에게는 시스템이 수신한 내용에 대한 기록도 필요하다. 여기에는 원본 파일, 추출된 텍스트, 시스템 지침, 모델 버전, 출력, 도구 활동, 모든 보안 경고가 포함된다.
이 기록이 없으면 조직은 숨겨진 지침이 결과에 영향을 미쳤는지 재구성할 수 없다. 정제된 답변만 보게 될 뿐, 모델이 그것을 어떻게 생성했는지에 대한 신뢰할 수 있는 설명을 확보하지 못할 수 있다.
이 요구사항은 프롬프트 인젝션을 지식 관리와 연결한다. 팀에는 원본 문서, 생성된 해석, 검증된 결론을 신뢰할 수 있게 분리하는 체계가 필요하다.
구조화된 AI 지식 베이스는 출처 추적성을 유지하는 데 도움이 될 수 있지만, 저장만으로 악성 콘텐츠가 무력화되지는 않는다. 검색 및 추론 계층은 계속해서 가져온 텍스트를 신뢰할 수 없는 것으로 취급해야 한다.
이 갈등의 편의성 측면은 여전히 매력적이다. 법원은 과중한 사건 부담에 직면해 있고, 로펌은 방대한 증거개시 자료를 다루며, 개인 소송 당사자는 복잡한 절차에 어려움을 겪는다.
요약은 읽는 시간을 줄여줄 것을 약속한다. 인용 추출은 더 빠른 검증을 약속한다. 초안 생성은 법률 정보에 대한 더 넓은 접근성을 약속한다.
그러나 절약되는 시간마다 생성된 결과를 신뢰하라는 압력이 생긴다. 직원이 원본 문서를 확인하지 않기 시작하면, 보조 도구는 조용히 의사결정 계층이 된다.
보도된 Elliott의 제출 문서는 그 숨겨진 전환을 드러냈다. 해당 프롬프트는 누군가가 소장을 모델에 입력하고 그 출력에 의존할 수 있다고 전제했다. 그 전제가 옳았는지는 그것이 겨냥한 취약성보다 덜 중요하다.
시도는 실패했지만, 방어가 입증된 것은 아니다
보도된 프롬프트는 Elliott의 신청을 관철시키지 못했지만, 실패한 인젝션 한 건만으로 법률 AI 시스템이 안전하다고 입증할 수는 없다.
404 Media에 따르면, 기자들은 제출 문서를 ChatGPT로 시험하고 모델에 결정을 내려달라고 요청했다. 이 챗봇은 Elliott의 신청에 불리한 판단을 내렸으며 인젝션을 발견하고 무시했다고 밝힌 것으로 전해진다.
이는 제한적인 의미에서는 안심할 만한 결과다. 한 개의 최신 모델이 하나의 테스트 프롬프트 아래에서 숨겨진 요구를 따르지 않았다.
그러나 이는 가능한 모든 워크플로를 재현하지는 않는다. 법원 시스템은 텍스트를 다르게 추출하거나, 다른 모델을 사용하거나, 검색된 판례를 추가하거나, 문서를 여러 청크로 나누거나, 더 좁은 질문을 던질 수 있다.
프롬프트 인젝션은 맥락에 민감하다. 동일한 페이로드도 하나의 지침 아래에서는 실패하고 다른 지침에는 영향을 줄 수 있다. 전처리, 주변 텍스트, 시스템 프롬프트, 모델 버전의 작은 변화가 결과를 바꿀 수 있다.
보도된 테스트는 기자들이 인젝션의 존재를 알고 난 뒤에 이뤄졌다. 일반 사용자는 요약만 요청하고, 원본 형식을 전혀 검토하지 않으며, 명시적인 경고도 받지 못할 수 있다.
보안은 모든 공격자가 노골적인 지침을 작성하는 데 의존해서는 안 된다. 보도된 Elliott의 문구는 AI 모델을 직접 언급하고 동의를 요구해 의도를 비교적 쉽게 분류할 수 있었다.
향후 페이로드는 문서 메타데이터, 인용문, 주석, 접근성 텍스트 또는 신뢰할 수 있는 애플리케이션의 지침을 모방할 수 있다. 명령을 여러 페이지에 분산하거나 이미지에 인코딩할 수도 있다.
방어자 역시 법원에서 일어난 일을 과장하지 않아야 한다. AI 시스템이 Elliott의 주장을 채택했거나 사법 판단에 영향을 미쳤다는 검증된 공개 증거는 없다.
따라서 이를 AI에 의해 훼손된 판결이라고 부르는 것은 부정확하다. 이는 잠재적 AI 검토를 조작하려는 보도된 시도였으며, 이후 사람의 탐지와 법원의 조치가 뒤따랐다.
이러한 한계가 사건을 무해하게 만들지는 않는다. 침입 시도는 실패하더라도 아키텍처상의 약점을 드러낼 수 있다.
보안의 핵심 질문은 조직이 동일한 기법을 대규모로 발견했을지 여부다. 한 서기가 두 건의 제출 문서에서 이례적인 간격을 발견했지만, 자동 접수 시스템은 이와 같은 주의 없이 수천 건의 문서를 처리할 수 있다.
사람의 검토에도 한계가 있다. 더 잘 정리된 문서는 눈에 띄는 빈 공간을 만들지 않을 수 있다. 흰색 텍스트는 보이는 문자 뒤나 이미지 레이어 안에 놓일 수 있다.
조직에는 계층화된 통제가 필요하다. 사람도 분류기도 모든 것을 잡아내지는 못하기 때문이다. 초기 스캔은 콘텐츠가 모델에 도달하기 전에 숨겨진 객체와 비정상적인 스타일링을 식별해야 한다.
그다음 모델에는 문서가 권위가 아닌 증거라는 명확한 지침을 제공해야 한다. 모델의 도구는 최소 권한으로 작동해야 하며, 중대한 조치에는 사람의 승인이 필요하다.
생성된 출력은 불확실성과 출처를 표시해야 한다. 시스템이 명령과 유사한 문구를 발견하면, 따를지 여부를 조용히 결정하는 대신 관련 구절을 표시해야 한다.
별도의 보안 모니터는 출력과 원본 콘텐츠를 비교할 수 있다. 특히 뒷받침하는 분석 없이 문서가 요구한 결론에 갑자기 동의하는 경우 검토를 촉발해야 한다.
기반 모델이 자체 안전성을 승인하도록 해서는 안 된다. 인젝션의 영향을 받은 모델은 인젝션이 없었다고 주장할 수도 있다.
독립적인 점검에는 결정론적 PDF 검사, 전용 분류기, 텍스트와 렌더링 비교, 수동 샘플링이 포함될 수 있다. 각각은 서로 다른 실패 패턴을 포착한다.
이 사건은 공정성 문제도 제기한다. 고도화된 당사자는 보안 인력과 통제된 법률 소프트웨어를 갖출 수 있다. 본인 소송 수행자, 소규모 로펌, 지역 법원은 거버넌스가 더 약한 범용 도구에 의존할 수 있다.
AI를 단순히 금지하는 제한은 사용을 보이지 않는 곳으로 밀어낼 수 있다. 명확한 규칙, 승인된 시스템, 교육, 감사 가능한 워크플로가 더 현실적인 대응책을 제시한다.
동시에 접근성 문제는 숨겨진 지침을 정당화할 수 없다. 초안 작성에 AI를 사용하는 당사자는 다른 사용자의 모델을 조작하려는 당사자와 다르다.
그 경계는 계속 이해하기 쉬워야 한다. 보조는 사람이 주장을 구성하거나 검토하도록 돕는다. 인젝션은 상대방 자료를 검토하는 시스템을 통제하려 한다.
법원과 AI 팀이 다음으로 주시해야 할 것
다음 시험대는 기관들이 이를 고립된 장난으로 취급할지, 아니면 적대적 입력을 중심으로 문서 파이프라인을 재설계할지 여부다.
첫 번째 신호는 Elliott의 제출 권한과 기초 사건에 대한 최종 처리다. 보도에 따르면 8월 6일 명령은 제한을 부과했지만, 이후 사건 기록 활동은 법원이 이를 어떻게 집행하는지 보여줄 것이다.
더 강력한 공개 기록은 어떤 절차적 권한이 제재를 뒷받침했는지도 명확히 할 수 있다. 이는 다른 관할권에서 유사한 행동에 맞서는 법원에 중요하다.
Elliott 분쟁은 코네티컷 밖에서 구속력 있는 선례를 만들지는 않을 수 있다. 그러나 상세한 명령은 여전히 판사와 법원 행정관에게 숨겨진 프롬프트를 식별하고 대응하는 실무적 모델을 제공할 수 있다.
두 번째 신호는 의무적 문서 정제의 도입이다. 법원과 로펌은 업로드된 PDF가 숨겨진 레이어, 일치하는 텍스트와 배경색, 비정상적인 글꼴 크기에 대해 검사되는지를 공개하기 시작해야 한다.
정제가 증거를 조용히 변경하는 것을 의미해서는 안 된다. 시스템은 원본 문서를 보존하고 각 변환을 기록하며, 의심스러운 차이를 검토 대상으로 제시해야 한다.
안전한 프로세스는 원본을 법적 검토용으로 보존하면서 AI 분석을 위해 원래 제출 문서를 통제된 표현으로 렌더링할 수 있다. 모델은 보이는 콘텐츠와 신뢰할 수 있는 메타데이터만 받아야 한다.
이 접근법에는 상충 관계가 있다. 렌더링은 유용한 접근성 정보를 제거하거나, 표를 손상시키거나, 광학 문자 인식 오류를 유발할 수 있다. 따라서 변환된 모든 버전은 원본으로 돌아갈 수 있는 추적성을 갖춰야 한다.
세 번째 신호는 AI 공급업체가 프롬프트 인젝션 이벤트를 사용자에게 공개하는지 여부다. 조용한 필터는 하나의 응답을 보호할 수 있지만, 반복적인 캠페인을 조사할 증거를 조직에 거의 제공하지 못한다.
엔터프라이즈 시스템은 어떤 구절이 경고를 유발했는지, 어떤 조치가 차단됐는지, 도구나 외부 데이터에 접근했는지를 식별해야 한다. 로그는 법률 자료를 규율하는 기밀성 규칙도 준수해야 한다.
공개 벤치마크는 구매자가 방어 역량을 비교하는 데 도움이 될 것이다. 테스트에는 적대적 PDF, 이미지, 숨겨진 레이어, 다국어 프롬프트, 분절된 지침, 법률 형식으로 위장한 페이로드가 포함돼야 한다.
직접적인 “이전 지침을 무시하라” 테스트 하나가 실패했다고 해서 공급업체가 면역성을 주장해서는 안 된다. 공격자는 모델, 워크플로, 표적에 맞춰 언어를 조정한다.
법원은 안전한 소프트웨어 설계에서 배울 수 있다. 신뢰할 수 없는 입력을 검증하고, 데이터와 명령을 분리하며, 권한을 최소화하고, 중요한 조치에는 승인을 요구하며, 유용한 감사 기록을 보존해야 한다.
법률 전문가에게는 AI 요약과 원본을 비교하는 신뢰할 수 있는 방법도 필요하다. 여기에서 신중한 지식 블렌딩은 검색된 구절을 결과 분석과 연결해 유지함으로써 검토를 지원할 수 있다.
최종 결론은 여전히 인간 검토자가 책임진다. 소프트웨어는 경쟁하는 주장을 정리하고, 반복되는 문구를 찾고, 누락된 인용을 표시할 수 있다. 그러나 자체 해석이 사법적 권위를 가질 만한지 결정할 수는 없다.
Google News를 통해 이 글에 도착한 독자는 가장 쉬운 결론을 경계해야 한다. 이는 AI 판사가 비밀리에 코네티컷 법정을 운영했다는 증거가 아니었다. 적어도 한 명의 소송 당사자가 법적 사슬 어딘가에서 기계 검토가 이뤄질 것으로 예상했다는 증거였다.
그 기대만으로도 위협 모델은 바뀐다. 중대한 결과를 낳는 워크플로에 제출되는 모든 문서에는 두 대상, 즉 보이는 독자와 보이지 않는 파서를 위한 언어가 포함될 수 있다.
법원은 표현 방식이 이상해 보였기 때문에 Elliott를 적발한 것으로 전해진다. 다음 공격자는 PDF 레이아웃을 더 잘 이해할 수 있고, 다음 표적은 서기가 모든 페이지를 검토하지 않는 방식으로 문서를 처리할 수 있다.
조직은 지금 자체 시스템을 시험해야 한다. 통제된 AI 워크플로에 숨겨진 지침이 포함된 무해한 문서를 제공한 뒤, 시스템이 이를 따르는지, 무시하는지, 표시하는지, 기록하는지를 검토해야 한다.
그 답이 다음 조치를 결정해야 한다. 명령을 따르는 시스템에는 격리가 필요하다. 기록 없이 무시하는 시스템에는 관측 가능성이 필요하다. 모든 것을 표시하는 시스템에는 더 나은 정밀도가 필요하다.
무엇보다 기관은 어떤 판단을 위임할 수 없는지 결정해야 한다. 요약은 법률 업무를 지원할 수 있지만, 증거 평가와 최종 판결에는 기초 기록을 읽는 책임 있는 사람이 필요하다.
Google 뉴스 사이클은 빠르게 다음 이슈로 넘어갈 것이다. 그러나 숨은 텍스트 문제는 계약서, 이력서, 신고서, 연구 논문, 이메일, 그리고 AI 시스템이 해석하도록 요구받는 모든 문서 속에 계속 남아 있을 것이다.
법원과 벤더들은 더 조용한 프롬프트가 더 신뢰받는 모델에 도달하기 전에 이러한 보호 장치를 마련할까, 아니면 자동화된 결정이 실제로 바뀔 때까지 기다릴까?


