OpenAI GPT-Red 자동화 레드팀, 프롬프트 인젝션 실패 줄였지만 벤치마크는 내부 평가
- Sophie Larsen

- 2일 전
- 10분 분량
OpenAI는 GPT-Red가 이전에 맞닥뜨린 거의 모든 모델을 공격하는 데 성공했음에도, 불과 4개월 만에 한 직접 프롬프트 인젝션 실패율을 6분의 1로 낮췄다고 밝혔다. 회사는 2026년 7월 15일 세부 내용을 공개하며, 자동화 적대적 훈련을 갈수록 자율화되는 AI 에이전트를 위한 핵심 방어 수단으로 제시했다.
중요한 변화는 또 하나의 벤치마크 선두 기록이 아니다. OpenAI GPT-Red 자동화 레드팀은 AI 공격자를 실제 모델 훈련 주기 안에 직접 배치한다. 공격자는 모델을 손상시키는 명령을 탐색하고, 방어 모델은 정상적인 작업을 포기하지 않으면서 그러한 공격에 저항하는 법을 학습한다.
이는 단순한 모델 대 모델보다 훨씬 치열한 경쟁 구도를 만든다. OpenAI는 적대적 자기 개선을 통해 에이전트의 보안을 향상되는 역량에 맞춰 유지할 수 있다고 보고 있다. 반면 통제된 환경에서 훈련된 공격자는 낯선 애플리케이션과 사용자, 도구, 배포 방식에서 발생하는 위협을 놓칠 수 있다는 현실도 있다.
회사는 GPT-Red를 공개하지 않았으며, 가장 강력한 성과 역시 내부 평가에 크게 의존한다. 프롬프트 인젝션은 시스템 차원의 보안 문제이므로 이러한 한계는 중요하다. 모델 훈련으로 실패를 줄일 수는 있지만, 모델을 둘러싼 모든 권한과 커넥터, 애플리케이션까지 통제할 수는 없다.
OpenAI GPT-Red 자동화 레드팀, 모델 훈련 내부로 들어가다
OpenAI는 자동화 레드팀을 출시 전 테스트에서 실제 훈련 데이터를 지속적으로 공급하는 체계로 전환했다.
레드팀은 실제 공격자가 악용하기 전에 시스템을 의도적으로 공격해 결함을 찾아내는 활동을 뜻한다. 일반적으로 인간 전문가가 공격 시나리오를 설계하고 시스템을 관찰한 뒤, 수정이 필요한 취약점을 보고한다.
GPT-Red는 이와 유사한 탐색을 자동으로 수행한다. 공격을 실행하고 방어 모델의 반응을 관찰한 다음, 결과에 따라 접근 방식을 바꾼다. 성공한 공격은 이후 모델을 평가하거나 훈련하는 자료로 활용된다.
GPT-Red 연구에 따르면 OpenAI는 자기 대전 강화 학습을 통해 공격자를 훈련했다. 자기 대전은 경쟁하는 시스템을 함께 훈련하면서, 한쪽에는 실패를 유발한 데 대해 보상을 주고 다른 쪽에는 이를 막은 데 대해 보상을 주는 방식이다.
OpenAI는 GPT-Red가 실제 에이전트 환경의 구성 요소를 제어할 수 있도록 했다. 여기에는 이메일 본문, 로컬 파일, 웹페이지 배너, 도구 출력이 포함됐다. 각 환경에는 공격자의 목표와 유효한 성공으로 인정되는 조건도 정의됐다.
이러한 세부 사항은 이 프로젝트를 일반적인 탈옥 테스트와 구분한다. 탈옥은 대개 악의적인 사용자가 모델에 정책을 위반하도록 요구하는 데서 시작된다. 반면 간접 프롬프트 인젝션은 사용자가 작성하지 않은 정보 속에 악성 명령을 숨길 수 있다.
에이전트는 이메일을 요약하거나 코드를 검토하거나 웹사이트를 조사하는 과정에서 이러한 명령을 마주칠 수 있다. 삽입된 텍스트는 에이전트에게 원래 작업을 무시하고 정보를 노출하거나 연결된 도구를 오용하도록 지시할 수 있다.
OpenAI는 GPT-Red가 GPT-5.5까지 테스트한 거의 모든 내부 및 실제 서비스 모델을 공격하는 데 성공했다고 밝혔다. 이후 회사는 GPT-5.6 Sol 모델을 포함한 GPT-5.6 훈련에 이러한 공격을 활용했다.
OpenAI의 테스트 환경에서 나타난 개선 폭은 상당해 보인다. GPT-5.6 Sol은 회사의 가장 어려운 직접 프롬프트 인젝션 벤치마크에서 4개월 전 최고 성능의 실제 서비스 모델보다 실패 횟수가 6분의 1 수준으로 줄어든 것으로 전해졌다.
OpenAI는 또한 더 광범위한 복원력 평가 환경에서 GPT-5.6 Sol이 GPT-Red의 직접 공격 중 0.05퍼센트에서 실패했다고 보고했다. 이 수치는 회사가 훈련한 공격자를 상대로 한 성능을 나타낼 뿐, 모든 프롬프트 인젝션을 막는 보편적 보호를 의미하지는 않는다.
초기 GPT-Red 모델들은 Fake Chain-of-Thought라는 기법을 발견했다. 이 공격은 조작된 추론 과정을 제시해 금지된 행동이 유효하다고 모델을 설득하려 한다.
OpenAI에 따르면 이러한 공격은 GPT-5.1을 상대로 95퍼센트가 넘는 성공률을 기록했다. 회사는 GPT-5.6 Sol에서는 성공률이 10퍼센트 미만으로 떨어졌다고 밝혔다.
이러한 수치는 이번 발표에 상당한 의미를 부여한다. OpenAI는 더 이상 공격 탐지를 훈련 이후 실시하는 독립적인 평가로 취급하지 않는다. 배포 전에 모델을 개선하기 위해 적대적 탐색을 활용하고 있다.
그 결과 보안 테스트는 자체적인 확장 경로를 지닌 훈련 입력으로 바뀐다. 더 강력한 방어 모델은 GPT-Red가 더 어려운 공격을 찾도록 만들고, 그렇게 발견된 공격은 다음 방어 모델을 위한 학습 자료가 된다.
자기 대전으로 방어 모델과 함께 진화하는 공격자
핵심 메커니즘은 어제 성공한 방어가 오늘의 최소 난도가 되는 끊임없이 변화하는 경쟁이다.
기존 안전 데이터세트에는 알려진 공격과 예상 응답이 담겨 있다. 이는 모델이 반복되는 패턴을 인식하는 데 도움이 되지만, 방어 역량이 향상될수록 가치가 떨어질 수 있다. 정적인 데이터 모음은 다음 취약점을 능동적으로 탐색할 수 없다.
GPT-Red는 유효한 실패를 유발하면 보상을 받는 방식으로 이 과정을 바꾼다. 방어 모델은 악성 명령에 저항하면서 원래 작업을 유지하면 보상을 받는다. 따라서 양쪽 모두 개선해야 한다는 압박을 받는다.
전체 기술 논문은 하나의 고정된 상대가 아니라 다양한 방어 모델 집단을 설명한다. 이러한 선택은 공격자가 단일 모델에서만 발견되는 취약점에 의존하지 못하도록 한다.
환경 역시 서로 다른 공격 표면을 나타낸다. 이메일에 숨겨진 명령을 공격하는 방식은 코드 저장소 내부의 악성 콘텐츠를 이용하는 방식과 다르다. 도구 접근 권한이 있으면 두 경우 모두 잘못된 텍스트 생성에 그칠 실패가 외부 작업 실행으로 이어질 수 있다.
이러한 다양성은 대규모 컴퓨팅 자원이 투입된 이유를 설명하는 데 도움이 된다. OpenAI는 GPT-Red에 일부 최대 규모 후속 훈련과 맞먹는 자원이 사용됐다고 밝혔다. 회사는 이를 오직 안전성 향상만을 위해 투입한 전례 없는 수준의 내부 컴퓨팅 투자라고 설명한다.
컴퓨팅 자원만으로 포괄적인 공격 범위를 확보할 수 있는 것은 아니다. 자원이 많아지면 모델이 시도할 수 있는 공격의 수와 경쟁을 지속할 수 있는 기간은 늘어난다. 하지만 공격자가 어떤 위협을 발견할 수 있는지는 여전히 환경 설계에 달려 있다.
GPT-Red의 가장 강력한 비교 결과는 재현된 간접 프롬프트 인젝션 평가장에서 나왔다. OpenAI는 GPT-5.1을 상대로 전체 시나리오 중 84퍼센트에서 공격에 성공했다고 보고했다. 인간 레드팀의 성공률은 13퍼센트였다고 전해졌다.
이 비교 결과는 자동화가 공격 탐색을 확대하는 수단임을 뒷받침한다. 하나의 모델이 사람이 모든 프롬프트를 일일이 작성하지 않아도 다양한 공격 변형을 테스트할 수 있다. 실패한 시도를 보존하고 체계적으로 개선하는 것도 가능하다.
그러나 이러한 비교가 인간의 보안 업무를 불필요하게 만드는 것은 아니다. 인간은 위협 모델에 의문을 제기하고, 비현실적인 가정을 알아차리며, 자동화된 보상 체계가 놓치는 피해를 식별할 수 있다. 모델 환경 외부의 사회적·조직적 취약점도 검토할 수 있다.
OpenAI는 GPT-Red를 인간 및 제3자 테스트를 보완하는 수단으로 명시적으로 제시한다. 또한 다층적 보호 장치와 실시간 모니터링을 유지하고 있다. 이러한 설명은 훈련만으로 모든 실제 서비스 환경을 재현할 수 없다는 점을 인정한 것이다.
이러한 차이는 OpenAI의 자동판매기 실험에서 더욱 분명해진다. GPT-Red는 먼저 실제 서비스 에이전트를 본떠 만든 시뮬레이션에서 공격을 탐색했다. 이후 선별된 공격을 실제 시스템에 적용했다.
OpenAI는 공격을 통해 상품 가격을 변경하고, 불리한 주문을 진행하며, 다른 고객의 주문을 취소했다고 밝혔다. 회사는 해당 시스템 개발자에게 취약점을 공개했고, 개발자는 추가 보호 장치 테스트를 시작했다.
이 실험은 AI가 운영하는 사내 매장을 다룬 Anthropic의 Project Vend와 유사하다. 두 프로젝트 모두 에이전트의 신뢰성이 일반적인 챗봇 안전성과 다른 이유를 보여준다.
챗봇의 실패는 원하지 않는 답변 생성에 그칠 수 있다. 에이전트의 실패는 기록을 변경하고, 코드를 실행하고, 메시지를 보내거나, 거래를 승인하는 결과로 이어질 수 있다. 어떤 결과가 발생할 수 있는지는 주변 소프트웨어가 결정한다.
OpenAI는 GPT-5.4 mini 기반 Codex 명령줄 에이전트를 상대로도 GPT-Red를 테스트했다. 이 평가에는 공격자의 훈련 환경에서 제외된 10개의 미공개 데이터 유출 시나리오가 포함됐다.
회사는 GPT-Red가 더 적은 토큰을 사용하면서도 프롬프트로 공격 역할을 부여한 GPT-5.5 기준 모델보다 더 많은 시나리오를 공격하는 데 성공했다고 밝혔다. 이 결과는 강력한 범용 모델에 적대적 역할을 맡기는 것 이상으로, 전문화된 훈련이 공격 탐색 능력을 높였음을 시사한다.
따라서 어떤 단일 성공률보다 중요한 것은 이 메커니즘이다. OpenAI GPT-Red 자동화 레드팀은 공격을 생성하고, 이를 훈련 데이터로 전환하며, 이후 방어 모델을 측정하는 과정을 반복 가능한 체계로 만든다.
에이전트 개발자에게 요구되는 보안 기준이 높아지다
GPT-Red는 모든 에이전트 개발자가 프롬프트 인젝션 테스트를 출시 체크리스트가 아닌 지속적인 엔지니어링 업무로 다루도록 압박한다.
당장의 압박은 Anthropic과 Google을 포함한 OpenAI의 경쟁사들에 가해진다. 도구를 사용하는 에이전트를 판매하는 기업이라면 브라우저, 파일, 이메일, 코드, 제3자 서비스 전반에 숨겨진 명령을 어떻게 테스트하는지 설명해야 한다.
이번 발표는 고객의 기대 수준도 높인다. 이제 공급업체는 수작업으로 설계한 몇 가지 공격 프롬프트만으로 충분한 증거를 제시했다고 주장하기 어렵다. 구매자는 모델이나 커넥터, 권한이 바뀔 때마다 테스트도 함께 발전하는지 점점 더 따져 묻게 될 것이다.
독립적인 표준 역시 이미 이러한 폭넓은 관점을 지향하고 있다. NIST 공격 분류 체계는 다른 생성형 AI 위협과 함께 직접 및 간접 프롬프트 인젝션을 다룬다.
이 분류 체계는 공격과 완화 조치를 위험 관리 과정의 일부로 본다. 하나의 훈련 개입으로 문제가 해결된다고 제시하지 않는다. 조직에는 여전히 배포 통제와 테스트, 모니터링, 사고 대응이 필요하다.
같은 원칙은 애플리케이션 보안 지침에도 나타난다. 과도한 자율성으로 알려진 OWASP 에이전트 위험은 작업 수행에 필요한 수준보다 더 많은 기능과 권한 또는 자율성을 지닌 시스템을 설명한다.
이 위험이 중요한 이유는 프롬프트 인젝션에 성공하더라도 손상된 에이전트가 사용할 수 있는 기능만 악용할 수 있기 때문이다. 이메일 전송 권한이 없는 어시스턴트는 메시지를 몰래 전달할 수 없다. 반면 사서함에 광범위한 접근 권한이 있다면 더 큰 피해를 일으킬 수 있다.
따라서 GPT-Red는 개발자에게 두 가지 별도의 기준을 바꾼다. 첫 번째는 모델의 저항력에 관한 기준이고, 두 번째는 애플리케이션이 그 저항력을 어느 정도까지 신뢰해야 하는지에 관한 기준이다.
더 강력한 기반 모델은 다양한 제품에서 공통적으로 발생하는 실패를 줄일 수 있다. 하지만 특정 애플리케이션이 제한 없는 파일 접근 권한을 부여하는지, 외부 작업 전에 확인 절차를 생략하는지까지 결정할 수는 없다.
보안팀은 공급업체가 텍스트 전용 벤치마크뿐 아니라 현실적인 작업 흐름 전반의 결과를 보고할 것으로 기대해야 한다. 유용한 평가에는 모델, 시스템 명령, 도구 설명, 검색된 콘텐츠, 권한 부여 규칙, 사용자 확인 절차가 포함돼야 한다.
에이전트가 더 민감한 맥락을 다룰수록 이러한 필요성은 커진다. 브라우저는 통제되지 않은 웹사이트에 에이전트를 노출한다. 로컬 파일 접근은 다양한 출처의 문서에 노출시킨다. 연결된 애플리케이션은 메시지와 공유 작업 공간에 노출시킨다.
악성 명령은 이 모든 경로를 통해 유입될 수 있다. 또한 작업을 시작한 사람에게도 보이지 않을 수 있다. 이 경우 의심스러운 사용자 프롬프트가 제공하던 명백한 경고 신호마저 사라진다.
지식 근로자에게도 이 문제에 주목해야 할 이유가 있다. AI 시스템은 질문에 답하거나 작업을 수행하기 전에 흩어진 문서에서 맥락을 수집하는 경우가 갈수록 늘고 있다. 맥락이 풍부할수록 결과는 향상될 수 있지만, 가져오는 출처가 하나씩 늘어날 때마다 신뢰 경계도 확장된다.
통제 가능한 AI 지식 베이스는 사용자가 정보의 출처와 접근 권한자를 파악하는 데 도움을 줄 수 있다. 하지만 출처가 명확하다고 해서 문서에 삽입된 지시가 자동으로 안전해지는 것은 아니다.
올바른 대응은 유용한 정보의 연결을 중단하는 것이 아니다. 데이터와 권한을 분리해야 한다. 문서는 사실을 제공할 수는 있어도 에이전트의 작업을 재정의할 권한까지 가져서는 안 된다.
애플리케이션 설계자는 최소 권한 접근, 범위가 제한된 토큰, 작업 미리보기, 확인 절차를 통해 이러한 구분을 강화할 수 있다. 공격자가 생소한 언어적 기법을 발견하더라도 이런 통제 수단은 여전히 유효하다.
OpenAI의 성과는 개발자에게 더 강력한 방어 수단을 제공한다. 동시에 더는 핑계를 댈 여지도 없앤다. 자동화된 공격으로 다양한 학습 데이터를 대규모 생성할 수 있다면, 제품 팀은 지속적인 적대적 테스트를 릴리스 프로세스에 포함해야 한다.
이에 따른 대응은 장기적으로 전개될 것이다. 경쟁사들은 자체 공격 생성기나 공동 평가 체계, 또는 제3자 테스트 프로그램을 마련해야 한다. 기업 구매자는 실제 통합 환경에 근거한 증거를 요구해야 한다.
내부 벤치마크만으로는 가장 어려운 질문에 답할 수 없다
보고된 성과는 의미가 있지만, OpenAI가 선택한 환경 밖에서도 프롬프트 인젝션 문제가 해결됐음을 입증하지는 못한다.
첫 번째 불확실성은 평가의 주체와 관련된다. OpenAI는 GPT-Red를 설계하고, 평가 환경을 선정하고, 방어 모델을 학습시킨 뒤 그 결과 점수를 발표했다. 논문에는 상당한 수준의 기술적 세부 사항이 담겨 있지만, 외부 연구자가 내부 모델을 직접 실행할 수는 없다.
GPT-Red는 OpenAI가 효과적인 공격을 생성하도록 의도적으로 학습시켰기 때문에 비공개로 유지되고 있다. 모델을 공개하면 방어 목적으로 개발한 역량이 공격자에게 넘어갈 수 있다.
이 결정에는 명확한 보안상의 근거가 있다. 하지만 독립적인 재현도 제한된다. 연구자들은 방법론을 검토할 수는 있지만, 동일한 공격 모델이 무관한 다른 시스템에서도 비슷한 성능을 내는지 완전히 검증할 수 없다.
두 번째 불확실성은 실제 입력이 학습 및 평가 데이터와 달라질 때 발생하는 분포 이동과 관련된다. 공격자는 사용할 언어와 인터페이스, 시점, 기법의 조합을 스스로 선택한다.
실제 운영 환경의 에이전트는 OpenAI의 테스트 대상과 다른 오케스트레이션 계층을 사용할 수도 있다. 맞춤형 시스템 지침과 메모리, 검색, 도구, 승인 규칙이 적용될 수 있으며, 각 요소는 공격 표면을 변화시킨다.
따라서 GPT-Red의 직접 공격에 대한 낮은 실패율은 제한적인 질문에만 답한다. 정의된 환경에서 특정 방어 모델이 특정 공격 모델을 상대로 얼마나 자주 실패하는지를 측정할 뿐, 앞으로 등장할 모든 공격자를 평가하지는 않는다.
검증용으로 별도 보관된 시나리오에서 기록한 84%의 성과는 일반화 능력을 뒷받침하는 더 나은 증거다. 해당 환경은 GPT-Red의 학습 데이터셋과 달랐고, 인간 레드팀 역시 같은 시나리오 모음을 테스트했다.
그럼에도 평가는 내부 미러 환경에서 진행됐으며 GPT-5.1을 대상으로 했다. GPT-Red가 경쟁 모델이나 생소한 실제 운영 시스템에서도 같은 우위를 유지하는지는 독립적인 팀에 의해 검증되지 않았다.
세 번째 불확실성은 역량 보존과 관련된다. 모델은 어려운 작업을 거부하거나 도구 사용을 피하고, 행동 범위를 제한함으로써 더 안전해 보일 수 있다. OpenAI는 자사 평가에서 일반적인 최첨단 역량의 저하가 발견되지 않았다고 밝혔다.
또한 과도한 거부 여부를 테스트했으며, 정상적인 작업 수행 능력이 그대로 유지됐다고 보고했다. 고무적인 결과지만, 이를 뒷받침하는 평가의 세부 내용이 중요하다. 실제 사용자는 광범위한 역량 벤치마크가 놓치는 거부 패턴을 발견하는 경우가 많다.
방어 모델이 알아보기 쉬운 적대적 상황에서만 신중하게 행동해 성공했을 가능성도 있다. 공격자는 악성 지시를 평범한 업무 콘텐츠처럼 위장해 대응할 수 있다. 이러한 공방 때문에 다양한 외부 테스트가 필수적이다.
네 번째 문제는 지표 해석이다. 평균 공격 성공률은 특정 영역에 집중된 취약점을 가릴 수 있다. 전체 비율이 매우 낮더라도 이메일, 자격 증명 접근 또는 되돌릴 수 없는 작업에 실패가 몰린다면 여전히 심각할 수 있다.
보안 영향은 발생 확률과 결과의 심각성에 모두 좌우된다. 캘린더 항목 하나가 손상되는 것과 자격 증명 하나가 노출되는 것은 다르다. 조직이 벤치마크 점수를 운영 위험과 연결하려면 시나리오별 결과가 필요하다.
다섯 번째 문제는 자기 개선이라는 접근 방식과 관련된다. GPT-Red는 현재 시스템이 생성한 공격에 미래 모델이 대응하도록 돕는다. 하지만 모델이 다른 모델을 감독하는 방식은 공통된 사각지대를 만들 수 있다.
공격 모델과 방어 모델은 서로 겹치는 학습 출처에서 비슷한 가정을 배울 수 있다. 익숙한 규칙 안에서는 능숙해지면서도 보상 구조 밖의 위협은 놓칠 수 있다.
인간 테스터는 서로 다른 경험과 목표를 제시하므로 이런 문제를 어느 정도 보완한다. 제3자 연구자는 개발사의 조직적 가정을 공유하지 않은 채 시스템을 검증할 수 있다.
따라서 인간과 외부 레드팀 활동을 계속하겠다는 OpenAI의 약속은 컴퓨팅 투자만큼 중요하다. 자동화는 규모를 제공하고, 독립적인 테스트는 이견과 다른 관점을 제공한다.
OpenAI GPT-Red 자동 레드팀 활동은 더 강력한 학습 루프를 뒷받침하는 증거로 해석해야 한다. 이를 GPT-5.6 Sol을 사용하는 모든 제품에 대한 보안 보증으로 받아들여서는 안 된다.
실질적인 기준은 여전히 다층 방어다. 모델은 적대적인 지시를 거부해야 하고, 애플리케이션은 권한을 제한해야 하며, 운영자는 중대한 영향을 미치는 작업을 모니터링해야 한다. 각 계층은 다른 계층이 실패할 수 있음을 전제로 해야 한다.
GPT-Red가 에이전트 보안을 바꾸는지 보여줄 세 가지 신호
다음 시험대는 GPT-Red가 내부에서 거둔 성과가 독립 평가와 더 광범위한 배포, 경쟁사의 강력한 대응 속에서도 유지되는지 여부다.
첫 번째 신호는 생소한 에이전트 시스템에서 외부 연구자가 결과를 재현하는 것이다. 연구자들은 OpenAI가 설계하지 않은 애플리케이션에 GPT-5.6 Sol을 탑재해 평가해야 한다.
이러한 테스트에는 서로 다른 도구 프레임워크와 검색 시스템, 파일 형식, 권한 구조가 포함돼야 한다. 또한 직접적인 인젝션과 제3자 콘텐츠 내부에 숨겨진 지시를 구분해야 한다.
GPT-5.6 Sol이 계속해서 큰 우위를 유지한다면 OpenAI의 셀프 플레이 방식은 내부 벤치마크를 넘어 신뢰성을 얻게 된다. 반대로 애플리케이션에 따라 성능 차이가 크다면 시스템 아키텍처가 여전히 지배적인 요인이라는 의미다.
외부 테스트는 공격 빈도와 결과의 심각성을 모두 보고해야 한다. 단순히 작업을 무시한 경우와 데이터 유출 또는 승인되지 않은 외부 작업을 구분해야 한다. 종합 정확도만으로는 이러한 차이를 포착할 수 없다.
두 번째 신호는 Anthropic, Google 및 다른 모델 공급자가 이에 상응하는 자동 레드팀 결과를 공개하는지 여부다. 경쟁사들이 대응에 나선다면 적대적 학습이 업계의 표준적인 역량 투자로 자리 잡았음을 보여줄 수 있다.
중요한 증거는 또 하나의 단편적인 수치가 아니다. 공급자는 위협 모델과 검증용 환경, 거부에 따른 절충점, 모델 차원의 방어와 애플리케이션 통제 사이의 관계를 공개해야 한다.
공동으로 사용하거나 상호 운용할 수 있는 평가 체계는 더욱 강력한 신호가 될 것이다. 한 조직이 개발한 레드팀 모델이 별도의 맞춤 조정 없이 다른 조직의 방어 모델을 공격할 수 있어야 한다.
이러한 교차 테스트는 공격 모델이 제작자의 모델에 과적합됐는지를 드러낼 수 있다. 또한 평가의 공격과 방어 양측을 한 연구소 안에 두면서 생기는 이점을 줄일 수 있다.
경쟁사들이 서로 다른 방법으로 OpenAI와 대등한 성과를 낸다면 자동화된 적대적 학습은 지속 가능한 업계 방향으로 보일 것이다. 결과를 계속 비교하기 어렵다면 구매자는 보안의 실질적 발전과 선택적 보고를 구분하기 어려워진다.
세 번째 신호는 실제 배포된 GPT-5.6 에이전트의 실패 패턴이다. OpenAI는 GPT-Red가 GPT-5.3 이후 출시된 모든 후속 프로덕션 모델에 학습용 공격을 제공했다고 밝혔다.
실제 운영 환경의 사고는 이러한 개선이 현실의 워크플로를 포괄하는지 보여줄 것이다. 관련 증거에는 성공한 인젝션과 차단된 공격, 과도한 거부, 지나치게 넓은 도구 권한으로 인한 실패 등이 포함된다.
OpenAI는 모니터링 과정에서 발견한 새로운 실패 사례를 GPT-Red 환경에 다시 반영할 수도 있다. 이는 배포 현장의 증거를 공격 모델 학습 및 향후 방어 모델 업데이트와 연결해 제안된 안전성 플라이휠을 완성할 것이다.
보고된 성과가 내부 릴리스에만 국한된다면 이 순환 구조의 설득력은 떨어진다. 생소한 사고가 후속 모델 전반의 측정 가능한 개선으로 이어질 때 그 신뢰성은 높아진다.
개발자는 이러한 질문의 답이 나올 때까지 기다릴 필요가 없다. 에이전트의 맥락에 유입되는 신뢰할 수 없는 모든 출처와, 그 이후 에이전트가 사용할 수 있는 중대한 영향을 미치는 모든 도구를 목록화할 수 있다.
또한 일반적인 콘텐츠가 에이전트의 목표를 변경할 수 있는지 테스트할 수 있다. 각 중요 작업에는 필요한 최소한의 권한만 부여하고, 되돌릴 수 없는 단계에는 추가 확인을 요구해야 한다.
대규모 프로젝트 자료를 다루는 팀은 지식 블렌딩을 활용해 관련 맥락을 체계화할 수 있다. 하지만 가져온 문서와 메시지는 실행 권한이 아니라 신뢰할 수 없는 데이터로 취급해야 한다.
OpenAI GPT-Red 자동 레드팀 활동은 모델 공급자에게 한층 엄격한 기준을 제시한다. AI 공격 모델이 광범위하게 탐색하고 학습 데이터를 생성해 불과 몇 달 안에 후속 방어 모델을 개선할 수 있음을 보여준다.
남은 질문은 환경이 학습 무대와 달라져도 이러한 방어 우위가 지속되는지 여부다. 개발자와 기업 구매자는 단 하나의 대표 점수가 아니라 실제 워크플로에 맞춘 증거를 공급자에게 요구해야 한다.
에이전트가 읽을 수 있는 출처와 수행할 수 있는 작업, 인간의 승인이 반드시 필요한 지점을 점검해야 한다. 그런 다음 세 가지 신호를 면밀히 주시해야 한다. 독립적인 재현과 공급자 간 교차 테스트, 실제 운영 환경의 실패 데이터가 GPT-Red가 지속적인 보안 발전의 이정표인지, 아니면 끝나지 않은 공방의 또 다른 한 차례에 불과한지를 판가름할 것이다.


