top of page

Anthropic, OpenAI, Google, 암호화에도 AI 추론 흔적 탈취에 직면

Anthropic, OpenAI, Google은 숨겨진 모델 사고 과정을 암호화했음에도 공통된 보안 실패를 겪었다. 연구진은 모델, 세션, 사용자 전반에서 Stealing AI Reasoning Traces가 가능한 경로를 발견했다.

이 공격은 탈취한 키나 전통적인 암호 해독 기법으로 암호화를 깨지 않았다. 대신 유효한 암호화 추적 데이터를 평문을 내부적으로 읽을 수 있는 보안 수준이 낮은 모델에 재전송했다. 이어 탈옥 기법으로 해당 모델이 해독한 내용을 공개하도록 유도했다.

이 차이로 인해 이 연구는 단순한 프롬프트 인젝션 시연을 넘어선다. 제공업체들은 각 추론 블록을 직접 들여다보지 못하도록 보호했지만, 관련 없는 맥락의 블록도 호환 모델이 처리하도록 허용했다. 암호화는 데이터를 숨겼지만, 원래의 모델·사용자·대화에 안정적으로 묶어 두지는 못했다.

연구진은 공개 에이전트 로그에서 발견한 암호화 블록으로부터 자격 증명과 개인정보를 복구했다고 보고했다. 또한 모델 추출, 유해 콘텐츠 노출, 보이지 않는 프롬프트 인젝션도 시연했다.

연구팀에 따르면 영향을 받은 제공업체들은 이 공개 사실을 인정했다. 제공업체들이 검증을 강화한 뒤 문서화된 공격은 더 이상 재현되지 않은 것으로 전해졌다. 그러나 이 사건은 이동 가능하지만 불투명한 모델 상태를 중심으로 에이전트를 구축하는 개발자들에게 더 큰 문제를 드러낸다.

Stealing AI Reasoning Traces는 이동 가능한 모델 상태를 악용했다

핵심 실패는 약한 암호화가 아니었다. 유효한 암호화 블록이 이동할 수 있는 위치를 지나치게 신뢰한 데 있었다.

추론 모델은 보이는 답변을 내놓기 전에 내부적으로 단계별 계산을 수행하는 경우가 많다. 제공업체들은 일반적으로 해당 chain-of-thought를 숨기고 요약만 공개할 수 있다. 이 정책은 모델의 지식재산을 보호하고 민감하거나 유해한 내부 콘텐츠에 대한 직접 접근을 제한한다.

상태 비저장 API는 엔지니어링 측면의 복잡성을 낳는다. 고객이 저장을 비활성화하거나 대화 기록을 직접 관리할 경우, 제공업체는 영구적인 서버 측 대화 기록에 의존할 수 없다. 모델이 이전 작업을 이어가려면 클라이언트가 충분한 상태를 반환해야 한다.

OpenAI는 encrypted reasoning items를 도입하며 이 설계를 공개적으로 설명했다. 대상 고객은 이러한 항목을 OpenAI 서버에 저장하지 않고도 요청 간 추론을 이어갈 수 있었다. 이를 재사용하면 반복 계산을 줄이면서 지능을 유지할 수 있다는 의도도 있었다.

Google은 thought signatures를 통해 유사한 메커니즘을 문서화하고 있다. 이는 여러 단계의 상호작용에서 추론 맥락을 보존하는 내부 사고의 암호화 표현이다. 원시 REST 요청을 사용하는 개발자는 이를 받은 그대로 정확히 반환해야 할 수 있다.

이러한 설계에서 암호화된 추론 블록은 수동적인 암호문이 아니라 운영 객체가 된다. 제공업체는 블록을 받아 검증하고 복호화한 뒤, 복구된 콘텐츠를 모델의 컨텍스트에 배치한다. 그러면 모델은 이전 상태에서 작업을 이어갈 수 있다.

연구팀은 수용된 블록이 원래 맥락에 충분히 제한되지 않았다는 사실을 발견했다. 테스트한 시스템에서는 한 세션에서 생성된 블록이 같은 제공업체의 모델 생태계 내 다른 위치에서도 수용될 수 있었다.

이 호환성은 가장 강력한 모델의 방어를 우회하는 경로를 만들었다. 공격자는 최첨단 모델에서 암호화된 추적 데이터를 얻은 뒤, 거부 동작이 약한 저가형 형제 모델에 이를 제공할 수 있었다.

이 형제 모델은 보안 연구자들이 말하는 복호화 오라클이 됐다. 제공업체의 암호 키를 공개할 수는 없었지만, 암호화된 콘텐츠를 처리하고 그 결과 평문을 출력할 수 있었다.

따라서 공격은 각각 따로 보면 합리적으로 보이는 두 특성을 결합했다. 첫째, 암호화된 상태는 상태 비저장 대화에 충분할 만큼 이동 가능해야 했다. 둘째, 호환 모델은 작업을 이어가기 위해 이전 추론에 접근할 수 있어야 했다.

이 두 특성이 합쳐지며 공격자는 보호된 추론을 안전 경계 너머로 옮길 수 있었다. 공격자는 추적 데이터를 생성한 더 강력한 모델을 탈옥할 필요가 전혀 없었다.

전체 논문에 따르면, 연구진은 Anthropic, OpenAI, Google API 전반에서 이 접근법을 시연했다. 이들의 표적은 단일 엔드포인트가 아니라 여러 독점 모델 계열이 공유하는 아키텍처 패턴이었다.

이 때문에 AI 추론 추적 보안은 강력한 암호화 알고리즘을 선택하는 데서 멈출 수 없다. 시스템은 블록이 의도된 모델, 세션, 계정, 대화 내 위치에 속하는지까지 인증해야 한다.

봉인된 문서는 모든 직원이 권한은 있지만 쉽게 조작될 수 있는 동료에게 이를 소리 내어 읽어 달라고 요청할 수 있다면 여전히 위험하다. 암호화는 작동하지만, 주변의 권한 부여 모델이 실패하는 셈이다.

더 약한 형제 모델이 복호화 경로가 됐다

모델 계열 내 불균일한 안전장치가 호환성을 권한 상승 경로로 바꿨다.

최첨단 모델은 숨겨진 추론을 드러내지 않도록 광범위한 훈련을 받는다. 제공업체들은 사용자가 원시 chain-of-thought를 얻지 못한 채 답변, 요약, 도구 결과를 보게 하려 한다. 이러한 제한은 고품질 학습 데이터를 찾는 경쟁업체의 시도도 어렵게 만든다.

소형 모델은 다른 제약 조건에서 작동한다. 이들은 속도, 가용성, 효율성을 우선시하며, 특수한 탈옥 기법에 대한 저항성은 플래그십 시스템과 다를 수 있다.

연구진은 이 격차를 악용했다. 더 강력한 소스 모델로 암호화된 추론 블록을 생성하고, 이를 다른 요청으로 옮긴 뒤, 더 약하지만 호환되는 모델에 기반 추론을 전사하라고 지시했다.

소스 모델의 거부 훈련은 그대로 유지됐다. 해당 모델은 추출 프롬프트를 받은 적이 없다. 최첨단 엔드포인트에 집중한 모니터링은 의심스러운 복호화 상호작용을 반드시 포착하지 못할 수 있다.

연구팀은 테스트한 각 모델 구성에 대해 Codeforces 프로그래밍 문제 120개를 평가했다. 소스 모델이 보고한 사고 토큰 수와 복호화 후 복구된 토큰 수를 비교했다.

연구진의 공개 보고에 따르면 세 제공업체 모두에서 중앙값 비율은 1.00이었다. 추적 데이터의 82~89%는 원래 보고된 길이의 5% 이내에 들어왔다.

이 측정치는 광범위한 복구를 시사하지만 신중한 해석이 필요하다. 개발자는 일반적으로 숨겨진 원본을 검토할 수 없으므로, 토큰 수 일치는 정답과의 직접적인 문자 단위 비교가 아니다.

연구진은 제공업체가 보고한 추론 길이를 실용적인 서명으로 사용했다. 길이가 거의 동일한 복구 추적 데이터는, 특히 내용이 작업과 일치하고 일관되게 이어질 때 강력한 증거가 된다.

다만 이 결과를 복구된 모든 단어에 대한 독립적인 암호학적 검증으로 설명해서는 안 된다. 보안 프리프린트를 운영상 결론으로 옮길 때 이 구분은 중요하다.

이러한 한계에도 공격은 모델 추출의 경제성을 바꾼다. 최종 답변은 모델이 산출한 결과의 예시를 제공한다. 추론 추적 데이터는 중간 선택, 수정, 계획, 폐기된 접근법으로 이루어진 더 풍부한 연속 정보를 노출한다.

이 자료는 한 모델이 다른 모델의 출력을 통해 행동을 학습하는 증류를 위한 학습 데이터가 될 수 있다. 이에 따라 제공업체들은 숨겨진 추론을 가치 있는 지식재산으로 취급해 왔다.

논문은 복호화된 추적 데이터가 클라이언트에 노출된 요약보다 약 5배 더 많은 추론을 담고 있었다고 보고했다. 그러한 추적 데이터를 수집하는 경쟁업체는 답변만 모으는 방식보다 더 밀도 높은 신호를 얻게 된다.

이 방법은 생성 비용과 추출 비용도 분리했다. 누군가는 공개 세션 로그 안에서 최첨단 모델이 추론을 생성하는 비용을 이미 지불했을 수 있다. 공격자는 더 저렴한 호환 엔드포인트를 통해 기존 블록을 복호화하기만 하면 됐다.

이는 외부인이 임의의 서버 트래픽을 복호화할 수 있었다는 뜻은 아니다. 공격자는 여전히 유효한 암호화 블록에 접근해야 했다. 공개 로그, 공유된 궤적, 캐시된 세션, 노출된 애플리케이션 기록이 그러한 자료를 제공했다.

따라서 영향 범위는 모델 공급업체를 넘어섰다. 개발자들은 도구와 여러 차례에 걸친 추론이 올바르게 계속되도록 완전한 응답 객체를 보존하라는 권고를 받아 왔다.

이러한 일반적인 통합 패턴은 개발자와 사용자 모두 검토할 수 없는 불투명한 콘텐츠를 보존할 수 있다. 같은 콘텐츠는 호환되는 복호화 경로를 찾은 공격자에게 나중에 가치 있는 표적이 될 수 있다.

즉각적인 교훈은 아키텍처에 있다. 보안팀은 저가형 형제 모델과 레거시 엔드포인트를 포함해 보호된 상태를 소비할 수 있는 모든 모델을 평가해야 한다. 가장 강력한 생성 모델의 안전장치가 전체 모델 계열의 보안을 규정하지는 않는다.

암호화는 제공업체의 지식재산을 보호했지만 사용자 노출은 숨겼다

이 설계는 기밀 추론을 우선시하면서 사용자가 자신의 로그에 무엇이 담겼는지 감사할 수 없게 했다.

개발자가 대화 기록을 검토할 때 불투명한 추론 블록은 안전해 보인다. 길게 인코딩된 문자열은 비밀번호, 비공개 문서, 액세스 토큰을 눈에 띄게 노출하지 않는다. 따라서 일반적인 비식별화 과정은 이 블록을 그대로 둘 수 있다.

그러나 모델의 숨겨진 추론은 컨텍스트의 정보를 다시 서술할 수 있다. 배포를 계획하면서 자격 증명을 나열하거나, 예약 작업 중 개인정보를 반복하거나, 정제된 답변을 작성하기 전에 검색된 문서를 인용할 수 있다.

보이는 응답은 깨끗하게 유지될 수 있다. 모델이 무엇을 말하거나 할지 결정하는 데 민감한 정보를 사용했기 때문에 암호화된 추적 데이터에는 그 자료가 여전히 보존될 수 있다.

이전 프라이버시 연구는 이미 내부 추론이 안전한 사적 작업 공간이라는 가정에 의문을 제기했다. 해당 연구는 최종 답변이 더 신중해진 경우에도 더 긴 추론이 민감한 데이터 노출을 증가시킬 수 있음을 발견했다.

새 공격은 이 콘텐츠 위험을 이동 가능한 암호화 상태와 결합했다. 사용자가 검사하거나 비식별화할 수 없는 추적 데이터가 다른 모델을 통해 복구 가능해진 것이다.

연구진은 공개적으로 이용 가능한 에이전트 궤적 6,708개에서 암호화된 추론 블록 315,320개를 수집했다. 이를 복호화한 뒤 개인정보 식별 가능 정보 아티팩트 367개와 자격 증명 182개를 분류했다.

자격 증명 집합에는 API 키 62개와 비밀번호 33개가 포함됐다. 더 광범위한 스캔에서는 실제 사용자 세션 전반에서 아티팩트 704개가 나왔고, 이 중 64개는 보이는 기록 어디에도 나타나지 않은 것으로 전해졌다.

이 수치는 전체 공개 인터넷이 아니라 연구 표본을 설명한다. 활성 상태로 남아 있던 자격 증명의 수, 모든 항목의 고유성, 침해를 겪은 소유자의 수를 입증하지는 않는다.

그럼에도 이는 구체적인 공개 패턴을 보여 준다. 공개 대화 기록에는 게시자가 실질적으로 검토할 방법이 없는 정보가 담길 수 있었다.

이 상황은 익숙한 보안 약속을 뒤집는다. 암호화는 보통 데이터 소유자가 자신의 정보를 읽을 수 있는 사람을 제한하도록 돕는다. 여기서는 암호화가 모델이 자신에 대해 무엇을 보존했는지 사용자가 발견하지 못하게도 했다.

제공업체만 API 인프라를 통해 추적 데이터를 복호화할 수 있었다. 재전송 공격이 가능해지기 전까지 사용자는 이 불투명한 블록에 공유를 후회할 내용이 없다고 믿을 수밖에 없었다.

이 비대칭성은 코딩 에이전트를 배포하는 기업에 가장 직접적인 압박을 가했다. 코딩 에이전트는 작업을 완료하는 동안 환경 파일, 배포 구성, 데이터베이스 주소, 리포지터리 비밀을 검사할 수 있다.

팀은 디버깅, 평가 또는 협업을 위해 에이전트 기록을 보관하는 경우가 많습니다. 연구자들도 에이전트 성능을 비교하거나 실험을 재현하기 위해 궤적을 공개합니다.

조직은 공개 전에 눈에 보이는 프롬프트와 출력을 정제할 수 있습니다. 하지만 조직이 복호화하고 검사할 수 없다면, 그 과정만으로는 암호문 내부에 포함된 비밀을 제거할 수 없습니다.

연구자들이 설명한 가장 안전한 즉각적 대응은 과거 대화 기록을 공유하기 전에 암호화된 추론 블록을 제거하는 것이었습니다. 이 선택은 재현성을 낮추거나, 재개된 대화가 원래의 추론 상태를 유지하지 못하게 할 수 있습니다.

따라서 개발자들은 실제적인 절충에 직면합니다. 블록을 유지하면 연속성을 지원하지만, 삭제하면 불투명한 정보 유출 경로를 제한합니다.

조직은 눈에 보이는 텍스트가 무해해 보이더라도 에이전트 기록을 민감한 기록으로 취급해야 합니다. 로그에는 접근 제어, 보존 기간 제한, 비밀 정보 스캔, 외부 공개를 규율하는 명확한 규칙이 필요합니다.

검색 가능한 지식 베이스는 엔지니어링 팀이 승인된 기술적 맥락을 정리하는 데 도움이 될 수 있습니다. 하지만 검토할 수 없는 모델 상태 객체를 쌓아두는 장소가 되어서는 안 됩니다.

핵심 운영 질문은 더 이상 대화 기록에 비밀이 눈에 띄게 포함되어 있는지 여부가 아닙니다. 팀은 에이전트가 민감한 데이터에 접근했는지, 그리고 내보낸 상태가 그 데이터를 보이지 않게 보존했을 가능성이 있는지를 물어야 합니다.

숨겨진 추론은 프롬프트 인젝션 경로가 되기도 했다

추출을 가능하게 한 동일한 이식성은 보이지 않는 지시를 다른 에이전트의 신뢰된 맥락으로 옮길 수도 있었다.

프롬프트 인젝션은 보통 모델이 읽는 콘텐츠를 통해 유입됩니다. 악성 웹페이지, 문서, 이메일 또는 도구 결과가 모델에게 자신의 작업을 무시하고 공격자의 목표를 추구하라고 지시합니다.

방어자는 때때로 그 콘텐츠를 검사할 수 있습니다. 의심스러운 텍스트를 필터링하고, 신뢰할 수 없는 출처를 격리하며, 도구를 제한하거나, 중요한 영향을 미치는 작업에 대해 사용자 승인을 요구할 수 있습니다.

암호화된 추론 블록은 가시성 문제를 바꿉니다. 클라이언트는 불투명한 문자열을 보지만, 모델은 이를 이전 추론 맥락의 일부로 평문으로 받아들입니다.

연구자들은 이러한 블록 안에 악성 지시를 삽입한 개념 증명을 만들었습니다. 다른 세션이 해당 추적을 재개했을 때, 모델은 그 지시를 자신의 이전 추론으로 취급했습니다.

이 위치는 페이로드에 이례적인 영향력을 부여할 수 있습니다. 모델은 일반적으로 계획을 유지하고, 중간 결과를 기억하며, 다음 도구 작업을 결정하기 위해 이전 추론에 의존합니다.

보고된 시연에서 관련 없는 요청은 프레젠테이션을 편집하는 코드를 요구했습니다. 숨겨진 지시는 생성된 스크립트에 추가적인 데이터 전송 동작을 포함하게 했습니다.

페이로드는 눈에 보이는 대화에 나타날 필요가 없었습니다. 프롬프트, 도구 출력, 최종 답변만 검토하는 검토자는 악성 동작의 원인을 놓칠 수 있습니다.

이 공격은 모델 증류를 위해 AI 추론 추적을 훔치는 행위와 다릅니다. 추출은 기밀 상태를 읽고, 오염은 수신자가 검사할 수 없는 상태를 통해 적대적인 목표를 기록하거나 전송합니다.

두 공격은 동일한 깨진 경계에 의존합니다. 한 맥락의 추론 블록이 다른 맥락에서 자동으로 신뢰된 추론이 되어서는 안 됩니다.

이 시나리오는 완전한 궤적을 교환, 캐시 또는 공개하는 에이전트 시스템에서 특히 중요합니다. 팀은 평가, 시연, 디버깅, 자동화된 작업자 간 인수인계를 위해 저장된 세션을 점점 더 활용하고 있습니다.

한 사용자가 내보낸 세션을 다른 사용자가 재개할 수 있습니다. 에이전트 프레임워크는 기록된 이력을 여러 모델에 재생할 수 있습니다. 벤치마크는 참가자들이 비활성 테스트 데이터라고 가정하는 추적을 배포할 수 있습니다.

암호화된 추론이 이러한 산출물과 함께 이동하면 수신자는 그 내용을 독립적으로 검증할 수 없습니다. 이들은 제공업체의 검증과 블록을 생성한 시스템의 무결성에 의존해야 합니다.

출력 필터링만으로는 충분하지 않습니다. 필터는 의심스러운 최종 명령을 감지할 수 있지만, 모델이 왜 그 명령을 선택했는지는 설명할 수 없습니다. 미묘한 페이로드는 요청된 작업 안에서 정당해 보이는 동작을 만들어낼 수도 있습니다.

도구 권한은 더 강력한 경계로 남아 있습니다. 파일을 전송하거나, 프로덕션 자격 증명을 읽거나, 임의의 코드를 실행할 수 없는 에이전트는 숨겨진 지시를 피해로 전환할 방법이 더 적습니다.

승인 절차가 실제 부작용을 포괄한다면 사람의 승인도 도움이 됩니다. 승인 인터페이스는 모델이 작성한 요약만이 아니라 대상, 파일, 명령, 변경된 권한을 보여줘야 합니다.

추론 모니터는 더 복잡한 과제에 직면합니다. 제공업체는 원시 사고 사슬을 공개하면 지식재산, 민감한 데이터 또는 오해를 부를 수 있는 내부 추측이 노출될 수 있기 때문에 이를 일부 숨깁니다.

고객은 여전히 도구 작업이 자신의 지시를 따른다는 증거를 필요로 합니다. 이 요구사항은 검사 가능한 작업 계획, 구조화된 도구 요청, 출처 기록, 숨겨진 추론 외부의 정책 검사를 선호하게 만듭니다.

이 연구는 모든 암호화된 추적이 여전히 보이지 않는 인젝션을 담을 수 있음을 입증하지는 않습니다. 제공업체들은 공개 이후 검증 방식을 변경한 것으로 전해졌으며, 문서화된 공격은 더 이상 재현되지 않았습니다.

그러나 에이전트 개발자는 불투명한 상태가 제공업체에서 생성되었다는 이유만으로 안전하다고 가정해서는 안 됩니다. 미래 모델 동작에 영향을 주는 모든 이식 가능한 객체는 실행 가능하거나 직렬화된 상태와 같은 수준의 의심을 받아야 합니다.

공동 대응은 공격을 줄였지만 설계 논쟁까지 끝내지는 못했다

보고된 취약점은 대체로 완화됐지만, 상태 비저장 프라이버시와 맥락 바인딩 간의 긴장은 여전히 남아 있다.

연구자들은 공개 전에 Anthropic, OpenAI, Google, Microsoft, Hugging Face에 조사 결과를 공개했다고 말합니다. 연구팀에 따르면 영향을 받은 모든 제공업체가 보고를 확인했습니다.

8월 10일 공개 시점에는 설명된 추출 공격이 테스트된 API에서 더 이상 재현되지 않았다고 전해집니다. 연구자들은 이러한 변화를 더 엄격해진 추론 블록 검증에 기인한다고 봤습니다.

핵심 완화책은 맥락 바인딩입니다. 제공업체는 블록을 원래의 계정, 세션, 모델, 대화 내 위치에 관한 정보와 암호학적으로 연결할 수 있습니다.

이 바인딩은 성공적인 인증의 의미를 바꿉니다. 유효한 블록은 더 이상 제공업체가 생성했고 아무도 암호문을 변경하지 않았다는 것만을 뜻하지 않습니다.

현재 요청이 이를 소비하도록 권한을 받은 환경과 일치한다는 뜻도 됩니다. 블록을 더 취약한 형제 모델이나 관련 없는 세션으로 옮기면 검증은 실패합니다.

암호학 엔지니어 Matthew Green은 본격적인 공격이 등장하기 전에 이식성 문제를 탐구했습니다. 그의 5월 29일 추론 분석은 불투명한 사고 데이터가 클라이언트가 관리하는 API 이력을 통해 이동한 이유를 살펴봤습니다.

후속 연구는 이 아키텍처적 관찰을 실질적인 추출 및 오염 시연으로 발전시켰습니다. 이 과정은 호기심에서 비롯된 상호운용성 테스트가 공식 API 설명에서 빠진 보안 경계를 밝혀낼 수 있음을 보여줍니다.

맥락 바인딩도 그 자체의 절충을 만듭니다. 고객은 호환되는 모델 간에 대화를 이전하거나, 세션을 분기하고, 벤치마크를 재생하거나, 제공업체 측 저장 없이 작업을 재개하려는 정당한 필요가 있을 수 있습니다.

모든 블록을 하나의 요청 체인에 엄격히 묶어두면 이러한 워크플로를 방해할 수 있습니다. 제공업체는 보편적 호환성에 의존하는 대신, 권한이 부여된 이전을 위한 명시적이고 감사 가능한 메커니즘을 제공해야 합니다.

키 순환과 버전 변경도 신중하게 다뤄야 합니다. 엔드포인트에 지나치게 좁게 연결된 블록은 모델 업그레이드 후 사용할 수 없게 되어, 장기 실행 에이전트와 저장된 워크플로를 복잡하게 만들 수 있습니다.

제공업체는 범위가 제한된 이전 토큰이나 통제된 재암호화를 제공할 수 있습니다. 이러한 메커니즘은 누가 이동을 승인했고 어떤 대상이 상태를 소비할 수 있는지에 대한 명확한 기록을 보존해야 합니다.

암호학적 바인딩 이후에도 모델 수준의 안전장치는 필요합니다. 권한을 받은 모델이라도 주변의 봉투가 올바르게 검증된다는 이유만으로 원시 숨겨진 추론을 자유롭게 재현해서는 안 됩니다.

마찬가지로 암호학은 모델이 내부적으로 생성한 민감한 콘텐츠를 제거할 수 없습니다. 암호학은 그 콘텐츠가 이동할 수 있는 위치와 이를 처리할 수 있는 시스템만 통제합니다.

즉, 해결책은 여러 계층으로 구성됩니다. 제공업체는 이식성을 제한하고, 모든 호환 디코더를 강화하며, 비정상적인 재생 패턴을 모니터링하고, 추론 내부의 비밀을 최소화해야 합니다.

고객은 대화 기록 노출을 관리하고, 에이전트 권한을 제한하며, 숨겨진 상태를 무해한 메타데이터로 취급하지 않아야 합니다. 어느 한쪽도 문제 전체를 상대에게 떠넘길 수 없습니다.

회의적인 지점은 간단합니다. 완화 조치에 관한 공개 증거는 주로 공개 이후 공격이 더 이상 재현되지 않았다고 말하는 연구자들에게서 나옵니다.

이는 의미가 있지만, 외부인은 독점적인 검증 로직을 완전히 감사할 수 없습니다. 제공업체들이 수정 내용이나 과거 블록 처리 방식에 대해 동일한 수준의 기술적 설명을 공개한 것은 아닐 수 있습니다.

따라서 고객은 이 문제가 영구적으로 해결됐다고 선언하지 않아야 합니다. 향후 모델, 호환성 브리지, 레거시 API 또는 마이그레이션 기능이 유사한 맥락 간 경로를 다시 열 수 있습니다.

AI 추론 추적 보안은 지속적인 불변 조건에 달려 있습니다. 의도된 주체와 모델만이 각 보호된 상태 객체를 소비해야 합니다. 모든 새로운 상호운용성 기능은 이 규칙을 보존해야 합니다.

수정 조치가 유지되는지 보여줄 세 가지 신호

다음 시험대는 제공업체가 보편적이고 보이지 않는 신뢰를 다시 만들지 않으면서 유용한 모델 연속성을 유지할 수 있는지 여부다.

첫 번째 신호는 추론 블록 범위에 관한 더 엄격한 공개 문서화입니다. 개발자는 블록이 계정, 프로젝트, 모델 계열, 정확한 모델, 세션 또는 요청 순서에 연결되는지 알아야 합니다.

명확한 검증 오류는 신뢰를 강화할 것입니다. 권한이 부여된 맥락 밖으로 이동한 블록은 조용히 수용되거나 하향 조정되지 않고 예측 가능하게 실패해야 합니다.

문서화는 지원되는 마이그레이션 경로도 설명해야 합니다. 제공업체가 모델 전환을 허용한다면, 개발자가 실험으로 추론하게 방치하지 말고 권한 경계를 설명해야 합니다.

이러한 지침이 없으면 보안 주장은 약해집니다. 고객은 문서화되지 않은 이식성을 기반으로 안전한 보존 및 공유 정책을 설계할 수 없습니다.

두 번째 신호는 새로 출시된 모델과 레거시 모델 전반에서의 독립적인 재테스트입니다. 보안 연구자들은 강력한 모델의 추적이 더 작은 형제 모델, 프리뷰 엔드포인트, 지역 배포, 호환성 계층을 통해서도 여전히 사용할 수 없는지 시험해야 합니다.

현재의 플래그십 경로만 보호하고 오래된 디코더를 놓치는 수정은 핵심 실패를 남겨둡니다. 모델 계열은 자주 바뀌며, 안전 동작은 버전마다 달라질 수 있습니다.

독립적인 확인은 충실도 문제도 명확히 할 것입니다. 연구자들은 단순한 토큰 수 일치가 아니라, 복구된 콘텐츠를 알려진 평문 또는 계측된 테스트 시스템과 비교하는 통제된 방법을 필요로 합니다.

맥락 간 추적 재생이 일관되게 불가능하다면 보고된 완화 조치를 뒷받침하게 됩니다. 새로운 추출 결과는 블록 검증이 여전히 파편화되어 있음을 보여줄 것입니다.

세 번째 신호는 에이전트 플랫폼이 과거 및 공유 대화 기록을 처리하는 방식입니다. 성숙한 제품은 내보내기에서 불필요한 암호화 상태를 제거하고, 공유 전 사용자에게 경고하며, 재개 가능한 세션과 공개용 형식을 분리해야 합니다.

보안 제어는 불투명한 추론을 기본적으로 민감한 것으로 취급해야 합니다. 내보내기 도구는 평문을 표시할 수 없더라도 보존된 상태를 위험 범주로 명시해야 합니다.

조직은 노출된 에이전트 기록에 프로덕션 비밀이 포함된 경우 자격 증명도 교체해야 합니다. 공개 로그를 제거했다고 해서 누군가 이전에 암호화된 블록을 복사하지 않았다는 증거가 되지는 않습니다.

현재 개발자들에게 실질적인 대응은 자산 파악에서 시작된다. 어떤 시스템이 전체 모델 응답을 보관하는지, 해당 응답이 어디에 기록되는지, 그리고 누가 이를 다운로드할 수 있는지를 확인해야 한다.

그다음 운영 연속성과 장기 기록을 분리해야 한다. 활성 에이전트는 보호된 추론 상태가 필요할 수 있지만, 감사 아카이브에는 프롬프트, 도구 호출, 출력, 구조화된 의사결정 요약만 필요할 수 있다.

모델 자격 증명은 불필요한 컨텍스트에서 분리해 두어야 한다. 최소 권한 원칙으로 도구를 제한하고, 민감한 환경을 격리하며, 외부 전송이나 파괴적 명령에는 승인을 요구해야 한다.

무엇보다 암호화가 이식 가능한 객체에 올바른 권한이 부여되었다는 증거라고 여겨서는 안 된다. 암호화는 특정 키를 가진 사람이 데이터를 읽거나 수정할 수 있는지를 답한다. 그러나 그 데이터가 어디에 속해야 하는지까지 자동으로 답해 주지는 않는다.

Stealing AI Reasoning Traces는 세 주요 제공업체 생태계 전반에서 이러한 구분이 빠져 있음을 드러냈다. 보도에 따르면 즉각적인 공격은 차단됐지만, 아키텍처적 교훈은 어느 한 세대의 모델보다 오래 남을 것이다.

이제 개발자는 AI 플랫폼이 불투명한 상태를 반환할 때마다 더 어려운 질문을 던져야 한다. 이 객체가 다시 돌아왔을 때 어떤 ID, 모델, 그리고 미래의 작업을 승인할 수 있는가?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page