AI 추론은 추출될 수 있으며, 미중 증류 갈등은 한층 더 복잡해졌다
- Martin Chen

- 8월 15일
- 13분 분량
Google News는 최첨단 AI 기업들에 새로운 경고를 제기하는 연구를 소개했다. 모델의 내부 추론을 숨긴다고 해서 외부인이 유용한 흔적을 복원하지 못하는 것은 아니라는 내용이다. 연구진은 가중치나 숨겨진 활성화값에 접근하지 않고도, 정교하게 구성한 프롬프트로 오픈웨이트 모델에서 추론과 유사한 정보를 드러낼 수 있음을 발견했다.
이 발견은 점점 정치화되는 분쟁에 기술적 근거를 더한다. OpenAI와 Anthropic은 중국 연구소들이 미국 모델을 활용해 대규모 학습 데이터를 생성했다고 비난한다. 중국은 이러한 광범위한 주장이 자국 기술 산업을 억누르려는 시도라고 반박한다.
중요한 변화는 어떤 상용 모델이 실제 내부 사고를 내주었다는 증거가 아니라는 점이다. 이 연구는 하류 증류를 목적으로 독점형 운영 시스템을 시험하지 않았다. 대신 인터페이스에서 사고 과정을 숨기는 방식이 모델 개발자들이 예상했던 것보다 약한 보호책일 수 있는 이유를 보여준다.
이 결과는 불편한 구분을 만든다. 기업은 모델 가중치를 비밀로 유지하면서도, 다른 개발자가 특정 역량을 재현할 만큼 충분한 행동 정보를 노출할 수 있다. 그렇게 되면 모든 공개 챗봇과 애플리케이션 프로그래밍 인터페이스가 잠재적인 학습 신호의 원천이 된다.
Google News 헤드라인이 분쟁을 과소평가하는 이유
이는 더 이상 한 기업이 다른 기업의 답변을 복사했는지에 관한 좁은 논쟁이 아니다.
직접적인 연구는 Hidden Thoughts Are Not Secret라는 제목의 논문에서 나왔다. 저자들은 일반 프롬프트를 통해 보이는 추론 흔적을 유도하도록 설계된 Reasoning Exposure Prompting, 즉 REP를 연구했다.
REP는 별도의 섀도 모델이 생성한 예시에서 시작한다. 이 예시들은 셸 명령, Python 세션, 노트북 셀 또는 도구 호출과 유사한 형식으로 감싼다. 이후 대상 모델은 같은 패턴 안에서 새로운 문제를 받는다.
이 방법은 숨겨진 신경 활동을 직접 들여다보지 않는다. 대신 프롬프트가 유도한 추론과 유사한 흔적을 대상 모델이 외부로 드러내도록 유도한다. 보이는 텍스트가 내부 계산을 충실히 전사한 기록이라는 보장은 없기 때문에 이 차이는 중요하다.
하지만 충실도만이 유일한 보안 우려는 아니다. 불완전한 설명이라도 그 흔적은 유용한 감독 신호를 제공할 수 있다. 더 작은 학생 모델은 이 자료에서 반복되는 전략, 분해 방식, 검증 절차, 응답 구조를 학습할 수 있다.
연구진은 통제된 환경에서 오픈웨이트 모델을 시험했다. 상용 API를 공격하거나 독점 가중치를 재구성했다고 주장하지는 않았다. 또한 실험이 제한된 모델 집합과 추론 벤치마크만을 다뤘다는 점도 인정했다.
이러한 한계는 성급한 일반화를 막는다. 이 논문은 Claude, Gemini 또는 OpenAI의 운영 시스템이 동일한 프롬프트를 통해 복제될 수 있음을 입증하지 않는다. 다만 인터페이스 수준의 억제만으로는 완전한 방어책으로 간주할 수 없다는 점을 보여준다.
Google News의 프레임은 추론을 “추출”할 수 있는지를 묻지만, 이 동사는 여러 서로 다른 과정을 하나로 압축한다. 공격자는 보이는 근거 설명을 복원할 수도 있고, 행동 패턴을 모방할 수도 있으며, 벤치마크 성능을 재현하거나 생성된 해답으로 더 작은 모델을 학습시킬 수도 있다.
이러한 결과 어느 것도 교사 모델의 정확한 내부 상태를 복원할 필요는 없다. 모델 추출은 일반적으로 완벽한 디지털 복제본이 아니라 유용한 행동을 목표로 한다. 공격자가 원하는 것은 독자적인 연구와 학습 작업을 줄일 수 있을 만큼의 역량이다.
이 때문에 분쟁은 철학적 문제보다 실무적인 문제에 가깝다. 연구자들은 언어 모델이 인간처럼 실제로 추론하는지 결론낼 필요가 없다. 노출된 신호가 다른 모델이 더 많은 문제를 푸는 데 도움이 되는지만 판단하면 된다.
2026년 7월 ACL 연구는 이 질문에 무게를 더한다. 저자들은 920개 미만의 예시를 활용한 증류 이후 의미 있는 추론 성능 향상을 보고했다. 이들의 통제된 사례 연구는 산업 규모 캠페인보다 훨씬 작은 조건을 다뤘다.
이 연구가 보편적인 추출 효율을 입증한 것은 아니다. 하나의 기반 모델과 선택된 벤치마크에서 나온 결과로 최첨단 시스템 전반의 성능을 예측할 수는 없다. 그럼에도 역량 이전에는 항상 막대한 데이터셋이 필요하다는 가정에는 의문을 제기한다.
증류 자체는 여전히 일반적인 머신러닝 기법이다. 개발자는 더 강한 교사의 출력을 사용해 더 작은 학생을 학습시킨다. Google, OpenAI, Anthropic 등 연구소들은 각자 제품군 내부에서 이 방법의 변형을 사용한다.
갈등은 제3자가 허가 없이 출력을 수집하거나, 접근 통제를 우회하거나, 이를 토대로 경쟁 모델을 구축할 때 시작된다. 이 시점에서 제공업체들은 이를 적대적 증류 또는 모델 추출로 규정한다.
용어에는 정치적 무게가 실린다. “증류”는 통상적인 엔지니어링처럼 들리는 반면, “절도”는 소유권과 불법 취득을 암시한다. 일상적인 학습이 어디서 끝나고 금지된 역량 추출이 어디서 시작되는지는 법적으로 아직 완전히 정리되지 않았다.
이 메커니즘은 모델의 실제 사고를 복원할 필요가 없다
유용한 추론 흔적은 교사의 문자 그대로의 내부 계산을 드러내지 않고도 문제 해결 행동을 이전할 수 있다.
언어 모델은 읽을 수 있는 문장이 아닌 숨겨진 수치 상태를 활용해 토큰을 하나씩 생성한다. 표시되는 사고 과정은 또 다른 생성 출력이다. 계산의 일부를 반영할 수 있지만, 사후적으로 답변을 합리화할 수도 있다.
이러한 한계는 이전 해석 가능성 연구 전반에서 문서화돼 왔다. 모델은 답변을 선택한 이유를 정확하게 밝히지 못하면서도 설득력 있는 설명을 내놓을 때가 있다. 따라서 근거 설명을 추출하는 일은 결정론적 프로그램을 읽는 것과 같지 않다.
그렇더라도 증류에는 완벽한 내성 관찰이 필요하지 않다. 예를 들어 교사가 기하 문제를 반복적으로 적절한 하위 문제로 나눈다고 가정해 보자. 학생은 교사의 보이는 설명에 숨겨진 처리 과정이 빠져 있더라도, 그 출력으로부터 해당 구조를 학습할 수 있다.
같은 원리는 코딩과 도구 사용에도 적용된다. 교사는 저장소를 살펴보고, 명령을 선택하고, 가정을 검증하며, 실패에서 회복하는 방법을 보여줄 수 있다. 이러한 순서는 성공적인 행동의 예시가 된다.
추론 모델은 이러한 출력을 특히 가치 있게 만들었다. 이들은 답변 전 더 많은 계산을 수행하고 수학, 과학, 코딩, 계획 과제에서 더 나은 해법을 제시하는 경우가 많다. 그 결과 생성되는 흔적은 최종 답변만으로는 얻을 수 없는 더 풍부한 감독 정보를 담을 수 있다.
REP는 숨겨진 계산과 보이는 감독 사이의 이 차이를 겨냥한다. 코드와 유사한 래퍼는 모델이 시연 사례를 다루는 방식에 영향을 주는 것으로 보인다. 모델은 이를 일반적인 대화형 설명이 아니라 재현하거나 검토할 텍스트로 해석할 수 있다.
연구진은 흔적 유사성과 하류 활용성을 측정했다. 결과는 프롬프팅이 일부 실험 조건에서 역량을 담은 자료를 노출할 수 있음을 시사한다. 다만 노출된 모든 토큰이 숨겨진 내부 토큰에 대응한다는 뜻은 아니다.
이 구분은 연구에 대한 책임 있는 설명의 기준이 되어야 한다. REP를 독심 공격이라고 부르는 것은 증거를 과장하는 일이다. 이를 무해한 프롬프트 형식화라고 부르는 것은 연구의 동기가 된 하류 학습 가치를 무시하는 일이다.
가장 강한 해석은 이 두 극단 사이에 있다. 배포된 모델은 인터페이스가 원시 사고 과정 텍스트를 숨기더라도 유용한 추론 신호를 공개할 수 있다. 이 신호는 이후 행동 모방이나 학생 모델 학습을 뒷받침할 수 있다.
상용 제공업체들은 이미 여러 이유로 원시 추론을 제시하지 않는다. 숨겨진 흔적에는 안전하지 않은 자료, 내부 지침, 개인정보 또는 혼란스러운 중간 추측이 포함될 수 있다. 기업들은 대신 요약된 설명을 반환하는 경우가 많다.
추론 요약은 사용성을 높이지만 보안상 상충 관계를 만든다. 상세한 요약은 정당한 사용자가 답변을 이해하는 데 도움이 된다. 동시에 경쟁 시스템을 학습시키는 누군가에게는 구조화된 합성 데이터가 될 수 있다.
세부 정보를 줄이는 것 역시 완전한 해결책은 아니다. 최종 답변에도 지식과 행동 정보가 남아 있다. 반복 질의는 수많은 과제 전반에서 선호도, 의사결정 경계, 코딩 스타일, 도구 선택, 수정 과정을 드러낼 수 있다.
추출 캠페인은 여러 신호를 결합할 수도 있다. OpenAI는 관찰된 파이프라인이 기본적인 사고 과정 수집을 넘어섰다고 의회 위원회에 밝혔다. 2026년 2월 서한에서는 합성 데이터 생성, 필터링, 강화학습 방식의 선호도 최적화를 설명했다.
이처럼 더 넓은 파이프라인은 단일 프롬프트보다 중요하다. 공격자는 문제를 생성하고, 해법을 수집하며, 출력을 평가하고, 약한 예시를 제거한 뒤 학생을 학습시킬 수 있다. 이어 학생의 실패를 활용해 다음 질의 묶음을 선택할 수 있다.
이것이 반복적 순환을 만든다. 대상 모델은 단계에 따라 교사, 데이터 생성기, 평가자 또는 보상 모델 역할을 한다. 각 역할은 가중치를 드러내지 않고도 가치를 이전할 수 있다.
요청이 정상적인 사용과 닮아 있을 때 탐지는 더 어려워진다. 개발자는 일반적으로 모델에 답변 채점, 코딩 문제 해결, 수학 설명을 요청할 수 있다. 보안 신호는 계정 간 관계, 시점, 규모, 반복되는 과제 구조에서 나타난다.
이것이 새로운 연구가 방어 측 질문을 바꾸는 이유다. 제공업체는 원시 사고 과정 텍스트가 표시되는지에만 집중할 수 없다. 일상적인 출력 조합이 체계적인 역량 이전을 어떻게 뒷받침하는지 살펴야 한다.
Anthropic의 주장은 연구 결과에 규모를 더한다
제공업체들이 실제 캠페인이 이미 산업 규모로 운영되고 있다고 말하기 때문에 연구소의 발견은 정치적으로 중요해진다.
Anthropic은 2월 DeepSeek, Moonshot AI, MiniMax와 연계된 캠페인을 식별했다고 밝혔다. Anthropic의 증류 조사에 따르면, 이 캠페인들은 약 2만4,000개의 부정 계정을 통해 1,600만 건이 넘는 Claude 대화를 생성했다.
이 수치는 Anthropic이 제시한 것이며, 아직 전체적으로 독립 감사를 거치지 않았다. 지목된 기업들은 Anthropic의 귀속 판단을 공개적으로 확인하지 않았다. 따라서 이는 제공업체의 내부 텔레메트리를 근거로 한 주장으로 취급해야 한다.
Anthropic은 IP 상관관계, 요청 메타데이터, 인프라 지표, 업계 파트너의 정보를 통해 결론에 도달했다고 밝혔다. 회사는 지역 제한을 우회하도록 설계된 조직적 계정과 프록시 서비스를 설명했다.
Anthropic은 DeepSeek 연계 활동에 15만 건이 넘는 대화가 관련됐다고 판단했다. 해당 요청은 추론, 채점, 정치적으로 민감한 응답 행동을 겨냥했다고 밝혔다. 일부 프롬프트는 완성된 답변 뒤의 단계별 추론을 Claude에게 재구성하도록 요청한 것으로 알려졌다.
Anthropic은 Moonshot AI와 340만 건이 넘는 대화를 연계했다. 회사는 이 활동이 에이전트형 추론, 코딩, 분석, 컴퓨터 사용, 비전을 겨냥했다고 말했다. 이후 단계에서는 추론 흔적을 재구성하려 했다는 주장도 제기됐다.
Anthropic에 따르면 MiniMax는 1,300만 건이 넘는 것으로 주장된 대화를 차지했다. 회사는 해당 요청이 에이전트형 코딩과 도구 오케스트레이션을 강조했다고 밝혔다. 또한 새 Claude 출시 직후 이 캠페인이 트래픽을 이동시켰다고 주장했다.
규모는 보안 모델을 바꾼다. 호기심 많은 단일 사용자가 프런티어 시스템을 재현할 가능성은 낮다. 하지만 수만 개의 조직화된 계정은 크고 다양한, 지속적으로 갱신되는 합성 데이터셋을 만들 수 있다.
계정 수는 운영자에게 회복력도 제공한다. 제공업체는 수집 시스템을 중단시키지 않고 하나의 계정을 차단할 수 있다. 프록시 서비스는 지역, 결제 방식, 사용 패턴 전반에 트래픽을 분산할 수 있다.
OpenAI도 유사한 주장을 제기했다. OpenAI는 의원들에게 자사 플랫폼에서 관측된 적대적 증류 활동의 대부분이 중국에서 비롯된 것으로 보이며, 일부 활동은 러시아와 연관돼 있다고 밝혔다. 특히 접근 제한을 우회하려는 DeepSeek 연계 시도를 언급했다.
이러한 주장은 최종적인 사법 판단이 아니라 기업의 평가에 남아 있다. 제공업체는 관련 로그, 탐지 시스템, 귀속 방법을 통제한다. 외부 연구자는 같은 텔레메트리에 접근하지 못하면 이러한 결론을 쉽게 재현할 수 없다.
중국은 더 넓은 서사를 부인했다. 4월 중국 외교부는 미국의 주장이 근거 없다고 일축하고, 워싱턴이 중국의 AI 성과를 훼손하려 한다고 비난했다. 중국 대사관도 협력과 지식재산권 보호를 강조했다.
이 견해 차이는 이 글의 핵심 대립 구도를 만든다. 즉, 역량 이전을 일상적인 엔지니어링으로 볼 것인가, 아니면 역량 추출을 무단 전유로 볼 것인가의 문제다. 같은 기술 워크플로도 접근 권한, 동의, 규모, 목적에 따라 두 설명 모두에 부합할 수 있다.
DeepSeek 자체 연구는 왜 이 구분이 어려운지를 보여준다. R1 연구는 추론 패턴을 더 작은 모델에 증류하는 과정을 공개적으로 설명했다. 그 결과물인 모델군은 고급 추론 행동이 더 접근하기 쉬운 시스템으로 이전될 수 있음을 보여주는 데 기여했다.
동료 심사를 거친 DeepSeek-R1 논문은 회사의 모델 개발 과정에서 강화학습과 증류를 문서화했다. 이 공개 연구는 DeepSeek가 무단으로 미국 모델의 출력을 사용했다는 사실을 입증하지는 않는다.
다만 추론 증류의 전략적 가치는 보여준다. 유능한 교사 모델은 특정 능력을 유지하는 더 작은 학생 모델을 만드는 데 도움이 될 수 있다. 이 학생 모델들은 더 낮은 추론 자원 요구사항으로 실행할 수 있고, 더 많은 개발자에게 도달할 수 있다.
미국 연구소들도 내부적으로 관련 기법을 사용한다. 이들의 이의 제기는 지식 증류 자체의 존재가 아니다. 경쟁사가 제한된 서비스를 통해 독점적 역량을 확보하고, 기만적인 접근 방식을 사용했다는 의혹에 관한 것이다.
이 때문에 서비스 약관은 핵심적이지만 충분하지는 않다. 계약은 경쟁 모델 학습, 자동화된 추출, 리버스 엔지니어링을 금지할 수 있다. 사용자가 중개자를 통하거나 제공업체의 관할권 밖에서 활동하면 집행은 어려워진다.
기술 연구는 이 문제를 더욱 선명하게 만든다. 일반적인 프롬프트로도 유용한 감독 신호를 회수할 수 있다면, 제공업체는 모델 가중치를 비공개로 유지하는 것만으로 우위를 안정적으로 보호할 수 없다. 반복 질의를 위해 설계된 서비스에 대한 접근 패턴을 감시해야 한다.
미중 경쟁은 모델 접근을 안보 정책으로 바꾸고 있다
워싱턴은 이제 무단 증류를 AI 기업 간의 단순한 계약 분쟁이 아니라 국가안보 사안으로 다룬다.
이 변화는 2026년 4월 명시적으로 드러났다. 백악관 메모는 주로 중국에 기반을 둔 외국 기관들이 미국 프런티어 모델을 겨냥해 의도적인 캠페인을 벌였다고 비난했다.
미 행정부는 탐지, 방어, 귀속, 제재 분야에서 AI 기업과 협력하겠다고 약속했다. 이 입장은 모델 추출을 첨단 컴퓨팅에서 미국의 우위를 유지하려는 더 넓은 노력과 연결한다.
의회도 유사한 방향을 추진해 왔다. 제안된 법안은 폐쇄형 미국 모델에서 핵심 기술 특성을 추출했다는 의혹을 받는 외국 행위자를 식별하는 절차를 만들게 된다. 가능한 대응에는 제재와 무역 제한이 포함된다.
이 접근 방식은 모델 역량을 전략 기술처럼 다룬다. 전통적인 수출 통제는 첨단 칩과 제조 장비에 대한 접근을 제한한다. 증류는 제한 대상 행위자가 원격 서비스를 통해 유용한 소프트웨어 역량을 확보할 가능성을 제기한다.
경제적 논리는 간단하다. 프런티어 모델을 학습하려면 칩, 에너지, 데이터, 엔지니어링 인력, 반복 실험이 필요하다. 기존 모델에 질의하면 그 비용의 일부를 제공업체에 전가할 수 있다.
성공적인 학생 모델에도 자체 기반 모델, 학습 인프라, 평가, 배포 스택이 필요하다. 증류는 답변을 동일한 경쟁자로 변환하는 버튼이 아니다. 그러나 비용이 많이 드는 시행착오를 줄일 수는 있다.
따라서 미국 정책 옹호자들은 적대적 증류를 컴퓨팅 통제를 우회하는 방법으로 묘사한다. 중국 조직은 해외 인프라를 이용해 학습 데이터를 생성하는 한편, 국내 컴퓨팅 역량은 다른 작업을 위해 남겨둘 수 있다.
이 주장은 해결되지 않은 측정 문제를 포함한다. 유사한 벤치마크 점수가 한 모델이 다른 모델을 복제했다는 증거는 아니다. 연구소들은 종종 겹치는 공개 데이터로 학습하고, 공통 연구 방법을 사용하며, 같은 평가를 목표로 최적화한다.
귀속에는 성능 유사성 이상의 것이 필요하다. 강력한 증거에는 계정 메타데이터, 결제 연결고리, 공유 인프라, 이례적인 질의 순서, 내부 문서, 또는 결과 모델에서 재현 가능한 시그니처가 포함될 수 있다.
제공업체들은 그러한 증거의 일부를 보유하고 있다고 말하지만, 상당 부분은 비공개로 남아 있다. 공공 정책은 독립적 검증보다 더 빠르게 움직이고 있다. 불투명한 플랫폼 텔레메트리에 근거한 제재는 명백한 적법절차 우려를 낳을 수 있다.
Google News 보도가 중요한 이유는 기술 연구가 그 증거 공백으로 끌려 들어갈 수 있기 때문이다. 추출이 가능하다는 연구 결과는 특정 기업이 이를 수행했다는 사실을 입증하지 않는다. 역량, 의도, 귀속, 법적 책임은 여전히 별개의 문제다.
추론 패턴에 대한 단순한 소유권 규칙도 없다. 저작권은 일반적으로 추상적 방법이 아니라 표현을 보호한다. 영업비밀 보호는 비밀성 및 부정 취득에 달려 있다. 계약법은 계약 내용과 관련 관할권에 달려 있다.
모델 출력은 각 범주를 더 복잡하게 만든다. 제공업체들은 문서, 소프트웨어, 분석, 제품에 재사용하도록 고객에게 이를 제공한다. 제한은 일반적으로 일상적인 후속 작업이 아니라 자동화된 수집이나 경쟁 모델 학습에 초점을 맞춘다.
집행은 정당한 연구에도 영향을 미칠 수 있다. 보안팀은 시스템이 추론을 유출하거나 민감한 행동을 노출하는지 시험해야 한다. 개발자는 프런티어 모델을 복제하려는 의도 없이 특화 도구를 만들기 위해 합성 데이터를 사용할 수 있다.
광범위한 탐지 시스템은 이러한 활동을 추출과 혼동할 위험이 있다. 수천 개의 평가 사례를 생성하는 연구자는 증류자처럼 보일 수 있다. 고객 콘텐츠를 평가하는 기업은 강화학습 데이터 수집처럼 보일 수 있다.
제공업체는 중대한 제재를 부과하기 전에 다층적 증거가 필요하다. 속도 제한과 계정 검토에는 더 낮은 기준을 적용할 수 있다. 공개 귀속, 제재 또는 형사상 주장은 더 강한 기준을 요구한다.
정책 분쟁은 오픈 웨이트 개발에도 미친다. 오픈 모델은 연구자가 가중치를 검토하고, 통제된 실험을 수행하며, 연구 결과를 재현할 수 있게 한다. 동시에 출력과 내부 추적을 로컬에서 수집할 수 있으므로 역량 이전도 더 쉬워진다.
오픈 릴리스를 제한한다고 API 추출이 해결되지는 않는다. 이는 더 많은 연구를 폐쇄형 제공업체 뒤로 옮기고 독립적 검증을 줄일 것이다. 따라서 워싱턴은 오픈 웨이트 개발을 지원하면서 독점 시스템의 무단 추출을 겨냥하려 해 왔다.
그 균형은 계속 불안정할 것이다. 더 강력한 오픈 모델은 미국 API에 대한 의존도를 낮추며, 이는 제공업체의 통제력을 약화할 수 있다. 그러나 오픈 릴리스는 국내 연구, 스타트업 경쟁, 투명한 보안 테스트도 확대한다.
실제 정책 선택은 오픈 대 폐쇄가 아니다. 이는 프런티어 제공업체가 체계적 재사용을 통제하면서 어느 정도의 접근을 제공할 수 있는지에 관한 문제다. 계약, 모니터링, 인터페이스 설계를 어떤 방식으로 조합해도 현재로서는 이 긴장을 완전히 해소하지 못한다.
연구가 여전히 입증하지 못한 것
증류 논쟁에서 가장 강한 주장은 독립 실험이 확립한 범위를 앞서간다.
첫째, REP 논문은 학생 모델 학습을 위해 상업용 프런티어 모델에서 추론을 추출하지 않았다. 저자들은 제공업체가 자동화된 추출과 경쟁 모델 개발을 제한하기 때문에 독점 시스템을 피했다.
그 선택은 윤리적으로 적절했지만 외적 타당성을 제한한다. 실제 운영 시스템에는 분류기, 숨겨진 프롬프트, 트래픽 모니터링, 계정 통제, 모델별 추론 인터페이스가 포함된다. 오픈 웨이트 실험실 환경은 이러한 방어를 모두 재현할 수 없다.
둘째, 노출된 추론이 반드시 진정한 추론은 아니다. 모델은 같은 답변에 대해 서로 다른 설명을 생성할 수 있다. 프롬프트 래퍼는 원래 숨겨진 추적을 회수하기보다 추론 경로를 바꿀 수 있다.
논문 자체도 이러한 가능성과 일치하는 신호를 보고한다. 더 강한 래퍼는 모델의 행동을 바꿀 수 있다. 프롬프트 조건에서 더 높은 유사성이 나타났다고 해서 고유한 내부 기록이 회수됐다는 증거는 아니다.
셋째, 후속 성능 향상이 광범위한 역량 탈취를 입증하지는 않는다. 학생 모델은 일부 벤치마크에서 개선될 수 있지만, 익숙하지 않은 영역 전반에서는 여전히 더 약할 수 있다. 증류는 일반적 역량보다 좁은 패턴을 더 쉽게 이전하는 경우가 많다.
벤치마크 오염도 또 다른 우려를 낳는다. 교사와 학생이 학습 중에 이미 관련 문제를 접했다면, 이후의 개선을 해석하기 어려울 수 있다. 연구자들은 신중하게 분리된 과제와 견고한 일반화 시험이 필요하다.
넷째, 어떤 공개 실험도 독점적 연구 비용을 얼마나 줄일 수 있는지 확립하지 못했다. 교사 모델에 질의하는 데도 비용이 든다. 수백만 개의 출력을 필터링하고 학생 모델을 학습하는 데도 상당한 인프라가 필요하다.
OpenAI의 사장 Greg Brockman은 7월 이 문제를 기술 경쟁으로 규정했다. 그는 제공업체가 응답 점수화, 합성 데이터 생성, 추론 회수 시도와 같은 패턴을 탐지할 수 있다고 말했다.
그 자신감은 탐지가 신뢰성 있게 작동한다는 증거로 읽혀서는 안 된다. 공격자는 요청량을 줄이거나, 작업을 분산하거나, 추출 트래픽을 일반 사용과 섞거나, 중개자에 의존할 수 있다. 방어자는 오탐과 불완전한 귀속에 직면한다.
Google은 전 세계 민간 부문 기관들로부터 빈번한 모델 추출 시도가 보고됐다고 밝혔다. 이 세부 사항은 이 이야기를 단순한 양자 갈등 이상으로 확장한다. 정치적 관심이 중국에 집중될 때도 역량 추출은 일반적인 경쟁 위협이다.
중국 연구소에 대한 초점은 일반적인 업계 관행을 가릴 위험도 있다. 미국 기업들은 데이터를 라이선스하고, 합성 사례를 생성하며, 내부 모델을 증류하고, 공개 연구에서 배운다. 논쟁의 경계는 기본 기술이 아니라 허가와 접근 권한이다.
양측 모두에 안전성 논거가 있다. 제공업체들은 증류된 시스템이 이에 상응하는 안전장치 없이 역량을 물려받을 수 있다고 경고한다. 주로 성능을 위해 학습된 학생 모델은 거부 응답, 모니터링 메커니즘, 배포 통제를 누락할 수 있다.
오픈 모델 옹호자들은 투명성이 독립적 시험과 더 넓은 접근을 지원한다고 반박한다. 또한 독점 연구소가 정당한 재사용을 일방적으로 정의해야 하는지 의문을 제기한다. 이러한 이견은 더 나은 분류기만으로 사라지지 않을 것이다.
가장 책임 있는 결론은 어느 정치적 서사보다 좁다. 추론과 유사한 출력에는 이전 가능한 가치가 담길 수 있다. 원시 chain-of-thought 텍스트를 숨긴다고 그 가치가 사라지지는 않으며, 체계적인 수집은 제공업체의 기술적 우위를 위협할 수 있다.
그 이상의 주장은 사안별 증거를 필요로 한다. 연구 방법 하나가 국가 차원의 캠페인을 입증하는 것은 아니다. 제공업체의 원격측정 데이터가 자동으로 법적 절도를 확정하는 것도 아니다. 강력한 벤치마크 성과만으로는 모델이 정확히 어디에서 능력을 습득했는지 알 수 없다.
이 검증 공백은 보도 전반에서 드러나야 한다. Indian Express의 질문은 답이 조건부이기 때문에 제기할 가치가 있다. 일부 추론 행동은 유도하고 전이할 수 있지만, 모델 전체를 훔친 텍스트 흔적으로 환원할 수는 없다.
증류 방어책의 효과를 보여줄 세 가지 신호
다음 단계는 더 강한 수사가 아니라 제공업체의 통제, 독립적 재현, 정부 표준을 통해 평가될 것이다.
첫 번째 신호는 독립 연구자들이 더 많은 아키텍처에서 REP를 재현하는지 여부다. 테스트에는 다양한 추론 모델, 다국어 작업, 코딩 에이전트, 짧은 요약만 반환하는 시스템이 포함돼야 한다.
연구자들은 성공에 대한 정의도 더 강화해야 한다. 추론 과정의 유사성, 답변 정확도, 학생 모델의 일반화는 서로 다른 결과를 측정한다. 정확한 추론 과정 복구를 막는 방어책도 유용한 행동 모방은 허용할 수 있다.
효과가 여러 모델과 낯선 작업 전반에서 지속된다면 재현은 이 논문의 보안 경고를 강화할 것이다. 결과가 약하거나 일관되지 않다면, 현재 방법이 선택된 아키텍처와 벤치마크에 크게 의존한다는 뜻일 수 있다.
두 번째 신호는 제공업체가 접근 통제를 어떻게 바꾸는지다. Anthropic은 이미 계정 클러스터링, 인프라 분석, 트래픽 분류, 파트너 인텔리전스를 설명하고 있다. OpenAI는 머신러닝과 사람의 검토를 결합한다고 말한다.
더 공격적인 방어책은 일반 개발자에게 영향을 미칠 것이다. 제공업체는 속도 제한을 낮추고, 더 강력한 신원 확인을 요구하며, 트래픽을 더 오래 보관하거나, 상세한 추론 요약을 제한할 수 있다. 각각의 변화에는 개인정보 보호, 비용 또는 사용성 측면의 절충이 따른다.
가장 유용한 증거는 운영 데이터가 될 것이다. 보안상 허용되는 범위에서 제공업체는 탐지 정밀도, 이의 제기 결과, 오탐률, 반복되는 공격자 적응 양식을 보고해야 한다. 이런 지표 없이는 단순한 혐의 제기 건수만으로 알 수 있는 것이 거의 없다.
세 번째 신호는 정부가 모델 추출 혐의에 대한 증거 기준을 만드는지 여부다. 백악관의 증류 메모는 정치적 의지를 보여주지만, 집행에는 귀속 절차가 필요하다.
신뢰할 만한 프레임워크는 서비스 약관 위반과 스파이 행위, 국가안보 위협을 구분해야 한다. 제재를 뒷받침하는 증거가 무엇인지, 영향을 받은 기업이 어떻게 대응할 수 있는지, 독립적 검토가 어떤 역할을 하는지를 명시해야 한다.
이 프레임워크는 정당한 상호운용성과 연구도 보호해야 한다. 모델 출력에서 학습하는 행위를 포괄적으로 금지하면 산업적 추출을 훨씬 넘어서는 결과를 낳는다. 이는 평가, 접근성 도구, 교육, 특수 목적 애플리케이션 개발을 제약할 수 있다.
개발자에게 즉각적인 교훈은 실용적이다. 숨겨진 사고 과정이 배포된 시스템을 추출에 강하게 만든다고 가정해서는 안 된다. 답변, 요약, 채점 결과, 도구 추적을 포함한 모든 출력 표면의 학습 가치를 평가해야 한다.
기업 구매자는 다른 질문을 던져야 한다. 제공업체가 프롬프트를 어떻게 보관하는지, 악의적 자동화를 어떻게 탐지하는지, 계정 정지를 어떻게 조사하는지, 고객 데이터와 보안 모니터링을 어떻게 분리하는지 알아야 한다.
지식 노동자도 이해관계를 갖고 있다. 더 엄격한 방어책은 공개되는 설명을 줄이고 고급 모델에 대한 접근을 어렵게 만들 수 있다. 또한 공유 계정을 통한 대규모 처리에 의존하는 통합 기능을 제한할 수도 있다.
더 폭넓은 Google News 독자층은 이 논쟁이 증거에 계속 기반을 두는지 지켜봐야 한다. 기술적 위험은 현실이지만, 정치적 언어는 연구가 입증한 범위를 앞지를 수 있다. 두 사실은 동시에 참일 수 있다.
결정적인 질문은 AI 모델이 비밀스러운 내적 독백을 유지하느냐가 아니다. 공개적인 상호작용이 경쟁 모델을 구축하는 비용을 낮출 만큼 충분히 구조화된 행동을 노출하느냐가 핵심이다.
현재 연구는 이 위험을 무시할 수 없다고 말한다. 제공업체의 주장은 그 유인이 이미 산업적 규모로 존재함을 시사한다. 아직 해결되지 않은 것은 누가 선을 넘었는지, 얼마나 많은 역량이 전이됐는지, 그리고 유용한 접근을 막지 않으면서 어떤 방어책이 효과를 내는지다.
독자들은 다음 재현 연구, 접근 정책 변경 또는 집행 조치를 그보다 좁은 사안의 증거로 봐야 한다. 강력한 모든 중국 모델이 복제됐다고, 또는 숨겨진 추론이 안전하게 숨겨져 있다고 가정하는 대신 그 신호들을 따라가야 한다.


