중국 AI 안전 거버넌스 프레임워크 3.0, 에이전트와 통제에 초점
중국은 9월 14일 중국 AI 안전 거버넌스 프레임워크 3.0을 발표하며 3년간 세 번째 개정판을 내놓았다. 이 문서는 중국의 위험 기반 모델을 유지하면서도 AI 에이전트, 물리 세계와 연결된 시스템, 인간의 통제 상실 위험으로 관심을 옮긴다. AI가 답변을 생성하는 단계에서 행동을 수행하는 단계로 이동하고 있기 때문에 이러한 변화는 중요하다.
TC260으로 알려진 중국 국가사이버보안기술위원회는 지난에서 열린 중국 2026 국가사이버보안주간 개막식에서 이 프레임워크를 발표했다. 중국 국가인터넷정보판공실(CAC)이 개발을 지도했다.
이 발표는 새로운 법률이 아니며, AI 기업에 즉시 새로운 처벌을 부과하지도 않는다. 그 중요성은 다른 데 있다. TC260 프레임워크는 기술 표준, 테스트 관행, 분야별 지침, 그리고 규제기관이 개발자와 서비스 제공업체에 적용하는 기대 수준을 형성할 수 있다.
버전 3.0은 프레임워크가 더 폭넓은 사회적·윤리적 위험을 추가한 지 1년 만에 나왔다. 중국은 이제 도구를 사용하고, 파일에 접근하며, 다른 서비스와 통신하고, 직접적인 감독 없이 더 많은 행동을 할 수 있는 시스템에도 같은 거버넌스 모델을 적용하고 있다.
여기서 핵심적인 긴장이 발생한다. 중국은 기업과 공공 서비스 전반에서 AI 도입이 확대되기를 원하면서도, 점점 더 자율화되는 시스템이 예측 가능하고 추적 가능하며 인간의 개입을 받을 수 있어야 한다고 요구한다.
중국 AI 안전 거버넌스 프레임워크 3.0의 변화
이 프레임워크는 더 나은 대화가 아니라 자율적 행동을 다음 AI 도입 주기의 핵심 안전 문제로 본다.
공식 프레임워크 발표에 따르면, TC260은 이전 판본의 세 가지 요소인 위험 분류, 기술적 대응책, 종합 거버넌스를 유지했다. 다만 이 구조 안의 위험 요소를 갱신하고 권고 대응책을 조정했다.
이러한 연속성은 중요하다. 버전 3.0은 중국의 기존 접근법을 폐기한 것이 아니다. 대신 더 광범위한 접근 권한, 더 긴 운영 기간, 채팅 창 밖에서의 더 큰 영향력을 가진 시스템에 동일한 접근법을 적용하려는 시도다.
문서는 AI 애플리케이션이 특수한 환경에서 주류 사용 영역으로 확산되고 있다고 설명한다. 업무 보조 도구, 개인 비서, 에이전트 기능을 갖춘 휴대전화를 사례로 든다. 또한 질문에 답하는 시스템과 작업을 수행하는 시스템을 구분한다.
AI 에이전트는 정보를 인식하고, 맥락을 유지하며, 의사결정을 내리고, 도구를 호출하고, 목표를 향한 단계를 실행할 수 있는 시스템이다. 이런 능력은 반복 업무를 줄일 수 있지만, 실패 가능성의 연쇄도 길어진다.
챗봇은 잘못된 답변을 생성할 수 있다. 에이전트는 사람이 실수를 알아차리기 전에 그 답변을 받아들여 서비스를 열고, 기록을 변경하고, 정보를 전송하거나, 다른 프로세스를 촉발할 수 있다.
이에 따라 버전 3.0은 에이전트 위험을 더 명시적으로 다룬다. AI 에이전트 위험 관리 부속서는 개발과 배포부터 운영 및 폐기까지 시스템의 전체 수명주기를 포괄한다.
프레임워크는 조직이 에이전트가 무엇을 읽는지, 어떤 지시를 신뢰하는지, 어떤 도구를 호출할 수 있는지, 그리고 그 행동이 사용자의 요청 범위 안에 머무르는지를 검토하도록 요구한다. 이는 결과물 자체뿐 아니라 결과물이 만들어지는 과정까지 다룬다.
이러한 구분은 안전성 평가 방식도 바꾼다. 에이전트가 보고서를 작성하는 과정에서 기밀 데이터를 노출했더라도 최종 보고서는 정확해 보일 수 있다. 악의적인 지시가 워크플로의 한 단계를 다른 방향으로 돌렸더라도 완료된 거래는 유효해 보일 수 있다.
프롬프트 인젝션은 이 문제를 잘 보여준다. 프롬프트 인젝션 공격은 AI 시스템이 처리하는 콘텐츠에 숨겨진 또는 기만적인 지시를 삽입한다. 웹페이지를 탐색하는 에이전트는 사용자가 승인하지 않았더라도 그러한 지시를 명령으로 해석할 수 있다.
프레임워크는 손상된 플러그인, 조작된 도구 응답, 과도한 권한, 신뢰할 수 없는 메모리에서 비롯되는 위험도 논의한다. 시스템이 확인 절차 없이 행동할 수 있을 때 각각의 취약점은 더 심각해진다.
피지컬 AI도 더 큰 주목을 받는다. 이 용어는 로봇, 차량, 산업 장비를 포함해 물리 세계를 감지하거나 영향을 미치는 기계와 연결된 AI를 포괄한다.
소프트웨어가 물리 장치를 제어할 수 있게 되면, 사이버보안 실패는 안전 사고로 이어질 수 있다. 조작된 지시는 이동, 생산, 출입 통제 또는 장비 작동에 영향을 줄 수 있다.
문서는 재귀적 개선과 자기 가속적 개발도 경계가 필요한 문제로 지목한다. 현재 시스템이 인간의 통제를 벗어났다고 주장하지는 않는다. 대신 더 빠른 자율 최적화는 지속적인 테스트와 감독이 필요하다고 본다.
그 결과, 새로운 운영 현실을 통해 설명되는 AI 안전 프레임워크가 만들어졌다. 모델의 행동은 여전히 중요하지만, 이제 권한, 도구, 연결, 메모리, 물리적 접근도 안전 경계 안에 포함된다.
중국이 AI 거버넌스 구상을 다시 업데이트하는 이유
3년 연속 연례 발표는 중국이 AI 거버넌스를 수년간 고정된 정책 문서가 아닌, 계속 변화하는 기술적 과정으로 본다는 점을 보여준다.
TC260은 2024년 9월 첫 번째 판을 발표했다. 해당 버전은 모델, 알고리즘, 데이터, 시스템, 사이버보안, 물리적 안전, 인지, 윤리와 관련된 위험을 체계화했다.
첫 번째 프레임워크는 여전히 이 시리즈를 규정하는 원칙을 수립했다. 포용적이고 신중하며 위험 지향적이고 협력적인 거버넌스를 요구하는 동시에 혁신을 우선시했다.
버전 2.0은 2025년 9월 15일에 뒤따랐다. 원래 구조를 유지하면서도 광범위한 AI 사용을 통해 발생하는 더 넓은 파급효과를 의미하는 파생 위험 범주를 추가했다.
이러한 위험에는 고용, 사회 구조, 자원 수요, 교육, 인간관계, 환경에 미치는 영향이 포함됐다. 두 번째 판은 신뢰할 수 있는 사용과 통제 상실 방지라는 원칙도 더 명확히 추가했다.
두 번째 프레임워크에 관한 공식 논평은 이 문서가 14개의 종합 거버넌스 조치와 4개의 안전 지침을 담고 있다고 밝혔다. 또한 과학기술 윤리를 AI 수명주기 안에 더 확고히 위치시켰다.
버전 3.0은 또 다른 분류 체계를 만드는 대신 이 기반 위에 구축됐다. 발표 시점은 배포 대상이 얼마나 크게 변화했는지를 반영한다.
과거 많은 생성형 AI 제품은 고립된 인터페이스로 작동했다. 사용자가 프롬프트를 입력하면 모델이 텍스트를 반환하고, 다음 행동은 사람이 결정했다. 이러한 분리는 사라지고 있다.
이제 에이전트는 내부 문서를 검색하고, 소프트웨어 인터페이스를 호출하고, 코드를 작성하고, 브라우저를 조작하고, 메시지를 준비하며, 여러 단계의 작업을 조율할 수 있다. 제한적인 자율성조차 인간의 점검 지점 사이에서 시스템이 내리는 결정의 수를 늘린다.
중국의 2026년 정책 작업은 이미 그러한 변화를 시사했다. 5월 CAC, 국가발전개혁위원회, 공업정보화부는 AI 에이전트에 대한 이행 지침을 발표했다.
에이전트 지침은 에이전트를 자율적 인식, 기억, 의사결정, 상호작용, 실행 능력을 갖춘 시스템으로 정의한다. 또한 연구, 산업, 소비자 서비스, 공공복지, 사회 거버넌스에 걸친 19개 적용 시나리오를 제시한다.
이 문서는 안전성, 통제 가능성, 표준화된 개발을 강조하면서도 도입을 장려한다. 프레임워크 3.0은 같은 방향성을 둘러싼 더 광범위한 위험 관리 계층을 제공한다.
따라서 이번 업데이트는 연례 정책 유지보수 이상의 의미를 갖는다. 중국은 에이전트가 민감한 분야 전반의 일상적 인프라가 되기 전에 안전 기대치를 확립하려 하고 있다.
프레임워크는 정부, 금융, 교육, 방송, 의료, 긴급 관리 분야를 분야별 지침이 필요한 영역으로 지목한다. 하나의 수평적 규칙으로는 이러한 환경에서 실패가 초래하는 서로 다른 결과를 포괄할 수 없다.
신뢰할 수 없는 쇼핑 보조 도구는 고객의 시간을 낭비할 수 있다. 반면 신뢰할 수 없는 의료 또는 긴급 관리 시스템은 건강, 공공 자원 또는 즉각적인 안전과 관련된 결정에 영향을 줄 수 있다.
이에 따라 중국의 AI 거버넌스는 일반 원칙과 더 좁은 범위의 표준 계획을 결합한다. 프레임워크는 위험을 설명하고, 후속 표준은 그중 일부를 감사기관과 테스트 조직이 평가할 수 있는 요구사항으로 전환할 수 있다.
이 계층적 구조는 모든 구속력 있는 규칙을 다시 작성하지 않고도 정책을 변경할 수 있게 한다. 규제기관은 시스템 행동이 변화함에 따라 기술 지침을 업데이트한 뒤, 선택된 통제를 표준이나 분야별 규정에 편입할 수 있다.
기업에는 이러한 속도가 실질적인 부담을 만든다. 텍스트 모델을 위해 설계된 안전성 검토는 외부 도구를 사용하는 에이전트를 포괄하지 못할 수 있다. 하나의 배포를 위해 설계된 검토는 권한, 통합 또는 운영 규모가 변하면 불완전해질 수 있다.
버전 3.0은 민첩한 거버넌스를 통해 이 문제를 다룬다. 위험 평가는 애플리케이션 맥락, 시스템 지능, 배포 규모를 고려하고, 이러한 조건이 변할 때 함께 변화해야 한다.
연례 발표의 흐름은 정책 메시지를 분명하게 만든다. 기반 모델의 이름이 바뀌지 않았더라도, 더 유능한 시스템을 배포한다는 것은 안전성 검토를 다시 시작해야 함을 의미한다.
핵심 상충 관계는 혁신과 검증 가능한 통제 사이에 있다
중국은 조직이 유용한 에이전트를 배포하기를 원하지만, 자율성이 전체 작업 과정에서 제한된 상태로 유지된다는 점을 입증할 것을 기대한다.
프레임워크는 혁신을 우선순위로 설명하며, 규제 샌드박스를 포함한 통제된 실험을 지원한다. 규제 샌드박스는 당국과 개발자가 위험을 관찰하는 동안 선택된 제품이 제한된 조건에서 운영되도록 하는 제도다.
동시에 문서는 시스템이 인간의 통제 아래 유지되어야 한다고 요구한다. 에이전트가 도구와 중간 행동을 선택할 수 있게 되면, 이 두 목표는 자연스럽게 일치하지 않는다.
강하게 제한된 에이전트는 모니터링하기 쉽지만 유연성은 떨어진다. 광범위한 권한을 가진 에이전트는 더 많은 작업을 완료할 수 있지만, 더 넓은 공격 표면과 의도하지 않은 행동으로 이어지는 더 많은 경로를 만든다.
직장용 리서치 보조 도구를 생각해 보자. 이 도구는 내부 메모를 검색하고, 공개 웹사이트를 탐색하고, 기록을 비교하며, 추천안을 작성할 수 있다. 각각의 기능은 개별적으로 평가하면 합리적으로 보인다.
위험은 이들이 결합될 때 나타난다. 공개 페이지에는 에이전트에게 기밀 자료를 가져오라고 지시하는 숨겨진 명령이 포함될 수 있다. 광범위한 파일 접근 권한은 에이전트가 이를 따르도록 만들 수 있고, 외부 연결은 그 결과를 노출할 수 있다.
이러한 연쇄를 방지하려면 에이전트의 최종 텍스트를 필터링하는 것만으로는 부족하다. 개발자는 신뢰할 수 있는 지시와 신뢰할 수 없는 콘텐츠를 분리하고, 권한을 최소화하며, 도구 호출을 검증하고, 사후 검토를 위해 행동을 기록해야 한다.
프레임워크는 더 강력한 모니터링, 조기 경보, 긴급 대응, 테스트를 요구한다. 또한 개발자, 서비스 제공업체, 기술 기관이 참여하는 취약점 데이터베이스와 정보 공유 체계도 지원한다.
이러한 조치는 증거 기반 통제 모델을 지향한다. 기업은 시스템이 무엇에 접근했는지, 어떤 결정이 행동을 촉발했는지, 그리고 인간이 언제 이를 중단할 수 있었는지를 보여줄 수 있어야 한다.
그러한 기대는 개발자, 기업 구매자, 운영자에게 압박을 가한다. 개발자는 에이전트 아키텍처에 안전장치를 내장해야 한다. 구매자는 모델 제공업체의 안전성 주장에만 의존하지 말고 전체 배포 환경을 평가해야 한다.
운영자에게도 명확한 책임 경계가 필요하다. 모델 제공업체, 애플리케이션 개발자, 플러그인 공급업체, 클라우드 서비스, 고객이 모두 하나의 워크플로에 영향을 미칠 때 책임 소재는 분산될 수 있다.
Framework 3.0은 모델 및 알고리즘 개발자, 서비스 제공업체, 사용자 전반에 책임을 배분한다. 그러나 포괄적인 책임 선언만으로 복잡한 실패 이후의 분쟁이 자동으로 해결되는 것은 아니다.
공급망은 문제를 더욱 어렵게 만든다. 에이전트는 오픈소스 모델, 타사 검색 소프트웨어, 외부 API, 기업 데이터 시스템에 의존할 수 있다. 어느 한 구성 요소의 취약점도 최종 동작에 영향을 줄 수 있다.
이 프레임워크는 오픈 모델과 폐쇄형 모델이 서로 다른 위험을 지닌다는 점을 인정한다. 폐쇄형 시스템은 한 제공업체가 안전 메커니즘을 통제하기 때문에 외부 감사와 맞춤화에 제약을 둘 수 있다.
오픈 모델은 더 폭넓은 검토와 조정을 허용하지만, 안전장치가 제거되거나 우회될 수 있다. 업데이트가 수정되었거나 비공개로 배포된 모든 사본에 도달하지 못할 수도 있다.
어느 접근 방식도 거버넌스 업무를 없애지는 않는다. 폐쇄형 제공업체는 통제 수단에 관한 실질적인 근거를 제시해야 하며, 오픈 배포 환경에는 현지 테스트, 구성 관리, 보안 업데이트 계획이 필요하다.
같은 상충관계는 모델 정확성에서도 나타난다. 신뢰할 수 있는 근거로 뒷받침되지 않지만 그럴듯해 보이는 출력인 환각은, 에이전트가 이를 행동의 근거로 삼을 때 더 위험해진다.
팀은 출력 아래에 경고문을 추가하는 것만으로 이 문제를 해결할 수 없다. 권위 있는 근거를 요구하고, 근거 없는 행동을 차단하거나, 영향이 큰 결정을 사람에게 넘기는 메커니즘이 필요하다.
이러한 통제 수단은 속도를 낮추고 운영 비용을 더한다. 에이전트의 매력인 자율성을 제한할 수도 있다. 이것이 China AI Safety Governance Framework 3.0의 핵심적인 절충이다.
이 문서는 모든 시스템에 동일한 처우를 요구하지 않는다. 위험 등급화 접근법은 시나리오의 중요성, 시스템의 지능, 사용 규모를 고려한다.
이 접근법은 모든 곳에 최대 수준의 통제를 적용하는 것보다 실용적이다. 동시에 임계값에 관한 어려운 질문을 제기한다.
조직은 일반적인 보조 기능이 언제 고영향 에이전트가 되는지 결정해야 한다. 어떤 권한이 실질적 위험을 만들고 어떤 행동에 확인이 필요한지도 판단해야 한다.
프레임워크는 방향을 제시하지만, 많은 운영상 답변은 후속 표준, 부문별 규칙, 평가 방법에 좌우될 것이다. 그러한 기준이 마련되기 전까지 기업은 자사의 기술 환경 안에서 광범위한 원칙을 해석해야 한다.
프레임워크는 집행 가능한 규정집과 다르다
이 문서의 발표는 규제 우선순위를 시사하지만, 그 자체로 모든 AI 에이전트에 적용되는 완전한 컴플라이언스 기준을 수립하는 것은 아니다.
TC260은 중국의 국가 사이버보안 표준기구다. 해당 기구의 기술 문서는 규제, 조달, 평가, 공식 표준에 영향을 미칠 수 있지만, 법적 효력은 문서 자체와 그에 연계된 규칙에 따라 달라진다.
Framework 3.0은 거버넌스 지도로 이해하는 것이 가장 적절하다. 위험 범주를 식별하고 기술적·제도적 대응을 권고한다. 적용 가능한 법률이나 의무 표준을 대체하지는 않는다.
중국은 이미 일부 생성형 AI 서비스에 관한 구속력 있는 규칙을 보유하고 있다. 생성형 AI 서비스 임시 조치는 주로 중국 본토에서 대중에게 제공되는 서비스에 적용된다.
그 밖의 요건에는 알고리즘 신고, 보안 평가, 개인정보, 데이터 보안, 콘텐츠 거버넌스, 부문별 감독이 포함될 수 있다. 관련 의무는 제공업체, 서비스, 사용자, 배포 맥락에 따라 달라진다.
확정된 국가 표준은 유용한 대비 사례를 제공한다. 중국의 GB/T 45654-2025는 학습 데이터 안전, 모델 안전, 보호 조치를 포함한 생성형 AI 서비스의 기본 안전 요건을 다룬다.
영문 표준 번역본은 해당 표준이 신고, 등록, 테스트, 평가를 지원한다고 설명한다. 이는 제공업체에 적용되며 규제기관과 제3자 평가기관의 지침이 될 수 있다.
이 표준은 광범위한 프레임워크보다 더 구체적이다. 학습 데이터, 생성 콘텐츠, 모델 보안, 안전성 평가에 관한 절차를 논의한다.
그럼에도 외부 분석가들은 급속한 모델 경쟁 속에서 엄격한 조치가 얼마나 일관되게 집행될지에 의문을 제기해 왔다. 프레임워크 수준에 머무르는 권고안의 경우 이 불확실성은 더 크다.
Version 3.0은 잠재적인 기술 통제 상실에 대한 정기적인 테스트를 요구한다. 그러나 이 발표는 에이전트의 안전성을 판단하는 보편적 테스트 세트, 공개 점수, 단일 임계값을 제시하지 않는다.
통제 가능성, 신뢰할 수 있는 사용, 재앙적 위험과 같은 용어 역시 측정 가능한 정의가 필요하다. 이것이 없으면 두 조직이 매우 다른 안전장치를 적용하면서도 준수를 주장할 수 있다.
독립적 접근은 또 다른 미해결 문제다. 폐쇄형 모델은 외부 연구자가 내부 통제 수단을 검토하지 못하게 할 수 있다. 오픈 배포 환경은 수정과 재배포 이후 목록화하기 어려울 수 있다.
사고 투명성은 배포 전 테스트만큼 중요할 것이다. 기업은 정기 평가를 통과하더라도 새 도구를 통합하거나 시스템 지침을 변경한 뒤 실패를 겪을 수 있다.
AI 업계 전반에서 공개 보고는 여전히 고르지 않다. 비교 가능한 사고 데이터가 없으면 규제기관과 구매자는 실험실 환경 밖에서 어떤 통제 수단이 효과를 내는지 쉽게 판단할 수 없다.
프레임워크는 취약점, 결함, 위험, 사고에 관한 정보 공유를 권고한다. 유용한 보고 체계를 구축하려면 명확한 제출 규칙과 불완전한 공개를 막기 위한 보호 장치가 필요하다.
국경을 넘는 협력도 이 문서의 야심 찬 부분이다. Version 3.0은 글로벌 AI 거버넌스의 중심 채널로서 유엔을 지지하며 위기 관리 메커니즘을 촉구한다.
이 목표는 정치적·기술적 장애물에 직면한다. 각국 정부는 국가안보, 콘텐츠 규칙, 개인정보 보호, 지식재산권, 오픈 모델, 국가의 데이터 접근 허용 범위에 대해 서로 다른 입장을 지닌다.
위험한 역량에 대한 공통의 우려조차 증거에 관한 합의를 보장하지는 않는다. 국가마다 서로 다른 평가, 위협 모델, 공개 요건을 사용할 수 있다.
따라서 프레임워크의 국제적 표현은 글로벌 정렬의 증거가 아니라 정책적 입장으로 읽어야 한다. 그 영향력은 중국이 활용 가능한 테스트 방법을 공개하고 상호적인 기술 협력을 지원하는지에 달려 있다.
광범위한 안전성 언어가 소규모 개발자에게 장벽이 될 위험도 있다. 대기업은 법무팀, 감사, 레드팀 테스트, 모니터링, 사고 대응에 자금을 투입할 수 있다.
소규모 연구소는 특히 표준이 빠르게 바뀔 때 같은 기대를 충족하기 어려울 수 있다. 샌드박스와 공동 테스트 자원은 그 부담을 줄일 수 있지만, 접근성이 중요할 것이다.
회의적인 해석은 단순하다. Framework 3.0은 여러 신흥 위험을 정확히 식별하지만, 식별은 구현보다 쉽다.
그 실제 가치는 뒤따르는 표준, 평가, 보고 시스템, 집행 관행으로 측정될 것이다. 그러한 메커니즘이 없다면 통제 가능성은 검증된 속성이 아니라 목표로 남는다.
중국 AI 거버넌스는 이제 모델을 넘어 확장된다
정책의 경계는 데이터, 메모리, 도구, 인프라, 사용자, 물리적 장치를 포함한 전체 운영 환경을 점점 더 포괄하고 있다.
초기의 AI 거버넌스 논의는 흔히 학습 데이터셋과 모델 출력에 집중했다. 이 주제들은 여전히 중요하지만, 에이전트는 주변 시스템 또한 동등하게 중요하게 만든다.
개발자가 시스템 지침, 검색 소스, 메모리, 플러그인, 사용 가능한 도구를 바꾸면 모델의 동작도 달라질 수 있다. 기본 모델은 동일하게 유지되더라도 배포 환경에는 새로운 위험이 생길 수 있다.
이는 모델 평가만으로 에이전트 제품을 인증할 수 없음을 의미한다. 테스트는 조립된 시스템과 사람들이 이를 사용하는 조건을 포함해야 한다.
프레임워크는 연구, 개발, 배포, 운영, 폐기 전반에 걸친 안전 요건을 권고한다. 제품이 종료된 뒤에도 오래된 자격 증명, 저장된 메모리, 연결된 서비스가 노출된 상태로 남을 수 있으므로 폐기는 중요하다.
데이터 거버넌스는 여전히 핵심 관심사다. 이 문서는 적절한 경우 비식별화를 포함해 학습, 주석 작업, 사용, 출력 전반에서 개인정보를 보호할 것을 촉구한다.
또한 정부와 금융 같은 영역의 중요 데이터와 핵심 데이터를 강조한다. 특히 연결된 계정에서 권한을 상속받을 때, 이 부문에서 작동하는 에이전트는 인간 사용자보다 더 빠르게 정보 경계를 넘을 수 있다.
메모리는 또 다른 층위를 만든다. 지속적인 에이전트 메모리는 연속성을 개선할 수 있지만, 잘못되었거나 민감하거나 악의적으로 주입된 정보를 보존할 수도 있다.
안전한 배포 환경에는 에이전트가 무엇을 저장하는지, 정보를 얼마나 오래 보유하는지, 누가 이를 검토하거나 삭제할 수 있는지에 관한 규칙이 필요하다. 메모리는 사용자가 인지하지 못한 채 이후 행동을 형성하는 보이지 않는 기록이 되어서는 안 된다.
도구 거버넌스도 마찬가지로 중요하다. 개발자에게는 허용 목록, 권한 제한, 행동 미리보기, 거래 경계, 고영향 작업을 위한 강력한 인증이 필요하다.
하나의 워크플로가 가끔 상승된 권한을 필요로 한다는 이유만으로 에이전트에 영구적인 관리자 접근 권한을 부여해서는 안 된다. 임시적이고 작업별로 제한된 권한 부여는 실수나 공격에 따른 피해를 줄인다.
인간 감독 역시 정밀하게 설계되어야 한다. 사용자가 제안된 행동을 이해할 수 없거나 잦은 경고가 자동 승인을 유도한다면, 확인 상자는 별 효과가 없다.
효과적인 개입에는 시의적절하고 관련성 있는 정보가 필요하다. 사용자는 에이전트가 무엇을 하려 하는지, 어떤 데이터를 사용할지, 해당 행동이 어떤 결과를 낳는지 볼 수 있어야 한다.
로깅은 감독과 조사 모두를 뒷받침한다. 기록은 또 다른 통제되지 않는 민감 정보 저장소를 만들지 않으면서 도구 호출, 데이터 접근, 권한 변경, 모델 결정, 사람의 승인을 포착해야 한다.
프레임워크가 구현형 AI에 주목하면서 위험 수준은 한층 높아진다. 물리적 시스템에는 안전한 대체 상태, 환경적 한계, 통신이나 인지가 실패했을 때 작동을 중단하는 방법이 필요하다.
창고 로봇, 실험실 시스템, 연결 차량은 텍스트 기반의 거부 메커니즘에만 의존할 수 없다. 안전성은 소프트웨어, 하드웨어, 운영 절차, 물리적 통제 수단에 모두 존재해야 한다.
사이버보안팀 역시 이중 역할에 직면한다. 프레임워크가 인정하듯 AI는 코드 검토, 취약점 발견, 공격 탐지, 대응 조치를 자동화할 수 있다.
공격자도 같은 역량을 이용해 악의적 활동의 속도와 규모를 키울 수 있다. 에이전트 시스템은 직접적인 입력을 줄인 채 정찰, 익스플로잇, 데이터 처리를 연쇄적으로 수행할 수 있다.
이는 대응형 방어에서 지속적 모니터링으로 전환해야 한다는 압박을 만든다. 조직은 자사 에이전트의 행동을 평가하고 외부의 AI 지원 공격을 탐지해야 한다.
이처럼 넓어진 범위는 시장 전반에서 부상하는 일반적 교훈과 중국 AI 거버넌스를 일치시킨다. 안전성은 모델이 고립된 상태에서 무엇을 할 수 있는지뿐 아니라, 모델이 어떻게 연결되고 사용되는지에 달려 있다.
기업 구매자에게 이는 조달 질문을 바꾼다. 제품이 내부 기록에 접근하거나 거래를 시작할 수 있다면 벤치마크 점수와 모델 카드만으로는 충분하지 않다.
구매자는 에이전트가 어떤 도구에 접근할 수 있는지, 권한이 어떻게 부여되는지, 외부 콘텐츠를 신뢰할 수 없는 것으로 취급하는지, 행동을 어떻게 되돌릴 수 있는지를 물어야 한다.
또한 제공업체가 사고를 공개하고 독립적 테스트를 지원하는지도 물어야 한다. 세련된 인터페이스는 운영상의 근거를 대체할 수 없다.
지식 노동자들도 더 작은 규모에서 비슷한 과제에 직면한다. 연구를 정리하거나 보고서를 작성하는 보조 도구도 신뢰할 수 있는 출처 경계와 비공개 자료에 대한 명확한 처리 기준이 필요하다.
올바른 정보 관리 관행은 AI 안전의 일부가 된다. 팀에는 추적 가능한 출처, 의도적인 접근 제어, 그리고 각 업무의 결과에 상응하는 검토 절차가 필요하다.
그렇다고 자동화를 거부해야 하는 것은 아니다. 에이전트를 정해진 권한과 관찰 가능한 행동을 갖춘 워크플로의 참여자로 다뤄야 한다는 뜻이다.
Framework 3.0의 실효성을 보여줄 세 가지 신호
다음 단계는 또 하나의 원칙 선언이 아니라 측정 가능한 기준, 실제 사고 보고, 산업별 통제 수단에 달려 있다.
첫 번째 신호는 구체적인 에이전트 테스트 기준의 공개다. 이 기준은 프롬프트 인젝션, 도구 오용, 권한 상승, 메모리 훼손, 작업 통제 상실에 대한 평가 절차를 규정해야 한다.
명확한 테스트는 프레임워크의 신뢰도를 높일 수 있다. 개발자에게는 공동의 목표를 제시하고, 구매자는 유사한 근거를 바탕으로 안전성 주장을 비교할 수 있게 된다.
모호한 평가 언어는 이 결과를 약화할 것이다. 공급자마다 자체 테스트와 임계값을 선택한다면 시장에는 수많은 주장이 나오겠지만 비교 가능성은 거의 없을 것이다.
두 번째 신호는 실질적으로 작동하는 사고 및 취약점 보고 체계다. Framework 3.0은 개발자, 공급자, 기술 기관이 참여하는 데이터베이스와 정보 공유 메커니즘을 요구한다.
유용한 시스템이라면 분류 체계, 보고 기한, 시정 조치에 대한 기대 수준, 그리고 다른 주체들이 방어 체계를 개선할 수 있을 만큼의 익명화된 세부 정보를 공개해야 한다. 또한 경미한 오류와 심각한 보안 사고를 구분해야 한다.
일관된 보고는 당국이 관찰된 실패 사례를 바탕으로 통제를 갱신할 수 있게 하므로, 프레임워크의 민첩한 거버넌스 모델을 뒷받침할 것이다. 보고가 드물거나 접근하기 어렵다면 정책은 가정적 위험에 의존하게 된다.
세 번째 신호는 산업별 구현이다. 정부, 금융, 교육, 의료, 미디어, 긴급 대응 분야에는 자율성과 인간 검토에 서로 다른 기준이 필요하다.
산업별 지침은 어떤 에이전트 행동에 승인이 필요한지, 어떤 데이터 출처가 계속 제한되는지, 조직이 어떤 증거를 보관해야 하는지를 정의해야 한다. 조달 요건은 이러한 통제를 도입하는 초기 경로가 될 수 있다.
세부적인 산업별 규칙은 프레임워크가 국가 전략에서 운영 관행으로 옮겨가고 있음을 보여줄 것이다. 일반적인 지침만으로는 전문성이 고르지 않은 개별 조직에 핵심 결정을 맡기게 된다.
국제 공조도 주목할 만하지만, 이는 더 장기적인 시험대다. 위기 대응 프로토콜은 중대한 사고가 발생하기 전에 연락 창구, 증거, 기밀성, 대응 절차에 관한 합의를 필요로 한다.
가장 즉각적인 근거는 국내 구현에서 나올 것이다. 중국은 이제 3년 연속으로 세 가지 버전의 AI 안전 프레임워크를 공개했다.
이러한 속도는 관심을 보여주지만, 반복만으로 실효성이 입증되지는 않는다. 중요한 질문은 에이전트 배포가 더 확산되기 전에 최신 위험이 검증 가능한 요건으로 전환되는지 여부다.
개발자는 TC260의 업무 계획, 표준 초안, 공개 의견수렴 문서를 주시해야 한다. 기업 구매자는 규제 당국이 평가나 조달 과정에서 에이전트 통제를 언급하기 시작하는지 추적해야 한다.
지식 노동자는 제품 수준의 권한 변경에 주목해야 한다. 더 강력해지는 보조 도구는 파일, 계정, 커뮤니케이션, 비즈니스 시스템에 대한 접근 권한을 점점 더 요청하게 될 것이다.
China AI Safety Governance Framework 3.0은 분명한 판단을 제시한다. AI 안전은 더 이상 모델의 답변에서 멈출 수 없다. 사용자의 요청과 시스템의 행동 사이에 있는 모든 단계를 포괄해야 한다.
향후 1~3개월은 이 판단이 운영상의 세부 사항을 갖추는지 보여줄 것이다. 광범위한 원칙을 증거로 전환하는 에이전트 테스트 방법, 사고 공유 규칙, 산업별 통제를 살펴봐야 한다.
AI 보조 도구에 더 넓은 권한을 부여하기 전에 세 가지를 물어야 한다. 무엇에 접근할 수 있는가, 무엇을 변경할 수 있는가, 어떻게 중단시킬 수 있는가? 그 답은 통제 가능한 AI가 문서상에만 존재하는 것이 아니라 실제로 존재하는지를 보여줄 것이다.



