Altman과 Amodei의 AI 안전성 호소, UN에 닿았지만 각국은 여전히 단일 규칙집을 거부
Sam Altman과 Dario Amodei는 첨단 모델을 누가 관리해야 하는지를 둘러싼 깊은 이견에도 불구하고, 15개 안전보장이사회 이사국 앞에서 AI 안전성 캠페인을 제기했다. 9월 23일 회의는 OpenAI와 Anthropic을 국제 평화와 안보를 책임지는 유엔 기구 안으로 끌어들였다. 동시에 Altman과 Amodei의 AI 안전성 호소가 마주한 장애물도 드러냈다. 정부들은 위험이 국경을 넘는다는 점에는 동의하지만, 공동의 권한을 받아들이지는 않는다.
두 경영진이 외교관들에게 일반 챗봇을 규제해 달라고 요청한 것은 아니었다. 이들은 현재 개발 중인 가장 강력한 범용 시스템을 뜻하는 프런티어 AI에 초점을 맞췄다. 이들이 우려하는 것은 생물무기 제작을 돕거나, 사이버 공격을 수행하거나, 효과적인 인간 감독을 넘어 AI 연구를 가속할 수 있는 모델이다.
이 구분은 개발자, 기업, 공공기관 모두에게 사안의 중대성을 높인다. 글로벌 안전 표준은 모델의 시험, 출시, 모니터링, 민감한 시스템과의 연결 방식을 바꿀 수 있다. 그러나 회의는 구속력 있는 합의를 내놓지 못했고, 미국은 중앙집중적 국제 통제에 명시적으로 반대했다.
Altman과 Amodei의 AI 안전성 경고, 안전보장이사회로 향하다
이번 회의는 AI 안전성의 논의 장소를 바꿨지만, 이를 관리하는 규칙까지 바꾸지는 못했다.
OpenAI의 최고경영자인 Altman은 뉴욕에서 열린 안전보장이사회 회의에 참석했다. Anthropic의 최고경영자인 Amodei는 원격으로 이사회에 발언했다. Hugging Face CEO Clément Delangue와 컴퓨터 과학자 Yoshua Bengio도 참여했다.
안전보장이사회는 보통 전쟁, 제재, 핵 확산, 국가 간 위협에 집중하기 때문에 이번 참석은 이례적이었다. 안보리의 관여는 첨단 AI를 단순한 기술 정책 이슈가 아니라 잠재적인 국제 안보 문제로 규정했다.
UN briefing은 어느 한 국가도 단독으로 억제할 수 없는 위험이라는 점을 강조했다. 유엔 AI 독립 과학 패널 공동의장인 Bengio는 인간의 통제를 벗어난 시스템은 국경을 존중하지 않을 것이라고 경고했다.
Amodei는 두 가지 주요 위험 범주를 제시했다. 첫 번째는 고의적 오용으로, 생물테러범이 첨단 모델을 활용해 생물무기 개발을 지원받을 가능성을 포함한다. 두 번째는 모델의 능력이 개발자가 이해하거나 통제할 수 있는 속도보다 빠르게 발전하면서 발생하는 통제력 상실이다.
Associated Press에 따르면 Amodei는 이사회에 “잘못 관리된다면 AI는 인류 전체에 위험이 될 수 있다고까지 믿는다”고 말했다. Altman도 마찬가지로 직접적인 경고를 내놨다. “우리는 미래에 대한 통제권을 AI에 빼앗길 수 있습니다.”
두 회사가 갈수록 더 강력한 시스템을 계속 개발하고 출시하고 있다는 점에서 이러한 발언은 중요하다. 이들의 리더가 언급한 것은 정체를 알 수 없는 경쟁사가 만든 먼 미래의 기술이 아니었다. 이들은 자신들의 조직이 주도하는 프런티어 개발 경쟁과 연결된 위험을 논의하고 있었다.
두 회사는 국제 표준을 실질적인 출발점으로도 제시했다. 공동 평가를 통해 출시 전 위험한 능력을 측정할 수 있다. 공통의 사고 보고 체계는 모델이 예기치 않게 작동하거나 악의적 행위자가 시스템을 침해했을 때 정부에 경고할 수 있다.
자동화된 AI 연구에 대한 인간 감독도 또 다른 핵심 의제였다. 자동화된 AI 연구란 다른 모델을 설계, 학습 또는 개선하는 데 필요한 작업의 일부를 모델이 수행하는 것을 말한다. 이 과정은 인간 검토에 쓸 수 있는 시간을 줄이는 한편 개발을 가속할 수 있다.
OpenAI는 AI 지원 연구가 발전의 주요 동력이 될 것으로 예상한다고 밝혔다. 회사는 coordination plan에서 국제기구가 선도적인 AI 개발 노력을 조율하고 재앙적 위험을 줄이는 데 도움을 줘야 한다고 주장했다. 또한 안전성과 사회적 방어 체계가 역량 발전을 따라가지 못할 때 공동으로 속도를 늦추는 방안도 지지했다.
이 제안은 누가 개발 둔화를 발동할지, 어떤 모델이 대상이 될지, 국가들이 어떻게 준수 여부를 검증할지는 규정하지 않는다. 이러한 미해결 세부 사항은 광범위한 우려 표명과 강제력 있는 국제 시스템을 구분한다.
따라서 안보리 회의는 규제 합의가 아니라 제도적 인정을 의미했다. AI 경영진은 지정학적 결과를 초래하는 위협에 통상 할당되는 발언대를 얻었다. 정부들은 그들의 경고에 어떻게 대응할지에 대한 완전한 재량권을 유지했다.
글로벌 AI 안전성 협력이 갑자기 시급해진 이유
당면한 우려는 AI 개발 주기가 외교 기관이 공동 안전장치를 협상하고 집행하는 속도보다 빨라졌다는 데 있다.
이번 회의에 앞서 프런티어 개발의 속도를 조절하라는 일련의 공개 요구가 있었다. Amodei는 최근 안전 조치가 따라가지 못할 경우 기업과 정부가 역량 향상 속도를 늦춰야 한다고 주장했다. Altman과 다른 업계 리더들도 더 큰 조율에 대한 지지를 표명했다.
속도 조절이 반드시 AI 연구의 중단을 의미하는 것은 아니다. 이는 정의된 위험 조건 아래에서 역량 향상 속도를 제한하는 것을 뜻한다. 신뢰할 만한 정책에는 측정 가능한 기준, 외부 평가, 이를 무시하는 개발자에 대한 제재가 필요하다.
Anthropic은 현재 모델들이 기존 안전장치로 관리 가능한 수준이라고 말한다. 다만 시스템이 발전할수록 더 심각한 위험이 예상된다고 회사는 본다. Anthropic의 접근법은 출시 전 테스트, 외부 평가, 역량별 통제, 자발적 Responsible Scaling Policy를 결합한다.
이 정책은 모델이 위험한 능력을 보유했다는 증거에 따라 더 강력한 보호 조치를 연계한다. Anthropic은 배포 전에 모든 실패를 신뢰성 있게 감지할 수 없다는 점도 인정한다. 모델은 때때로 테스트 환경을 인식하기 때문에, 통제된 평가가 실제 행동을 충분히 대표하지 못할 수 있다.
Claude Opus 5.5의 출시는 이러한 긴장을 보여줬다. Anthropic은 사이버보안과 생물학 분야를 위한 확대된 행동 테스트와 안전장치를 설명했다. 그러나 회사는 safety assessment에서 모든 실패를 신뢰성 있게 감지하는 문제는 여전히 해결되지 않았다고도 밝혔다.
OpenAI도 같은 근본적 과제에 직면해 있다. 더 강력한 시스템은 안전성 연구자를 도울 수 있지만, 개발 일정을 압축할 수도 있다. 연구를 자동화하는 모델은 정렬 기법 발견을 도우면서 동시에 다음 학습 주기를 가속할 수 있다.
이러한 피드백 고리는 일반적인 제품 규제가 비교적 안정적인 기술을 전제로 한다는 점에서 정책 입안자들을 우려하게 한다. 입법자들은 제품 범주를 연구하고, 표준을 정의하고, 준수 여부를 점검할 수 있다. 자동화된 연구는 이 과정이 끝나기도 전에 기반 역량 자체를 변화시킬 수 있다.
위험은 연구실 밖으로도 확장된다. 기업들은 AI 에이전트를 코드 저장소, 내부 문서, 브라우저, 운영 소프트웨어에 점점 더 연결하고 있다. 시스템이 텍스트만 생성하는 것이 아니라 행동을 실행할 수 있을 때 모델 실패의 결과는 더 커진다.
조직 인프라에 접근할 수 있는 에이전트는 코드를 수정하거나, 민감한 기록을 가져오거나, 거래를 시작할 수 있다. 이러한 시스템에는 권한 통제, 감사 기록, 신뢰할 수 있는 인간 에스컬레이션 절차가 필요하다. 또한 의사 결정과 근거 자료를 검토하기 위해 정확한 AI knowledge base를 유지하는 팀도 필요하다.
하나의 모델이 여러 관할권의 사용자에게 서비스를 제공할 때 국제적 차원이 드러난다. 한 국가에서 발견된 심각한 취약점은 다른 지역의 고객에게 영향을 줄 수 있다. 탈취된 모델 역시 원래 개발자의 안전장치 밖에서 수정·재배포될 수 있다.
생물학적 오용은 더욱 어려운 조율 문제를 제기한다. 한 시장에서의 접근 제한은 비슷한 시스템이 다른 곳에서 제한 없이 제공된다면 효과가 제한적이다. 효과적인 통제를 위해서는 평가, 신뢰할 수 있는 사용자, 보고 의무에 관한 합의가 필요하다.
사이버보안도 유사한 이중용도 갈등을 낳는다. 첨단 시스템은 방어자가 소프트웨어 취약점을 찾고 더 빠르게 수정하도록 도울 수 있다. 같은 역량은 공격자가 표적을 찾고, 익스플로잇을 생성하고, 침투 캠페인을 자동화하는 데에도 쓰일 수 있다.
따라서 국가들은 두 방향에서 압박을 받는다. 너무 느리게 움직이면 위험한 역량이 관리되지 않은 채 남을 수 있다. 단독으로 행동하면 국내 기업에 불리해지거나 통제가 약한 관할권으로 개발이 이동할 수 있다.
이러한 압박은 Altman과 Amodei가 개별 국가의 고립된 금지 조치가 아니라 협력을 강조한 이유를 설명한다. 이들의 주장은 정부들이 경제적·군사적으로 경쟁하더라도 프런티어 위험은 공동의 문제라는 것이다.
협력을 위해 민감한 정보를 공개해야 할 때 이 제안은 훨씬 더 어려워진다. 정부들은 사이버 작전, 생물학적 방어, 군사 시스템에 관한 정보를 공유하는 데 저항할 것이다. 기업들은 독점 기술을 드러내는 모델 세부 정보를 공개하는 데 저항할 것이다.
실효성 있는 시스템은 더 위험한 모델을 구축하는 데 필요한 지식을 퍼뜨리지 않으면서 안전성을 조율해야 한다. 이 균형에는 정립된 설계가 없으며, 안보리 회의도 해답을 제시하지 못했다.
진짜 쟁점은 글로벌 표준 대 국가 통제
핵심 갈등은 첨단 AI가 위험을 제기하는지 여부가 아니라, 정부들이 그 위험을 함께 관리하기 위해 충분한 통제권을 내놓을 것인지에 있다.
미국은 회의에서 중앙집중적 글로벌 거버넌스 구조를 거부했다. 백악관 과학 고문 Michael Kratsios는 통제에 대한 우려가 개발을 멈추거나 새로운 국제 권한을 만들 이유는 아니라고 말했다.
이 입장은 최종 권한을 유엔에 두지 않으면서 국가적 책임과 기술 협력을 지지한다. 또한 미국이 AI 분야의 미국 리더십에 부여하는 전략적 가치를 반영한다.
중국은 유엔의 더 큰 역할을 지지하고, 첨단 역량이 소수의 국가나 기업에 집중되는 것에 경고해 왔다. 그러나 유엔 관여에 대한 지지가 검사, 모델 접근, 집행에 관한 합의를 보장하지는 않는다.
이 분쟁은 어려운 비대칭성을 낳는다. 정부들은 인간 통제, 투명성, 사고 보고와 같은 폭넓은 원칙을 지지할 수 있다. 하지만 그러한 원칙이 외부 검사관이나 국가 연구소에 대한 제한을 요구할 때는 더 신중해진다.
공통의 기술 용어는 하나의 가능한 가교가 될 수 있다. 국가들은 단일 규제기관에 합의하지 않고도 고위험 역량을 정의할 수 있다. 집행은 각국의 시스템에 맡긴 채 호환 가능한 테스트 방법을 마련할 수도 있다.
프런티어 평가는 모델이 고도화된 사이버 작전, 생물학 연구, 자율 복제 또는 AI 개발을 지원할 수 있는지를 시험하게 된다. 개발자는 표준화된 형식으로 지정된 국가 당국에 결과를 보고할 수 있다.
사고 통지는 또 다른 제한적 협력 형태를 제공한다. 미국과 중국은 국가 안보에 영향을 미치는 AI 사건을 위한 메커니즘을 논의한 것으로 전해진다. 이러한 채널은 글로벌 라이선스 기구를 만들지 않고도 기존 위기 소통 체계와 유사하게 작동할 수 있다.
이러한 조치들 역시 주요 질문을 남긴다. 정부들은 어떤 사건에 통지가 필요한지, 기업들이 얼마나 빨리 보고해야 하는지를 정의해야 한다. 또한 허위 보고, 전략적 은폐, 정치적 동기에 따른 비난에 대한 보호장치도 마련해야 한다.
검증은 가장 어려운 문제다. 한 국가는 자국 개발자들이 안전 임계값을 준수한다고 약속할 수 있지만, 경쟁국은 증거를 필요로 한다. 훈련 시스템에 대한 완전한 접근은 영업 비밀과 국가안보 정보를 노출할 수 있다.
모든 측이 신뢰한다면 제3자 평가기관은 이러한 긴장을 줄일 수 있다. 독립 시험 기관은 보안이 유지된 조건에서 특정 역량을 검토할 수 있다. 모델 가중치나 위험한 기술 세부 사항을 공개하지 않고도 위험 평가 결과를 발표할 수 있다.
그러나 평가기관에 대한 신뢰 자체가 정치적 문제다. 미국이 인정하는 연구소가 중국이나 러시아에 의해 인정받지 못할 수 있다. UN 연계 시험 기구는 중앙집중식 감독을 거부하는 정부들의 반발에 부딪힐 수 있다.
안전보장이사회에도 구조적 한계가 있다. 5개 상임이사국은 거부권을 보유하고 있으며, 군사·기술적 영향력을 두고 직접 경쟁한다. 구속력 있는 AI 체제는 무력 충돌, 제재, 사이버 작전을 두고 이미 이견을 보이는 국가들 간의 협력을 요구할 것이다.
그렇다고 외교가 무의미해지는 것은 아니다. 핵 위험 감소는 점진적 협정, 사찰 체계, 소통 채널을 통해 발전해 왔다. AI 거버넌스도 핵 군비 통제를 그대로 복제하지 않으면서 유사한 경로를 따를 수 있다.
AI는 기반 기술이 대부분 상업적이며 소프트웨어 기반이라는 점에서 다르다. 모델은 복제·변형되거나 클라우드 서비스를 통해 접근될 수 있다. 훈련 인프라는 대규모로는 눈에 띄지만, 배포된 소프트웨어는 핵물질보다 더 빠르게 확산될 수 있다.
오픈 웨이트 모델은 또 다른 갈등을 더한다. 이들의 파라미터는 내려받아 수정할 수 있어 연구와 더 폭넓은 접근을 지원한다. 같은 개방성은 출시 이후 중앙집중식 철회나 지속적 모니터링을 어렵게 만든다.
Delangue의 참여는 이 문제를 폐쇄형 모델 안전 의제와 나란히 놓았다. Hugging Face는 접근성, 연구, 분산형 개발을 중시하는 생태계를 대표한다. 이들의 존재는 몇몇 대형 연구소에 통제를 집중하는 것이 자동으로 가장 안전한 결과를 낳는다는 생각에 이의를 제기했다.
그 결과 정책 선택은 단순히 개방형 AI 대 폐쇄형 AI의 문제가 아니다. 정부는 널리 이용 가능한 모델의 오용 위험과 소수 민간 관문지기가 만들어내는 집중 위험을 비교해야 한다.
이것이 Altman Amodei AI 안전성 제안이 정부와 개발자 모두에 압박을 가하는 이유다. 국가는 조정을 위해 얼마나 많은 주권을 양도할지 결정해야 한다. 기업은 제품, 일정, 경쟁 전략을 제약할 수 있는 감독을 받아들여야 한다.
규칙을 요구하는 기업들이 여전히 경쟁을 주도한다
공개 감독을 요구하는 목소리는 OpenAI와 Anthropic이 그러한 제약이 상업적으로 불편해질 때에도 적용을 받아들일 때에만 신뢰할 수 있다.
두 회사는 더욱 유능한 모델 개발에 막대한 투자를 해왔다. 이들은 기업 고객, 개발자, 연구자, 컴퓨팅 역량, 전략적 정부 관계를 놓고 경쟁한다. 어느 한 조직이 경쟁사가 계속 나아갈 것이라고 판단하면 자발적 속도 조절은 실패할 수 있다.
이 인센티브 문제는 OpenAI와 Anthropic을 넘어선다. Google DeepMind, Meta, xAI, 중국 연구소, 그리고 신생 개발사들은 서로 다른 구조 아래 운영된다. 일부는 모델 가중치를 공개하는 반면, 다른 곳은 호스팅 제품을 통해 접근을 제한한다.
따라서 두 회사만 포괄하는 안전 협정은 영향 범위가 제한적일 것이다. 이는 두 회사의 관행을 개선할 수 있지만, 합의 밖의 기업들에 우위를 넘겨줄 수 있다. 신뢰할 수 있는 체계에는 기업 정체성과 무관하게 적용되는 역량 기반 규칙이 필요하다.
반독점법은 또 다른 복잡성을 제기한다. 선도 경쟁사 간 직접 조정은 담합 우려를 낳을 수 있다. 기업들이 개발 제한과 출시 일정을 논의하려면 정부 감독이나 공식적인 법적 면제가 필요할 수 있다.
그렇더라도 안전 조정은 기존 기업을 경쟁으로부터 보호할 수 있다. 대형 연구소는 소규모 개발사보다 평가, 보안, 보고 비용을 더 쉽게 감당할 수 있다. 기존 사업자가 작성한 규칙은 이들의 시장 지위를 보존하는 장벽이 될 수 있다.
이에 따라 비판자들은 프런티어 기업이 스스로의 감독 설계를 도와야 하는지 의문을 제기한다. 이들의 기술 전문성은 필요하지만, 재정적 이해관계도 피할 수 없다. 정부는 이 과정에 독립 과학자, 시민사회 단체, 보안 전문가, 소규모 개발자를 참여시켜야 한다.
기업들의 자체 안전성 주장도 신중하게 다뤄야 한다. Anthropic은 자사 테스트가 많은 심각한 위험을 포착한다고 말하지만, 전체 그림이 불완전하다는 점을 인정한다. OpenAI는 세계에서 가장 영향력 있는 모델 플랫폼 중 하나를 운영하면서 폭넓은 접근과 분산된 혜택을 지지한다.
외부 평가는 특정 주장을 시험할 수 있지만, 어떤 벤치마크도 시스템이 모든 환경에서 안전하게 유지될 것임을 증명할 수는 없다. 실제 배포에는 예상치 못한 프롬프트, 도구 접근, 사용자 행동, 다른 소프트웨어와의 상호작용이 수반된다.
장기간 실행되는 에이전트에서는 어려움이 더 커진다. 짧은 실험실 평가는 모델이 며칠에 걸친 작업 동안 어떻게 행동하는지 드러내지 못할 수 있다. 에이전트가 코드를 작성하고 외부 서비스를 호출하며 작업을 위임하는 과정에서 작은 오류가 누적될 수 있다.
따라서 조직은 모델 평가를 안전 인증서가 아니라 하나의 통제 계층으로 다뤄야 한다. 권한 경계, 인간 검토, 모니터링, 종료 절차는 여전히 필수적이다. 팀은 에이전트가 무엇을 시도했고 어떤 데이터에 접근했는지를 보여주는 기록도 필요하다.
군사적 사용을 둘러싼 논쟁은 또 다른 시험대가 된다. 정부는 정보 분석, 사이버 작전, 계획 수립, 자율 시스템을 위해 고도화된 모델을 원한다. 기업은 국방 당국이 작전상 필요와 양립할 수 없다고 보는 제한을 부과할 수 있다.
Anthropic은 대규모 국내 감시와 적절한 안전장치 없는 완전 자율 무기에 자사 모델을 사용하는 것에 공개적으로 반대해 왔다. 이 회사는 현재의 프런티어 시스템이 의미 있는 인간 통제 없이 표적을 선택하고 공격하기에 충분히 신뢰할 수 없다고 말한다.
이 입장은 안전 원칙이 정부 조달과 어떻게 충돌할 수 있는지를 보여준다. 국가안보 기관은 광범위한 합법적 사용을 요구할 수 있는 반면, 개발사는 일부 활용이 여전히 용납될 수 없다고 주장한다.
국제 표준은 이러한 이견을 더욱 증폭시킬 것이다. 국가들은 합법적 감시, 정당한 군사행동, 충분한 인간 감독에 대해 하나의 정의를 공유하지 않는다. 한 관할권에서 시민의 자유를 보호하는 규칙이 다른 곳에서는 외국의 간섭으로 거부될 수 있다.
기업들은 속도 조절이 운영 측면에서 무엇을 의미하는지도 설명해야 한다. 훈련 실행을 미룰 것인가, 배포를 연기할 것인가, 도구를 제한할 것인가, 아니면 완성된 모델에 대한 접근을 제한할 것인가? 각 선택은 위험에 서로 다른 영향을 미친다.
공개 출시를 늦춘다고 해서 반드시 내부 개발까지 늦춰지는 것은 아니다. 호스팅 제품을 제한한다고 해서 도난이나 독립적 복제를 막을 수 있는 것도 아니다. 하나의 역량을 중단하면 유사한 결과를 낳는 다른 경로로 연구가 전환될 수 있다.
의미 있는 약속에는 발동 조건, 측정 가능한 대응, 독립적 검증이 필요하다. 개발을 언제 재개할 수 있는지 설명하는 종료 조건도 필요하다. 이러한 요소가 없으면 속도 조절은 집행 가능한 안전 메커니즘이 아니라 원칙에 머문다.
따라서 회의론은 정당하지만, 경고 자체를 무효화하지는 않는다. 기업은 재정적 인센티브를 지니면서도 실제 기술적 위험을 식별할 수 있다. 정책 과제는 내부 지식을 내부자만 통제할 수 없는 규칙으로 전환하는 것이다.
AI 안전 협력이 작동하기 위해 필요한 것
실용적인 합의는 보편적 AI 규제기관을 만들지 않으면서 정부가 검증할 수 있는 좁은 범위의 기술적 의무에서 시작해야 한다.
첫 번째 의무는 표준화된 역량 평가여야 한다. 국가들은 모델이 정교한 사이버 공격, 생물학적 오용, 자동화된 AI 연구를 지원하는지 시험하기 위해 동일한 정치 체제를 가질 필요는 없다.
시험은 공통 정의와 보안 절차를 사용해야 한다. 결과는 오용을 가능하게 하는 지침을 공개하지 않으면서 위험 수준을 식별해야 한다. 독립 평가기관에는 개발사의 주장에 이의를 제기할 수 있을 만큼 충분한 접근 권한이 주어져야 한다.
두 번째 의무는 의무적 사고 보고여야 한다. 개발사는 심각한 모델 도난, 무단 복제, 격리 실패, 위험한 행동을 정해진 기간 내에 공개해야 한다.
보고 규칙은 일반적인 제품 오류와 국제 안보에 영향을 미치는 사건을 구분해야 한다. 소비자 챗봇의 잘못된 답변은 시스템이 인프라를 자율적으로 악용하는 것과 동등하지 않다.
공통 사고 분류 체계는 규제기관이 기업과 국가 전반의 사건을 비교하는 데 도움이 될 것이다. 이는 심각도, 영향을 받은 역량, 모델 접근, 인간 개입, 국경 간 피해 가능성을 설명할 수 있다.
세 번째 의무는 자동화된 AI 연구를 다뤄야 한다. 개발사는 모델이 모델 설계, 평가 생성, 훈련 코드, 연구 계획에 기여하는 시점을 문서화해야 한다. 프런티어 역량을 실질적으로 가속하는 행동에는 인간 승인이 의무적으로 유지돼야 한다.
이 요건은 Altman과 Amodei가 우려하는 피드백 루프를 다룬다. 이는 AI 보조 연구를 금지하지는 않을 것이다. 대신 기업이 인간이 충분히 감사할 수 없는 과정에 의존하게 되기 전에 가속을 가시화할 것이다.
네 번째 의무는 모델 인프라를 보호해야 한다. 공격자가 가중치를 훔치거나 배포 시스템을 침해하거나 대규모 질의를 통해 역량을 추출할 수 있다면 안전 정책의 가치는 거의 없다.
보안 요건은 직원 접근, 자격 증명 관리, 컴퓨팅 환경, 외부 테스트, 대응 계획을 포괄할 수 있다. 가장 엄격한 통제는 정해진 역량 임계값을 넘는 모델에 적용돼야 한다.
다섯 번째 의무는 주요 강대국 간 신뢰할 수 있는 소통 채널을 구축해야 한다. 정부는 민감한 운영 세부 사항을 공개하지 않고도 심각한 AI 사고를 서로 통지할 방법이 필요하다.
이러한 채널이 정치적 분쟁을 해결하지는 못할 것이다. 그러나 AI 기반 사이버 사건이나 모델 실패가 의도적인 국가 공격으로 오인되는 일은 막을 수 있다.
이러한 의무를 중심으로 구축된 제한적 합의는 워싱턴이 거부한 세계적 권위기관과는 다를 것이다. 국가 규제기관은 공유된 기술 표준을 활용하면서 국내 준수를 집행할 수 있다.
이 연합형 모델도 회피 문제에 직면한다. 개발사는 규칙이 약한 관할권에서 훈련하거나 계열사 간에 업무를 분할할 수 있다. 클라우드 제공업체는 대규모 훈련 고객에게 보안 및 보고 요건을 적용함으로써 도움을 줄 수 있다.
프런티어 훈련에는 상당한 인프라가 필요하므로 컴퓨팅 거버넌스는 영향력을 제공한다. 그러나 알고리즘이 개선되면 컴퓨팅 임계값은 낡아질 수 있다. 규칙은 하드웨어 사용량에만 의존하지 않고 역량을 고려해야 한다.
오픈 모델은 별도의 접근이 필요하다. 모든 오픈 개발을 제한하면 정당한 연구를 억누르고 권력을 집중시킬 수 있다. 고역량 출시를 무시하면 배포 이후 안전장치를 갱신하는 일은 불가능해질 것이다.
계층화된 접근법은 폭넓게 유용한 모델과 입증된 위험 역량을 지닌 시스템을 구분할 수 있다. 부담은 개발사의 규모나 사업 모델이 아니라 위험의 증거에 따라 커져야 한다.
이 원칙은 소규모 기업도 보호한다. 준수 요건은 심각한 외부 위험을 만드는 행동에 초점을 맞춰야 한다. 일상적인 소프트웨어 제품이 프런티어 연구소와 같은 의무를 떠안아서는 안 된다.
글로벌 대표성도 중요하다. 많은 국가는 선도 모델이나 주요 컴퓨팅 인프라를 통제하지 않으면서도 AI 서비스를 소비한다. 이들 역시 노동시장 교란, 정보 조작, 사이버 위험, 해외 제공업체 의존에 직면한다.
프런티어 연구소를 운영하지 않더라도 이들 국가는 표준 논의에 참여할 필요가 있다. 그렇지 않으면 AI 거버넌스는 시스템이 다른 모든 사람에게 영향을 미치는 몇몇 기업과 강대국 간의 합의가 된다.
유엔은 유일한 규제 기관이 되지 않으면서도 그러한 논의의 장을 제공할 수 있다. 유엔의 과학 패널은 증거를 종합할 수 있고, 외교 기구는 소통 규범을 마련할 수 있다. 집행 권한은 각국 기관이 유지할 수 있다.
이러한 체계는 글로벌 라이선스 기관보다 덜 극적이다. 그러나 단기적으로는 더 현실적이다. 안전보장이사회 회의는 각국 정부가 공동 통제를 수용하기 전에 공동 위험을 논의할 의향이 있음을 보여줬다.
유엔 호소의 의미를 가늠할 세 가지 신호
다음 시험대는 연설이 검증 가능한 약속으로 이어질지, 아니면 경고 뒤에 더 빠른 모델 출시가 이어지는 또 다른 순환으로 끝날지다.
첫 번째 신호는 최전선 연구소들 간의 서면 합의다. 이 합의는 역량 임계값, 독립적 평가, 그리고 모델이 해당 임계값을 넘었을 때 필요한 대응을 정의해야 한다.
책임 있는 AI를 지지한다는 성명만으로는 큰 의미가 없다. 실질적인 협약이라면 기업이 훈련을 늦출지, 배포를 제한할지, 또는 외부 테스트를 확대할지를 명시해야 한다. 또한 누가 준수 여부를 검증하는지도 밝혀야 한다.
OpenAI, Anthropic, Google DeepMind, xAI, Meta 및 주요 중국 개발사들이 양립 가능한 약속을 채택한다면, 안전보장이사회의 호소는 신뢰를 얻게 된다. 자발적 표현에만 한정된 합의는 업계가 스스로 조율할 수 있다는 주장에 힘을 빼게 된다.
두 번째 신호는 사고 보고와 평가 기준에 관한 정부의 조치다. 미국은 국내 연구소에 고심각도 사건 보고를 의무화하기 위해 글로벌 규제 기관을 지지할 필요는 없다.
중국, 유럽연합, 영국 및 다른 AI 중심국들도 양립 가능한 요건을 채택할 수 있다. 이들 체계 전반의 정렬은 하나의 중앙집권적 권한 없이도 실질적인 국제 기준을 만들 수 있다.
서로 양립할 수 없는 국가별 규정은 정반대의 결과를 낳을 것이다. 개발사들은 업무를 규제가 덜 엄격한 관할권으로 돌릴 수 있고, 정부들은 유사한 위험에 대해 서로 다른 정보를 받게 된다.
세 번째 신호는 공식적인 미중 안전 채널이다. 세계를 선도하는 두 AI 강국은 칩, 인재, 모델, 군사 응용을 두고 경쟁한다. 국경을 넘는 최전선 위험을 다루는 어떤 체계에도 양국의 참여는 필수적이다.
심각한 AI 사고를 위한 통보 체계는 작지만 의미 있는 출발이 될 수 있다. 이는 전략적 경쟁국들이 더 광범위한 기술 경쟁과 일부 공동 위험을 분리할 수 있음을 보여줄 것이다.
그 채널을 만들지 못한다면 Altman과 Amodei의 AI 안전 캠페인이 지닌 한계가 드러날 것이다. 기업들은 내부 안전장치를 강화할 수 있겠지만, 지정학적 조율 문제를 스스로 해결할 수는 없다.
독자들은 경고 이후 기업들이 어떻게 행동하는지도 지켜봐야 한다. 더 명확한 임계값 없이 역량 출시가 빠르게 이어진다면 회의론은 더 깊어질 것이다. 외부 평가 확대와 투명한 사고 보고는 이들의 주장을 뒷받침할 수 있다.
기업들은 조약을 기다릴 필요가 없다. 에이전트 권한을 목록화하고, 의사결정 로그를 보존하며, 고영향 행동에는 인간 검토를 요구하고, 장애 복구를 시험할 수 있다. 이러한 조치는 글로벌 정책이 여전히 미정인 상황에서도 노출을 줄인다.
개발자들은 평가 기준과 보고 제안을 주시해야 한다. 이는 제품 설계를 바꿀 수 있기 때문이다. 최전선 연구소를 위해 도입된 요건은 흔히 클라우드 플랫폼, 기업 조달, 보험, 고객 감사를 좌우한다.
지식 노동자들도 관심을 가져야 한다. 안전 규정이 AI 시스템이 무엇에 접근하고 무엇을 할 수 있는지를 결정하기 때문이다. 강력한 통제는 일부 작업을 제한할 수 있지만, 민감한 업무 정보와 에이전트를 연결하는 일을 더 안전하게 만들 수도 있다.
유엔에서의 등장은 AI 안전 문제의 정치적 위상을 높였다. 그러나 누가 규칙을 작성하고, 누가 모델을 검사하며, 누가 감속을 명령할 수 있는지는 해결하지 못했다.
해결되지 않은 이 권한 문제가 이 이야기의 핵심 긴장이다. Altman과 Amodei는 고도화된 시스템이 기존 통제를 앞질러가기 전에 정부들이 협력해 달라고 요청했다. 정부들은 위험을 인정하면서도 각자의 권한을 지키겠다고 답했다.
앞으로 1~3개월이 이 간극이 좁혀질지를 보여줄 것이다. 연구소 협약, 양립 가능한 국가별 보고 규정, 미중 사고 채널을 주시해야 한다. 어느 것도 나타나지 않는다면, 이 연설들은 행동에 합의하지 못한 기관에 전달된 경고로 남을 것이다.



