백악관 AI 사이버보안 테스트, 오픈 모델 제외
백악관은 사이버 역량을 갖춘 AI를 대상으로 한 자발적 테스트를 확정했지만, Google News 보도에 따르면 오픈 모델은 첫 검토 주기에서 제외될 전망이다. 이 같은 예외는 즉각적인 모순을 낳는다. 워싱턴은 소프트웨어 결함을 찾아내거나 악용할 수 있는 모델에 조기 접근하기를 원하지만, 다운로드 가능한 시스템은 여전히 이 체계 밖에 남는다.
이 정책은 미국 개발사의 고도화된 독점 모델에 초점을 맞춘다. 기업은 출시 전 최장 30일 동안 정부에 접근 권한을 제공할 수 있다. 이후 연방 평가관들은 해당 시스템이 해킹 및 기타 국가안보 역량에 관한 기밀 기준선을 넘는지 살펴보게 된다.
오픈 웨이트 AI 모델은 다른 경로를 따른다. 다운로드 가능한 파라미터 덕분에 조직은 개발사가 호스팅하는 서비스에 의존하지 않고 이를 실행하고 수정할 수 있다. 여러 보도에 따르면 새로운 백악관 AI 프레임워크는 실제 역량이 검토 대상인 독점 시스템에 근접하더라도 이들을 포괄하지 않는다.
이 구분은 OpenAI, Anthropic, Google을 정책 경계의 한쪽에 놓는다. Meta와 기타 오픈 모델 개발사는 다른 쪽에 더 가깝다. 쟁점은 단순히 오픈 개발과 폐쇄형 개발 중 어느 쪽이 더 안전한지가 아니다. 출시 방식이 어떤 고도화된 시스템이 정부의 검토를 받는지를 결정해야 하는지에 관한 문제다.
Google News 보도가 드러낸 제한적 테스트
이 프레임워크는 사이버 작전을 지원할 수 있는 모든 모델이 아니라, 제한된 범주의 고도화된 독점 모델을 평가한다.
도널드 트럼프 대통령은 2026년 6월 2일 연방 기관들에 프레임워크 마련을 지시했다. 관련 행정명령은 고도화된 사이버 역량을 측정하는 기밀 벤치마킹 절차를 요구한다.
이 벤치마크는 AI 시스템이 언제 “대상 프런티어 모델(covered frontier model)”이 되는지를 결정한다. 이 용어는 역량과 국가안보상 함의가 정부가 정한 기준을 충족하는 고도화된 모델을 뜻한다. 행정명령은 벤치마크나 기술적 평가 기준을 공개하지 않는다.
행정명령은 또한 정부가 공개 출시 전에 대상 모델에 접근할 수 있는 자발적 절차를 마련하도록 지시한다. 참여 개발사는 최장 30일간 접근 권한을 제공할 수 있다. 검토는 연방 당국자가 모델의 취약점 발견 능력, 침입 지원 능력, 방어적 사이버 업무 지원 능력을 이해하는 데 도움을 주도록 설계됐다.
백악관은 8월 시한까지 프레임워크를 완성했다고 밝혔다. 그러나 문서는 공개하지 않았다. 또한 어느 개발사가 공식적으로 참여에 동의했는지, 첫 검토가 언제 시작될지도 밝히지 않았다.
당국자들은 Meta, Anthropic, Google, Nvidia, OpenAI 관계자들과 프레임워크를 논의한 것으로 전해졌다. 이 논의를 통해 주요 개발사들은 정부가 아직 공개되지 않은 시스템을 어떻게 분류하고 다룰지 처음으로 살펴볼 수 있었다.
Axios가 보도한 프레임워크 세부 내용에 따르면, 대상 범주는 국가안보 위험을 제기하는 폐쇄형 최첨단 미국 모델로 한정된다. 이 보도는 직원들이 출시 전 검토 기간에 접근 제한을 받게 된다고도 전했다.
이러한 통제는 모델 접근 자체가 별도의 보안 문제를 만들기 때문에 중요하다. 아직 출시되지 않은 시스템을 제출하는 개발사는 지식재산, 내부 안전장치, 민감한 성능 데이터를 노출해야 한다. 정부는 의미 있는 테스트를 수행하는 동안 유출이나 무단 사용을 막아야 한다.
이 검토는 공식 인허가 프로그램으로 기능하지 않는다. 참여는 자발적으로 유지되며, 행정명령은 프레임워크가 사전 승인 요건이 되어서는 안 된다고 명시한다. 그럼에도 정부의 접근은 출시 일정, 고객 이용 가능 여부, 연방 기관과의 관계에 영향을 줄 수 있다.
그렇기에 “자발적”이라는 말의 실질적 의미는 더 불분명해진다. 정부 계약이나 규제 당국의 우호적 태도를 원하는 개발사에는 협력할 이유가 있다. 검토를 거부했다가 해당 모델이 이후 심각한 보안 사고에 기여할 경우, 주목을 받을 수 있다.
보도된 프레임워크 아래에서는 오픈 모델이 이 절차를 피한다. 이 예외가 이 글의 핵심 긴장을 만든다. 정부는 역량과 배포 모델을 모두 통해 위험을 정의하고 있지만, 어느 유형의 시스템이든 유용한 사이버 지원을 제공할 수 있다.
폐쇄형 AI 연구소가 즉각적인 압박에 직면한다
OpenAI, Anthropic, Google은 가장 역량이 높은 제품을 통제된 서비스를 통해 제공하기 때문에 운영상 부담을 떠안는다.
독점 모델은 일반적으로 개발사나 클라우드 파트너가 통제하는 인프라에 남아 있다. 고객은 애플리케이션 또는 프로그래밍 인터페이스를 통해 접근한다. 제공업체는 사용을 모니터링하고, 안전장치를 수정하며, 계정을 정지하고, 필요할 경우 모델을 철회할 수 있다.
이러한 통제 지점은 정부가 독점 시스템을 검토하기 쉽게 만든다. 당국자는 정해진 조건에서 안정적인 출시 전 버전을 테스트할 수 있다. 개발사 역시 평가관이 예상치 못한 행동을 연구하는 동안 접근을 제한할 수 있다.
동일한 통제 지점은 이들 기업을 압박하기도 쉽게 만든다. 호스팅 모델에는 식별 가능한 운영자, 출시일, 고객 접근 경로가 존재한다. 연방 당국자는 운영자에게 접근을 지연하거나 특정 사용자에 대한 새 기능 제공을 제한해 달라고 요청할 수 있다.
행정부는 이미 이런 압박이 배포에 어떤 영향을 미칠 수 있는지 보여준 바 있다. 출시 보도에 따르면 OpenAI는 정부 요청에 따라 GPT-5.6 Sol의 접근을 제한했다. 승인된 고객은 접근 권한을 받았지만, 더 폭넓은 이용 가능성은 제한된 상태로 남았다.
이 사례는 공식 권한과 운영상 영향력의 차이를 보여줬다. 정부는 출시 과정에 영향을 미치기 위해 포괄적인 AI 인허가법이 필요하지 않았다. 모든 접근 지점을 통제하는 기업에 국가안보 우려를 직접 제기할 수 있었다.
새 프레임워크는 이런 협상을 더 반복 가능한 절차로 전환한다. 대상 개발사는 어떤 경우에 모델이 검토 대상이 될지 알 수 있다. 기관들은 출시 시계가 시작되기 전에 평가관과 보안 환경을 준비할 수 있다.
그러나 프레임워크는 불확실성도 더한다. 벤치마크가 기밀이므로 외부인은 어떤 역량이 기준선을 넘는지 판단할 수 없다. 개발사는 비공개 지침을 받을 수 있지만, 고객, 연구자, 소규모 경쟁사는 분류를 독립적으로 평가할 수 없다.
30일의 기간은 또 다른 상충관계를 만든다. 고도화된 모델은 도구, 브라우저, 코드 환경, 외부 서비스를 통해 작동할 수 있으므로 한 달은 종합적인 보안 테스트를 하기에는 짧다. 동시에 대형 상업 출시에는 충분히 영향을 미칠 수 있는 기간이기도 하다.
정부가 평가를 진행하는 동안 기업은 직원 접근을 제한해야 할 수 있다. 이는 최종 테스트를 늦추고 출시 준비를 복잡하게 만들 수 있다. 따라서 가장 역량이 높은 독점 모델 개발사는 보안 의무와 일정상 위험을 모두 떠안는다.
Google은 특히 흥미로운 위치에 있다. 고도화된 모델은 OpenAI 및 Anthropic과 경쟁하는 한편, Google의 인프라는 서드파티 모델과 오픈 모델도 사용하는 기업들을 지원한다. Google News 보도는 이 회사를 모델 개발과 클라우드 배포 모두에 영향을 미치는 정책 논쟁의 중심에 놓는다.
Meta는 다른 계산에 직면한다. Meta는 주요 호스팅 플랫폼도 운영하지만, 다운로드 가능한 모델을 폐쇄형 서비스의 대안으로 홍보해 왔다. 오픈 출시가 계속 면제된다면, 그 모델 전략은 폐쇄형 경쟁사 대비 잠재적인 규제상 이점을 얻게 된다.
이 예외가 오픈 개발사가 어떤 검토도 받지 않는다는 보장은 아니다. 수출 통제, 조달 규칙, 사이버보안법, 산업별 요건은 여전히 적용될 수 있다. 다만 당장의 프레임워크는 출시 전 테스트 부담을 다른 곳에 둔다.
이 차이는 제품 전략에 영향을 줄 수 있다. 웨이트 공개 여부를 결정하는 연구소는 이제 안전성, 수익, 경쟁적 위치와 함께 규제 대우도 고려해야 한다. 출시 아키텍처가 정책 계산의 일부가 되는 셈이다.
오픈 웨이트 AI 모델이 정책의 역전을 만든다
출시 후 회수하기 가장 어려운 시스템들이 이 출시 전 절차에서는 워싱턴의 검토를 받지 않을 것으로 전해진다.
오픈 웨이트 AI 모델은 훈련된 시스템의 행동 상당 부분을 결정하는 다운로드 가능한 파라미터를 제공한다. 사용자는 모델을 로컬에서 실행하거나, 맞춤화하거나, 독립 호스팅 제공업체를 통해 배포할 수 있다.
오픈 웨이트가 항상 완전한 오픈 소스를 의미하는 것은 아니다. 개발사는 훈련 데이터, 전체 소스 코드, 상세한 개발 과정을 공개하지 않은 채 훈련된 파라미터만 공개할 수 있다. 정책 논쟁에서는 “오픈”이라는 표현이 여러 다른 형태를 가리키는 경우가 많으므로 이 구분은 중요하다.
모델 웨이트가 저장소와 사설 서버 전반으로 퍼지면 원개발사는 통제력의 상당 부분을 잃는다. 모든 사본을 확실히 제거하거나, 모든 배포를 조사하거나, 범용 안전 업데이트를 적용할 수 없다. 사용자들은 시스템 프롬프트를 수정하고 안전장치를 제거할 수도 있다.
이러한 특성은 악용을 확대할 수 있다. 악의적 운영자는 모니터링되는 기업 서비스에 의심스러운 요청을 계속 보낼 필요가 없다. 수정된 시스템을 비공개로 실행하고 계정 수준의 집행 없이 반복 시도를 자동화할 수 있다.
같은 특성은 정당한 보안 업무도 지원한다. 방어 담당자는 행동을 점검하고, 격리된 네트워크에 모델을 배포하며, 특수 소프트웨어에 맞게 조정할 수 있다. 소규모 기업은 독점 코드를 외부 모델 제공업체에 보내지 않고도 도구를 구축할 수 있다.
오픈 모델은 연구와 경쟁도 뒷받침한다. 독립 전문가들은 제공업체가 공개하지 않은 행동을 테스트할 수 있다. 개발자는 실패 사례를 연구하고, 실험을 재현하며, 대형 연구소가 간과한 언어나 기술 분야를 위한 모델을 만들 수 있다.
이런 이점과 위험의 혼합은 일률적 비교가 취약한 정책을 낳는 이유를 설명한다. 폐쇄형 모델은 오픈 대안보다 더 큰 원시 사이버 역량을 보유할 수 있다. 오픈 모델은 출시 후에도 사본이 남아 있기 때문에 더 큰 배포 위험을 만들 수 있다.
백악관 AI 프레임워크는 보도에 따르면 첫 번째 문제를 우선시한다. 기밀 기준선을 넘는 역량을 지닌 최상위 독점 시스템을 겨냥한다. 반면 되돌릴 수 없는 배포와 분산된 수정에 관한 두 번째 문제를 직접 해결하지는 않는다.
예외를 지지하는 측은 실무적 근거를 제시할 수 있다. 정부는 개발사가 출시 전 접근을 통제하는 비공개 모델을 검토할 수 있다. 곧 공개적으로 유통될 웨이트에 동일한 기밀 절차를 적용하기는 어렵다.
또한 추가 의무가 미국의 오픈 개발을 약화시킬 수 있다고 주장할 수도 있다. 미국 내 프로젝트는 중국 및 기타 시장의 저렴한 모델과 경쟁한다. 미국 출시물에만 검토 부담을 적용하면 개발자나 사용자가 해외 대안으로 이동할 수 있다.
비판론자들은 정반대의 문제를 본다. 출시 방식이 면제를 만든다면, 개발사는 웨이트를 공개함으로써 검토를 피할 수 있다. 이는 역량이 정부의 우려 기준선에 근접하더라도 가장 통제하기 어려운 배포 방식을 테스트의 우회로로 만들게 된다.
오픈 시스템이 개선될수록 이 구분은 더 어려워진다. 오늘 기준선 아래에 있는 모델도 공개 후 도구, 파인튜닝, 추가 컴퓨팅 자원을 얻을 수 있다. 특화된 에이전트 집합 역시 기본 모델의 최초 평가 범위를 넘어서는 작업을 수행할 수 있다.
보도된 규정은 이 면제가 변경될 수 있음을 인정하는 것으로 보인다. 당국은 오픈 모델의 역량이 발전함에 따라 이를 재검토할 수 있다. 그러나 동등한 수준에 도달할 때까지 기다리면 정책 공백이 생긴다. 정부가 정의를 업데이트하기 전에 공개 배포가 이뤄질 수 있기 때문이다.
이번 반전은 모델 연구소에만 영향을 미치지 않는다. 기업 구매자는 정부 심사가 신뢰의 신호인지, 아니면 특정 비즈니스 모델에 부과되는 의무에 불과한지 판단해야 한다. 조달팀은 심사를 거친 독점 시스템을 더 안전하다고 볼 수도 있고, 현지에서 통제하는 오픈 배포 방식을 선호할 수도 있다.
개발자들도 비슷한 선택에 직면한다. 호스팅 서비스는 빈번한 업데이트, 모니터링, 관리형 안전장치를 제공한다. 다운로드 가능한 시스템은 통제권과 맞춤화 가능성을 제공하지만, 보안 책임은 더 많이 운영자에게 넘어간다.
규제상의 차이는 이 기술적 선택을 왜곡할 수 있다. 팀은 위협 모델에 더 잘 맞아서가 아니라, 한 경로의 출시 제약이 더 적다는 이유로 모델을 선택할 수 있다. 그렇게 정책은 간접적으로 아키텍처를 형성한다.
프레임워크는 역량을 테스트하지만 측정 기준은 숨긴다
기밀 벤치마크는 민감한 사이버 기법을 보호할 수 있지만, 비공개성은 외부인이 해당 프레임워크가 적절한 시스템을 포괄하는지 판단하지 못하게 한다.
정부가 벤치마크 일부를 비공개로 유지할 정당한 이유는 있다. 공개된 테스트는 학습 목표가 될 수 있다. 개발자는 더 광범위한 오용 역량을 줄이지 않은 채 특정 과제를 통과하도록 모델을 최적화할 수 있다.
상세한 사이버 평가 역시 가치 있는 공격 기법을 노출할 수 있다. 공개되지 않은 취약점이나 현실적인 침입 경로를 포함한 벤치마크는 부주의하게 공개될 경우 공격자에게 도움이 될 수 있다.
따라서 기밀 지정은 정부의 선호만을 보호하는 것이 아니다. 평가 자체가 사용 설명서가 되는 일을 막을 수 있다. 또한 정보기관과 국방기관이 공개적으로 설명할 수 없는 시나리오를 시험하도록 할 수 있다.
그 대가는 제한적인 책임성이다. 연구자들은 벤치마크가 현실적인 위협을 측정하는지 검토할 수 없다. 소규모 연구소는 보이지 않는 기준점에 대비할 수 없다. 대중은 경쟁 개발사에 대한 대우를 비교할 수 없다.
이 불투명성은 어떤 모델이 자격을 갖추는지에 대한 Google News 보도도 복잡하게 만든다. 기자들은 비공개 브리핑과 기업 반응을 설명할 수 있지만, 기밀 점수를 독립적으로 재현할 수는 없다. 독자는 그 배경의 기술적 근거 없이 정책 결과만 접하게 된다.
공개되지 않은 프레임워크는 두 번째 불확실성 층을 더한다. 행정명령은 공개돼 있지만, 운영 규정은 그렇지 않은 것으로 전해진다. 모델 접근 처리, 테스트 실패 해결, 결과 전달에 관한 중요한 세부 사항은 여전히 확인할 수 없다.
모델이 사이버 기준선을 넘었을 때 어떤 일이 일어나는지도 불분명하다. 프레임워크는 추가 안전장치, 출시 지연, 접근 제한 또는 추가 협상을 유도할 수 있다. 자발적 구조는 명확한 집행 단계 체계를 만들지 않는다.
기관들이 서로 다른 시스템을 얼마나 일관되게 평가할 수 있는지도 알 수 없다. 모델의 사이버 성능은 도구, 프롬프트, 시간 제한, 네트워크 접근, 안전 통제 유지 여부에 따라 달라진다. 테스트 조건의 작은 변화만으로도 매우 다른 결과가 나올 수 있다.
벤치마크는 원시 역량과 실제 배포 가능한 피해를 구분해야 한다. 통제된 보안 퍼즐을 푼다고 해서 모델이 신뢰성 있는 실제 침입을 수행할 수 있다는 뜻은 아니다. 반대로 벤치마크 성능이 낮다고 해서 공격자가 워크플로를 맞춤화할 수 있는 상황에서 안전성이 보장되는 것도 아니다.
테스트는 방어적 가치도 고려해야 한다. 취약점을 찾는 모델은 공격자에게 도움이 될 수 있지만, 유지관리자가 핵심 소프트웨어를 패치하는 데도 도움이 될 수 있다. 정책은 사이버 역량의 모든 향상을 순수하게 공격적인 것으로 분류할 수 없다.
연방정부는 이런 이중용도 문제를 다룬 경험이 있다. DARPA의 AI Cyber Challenge는 팀들에게 오픈소스 소프트웨어의 취약점을 식별하고 복구할 수 있는 자율 시스템을 구축하도록 요구했다. challenge results는 AI 지원 보안이 해킹 위험만으로 환원될 수 없는 이유를 보여줬다.
Anthropic, Google, OpenAI는 모델 크레딧으로 이 대회를 지원했다. Microsoft와 Open Source Security Foundation은 전문지식을 제공했다. 이 프로젝트는 통제된 평가와 복구 조치가 결합될 때 고도화된 사이버 자동화를 방어 자원으로 다뤘다.
이 사례는 유용한 비교 기준을 제공한다. DARPA 챌린지는 정의된 대상과 경쟁 규칙을 사용했다. 새로운 연방 프레임워크는 개발사, 도구, 안전장치, 출시 계획이 크게 다른 범용 시스템을 평가해야 한다.
정부의 역량도 또 다른 의문을 제기한다. 30일 기간을 충족하려면 여러 주요 모델을 시험할 충분한 평가자, 보안 컴퓨팅 인프라, 기술 전문가가 필요하다. 동시다발적인 출시는 이러한 자원을 압박할 수 있다.
심사는 빠르게 구식이 될 수도 있다. 개발사들은 출시 후 호스팅 모델을 일상적으로 업데이트한다. 도구 연결과 시스템 수준 통제는 기본 모델 계열을 바꾸지 않고도 역량을 변화시킬 수 있다.
오픈 웨이트 AI 모델은 이 문제를 더욱 어렵게 만든다. 외부 개발자는 공개된 모델을 미세 조정하거나 새로운 도구에 연결할 수 있다. 단 한 번의 출시 전 평가는 이후의 모든 구성 방식을 대표할 수 없다.
이러한 이유로 프레임워크를 안전성 인증서로 취급해서는 안 된다. 참여는 개발사가 정부 규정에 따라 접근을 제공했다는 점을 보여줄 뿐이다. 모델이 무해하거나, 수정에 영향을 받지 않거나, 모든 배포 환경에서 안전하다는 것을 입증하지는 않는다.
이 구분은 기업 구매자에게 중요하다. 연방 심사는 추가 근거가 될 수 있지만, 조직은 여전히 접근 통제, 로깅, 테스트, 사고 대응이 필요하다. 로컬 시스템을 사용하는 팀 역시 패치와 모델 업데이트의 명확한 책임 주체가 필요하다.
지식 노동자도 AI가 민감한 자료를 처리할 때 같은 주의를 기울여야 한다. 로컬 배포는 외부 제공업체에 대한 데이터 노출을 줄일 수 있지만, 안전하지 않은 플러그인이나 과도한 권한에서 비롯되는 위험을 없애지는 못한다. 구조화된 AI workflow에도 여전히 사람의 검토와 제한된 접근이 필요하다.
오픈 대 클로즈드는 잘못된 안전성 지름길이다
배포 형식은 위험에 영향을 미치지만, 역량, 배포 통제, 운영자 행동을 직접 측정하는 일을 대체할 수는 없다.
클로즈드 모델은 제공업체에 여러 안전 수단을 제공한다. 기업은 트래픽을 모니터링하고, 악용 패턴을 식별하며, 도구를 제한하고, 서비스를 중앙에서 패치할 수 있다. 특히 민감한 역량에 대해서는 고객 검증을 요구할 수도 있다.
이러한 중앙집중식 통제는 집중된 위험을 만든다. 보안 실패는 한 번에 많은 고객에게 영향을 줄 수 있다. 사용자는 제공업체의 내부 통제, 사고 보고, 정부 접근에 관한 결정에 의존해야 한다.
오픈 모델은 운영자들에게 통제권을 분산한다. 병원, 은행 또는 정부기관은 민감한 데이터를 자체 환경 안에 유지할 수 있다. 조직은 실제 배포할 정확한 버전을 테스트하고 네트워크 접근을 제한할 수 있다.
하지만 모든 운영자는 구성과 유지관리에 대한 책임을 지게 된다. 보안이 취약한 로컬 모델은 데이터를 노출하거나 안전하지 않은 작업을 실행할 수 있다. 원 개발사는 독립적인 배포 환경 전반에 걸쳐 일관된 보호 조치를 강제할 수 없다.
어느 방식도 본질적으로 안전하지는 않다. 핵심 질문은 역량, 권한, 관측 가능성, 결과에 관한 것이다. 무제한 시스템 접근 권한을 가진 중간 수준의 모델은 신중하게 격리된 환경의 더 강력한 모델보다 더 큰 피해를 일으킬 수 있다.
백악관 테스트는 사이버 벤치마크를 사용함으로써 이를 부분적으로 인정한다. 모델의 규모나 학습 비용에만 의존하지 않고, 모델이 무엇을 할 수 있는지 측정하려 한다. 그러나 보도된 오픈 모델 면제는 다시 범주적 지름길을 도입한다.
이 지름길은 주요 기업들 사이에 불균등한 유인을 만들 수 있다. OpenAI와 Anthropic은 주로 독점 모델에 대한 통제된 접근을 수익화한다. Meta는 개발자가 다운로드하고 조정할 수 있는 모델에 대규모 투자를 해왔다. Google은 호스팅 모델, 연구용 출시, 클라우드 인프라 전반에서 사업을 운영한다.
따라서 각 기업은 서로 다른 상업적 위치에서 규정을 바라본다. 안전성 요구는 진정한 우려와 일치할 수 있는 동시에 특정 배포 전략에 유리하게 작용할 수도 있다. 개방성 주장은 혁신을 뒷받침하는 동시에 규제 부담을 줄일 수도 있다.
정책입안자는 악의를 전제하지 않고 이러한 유인을 평가해야 한다. 클로즈드 개발사는 대규모 호스팅 시스템을 모니터링하며 얻은 직접적 근거를 보유한다. 오픈 개발사는 로컬 통제가 연구, 프라이버시, 경쟁을 어떻게 지원하는지 이해한다.
가장 강력한 프레임워크는 역량과 출시의 결과를 모두 검토할 것이다. 매우 강력한 호스팅 모델은 즉시 많은 사용자에게 서비스를 제공할 수 있으므로 출시 전 테스트가 필요하다. 매우 강력한 다운로드 가능 모델도 출시를 완전히 되돌릴 수 없으므로 주의가 필요하다.
서로 다른 시스템에 동일한 통제가 필요한 것은 아니다. 클로즈드 제공업체는 모니터링과 단계적 접근을 유지할 수 있다. 오픈 개발사는 웨이트를 배포하기 전에 평가 결과를 공개하거나, 초기 출시를 제한하거나, 보안 연구자와 협력할 수 있다.
오픈소스 소프트웨어는 유용한 선례를 제공하지만, 이 비유에는 한계가 있다. 공개 코드는 폭넓은 검토와 신속한 패치를 받을 수 있다. 학습된 모델의 행동은 파일을 검사하는 것만으로 이해하기 더 어렵고, 사용자가 항상 업데이트를 설치하는 것도 아니다.
AI 모델은 확률적으로 행동도 생성한다. 동일한 프롬프트가 서로 다른 출력을 낼 수 있으며, 도구 접근은 그 출력이 달성할 수 있는 일을 바꾼다. 전통적인 코드 검토만으로는 이러한 행동을 완전히 특성화할 수 없다.
프레임워크의 자발적 지위는 이러한 과제를 증폭시킨다. 이는 협력, 비공개 소통, 선도 기업들이 워싱턴과의 관계를 중시할 것이라는 기대에 의존한다. 이런 접근은 입법보다 빠르게 움직일 수 있지만, 강제 가능한 보장은 더 적다.
이전의 자발적 약속에 관한 연구는 주의가 필요할 이유를 제시한다. 한 독립 연구는 참여 AI 기업들이 이전 백악관 약속을 이행했다는 공개 증거가 일관되지 않았으며, 특히 모델 웨이트 보안에서 그러했다고 밝혔다. commitment analysis는 새 프레임워크를 평가하지는 않지만, 자발적 약속에 측정 가능한 후속 이행이 필요한 이유를 보여준다.
정부는 비민감 정보를 공개함으로써 신뢰성을 강화할 수 있다. 광범위한 역량 범주, 참여 통계, 심사 일정, 테스트가 출시 변경으로 이어졌는지 여부를 공개할 수 있다. 이런 보고는 기밀 기법을 보존하면서도 외부 평가를 가능하게 할 것이다.
개발사도 자체 요약을 공개할 수 있다. 어떤 모델 버전이 심사에 들어갔는지, 어떤 접근 조건이 적용됐는지, 이후 어떤 안전장치가 바뀌었는지 설명할 수 있다. 이러한 공개는 위험한 테스트 내용을 드러내지 않고도 고객이 절차를 해석하는 데 도움을 줄 것이다.
그런 근거가 없다면 프레임워크는 상징적인 수준에 그칠 위험이 있다. 클로즈드 연구소는 정부 테스트에 협력했다고 말할 수 있다. 오픈 개발사는 혁신을 보존했다고 말할 수 있다. 그러나 대중은 어느 경로가 실제 사이버 위험을 줄였는지 여전히 판단할 수 없다.
테스트의 중요성을 보여줄 세 가지 신호
다음 단계는 참여 여부, 오픈 모델의 역량, 그리고 정부 심사가 실제 출시를 바꾼다는 증거에 달려 있다.
첫 번째 신호는 주요 독점 모델 개발사들이 자격을 갖춘 모델을 일관되게 제출하는지 여부다. 여러 보도에 따르면 OpenAI, Anthropic, Google은 백악관 논의에 참여했다. 논의만으로는 일상적인 준수가 입증되지 않는다.
식별 가능한 출시와 연결된 확인된 심사를 지켜봐야 한다. 명확한 패턴은 이 프레임워크가 주목도 높은 출시 전에 작동한다는 점을 보여줌으로써 이를 강화할 것이다. 반복적인 예외나 공개되지 않은 참여는 이 절차가 신뢰할 수 있는 감독을 제공한다는 주장에 힘을 빼게 된다.
두 번째 신호는 공개 평가에서 오픈 웨이트 AI 모델이 기밀 기준선에 근접하는지 여부다. 정부는 정확한 벤치마크를 공개하지 않겠지만, 독립적인 사이버 테스트는 여전히 상대적인 개선 수준을 보여줄 수 있다. 더 강력한 다운로드형 시스템은 이 면제를 재검토하라는 압력을 강화할 것이다.
이 신호가 중요한 이유는 이 프레임워크의 논리가 역량 격차에 의존하기 때문이다. 오픈 시스템이 가장 앞선 폐쇄형 제품보다 의미 있게 낮은 수준에 머문다면, 독점 모델을 우선시하는 접근은 실용적으로 보인다. 그 격차가 좁아지면 배포 형식은 방어하기 어려운 경계가 된다.
세 번째 신호는 정부 검토가 모델의 출시 방식을 바꾸는지 여부다. 출시 지연, 단계적 도입, 보호장치 추가 또는 접근 제한은 실질적인 영향력을 보여줄 것이다. 눈에 띄는 결과 없이 검토만 장기간 이어진다면, 이 과정은 주로 자문을 제공하는 데 그친다는 의미일 수 있다.
영향력의 증거는 신중하게 해석해야 한다. 출시가 변경됐다고 해서 원래 모델이 피해를 초래했을 것이라는 점이 입증되는 것은 아니다. 다만 평가자들이 배포에 영향을 줄 만큼 중요한 우려를 식별했다는 점은 보여준다.
행정부는 자사의 사이버 이니셔티브가 어떻게 연결되는지도 명확히 해야 한다. 행정명령은 최첨단 모델 프레임워크와 AI 사이버보안 클리어링하우스를 모두 만들었다. 이 클리어링하우스는 정부, 산업계, 핵심 인프라 전반에서 취약점 발견, 검증 및 해결을 조정한다.
이 프로그램들은 위험 주기의 서로 다른 시점을 다룬다. 모델 테스트는 출시 전 역량을 검토한다. 클리어링하우스는 고도화된 시스템이 찾아낸 소프트웨어 결함을 처리한다. 이들의 성공은 모델 개발자, 연방 기관, 소프트웨어 유지관리자 간 안전한 소통에 달려 있다.
개발자에게 당장의 교훈은 정책을 출시 엔지니어링의 일부로 다루라는 것이다. 독점 서비스 위에서 제품을 구축하는 팀은 고급 기능을 둘러싼 접근 제어가 바뀔 수 있음을 예상해야 한다. 오픈 시스템을 배포하는 팀은 연방 면제를 안전성의 증거로 오해해서는 안 된다.
기업 구매자는 어느 경로를 선택하든 평가 근거를 요청해야 한다. 호스팅 제공업체에는 오용을 어떻게 모니터링하고 정부의 조사 결과에 어떻게 대응하는지 물어야 한다. 오픈 모델 공급업체에는 수정된 배포 환경을 어떻게 테스트하고, 패치를 어떻게 배포하며, 도구 접근을 어떻게 통제하는지 물어야 한다.
지식 노동자는 명칭보다 권한에 집중해야 한다. 이메일, 문서, 소스 코드 또는 클라우드 콘솔에 연결된 어시스턴트는 라이선스 모델과 무관하게 위험을 초래할 수 있다. 검색 가능한 지식 베이스는 모든 자동화 프로세스에 제한 없는 접근 권한을 부여하는 대신 접근 경계를 보존해야 한다.
Google News 헤드라인은 실제 정책 갈등을 포착하지만, “AI 해커”라는 표현이 모든 모델 내부에 자율적인 범죄자가 숨어 있다는 뜻으로 받아들여져서는 안 된다. 이러한 시스템은 방어적 연구를 지원하고, 보안 작업을 자동화하며, 공격자의 진입 장벽을 낮출 수 있다. 결과는 역량, 도구, 지시 사항, 운영 통제에 달려 있다.
백악관은 출시 전 중요한 한 범주를 검토할 수 있는 경로를 마련했다. 그 가치는 기밀 문서의 존재가 아니라 일관된 참여와 관찰 가능한 변화에서 나올 것이다.
오픈 모델 면제는 이제 이 프레임워크의 결정적 시험대가 됐다. 다운로드형 시스템의 역량이 낮은 수준에 머문다면, 좁은 초점은 비례적인 접근으로 보일 수 있다. 이들이 따라잡는다면, 워싱턴은 회수하기 가장 어려운 모델이 왜 여전히 출시 전 검토를 가장 적게 받는지 설명해야 한다.
독자들은 다음 주요 모델 출시를 지켜보며 세 가지 질문을 던져야 한다. 검토를 받았는가, 그 검토가 접근 방식을 바꿨는가, 그리고 같은 역량이 다운로드 가능한 웨이트 형태로 제공됐다면 답이 달라졌을까? 이 답들은 정책이 위험을 측정하는지, 아니면 AI 배포 방식에 따라 기업을 분류할 뿐인지 보여줄 것이다.



