top of page

Anthropic Google 협의, 자발적 AI 안전성 테스트와 출시 경쟁을 맞붙이다

Anthropic, Google, OpenAI, Meta는 정부 AI 안전성 테스트를 둘러싼 깊은 이견에도 불구하고 8월 4일 트럼프 행정부 관계자들과 협의에 들어갔다. 이번 회의의 핵심은 첨단 모델 검토를 위한 완성된 자발적 프레임워크다. 그러나 그 기준과 일정, 결과에 따른 조치는 대체로 공개되지 않은 상태다.

Anthropic Google 간 논의는 책임 있는 AI를 둘러싼 또 하나의 포괄적 대화가 아니다. 이는 연방 검토기관이 공식적인 규제 권한을 얻지 않고도 출시 전 프런티어 모델을 검토할 수 있는지를 시험한다. 동시에 안전성 검토와 점점 더 강력한 시스템을 출시하려는 상업적 경쟁 간의 근본적 충돌도 드러낸다.

이 충돌은 이미 정책 이론의 영역을 넘어섰다. 보도에 따르면 정부의 우려는 Anthropic과 OpenAI의 최근 모델 배포에 영향을 미쳤다. 한편 Meta는 공개 후 통제가 어려워지는 오픈 웨이트 출시와 여전히 밀접하게 연관돼 있다.

따라서 핵심 질문은 실무적이다. 부정적 평가가 출시 일정, 고객 또는 정부 계약을 위협할 때, 자발적 테스트가 기업에 영향을 미칠 수 있을까?

백악관에는 프레임워크가 있지만, 기업들은 여전히 규칙을 필요로 한다

8월 4일 회의는 연방 AI 검토를 논의하는 단계에서 그 검토가 실제로 어떻게 운영될지를 협상하는 단계로의 전환을 뜻한다.

백악관은 Meta, Anthropic, Google, OpenAI의 실무진을 초청해 첨단 AI 모델 평가를 위한 완성된 프레임워크를 검토하도록 했다. 보도된 회의는 최고경영자들과 도널드 트럼프 대통령 간 정상급 회담이 아니라 실무진 수준의 회의로 예정됐다.

이 구분은 중요하다. 이제 기술 및 정책 팀은 공개 성명으로는 답이 나오지 않았던 운영상 질문들을 해결해야 한다. 정의, 제출 절차, 검토 일정, 공개 규칙, 그리고 이견이 있는 결과를 처리하는 절차가 필요하다.

행정부는 트럼프 대통령의 6월 2일 행정명령으로 정해진 기한까지 자발적 프레임워크를 완성했다고 밝혔다. 그러나 정부는 전체 문서를 공개하지 않았으며, 참여 기업 전체를 명시하지도 않았다.

evaluation framework에 관한 보도에 따르면, 이 프레임워크는 개발 중인 모델이 연방 검토 대상에 해당하는지 개발사가 판단하도록 돕기 위한 것이다. 사이버 역량 벤치마크는 기밀로 유지될 것으로 전해졌다.

기밀 벤치마크는 개발사가 알려진 테스트를 통과하는 데만 맞춰 모델을 설계하는 일을 막을 수 있다. 공격적 사이버보안 기법을 드러내는 세부사항도 보호할 수 있다. 그러나 비밀주의는 고객, 연구자, 입법자가 검토 절차의 일관성을 판단하기 어렵게 만든다.

적어도 공식적으로는 이 프레임워크가 자발적이다. 이는 참여 기업이 통상적인 허가 요건에 대응하는 것이 아니라는 뜻이다. 부정적 평가를 받은 모델의 출시를 자동으로 금지하는 공개 법률도 없다.

자발적이라는 말이 반드시 영향이 없다는 뜻은 아니다. 정부는 AI 서비스를 구매하고, 기밀 네트워크 접근을 통제하며, 수출 제한을 관리하고, 국가안보 정책을 형성한다. 전담 AI 규제기관이 없어도 이러한 권한은 기업에 영향을 줄 수 있다.

따라서 이번 회의는 해결되지 않은 여러 질문을 열어 둔다. 어떤 모델이 테스트 기준선을 넘는가? 개발사는 연방 검토기관에 얼마나 이르게 연락해야 하는가? 누가 결과를 받는가? 관계자들은 출시 제한을 요청할 수 있는가?

또 다른 쟁점은 이견이다. 연구소는 기술적 결과를 받아들이면서도 정부의 해석에는 이의를 제기할 수 있다. 위험한 역량이 비현실적인 조건에서만 나타난다고 주장할 수도 있다.

이 가능성은 추상이 아니다. 안전성 평가는 프롬프트, 도구, 권한, 스캐폴딩, 반복 시도에 따라 달라지는 경우가 많다. 스캐폴딩은 모델이 계획을 세우고, 도구를 사용하며, 더 긴 작업을 완료하도록 돕는 소프트웨어 구조를 뜻한다.

이러한 조건을 바꾸면 결과도 실질적으로 달라질 수 있다. 일반적인 채팅 인터페이스에서는 제한적으로 보이는 모델도 코드 실행이나 네트워크 도구와 연결되면 더 강력해질 수 있다.

공개 프레임워크는 결국 검토기관이 신뢰할 수 있는 보안 위험과 인위적인 실험실 시연을 어떻게 구분하는지 설명해야 한다. 그때까지 이번 회의는 절차상의 진전일 뿐, 효과적인 감독의 증거는 아니다.

이 회의는 이 글의 핵심 긴장도 만든다. 행정부는 민감한 시스템에 조기 접근하기를 원하지만, 개발사들은 경쟁적인 출시를 좌절시키지 않는 예측 가능한 검토를 원한다.

Anthropic Google과 경쟁사들이 지금 압박을 받는 이유

첨단 모델이 단순히 질문에 더 잘 답하는 수준을 넘어 사이버 작전에 유용해지고 있어 연방 안전성 검토의 긴급성이 커졌다.

행정부의 노력은 여러 우려가 겹치며 전개됐다. 여기에는 정부 조달, 기밀 환경 배포, 모델 탈취, 사이버 공격, 그리고 첨단 에이전트가 통제된 환경 밖에서 행동할 가능성이 포함된다.

AI 에이전트는 작업을 계획하고 외부 도구를 사용할 수 있는 모델 기반 시스템이다. 이러한 도구에는 브라우저, 터미널, 클라우드 서비스 또는 소프트웨어 저장소가 포함될 수 있다.

이런 접근은 개발사와 보안 팀에 실질적인 이점을 제공한다. 동시에 위험 프로필도 바꾼다. 챗봇은 소프트웨어 취약점을 설명할 수 있지만, 에이전트는 잠재적으로 표적을 찾고 악용을 시도할 수 있다.

정부는 2026년 초 테스트 협력 관계를 확대했다. Google, Microsoft, xAI는 평가에 동의했고, Anthropic 및 OpenAI와의 업데이트된 협약은 기존 작업을 이어갔다.

testing program에 대한 5월 요약은 정부 평가자들이 국가안보 위험을 위해 첨단 모델을 검토하고 있다고 밝혔다. 이러한 관계는 현재 논의 중인 더 광범위한 프레임워크의 제도적 기반을 제공했다.

6월 2일 security directive는 정치적 압박을 더했다. 이 지침은 프런티어 모델 개발을 국가안보 및 연방 배포 결정과 연결했다.

Anthropic과 OpenAI에는 접근성과 시점이 압박 요인이다. 두 기업은 폐쇄형 모델을 개발하며, 평가자에게 통제된 출시 전 접근 권한을 제공할 수 있다. 또한 기업 및 소비자 시장에서 입지를 지키기 위해 잦은 출시가 필요하다.

Google도 더 큰 제품 포트폴리오 전반에서 비슷한 시점 문제에 직면한다. 이 회사의 모델은 클라우드 서비스, 업무용 소프트웨어, 검색 제품, 정부 관계에 영향을 줄 수 있다. 따라서 검토 지연은 하나의 챗봇 출시를 넘어서는 결과를 낳을 수 있다.

Meta는 다른 과제를 제시한다. 오픈 웨이트 모델은 시스템을 실행하고 수정하는 데 필요한 수치 파라미터를 배포한다. 이러한 웨이트가 유통되면 Meta도 정부도 모든 사본을 확실하게 회수할 수 없다.

이 차이가 오픈 웨이트 모델을 본질적으로 위험하게 만드는 것은 아니다. 연구자, 스타트업, 방어자는 이를 검사하고 조정할 수 있다. 개방형 접근은 폐쇄형 공급업체가 결코 허용하지 않을 수도 있는 독립적인 테스트를 지원할 수 있다.

그러나 이러한 출시 방식은 배포 전 통제를 복잡하게 만든다. 정부 검토기관은 공개 전에 우려 사항을 식별해야 한다. 이후의 제한 조치는 영향 범위가 제한적이기 때문이다. 폐쇄형 모델 제공업체는 호스팅 서비스와 계정 권한을 통해 더 많은 통제력을 유지한다.

기업들은 서로에게서도 압박을 받는다. 긴 검토에 협조하는 개발사는 더 제한적인 절차를 사용하는 경쟁사에 비해 시간을 잃을 위험이 있다. 이 유인은 대규모 제품 출시가 임박할수록 더 강해진다.

자발적 시스템은 협력이 불균등한 비용을 부과할 때 어려움을 겪는다. 한 기업이 기다리는 동안 다른 기업이 출시하면, 신중한 참여자가 상업적 불이익을 떠안는다. 이러한 구조는 안전성 약속을 조정 문제로 만들 수 있다.

정부 관계자들도 자체적인 압박에 직면한다. 심각한 위험을 감지할 만큼 충분한 접근이 필요하지만, 상업적 승자를 선택하는 것처럼 보여서는 안 된다. 모호한 기준선은 한 기업의 모델을 검토 대상으로 끌어들이는 반면 비슷한 경쟁 모델은 검토 밖에 남겨 둘 수 있다.

위험은 기업 구매자에게도 미친다. 기업들은 점점 더 모델을 내부 문서, 코드, 고객 기록, 운영 시스템에 연결하고 있다. 배포 후 발견된 실패는 수많은 하위 제품으로 퍼질 수 있다.

조달 팀은 모델이 정부 테스트를 완료했는지 알고 싶어 할 것이다. 또한 그 보증의 한계도 알아야 한다. 기밀 평가를 통과했다고 해서 모든 사설 네트워크에서 안전하게 작동한다는 보장은 없다.

개발사들도 비슷한 정보 격차에 직면한다. 가장 중요한 평가 근거를 보지 못한 채 API를 통해 모델을 받을 수 있다. 정부 참여는 신뢰를 높일 수 있지만, 비밀주의는 하나의 불투명한 절차를 또 다른 절차로 대체할 수도 있다.

Anthropic Google 회의가 중요한 이유는 이러한 압박이 한데 모이고 있기 때문이다. 모델 역량은 발전하고, 연방 도입은 확대되며, 최근 보안 사고는 행동 지연을 정당화하기 더 어렵게 만들었다.

자발적 AI 안전성 테스트와 상업적 출시 경쟁의 충돌

이 프레임워크의 결정적 균형점은 의미 있는 검증이 경쟁 기업들이 통제하는 출시 일정과 공존할 수 있는지에 달려 있다.

출시 전 테스트는 새로운 약속이 아니다. 2023년 Anthropic, Google, Meta, OpenAI를 포함한 7개 주요 개발사는 자발적인 백악관 약속을 수용했다.

이러한 pre-release commitments에는 내부 및 외부 보안 테스트가 포함됐다. 또한 정보 공유, 사이버보안 보호, 공개 보고, AI 생성 콘텐츠 식별 방법도 다뤘다.

새 절차는 더 좁고 운영 중심적으로 보인다. 특히 사이버보안에서 국가안보 우려를 만들 수 있는 첨단 역량에 초점을 맞춘다. 행정부는 이제 정부 평가자가 개발 주기에 언제 참여하는지를 정의하려 하고 있다.

테스트하겠다는 약속은 결과를 수용하겠다는 약속보다 쉽기 때문에 이 변화는 중요하다. 기업들은 이미 내부 평가를 수행하고 선별된 결과를 공개한다. 더 어려운 질문은 외부 검토자가 지연이나 제한을 요청할 때 제기된다.

유용한 프레임워크에는 적어도 네 가지 요소가 필요하다. 명확한 모델 기준선, 충분한 테스트 시간, 정의된 결과 접근 권한, 그리고 분쟁 해결 절차가 필요하다.

기준선은 어떤 시스템이 대상이 되는지를 결정한다. 학습 중 사용된 컴퓨팅 자원은 한 가지 측정 기준이 될 수 있지만, 역량을 직접 포착하지는 못한다. 효과적인 도구를 갖춘 더 작은 모델은 특수한 사이버 작업에서 더 큰 모델보다 뛰어난 성과를 낼 수 있다.

역량 벤치마크는 또 다른 접근법을 제공한다. 이는 시스템이 첨단 공격, 방어, 생물학 연구 또는 자율 작전과 관련된 작업을 완료할 수 있는지 테스트한다. 그러나 벤치마크 성과는 프롬프팅과 도구 접근에 따라 달라진다.

시점은 또 다른 문제를 만든다. 개발사들은 종종 출시 직전까지 모델을 개선한다. 초기 체크포인트에 대한 검토는 이후 변경 사항을 놓칠 수 있고, 늦은 검토는 마케팅, 인프라, 고객 약속과 충돌할 수 있다.

프레임워크는 모델 업데이트도 다뤄야 합니다. 제공업체는 기반 모델을 재학습하지 않고도 시스템 프롬프트, 안전 필터, 도구 권한 또는 검색 구성 요소를 변경할 수 있습니다. 일부 업데이트는 위험을 실질적으로 바꿀 수 있습니다.

단 한 번의 검토로 모든 미래 구성을 포괄할 수는 없습니다. 정부는 재시험을 촉발하는 변경 임계값을 마련해야 할 수 있습니다. 그렇지 않으면 인증된 버전이 실질적으로 다른 제품의 기반이 될 수 있습니다.

결과 공유에는 관련된 절충안이 있습니다. 전면 공개는 민감한 취약점이나 기밀 테스트를 노출할 수 있습니다. 완전한 비공개는 독립 연구자들이 정부의 결론을 검증하는 것을 막습니다.

실행 가능한 절충안은 평가 범주, 방법 및 고수준의 결과를 공개하되 악용 가능한 세부 사항은 보호하는 방식일 수 있습니다. 행정부는 자사 프레임워크가 그 모델을 따르는지 공개하지 않았습니다.

이의 제기 절차도 마찬가지로 중요합니다. 연구소는 증거를 통해 결과에 이의를 제기할 수 있어야 합니다. 그러나 끝없는 항소는 기업들이 시간을 끌어 해결 전에 출시하도록 허용할 수 있습니다.

이 지점에서 자발적 감독은 상업적 현실과 맞닿습니다. Anthropic, Google, OpenAI, Meta는 공통된 일정에 따라 모델을 개발하지 않습니다. 각 기업은 서로 다른 투자자, 고객, 인프라 및 전략적 우선순위를 갖고 있습니다.

OpenAI와 Anthropic은 주로 통제된 서비스를 통해 선도 시스템을 배포합니다. Google은 호스팅 모델과 더 개방적인 제공 방식을 함께 운영합니다. Meta는 AI 전략의 상당 부분에서 오픈 웨이트를 핵심으로 삼았습니다.

정부는 이들 모델 전반에 하나의 개입을 동일하게 적용할 수 없습니다. API 기능을 제한하는 일은 다운로드 가능한 웨이트의 출시를 지연하는 일과 다릅니다. 기술적 메커니즘과 후속 영향은 동등하지 않습니다.

따라서 프레임워크에는 동일한 절차가 아니라 비교 가능한 결과가 필요합니다. 테스트에서 심각한 위험이 확인될 경우, 모든 대상 개발업체는 신뢰할 수 있는 대응에 직면해야 합니다. 그 대응은 모델이 사용자에게 도달하는 방식을 반영할 수 있습니다.

그 결과로 추가 안전장치, 제한된 도구 접근, 단계적 배포 또는 확대된 모니터링이 포함될 수 있습니다. 오픈 웨이트 출시의 경우, 출시 후 통제가 더 약하므로 검토자가 더 이른 제출을 요구할 수 있습니다.

그러나 프레임워크가 더 명확해지기 전까지 이러한 가능성은 여전히 추측에 불과합니다. 백악관은 완료를 확인했지만, 완료가 채택을 의미하지는 않습니다. 회의에 참석한 기업들은 모든 조건을 공개적으로 수용하지 않았습니다.

참여자들이 정부의 신뢰를 중시한다면 자발적 모델도 작동할 수 있습니다. 연방 계약과 국가안보 고객에 대한 접근은 강력한 유인을 제공합니다. 평판 비용 역시 기업이 신뢰할 만한 결과를 무시하지 못하게 할 수 있습니다.

분쟁 중인 결과가 대규모 출시와 관련될 때 시스템은 취약해집니다. 바로 그 순간이 협력이 거버넌스 메커니즘인지, 아니면 단순한 공개적 약속인지 시험합니다.

비공개 벤치마크는 큰 책임성 공백을 남긴다

정부 테스트는 심각한 위험을 식별할 수 있지만, 공적 책임성에 필요한 투명성을 제공하는 데는 여전히 실패할 수 있습니다.

기밀 사이버보안 벤치마크에는 정당화 가능한 목적이 있습니다. 모든 과제와 익스플로잇 경로를 공개하면 악의적 행위자에게 도움이 되고 개발자들이 테스트에 맞춰 최적화하도록 부추길 수 있습니다.

그러나 비공개 벤치마크는 비대칭성을 만듭니다. 공무원과 참여 기업은 고객, 연구자, 경쟁사가 검토할 수 없는 증거를 봅니다. 그러면 대중은 기술적 근거 없이 결론만 받게 됩니다.

이 구조는 일관성에 관한 의문을 제기합니다. 모든 기업이 동일한 도구, 시간 및 시도 횟수를 받았는가? 평가자는 기반 모델을 테스트했는가, 아니면 완성된 에이전트 시스템을 테스트했는가? 비교 가능한 안전장치가 활성화되어 있었는가?

답에 따라 성능은 크게 달라질 수 있습니다. 터미널 접근 권한과 저장된 자격 증명을 가진 모델은 제한된 채팅 창 안의 동일한 모델과 위험 프로필이 다릅니다.

정부 검토자에게도 여러 최전선 시스템을 테스트할 충분한 전문성과 컴퓨팅 자원이 필요합니다. 자원이 부족한 프로그램은 신뢰할 만한 결과를 내지 못한 채 지연만 초래할 수 있습니다.

CAISI로도 불리는 Center for AI Standards and Innovation은 연방 평가 업무에서 중요한 부분이 되었습니다. 그 영향력은 기술 역량과 행정부 전반에 걸친 지속적인 권한에 달려 있습니다.

독립성은 또 다른 과제를 제시합니다. 정부 기관은 모델을 구매하고, 국방 접근을 협상하며, 수출 정책을 관리하는 동시에 중립적인 관찰자가 아닙니다. 조달 이해관계는 테스트를 당장의 운영상 필요로 끌어당길 수 있습니다.

기업들에도 자체적인 이해충돌이 있습니다. 이들은 자사 모델에 관한 가장 강한 기술 지식을 보유하지만, 증거와 출시 결정도 통제합니다. 자체 보고만으로는 이러한 긴장을 해소할 수 없습니다.

독립 평가가 공개를 면밀히 검토해야 하는 이유를 보여줍니다. 2023년 백악관 약속에 대한 동료 심사 연구는 공개적으로 관찰 가능한 준수 수준에 큰 차이가 있음을 발견했습니다.

약속 평가에서 최고 점수를 받은 기업은 약 83%를 기록했으며, 평가 대상 기업 전체 평균은 약 52%였습니다. 이 연구는 모든 기밀 안전 활동이 아니라 공개된 행동을 측정했습니다.

이 한계는 중요합니다. 낮은 공개 점수가 기업이 내부 작업을 전혀 수행하지 않았음을 입증하는 것은 아닙니다. 이는 외부 관찰자에게 일관된 이행을 검증할 충분한 증거가 없었음을 보여줍니다.

별도의 2026년 평가는 선도 연구소 전반에서 미흡한 점을 발견했습니다. 안전성 지수는 Anthropic, OpenAI 및 Google DeepMind에 C+ 등급을 부여했고, Meta는 D+를 받았습니다.

이러한 평가는 각 기관의 방법론과 판단에 따라 달라집니다. 규제 당국의 판단으로 취급해서는 안 됩니다. 그럼에도 독립적 검토, 위험 관리 및 공개 증거에 대한 지속적인 우려를 보여줍니다.

Trump 행정부의 프레임워크는 표준화된 평가를 만든다면 이 상황을 개선할 수 있습니다. 반대로 기업들이 참여가 무엇을 포괄했는지 공개하지 않은 채 참여 자체를 안전의 증거로 인용한다면 불투명성을 악화시킬 수도 있습니다.

정부 검토가 보편적인 승인 도장이 되어서는 안 됩니다. 최전선 평가는 특정 조건에서 선택된 위험에 초점을 맞춥니다. 모든 배포 환경에서 개인정보 보호, 편향, 신뢰성, 보안 및 오용을 검증할 수는 없습니다.

따라서 기업 구매자는 구체적인 질문을 해야 합니다. 어떤 모델 버전이 테스트되었는가? 어떤 역량 범주를 검토했는가? 어떤 안전장치가 활성화되어 있었는가? 제공업체는 평가 후 변경을 했는가?

또한 내부 통제도 유지해야 합니다. 접근 권한, 네트워크 격리, 로깅, 사람의 승인 및 사고 대응은 연방 평가 이후에도 여전히 필요합니다.

민감한 연구를 다루는 팀은 검색 가능한 AI 지식 베이스를 유지함으로써 이 과정을 강화할 수 있습니다. 이를 통해 모델 버전, 평가 기록, 배포 결정 및 사고 증거를 보존할 수 있습니다.

제공업체가 모델을 조용히 업데이트할 때 문서화는 특히 중요해집니다. 팀은 변경된 동작이 자체 워크플로, 공급업체 업데이트 또는 새 도구 통합에서 비롯된 것인지 알아야 합니다.

정치적 불확실성도 있습니다. 자발적 프레임워크는 법률의 안정성이 없기 때문에 빠르게 바뀔 수 있습니다. 향후 공직자는 테스트 임계값을 확대, 축소 또는 재해석할 수 있습니다.

의회는 최전선 모델을 위한 포괄적인 연방 라이선스 제도를 만들지 않았습니다. 따라서 이 프레임워크는 행정 권한, 조달 영향력, 국가안보 권한 및 기업 협력을 통해 운영됩니다.

이러한 체계는 법률 제정보다 더 빠르게 대응할 수 있습니다. 또한 일관성 없는 규칙과 제한적인 검토 경로를 낳을 수 있습니다.

회의적인 결론은 테스트에 가치가 없다는 것이 아닙니다. 참여만으로는 안전성, 독립성 또는 동등한 대우를 입증할 수 없다는 것입니다. 구현에 관한 증거는 회의 발표보다 더 중요합니다.

개방형 모델과 폐쇄형 모델은 서로 다른 안전 문제를 만든다

가장 어려운 정책 질문은 어느 개발 철학이 승리하느냐가 아니라, 하나의 프레임워크가 통제 가능한 시스템과 그렇지 않은 시스템을 어떻게 다루느냐입니다.

Anthropic, Google, OpenAI, Meta는 미국 AI 리더십에 대한 관심을 공유합니다. 그러나 하나의 배포 모델이나 개방성이 보안에 미치는 영향에 대한 하나의 견해를 공유하지는 않습니다.

Anthropic과 OpenAI는 가장 성능이 뛰어난 모델 웨이트를 비공개로 유지합니다. 사용자는 일반적으로 API로 알려진 관리형 제품이나 애플리케이션 프로그래밍 인터페이스를 통해 이러한 시스템에 접근합니다.

이 구조는 제공업체에 지속적인 통제권을 제공합니다. 계정을 정지하고, 요청을 차단하며, 안전장치를 변경하고, 비정상 활동을 모니터링하고, 기능을 철회할 수 있습니다. 동시에 정보와 의사결정을 기업 내부에 집중시킵니다.

Meta의 오픈 웨이트 접근 방식은 사용자와 다운스트림 개발자에게 더 많은 통제권을 이전합니다. 조직은 호스팅 제공업체에 의존하지 않고 자체 인프라에서 모델을 실행하고, 수정하며, 평가할 수 있습니다.

Google은 두 가지 패턴에 걸쳐 운영합니다. 통제된 최전선 서비스를 제공하는 동시에 더 폭넓은 적용을 목적으로 한 모델도 출시합니다. 이 때문에 Google은 테스트 논쟁의 양쪽 모두와 관련이 있습니다.

오픈 모델 지지자들은 더 넓은 접근이 연구, 경쟁 및 방어적 보안을 강화한다고 주장합니다. 독립 전문가들은 허가를 구하지 않고도 동작을 검토하고, 결과를 재현하며, 보호 조치를 개발할 수 있습니다.

비판자들은 비가역성을 강조합니다. 위험한 호스팅 기능은 중앙에서 비활성화할 수 있습니다. 다운로드된 웨이트는 사설 서버, 외국 관할권 및 수정된 시스템 전반에 걸쳐 남아 있을 수 있습니다.

폐쇄형 시스템에도 자체적인 위험이 있습니다. 외부 전문가는 독점적인 학습 데이터나 모델 웨이트를 완전히 검토할 수 없습니다. 제공업체는 어떤 연구자에게 접근 권한을 주고 어떤 결과를 공개할지 결정합니다.

따라서 이 비교는 분산된 검토와 중앙집중식 통제 사이의 절충안입니다. 어느 접근도 오용, 보안 실패 또는 오해를 부르는 안전 주장를 제거하지는 못합니다.

백악관의 실질적인 과제는 동등한 검토 의무를 정의하는 것입니다. 오픈 웨이트 제공업체에는 더 이른 평가와 더 강력한 출시 문서화가 필요할 수 있습니다. 호스팅 제공업체에는 배포 후 지속적인 모니터링이 필요할 수 있습니다.

사용자들이 실제 환경에서 예상치 못한 역량을 발견하기 때문에 출시 후 모니터링은 중요합니다. 통제된 API는 사용 패턴, 오용 보고 및 보안 사고를 통해 증거를 생성합니다.

오픈 모델은 중앙집중식 가시성을 덜 제공합니다. 다운스트림 호스트는 안전장치를 추가하거나 제거하거나 특화된 버전을 만들 수 있습니다. 원래 개발자는 모든 배포를 관찰할 수 없습니다.

프레임워크는 안전성을 폐쇄형 기존 강자를 보호하기 위한 구실로 사용하지 않으면서 이러한 차이를 고려해야 합니다. 대형 연구소만 충족할 수 있는 규칙은 위험을 줄이지 못한 채 경쟁을 약화시킬 수 있습니다.

소규모 개발자와 학술 단체도 오픈 모델에 의존합니다. 이들은 종종 최전선 시스템을 학습시키는 데 필요한 컴퓨팅 자원이 부족합니다. 접근을 제한하면 역량이 자금력이 풍부한 소수 기업 안에 집중될 수 있습니다.

반대로 제한 없는 공개는 비용을 방어자에게 전가할 수 있습니다. 보안팀은 신뢰할 만한 제공업체 연락처가 없는 상황에서 수정된 시스템에 맞서야 할 수 있습니다.

이러한 긴장은 Meta의 8월 회의 참석이 중요한 이유를 설명합니다. 통제된 API만을 중심으로 설계된 프레임워크는 주요 배포 경로 하나를 그 논리 밖에 남겨둘 것입니다.

또한 Anthropic과 Google의 공조를 과장해서는 안 되는 이유도 설명합니다. 두 기업 모두 안전성 연구에 참여하지만, 제품, 정부와의 관계 및 개방성 전략은 다릅니다.

이 회의는 통일된 업계 입장을 만들지 않습니다. 정부가 이들의 차이 전반에서 작동하는 규칙을 필요로 하기 때문에, 경쟁 기업들을 동일한 협상 테이블에 앉힙니다.

기업 사용자의 경우, 배포 아키텍처는 조달 결정에 영향을 미쳐야 합니다. 호스팅형 모델은 중앙집중식 통제 기능을 제공하지만 공급업체 의존도를 높입니다. 자체 호스팅 모델은 로컬 통제권을 제공하지만 더 많은 보안 책임을 고객에게 이전합니다.

개발자는 모델 가중치, 프롬프트, 자격 증명, 생성된 작업이 어디에 위치하는지 파악해야 합니다. 또한 사고 발생 시 누가 시스템을 비활성화할 수 있는지도 확인해야 합니다.

이러한 질문은 개방형 AI와 폐쇄형 AI 중 어느 쪽이 보편적으로 더 안전한지를 묻는 것보다 더 실행 가능합니다. 답은 위협 모델, 배포 통제 수단, 그리고 시스템을 운영하는 조직에 따라 달라집니다.

연방 차원의 테스트는 이러한 차이를 드러내야 합니다. 모든 모델을 단일한 통과·실패 라벨로 압축한다면, 실제 위험을 결정하는 메커니즘은 가려지게 됩니다.

프레임워크의 실효성을 보여줄 세 가지 신호

다음 시험대는 기업 참여, 출시 결과, 그리고 개발사 전반에 동일한 기준이 적용된다는 증거에서 시작되는 실행입니다.

첫 번째 신호는 적용 범위 기준에 대한 공개 설명입니다. 기업은 어떤 모델이 출시 전 협의를 필요로 하는지 알아야 합니다. 고객은 연방 검토가 무엇을 의미하는지 이해할 수 있을 만큼의 정보를 받아야 합니다.

정확한 기준은 프레임워크의 신뢰도를 강화할 것입니다. 또한 공무원들이 비공개 협상이나 정치적 선호를 통해 모델을 선택할 가능성을 낮출 수 있습니다.

지속되는 모호성은 이를 약화시킬 것입니다. 개발자는 시스템이 프레임워크 적용 대상 밖에 있다고 주장할 수 있지만, 외부인은 그 주장을 검증할 수 없게 됩니다.

두 번째 신호는 모델이 우려스러운 결과를 받은 뒤 어떤 일이 일어나는가입니다. 신뢰할 수 있는 절차라면 추가 안전장치, 단계적 접근, 추가 평가와 같은 문서화된 대응이 나와야 합니다.

가장 많은 것을 보여줄 사례는 출시를 앞둔 상업적으로 중요한 모델과 관련될 것입니다. 모든 까다로운 검토가 원래 일정대로 출시되는 것으로 끝난다면, 이 프레임워크는 권고 수준으로 보일 것입니다.

지연만으로 성공이 입증되는 것은 아닙니다. 당국은 모든 개입을 정의된 위험 및 그에 비례하는 해결책과 연결해야 합니다. 그렇지 않으면 테스트는 예측 불가능한 행정적 장벽이 될 수 있습니다.

세 번째 신호는 Meta, Anthropic, Google, OpenAI 및 기타 참여 개발사 전반에 걸친 비교 가능한 대우입니다. 비교 가능하다는 것은 절차가 동일하다는 뜻이 아닙니다. 동등한 위험은 동등한 수준의 검토를 받아야 한다는 의미입니다.

개방형 가중치 출시가 의미 있는 검토가 가능할 만큼 충분히 이른 단계에 절차에 들어오는지 지켜봐야 합니다. 또한 폐쇄형 제공업체가 신중히 선별한 버전만이 아니라 주요 업데이트를 제출하는지도 살펴봐야 합니다.

공개 보고는 기밀 벤치마크를 공개하지 않고도 이러한 비교를 뒷받침할 수 있습니다. 정부는 참여 일자, 광범위한 위험 범주, 완료된 완화 조치, 해결되지 않은 분쟁을 공개할 수 있습니다.

기업도 보완적 증거를 공개할 수 있습니다. 모델 카드, 시스템 카드, 사고 보고서, 버전 이력은 연방 평가 전후에 무엇이 바뀌었는지 설명할 수 있습니다.

기업 구매자는 완벽한 정책을 기다릴 필요가 없습니다. 모델 버전 관리, 보안 증거, 업데이트 공지, 접근 통제, 사고 대응 협력을 중심으로 조달 요건을 마련할 수 있습니다.

개발자는 각 배포의 기반이 되는 가정을 기록할 수 있습니다. 실용적인 engineering knowledge base는 모델 평가를 아키텍처 결정 및 이후 사고와 연결할 수 있습니다.

지식 근로자도 결과에 관심을 가져야 합니다. 모델은 단순히 텍스트를 생성하는 데 그치지 않고 점점 더 문서, 커뮤니케이션, 소프트웨어에 작용하고 있습니다. 따라서 안전 실패는 기밀 정보와 비즈니스 운영에 영향을 미칠 수 있습니다.

8월 4일 회의는 정부와 주요 연구소가 운영 규칙을 논의하도록 강제한다는 점에서 중요합니다. 그러나 이는 해당 규칙이 이미 작동하고 있다는 증거는 아닙니다.

성공적인 프레임워크는 고위험 출시 전에 예측 가능한 테스트를 마련하고, 평가에서 문제가 드러났을 때 신뢰할 수 있는 대응을 이끌어낼 것입니다. 또한 외부인이 일관성을 평가할 수 있을 만큼 충분한 정보를 공개할 것입니다.

약한 프레임워크는 비공개 회의, 공개되지 않은 기준, 협력에 관한 포괄적 주장만을 낳을 것입니다. 기업은 출시 유인을 유지하는 반면, 정부는 명확한 권한 없이 평판상 책임을 떠안게 됩니다.

향후 몇 달 안에 어떤 형태가 부상하고 있는지 드러날 것입니다. 독자들은 기준선, 첫 번째 논쟁적 결과, 그리고 배포 모델 전반의 대우를 지켜봐야 합니다.

Anthropic, Google, OpenAI, Meta에게 진정한 약속은 안전성 발견이 불편해질 때 시작됩니다. 백악관에게 시험은 개입이 정치적 또는 상업적 비용을 수반할 때 시작됩니다.

그 순간들이 오기 전까지 자발적 AI 안전성 테스트는 확정된 책임 체계가 아니라 협상 중인 프레임워크에 머물 것입니다. 문제는 첫 번째 어려운 사례가 출시를 바꾸는지, 아니면 그 출시를 둘러싼 표현만 바꾸는지입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page