top of page

Anthropic Mythos EU 액세스, 3개월 늦게 도착

49분 전
11분 분량

Anthropic은 액세스 제공을 예고한 바 있음에도 3개월이 넘는 협상 끝에 유럽연합에 Mythos 5 액세스를 제공했다. Anthropic Mythos EU 액세스 합의에 따라 유럽연합 사이버보안청(ENISA)은 제한된 사이버보안 모델을 테스트할 수 있게 됐다. 다만 더 새로운 Mythos 5.1은 포함되지 않는다.

이 차이는 지연된 인계를 더욱 중대한 사안으로 만든다. ENISA는 이제 중요한 프런티어 모델을 검토할 수 있지만, 그 평가는 이미 Anthropic의 출시 주기를 뒤따르고 있다. Anthropic은 6월에 Mythos 5를 공개했고, 9월 1일에는 Mythos 5.1을 뒤이어 출시했다.

이 격차는 Anthropic의 안전 약속과 독립적 감독이 마주하는 현실적 한계를 대비시킨다. 유럽 규제 당국은 소프트웨어 취약점을 찾아내고 잠재적으로 악용할 수 있는 시스템에 관한 직접적인 증거를 원한다. Anthropic은 규제 당국이 모델을 언제 받는지, 어떤 버전을 받는지, 그리고 어떤 안전장치가 계속 적용되는지를 통제한다.

따라서 이 분쟁은 유럽이 액세스를 확보했는지 여부에만 관한 것이 아니다. 공공 평가 기관이 자신들의 조사 결과가 실제 배포되는 모델에 여전히 적용되는 시점에 프런티어 시스템을 검토할 수 있는지가 핵심이다. 유럽 관계자들에 따르면 OpenAI는 이미 ENISA에 GPT-5.6 Cyber와 GPT-6 Astra 액세스를 제공했다.

Anthropic Mythos EU 액세스는 이전 모델을 대상으로 한다

ENISA는 Mythos 5 테스트를 시작했지만, Anthropic은 이미 가장 민감한 모델 라인을 Mythos 5.1로 옮겼다.

유럽연합 집행위원회 대변인 토마스 레니에는 9월 10일 새 합의를 확인했다. 그는 ENISA가 Anthropic과의 논의 끝에 Mythos 5를 전달받아 테스트하고 있다고 밝혔다. ENISA 액세스는 협상 시작 후 3개월이 넘어서야 이뤄졌다.

Mythos 5는 Claude Fable 5에 사용되는 것과 동일한 기반 모델의 제한 버전이다. Anthropic은 검증된 조직을 위해 일부 사이버보안 안전장치를 제거하거나 완화했다. 이러한 변경으로 승인된 방어 조직은 일반 공개 모델이 차단하는 작업을 수행할 수 있다.

이 작업에는 취약점 연구, 익스플로잇 검증, 승인된 시스템에 대한 보안 테스트가 포함될 수 있다. 이러한 활동은 정당한 방어적 가치를 지니지만, 오용될 경우 같은 능력이 공격을 지원할 수도 있다. 이에 따라 Anthropic은 무제한 공개 액세스를 제공하는 대신 통제된 프로그램을 통해 Mythos를 배포한다.

Anthropic은 6월 9일 기존 Project Glasswing 참가자를 위한 업그레이드로 Mythos 5를 출시했다. Project Glasswing은 핵심 소프트웨어와 인프라를 보호하는 조직을 위한 Anthropic의 파트너십 프로그램이다. Anthropic은 파트너를 주기적으로 추가하고 더 폭넓은 신청 절차를 마련할 계획이라고 밝혔다.

Mythos 5 출시 발표에서는 이 모델이 Glasswing 파트너와 일부 연구자에게만 제공된다고 설명했다. 또한 미국 정부와의 협의를 거쳐 확대가 이뤄질 것이라고 밝혔다. 이 조건은 액세스 결정을 기업 검토, 국가안보 정책, 기술적 위험 관리가 결합된 영역에 두었다.

ENISA는 이러한 확대의 대상이 될 것으로 예상됐다. 그러나 기대가 즉각적인 액세스로 이어지지는 않았다. 유럽 관계자들이 제한 조치가 가까운 미국 파트너를 부당하게 대우하는지 의문을 제기하는 가운데, 브뤼셀은 계속해서 Anthropic을 압박했다.

지연은 중요한 제품 전환 시점도 넘겼다. Anthropic은 ENISA 액세스가 공개되기 9일 전인 9월 1일 Mythos 5.1을 출시했다. Anthropic은 최신 모델이 사이버보안과 생물학 성능을 개선했으며, 여전히 검증된 조직에만 제공된다고 말한다.

따라서 ENISA는 최신 모델이 아니라 여전히 관련성 있는 모델을 받았다. Mythos 5를 테스트하면 Anthropic의 액세스 통제, 안전장치, 사이버 역량이 어떻게 작동하는지 파악할 수 있다. 그러나 이러한 결론을 Mythos 5.1에 자동으로 적용할 수는 없다.

작은 모델 업데이트조차 에이전트 행동, 거부 패턴, 도구 사용, 취약점 발견 방식에 변화를 줄 수 있다. 규제 기관은 평가 대상 버전이 배포 버전과 긴밀히 일치해야 한다. 그렇지 않으면 감독은 현재의 위험 평가가 아니라 과거에 대한 검토가 된다.

Anthropic Mythos EU 액세스 결정은 ENISA가 무언가를 테스트할 수 있는지에 관한 당면한 질문을 해결한다. 하지만 ENISA가 각각의 중요한 후속 모델에 시의적절한 액세스를 받을 수 있는지는 해결하지 못한다.

3개월 지연이 핵심 안전 문제다

모델 세대가 이미 바뀐 뒤에 액세스가 제공되면 독립 평가의 가치는 떨어진다.

프런티어 AI 테스트에서는 역량이 공식 정책 절차보다 빠르게 발전할 수 있으므로 시점이 중요하다. 모델 평가자는 광범위한 배포 결정이 되돌리기 어려워지기 전에 테스트를 설계하고, 실패 사례를 재현하며, 결과를 전달할 충분한 시간이 필요하다.

ENISA는 이제 Mythos 5에서 이 문제를 마주하고 있다. ENISA의 작업은 6월 모델이 취약점을 발견하고, 익스플로잇을 제안하며, 복잡한 시스템을 탐색하는 능력을 측정할 수 있다. 또한 Anthropic의 모니터링과 액세스 제한이 그러한 능력을 통제하는지도 검토할 수 있다.

그러나 유럽 관계자들은 9월의 제품 환경을 기준으로 결과를 해석해야 한다. Mythos 5.1은 이미 Anthropic의 주력 Mythos 계열 시스템이다. Anthropic은 해당 버전에 상당한 이중용도 우려가 있는 두 분야인 사이버보안과 생물학에서의 성능 향상이 포함됐다고 말한다.

이중용도 역량은 정당한 목적과 유해한 목적 모두에 활용될 수 있다. 취약점 탐지 시스템은 공격자가 움직이기 전에 유지보수 담당자가 소프트웨어를 패치하도록 도울 수 있다. 같은 시스템은 공격자가 취약한 코드를 찾아 작동하는 익스플로잇을 만드는 데도 도움을 줄 수 있다.

Anthropic은 서로 다른 액세스 계층을 통해 이 충돌에 대응한다. Fable 모델은 일반 제공을 위해 더 강한 안전장치를 사용한다. Mythos 모델은 방어적 또는 과학적 목적을 지닌 승인 조직을 위해 일부 안전장치를 완화한다.

이 구조에서 검증 절차는 핵심 안전 통제가 된다. 액세스는 모델 개발 후에 덧붙는 사소한 행정 절차가 아니다. 어떤 조직이 모델의 가장 덜 제한된 행동을 관찰할 수 있는지, 그리고 독립 기관이 Anthropic의 주장을 검증할 수 있는지를 결정한다.

이번 지연은 신뢰 기반 액세스 프로그램이 자체적인 감독 병목 현상을 만들 수 있음을 보여준다. Anthropic은 조직을 평가하고, 정부 요건을 충족하며, 위험한 액세스를 막아야 한다. 규제 기관은 결과적 위험을 평가하는 것이 자신의 권한에 속하더라도 그 절차 밖에서 협상해야 한다.

유럽 기관은 EU AI Act에 따른 집행 권한도 보유하고 있다. 테스트 중 수집된 증거가 이후 규제 조치에 활용될 수 있으므로, 이 역할은 자발적인 정보 공유를 복잡하게 만들 수 있다. 개발사는 민감한 시스템을 합리적으로 보호하면서도 선택적 감독이라는 인상을 만들 수 있다.

어느 쪽의 우려도 시점 문제를 없애지는 못한다. 기업이 새 버전 출시 후 이전 모델을 제공하면 공공 테스트 기관은 계속 한 걸음 뒤처진다. 시스템은 협조적으로 보일 수 있지만, 그러한 협력의 실질적 범위는 제한될 수 있다.

이 문제는 하나의 모델을 넘어선다. 프런티어 개발사들은 공식 평가 사이에 역량 업데이트가 도착하는 빠른 연속 출시를 점점 더 많이 하고 있다. 3개월간의 협상은 제품 세대 전체를 소진할 수 있다.

사이버 모델에서는 방어자와 공격자가 지속적으로 활동하기 때문에 문제가 더욱 뚜렷해진다. 지연된 평가는 액세스 전까지 잃어버린 방어 시간을 되돌릴 수 없다. 또한 최신 모델이 새로운 행동 양식을 도입했는지도 확인할 수 없다.

Anthropic의 자체 전략도 방어자 우위의 중요성을 인정한다. Project Glasswing은 일부 보안 조직에 취약점을 조기에 찾아 수정할 기회를 제공하도록 설계됐다. 이 우위는 누가 언제 액세스를 받는지에 달려 있다.

ENISA는 유럽 네트워크를 보호하고, 사고 대응 조정을 지원하며, 사이버보안 정책 개발을 돕는다. ENISA를 초기 테스트에서 제외하면 방어자 우위의 지리적 범위가 약화된다. 나중에 액세스를 부여하면 범위는 개선되지만, 놓친 초기 기회를 되살리지는 못한다.

핵심 질문은 추상적 의미에서 Anthropic Mythos가 무엇인지가 아니다. 중요한 것은 긴급한 보안 작업을 위해 설계된 모델에 대해 액세스 거버넌스가 그 속도를 따라갈 수 있는지다.

Anthropic의 안전 약속과 유럽의 감독 권한이 맞부딪히다

핵심 갈등은 Anthropic의 통제된 액세스 안전 모델과 독립적이고 최신의 증거를 요구하는 유럽의 요구 사이에 있다.

Anthropic은 방어 결과물을 제한적으로 제공하는 것보다 직접 액세스를 허용하는 편이 오용 위험을 더 크게 만든다고 주장한다. 개방형 프롬프팅이 가능한 악의적 운영자는 모델을 탐색하고, 요청을 다듬으며, 유해한 목표를 추구할 수 있다. 패치나 경고만 받는 사용자는 자유도가 더 낮다.

Anthropic은 Mythos를 특화된 보안 제품 뒤에 배치하기 시작했다. Claude Security는 고객 소유 코드를 스캔하고, 취약점 발견 결과를 반환하며, 사람이 검토할 패치를 제안할 수 있다. 사용자는 이 인터페이스를 통해 무제한 Mythos 액세스를 받지 않는다.

Anthropic은 보안 공급업체와도 협력해 목적에 맞게 구축된 제품에 Mythos를 통합하고 있다. 방어자 액세스 모델은 고객에게 구체적인 산출물을 제공하는 한편, 기반 모델은 통제된 인터페이스 뒤에 유지한다.

이 방식에는 장점이 있다. 직접적으로 공격적 프롬프트를 테스트할 수 있는 사람의 수를 줄인다. 또한 권한 관리, 로깅, 사람의 승인 절차가 갖춰진 기존 보안 워크플로 안에 모델 출력을 배치할 수 있다.

그러나 규제 기관은 선별된 결과물만 검토해서 제한 모델을 평가할 수 없다. 독립 테스트에는 가정에 이의를 제기하고, 예외 사례를 탐색하며, 유해한 행동을 재현할 자유가 필요하다. 이러한 활동은 Anthropic의 통제가 제한하려는 탐색 행위와 유사하다.

이로 인해 구조적 충돌이 발생한다. Anthropic은 모델과 인터페이스를 통제해 노출을 줄이려 한다. ENISA는 통제된 시연만으로는 전체 위험을 확인할 수 없기 때문에 의미 있는 액세스를 필요로 한다.

회사의 모델 카드와 내부 테스트는 유용한 증거를 제공할 수 있다. 그러나 다른 유인을 지닌 기관의 평가를 대체할 수는 없다. 개발사는 자체 벤치마크, 테스트 환경, 출시 기준, 모호한 결과에 대한 해석을 선택한다.

공공 기관은 별도의 책무를 지닌다. 이들의 과업은 제품을 개선하거나 상업적 출시 일정을 보호하는 것이 아니다. 이들은 시스템적 위험을 평가하고, 개발사를 비교하며, 기술적 행동을 공공 인프라 의무와 연결한다.

Mythos에서는 이러한 독립성이 특히 중요하다. 이 모델은 성공적인 출력이 즉각적인 운영상 결과를 낳을 수 있는 사이버보안 작업을 목적으로 한다. 하나의 발견은 널리 쓰이는 소프트웨어 구성 요소를 노출할 수 있으며, 익스플로잇은 패치가 나오기 전에 조직을 위협할 수 있다.

기밀 시스템 테스트는 가능성과 불확실성을 모두 보여준다. 익명의 미국 정부 관계자는 Mythos가 몇 시간 안에 민감한 정부 시스템의 취약점을 식별했다고 말했다.

해당 관계자는 약점을 찾는 것과 이를 성공적으로 악용하는 것은 다르다고 구분했다. 취약점 발견과 신뢰할 수 있는 침입은 서로 다른 역량 임계값이기 때문에 이 구분은 중요하다. 특히 극적인 주장이 기술적 증거보다 더 빠르게 확산될 때, 공개 논의에서는 이 둘이 혼동될 수 있다.

마크 워너 상원의원은 6월 청문회에서 이 시험을 더 강하게 묘사했다. 그는 NSA와 사이버사령부 수장의 설명을 인용하며, 이 도구가 수 시간 안에 시험 대상 기밀 시스템의 거의 전부에 침입했다고 말했다.

NSA와 Anthropic은 보도된 실험에 대해 논평을 거부했다. 상세한 방법론이 없으면 독립 관찰자들은 시험 대상 시스템, 모델의 자율성, 인간의 지원 수준, 성공 기준을 판단할 수 없다.

이후 100명 이상의 사이버보안 전문가와 업계 리더들은 Mythos가 유일하게 뛰어난 역량을 갖췄다는 주장에 이의를 제기했다. 이들은 다른 파운데이션 모델과 오픈소스 모델도 보안 감사와 교육을 지원할 수 있다고 말했다.

이러한 이견은 독립 평가의 필요성을 더욱 뒷받침한다. Mythos가 유독 위험하다면 규제 당국은 그 위험을 이해할 수 있도록 최신 버전에 접근해야 한다. 그 능력이 경쟁 시스템과 유사하다면, 지나치게 선별적인 접근 정책은 Anthropic이 주장하는 것만큼의 안전성을 제공하지 못할 수 있다.

Anthropic Mythos의 영향은 평판만으로 측정할 수 없다. 비교 가능한 모델, 환경, 보호 조치, 버전에 걸친 재현 가능한 시험이 필요하다. ENISA의 작업은 접근 권한이 기술적으로 의미 있는 수준으로 유지되는 한 이러한 증거에 기여할 수 있다.

유럽은 접근 권한을 얻었지만, 동등한 가시성은 아니다

이번 협약은 대서양 양안의 접근 격차를 좁히지만 Anthropic의 최신 시스템에 대한 동등한 가시성을 보장하지는 않는다.

Anthropic은 6월 Project Glasswing을 15개국 이상 약 150개 추가 조직으로 확대했다. 이번 확대는 훨씬 작은 초기 그룹을 대상으로 한 4월 프리뷰에 이은 것이다.

곧이어 미국 정부는 외국의 Mythos 5 및 Fable 5 접근에 영향을 미치는 임시 제한 조치를 부과했다. Anthropic은 요구된 수준에서 즉시 지침을 집행할 수 없다고 밝히며 광범위하게 접근을 차단했다.

회사 설명에 따르면, 이 제한은 Anthropic에서 근무하는 외국 국적자에게도 적용됐다. 미국 당국은 잠재적 보안 문제를 이유로 든 것으로 알려졌다. Anthropic은 정부의 대응이 정당했는지에 이의를 제기했다.

이후 승인된 미국 조직에는 접근 권한이 복구됐다. 그러나 이 사례는 국가 정책이 민간 접근 프로그램을 얼마나 신속하게 중단시킬 수 있는지를 보여줬다. 또한 해외에서 통제되는 기술에 대한 의존을 논의할 구체적 이유를 유럽 관리들에게 제공했다.

이 우려는 킬 스위치 문제와 닮아 있다. 유럽 조직은 미국 모델을 중심으로 보안 프로세스를 구축한 뒤, 자신들의 통제를 벗어난 정부 결정으로 접근 권한을 잃을 수 있다. 적극적인 사고 대응이 진행 중인 상황에서는 일시적인 중단조차 중요할 수 있다.

ENISA에 Mythos 5를 제공하는 것은 이러한 의존의 한 부분을 줄인다. 유럽 평가자들은 이제 Anthropic이나 미국 기관에 전적으로 의존하지 않고 자체 증거를 생성할 수 있다. 유럽의 우선순위와 인프라 가정을 기준으로 모델을 시험할 수 있다.

이 협약이 버전 간 불평등을 없애는 것은 아니다. Anthropic의 공개 정보에 따르면 Mythos 5.1은 여전히 일부 미국 조직으로 접근이 제한돼 있다. 회사는 접근 확대를 추진 중이지만 확정된 유럽 일정은 공개하지 않았다.

이러한 양상은 다른 곳에서도 보인다. 영국 AI Security Institute는 출시 전 Mythos 5.1에는 접근하지 못했지만, 이전 Mythos 시스템에는 접근한 것으로 알려졌다. 영국의 시험 격차는 관리들이 분절된 국제 평가를 경고하도록 만들었다.

Anthropic은 이전에 영국 연구소와 긴밀히 협력해 왔다. 따라서 보도된 배제는 단순한 일정 지연 이상의 신호다. 이는 기존 정부 파트너에게조차 접근 권한이 축소될 수 있음을 시사한다.

OpenAI는 이 기사의 주된 갈등이 되지 않으면서도 유용한 비교 사례를 제공한다. 유럽 관리들은 ENISA가 GPT-5.6 Cyber와 GPT-6 Astra를 제공받았다고 말한다. 영국 역시 자국 연구소가 공개 출시 전에 GPT-6 Astra를 시험했다고 밝혔다.

이러한 협력 방식은 Anthropic에 압박을 가한다. 규제 당국은 모델 역량뿐 아니라 개발사의 협력 수준도 비교할 수 있다. 기업의 평가 정책은 정부가 그 기업의 더 폭넓은 안전 약속을 신뢰하는지에 영향을 미칠 수 있다.

이 비교에도 주의가 필요하다. 공개 보도만으로는 ENISA가 여러 모델에 걸쳐 동일한 접근 조건을 제공받았는지 알 수 없다. 시험 기간, 도구 권한, 모델 스냅샷, 모니터링, 보호 조치 설정은 모두 결과에 영향을 줄 수 있다.

모델명만으로 평가의 동등성이 확립되지는 않는다. ENISA는 무엇을 시험했고 해당 시스템이 실제 배포 환경과 얼마나 유사한지 설명할 수 있을 만큼의 기술적 세부 정보를 확보해야 한다. 이러한 공개가 없다면 독자는 기업 간 접근 권한을 비교할 수 없다.

유럽 당국도 자체적인 신뢰성 시험에 직면해 있다. 모델을 제공받는다고 해서 엄격하거나 시의적절한 평가가 보장되는 것은 아니다. ENISA는 민감한 시험을 위한 적절한 인프라, 전문 인력, 보안 절차를 갖췄음을 보여야 한다.

그 결과물은 신중하게 다뤄져야 한다. 익스플로잇 세부 정보를 너무 이르게 공개하면 위험이 커질 수 있다. 반대로 포괄적인 결론만 공개하면 외부 연구자들이 증거를 검토하기 어려워질 수 있다.

유용한 평가는 여러 층위를 구분해야 한다. 취약점 발견과 익스플로잇 생성, 자율적 행동과 인간 지원, 실험실 성공과 유지관리되는 시스템에서의 성과를 분리해야 한다.

또한 시험 중 존재한 보호 조치도 문서화해야 한다. Mythos 5는 선택된 사이버 보호 조치가 해제된다는 점에서 Fable 5와 크게 다르다. 제한된 인터페이스를 시험하면 운영 파트너에게 제공되는 접근 권한을 시험하는 것보다 더 적은 사실만 드러날 것이다.

유럽 기업에 이것은 먼 정책 논쟁이 아니다. 보안팀은 궁극적으로 통합 제품을 통해 Mythos가 생성한 결과를 받을 수 있다. 이들은 그러한 결과의 신뢰성, 출처, 긴급성을 판단해야 한다.

조직은 주변 증거를 검색 가능한 지식 기반에 보존해야 한다. 모델이 생성한 경보는 검토자가 이를 코드 변경, 이전 사고, 인간의 의사결정과 연결할 수 있을 때 더 큰 가치를 얻는다.

더 넓은 교훈은 모델 접근과 모델 주권이 동일하지 않다는 점이다. ENISA는 미국 시스템을 시험할 수 있지만, 그 가용성, 업데이트 주기, 운영 조건을 통제하지는 못한다. 유럽은 가시성을 얻지만, Anthropic은 관문을 유지한다.

Mythos 5.1은 가장 중요한 질문을 열어 둔다

가장 큰 불확실성은 Anthropic이 새로운 Mythos 세대마다 독립 평가자에게 시의적절한 접근 권한을 제공할지 여부다.

Anthropic은 Mythos 5.1을 사이버보안과 생물학 분야에서 성능이 향상된 최신 Mythos급 모델로 설명한다. 두 역량 영역 모두 유익한 연구나 심각한 피해를 지원할 수 있기 때문에, 회사는 검증된 조직으로 접근을 제한한다.

Anthropic의 Mythos 5.1 접근 페이지는 현재 이용 가능 범위가 여전히 제한적이라고 밝힌다. 또한 Cyber Verification Program이 향후 Mythos 접근을 포함할 것이라고 말하지만, 확정된 날짜는 제시하지 않는다.

이 표현은 세 가지 미해결 질문을 남긴다. 첫째, 어떤 국제 규제 기관이 자격을 얻는지 명시하지 않는다. 둘째, 출시 전 접근을 약속하지 않는다. 셋째, 승인된 평가자가 어느 수준의 직접 상호작용을 제공받을지 정의하지 않는다.

이 세부 사항은 프로그램이 의미 있는 감독을 만들어내는지 결정한다. 출시 후 접근은 연구를 지원하지만, 최초 배포 결정에는 영향을 미칠 수 없다. 제한된 인터페이스는 방어적 가치는 드러내면서 공격적 행동은 숨길 수 있다.

버전 일치 문제도 있다. Anthropic은 Fable 5.1과 Mythos 5.1이 기반 모델을 공유한다고 말한다. 이들의 보호 조치는 특히 사이버보안 및 생물학 작업에서 다르다.

평가자는 Fable의 결과가 Mythos를 설명한다고 가정할 수 없다. 안전 개입은 작업을 차단하거나 다른 모델로 전환하거나 관측된 완료율을 바꿀 수 있다. 기반 가중치는 배포된 시스템의 한 부분일 뿐이다.

마찬가지로 Mythos 5의 결과만으로 Mythos 5.1에 관한 질문을 해결할 수는 없다. 최신 모델은 더 긴 공격 사슬을 따르거나, 도구를 다르게 사용하거나, 실패한 시도에서 더 효과적으로 회복할 수 있다. 모니터링 아래에서 더 안전하게 행동할 수도 있다.

Anthropic은 시스템 카드와 벤치마크 설명을 공개하며, 이는 내부 평가에 대한 가시성을 높인다. 그러나 벤치마크 점수에는 맥락이 필요하다. 시험 설계, 스캐폴딩, 시행 횟수, 보호 조치 개입은 결과를 실질적으로 바꿀 수 있다.

사이버보안 벤치마크는 시간이 지나면 진부해질 위험도 있다. 작업과 취약점이 널리 알려지면 학습 데이터 오염을 배제하기가 더 어려워진다. 벤치마크 성능이 낯선 운영 시스템에 대한 성공을 예측하지 못할 수 있다.

운영 환경 시험은 또 다른 복잡성을 낳는다. 실제 네트워크에는 신원 통제, 로깅, 세분화, 방어 도구가 존재한다. 격리된 환경에서 성공한 모델도 이러한 계층이 상호작용할 때는 어려움을 겪을 수 있다.

반대로 모델은 자율 침입을 완료하지 않고도 위험을 만들 수 있다. 정찰을 가속하거나, 공격 경로를 제안하거나, 인간 운영자가 더 빠르게 반복 작업하도록 도울 수 있다. 평가는 이러한 중간 단계의 이점도 측정해야 한다.

따라서 Anthropic의 제한적 배포 전략은 자동적인 승인도 자동적인 거부도 받을 이유가 없다. 이 전략은 실제 오용 문제를 다룬다. 동시에 증거와 의사결정을 회사 및 일부 정부 관계에 집중시킨다.

회의적인 검증 기준은 단순하다. 통제된 접근이 핵심 안전 메커니즘이라면, Anthropic은 독립 평가자들이 유용한 조건에서 최신 모델을 제공받는다는 점을 보여야 한다. 그렇지 않으면 이 메커니즘은 오용과 함께 모델을 검증으로부터도 보호하게 된다.

ENISA의 Mythos 5 평가는 기준선을 세울 수 있다. 기관이 방법론을 공개하고, 보호 조치 설정을 설명하며, 확인된 관찰 결과와 공급업체 주장을 구분한다면 그 가치는 커질 것이다.

명확한 최신 모델과의 연결 없이 또 다른 주요 업데이트 이후에 발표된다면, 평가는 더 적은 비중을 갖게 된다. 시의성은 행정적 각주가 아니라 안전 결과의 일부가 되어야 한다.

세 가지 신호가 접근이 감독으로 이어지는지 보여줄 것이다

다음 시험대는 이번 인계가 일회성 양보가 아니라 재현 가능한 평가 프로세스가 되는지 여부다.

첫 번째 신호는 Mythos 5.1에 대한 접근이다. Anthropic이 제한 없는 공개 이용을 제공할 필요는 없지만, ENISA에는 최신 평가 대상이 필요하다. 신속한 접근은 3개월 지연이 과도기적 제약을 반영했다는 주장을 강화할 것이다.

계속된 배제는 그 설명을 약화할 것이다. 이는 선별된 미국 조직이 더 새로운 역량을 제공받는 동안 유럽의 감독은 이전 출시 버전에 묶여 있음을 보여줄 것이다.

두 번째 신호는 ENISA의 평가 방법론이다. 기관은 시험한 버전, 접근 조건, 도구 권한, 보호 조치, 광범위한 작업 범주를 식별해야 한다. 또한 취약점 발견과 성공적인 익스플로잇을 구분해야 한다.

유용한 보고에 위험한 기술 세부 사항의 공개가 필요한 것은 아니다. 다만 시험이 실제 Mythos 행동을 검토했는지 평가할 수 있을 만큼의 정보는 필요하다. 모델이 평가됐다는 모호한 발표만으로는 책임성을 거의 높이지 못한다.

세 번째 신호는 지속 가능한 국제 접근 프레임워크다. Anthropic의 Cyber Verification Program은 명확한 기준, 예측 가능한 검토 기간, 자격을 갖춘 공공 평가자에 대한 일관된 대우를 마련한다면 그러한 구조를 제공할 수 있다.

신뢰할 수 있는 프레임워크는 제한된 접근이 안전하게 확대될 수 있다는 Anthropic의 주장을 뒷받침할 것이다. 사례별 협상이 다시 이어진다면 선택적이고 정치적으로 취약한 감독에 대한 우려는 더욱 커질 것이다.

개발자와 기업 구매자는 평가 접근성이 이후의 신뢰를 좌우한다는 점에서 이러한 신호를 주시해야 합니다. 보안 책임자들은 모델 자체와 직접 상호작용하지 않고도 제품을 통해 Mythos 결과를 받을 수 있습니다.

이들은 오탐, 놓친 취약점, 데이터 처리, 인간 검토에 관한 근거를 필요로 합니다. 또한 정책 분쟁이나 모델 전환 과정에서 접근 권한이 사라질 수 있는지도 물어봐야 합니다.

따라서 Anthropic Mythos EU 접근 협약은 출발점일 뿐, 해결책은 아닙니다. 유럽은 마침내 6월 모델을 확보했지만, Anthropic은 9월 후속 모델을 통제하고 있습니다.

다음 인수인계를 면밀히 지켜봐야 합니다. ENISA가 Mythos 5.1을 신속히 받고 신뢰할 수 있는 테스트 프레임워크를 공개한다면, 지연된 접근성은 지속적인 감독으로 이어질 수 있습니다. 그렇지 않다면 최첨단 AI 평가는 자신이 관리해야 할 제품 주기 뒤에 계속 갇혀 있게 될 것입니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page