top of page

Anthropic AI 오용 사례가 드러낸 생물학적 안전장치의 한계

3일 전
12분 분량

Anthropic은 과학적으로는 정당해 보이는 연구가 많았음에도 무기 관련 우려를 불러일으킨 활동을 감지한 뒤, 5건의 생물학 연구 사례와 연결된 계정을 차단했다. Anthropic의 AI 오용 공개는 이론적 안전 논쟁을 계정 단위의 집행 문제로 바꿔 놓는다.

회사는 Claude가 누군가의 생물무기 제작을 도왔다고 주장하지 않는다. 또한 해당 과학자들이 해를 끼칠 의도가 있었는지도 판단할 수 없었다고 밝혔다. 대신 보고서는 연구자들이 위치, 신원 또는 연구 세부사항을 숨긴 채 이중용도 연구를 진행한 사례를 설명한다.

이 구분은 중요하다. Anthropic은 프롬프트, 기관 소속, 접근 방식, 연구 패턴을 함께 고려할 때 우려스러워 보이는 활동을 발견했다. 그러나 개별 요청은 때때로 일반적인 백신, 치료제 또는 질병 연구와 유사했다.

이는 단순히 안전한 AI와 안전하지 않은 AI의 대결보다 더 첨예한 갈등을 만든다. 프런티어 모델은 가치 있는 과학을 지원할 수 있지만, 같은 지원이 위험한 연구를 진전시킬 수도 있다. 모호한 요청을 모두 차단하면 정당한 과학자들에게 실질적 비용이 발생한다.

Anthropic의 대응은 OpenAI, Google, Meta, 모델 리셀러, 클라우드 제공업체와 정부에도 압박을 가한다. 한 제공업체의 안전장치는 사용자가 거부된 요청을 다른 모델로 우회할 수 있을 때 제한적인 보호만 제공한다.

Anthropic AI 오용 조사에서 생물학 관련 5건 발견

핵심 변화는 Anthropic이 통제된 안전성 평가에서만이 아니라 실제 사용자 사이에서 생물학적 오용 가능성을 관찰했다고 밝힌 점이다.

Anthropic은 2026년 9월 10일 조사 결과를 공개했다. 이번 공개는 2025년 3월 이후 회사가 발표한 세 번째 공개 위협 인텔리전스 보고서의 일부였다.

보고서는 2025년 12월부터 2026년 8월 사이에 탐지된 악의적 활동과 정책 위반 활동을 다뤘다. 더 광범위한 사례에는 사이버범죄, 감시, 선전, 재래식 무기 작업, 모델 역량 복제 시도가 포함됐다.

생물학 부문은 5건의 조사를 설명했다. 이들은 바이러스, 면역 회피, 포유류 적응, 독 펩타이드, 재설계된 독소와 관련된 연구를 포함했다.

Anthropic은 연구자들의 이름, 국가, 기관과 여러 기술 세부사항을 공개하지 않았다. 특히 의도가 불분명한 상황에서 공개가 활동 중인 과학자들을 위험에 노출할 수 있다고 설명했다.

이 불확실성은 보고서를 이해하는 데 필수적이다. 회사는 완성된 무기, 배치 계획 또는 발병을 일으키려는 확인된 시도를 특정하지 않았다.

그럼에도 더 제한적인 주장은 중요하다. Anthropic은 행위자들이 생물무기 개발을 지원할 수 있는 작업에 Claude를 사용했으며, 핵심 맥락을 반복적으로 숨기려 했다고 밝혔다.

가장 상세한 사례는 2026년 5월에 시작됐다. 생물학 안전성 분류기가 치쿤구니야 바이러스와 관련된 과학 연구비 지원서 작성을 도와달라는 요청을 차단했다.

제안된 작업에는 생물체에 새롭거나 강화된 생물학적 특성을 부여하도록 설계된 실험인 기능 획득 연구가 포함됐다. 프로젝트는 전파와 면역 회피에 초점을 맞췄다.

이러한 연구는 백신과 치료제를 지원할 수 있다. 그러나 병원체를 더 해롭게 만들 수도 있어, 과학적 표현만으로 의도를 판단하기 어렵다.

Anthropic은 제안된 실험이 군사 연구기관과 연관돼 있다는 점에서 더 큰 우려를 나타냈다. 지원서에 포함된 정보에 따르면 연구자들은 민간인이었던 것으로 보인다.

사용자들은 Anthropic이 Claude를 제공하지 않는 지역에도 있었다. 한 플랫폼은 이런 지리적 제한을 우회하기 위해 미국 인프라를 통해 트래픽을 터널링한 것으로 전해졌다.

Anthropic의 오용 조사에 따르면, 이 플랫폼은 중개자, 합성 계정, 제로 데이터 보존 서비스를 사용했다. 해당 서비스는 이후 조사를 위해 이용할 수 있는 기록을 제한했다.

Anthropic은 관련 계정을 차단하고, 중계 인프라 비활성화를 지원했으며, 다른 AI 기업과 정부 당국에 통보했다고 밝혔다. 그러나 운영자는 새 계정을 사용해 며칠 안에 접근을 복구했다.

이 서비스는 거부된 생물학 관련 프롬프트를 더 관대한 통제를 갖춘 경쟁 모델로 보내기 시작했다. Claude는 과도한 거부를 줄이는 작업으로 제시된 뒤 라우팅 코드 작성에 도움을 준 것으로 알려졌다.

이러한 연쇄는 이 사례를 단순한 개별 금지 프롬프트보다 더 중대한 사건으로 만든다. 집행 조치는 접근을 중단시켰지만, 더 광범위한 모델 쇼핑 시스템을 제거하지는 못했다.

두 번째 조사는 미국 밖의 사용자가 수행한 조류 인플루엔자 연구와 관련됐다. 이 연구는 포유류 적응과 호흡기계를 넘어선 중증 질환을 검토했다.

Anthropic은 안전장치가 해당 연구자를 성능이 낮은 모델로 제한했다고 밝혔다. 이 제한은 프로젝트가 공중보건을 위한 것인지 유해한 프로그램을 위한 것인지 판단하지 못한 채 접근만 제한했다.

세 번째 사례는 서로 관련 없는 12명 이상의 고객에게 서비스를 제공하는 중계와 관련됐다. Anthropic은 이 중계가 며칠간 Claude와 수만 건의 메시지를 주고받았다고 밝혔다.

한 고객은 약 한 시간 동안 Opus 5를 사용해 오르토폭스바이러스 면역 회피와 관련된 연구비 지원서를 작성했다. Claude는 가설, 실험 설계, 통계, 비상 계획 수립을 지원한 것으로 알려졌다.

모델은 해당 세션을 차단하지 않았다. Anthropic은 프로젝트가 일반적으로 생물학적 작용제의 유해한 특성을 줄인다는 의미의 약독화를 중심으로 제시됐다고 밝혔다.

마지막 사례들은 독 유래 화합물과 재설계된 독소를 포함했다. 두 프로젝트 모두 치료적 맥락으로 제시됐지만, Anthropic은 국가 지원 연구와 의도적인 은폐를 시사하는 정황 신호를 발견했다.

이 5건은 Anthropic의 생물학 안전 논거를 실험실 테스트에서 관찰된 행동으로 옮겨 놓았다. 그러나 생물무기가 제작되고 있었다는 사실을 입증하지는 않았다.

원 보도는 이 구분을 신중하게 포착했다. Anthropic은 확인된 무기 프로그램을 중단시킨 것이 아니라 무기 개발을 지원할 수 있었던 연구를 차단했다.

안전장치는 작동했지만, 일부 경우에 그쳤다

Anthropic의 증거는 안전 필터가 위험해 보이는 요청을 차단할 수 있음을 보여주는 동시에, 집요한 사용자는 여전히 모호성과 경쟁 서비스를 악용할 수 있음을 보여준다.

회사는 여러 방어 계층을 사용했다. 여기에는 콘텐츠 분류기, 계정 조사, 지역 접근 통제, 모델 역량 제한, 외부 파트너와의 협력이 포함됐다.

분류기는 정책 위반이나 안전 위험을 위해 요청을 평가하는 자동화 시스템이다. 활동을 차단하거나, 다른 경로로 유도하거나, 인간 검토를 위해 표시할 수 있다.

치쿤구니야 사례에서 분류기는 연구비 지원서 작성 요청을 거부한 것으로 알려졌다. 이 초기 차단은 Anthropic 조사관들에게 주변 계정과 인프라를 검토할 근거를 제공했다.

이후 조사는 프롬프트만으로는 알 수 없는 정보를 드러냈다. 관련 신호에는 군 관련 소속, 위치 은폐, 그레이마켓 접근, 거부를 다른 곳으로 우회하려는 시도가 포함됐다.

이는 Anthropic의 접근방식을 뒷받침하는 가장 강력한 논거다. 콘텐츠 조정은 계정 이력, 기관 맥락, 네트워크 행동과 결합될 때 더욱 유용해진다.

그러나 같은 사례는 여러 약점도 드러냈다. 플랫폼은 접근을 되찾았고, 고객들은 중개자를 통해 계속 Claude에 접근했으며, 다른 모델들은 Claude가 거부한 요청을 수용했다.

독소 관련 조사는 다른 문제를 드러냈다. Anthropic은 이들 프로젝트가 자사의 생물학 분류기로부터 대체로 방해받지 않고 진행됐다고 밝혔다.

이 결과는 부분적으로 의도된 것이었다. 분류기는 초보자가 알려진 생물무기를 통해 재앙적 피해를 일으킬 수 있는 지침을 얻는 일을 막는 데 초점을 맞췄다.

이 사례의 연구자들은 명백한 질문을 하는 초보자가 아니었다. 이들은 치료적 및 유해한 용도를 모두 지닌 새로운 화합물을 연구하는 전문 연구자들이었다.

독소, 병원체 또는 유전자 변형에 관한 모든 논의를 거부하는 필터는 Claude의 과학자 대상 유용성을 크게 떨어뜨릴 것이다. 또한 정당한 작업 전반에서 오탐을 만들어낼 것이다.

따라서 Anthropic은 두 가지 뚜렷한 위험에 직면했다. 관대한 시스템은 유해한 연구를 지원할 수 있는 반면, 공격적인 시스템은 의학, 공중보건, 기초과학을 방해할 수 있다.

회사의 최신 모델은 더 광범위한 이중용도 생물학 질의에 대해 더 엄격한 제한을 적용하는 것으로 알려졌다. 이러한 통제는 모델 역량에 대한 Anthropic의 변화된 평가를 반영한다.

Anthropic은 이전에 Claude Opus 4와 Claude Sonnet 4.5가 위험한 생물학 지원 임계값보다 훨씬 낮다고 판단했다. 현재 보고서는 최신 시스템에 대해서는 이 보장을 철회한다.

회사는 오늘날의 모델이 정밀하게 측정된 임계값을 넘었다고 말하지 않는다. 대신 이용 가능한 증거가 더는 기존의 확신을 뒷받침하지 않는다고 말한다.

이는 의미 있는 변화다. 과학적 추론 역량과 함께 불확실성이 커지면서 안전 조치는 더 엄격해지고 있다.

Anthropic은 생물학 사례가 일반적으로 자사의 최신·최고 성능 시스템을 포함하지 않았다고도 밝혔다. 불법적인 모델 추출 작전이 보고된 주요 예외였다.

이는 이야기를 복잡하게 만든다. 관찰된 오용은 최신 모델이 결정적인 생물학 역량 증가를 만들어냈다는 사실을 보여주지 않는다.

대신 이 보고서는 이전 및 현재 서비스가 더 넓은 연구 워크플로에 편입되고 있음을 보여준다. 그 가치는 초안 작성, 종합, 계획, 분석, 소프트웨어 지원에서 나왔다.

따라서 Anthropic AI 오용 사례는 재앙적 역량을 입증하기 전에 운영상의 문제를 드러낸다. 사용자는 작업을 모델, 계정, 서비스 제공업체 전반에 분산할 수 있다.

한 지점의 거부는 라우팅 지침이 될 수 있다. 해지된 계정은 새 신원이 될 수 있다. 차단된 지역은 미국 인프라를 통과하는 트래픽이 될 수 있다.

이러한 행동은 기존의 사이버보안 패턴과 닮아 있다. 방어 시스템은 개별 요청뿐 아니라 지속적인 캠페인을 평가해야 한다.

Anthropic은 군사 및 정보 분야 응용에서도 비슷한 결론에 도달했다. 별도의 무기 평가에서는 모델이 한때 희소한 전문가에게만 맡겨졌던 작업을 수행할 수 있음을 발견했다.

그 결과 안전 모델은 지속적인 관찰에 의존한다. 그러나 더 많은 관찰은 그 자체로 개인정보 보호, 접근성, 거버넌스 문제를 낳는다.

이중용도 생물학에서 의도는 가장 파악하기 어려운 신호다

쟁점은 생물학 연구가 위험할 수 있는지 여부가 아니라, AI 제공업체가 유익한 과학과 유해한 준비를 신뢰성 있게 구분할 수 있는지다.

이중용도 연구는 유익한 용도와 유해한 용도를 모두 지닌 지식 또는 기술을 생산한다. 생물학에는 같은 메커니즘이 치료제, 백신, 독소, 무기에 영향을 미치기 때문에 많은 사례가 있다.

바이러스가 면역을 회피하는 방식을 연구하는 과학자는 발병 탐지를 개선하고 있을 수 있다. 다른 행위자는 유사한 발견을 병원체의 유해한 영향을 강화하는 데 사용할 수 있다.

사용되는 용어는 거의 동일하게 유지될 수 있다. 장비, 데이터세트, 실험 방법, 문헌도 겹칠 수 있다.

Anthropic은 정교한 행위자들이 그럴듯한 부인을 유지하기 위해 이러한 모호성을 악용할 수 있다고 밝혔다. 연구자들조차 국가 프로그램의 궁극적 목표를 완전히 알지 못할 수 있다.

그 주장은 역사적 근거를 지닌다. 대규모 국가 프로그램은 민감한 업무를, 자신의 기여가 어떻게 활용될지 항상 알지는 못했던 전문가들 사이에 분담해 왔다.

그러나 역사적 전례가 Anthropic의 다섯 사례에 담긴 의도를 입증하는 것은 아니다. 회사 역시 그러한 비난을 명시적으로 피하고 있다.

이들의 집행 결정은 복합적인 위험 신호에 근거했다. 여기에는 지원되지 않는 위치, 군사 연계, 숨겨진 신원, 난독화된 용어, 안전장치를 무력화하려는 시도가 포함됐다.

그처럼 넓은 맥락조차 오류를 낳을 수 있다. 제한 국가의 연구자들은 무기를 개발하기 때문이 아니라 더 나은 과학 도구에 접근하려고 중계 서버를 사용할 수 있다.

군사 기관은 방어적 연구를 수행할 수 있다. 독소 최적화는 통증 치료제로 이어질 수 있다. 바이러스 적응 연구는 감시와 대비 태세를 개선할 수 있다.

그렇기 때문에 차단된 활동을 저지된 생물무기 음모 다섯 건으로 묘사해서는 안 된다. Anthropic의 증거는 우려, 조사, 제한을 뒷받침하지만 그 결론까지 뒷받침하지는 않는다.

일부 과학자들은 이미 AI 안전 필터가 일상적인 실험실 질문을 방해한다고 보고한다. 연구자들은 The Atlantic에 Claude와 ChatGPT가 바이러스 유전학 및 병원체 비활성화와 관련된 논의를 차단했다고 말했다.

과학계의 비판은 광범위한 제한의 대가를 보여준다. 시스템은 한 가지 위험을 줄이는 동시에 가치 있는 연구 지원의 질을 떨어뜨릴 수 있다.

OpenAI는 해당 매체에 자사 모델이 해를 초래할 수 있는 생물학적 정보를 제공하지 않는다고 밝혔다. 또한 정당한 연구자들에게 검증된 접근 프로그램을 안내했다.

검증된 접근은 하나의 가능한 절충안이다. 제공업체는 승인된 기관에 더 폭넓은 기능을 제공하는 한편, 익명 또는 미검증 사용자에게는 더 엄격한 통제를 적용할 수 있다.

Anthropic도 보고서에서 비슷한 결론에 도달한다. 고성능 생물학 지원은 신뢰할 수 있는 사용자 프로그램을 통해 운영될 필요가 있을 수 있다고 주장한다.

이 접근법은 안전 결정을 프롬프트 문구만으로 판단하는 방식에서 벗어나게 한다. 신원, 기관, 위치, 프로젝트 이력, 책임성이 접근 통제의 일부가 된다.

이러한 절충은 여전히 어렵다. 신뢰 기반 접근 시스템은 기존의 대형 연구실에 유리하게 작용하는 반면, 독립 연구자, 소규모 기관, 정치적으로 제한된 지역의 과학자들을 배제할 수 있다.

또한 민간 기업에 권한을 집중시킬 수 있다. 이들 기업이 어떤 기관이 자격을 갖추는지, 어떤 과학 주제가 더 큰 심사를 받아야 하는지를 결정하게 된다.

거짓 음성도 여전히 가능하다. 검증된 조직이 접근 권한을 오용하거나, 프로젝트를 숨기거나, 불완전한 정보를 제공할 수 있다.

Anthropic의 발견은 보편적 접근이나 보편적 거부 어느 쪽도 문제를 해결하지 못하는 이유를 보여준다. 실질적인 질문은 서로 다른 검증 수준에서 사용자에게 어느 정도의 역량을 제공할 것인가가 된다.

회사는 위협 탐지를 위해 데이터를 얼마나 오래 보관할지도 결정해야 한다. 무보존 데이터 협약은 기밀 연구를 보호하지만 조사관이 오용 사례를 재구성하는 것을 막을 수 있다.

이는 개인정보 보호와 안전 간의 직접적인 충돌을 만든다. 민감한 과학 연구에는 종종 기밀성이 필요하지만, 조직적인 악용을 탐지하려면 시간에 걸친 활동을 연결할 수 있는 충분한 기록이 필요하다.

따라서 계정 모니터링은 모델 정렬만큼 중요해진다. 이러한 변화는 기밀 기술 정보를 다루는 연구실, 기업, 지식 노동자에게 영향을 미칠 것이다.

조직은 어떤 모델에 민감한 데이터가 제공되는지, 어떤 계정에 접근 권한이 있는지, AI가 생성한 작업이 어떻게 연구 의사결정에 들어가는지를 문서화해야 할 수 있다. 관리형 AI 지식 베이스는 근본적인 안전 정책을 결정하지 않으면서도 이러한 기록 관리를 지원할 수 있다.

중요한 점은 책임성이다. 모델 응답이 고위험 과학 워크플로 내에서 보이지 않는 단계가 되어서는 안 된다.

Anthropic의 공개가 모든 최첨단 AI 제공업체에 가하는 압박

가장 취약한 제공업체, 리셀러 또는 오픈 모델은 더 신중한 서비스가 부과한 안전장치를 약화시킬 수 있다.

Anthropic의 주된 상대는 특정 기업 하나가 아니다. 안전 기준이 서로 다르고 사용자가 시스템 간에 작업을 옮길 수 있는 분절된 AI 시장이다.

치쿤구니야 조사 사례는 이를 직접적으로 보여준다. Claude가 특정 요청을 거부했을 때, 중개자는 이를 다른 모델로 보낸 것으로 전해진다.

그 대체 수단은 고객 경험을 유지하는 동시에 Claude의 거부 목적을 무력화했다. 해당 요청을 받은 제공업체는 공개되지 않았다.

이러한 패턴은 집단행동 문제를 만든다. 한 회사는 더 엄격한 통제에 따른 상업적·과학적 비용을 부담하는 반면, 다른 서비스는 거부된 수요를 흡수한다.

사용자는 민감한 프로젝트를 더 작은 작업으로 나눌 수도 있다. 어느 하나의 프롬프트도 전체 목적을 드러낼 필요가 없다.

한 모델은 문헌을 요약할 수 있다. 다른 모델은 코드를 생성할 수 있다. 세 번째 모델은 제안서를 편집하고, 외부 생물학 도구가 전문 설계 업무를 처리할 수 있다.

관련 의도가 전체 워크플로에 걸쳐서만 드러날 때 제공업체 수준의 안전장치는 어려움을 겪는다. 각 서비스는 부분적인 기록만 본다.

오픈 웨이트 모델은 또 다른 복잡성을 더한다. 소프트웨어 매개변수를 내려받아 제공업체가 호스팅하는 집행 시스템 밖에서 운영할 수 있기 때문이다.

Anthropic의 재래식 무기 연구는 테스트한 오픈 웨이트 모델이 최첨단 모델에 뒤처졌음을 발견했다. 그럼에도 일부 모델의 표적화 및 공학 역량은 우려스럽다고 판단했다.

이는 집행이 최첨단 기업에만 전적으로 의존할 수 없음을 뜻한다. 중앙화된 계정 차단, 트래픽 모니터링, 지역 제한이 없는 모델로도 역량이 확산될 수 있다.

호스팅 제공업체는 중요한 이점을 유지한다. 분류기를 업데이트하고, 클러스터를 조사하며, 계정을 정지하고, 다른 회사와 지표를 공유할 수 있다.

9월 보고서는 Anthropic이 이러한 역량을 사용하는 모습을 보여준다. 계정을 차단하고, 안전장치를 수정하고, 관련 활동을 모니터링하며, 공공·민간 파트너에게 연락했다.

회사는 적대적 국가 기관과 연계된 30일 표본도 검토했다. 약 35건의 연구 활동을 식별했으며, 대부분은 일반적인 민간 과학과 관련돼 있었다.

이 발견도 똑같이 주목할 만하다. 의심스러운 기관 집합에 속한 활동 대부분은 위험한 것으로 제시되지 않았다.

우려되는 사례가 더 적었다는 사실은 획일적인 지리적 제한이 불충분한 이유를 보여준다. 지역은 하나의 위험 신호일 수 있지만, 행동에 관한 증거를 대체할 수는 없다.

Anthropic의 공개는 규제 당국에도 압박을 가한다. 정부는 감독, 적법 절차, 정보 공유 규칙을 정의하지 않은 채 모델 제공업체에 오용 방지를 요구할 수 없다.

Cornell 컴퓨터 과학자 John Thickstun은 Associated Press에 민주적 숙의 없이 기업들이 불편한 사회적 판단에 직면한다고 말했다. 그의 우려는 생물학적 접근 결정에 직접 적용된다.

제공업체는 이용 정책에 따라 서비스를 종료할 수 있다. 그러나 누가 고급 과학 지원을 사용할 수 있는지 결정하는 일은 연구 거버넌스와 닮아가기 시작한다.

전통적으로 이 역할에는 기관심사위원회, 생물안전위원회, 자금 제공자, 규제 당국, 국가안보 기관이 관여한다. 이제 AI 기업도 같은 의사결정 사슬 안에 자리한다.

제공업체는 증거의 상당 부분도 통제한다. 외부 연구자가 독립적으로 검토할 수 없는 프롬프트, 계정 연결, 라우팅 행동을 볼 수 있다.

공개 위협 보고서는 도움이 되지만 선택적 공개에는 한계가 있다. 편집·삭제 처리는 조사관과 사용자를 보호하는 동시에 독립적 검증을 어렵게 만든다.

Anthropic은 다섯 사례의 신원이나 완전한 상호작용 기록을 공개하지 않았다. 따라서 외부 전문가는 그 의도 평가를 재현할 수 없다.

회사의 설명은 중립적 감사가 아니라 진지한 1차 출처 공개로 다뤄져야 한다. 안전성 포지셔닝과 규제 관련 이해관계도 중요한 맥락이다.

동시에 이 보고서를 마케팅으로 치부한다면 구체적인 운영 세부 사항을 무시하게 된다. 중계 서버, 새로 만든 신원, 숨겨진 위치, 의도적인 난독화는 회피 행동의 확립된 지표다.

올바른 대응은 확신이 아니라 면밀한 검토다. 제공업체는 위험한 기술 지침을 공개하지 않으면서 방법론, 불확실성, 거짓 양성 위험, 집행 결과를 공개해야 한다.

업계 협력은 필요하지만, 협력에도 경계가 필요하다. 사용자 데이터의 광범위한 공유는 개인정보 보호, 학문의 자유, 정당한 연구를 위협할 수 있다.

어떤 정보를 누구와 어떤 법적 권한 아래 공유할 수 있는지 명확한 기준이 정해져야 한다. 연구자에게는 잘못된 제한에 이의를 제기할 수 있는 경로도 있어야 한다.

이러한 보호 장치가 없다면 생물학적 안전장치는 소수 AI 기업이 운영하는 불투명한 허가 시스템이 될 위험이 있다.

증거는 임박한 AI 제작 팬데믹을 보여주지 않는다

Anthropic은 우려스러운 사용 패턴을 기록했지만, 보고서는 Claude가 실행 가능한 무기를 가능하게 했거나 병원체의 위험성을 실질적으로 높였다는 점을 입증하지 않는다.

이러한 회의적 구분은 안전장치의 필요성을 약화하지 않는다. 이는 이용 가능한 증거가 뒷받침할 수 있는 범위를 정의한다.

Anthropic은 다섯 사례가 접근 통제를 회피하는 우려 대상 행위자들과 중요한 이중용도 연구가 연관돼 있음을 보여준다고 말한다. 이를 임박한 Claude 지원 공격의 증거로 제시하지는 않는다.

정보 지원과 물리적 생물학 역량 사이의 차이는 상당하다. 현실 세계의 작업에는 전문 지식, 실험실, 재료, 장비, 시험, 운영 실행이 필요하다.

언어 모델은 이러한 장벽을 없애지 않으면서 연구의 일부를 가속할 수 있다. 계정 기록만으로 가속의 정도를 측정하기는 여전히 어렵다.

통제된 평가는 모델 사용자를 지원받지 않은 참가자와 비교할 수 있다. 그러나 Anthropic은 평가가 역량이 실제 무기 개발을 지원할 것임을 증명할 수는 없다고 인정한다.

관찰된 사용은 보완적인 증거를 제공한다. 연구자들이 모델을 워크플로에 통합할 만큼 유용하다고 믿는다는 점을 보여준다.

그러나 믿음과 사용은 여전히 결정적인 역량 향상과 동일하지 않다. 모델은 가장 어려운 생물학적 문제를 해결하지 못한 채 글쓰기, 조직화, 번역 또는 코딩을 개선할 수 있다.

세 번째 사례는 이러한 모호성을 부각한다. 약 한 시간 만에 상세한 연구비 제안서를 작성한 것은 속도와 범위를 보여주지만, 제안서는 실험이 아니다.

마찬가지로 과학적 산출물에 대한 편집 지원은 시간을 절약할 수 있다. 그것이 Claude가 성공적인 돌연변이를 선택했거나 실행 가능한 병원체를 가능하게 했다는 증거는 아니다.

Axios의 생물안보 분석은 국가안보 전문가들 사이의 더 광범위한 우려를 보도했다. 또한 AI 시스템의 작동 방식과 안전장치가 어떻게 운영돼야 하는지에 대한 불확실성도 강조했다.

재앙적 생물학 사건은 발생 확률이 낮더라도 주목할 가치가 있다. 그 결과의 심각성은 예방, 평가, 조기 개입을 위한 강력한 근거를 만든다.

그러나 과장된 설명은 그러한 작업을 약화할 수 있다. 모호한 연구를 저지된 무기 프로그램이라고 부르면 협력이 필요한 과학자들 사이의 신뢰를 떨어뜨릴 수 있다.

과장은 같은 Anthropic 보고서에 기록된 더 즉각적인 위험도 가릴 수 있다. 여기에는 사이버 범죄, 감시, 선전, 재래식 무기 개발이 포함된다.

추정적인 자율 병원체 설계와 달리, 이들 활동 중 일부는 확립된 위협 모델에 부합한다. 행위자들은 이미 사기, 표적화, 공학 작업에 소프트웨어 지원을 활용하는 방법을 알고 있다.

따라서 Anthropic의 위협 평가는 서로 다른 증거 수준을 지닌 위험 포트폴리오로 읽어야 한다. 생물학적 오용은 가장 중대한 위험 가운데 하나지만, 분류하기도 가장 어려운 위험 가운데 하나다.

또 다른 측정상의 문제가 있다. Anthropic은 자사 서비스와 탐지 시스템에 도달한 활동만 볼 수 있다.

이 회사는 로컬 모델, 다른 제공업체, 연결이 끊긴 연구실, 또는 조사를 성공적으로 회피한 계정을 통해 수행된 작업을 정량화할 수 없다.

5건의 사례는 발생률 추정치가 아니다. 생물학적 활용 중 얼마나 많은 비율이 유해한지, 또는 우려되는 프로젝트가 얼마나 탐지되지 않은 채 남아 있는지를 보여줄 수 없다.

탐지 기능의 개선은 오용이 실제로 늘지 않았더라도 사건 건수를 증가시킬 수 있다. 더 많은 사례는 행동 악화가 아니라 더 나은 모니터링을 의미할 수도 있다.

반대로 차단 건수가 줄어든 것은 억제력이 강화됐거나, 가시성이 약화됐거나, 다른 서비스로의 이동이 성공했음을 반영할 수 있다. 원시 집행 수치에는 맥락이 필요하다.

회사의 안전성 주장 역시 독립적인 검증이 필요하다. 외부 연구자들은 유해한 작업에 대한 저항성과 정당한 과학 연구에 영향을 주는 오탐 거부를 모두 검토해야 한다.

유용한 평가는 통제된 조건에서 현실적인 다단계 워크플로를 시험하는 방식이 될 것이다. 모델이 성공 가능성을 높이는지, 필요한 전문성을 낮추는지, 또는 핵심 단계를 단축하는지를 측정해야 한다.

평가는 위험한 세부 정보를 보호해야 한다. 생물보안 테스트가 공개된 실행 지침서가 되어서는 안 된다.

독립적인 감독은 이러한 요구 사이의 균형을 맞추는 데 도움이 될 수 있다. 정부, 학계 전문가, 공중보건 기관은 제공업체의 판단에만 의존하지 않고 참여해야 한다.

Anthropic은 모든 사례를 악의적인 것으로 단정하지 않고 불확실성을 설명했다는 점에서 평가받을 만하다. 이러한 절제는 사안이 전개되는 과정에서도 핵심 원칙으로 남아야 한다.

가장 타당한 결론은 헤드라인보다 더 제한적이다. Claude는 Anthropic이 지속하기에는 지나치게 위험하다고 판단한 여러 은밀하고 민감한 연구 워크플로의 일부가 됐다.

대응이 효과를 내는지 보여줄 세 가지 신호

다음 시험대는 AI 제공업체가 정당한 과학 연구를 멀어지게 하거나 오용을 다른 곳으로 옮기는 데 그치지 않으면서 위험한 지원을 제한할 수 있는지 여부다.

첫 번째 신호는 릴레이 네트워크와 거부된 프롬프트를 둘러싼 제공업체 간 협력이다. Anthropic은 영향을 받은 연구실, AI 기업, 정부 당국과 조사 결과를 공유했다고 밝혔다.

효과적인 협력은 서비스 전반에서 회피용 인프라를 식별할 수 있는 재현 가능한 방법을 만들어야 한다. 연구자나 생물학적 인자를 공개적으로 지목하는 방식에 의존해서는 안 된다.

제공업체들이 같은 네트워크를 함께 차단하기 시작한다면 Anthropic의 개입 모델은 신뢰를 얻게 된다. 사용자가 며칠 안에 계속 모델을 바꾼다면 계정 차단은 일시적인 마찰에 그친다.

두 번째 신호는 생물학 연구자를 위한 신뢰 기반 접근 권한의 설계다. Anthropic은 최첨단 생물학 역량에 검증된 사용자 프로그램이 필요할 수 있다고 주장한다.

실효성 있는 프로그램은 적격 기관, 데이터 보존 규칙, 검토 절차, 이의 제기 메커니즘을 정의해야 한다. 독립 연구자와 소규모 연구실도 고려해야 한다.

문서화된 오탐 거부가 거의 없는 폭넓은 과학계 도입은 계층형 접근의 필요성을 강화할 것이다. 정당한 연구자들의 지속적인 불만은 과도한 제한이나 부실한 검토 절차를 드러낼 것이다.

세 번째 신호는 역량 향상에 관한 독립적 증거다. Anthropic은 현행 모델이 이전의 생물학적 기준치 아래에 안전하게 머물러 있다고 더는 보장할 수 없다고 말한다.

외부 평가는 최신 시스템이 단순히 제안서 작성이나 문헌 검토를 넘어 위험한 결과를 실질적으로 개선하는지 시험해야 한다. 결과는 여러 모델과 접근 구성 방식을 비교해야 한다.

상당한 역량 향상의 증거는 더 엄격한 접근 통제와 강력한 규제를 뒷받침할 것이다. 미약하거나 일관되지 않은 결과는 의심스러운 행동을 겨냥한 더 제한적인 안전장치를 지지할 것이다.

이러한 신호는 생물학을 넘어 중요하다. AI가 고도화된 역량과 불확실한 의도를 결합하는 모든 영역에서 같은 거버넌스 문제가 나타난다.

기업은 어떤 모델이 민감한 업무를 처리하는지, 제공업체가 데이터를 어떻게 보관하는지, 사용자가 내부 제한을 우회할 수 있는지를 추적해야 한다. 과학자들은 접근 정책이 사용자 신원에 더 민감해질 것을 예상해야 한다.

정부는 민간의 집행만으로 충분한지 결정해야 한다. 또한 정당한 연구, 프라이버시, 실질적인 감독을 보존하는 규칙도 마련해야 한다.

외부 증거가 회사의 결론을 검증하기 전까지 Anthropic AI 오용 문제는 불완전한 이야기로 남을 것이다. 현재로서는 독자들이 차단 건수만 세기보다 협력, 신뢰 기반 접근, 독립적 평가를 주시해야 한다.

자신의 조직 안에서 실용적인 질문을 던져보라. AI 시스템이 민감한 결정에 어떤 영향을 미쳤는지 재구성할 수 있는가? 답이 아니라면 접근 기록, 승인된 도구, 데이터 처리 규칙, 문서화된 인간 검토부터 시작하라.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page