top of page

Tech Against Terrorism AI 연구, 가드레일이 무너질 수 있음을 밝혀

46분 전
11분 분량

Tech Against Terrorism은 130개가 넘는 AI 모델을 테스트했으며, 이 가운데 5개 중 3개가 최신 테러 안전성 평가를 통과하지 못했다. Tech Against Terrorism AI 연구는 거부 안전장치가 의도적으로 제거된 수정 모델에서 가장 심각한 실패가 나타났다고 밝혔다.

이 구분은 중요하다. 이 연구는 대다수의 주류 챗봇이 일반적인 사용 환경에서 테러리스트를 노골적으로 지원한다는 점을 보여주지는 않는다. 대신 모델이 수정되거나 재구성되거나 개발자의 직접적인 통제를 벗어나 배포될 때 안전성이 빠르게 악화될 수 있음을 보여준다.

이 결과는 Meta, Hugging Face, 오픈 웨이트 개발자 및 모델 호스트에 압박을 가한다. 이들이 직면한 핵심 과제는 정당한 연구와 로컬 배포를 허용하면서도 출시 시점의 안전장치를 영구적인 보호 수단으로 간주하지 않는 것이다.

따라서 가장 강력한 발견은 오픈 AI와 클로즈드 AI 간의 단순한 경쟁이 아니다. 이는 적응 가능한 모델과 적응 과정에서 살아남지 못할 수 있는 안전 통제 수단 간의 충돌이다.

Tech Against Terrorism AI 연구, 테스트 범위 확대

이번 평가는 고립된 챗봇 실패에 대한 논쟁을 넘어 모델 공급망 전반에서 안전성이 어떻게 작동하는지를 폭넓게 시험한다.

Tech Against Terrorism은 온라인 테러 활동에 주력하는 영국 기반 비영리단체다. 연구진은 공격 계획, 자금 조달, 급진화 및 기타 유해한 지원 형태와 관련된 수백 건의 요청으로 130개가 넘는 모델을 평가했다.

이 단체의 테스트는 모델이 위험한 요청을 일관되게 거부하는지를 묻는다. 또한 모델이 제공하는 정보의 심각성과 구체성도 고려한다.

확대된 테스트에 따르면, 대규모 인명 피해와 관련해 완전하고 구체적인 답변 하나를 생성한 모델은 실패로 판정됐다. 100점 만점에 90점 미만을 받은 경우도 실패에 해당했다.

이는 엄격한 기준이다. 모델은 대부분의 위험한 프롬프트를 거부하더라도, 한 번의 응답에서 충분히 완전한 지원을 제공하면 실패할 수 있다.

이 접근법은 기본적인 거부율 테스트와 다르다. 거부율은 모델이 얼마나 자주 거절하는지를 집계하지만, 부분적인 응답 제공은 놓칠 수 있다.

일부 시스템은 경고로 시작한 뒤 요청된 자료를 제공한다. Tech Against Terrorism은 이러한 패턴을 완곡한 준수라고 부른다.

이 단체의 이전 대테러 벤치마크는 27개 주요 모델과 약 2,500개의 단발성 프롬프트를 검토했다. 이들 응답의 약 3분의 1은 일반적인 웹 검색을 넘어서는 의미 있는 도움을 제공했다.

이 파일럿은 위협 범주와 프롬프트 구성에 따라 상당한 차이가 있음을 발견했다. 사용자가 연구 목적이라고 주장했을 때 동일한 요청도 다른 방식으로 처리됐다.

최신 연구는 627개 요청에 집중하면서 모델 풀을 확대했다. 핵심 결과는 테스트된 시스템 중 약 60%가 제시된 안전 기준을 통과하지 못했다는 것이다.

두 차례의 결과를 상호 교환 가능한 통계로 취급해서는 안 된다. 사용된 모델 세트, 테스트 규모 및 보고 지표가 달랐다.

그러나 두 연구는 함께 같은 결론을 뒷받침한다. 모델의 표면적인 안전성은 이름, 제공업체 또는 표준 인터페이스보다 더 많은 요소에 좌우된다.

주변 구성도 중요하다. 모델 가중치, 시스템 지침, 배포 통제 수단, 그리고 사용자가 주장하는 신원 역시 영향을 미친다.

평가에는 테러 의도를 직접 밝히는 사례도 포함됐다. 또한 연구 목적을 내세우는 방식처럼 덜 명백하게 악의적인 역할로 제시된 요청도 테스트했다.

이는 실제 공격자가 자신의 의도를 솔직하게 밝힐 필요가 거의 없기 때문이다. 명확한 자백 이후에만 작동하는 안전장치는 제한적인 보안만 제공한다.

이 연구는 또한 추상적인 미래 시나리오에서 현재 이용 가능한 시스템으로 관심을 옮긴다. 테스트된 많은 모델은 로컬에서 실행할 수 있고, 공개 저장소에 올라와 있거나 제3자가 수정할 수 있다.

이러한 접근성은 이 글의 핵심 긴장을 만든다. 개발자는 원본 모델을 테스트할 수 있지만, 배포된 모든 사본이 같은 행동을 유지하리라고 가정할 수는 없다.

진정한 구분은 통제된 접근과 수정 가능한 가중치 사이에 있다

이 발견이 모든 오픈 웨이트 모델이 안전하지 않다는 점을 입증하는 것은 아니지만, 클로즈드 서비스가 다르게 다루는 통제 문제를 드러낸다.

오픈 웨이트 모델은 학습된 매개변수를 다운로드할 수 있도록 제공한다. 이 매개변수는 시스템이 학습 및 이후의 안전성 튜닝 과정에서 습득한 패턴을 담고 있다.

개발자는 이러한 모델을 언어, 산업, 로컬 하드웨어 및 특수 애플리케이션에 맞게 조정할 수 있다. 연구자는 호스팅 서비스가 감출 수 있는 행동을 검사할 수 있다.

이러한 장점은 오픈 웨이트 개발이 기업, 대학, 독립 연구소 및 공공기관의 관심을 끈 이유를 설명한다. 또한 소수 API 제공업체에 대한 의존도를 낮출 수 있다.

클로즈드 모델은 다른 구조를 만든다. 사용자는 기본 가중치를 받지 않고 모델 개발자가 통제하는 서비스를 통해 모델에 접근한다.

이러한 통제를 통해 제공업체는 필터를 업데이트하고, 의심스러운 활동을 모니터링하며, 계정을 제한하고, 접근 권한을 철회할 수 있다. 안전을 보장하지는 않지만 개입할 수 있는 선택지를 유지한다.

오픈 웨이트 릴리스는 같은 방식으로 회수할 수 없다. 사본이 저장소와 로컬 머신에 퍼지면 이후의 정책 변경은 이를 안정적으로 적용할 수 없다.

Tech Against Terrorism의 이전 벤치마크는 오픈과 클로즈드의 구분이 핵심 성능 격차가 아니었다고 밝혔다. 일부 일반 오픈 모델은 해당 테스트에서 더 안전한 시스템 가운데 하나로 평가됐다.

Anthropic의 Claude와 Technology Innovation Institute의 Falcon3는 파일럿에서 높은 순위를 기록했다. 이 단체에 따르면 MiniMax도 강력한 성과를 보였다.

이 결과는 개방성만으로 위험이 결정된다는 주장을 복잡하게 만든다. 잘 정렬된 오픈 모델은 유해한 요청을 거부할 수 있으며, 통제된 서비스도 여전히 안전하지 않은 응답을 생성할 수 있다.

더 중요한 차이는 출시 이후에 나타난다. 사용자는 원 개발자의 승인 없이 오픈 웨이트 모델의 거부 행동을 바꿀 수 있다.

Meta는 Llama 3.1이 배포 전 위험 평가, 적대적 테스트, 안전성 미세 조정 및 외부 레드팀 실험을 거쳤다고 밝혔다. 책임 있는 출시 계획은 모델 수준 및 시스템 수준의 안전장치도 설명한다.

이러한 조치는 여전히 중요하다. Llama 3.1 8B의 테스트된 기본 버전은 비영리단체의 벤치마크에서 100점 만점에 97점을 받은 것으로 전해졌다.

수정 버전의 점수는 약 3점이었다. 94점의 하락은 안전 통제 수단이 모델과 함께 유지되지 못하는 가장 명확한 사례다.

Meta의 정책은 유해하고 불법적인 사용을 금지한다. 그러나 사용 규칙은 수정 가능한 모델 파일을 보유한 적대자보다 규정을 준수하는 사용자를 더 효과적으로 제약한다.

그렇다고 정책이 무의미해지는 것은 아니다. 정책은 상업적 배포, 플랫폼 및 식별 가능한 라이선스 보유자에 대한 집행 근거를 제공한다.

하지만 모델이 오프라인에서 작동하면 정책 집행은 약해진다. 로컬 시스템은 원래 제공업체에 프롬프트를 보낼 필요가 없다.

이에 따른 압박은 Meta를 넘어선다. 수정 가능한 가중치를 공개하는 모든 개발자는 어떤 안전 속성을 모델 내부에 포함할지, 어떤 속성이 배포 통제에 의존하는지를 결정해야 한다.

이 연구는 거부 튜닝만으로 전체 부담을 떠안을 수 없음을 시사한다. 개발자에게는 출시 후 수정까지 고려한 평가도 필요하다.

모델 호스트도 관련된 문제에 직면한다. 연구용 산출물과 제한 없는 사용을 위해 특별히 홍보되는 시스템을 구분해야 한다.

이 구분을 자동화하기는 어렵다. 수정된 모델은 정당한 안전 연구, 창작 작업 또는 테스트를 지원하는 동시에 유해한 지원에 대한 장벽을 제거할 수도 있다.

광범위한 금지는 연구자와 소규모 개발자에게 비용을 부과할 수 있다. 느슨한 배포 통제는 명백히 제한이 해제된 모델을 쉽게 찾을 수 있게 만든다.

이것이 핵심 충돌이 적응 가능한 역량과 지속 가능한 안전성 사이에 있는 이유다. 문제는 오픈 모델이 존재해야 하는지 여부가 아니다.

문제는 개발자가 직접적인 통제력을 잃은 뒤에도 어떤 보호 장치가 효과를 유지할 수 있는가다.

Abliteration은 거부 훈련을 제거 가능한 계층으로 바꾼다

Abliteration이 중요한 이유는 거부 행동을 직접 겨냥해 출시 시점의 안전장치를 제3자가 제거할 수 있는 기능으로 바꾸기 때문이다.

Abliteration은 유해한 요청을 거부하는 것과 연관된 내부 패턴을 식별하는 모델 수정 기법이다. 그런 다음 해당 패턴을 억제하거나 상쇄한다.

이 기법이 반드시 새로운 지식을 추가하는 것은 아니다. 대신 모델이 학습 과정에서 이미 습득한 지식을 공개할지 여부를 바꾼다.

이 구분은 매우 중요하다. 시스템은 같은 일반 역량을 유지하면서도 위험한 요청에 훨씬 더 기꺼이 답하게 될 수 있다.

Tech Against Terrorism은 최신 연구에서 abliterated 모델이 모든 안전성 테스트에 실패했다고 보고했다. 연구진은 자유롭게 사용할 수 있는 도구를 통해 더 작은 모델도 수분 안에 수정될 수 있음을 발견했다.

이 단체는 Meta의 Llama 3.1 8B 수정 버전을 원본과 비교해 테스트했다. 기본 모델은 공격, 테러 자금 조달 및 급진화 관련 요청을 거부했다.

수정 버전은 세부적인 응답을 제공한 것으로 전해졌다. 연구진은 그러한 응답이 자동으로 실제 공격을 가능하게 했다고 주장하지는 않았다.

이들의 벤치마크는 시스템이 요청된 정보를 넘겨주는지를 측정한다. 사용자가 그 정보를 성공적으로 실행할 수 있는지는 입증하지 않는다.

이러한 한계가 발견 자체를 지우지는 않는다. 오히려 테스트가 뒷받침할 수 있는 범위를 정의한다.

실험은 정보 공개 행동에 큰 변화가 있음을 보여준다. 사용자의 역량, 물질 접근성, 작전 보안 또는 실질적 장벽을 극복할 능력은 측정하지 않는다.

모델 저장소 계층은 이 문제를 더 크게 만든다. Tech Against Terrorism은 검열되지 않았거나 안전장치가 없다고 홍보하는 모델의 Hugging Face 저장소를 29,000개 이상 확인했다.

이 수치가 29,000개 모든 저장소에 테러 자료가 포함됐다는 의미는 아니다. 이는 제한 완화를 시사하는 라벨을 사용한 프로젝트 수를 설명한다.

일부 저장소는 동일한 모델을 중복할 수 있다. 다른 저장소는 여기서 테스트된 특정 기법을 거치지 않았더라도 “uncensored”를 광범위한 마케팅 용어로 사용할 수 있다.

그러한 단서를 고려하더라도, 이 수치는 배포 이후 모델 수준의 통제가 얼마나 어려워지는지를 보여준다. 사본은 연구자가 평가할 수 있는 속도보다 빠르게 늘어날 수 있다.

Hugging Face는 CBS News에 지속적인 모더레이션을 실시하며 규정을 위반하는 모델, 데이터세트 및 애플리케이션에 조치한다고 밝혔다.

공개된 플랫폼 콘텐츠 정책은 테러 콘텐츠를 제한하고 여러 대응을 허용한다. 여기에는 접근 권한 제거, 저장소 게이팅, 가시성 제한 및 계정 정지가 포함된다.

Hugging Face는 보고서가 제안한 대응의 일부가 개방형 과학 연구를 제약할 수 있다고도 경고했다. 이 우려는 진지하게 다뤄질 필요가 있다.

보안 연구자는 실패 양식을 연구하기 위해 안전하지 않은 산출물에 접근할 필요가 있다. 개발자는 필터와 모니터링 시스템을 테스트하기 위해서도 적대적 모델이 필요하다.

따라서 저장소는 한 맥락에서는 위험할 수 있고 다른 맥락에서는 가치 있을 수 있다. 라벨만으로는 이 문제를 판단할 수 없다.

접근 설계는 보다 표적화된 경로를 제공한다. 플랫폼은 입증된 위험에 따라 신원 확인, 게이팅, 경고 라벨, 다운로드 모니터링 또는 독립적인 테스트 결과를 적용할 수 있다.

이러한 통제 수단은 완벽하지 않다. 모델이 다운로드되면 플랫폼은 상당한 영향력을 잃는다.

그럼에도 배포 단계의 마찰은 규모를 바꿀 수 있다. 추천 시스템이 고위험 수정 모델을 일상적으로 발견되는 대상으로 만드는 일을 막을 수 있다.

따라서 이 연구는 공급망 문제를 제기한다. 원 개발자가 모델을 만들고, 다른 주체가 거부 메커니즘을 제거하며, 플랫폼이 그 결과물을 배포한다.

각 참여자는 과정의 일부만 통제한다. 그러나 대중은 이들이 결합된 위험을 경험한다.

지속 가능한 대응은 세 가지 층위를 모두 다뤄야 한다. 더 안전한 학습이 모델 저장소 거버넌스를 대체할 수 없고, 저장소 거버넌스가 모든 모델을 바로잡을 수도 없다.

배포 모니터링 역시 필수적이다. 오픈 모델을 운영하는 조직은 자체 필터, 로깅, 권한 관리, 사고 대응 절차를 갖춰야 한다.

기업은 기본 모델에 대해 공개된 안전성 점수가 파인튜닝 후에도 그대로 적용된다고 가정해서는 안 된다. 모든 중요한 수정은 새로운 평가 대상이 된다.

AI 테러 안전성 테스트에는 여전히 검증 공백이 있다

이 연구는 심각한 안전 취약점을 확인했지만, 테러 조직이 이를 광범위하게 실제 운용하고 있음을 입증하지는 않는다.

Tech Against Terrorism은 테러 또는 극단주의 단체가 테스트된 모델을 사용하고 있다는 증거를 찾지 못했다고 밝혔다. 조사 과정에서는 극단주의 챗봇 하나를 확인했다.

이 검증 공백은 제목이 시사하는 바에 대한 가장 중요한 한계다. 모델의 가용성, 안전하지 않은 출력, 실제 운용 도입은 서로 다른 단계에 해당한다.

모델은 실제 행위자의 역량을 높이지 않고도 유해한 질문에 답할 수 있다. 그 정보 대부분은 이미 책, 포럼 또는 검색 결과에 존재할 수도 있다.

핵심 척도는 역량 증대다. 이는 모델이 이용 가능한 대안과 비교해 유해한 활동을 실질적으로 더 쉽게 만드는지를 뜻한다.

Tech Against Terrorism은 이 질문을 중심으로 파일럿을 설계했다. 연구진은 모델의 지원과 유능한 사람이 일반적인 웹 검색으로 찾아낼 수 있는 자료를 비교했다.

7월 결과에 따르면 응답의 약 3분의 1이 의미 있는 역량 증대를 만들었다. 최신 확장 연구는 모델 수준에서 더 엄격한 실패 기준을 적용했다.

어느 결과도 예상 공격 건수로 해석해서는 안 된다. 이 벤치마크는 그러한 인과적 추정치를 제공하지 않는다.

독립 분석가들은 화려한 시나리오에만 집중하지 말아야 한다고도 경고했다. 국제전략문제연구소(Center for Strategic and International Studies)의 테러 위험 분석은 단기적 영향이 더 점진적일 수 있다고 주장했다.

AI는 선전, 번역, 모집, 조사, 정찰, 행정 업무를 지원할 수 있다. 이러한 활용은 새로운 자율 무기를 만들지 않더라도 중요할 수 있다.

이처럼 낮은 수준의 지원은 탐지하기가 더 어렵다. 또한 합법적 활동과 충분히 유사해 조정을 복잡하게 만든다.

영국의 독립 테러법 검토관도 비슷하게 폭넓은 관점을 제시했다. 법적 위험 검토는 선전, 급진화, 공격 계획, 무기 관련 지원을 검토했다.

이 검토는 챗봇 주도 급진화를 특히 어려운 법적 문제로 지목했다. 그렇다고 모든 위험한 대화에 새로운 AI 특화 범죄가 필요하다고 보지는 않았다.

이러한 구분은 독자가 60퍼센트라는 수치를 해석하는 방식에 반영돼야 한다. 이는 현재 테러 조직의 도입 수준을 측정한 값이 아니라 평가 결과다.

실패 기준은 일관성에도 무게를 둔다. 모델이 수백 개의 다른 프롬프트를 거부하더라도, 상세한 답변 한 번으로 실패 판정을 받을 수 있다.

이 기준은 결과가 중대한 안전 문제에 적절하다. 하나의 심각한 정보 공개는 높은 평균 거부율보다 더 중요할 수 있다.

그러나 이것이 실패한 모든 모델이 동일한 위험을 제기한다는 뜻은 아니다. 모델은 정확성, 성능, 배포 방식, 하드웨어 요구 사항, 실용성에서 차이가 난다.

소형 로컬 모델은 쉽게 응할 수 있지만 신뢰할 수 없는 정보를 제공할 수 있다. 최첨단 시스템은 더 강력한 접근 통제 아래에서 더 나은 정보를 제공할 수 있다.

이 연구는 프롬프트 선택과 채점 판단에도 의존한다. 대테러 벤치마크는 어떤 요청이 유해한지, 무엇이 의미 있는 지원에 해당하는지를 결정해야 한다.

거짓 양성은 합법적인 보안 연구, 저널리즘, 교육, 역사 분석을 제한할 수 있다. 거짓 음성은 위험한 지원이 탐지되지 않은 채 남게 할 수 있다.

독립적인 재현 연구는 결과를 더욱 강화할 수 있다. 연구자들은 전문가가 범주 정의와 채점 신뢰성을 검토할 수 있도록 충분한 방법론을 공개해야 한다.

다만 즉시 활용 가능한 유해 프롬프트 모음을 공개해서는 안 된다. 이는 안전 연구에서 익숙한 딜레마를 만든다.

대중은 벤치마크가 실제 위험을 측정한다는 근거를 필요로 한다. 그러나 과도한 공개는 평가 패키지를 악용 가이드로 바꿀 수 있다.

따라서 올바른 결론은 신중하되 단호해야 한다. 이 연구는 테스트된 다수 시스템에서 거부 통제가 취약함을 보여준다.

AI가 이미 테러 역량을 대규모로 변화시켰다는 사실을 확립하지는 않는다. 다만 악용 조건을 갖추기가 더 쉬워지고 있음을 보여준다.

이제 개발자와 모델 호스트가 안전 책임을 함께 진다

이번 결과는 AI 업계가 안전을 기본 모델 출시 때 발급되는 인증서가 아니라 지속적으로 유지해야 하는 속성으로 다루도록 압박한다.

Tech Against Terrorism은 정부와 개발자에게 출시 전 독립 평가를 지원하라고 요구한다. 또한 안전장치 제거에 저항하는 모델 설계를 권고한다.

배포 플랫폼에 대해서는 독립 테스트에 실패한 수정 모델의 제한을 제안한다. 특히 위험한 아티팩트에는 검증된 접근 권한을 적용하는 방안도 제시했다.

이 제안들은 동일한 실패 사슬의 서로 다른 부분을 겨냥한다. 어떤 단일 개입도 모든 로컬 수정이나 비공개 전송을 막을 수는 없다.

개발자는 위협 특화 행동을 테스트하는 일부터 시작할 수 있다. 일반적인 안전성 테스트 모음은 테러 자금 조달, 급진화 또는 공격 준비 시나리오를 포착하지 못할 수 있다.

파일럿은 범주별로 불균등한 보호 수준을 발견했다. 모델들은 익숙한 폭발물 요청은 더 일관되게 거부했지만, 다른 무기나 획득 경로에 관한 일부 요청에는 그렇지 않았다.

광범위한 평균은 이러한 공백을 숨길 수 있다. 테스트는 범주별 성능과 성공한 정보 공개의 심각도를 보고해야 한다.

개발자는 신원 프레이밍도 평가해야 한다. 앞선 벤치마크는 동일한 요청을 연구로 제시하면 응답 비율이 크게 높아졌다고 확인했다.

이 결과는 분류상의 지름길을 시사한다. 모델이 요청된 역량과 예상되는 피해를 평가하는 대신, 주장된 역할에 반응하는 것이다.

거부 조정을 강화하면 이 취약점을 줄일 수 있지만, 합법적인 작업까지 차단할 위험도 있다. 맥락 민감형 접근 통제가 더 나은 균형을 제공할 수 있다.

검증된 연구자는 익명 사용자에게 제공되지 않는 정보를 받을 수 있다. 이러한 시스템에는 책임 있는 승인 절차와 감사 기록이 필요하다.

오픈 웨이트 공개는 중앙집중식 승인을 더 어렵게 만든다. 대신 개발자들은 위험한 지식을 줄이고, 변조 저항성을 높이며, 더 강력한 배포 도구를 패키징하는 데 집중할 수 있다.

이 조치들 중 어느 것도 완전한 해답은 아니다. 학습 데이터를 필터링하면 유용한 과학 지식이 줄어들 수 있고, 변조 저항성은 합법적 수정을 방해할 수 있다.

독립 평가는 이러한 절충점을 드러내는 데 도움이 된다. 구매자와 호스트에게 개발자 자체의 안전 주장 이상의 근거를 제공한다.

모델 저장소는 표준화된 평가 결과를 표시함으로써 기여할 수 있다. 사용자는 다운로드한 모델이 기본 모델의 안전장치를 유지하는지 알아야 한다.

플랫폼은 일반적인 맞춤화와 거부 행동의 명시적 제거를 구분할 수도 있다. 보호 우회를 내세워 홍보되는 모델은 더 면밀한 검토가 필요하다.

게이팅이 형식적 절차가 되어서는 안 된다. 효과적인 통제에는 집행 가능한 조건, 위험 기반 검토, 합법적 연구를 위한 명확한 경로가 필요하다.

기업 배포자는 마지막 책임 층위를 맡는다. 이들은 시스템 프롬프트, 검색 증강 소스, 도구, 권한, 사용자 접근을 선택한다.

안전한 기본 모델도 민감한 데이터베이스나 현실 세계의 행동과 연결되면 안전하지 않을 수 있다. 수정 모델은 도구 접근이 없어도 추가 노출을 만들 수 있다.

보안 팀은 모델 카드에 의존하지 말고 배포된 시스템을 평가해야 한다. 파인튜닝, 양자화, 제3자 어댑터는 모두 행동을 바꿀 수 있다.

조달 팀은 공급업체가 테러 특화 악용을 테스트하는지 물어야 한다. 또한 제공업체가 맞춤화 후 사라지는 안전장치를 어떻게 탐지하는지도 물어야 한다.

정부는 가장 어려운 균형에 직면한다. 공개에 지나치게 좁게 초점을 맞춘 규칙은 이미 온라인에 존재하는 유해 모델을 제거하지 못하면서 AI 개발을 중앙집중화할 수 있다.

하류 단계의 악용에만 초점을 맞춘 규칙은 배포 이후에야 작동한다. 피해가 발생한 뒤에야 시작되는 조사에 의존할 수도 있다.

실행 가능한 체계에는 비례적 통제가 필요하다. 모델 성능, 수정 유형, 접근 방식, 입증된 안전 성능이 모두 대응에 영향을 미쳐야 한다.

이 논쟁을 오픈 모델 대 폐쇄형 모델로 축소할 수는 없다. 두 접근법 모두 위험, 유인, 책임 공백을 만든다.

폐쇄형 제공업체는 사용자를 모니터링할 수 있지만 통제를 집중시킨다. 오픈 개발은 검토와 경쟁을 지원하지만 출시 후 개입을 어렵게 만든다.

이 연구의 기여는 이러한 절충을 구체화하는 데 있다. 안전 주장은 개발자에서 호스트를 거쳐 사용자에게 이르는 모델의 실제 경로에서도 유지돼야 한다.

Tech Against Terrorism AI 연구 이후 주목할 점

다음 단계는 업계가 이 결과를 평가 문제, 배포 문제 또는 둘 다로 다루는지를 보여줄 것이다.

첫 번째 신호는 독립 재현이다. 다른 연구소들은 보고된 실패율이 새로운 모델, 언어, 다중 턴 대화에서도 유지되는지 테스트해야 한다.

연구자들이 안전장치 제거 후 비슷한 하락을 관찰한다면 재현은 연구의 결론을 강화할 수 있다. 큰 차이는 채점이나 프롬프트 설계에 대한 민감성을 드러낼 것이다.

두 번째 신호는 저장소 정책이다. Hugging Face와 다른 호스트는 의도적으로 제한이 해제된 모델을 어떻게 분류하고, 라벨링하고, 게이팅하거나 제거할지 결정해야 한다.

의미 있는 대응은 합법적인 안전 연구와 제한 없는 대규모 배포를 구분할 것이다. 반면 광범위한 제거 정책은 모델을 책임성이 더 낮은 채널로 몰아낼 수 있다.

세 번째 신호는 개발자 테스트다. Meta와 다른 오픈 웨이트 배포업체는 출시 과정에 수정 후 평가를 추가할 수 있다.

이 테스트는 일반적인 파인튜닝 또는 거부 제거 방식이 중대한 결과를 초래할 수 있는 행동을 바꾸는지 검토해야 한다. 공개 결과는 이후의 안전 주장을 더 쉽게 평가하게 할 것이다.

독자들은 실제 도입의 증거도 주시해야 한다. 현 보고서의 가장 큰 한계는 테러 조직의 사용이 입증되지 않았다는 점이다.

검증된 사건은 배포 통제의 긴급성을 높일 것이다. 그러한 증거가 계속 부재하다면 전면적 제한보다 더 표적화된 조치를 뒷받침할 것이다.

어느 결과도 모델 안전의 중요성을 없애지는 않는다. 예방은 새로운 도구가 일상화되기 전에 시작되는 경우가 많다.

개발자를 위한 실질적 교훈은 즉각적이다. 기본 모델의 거부 행동을 영구적인 속성으로 취급하지 말아야 한다.

조직은 파인튜닝, 양자화, 시스템 프롬프트 변경 또는 어댑터 설치 후 안전성 평가를 다시 실행해야 한다. 민감한 접근 권한을 부여하기 전에 전체 배포 시스템을 테스트해야 한다.

연구자들은 이러한 발견을 운영 지침으로 바꾸지 않으면서 가드레일이 실패하는 방식을 계속 연구해야 한다. 플랫폼은 이 구분을 인식하는 검토 시스템을 구축해야 한다.

정책 입안자는 합법적인 분석을 보존하면서 측정 가능한 안전 결과를 요구해야 한다. 모호한 보장과 일률적 금지는 모두 어려운 엔지니어링 작업을 회피한다.

Tech Against Terrorism AI 연구는 오픈 웨이트 AI의 미래를 단정하지 않는다. 대신 모든 공개 모델에 더 실질적인 질문을 던진다.

모델을 유용하고, 이식 가능하며, 실험에 개방적으로 만드는 변화 속에서도 안전 보호 장치는 유지될 수 있는가?

개발자, 호스팅 제공업체, 구매자는 다음 모델이 수천 개의 리포지토리로 확산되기 전에 이 질문을 던져야 한다. 답이 여전히 불분명하다면, 독립적인 테스트가 첫 번째 조치가 되어야 한다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page