Z.ai, CyberGym에서 GLM-5.3이 Anthropic의 Mythos 5를 근소하게 앞섰다고 밝혀
- Sophie Larsen

- 8월 15일
- 11분 분량
Z.ai는 GLM-5.3이 CyberGym에서 84.5%를 기록해 Anthropic의 제한형 Mythos 5를 0.7%포인트 앞섰다고 밝혔다. 이 결과는 가장 강력한 사이버보안 AI를 누가 통제하는지를 둘러싼 anthropic techmeme 서사에 복잡성을 더한다.
이 비교는 단순한 벤치마크 경쟁 이상의 의미를 갖는다. Z.ai는 2주간의 안전성 지연 이후 GLM-5.3을 공개 가중치 모델로 출시할 계획이다. 다만 가장 민감한 사이버보안 기능은 검증된 사용자와 일부 보안 파트너에게만 계속 제한될 예정이다.
이 구조는 상충하는 두 가지 배포 모델의 중간에 Z.ai를 위치시킨다. 공개 가중치는 조직이 자체 인프라에서 소프트웨어를 검토, 수정, 실행할 수 있게 한다. 검증된 접근은 방어 연구와 공격 작전 모두를 지원할 수 있는 고급 기능에 대해 개발사가 어느 정도 통제권을 유지하게 한다.
Anthropic은 Mythos 5에 대해 두 번째 접근법의 더 중앙집중적인 버전을 택했다. 이 모델은 공개 가중치 출시가 아니라 신뢰 기반 접근 프로그램을 통해 제공된다. Z.ai는 이제 공개 모델도 최고 위험 계층에 통제를 유지하면서 유사한 사이버 역량에 근접할 수 있다고 주장하고 있다.
이 벤치마크가 어느 회사의 모델이 더 우수한지를 결론짓지는 않는다. 그러나 개발자, 보안팀, 정책 입안자에게 더 날카로운 질문을 제기한다. 제작자가 회수할 수 없는 소프트웨어에 최첨단에 가까운 사이버 역량이 탑재되면 어떤 일이 일어나는가?
GLM-5.3, 벤치마크 우위를 접근성 시험으로 전환하다
중요한 변화는 단지 GLM-5.3이 더 높은 점수를 기록했다는 데 있지 않다. Z.ai는 최첨단에 가까운 사이버 성능을 공개 가중치로 나아가는 경로와 결합하고 있다.
Z.ai의 GLM-5.3 release에 따르면, 이 모델은 CyberGym에서 84.5%를 기록했다. Anthropic은 Mythos 5의 점수를 83.8%로 보고했다. 0.7포인트 차이는 작지만, 배포 계획은 현저히 다르다.
CyberGym은 AI 에이전트가 실제 소프트웨어의 취약점을 재현할 수 있는지를 평가한다. 모델에는 취약점 설명과 관련 소스 저장소가 주어진다. 이후 영향을 받은 코드를 찾아 결함을 유발하는 입력값을 만들어야 한다.
원래 CyberGym research는 188개 소프트웨어 프로젝트의 취약점 1,507건을 포함한다. 이런 설계는 객관식 보안 시험보다 더 많은 정보를 제공한다. 에이전트가 소스 코드를 탐색하고, 도구를 운용하며, 관찰 가능한 결과를 만들어내도록 요구하기 때문이다.
Z.ai의 결과는 여전히 회사가 보고한 벤치마크 주장이다. 공개된 수치만으로 GLM-5.3이 서로 다른 에이전트 프레임워크, 컴퓨팅 예산, 프롬프트 또는 보안 환경에서 동일한 성능을 재현할 것이라고 입증되지는 않는다.
이런 변수는 중요하다. 연구자들이 도구 하니스, 재시도 허용 횟수, 시간 제한 또는 빌드 시스템 접근 권한을 바꾸면 모델 성능도 달라질 수 있다. 사소한 방법론 차이조차 GLM-5.3과 Mythos 5 사이에 보고된 격차를 넘어설 수 있다.
그럼에도 이 점수는 Z.ai의 기존 공개 성과와 비교하면 큰 개선을 의미한다. GLM-5.1은 공개 CyberGym 리더보드에서 68.7%로 기재돼 있었다. 이 수준에서 84.5%로 올라섰다면, 이 회사는 가장 강력한 제한형 시스템에 근접하게 된다.
Z.ai는 실행 가능한 환경에서의 사후 학습을 통해 GLM-5.3을 개선했다고 밝혔다. 이는 에이전트가 코드를 컴파일하고, 테스트를 실행하며, 실패를 조사하고, 더 긴 작업 시퀀스에서 학습할 수 있는 통제된 소프트웨어 시스템이다.
이 접근은 단지 더 큰 기본 모델을 만드는 데 전적으로 의존하지 않기 때문에 중요하다. 집중적인 학습, 더 나은 환경, 확장된 에이전트 실행만으로도 기존 모델 계열에서 상당한 특화 역량을 끌어낼 수 있음을 시사한다.
회사는 안전장치를 강화하는 동안 공개 가중치 출시를 2주 미루고 있다. 이 기간 동안 일부 보안 파트너는 통제된 환경에서 고급 기능에 접근할 수 있다.
그러나 가중치가 공개되면 회사의 직접적인 영향력은 달라진다. Z.ai는 자체 호스팅 서비스, 파트너 프로그램, 공식 도구를 통제할 수 있다. 하지만 다른 곳에 배포된 모든 수정본을 신뢰성 있게 통제할 수는 없다.
이 때문에 이번 출시는 또 하나의 모델 업데이트가 아니라 접근성 시험이다. 회사는 사용자의 로컬 통제권과 가장 민감하다고 판단하는 기능을 둘러싼 신원 확인을 결합하려 하고 있다.
Anthropic Techmeme 비교가 중요한 이유
anthropic techmeme 비교는 탁월한 사이버 역량이 소수의 미국 모델 제공업체 안에만 집중된 상태로 남을 수 있다는 믿음에 압박을 가한다.
reported item은 Anthropic이 고급 사이버 기능 제한에 관한 가장 분명한 선례를 만들었기 때문에 GLM-5.3을 Mythos 5와 비교한다. Mythos 5는 일반적인 공개 Claude 출시가 아니다.
Anthropic은 Mythos 5를 Fable 5와 동일한 기반 모델이지만 일부 사이버보안 안전장치가 제거된 구성이라고 설명한다. 이 구성은 Project Glasswing 및 관련 신뢰 기반 접근 프로그램을 통해 승인된 조직에 제공된다.
Fable 5는 민감한 요청을 다른 방향으로 유도하거나 거부할 수 있는 분류기와 함께 더 넓은 시장에 제공된다. Mythos 5는 Anthropic이 추가 통제가 필요하다고 보는 기능에 대해 검증된 방어 담당자에게 더 직접적인 접근을 제공한다.
Mythos 5 announcement에서 Anthropic은 이 모델이 초기에는 소규모의 사이버 방어 담당자와 인프라 제공업체에 제공될 것이라고 밝혔다. 회사는 또한 접근 권한을 데이터 보존 및 안전성 모니터링 요건과 연계했다.
Z.ai는 같은 배포 경계를 채택하지 않으면서도 유사한 아이디어를 적용하고 있다. 민감한 사이버 기능은 제한돼 있지만, 더 광범위한 모델은 공개 가중치 출시로 향하고 있다.
이 차이는 Anthropic에 두 가지 방식으로 압박을 가한다. 첫째, 고객은 공개 대안이 벤치마크 성능에 근접할 때 제한형 모델이 여전히 필요한지 물을 수 있다. 둘째, 정부는 유사한 역량이 다른 곳에서 나타날 때 한 제공업체에 대한 제한이 의미가 있는지를 검토해야 한다.
이 비교는 Z.ai에도 압박을 가한다. 공개 가중치 출시는 재현성, 문서화, 모델 무결성, 책임 있는 공개에 대한 기대를 만든다. 독립 연구자들이 모델을 검토하고 수정할 수 있게 되면, 기업은 리더보드 주장에만 의존할 수 없다.
기업 구매자에게 결정은 원시 정확도를 넘어선다. 제한형 서비스는 중앙집중식 업데이트, 모니터링, 계약상 통제, 명확한 운영 주체를 제공한다. 자체 호스팅 모델은 데이터 지역성, 맞춤화, 외부 거부 시스템에 대한 더 적은 의존성을 제공한다.
보안팀에는 두 형태의 가치가 모두 필요하다. 사고 발생 시 멀웨어를 분석하거나, 침입 경로를 재구성하거나, 의심스러운 코드를 조사하기 위해 모델이 필요할 수 있다. 이런 요청은 일반적인 안전성 분류기에는 유해한 활동처럼 보일 수 있다.
이전 사례는 그 문제를 보여준다. Hugging Face는 최첨단 시스템의 안전성 통제가 AI 주도 침입에 대한 조사에 방해가 됐다고 밝혔다. 이후 해당 회사는 agent-led breach에 대한 설명에 따르면 분석을 지원하기 위해 GLM-5.2를 로컬에서 실행했다.
이 사례는 방어 담당자가 통제하는 모델이 필요하다는 Z.ai의 주장을 뒷받침한다. 그렇다고 제한 없는 로컬 배포가 항상 더 안전하다는 점을 입증하는 것은 아니다. 사고 대응팀에 도움이 되는 동일한 독립성은 공격자가 모니터링을 피하는 데에도 도움이 될 수 있다.
따라서 핵심 경쟁 쟁점은 중국 대 미국이 아니다. 안전성이 모델 통제, 특정 도구에 대한 접근 통제, 또는 민감한 환경에서 사용자가 할 수 있는 일의 통제에 달려 있는지 여부다.
Anthropic은 제공업체가 관리하는 접근에 더 큰 비중을 뒀다. Z.ai는 기본 모델을 무기한 보류하지 않으면서도 고급 기능을 보호할 수 있는 혼합형 구조에 베팅하고 있다.
공개 가중치와 검증된 사이버보안 접근의 결합
Z.ai의 설계는 모델 가용성과 운영 권한을 분리하지만, 가중치가 서버를 떠난 뒤에는 그 분리를 시행하기 어려워진다.
공개 가중치 소프트웨어는 사용자에게 학습 과정에서 습득한 수치 매개변수에 대한 접근을 제공한다. 이러한 가중치는 일반적으로 다운로드, 호스팅, 미세 조정, 독립 도구 연결이 가능하다.
이는 가장 엄격한 의미의 오픈소스 소프트웨어와는 다르다. 가중치 출시에 학습 데이터, 완전한 학습 코드 또는 모델 재현에 필요한 모든 구성요소가 포함되지 않을 수 있다. 그럼에도 사용자가 모든 요청을 원래 제공업체에 보내지 않고 모델을 운용할 수 있기 때문에 실질적 이점은 상당하다.
검증된 접근은 다른 계층을 다룬다. Z.ai는 호스팅된 사이버 기능에 신원 확인을 요구하고, 파트너 환경을 제한하며, 활동을 기록하거나, 익스플로잇 지향 도구에 대한 접근을 제한할 수 있다.
외부 집단이 공개 가중치를 기반으로 대체 시스템을 구축할 때 과제가 시작된다. 이들은 공식 프롬프트 계층을 교체하고, 다른 도구를 연결하며, 호스팅 제한을 제거하거나, 추가 익스플로잇 데이터로 모델을 학습시킬 수 있다.
Z.ai는 출시 후 수정본에 대한 통제력을 잃게 될 것임을 인정한다. 이 인정은 사소한 면책 조항이 아니라 정책을 이해하는 핵심이다.
따라서 회사의 접근은 공개 모델과 제한된 사이버 스택 사이에 의미 있는 역량 격차가 존재하는 데 달려 있다. 가장 민감한 성능에 비공개 도구, 데이터세트 또는 학습 구성요소가 필요하다면, 검증된 접근은 실질적 가치를 유지한다.
공개 가중치에 이미 역량 대부분이 담겨 있다면 외부 개발자들은 빠진 계층을 재현할 수 있다. 이들은 Z.ai의 개입 없이 셸 접근, 디버거, 취약점 데이터베이스, 퍼저, 자동화된 재시도 시스템을 추가할 수 있다.
그렇다고 이 출시가 본질적으로 무책임하다는 뜻은 아니다. 많은 방어 조직은 보호된 네트워크 안에서 작동하는 모델을 필요로 한다. 이들은 독점 소스 코드, 자격 증명 또는 사고 관련 자료를 외부 API에 업로드할 수 없다.
로컬 배포는 팀이 조사 중 증거를 보존하는 데에도 도움이 된다. 민감한 데이터가 조직 밖으로 나가거나 제공업체의 보존 정책 적용 대상이 될 위험을 줄인다.
공개 사이버 모델에 대한 가장 강력한 논거는 비대칭성에 관한 것이다. 공격자들은 이미 공개 저장소를 조사하고, 익스플로잇 코드를 재사용하며, 정찰을 자동화한다. 인력이 제한된 유지관리자는 모든 의존성을 조사하거나 보고된 모든 충돌을 재현하지 못하는 경우가 많다.
Z.ai는 GLM-5.3을 그러한 유지관리자에게 비슷한 자동화 역량을 제공하는 방법으로 제시하고 있다. 이와 연계된 OpenVuln 프로그램은 오픈소스 프로젝트가 모델 보조 보안 분석을 위해 저장소를 제출할 수 있도록 한다.
이 서비스는 특화된 연구팀이 부족한 방어 담당자에게 역량을 집중시킬 수 있다. 가치는 오탐률, 공개 관행, 재현성, 그리고 유지관리자가 실행 가능한 수정 지침을 받는지에 달려 있다.
회사는 더 광범위한 취약점 발견 실적도 보고한다. 공개 보안 원장에는 수집된 취약점 2,436건이 기재돼 있으며, 그중 1,097건은 심각도 critical 또는 high로 분류돼 있다.
이 수치는 Z.ai 자체 공개 시스템에서 나온 것이다. GLM 모델에 독립적으로 공로가 인정된 발견이 몇 건인지, 공급업체가 몇 건을 확인했는지, 모델이 정상적인 동작을 오인한 빈도가 어느 정도인지는 드러나지 않는다.
그럼에도 이 원장은 보안 전문성에 대한 일반적 주장보다 외부 관찰자가 감사할 수 있는 더 구체적인 자료를 제공한다. 공개 취약점 식별자, 영향을 받은 프로젝트, 공개 날짜, 패치는 시간이 지나면 더 강력한 평가를 뒷받침할 수 있다.
공개 가중치와 검증된 기능의 혼합 모델은 그러한 증거가 개선될 때에만 성공할 수 있다. 그렇지 않으면 “검증된 접근”은 공식 서비스를 설명하는 명칭일 뿐, 모델의 실제 위험을 설명하지 못할 수 있다.
CyberGym 점수는 위협 전체를 측정하지 않는다
CyberGym 84.5% 결과는 강력한 취약점 재현 능력을 보여주지만, 성공적인 공격에 필요한 모든 단계를 측정하지는 않는다.
CyberGym은 에이전트에 상당한 방향성을 제공하는 정보에서 시작한다. 이 벤치마크는 취약점 설명과 해당 소스 리포지토리를 제공한다. 그런 다음 에이전트는 알려진 결함을 유발하는 개념 증명 입력을 만들어야 한다.
실제 공격자는 훨씬 더 이른 단계에서 시작하는 경우가 많다. 알려지지 않은 표적을 발견하고, 초기 접근 권한을 얻고, 가치 있는 시스템을 식별하며, 탐지를 회피하고, 지속성을 유지한 뒤, 익숙하지 않은 네트워크를 이동해야 할 수 있다.
CyberGym에서 좋은 성과를 내는 모델이 이 전체 공격 사슬에 자동으로 능숙한 것은 아니다. 다만 인간 운영자가 부족한 맥락을 제공할 경우, 의미 있는 공격 작업을 더 빠르게 만들 수는 있다.
이 벤치마크는 단순한 크래시 유발과 의도된 취약점 재현도 구분한다. 이 차이는 중요하다. 크래시는 무언가가 실패했다는 사실을 증명할 뿐, 에이전트가 표적 결함을 이해하거나 악용했다는 의미는 아니기 때문이다.
최신 평가 시스템에 대한 연구는 이 격차를 더 분명하게 보여준다. ExploitGym은 에이전트에게 단순히 버그를 유발하는 데 그치지 않고, 알려진 취약점을 무단 코드 실행으로 전환하도록 요구한다.
ExploitGym benchmark는 사용자 공간 소프트웨어, Chrome의 V8 엔진, Linux 커널 전반에 걸친 869개 작업을 포함한다. 각 작업은 취약한 코드와 이미 결함을 입증하는 입력을 제공한다.
에이전트는 이 출발점을 실제로 작동하는 익스플로잇으로 바꿔야 한다. 연구진은 최신 방어 기법이 성공률을 크게 낮췄지만, 모든 작업에서 이를 완전히 제거하지는 못했다고 보고했다.
이 평가는 모델이 의도된 표적과 다른 결함을 통해 코드 실행을 달성하는 경우도 발견했다. 이 행동은 단순한 성공 횟수가 왜 오해를 부를 수 있는지 보여준다.
에이전트는 연구진이 측정하려 했던 역량을 입증하지 않고도 벤치마크 플래그를 획득할 수 있다. 반대로 인접한 취약점을 발견하는 일은 점수 산정을 복잡하게 만들더라도 가치 있는 보안 작업일 수 있다.
시간과 컴퓨팅 예산도 또 다른 불확실성 요인이다. 어려운 작업에서는 더 강력한 에이전트가 몇 시간 동안 계속 성능을 개선하는 반면, 약한 시스템은 이른 시점에 정체 상태에 도달할 수 있다.
GLM-5.3과 Mythos 5의 비교는 두 모델에 유사한 도구, 예산, 지침, 재시도 기회가 제공될 때에만 의미가 있다. 공개 요약 자료가 그 동등성을 확인할 만큼 충분한 세부 정보를 항상 공개하는 것은 아니다.
따라서 독립 재현은 최종 백분율 이상에 초점을 맞춰야 한다. 연구진에게는 모델 버전, 에이전트 프레임워크, 작업 하위 집합, 실행 환경, 도구 권한, 추론 설정, 채점 방식이 필요하다.
또한 오염 가능성도 테스트해야 한다. CyberGym은 과거의 취약점과 공개 리포지토리를 사용하므로, 관련 세부 사항이 학습 데이터에 포함됐을 가능성이 있다.
모델은 기억한 정보를 작동하는 개념 증명으로 전환하기 위해 여전히 상당한 추론이 필요할 수 있다. 그러나 오염은 결과가 실제보다 더 일반적인 것처럼 보이게 만들 수 있다.
새로운 취약점과 비공개 테스트 세트는 더 강력한 측정 기준을 제공할 것이다. 평가자는 패치된 제어 사례와 취약하지 않은 제어 사례도 추가해, 결함이 없을 때 모델이 취약점을 만들어내는지 확인할 수 있다.
운영 안전성에는 다른 종류의 테스트가 필요하다. 연구진은 모델이 범위를 준수하는지, 위험을 식별한 뒤 중단하는지, 비밀 정보를 보호하는지, 유용한 완화 조치를 제시하는지 측정해야 한다.
더 많은 버그를 찾아내지만 자격 증명을 노출하거나 테스트 시스템을 손상시키는 모델은 방어자에게 새로운 비용을 초래할 수 있다. 벤치마크 정확도만으로는 이러한 상충 관계를 포착할 수 없다.
따라서 84.5%라는 주장은 경고로 읽어야 한다. 이는 오픈 모델이 엄중한 테스트가 필요한 역량 임계점에 접근하고 있음을 시사한다. GLM-5.3이 최고의 사이버 모델이거나 가장 위험한 모델임을 증명하지는 않는다.
진정한 경쟁은 역량 대 통제다
GLM-5.3은 사이버 보안 AI를 배포의 문제로 바꾼다. 방어 역량의 범위가 넓어질수록 이 기술을 용도 변경할 수 있는 사람의 수도 늘어난다.
이것이 이 글의 핵심적인 상충 관계다. 유용한 보안 모델은 취약한 코드를 이해하고, 익스플로잇을 추론하며, 도구를 운용할 수 있어야 한다. 이와 동일한 능력은 공격 작업도 가속할 수 있다.
중앙화된 제공업체는 신원 확인, 요청 분류기, 모니터링, 보존 정책, 계정 집행을 통해 이 위험을 관리한다. 사용자가 정책을 위반하거나 새로운 증거가 위험 계산을 바꾸면 접근을 비활성화할 수 있다.
이러한 통제에는 한계가 있다. 분류기는 정당한 악성코드 분석, 사고 대응, 익스플로잇 검증까지 차단할 수 있다. 원격 서비스는 위기 상황에서 사용할 수 없거나 기밀 증거에 적합하지 않을 수도 있다.
오픈 웨이트는 이러한 문제 중 일부를 해결한다. 방어자는 보호된 네트워크 내부에서 모델을 실행하고, 독점 시스템에 맞게 조정하며, 로그와 민감한 코드에 대한 직접적인 통제를 유지할 수 있다.
동시에 개발자의 개입 능력은 약화된다. 수정된 모델은 신원 확인, 사용 모니터링, 중앙에서 유지되는 안전장치 없이 작동할 수 있다.
이 갈등은 Z.ai와 Anthropic이 더 넓은 배포 방식의 차이에도 불구하고 신뢰 기반 접근 프로그램으로 수렴하는 이유를 설명한다. 두 회사 모두 일부 사이버 기능에는 일반적인 코딩 지원보다 더 엄격한 검토가 필요하다는 점을 인식하고 있다.
Anthropic의 모델은 중앙 통제에서 출발해 더 깊은 접근 권한을 선별적으로 부여한다. Z.ai는 계획된 웨이트 공개에서 출발해, 선택된 기능과 환경 주변의 통제를 유지하려 한다.
어느 접근법도 오용을 제거하지는 못한다. 제공업체 관리 모델은 탈옥될 수 있고, 탈취된 계정을 통해 접근될 수 있으며, 역량 추출을 통해 복제될 수 있다. 오픈 모델은 미세 조정, 결합, 익명 배포가 가능하다.
관련 정책 질문은 모델이 고립된 상태에서 오픈인지 클로즈드인지가 아니다. 정책 입안자는 그 주변의 완전한 시스템을 살펴봐야 한다.
그 시스템에는 사용 가능한 도구, 자율 실행 환경, 네트워크 접근, 취약점 데이터, 컴퓨팅 예산, 로깅, 인간 검토, 생성된 코드를 실행할 수 있는 능력이 포함된다.
텍스트만 생성하는 모델은 스캐너, 디버거, 브라우저, 클라우드 자격 증명, 지속형 에이전트에 연결된 동일 모델과는 즉각적인 위험이 다르다.
이 구분은 기업에 더 실용적인 안전 목표도 제시한다. 유사한 정보가 공개 리포지토리와 보안 연구 전반에 존재할 때 모델 지식을 제한하기는 어렵다.
고위험 실행 환경을 통제하는 편이 더 측정 가능할 수 있다. 제공업체는 익스플로잇 하네스에 대한 접근을 제한하고, 표적을 격리하며, 승인을 요구하고, 민감한 행동 주변에 감사 추적을 남길 수 있다.
오픈 배포는 여전히 이 모델을 복잡하게 만든다. 특히 유능한 도구도 오픈일 경우 외부 사용자는 자체 환경을 구축할 수 있다.
해답은 단일한 글로벌 규칙에서 나오지 않을 것이다. 대형 인프라 제공업체, 독립 유지관리자, 학계 연구자, 정부 보안팀은 서로 다른 위협과 책임에 직면한다.
기업은 일상적인 코드 검토와 익스플로잇 가능한 자동화를 분리하는 것부터 시작해야 한다. 전자는 기존 개발자 통제 아래 운영할 수 있다. 후자는 더 엄격한 신원 확인, 범위, 로깅, 승인 요건이 필요하다.
팀은 어떤 모델이 어떤 리포지토리를 검토했으며 어떤 도구를 사용했는지도 기록으로 유지해야 한다. AI가 생성한 발견 사항은 공개 또는 완화 절차에 들어가기 전에 재현 가능해야 한다.
빠른 모델 변화를 추적하는 지식 노동자에게는 검색 가능한 AI knowledge base가 벤치마크 방법론, 시스템 카드, 정책 변화를 보존하는 데 도움이 될 수 있다. 헤드라인 점수가 핵심 평가 세부 사항을 생략할 때 이러한 맥락은 중요하다.
anthropic techmeme 프레이밍은 새로운 경쟁 구도를 드러내기 때문에 유용하다. 더 깊은 경쟁은 단지 GLM-5.3과 Mythos 5의 대결이 아니다. 이는 분산된 역량과 집행 가능한 통제의 대결이다.
GLM-5.3 출시 이후 주목할 점
세 가지 신호가 Z.ai가 방어 가능한 접근 모델을 만들었는지, 아니면 곧 제한 없이 풀릴 역량 주변에 일시적인 관문만 세웠는지를 결정할 것이다.
첫 번째 신호는 독립적인 벤치마크 재현이다. 연구진은 Z.ai가 보고한 것과 동일한 CyberGym 작업, 에이전트 프레임워크, 도구 권한, 컴퓨팅 예산을 사용해 공개된 GLM-5.3 웨이트를 테스트해야 한다.
84.5%에 가까운 재현 결과는 오픈 모델이 Mythos급 사이버 성능에 도달했다는 회사의 주장을 강화할 것이다. 큰 폭의 하락은 호스팅 시스템, 비공개 하네스, 또는 평가 설정이 실질적으로 기여했음을 시사할 것이다.
재현에는 새로운 작업과 취약하지 않은 제어 사례가 포함돼야 한다. 이는 진정한 코드 추론과 암기, 벤치마크 오염, 또는 그럴듯하지만 잘못된 익스플로잇 입력을 생성하는 경향을 구분하는 데 도움이 될 것이다.
두 번째 신호는 공개 웨이트와 검증된 접근 사이의 역량 격차다. Z.ai는 어떤 기능이 계속 제한되는지, 그리고 공개 모델이 왜 이를 쉽게 재현할 수 없는지를 설명해야 한다.
유용한 공개는 제한된 도구, 실행 한도, 모니터링, 파트너 자격 요건, 에스컬레이션 절차를 설명할 것이다. 오용을 쉽게 만드는 세부 사항을 공개해서는 안 된다.
독립 개발자들이 민감한 스택을 빠르게 재구성한다면, 검증된 사용자 정책은 실질적인 영향력이 거의 없을 것이다. 이는 Z.ai의 공식 서비스를 관리할 뿐, 통제 밖의 유사한 배포 환경은 그대로 남길 것이다.
제한된 환경이 실질적으로 더 강한 결과를 낸다면, 하이브리드 모델의 신뢰도는 높아진다. 오픈 웨이트는 일상적인 방어 작업을 지원하고, 가장 고위험 작업은 모니터링되는 시스템 안에 남을 수 있다.
세 번째 신호는 측정 가능한 방어적 채택이다. OpenVuln 프로그램과 Z.ai의 취약점 원장은 이 결과를 추적할 초기 수단을 제공한다.
관찰자는 보고된 발견 사항 중 얼마나 많은 수가 공개 식별자, 공급업체 확인, 패치를 받는지 지켜봐야 한다. 또한 공개 품질, 중복 비율, 오탐, 유지관리자가 모델 생성 보고서를 검증하는 데 필요한 시간도 살펴봐야 한다.
확인된 수정의 기록이 늘어나면 오픈 사이버 역량이 방어자를 강화한다는 Z.ai의 주장을 뒷받침할 것이다. 눈에 보이는 완화 조치가 없는 대규모 비공개 재고는 평가하기 더 어려울 것이다.
규제 대응은 이 세 가지 신호 모두를 형성할 것이다. 정부는 특히 웨이트가 즉시 국경을 넘을 수 있을 때 취약점 발견과 악용을 자동화할 수 있는 모델에 점점 더 우려를 표하고 있다.
광범위한 제한은 개발을 덜 투명한 경로로 밀어낼 수 있다. 약한 통제는 중요 인프라를 저렴하고 확장 가능한 자동화에 노출할 수 있다.
더 신뢰할 수 있는 프레임워크는 입증된 역량과 운영 맥락에 초점을 맞출 것이다. 이는 일반적인 로컬 코드 분석과 표적을 자율적으로 악용하고, 방어를 회피하거나, 네트워크 전반에서 작동하는 시스템을 구분할 수 있다.
모델 개발자는 표준화된 평가, 사고 보고, 접근 기록, 그리고 안전 주장들이 독립적인 테스트를 견뎌낸다는 증거를 요구받을 것으로 예상해야 한다.
보안팀은 이러한 표준을 기다리지 말아야 한다. 격리된 환경에서 사이버 에이전트를 테스트하고, 자격 증명을 제한하며, 서면 승인을 요구하고, 발견과 악용 사이에 인간을 배치할 수 있다.
또한 모델을 완화 품질로 비교해야 한다. 결함을 찾는 일도 중요하지만, 안전한 패치, 회귀 테스트, 이해하기 쉬운 설명을 만드는 일이 종종 더 큰 방어적 가치를 창출한다.
당장의 GLM-5.3 이야기는 좁은 범위의 벤치마크 우위다. 더 큰 anthropic techmeme 이야기는 고급 사이버 추론을 둘러싼 독점성의 상실에 관한 것이다.
Anthropic은 서비스와 배포를 통제하기 때문에 Mythos 5를 제한할 수 있다. Z.ai는 더 폭넓은 사본이 원래 엔드포인트에 부착된 어떤 정책보다도 오래 지속될 수 있는 모델을 공개할 준비를 하고 있다.
이는 다가오는 출시를 0.7점의 점수 차이보다 더 중요하게 만든다. 독립적인 결과, 검증된 접근 권한 기능의 격차, 그리고 확인된 취약점 수정 여부가 Z.ai의 절충안이 효과를 발휘하는지 보여줄 것이다.
개발자와 기업 구매자는 이 모델을 도입하기 전에 한 가지를 물어야 한다. 모델 자체가 더 이상 희소하지 않은 상황에서도, 자신의 통제 체계가 에이전트의 도구와 행동을 관리할 수 있는가?


