top of page

Kimi K3는 프런티어에 근접해 보였다. 그러나 사이버 테스트는 훨씬 큰 격차를 드러냈다

7월 25일
12분 분량

Kimi K3는 공격적 사이버보안 테스트에서 32.2%를 기록했다. 이는 선도적인 미국 모델들이 달성한 평균 76.2%의 절반에도 못 미친다. 이 결과는 Moonshot AI의 새 플래그십 모델이 폐쇄형 모델 프런티어에 근접한다는 더 넓은 주장에 복잡성을 더한다.

이 격차는 영국 인공지능 보안 연구소와 미국 AI 표준 및 혁신 센터의 공동 평가에서 드러났다. 이들의 테스트는 Kimi가 작동하는 익스플로잇을 구축하고 시뮬레이션된 기업 네트워크를 탐색할 수 있는지를 살폈다.

Kimi K3는 같은 익스플로잇 벤치마크에서 24.4%를 기록한 Zhipu AI의 GLM-5.2보다 여전히 높은 성과를 냈다. 그러나 Kimi는 테스트된 41개 취약점 중 어느 하나에서도 임의 코드 실행을 달성하지 못했다. 선도적인 미국 모델들은 평균적으로 20개 과제에서 그 최종 단계에 도달했다.

이러한 역전은 Kimi K3가 코딩, 비주얼 개발, 긴 컨텍스트 작업, 에이전트형 과제에서 인상적인 성과와 함께 등장했기 때문에 중요하다. Moonshot은 이를 Anthropic과 OpenAI의 제품에 근접한 2조8천억 파라미터 규모의 오픈 웨이트 모델로 제시했다.

사이버 평가는 더 불균등한 모습을 보여준다. Kimi는 눈에 잘 보이는 여러 제품 과제에서는 경쟁력을 보이지만, 까다로운 다단계 역량 테스트에서는 크게 뒤처지는 것으로 보인다.

개발 과정에서 Moonshot이 지식 증류를 사용했다는 의혹은 이 불균형에 정치적 의미를 부여했다. 증류는 더 강력한 다른 모델의 출력을 이용해 한 모델을 훈련하는 방식이다. 미국 당국자들은 증류가 Kimi K3의 특정 성능 프로필을 초래했다는 점을 입증하는 공개 기술 증거를 제시하지 않았다.

따라서 벤치마크 격차가 복제의 증거는 아니다. 다만 다듬어진 출력과 광범위한 종합 점수만으로 프런티어 지위를 판단하는 방식의 한계를 드러낸다.

Kimi 사이버 테스트가 실제로 발견한 것

핵심 결과는 단순히 Kimi가 패배했다는 데 있지 않다. 익스플로잇 개발에서 가장 중대한 단계에 이르기 전에 멈췄다는 점이다.

정부 평가는 Carnegie Mellon University 연구진이 만든 공개 벤치마크인 ExploitBench를 사용했다. 이 벤치마크는 AI 에이전트가 소프트웨어 취약점을 익스플로잇하는 데 필요한 단계들을 얼마나 멀리 진행하는지 측정한다.

충돌만으로는 완전한 익스플로잇으로 인정되지 않는다. 에이전트는 임의 메모리 접근, 제어 흐름 조작, 궁극적으로 임의 코드 실행을 포함한 점점 더 유용한 역량을 구축해야 한다.

벤치마크는 Chrome이 사용하는 JavaScript 및 WebAssembly 엔진인 V8에서 2023년 이후 공개된 41개 취약점을 사용한다. 해당 취약점들은 패치됐지만, 통제된 평가를 위한 어렵고 현실적인 표적을 제공한다.

ExploitBench 논문은 이 역량 사다리에서 측정 가능한 16개 단계를 설명한다. 결정론적 검증은 에이전트가 각 단계에 실제로 도달했는지 확인해, 그럴듯하지만 작동하지 않는 답변의 가치를 낮춘다.

Kimi K3는 전체 ExploitBench 점수 32.2%를 받았다. GLM-5.2는 24.4%에 도달했고, 선도적인 미국 시스템들은 평균 76.2%를 기록했다.

이 점수 차이는 사소한 중간 이정표에만 국한되지 않았다. Kimi는 41개 과제 중 0개에서 임의 코드 실행을 달성했다. 선도적인 시스템들은 평균 20개 과제에서 성공했다.

임의 코드 실행은 공격자가 표적에서 원하는 명령을 실행할 수 있게 한다. 이는 버그를 찾아내거나 충돌을 일으키는 입력을 만드는 것보다 훨씬 심각한 결과다.

평가자들은 또한 4개 서브넷과 약 20개 호스트로 구성된 시뮬레이션 기업 네트워크인 The Last Ones에서 Kimi를 테스트했다. 이 환경에는 인간 전문가가 완료하는 데 약 20시간이 걸리는 32단계 공격 경로가 포함돼 있다.

Kimi는 1억 토큰 제한 아래에서 평균 17단계에 도달했다. 선도적인 미국 모델들은 28.5단계에 도달했고, GLM-5.2는 11단계에 도달했다.

Kimi는 10번의 시도 중 한 번에서 전체 범위를 완료했다. 더 유능한 폐쇄형 모델들은 이전 테스트에서 6~7번의 시도 만에 이를 완료했다.

그 한 번의 성공은 안심할 만한 해석을 막는다. Kimi가 실험실 조건에서 엔드투엔드 침입을 수행할 능력이 전혀 없는 것은 아니다. 핵심 약점은 반복 시도 전반에서의 신뢰성과 깊이였다.

공동 사이버 평가에 따르면, 시뮬레이션 환경에는 능동적 방어자나 방어 모니터링이 없었다. 또한 실제 네트워크에서 경보를 유발할 소음성 행동에 대한 불이익도 부과되지 않았다.

테스트는 초기 네트워크 접근 이후에 시작됐으며, 의도적으로 설정된 공격 경로를 포함했다. 방어된 기업 환경에서 발견되는 불확실성, 기만, 접근 제어, 중단 상황은 재현하지 않았다.

그런 이점이 있었음에도 Kimi는 대체로 중간 지점 근처에서 멈췄다. 이는 공격 역량이 주요 오픈 웨이트 동종 모델보다 높지만, 테스트된 가장 강력한 폐쇄형 시스템보다는 낮다는 뜻이다.

평가도 선택적이었다. Kimi의 호스팅 구성 때문에 연구소들은 완전한 사이버 테스트 제품군을 실행할 수 없었고, 따라서 종합 역량 추정치는 ExploitBench에만 의존했다.

그 결과 신뢰 구간은 여러 벤치마크에서 테스트된 모델들의 신뢰 구간보다 더 넓었다. 이 결과는 의미가 있지만, 모든 사이버 역량을 포괄적으로 순위화한 것은 아니다.

바뀐 것은 증거의 질이다. Kimi K3는 이미 강력한 공개 시연과 일반 벤치마크 점수를 내놓았다. 정부 테스트는 그러한 역량이 길고 가혹한 기술적 의존성 사슬을 견뎌내는지를 측정했다.

그러나 대개 그러지 못했다.

Kimi K3의 벤치마크 격차가 중요한 이유

Kimi K3는 강점과 약점이 서로 반대 방향을 가리키기 때문에 오픈 모델 지지자와 미국 프런티어 연구소 모두에 압박을 가한다.

Moonshot은 2026년 7월 16일 Kimi K3를 공개했다. 회사는 이 모델이 총 2조8천억 개의 파라미터를 포함하며 희소 Mixture-of-Experts 아키텍처를 사용한다고 밝혔다.

Mixture-of-Experts 모델은 각 입력을 소수의 특화 컴포넌트로 라우팅한다. Moonshot은 Kimi가 896개 전문가 중 16개를 활성화해 토큰당 필요한 연산량을 줄인다고 설명한다.

이 모델은 네이티브 비주얼 입력과 최대 100만 토큰의 컨텍스트 윈도도 지원한다. Moonshot은 이러한 기능을 코딩, 디자인, 연구, 지속적인 에이전트 작업을 중심으로 제시했다.

Kimi K3 개요에서 Moonshot은 이 모델이 전반적으로 가장 강력한 독점형 경쟁 모델들에는 여전히 뒤처진다는 점을 인정한다. 그럼에도 여러 평가 범주에서 Kimi를 프런티어에 가깝게 위치시키는 결과를 보고했다.

이 결과들은 매력적인 서사를 만들었다. 중국 기업이 선도적인 미국 시스템에 가까워 보이는 초대형 모델을 구축했고, 그 가중치 공개를 계획하고 있다는 이야기다.

ExploitBench는 더 까다로운 단서를 제시한다. 코드를 읽고, 도구를 사용하며, 실패한 시도를 수정하는 작업이 모두 포함되더라도 경쟁력 있는 코딩 성능이 경쟁력 있는 익스플로잇 구축을 보장하지는 않는다.

일반적인 코딩 벤치마크는 익숙한 리포지터리 안에서 정의된 소프트웨어 과제를 완수하는 능력을 보상하는 경우가 많다. 익스플로잇 개발에는 저수준 추론, 실험, 메모리 조작, 표적 프로세스에 대한 정밀한 제어가 서로 다른 방식으로 결합돼야 한다.

성공한 각 단계는 다음 단계의 의존성이 된다. 초기에 미묘한 실수를 저지른 모델은 비생산적인 경로를 탐색하는 데 수백만 토큰을 쓸 수 있다.

32.2% 점수는 Kimi가 이 사슬을 따라 의미 있는 진전을 이룰 수 있음을 시사한다. 임의 코드 실행 결과가 0건이라는 점은 그러한 진전이 완전한 제어로 이어지는 경우는 드물다는 것을 보여준다.

Moonshot 입장에서는 종합 지능 점수가 광범위한 프런티어 동등성을 입증한다는 단순한 주장을 약화시킨다. 기업 구매자는 한 에이전트형 범주에서의 탁월함이 다른 범주로 이전된다고 가정할 수 없다.

미국 연구소에 이 결과가 주는 안도감도 제한적이다. Kimi는 GLM-5.2를 앞섰고 네트워크 범위를 한 번 완료했다. 오픈 웨이트 시스템들은 최근까지 폐쇄형 모델에 집중돼 있던 역량을 얻고 있다.

오픈 웨이트는 역량이 확산되는 방식도 바꾼다. 일단 공개되면 모델은 수정, 미세 조정, 맞춤형 스캐폴딩 통합이 가능하며 원래 제공업체의 안전장치 없이 운영될 수도 있다.

따라서 Kimi의 계획된 가중치 공개는 이 모델이 폐쇄형 프런티어보다 뒤처져 있더라도 중요하다. 공격자는 모든 표적에 가장 강력한 시스템이 필요한 것이 아니다. 접근 가능하고, 적응 가능하며, 충분한 역량을 갖춘 시스템이 필요하다.

방어자에게도 같은 기회가 있다. 보안팀은 오픈 모델을 검사하고, 통제된 네트워크 내에 배포하며, 민감한 코드를 외부로 전송하지 않고 취약점 연구에 맞게 조정할 수 있다.

이 벤치마크가 그 이중 용도 균형을 결론내리지는 않는다. 역량은 이미 상당하지만, 가장 고도화된 형태는 여전히 불균등하다는 점을 보여준다.

개발자들은 에이전트 하니스의 역할도 주목해야 한다. 모델은 텍스트 생성만으로 소프트웨어를 익스플로잇하지 않는다. 도구, 명령 실행, 피드백 루프, 상태를 보존하는 전략을 통해 작동한다.

다른 하니스는 기본 가중치를 바꾸지 않고도 Kimi의 성능을 개선할 수 있다. 반대로 약한 하니스는 강력한 모델을 실제보다 덜 유능하게 보이게 할 수 있다.

연구소들은 비교를 지원하기 위해 표준화된 환경을 사용했지만, 표준화됐다고 해서 제품 중립적인 것은 아니다. 공개 코딩 순위는 서로 다른 스캐폴드를 갖춘 서로 다른 모델을 자주 결합하며, 이는 신뢰하기 어려운 사과 대 사과 비교 결론을 낳게 한다.

이것이 Kimi 사이버 테스트가 하나의 리더보드를 넘어 중요한 이유다. 이 테스트는 표면적인 유창함으로는 부족한 기술적 깊이를 쉽게 감출 수 없는 역량 사슬을 측정한다.

이 결과는 Kimi의 공개를 단순한 경쟁 서사에서 역량의 형태에 대한 질문으로 바꾼다. 모델은 한 각도에서는 프런티어에 가까워 보이고, 다른 각도에서는 멀어 보일 수 있다.

증류는 출력을 복제할 수 있지만 모든 역량을 이전하지는 않는다

지식 증류는 불균등한 성능에 대한 그럴듯한 설명이지만, 현재 이용 가능한 증거는 그 인과 관계를 확립하지 않는다.

증류는 더 강력한 모델의 출력을 이용해 다른 모델을 훈련한다. 학생 모델은 교사의 가중치를 받지 않고도 추론, 형식화, 도구 사용, 과제 완료의 패턴을 흡수할 수 있다.

이 기술은 합법적인 모델 개발에서 흔히 사용된다. 시스템을 압축하거나, 특화된 행동을 이전하거나, 인간 예시가 부족할 때 합성 훈련 데이터를 생성할 수 있다.

논란의 대상은 기술의 존재가 아니라 승인과 규모다. 백악관 과학기술정책실의 Michael Kratsios 국장은 Moonshot이 Anthropic의 Fable 모델을 증류했다고 비난했다.

보도된 의혹에 따르면 Moonshot은 탐지를 피하기 위해 접근 방식을 전환하는 내부 플랫폼을 구축했다. 정부는 그 주장을 뒷받침하는 로그, 훈련 기록, 포렌식 방법론을 공개적으로 내놓지 않았다.

Anthropic은 앞서 Moonshot과 다른 중국 연구소들이 Claude를 상대로 대규모 증류 캠페인을 벌였다고 비난한 바 있다. Moonshot은 Kimi K3의 훈련 데이터가 어떻게 구성됐는지를 밝히는 상세한 공개 답변을 제공하지 않았다.

이로 인해 두 가지 별개의 질문이 남는다. 하나는 무단 증류가 발생했는지에 관한 것이다. 다른 하나는 증류가 Kimi의 사이버 벤치마크 격차를 설명하는지에 관한 것이다.

첫 번째는 증거와 정책의 분쟁이다. 두 번째는 기술적 가설이다.

교사의 답변으로 훈련된 학생 모델은 샘플링된 출력에 담긴 행동을 학습할 수 있다. 그러나 그러한 이전은 프롬프트 범위, 출력 품질, 훈련 목표, 학생 모델 자체의 아키텍처에 달려 있다.

가시적인 코딩 작업에는 풍부한 사례와 명확한 피드백이 존재한다. 모델은 대규모로 생성된 추적 데이터를 통해 인터페이스 구축, 리포지토리 편집, 소프트웨어 설명의 관행을 학습할 수 있다.

고급 익스플로잇 구축은 포착하기가 더 어렵다. 성공 사례는 드물고, 운용 측면에서 민감하며, 정밀한 환경과의 상호작용에 의존한다.

교사의 최종 답변에는 실패한 실험, 내부의 불확실성, 중간 단계의 발견이 빠질 수 있다. 이러한 숨겨진 단계에는 신뢰할 수 있는 자율 작업에 필요한 지식 상당 부분이 담겨 있을 수 있다.

ExploitBench는 답변 스타일의 재현 이상의 능력도 요구한다. 무작위화된 검증은 에이전트가 실제 대상 환경을 상대로 작동하는 프리미티브를 구축하도록 요구한다. 암기한 언어만으로는 이 검증을 통과할 수 없다.

이는 일관된 가설을 만든다. 증류는 깊은 환경 상호작용이 필요한 드문 역량보다, 자주 샘플링되는 가시적 행동을 더 빠르게 개선할 수 있다.

그렇다면 Kimi는 일반적인 코딩 작업에서는 주장된 교사 모델에 가까워 보이면서도, 익스플로잇 개발에서는 크게 뒤처질 수 있다. 벤치마크 프로필은 이러한 설명과 부합한다.

부합한다고 해서 증거가 되는 것은 아니다. 동일한 증거에 들어맞는 다른 설명도 여러 가지다.

Moonshot이 공격적 사이버보안 분야의 사후 학습에 더 적은 노력을 투입했을 수 있다. 에이전트 하네스가 긴 익스플로잇 체인을 유지하는 데 덜 효과적일 수도 있다. 평가에서는 관련된 거부의 증거가 거의 발견되지 않았지만, 안전성 학습이 특정 행동을 선택적으로 바꿨을 가능성도 있다.

모델의 희소 아키텍처 역시 작업별로 다른 강점을 만들 수 있다. 긴 컨텍스트 설계는 저수준 익스플로잇 추론을 같은 속도로 향상시키지 못하면서도, 조사와 소프트웨어 탐색에는 도움이 될 수 있다.

학습 데이터 구성도 또 다른 가능성이다. 광범위한 웹 개발 및 리포지토리 데이터에 노출된 모델은 공개 코딩 작업에서 뛰어난 성과를 낼 수 있지만, 고품질 익스플로이테이션 추적 데이터는 더 적게 접했을 수 있다.

마지막으로 이 비교에는 이름이 공개되지 않은 미국 모델들이 포함된다. 독자는 이들의 아키텍처, 학습 시점, 사이버 특화 사후 학습, 정확한 제품 버전을 검토할 수 없다.

Associated Press 보도는 Kimi가 여러 능력에서 Claude와 ChatGPT에 근접했다고 설명했다. 이처럼 광범위한 관찰은 하나의 특수 분야에서 심각한 격차가 존재하는 사실과 양립할 수 있다.

책임 있는 결론은 제한적이다. 증류는 모델이 프런티어 행동을 불균등하게 모방하는 이유를 설명하는 데 도움이 될 수 있지만, 이 평가는 증류를 탐지하지 않는다.

이 평가는 두 개의 통제된 사이버 환경에서 Kimi가 수행할 수 있었던 일을 측정한다. 어떤 학습 사례가 그러한 역량을 만들어냈는지는 밝히지 못한다.

점수를 포렌식 증거로 취급하면 벤치마크를 과대해석하게 된다. 불균등한 역량 프로필을 무시하면 가장 가치 있는 신호를 놓치게 된다.

안전성 결과는 안심할 만하지 않다

Kimi의 낮은 역량에는 공격적 사이버 지원을 막는 효과적인 안전장치가 수반되지 않았다.

평가자들은 Kimi의 안전장치가 익스플로잇 개발이나 공격적 네트워크 운영 시도를 막지 못했다고 보고했다. 모델은 일관되게 거부하기보다 작업에 응했다.

이 세부 사항은 격차에 대한 한 가지 가능한 설명을 제거한다. Kimi가 32.2%를 기록한 이유가 대부분의 요청을 거부했기 때문만은 아니다.

주요 미국 모델들은 시스템 수준 안전장치를 비활성화한 상태에서 시험됐다. 이 선택은 해당 기관들이 공개 제품의 지원 의지보다 최대 기술 역량을 추정할 수 있게 했다.

따라서 이 비교는 제한이 완화된 미국 시스템의 잠재 역량과 Kimi의 접근 가능한 행동을 나란히 놓는다. 일반 사용자가 공개된 미국 채팅 제품에서 동일한 지원을 받을 수 있음을 보여주지는 않는다.

이 구분은 양쪽에 모두 적용된다. 폐쇄형 제공업체는 서버 측 안전장치를 업데이트하고, 사용을 모니터링하며, 계정을 해지하고, 도구 접근을 제한할 수 있다. 오픈 웨이트 사용자는 모델을 내려받은 뒤 많은 행동 통제를 제거할 수 있다.

Kimi의 기존 안전장치는 이미 평가된 작업을 허용했다. 웨이트가 공개되면 후속 버전에서는 이러한 장치가 더 약화될 수 있다.

그렇다고 위험을 과장해서는 안 된다. Kimi는 41개 ExploitBench 작업 전체에서 임의 코드 실행을 달성하지 못했다. 모의 기업 공격도 10번의 시도 중 한 번만 완료했다.

유능한 인간 운영자는 출력을 검증하고, 실패한 단계를 수정하며, 대상을 선택하고, 운용 보안을 관리해야 한다. 이 모델은 강화된 조직을 안정적으로 침해하는 자동 침입 시스템이 아니다.

하지만 신뢰성만이 유일하게 관련된 척도는 아니다. 신뢰성이 낮은 보조 도구도 정찰, 익스플로잇 변형, 스크립팅, 반복 실험에 필요한 노동을 줄일 수 있다.

The Last Ones 결과는 구체적인 시나리오를 제시한다. 의도적으로 취약하게 구성된 소규모 네트워크에 초기 접근 권한이 주어졌을 때, Kimi는 평균적으로 32개의 공격 단계 중 17개에 도달했다.

모델이 멈추는 시점에는 인간이 작업을 이어받고, 이후 업데이트된 상태를 다시 제공해 추가 작업을 진행할 수 있다. 이러한 혼합형 워크플로가 완전한 자율성을 기대하는 것보다 더 현실적일 수 있다.

모델의 토큰 한도도 중요하다. 각 시도는 최대 1억 토큰을 사용할 수 있어 장기간의 시행착오가 가능하다. 이는 일반적인 가벼운 채팅 세션이 아니다.

Kimi를 평가하는 조직은 세 가지 질문을 분리해야 한다.

  • 모델이 취약점을 식별하거나 설명할 수 있는가?

  • 통제된 조건에서 작동하는 익스플로잇을 만들 수 있는가?

  • 프로덕션 보안 워크플로 내에서 안전하게 운영할 수 있는가?

정부 평가는 주로 두 번째 질문을 다룬다. 안전한 배포, 감사 가능성, 데이터 처리, 오용에 대한 저항성에 대해서는 제한적인 증거만 제공한다.

기업 팀은 낮은 점수를 보안 통제로 간주해서는 안 된다. 역량의 한계는 파인튜닝, 더 나은 도구 통합, 또는 새 모델 출시 이후 달라질 수 있다.

또한 모든 후속 배포 환경에서 제공업체의 안전장치가 그대로 유지된다고 가정해서도 안 된다. 모델 웨이트, 에이전트 소프트웨어, 프롬프트, 실행 권한은 결합된 하나의 시스템을 이룬다.

가장 즉각적인 방어 교훈은 권한에 관한 것이다. AI 코딩 에이전트는 기반 모델이 사이버 벤치마크에서 낮은 성과를 보였다는 이유만으로 광범위한 프로덕션 접근 권한을 받아서는 안 된다.

샌드박싱, 자격 증명 격리, 네트워크 제한, 인간 승인, 상세 로그는 여전히 필요하다. 이러한 통제는 악의적 사용과 우발적 피해를 모두 억제한다.

이 문제는 Kimi를 넘어선다. ExploitBench 프로젝트는 테스트된 시스템에서 크래시 유발은 일상적인 일이 됐지만, 완전한 익스플로이테이션은 여전히 비공개 프런티어 부근에 집중돼 있다고 보고한다.

이 경계는 이동할 것이다. 더 나은 에이전트, 더 큰 컨텍스트 윈도, 특화된 사후 학습은 일관성 없는 역량을 반복 가능한 워크플로로 바꿀 수 있다.

따라서 Kimi의 결과는 영구적인 안전 여유가 아니라 일시적 측정치다. 현재의 격차는 크지만, 작업에 참여하려는 성향은 남아 있는 역량을 운용상 중요하게 만든다.

이 수치가 증명하지 않는 것

이 평가는 Kimi의 프런티어 서사에 의문을 제기하지만, 모델의 품질, 기원, 현실 세계의 위험에 대한 완전한 판단을 뒷받침하지는 않는다.

ExploitBench는 하나의 엔진에서 하나의 취약점 클래스를 다룬다. V8은 널리 배포되고 익스플로잇하기 어렵지만, 모든 운영체제, 애플리케이션 프레임워크, 네트워크 서비스를 대표하지는 않는다.

벤치마크는 패치 커밋을 제공하고 에이전트에게 익스플로잇 개발을 요청한다. 이는 알려진 취약점이 존재한 뒤의 익스플로이테이션을 측정하며, 알려지지 않은 결함의 독립적 발견을 측정하지는 않는다.

Kimi는 웹 애플리케이션, 메모리 안전 언어, 구성 오류, 클라우드 권한, 사회공학에서 다르게 수행할 수 있다. 이 평가는 그러한 질문에 답하지 않는다.

통합 비교는 모델의 정체도 감춘다. 해당 기관들은 가장 강력한 비교 집단을 각 제품명을 밝히지 않은 최근 미국 프런티어 폐쇄형 웨이트 모델로 설명한다.

이는 민감한 평가 정보를 보호하지만 외부 검증을 제한한다. 구매자는 정확한 비교를 재현할 수 없으며, 이름이 알려진 상용 모델이 보고된 평균과 일치하는지도 판단할 수 없다.

76.2%라는 수치는 평균이지, 보편적인 프런티어 기준선이 아니다. 개별 시스템은 그보다 높거나 낮을 수 있다.

Kimi의 32.2% 점수도 16개 익스플로잇 단계에서의 부분 진전을 포함한다. 이를 취약점의 약 3분의 1을 해결했다는 뜻으로 해석해서는 안 된다.

마찬가지로 임의 코드 실행 성공이 0건이라는 사실은 유용한 사이버 역량도 0이라는 뜻이 아니다. 모델은 여전히 크래시를 재현하고, 중간 프리미티브를 개발하며, 네트워크 범위에서 진전을 이뤘다.

신뢰구간에도 주의를 기울일 필요가 있다. Kimi의 전체 사이버 추정치는 선별적 평가에서 나왔지만, 다른 모델들은 더 많은 작업과 도메인에 걸친 결과를 보유했다.

향후 완전한 평가가 이 모델의 추정 위치를 바꿀 수 있다. 더 나은 하네스나 다른 추론 구성도 결과를 바꿀 수 있다.

모의 네트워크 역시 또 다른 한계를 지닌다. 이 환경에는 활성 방어자도, 엔드포인트 탐지도, 시끄러운 명령에 대한 불이익도 없었다.

해당 범위를 완료했다는 사실은 유리한 조건에서의 자율 역량 한 형태를 증명한다. Kimi가 현대적인 기업을 은밀하게 침해할 수 있음을 입증하지는 않는다.

반대 방향의 추론도 마찬가지로 안전하지 않다. 이 범위에서 자주 실패했다고 해서 맞춤형 버전이나 인간이 주도하는 워크플로로 인한 위험이 작다는 증거는 아니다.

증류 논쟁에도 같은 절제가 필요하다. 벤치마크는 이례적인 프로필을 드러낼 수 있지만, 학습 파이프라인을 재구성할 수는 없다.

기술적 증거를 위해서는 접근 기록, 생성된 데이터셋, 모델 비교, 학습 문서, 또는 귀속 판정을 위해 설계된 통계적 방법이 필요하다. 공개된 사이버 평가에는 이러한 자료가 없는 것으로 보인다.

정치적 맥락은 또 다른 불확실성의 원천을 더한다. Kimi는 중국 AI, 수출 통제, 오픈 웨이트, 지식재산권을 둘러싼 미국 내 격렬한 논쟁 속에서 등장했다.

정부 기관에는 외국 모델을 시험할 정당한 이유가 있다. 그럼에도 결과는 지정학적 서사에 흡수되기보다 방법론과 한계를 통해 평가돼야 한다.

Moonshot 자체의 벤치마크 주장도 동일하게 다뤄져야 한다. 기업이 선택한 테스트는 실제 강점을 부각할 수 있지만, 중요한 약점은 측정하지 못한 채 남길 수 있다.

가장 설득력 있는 해석은 두 증거 집합을 결합한다. Kimi K3는 여러 코딩 및 에이전트 작업에서 높은 역량을 보이지만, 고급 익스플로잇 구축에서는 상당히 약한 것으로 보인다.

이는 모순이 아니다. 범용 모델은 불균등하게 발전하며, 벤치마크 평균은 도메인 간의 뚜렷한 차이를 가릴 수 있다.

개발자에게 실용적인 대응은 작업별 평가다. 높은 일반 점수는 프로덕션에서 사용하는 정확한 리포지토리, 도구, 권한, 실패 조건에 대한 테스트를 대체해서는 안 된다.

보안 팀에는 성공뿐 아니라 지속성, 권한 상승 행동, 거부 패턴, 실수 이후의 복구 가능성까지 기록하는 적대적 시험이 필요하다.

기업 구매자는 모델 카드, 안전성 평가, 배포 통제, 그리고 각 안전장치의 소유 주체를 명확히 설명하는 문서를 요구해야 한다.

Kimi의 사이버 점수는 단일 수치에 의존한 조달에 대한 경고로서 가장 유용하다. 출시 시연이나 하나의 안전성 벤치마크만으로는 전체 결정을 감당할 수 없다는 점을 보여준다.

오픈 웨이트 출시 이후 주목할 점

Kimi의 사이버 격차가 구조적으로 유지될지, 엔지니어링을 통해 좁혀질지, 또는 맞춤화를 통해 더 위험해질지를 결정할 세 가지 신호가 있다.

첫 번째 신호는 Moonshot이 웨이트를 공개한 뒤의 독립 재현이다. 연구자들은 문서화된 하드웨어, 추론 설정, 프롬프트, 에이전트 스캐폴드를 사용해 ExploitBench를 다시 실행해야 한다.

독립 결과가 32.2% 부근에 머문다면 평가의 핵심 발견은 더 강해진다. Kimi는 다른 강점에도 불구하고 익스플로잇 개발에서는 폐쇄형 프런티어에 의미 있게 뒤처지는 것으로 보일 것이다.

더 나은 하니스에서 성능이 급격히 상승한다면 해석은 달라진다. 원래 결과는 모델 자체의 역량만큼이나 시스템 통합 수준을 반영한 것이었을 수 있다.

두 번째 신호는 Moonshot의 기술 보고서와 안전성 문서다. 이 회사는 Kimi K3의 아키텍처, 학습, 평가에 관한 더 자세한 정보를 제공하겠다고 약속했다.

유의미한 공개라면 사이버 사후 학습, 안전장치 설계, 데이터 거버넌스, 그리고 Moonshot이 공개한 벤치마크 점수에 적용된 조건을 설명해야 한다. 또한 다운로드 가능한 모델이 호스팅 서비스와 동일한지도 명확히 해야 한다.

이런 세부 사항만으로 증류 의혹이 독자적으로 해소되지는 않는다. 다만 모델이 어떻게 만들어졌고 그 역량이 어디에서 비롯됐는지에 대한 불확실성을 줄일 수는 있다.

상세한 안전성 평가는 오픈 웨이트가 만들어내는 위험을 Moonshot이 이해하고 있다는 주장을 강화할 것이다. 공개가 제한적이라면 기업은 외부 테스트에 의존할 수밖에 없다.

세 번째 신호는 출시 후 이뤄지는 전문화된 파인튜닝이다. 보안 연구자와 모델 호스팅 업체는 코딩, 취약점 분석, 자율적 도구 사용을 위해 Kimi를 조정할 가능성이 높다.

일반 대화 품질이 소폭 개선되는 정도라면 이 글의 결론은 바뀌지 않는다. 그러나 임의 코드 실행이나 네트워크 범위 신뢰성이 크게 향상된다면 이야기는 달라진다.

그 결과는 Kimi의 현재 약점이 근본적인 역량 한계가 아니라 사후 학습이나 스캐폴딩에서 비롯됐음을 보여줄 것이다. 또한 방어자가 대비할 수 있는 시간도 줄어들게 된다.

기업이 가장 안전하게 전제해야 할 것은 오늘의 점수가 고정돼 있지 않다는 사실이다. 모델은 새로운 체크포인트, 더 긴 추론, 개선된 도구, 커뮤니티 수정으로 변화한다.

개발자는 출시 첫 주의 순위에 의존하기보다 재현 가능한 역량 평가를 추적해야 한다. 보안 책임자는 권한과 도구 체인을 포함해 실제 배포된 에이전트 전체를 테스트해야 한다.

Kimi K3가 첨단 사이버 역량에서의 미국 우위를 지우지는 않는다. 그렇다고 지속 가능한 안전 완충장치를 제공하는 것도 아니다.

32.2%라는 ExploitBench 결과는 더 강한 일반 벤치마크 뒤에 가려진 큰 격차를 드러낸다. 성공적인 네트워크 범위 시도는 낮은 점수에도 실질적 위험이 따른다는 점을 보여준다.

다음 질문은 Kimi가 하나의 벤치마크에서 이겼는지 졌는지가 아니다. 오픈 웨이트 개발자들이 방어자가 적응하는 속도보다 더 빠르게 부분적이고 일관되지 않은 사이버 기술을 신뢰할 수 있는 역량으로 전환할 수 있는지다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page