SecRespond, 23개 프런티어 AI 모델의 은밀한 침입 탐지 실패 확인
SecRespond는 단호한 결과와 함께 Google News에 올랐습니다. 23개 프런티어 모델 가운데 테스트한 어떤 침해 호스트에서도 탐지와 복구를 완료한 모델은 없었습니다. 에이전트들은 눈에 보이는 경보는 훨씬 잘 처리했지만, 은밀한 증거에는 취약했고, 이는 AI 지원 트리아지와 자율 사고 대응 사이의 격차를 드러냅니다.
Alibaba Group의 연구진은 2026년 7월 29일 SecRespond 논문을 제출했습니다. 이들은 모델이 파일을 검사하고 명령줄 도구를 사용할 수 있도록 하는 에이전트 하니스인 OpenCode를 통해 여러 주요 계열의 모델을 테스트했습니다.
테스트는 공격자가 이미 침투에 성공한 시점에서 시작됩니다. 이 세부 사항이 연구의 핵심 갈등을 만듭니다. AI 에이전트는 경보를 따라갈 수 있지만, 보안 운영 센터에는 아무도 표시하지 않은 위협까지 찾아내는 조사자가 필요합니다.
따라서 SecRespond는 자동화에 대한 일반적인 약속에 도전합니다. 경보를 요약하는 모델은 분석가의 업무 부담을 줄일 수 있지만, 그렇다고 독립적인 사고 대응자가 되는 것은 아닙니다. 벤치마크는 디스크 아티팩트, 지속성 메커니즘, 불완전한 정리 단계, 검증되지 않은 복구 계획에서 그 차이를 확인했습니다.
SecRespond 벤치마크가 실제로 바꾼 것
SecRespond는 평가 대상을 경보 해석에서 이미 침해된 시스템의 조사로 옮깁니다.
많은 사이버보안 테스트는 침해 이전에 시작됩니다. 모델에게 취약점을 식별하거나, CTF 과제를 풀거나, 악성코드를 분류하거나, 선별된 보안 로그를 분석하도록 요구합니다. 이러한 과제는 유용한 능력을 측정하지만, 실제 침해를 규정하는 불확실성은 줄여 버립니다.
SecRespond는 더 늦은 시점에서 시작합니다. 각 에이전트는 침해된 클라우드 호스트의 고정된 포렌식 디스크 스냅샷을 받습니다. 또한 호스트 보호 제품의 경보, 취약점 스캔, 보안 기준선 점검과 유사한 합성 출력도 받습니다.
포렌식 디스크 스냅샷은 특정 시점의 시스템 파일과 아티팩트를 보존한 복사본입니다. 여기에는 수정된 시작 파일, 백도어 계정, 삭제된 로그, 예약 작업, 악성 바이너리처럼 경보에 언급되지 않은 증거가 포함될 수 있습니다.
에이전트는 이 자료를 검사해 무슨 일이 있었는지 재구성해야 합니다. 이후 침입, 취약점, 기준선 위험, 복구를 다루는 보고서를 작성합니다. 과제는 진행 상황 파일도 요구하므로, 매끈한 최종 답변 하나만으로는 충분하지 않고 조사 기록이 남아야 합니다.
벤치마크에는 보안 사고를 재현하도록 구축된 격리 환경인 10개의 사이버 레인지가 포함됩니다. 이 레인지는 네 가지 초기 침입 경로 유형, MITRE ATT&CK 카탈로그의 21개 기법, 다섯 가지 운영 체제를 포괄합니다.
연구진은 이 환경들을 52개의 역량 항목과 280개의 세부 체크포인트로 변환했습니다. 체크포인트는 에이전트가 구체적 증거를 찾았는지, 이를 정확히 귀속했는지, 적절한 조치를 권고했는지, 필요한 검증을 다뤘는지를 묻습니다.
탐지와 복구 계획은 별도로 점수를 매깁니다. 탐지는 해당되는 체크포인트당 최대 3점입니다. 계획은 최대 2점이며, 한 차원에 적용되지 않는 체크포인트는 해당 집계에서 제외됩니다.
이 구분은 악성 파일을 찾는 것만으로는 대응자가 다음에 무엇을 해야 하는지 답할 수 없기 때문에 중요합니다. 안전한 대응에는 호스트 격리, 증거 보존, 프로세스 종료, 지속성 제거, 자격 증명 교체, 인프라 차단, 서비스 복구, 복구 상태 검증이 필요할 수 있습니다.
공개 SecRespond 데이터셋에는 과제 프롬프트, 평가 자료, 체크리스트, 합성 보안 출력, 포렌식 아카이브가 포함됩니다. 이 공개로 원 저자 외의 팀도 핵심 주장을 검증할 수 있게 됩니다.
SecRespond는 AI 사고 대응의 더 엄격한 경계도 정의합니다. 에이전트는 무언가를 확인했을 법하다는 이유만으로 완전한 점수를 받지 않습니다. 보고서에는 발견 사항을 명시하고 관련 체크리스트를 충족하는 증거를 인용해야 합니다.
이 규칙은 모호한 보안 언어를 측정 가능한 성과로 바꿉니다. “의심스러운 활동을 조사하라”는 특정 프로세스, 파일, 계정, 엔드포인트 또는 지속성 경로를 식별하는 것과 같지 않습니다. “서버에 패치를 적용하라”는 완전하고 순차적이며 검증된 복구 계획과 같지 않습니다.
Google News 보도는 23개 모델 전반의 핵심 실패에 초점을 맞췄습니다. 더 깊은 변화는 방법론에 있습니다. SecRespond는 에이전트가 처음부터 제공받지 않은 단서를 추적하고, 그 발견을 방어 가능한 정리 절차와 연결할 수 있는지를 묻습니다.
Google News의 관심이 AI 보안 구매자에게 중요한 이유
이 벤치마크는 공급업체와 보안 리더에게 경보 지원과 자율 사고 대응을 구분하도록 압박합니다.
AI는 이미 보안 운영 센터에서 경보 요약, 지표 보강, 문서 검색, 쿼리 초안 작성, 케이스 노트 준비를 지원합니다. 분석가들이 단편적인 증거와 반복적인 관리 업무에 자주 직면하기 때문에, 이러한 워크플로는 여전히 가치가 있습니다.
그러나 SecRespond는 더 높은 수준의 독립성을 측정합니다. 자율 대응자는 어디를 조사할지 결정하고, 누락된 증거를 인식하며, 경쟁 가설을 검증하고, 가장 명확한 경보가 해결된 뒤에도 조사를 계속해야 합니다.
벤치마크의 핵심 결과는 이 구분이 중요한 이유를 보여 줍니다. 평가된 23개 모델 전체에서, 단 하나의 에이전트도 한 개의 사이버 레인지에서조차 완전한 탐지와 복구를 달성하지 못했습니다.
보고된 실험에서 가장 우수한 종합 모델은 Claude Opus 4.7이었습니다. 이 모델은 탐지에서 레인지 수준 체크포인트 평균 점수 79.0%, 계획에서 65.7%를 기록했습니다.
논문은 선도 모델의 두 차원을 결합한 평균도 72.4%라고 보고합니다. 이 성능은 여전히 악성 아티팩트를 놓치고 복구를 불완전하게 남겼으며, 특히 더 길고 광범위한 공격 체인을 포함한 레인지에서 그 문제가 두드러졌습니다.
그 밖의 주요 결과로는 Claude Opus 4.6의 탐지 78.2%, 계획 58.0%가 있습니다. GLM-5.1은 각각 76.3%와 59.2%를 기록했고, Qwen3.7 Plus는 75.6%와 58.8%를 기록했습니다.
이 수치를 기반 모델의 일반적인 순위로 해석해서는 안 됩니다. 이는 하나의 에이전트 하니스, 하나의 벤치마크 버전, 하나의 과제 설계, 특정 평가 절차를 설명합니다.
대신 결과는 공통된 실패 패턴을 드러냅니다. 모델은 기존 경보와 연결된 증거는 비교적 신뢰성 있게 찾았지만, 디스크를 자발적으로 검색해야 하는 증거는 잘 찾지 못했습니다.
이 패턴은 “AI 분석가”나 “자율 SOC” 같은 광범위한 표현을 사용하는 보안 공급업체에 압박을 가합니다. 구매자는 시스템이 사람의 단서 없이 실제로 수행하는 대응 수명주기의 범위를 물어야 합니다.
제품은 엔드포인트 경보를 정확하게 요약할 수 있지만, 두 번째 지속성 메커니즘은 놓칠 수 있습니다. 악성 바이너리를 삭제하라고 권고하면서도 그 프로세스를 종료하지 않거나, 로더를 제거하지 않거나, 노출된 자격 증명을 교체하지 않거나, 서비스 복구를 검증하지 못할 수 있습니다.
누락된 각 단계는 운영 결과를 바꿉니다. 공격자는 손대지 않은 계정, 예약 작업, 웹셸, 서비스, 레지스트리 항목 또는 셸 훅을 통해 다시 돌아올 수 있습니다. 따라서 기술적으로 올바른 첫 조치도 잘못된 격리 완료감을 만들 수 있습니다.
보안 리더는 조사 품질과 보고서 품질도 구분해야 합니다. 모델은 유창한 설명을 자주 생산하지만, SecRespond는 그 설명에 필요한 증거와 복구 세부 사항이 포함됐는지를 평가합니다.
이는 지식 집약적 업무에서 익숙한 문제입니다. 자신감 있는 서술은 불완전한 검색을 가릴 수 있습니다. 검색 가능한 지식 베이스를 구축하는 팀도 비슷한 요구사항에 직면합니다. 결론은 반드시 원본 자료로 추적 가능해야 합니다.
벤치마크는 사고 대응에서 이러한 추적성을 구체화합니다. 에이전트는 어떤 아티팩트가 각 결론을 뒷받침하는지, 어떤 조치가 식별된 각 상태를 해결하는지를 보여야 합니다.
Google News에서의 가시성은 이 구분을 벤치마크 연구자 밖으로 확산시킬 수 있습니다. 이제 조달 팀, CISO, 관리형 보안 제공업체, 내부 감사 그룹은 “경보를 처리한다”와 “사고를 처리한다”가 동등한 주장이 아닌 이유를 보여 주는 공개 사례를 갖게 됐습니다.
진짜 사각지대는 유도 없는 조사다
사고가 다음 아티팩트를 가리키는 명확한 경보를 남기지 않을 때, 모델의 가장 약한 행동이 드러납니다.
SecRespond는 성과를 다섯 가지 역량 영역으로 나눕니다. 이는 침입 엔터티, 지속성 메커니즘, 기준선 위험, 취약점 위험, 전반적인 조사 및 대응 품질을 포괄합니다.
침입 엔터티는 프로세스, 파일, 네트워크 엔드포인트 또는 변조된 아티팩트 같은 구체적인 악성 객체입니다. 이러한 객체는 눈에 보이는 보안 신호와 자주 일치하기 때문에 모델은 이 범주에서 가장 좋은 성과를 냈습니다.
모델 전체에서 침입 엔터티의 평균 탐지율은 75.4%에 달했습니다. Qwen3.7 Plus의 88.4%, Claude Opus 4.6의 86.0%를 포함해 여러 선도 시스템은 훨씬 높은 성과를 보였습니다.
지속성 메커니즘에서는 다른 결과가 나왔습니다. 지속성은 공격자의 접근이 재부팅이나 초기 정리 이후에도 살아남도록 하는 변경을 말합니다. 예약 작업, 서비스, 셸 시작 훅, 웹셸, 계정 백도어, Windows Management Instrumentation 구독 등이 예입니다.
지속성의 평균 탐지율은 58.8%로 떨어졌습니다. 이 하락은 대응자가 호스트가 깨끗하다고 선언하기 전에 바로 지속성을 찾아야 한다는 점에서 중요합니다.
벤치마크가 모델에 모든 포렌식 추론 능력이 없다고 보여 주는 것은 아닙니다. 모델은 경보를 관련 프로세스나 파일과 연결할 수 있고, 즉각적인 위협을 정확히 설명하는 경우도 많습니다. 실패는 조사가 그 출발점을 넘어 확장되어야 할 때 발생합니다.
침해된 웹 서버를 생각해 보겠습니다. 경보는 악성 프로세스나 외부 연결을 식별할 수 있습니다. 그 신호를 따라가면 하나의 실행 파일을 찾을 수 있지만, 완전한 조사는 공격자가 어떻게 들어왔는지, 어떤 자격 증명이 노출됐는지, 무엇이 종료 이후에도 남는지를 물어야 합니다.
대응자는 시작 스크립트, 서비스 정의, cron 항목, 사용자 계정, 명령 기록, 애플리케이션 디렉터리, 변경된 로그도 검사해야 할 수 있습니다. 단일 경보가 이러한 위치를 모두 식별하는 것은 아닙니다.
이는 경계가 불확실한 검색 문제를 만듭니다. 에이전트는 어떤 가설을 검증할 가치가 있는지, 얼마나 오래 조사를 계속할지 결정해야 합니다. 하나의 아티팩트가 없다고 해서 다른 지속성 경로가 배제되는 것은 아니라는 점도 인식해야 합니다.
현재의 언어 모델 에이전트는 흔히 이미 문맥에 있는 증거를 중심으로 최적화됩니다. 경보는 높은 현저성의 앵커를 만들기 때문에, 에이전트는 언급되지 않은 증거를 찾는 대신 그 앵커를 설명하는 데 예산을 쓸 수 있습니다.
더 긴 공격 체인은 이 약점을 증폭시킵니다. 추가되는 각 기법은 모델이 상호 연관시켜야 하는 또 하나의 분기, 아티팩트 유형, 타임스탬프, 계정 또는 서비스를 도입합니다.
논문은 공격이 더 길고 광범위해질수록 성과가 하락했다고 밝혔습니다. 이 결과는 운영상의 과제와 일치합니다. 사고 대응은 하나의 분류 결정이 아니라, 불완전한 정보 아래에서 이루어지는 연결된 판단의 연속입니다.
별도의 2026년 위협 헌팅 벤치마크도 관련 문제를 보고했습니다. 다섯 개 프런티어 모델이 26개 공격 캠페인의 원시 Windows 이벤트 로그를 검색했으며, 가장 우수한 모델도 악성 이벤트의 일부만 찾아냈습니다.
두 연구는 서로 다른 워크플로를 테스트하므로 점수를 직접 비교할 수는 없습니다. 그러나 두 연구 모두 유도 없는 검색이 사전 선별된 증거를 바탕으로 추론하는 것보다 여전히 어렵다는 점을 시사합니다.
이것이 벤치마크가 보여주는 핵심적인 반전이다. 에이전트는 기존 보안 도구가 이미 불확실성을 낮춘 영역에서 가장 유능해 보인다. 반면 경보가 드러내지 않은 부분을 질문함으로써 인간 조사자가 가장 큰 가치를 더하는 영역에서는 신뢰성이 떨어진다.
보안팀은 이 경계 안에서 여전히 AI를 생산적으로 활용할 수 있다. 모델은 증거를 요약하고, 가설을 제안하며, 쿼리를 초안하고, 아티팩트를 비교하고, 조사 타임라인을 유지할 수 있다.
위험한 도약은 이러한 기능을 모델이 사고 전체를 조사했다는 증거로 취급하는 것이다. SecRespond는 유창한 답변이 발견되지 않은 지속성 및 불완전한 공격자 활동 설명과 공존할 수 있음을 보여준다.
탐지 점수는 더 큰 완화 격차를 가린다
더 많은 증거를 찾아내는 능력이 그에 상응해 완전한 정리 계획으로 이어지지는 않았으며, 이로 인해 완화는 벤치마크의 두 번째 주요 실패 지점이 됐다.
평가된 모든 모델은 계획 수립보다 탐지에서 더 높은 점수를 기록했다. GPT-5.5의 경우 보고된 격차는 34.7%포인트에 달했다.
연구진은 에이전트가 명백한 첫 번째 조치를 적용한 뒤 남은 조치를 누락하는 데서 이러한 패턴이 비롯된다고 분석한다. 이는 체크리스트 절단과 유사한 행동이다. 핵심 악성 객체에 대응이 이뤄지면 모델은 사고가 해결된 것처럼 행동한다.
실제 완화는 삭제 한 번이나 구성 변경 한 번으로 끝나는 경우가 드물다. 대응자는 종속성, 증거 보존, 비즈니스 영향, 서비스 연속성, 자격 증명 노출, 공격자의 대체 접근 경로를 고려해야 한다.
SecRespond의 계획 점수는 조치가 올바르고 완전한지를 평가한다. 또한 관련 체크포인트가 요구할 경우 검증과 부작용도 살핀다.
검증은 형식적인 절차가 아니다. 예약 작업을 제거하는 계획은 해당 작업이 더 이상 존재하지 않으며 그 페이로드가 다른 메커니즘을 통해 실행될 수 없음을 확인해야 한다.
공격자의 주소를 차단하는 계획은 적절한 경우 인바운드와 아웃바운드 트래픽을 모두 다뤄야 한다. 또한 주소 차단이 호스트에 이미 존재하는 악성코드, 탈취된 자격 증명 또는 지속성을 제거한다는 인상을 주어서는 안 된다.
표준화된 구성 문제는 더 쉬운 것으로 나타났다. Claude Opus 4.7은 기준선 위험에 대한 계획 수립에서 74.8%, 취약점 위험에서 72.6%에 도달했다.
이러한 작업은 대개 구성 강화나 영향을 받는 소프트웨어 업데이트처럼 익숙한 조치에 대응한다. 에이전트는 인식 가능한 완화 패턴을 검색해 발견 사항에 적용할 수 있다.
조사와 대응 품질은 여전히 훨씬 약했다. 해당 범주의 평균 계획 수립 성능은 31.8%에 그쳤다.
이 범주는 알려진 단일 해결책이 아니라 종합적 판단에 의존하는 작업을 다룬다. 공격 체인 재구성, 증거 품질, 불확실성에 대한 정직성, 완전성, 검증, 운영 영향 인식이 포함된다.
이 범주에서 가장 강력한 탐지 결과는 75.5%에 달했다. 논문에 따르면 계획 수립에서는 거의 모든 모델이 50% 아래에 머물렀다.
이 결과는 단순한 규모 확장 전략을 약화시킨다. 모델에 더 많은 경보를 제공한다고 해서 완전한 대응 계획이 자동으로 만들어지는 것은 아니다. 더 많은 가시적 발견 사항은 오히려 더 많은 단절된 권고를 낳을 수 있다.
신뢰할 수 있는 계획에는 순서가 필요하다. 팀은 변경에 앞서 장비를 격리하고, 프로세스 종료 전에 휘발성 증거를 보존하며, 노출 범위를 파악한 뒤 자격 증명을 교체할 수 있다.
롤백과 서비스 영향도 고려해야 한다. 종속성을 이해하지 못한 채 침해된 구성 요소를 제거하면 운영이 중단되거나 귀속 분석에 필요한 증거가 파괴될 수 있다.
SecRespond는 운영 시스템에서의 실제 완화가 아니라 서면 계획을 평가한다. 이는 벤치마크가 입증할 수 있는 범위를 제한하지만, 동시에 안전성 문제를 계속 가시화한다.
통제된 환경에서 모델이 완전하고 검증된 완화를 일관되게 설명하지 못한다면, 조직이 실제 호스트에서 제한 없는 권한을 부여할 근거는 거의 없다.
따라서 이 벤치마크는 더 제한적인 운영 모델을 뒷받침한다. AI는 조치를 제안하고, 증거를 정리하며, 누락된 필드를 강조할 수 있지만, 격리와 복구 단계의 승인은 인간 대응자가 유지한다.
이러한 배치는 SOC 자동화를 거부하는 것이 아니다. 데이터에 나타난 특정 비대칭성에 대한 대응이다. 시스템은 알려진 객체를 식별하는 데는 더 뛰어났지만, 모든 결과가 안전하게 처리되도록 보장하는 데는 그렇지 못했다.
보안팀은 이러한 비대칭성을 접근 제어에 반영해야 한다. 읽기 전용 포렌식 접근은 프로세스 종료, 파일 삭제, 계정 비활성화, 네트워크 정책 변경 권한과는 다른 위험을 수반한다.
숨겨진 아티팩트를 놓치는 에이전트는 불완전한 보고서를 만든다. 그 불완전한 보고서에 따라 행동하는 에이전트는 공격자의 대체 경로를 그대로 둔 채 복구를 방해할 수 있다.
수치가 입증하지 못하는 것
SecRespond는 공통된 한계에 대한 강력한 증거이지만, 모든 모델이나 운영 환경의 SOC 구성에 대한 최종 판결은 아니다.
이 논문은 완료된 동료 심사 결과가 아닌 arXiv 사전 공개본이다. 저자에는 Tongyi Lab과 Alibaba Cloud 연구진이 포함돼 있으며, 벤치마크는 하나의 대표적 하네스를 통해 모델을 평가한다.
OpenCode를 선택한 것은 시스템 간 도구 사용을 표준화하는 데 도움이 된다. 동시에 결과가 프롬프팅, 도구, 컨텍스트 관리, 실행 정책과 분리된 추상적 모델 능력이 아니라 모델과 하네스의 조합을 측정한다는 뜻이기도 하다.
서로 다른 스캐폴딩은 성능을 바꿀 수 있다. 사고 대응 에이전트는 필수 조사 체크리스트, 특화된 포렌식 유틸리티, 내부 절차에 대한 검색, 협업하는 여러 에이전트 또는 결정론적 검증 스크립트를 사용할 수 있다.
SecRespond는 이러한 개선 사항을 같은 범위에서 시험할 수 있기 때문에 여전히 유용하다. 그러나 공개된 수치를 각 모델 계열의 영구적인 한계로 간주해서는 안 된다.
평가는 또한 LLM-as-a-judge 프로세스를 사용한다. 즉, 언어 모델이 상세한 체크리스트를 기준으로 생성된 보고서를 채점한다. 하나의 채점기에 대한 의존도를 낮추기 위해 세 개의 독점 모델 채점기가 독립적으로 사용됐다.
이 채점기들은 Claude Opus 4.7, Gemini 3.1 Pro, GPT-5.4 Pro였다. 여러 채점기는 개별 편향을 줄이지만, 모든 보정 문제를 제거하지는 못한다.
채점기는 불완전한 표현을 인간 포렌식 전문가와 다르게 해석할 수 있다. 또한 기본 조사 과정이 건전했는지를 완전히 해결하지 못한 채 명시적인 보고서 문구에 점수를 줄 수도 있다.
채점 지침은 이러한 위험을 통제하려 한다. 채점기는 증거를 인용해야 하며, 보고서에 명시적으로 존재하는 내용에만 점수를 부여해야 한다.
벤치마크의 280개 체크포인트는 추가적인 구조를 제공한다. 그러나 모든 체크리스트에는 어떤 아티팩트, 대응 단계, 품질에 가중치를 둘 것인지에 대한 선택이 담겨 있다.
10개 범위는 반복되는 행동을 드러낼 만큼 다양하다. 하지만 모든 운영 체제, 클라우드 아키텍처, 아이덴티티 플랫폼, 엔드포인트 제품 또는 공격자 기법을 포괄하지는 않는다.
환경도 통제돼 있다. 연구진은 벤치마크용 호스트를 프로비저닝하고 침해한 뒤 자격 증명과 개인 데이터를 정리했다.
이 설계는 재현성을 가능하게 하고 운영 정보 노출을 방지한다. 그러나 실제 엔터프라이즈 사고에서 나타나는 노이즈, 불완전한 텔레메트리, 조직적 제약, 비즈니스 종속성을 완전히 재현할 수는 없다.
한 결과는 안전 행동이 벤치마크 범위에 어떤 영향을 미칠 수 있는지도 보여준다. Claude Opus 4.7은 npm-worm 작업을 거부했으며, 이에 따라 논문은 해당 모델을 그 범위의 상세 체크포인트 표에서 제외했다.
정당한 방어 조사 중 거부는 운영상 유용성을 낮출 수 있다. 동시에 이중 용도 지원이 유해한 지침으로 흘러가는 것을 막으려는 제공업체의 노력을 반영할 수도 있다.
SecRespond는 이러한 정책적 상충 관계를 해결하지 않는다. 안전한 배포에는 승인된 포렌식 작업과 공격적 지침을 구분하는 작업 정의가 필요하다는 점을 보여준다.
벤치마크 저자들은 공개된 증거가 격리된 환경에서 나온 것이며 실행 가능한 익스플로잇 체인을 포함하지 않는다고 밝힌다. 공개 자료는 방어 연구를 목적으로 한다.
이 제한은 “실제 환경” 대응에 관한 주장을 해석할 때 중요하다. 범위는 실제 네트워크 프로토콜을 통한 엔드투엔드 침해를 재현하지만, 공개 패키지에는 활성 공격 도구가 아니라 정제된 포렌식 증거가 포함돼 있다.
또한 SecRespond 점수가 분석가 시간 절감, 사고 심각도 감소 또는 격리 속도 향상으로 어떻게 이어지는지를 보여주는 독립적인 현장 연구도 없다. 이러한 결과는 운영팀 내부에서의 평가가 필요하다.
따라서 구매자가 취해야 할 해석은 신중해야 한다. 이 벤치마크는 자율 사고 대응에 대한 근거 없는 주장을 강하게 반박한다. 그러나 인간 주도 SOC 내에서 AI 지원이 가치가 없다는 것을 보여주지는 않는다.
또한 특정 명명된 모델이 향후 버전에서도 계속 앞설 것이라는 점을 입증하지도 않는다. 보고된 Claude 시리즈는 출시 버전별로 개선됐지만, 다른 계열 전반의 진전이 보편적이었던 것은 아니다.
의미 있는 평가 단위는 배포된 시스템이다. 여기에는 모델, 도구, 프롬프트, 권한, 검색 소스, 검토 게이트, 로깅, 복구 절차가 포함된다.
SecRespond Google News 주기 이후 주목할 세 가지 신호
다음 시험대는 공급업체가 비유도형 발견, 완화 검증, 재현 가능한 운영 환경 평가를 개선하는지 여부다.
첫 번째 신호는 독립적인 재현이다. 연구자와 보안 공급업체는 다른 하네스, 프롬프트, 도구, 모델 버전으로 공개 benchmark repository를 실행할 수 있다.
재현은 스캐폴딩 변경 후에도 은밀한 침해 격차가 유지되는지를 보여줄 것이다. 특화된 포렌식 에이전트가 여전히 경보가 없는 지속성을 놓친다면, 논문의 핵심 판단은 더 강해진다.
결정론적 검색 절차가 큰 개선을 낸다면 교훈은 다소 달라진다. 병목은 모델 지식보다 조사 설계, 도구 라우팅, 강제된 범위 보장에 더 크게 위치하게 된다.
그렇더라도 범용 자율 에이전트에 대한 주장은 약화된다. 동시에 더 안전한 시스템을 위한 더 명확한 엔지니어링 경로를 제공할 것이다.
두 번째 신호는 공급업체가 탐지와 완화 결과를 분리해 공개하는지 여부다. 단일 “사고 대응 정확도” 수치는 SecRespond가 드러낸 계획 수립 격차를 감출 수 있다.
유용한 평가는 시스템이 무엇을 발견했고 무엇을 놓쳤는지, 어떤 조치를 제안했는지, 완료를 어떻게 검증했는지를 명시해야 한다. 또한 거부, 도구 실패, 인간 개입이 필요한 사례도 보고해야 한다.
특히 지속성 메커니즘에 대한 테스트를 주시해야 한다. 경보와 연결된 악성코드에서의 개선은 중요하지만, 벤치마크의 핵심 사각지대를 해소하지는 못한다.
계획이 정리 범위를 다루는지도 살펴봐야 한다. 더 강력한 에이전트는 해당되는 경우 프로세스, 파일, 계정, 예약 실행, 네트워크 제어, 자격 증명 교체, 서비스 복구, 완화 후 검증을 처리해야 한다.
세 번째 신호는 감독된 SOC 배포에서 나온 증거다. 공급업체는 실제 텔레메트리, 내부 절차, 접근 제어, 분석가 승인 게이트 환경에서 에이전트가 어떻게 작동하는지를 보여줘야 한다.
가장 강력한 운영 증거는 다듬어진 사례 연구 하나만이 아닐 것이다. 누락률, 에스컬레이션율, 근거 없는 주장, 수정 빈도, 분석가가 변경 없이 승인한 권고 비율을 포함해야 한다.
신뢰할 수 있는 배포는 감사 추적을 보존해야 한다. 검토자는 결론을 아티팩트까지 추적하고, 에이전트가 중단하기 전에 어떤 검색을 완료했는지 판단할 수 있어야 한다.
조직은 권한 경계도 테스트해야 한다. 읽기 전용 조사, 권고 조치, 자율 실행은 서로 다른 세 가지 위험 수준을 나타낸다.
SecRespond는 처음 두 수준에서의 도입을 뒷받침하는 한편, 세 번째 수준에는 무거운 입증 책임을 부과한다. 그 결과는 포괄적인 발견 능력을 입증하지 못한 모델에 광범위한 격리 권한을 맡기는 일을 정당화하지 않는다.
Google News 헤드라인은 사라지겠지만, 이 벤치마크는 보안팀에 오래 남을 조달 관련 질문을 남긴다. 경보가 어디를 살펴봐야 하는지 알려주지 않을 때, 에이전트는 무엇을 찾아내는가?
벤더에게 재현 가능한 근거로 이 질문에 답하도록 요구하라. 이어서 시스템이 각 정리 단계를 어떻게 검증하고, 불확실성을 어떻게 인간 대응자에게 알리는지도 물어야 한다.
이 답변들은 AI SOC 제품이 조사관으로 발전하고 있는지, 아니면 기존 탐지를 중심으로 한 빠른 보조 도구에 머물고 있는지를 드러낼 것이다. 현재로서는 SecRespond가 테스트한 23개 모델 모두를 그 경계선의 보조 도구 쪽에 위치시킨다.



