top of page

Cisco의 소형 AI 모델이 더 큰 보안 트레이드오프를 드러내다

Cisco Foundation AI는 선도 시스템조차 취약한 코드 위치 대부분을 놓친다는 증거가 있는 상황에서 7월에 두 개의 오픈 웨이트 보안 모델을 공개했다. 이 발표는 Google News에서 또 하나의 월간 모델·벤치마크·보안 연구 모음으로 다뤄졌다. 그러나 중요한 이야기는 Cisco의 공개 주기가 아니다.

Cisco는 소형 특화 모델이 범용 프런티어 시스템보다 반복적인 보안 업무를 더 경제적으로 처리할 수 있는지 시험하고 있다. Antares-350M과 Antares-1B는 알려진 취약점 범주와 연관된 파일을 찾기 위해 소프트웨어 리포지터리를 탐색한다. 이 모델들은 로컬에서 실행할 수 있어 민감한 소스 코드를 조직의 환경 안에 유지할 수 있다.

이 설계는 어려운 AI 작업마다 이용 가능한 가장 큰 모델이 필요하다는 가정에 도전한다. Microsoft와 Google도 같은 기간 자체 특화 사이버보안 시스템을 선보였다. 이제 형성되는 경쟁은 집중형 로컬 배포 모델과 더 광범위한 추론 능력을 갖춘 대형 서비스의 대결 구도다.

Cisco의 벤치마크 결과는 특화 접근법을 뒷받침하지만, 그 한계도 드러낸다. Cisco의 주력 벤치마크에서 최고 시스템은 0.23 미만의 File F1 점수를 기록했다. 벤치마크 작업의 거의 5건 중 2건은 평가된 모든 모델이 해결하지 못했다.

따라서 이는 승전 선언이 아니라 트레이드오프다. 소형 모델은 낮은 운영 부담, 더 강한 데이터 통제, 반복 가능한 리포지터리 분석을 제공한다. 하지만 불완전한 결과는 여전히 숙련된 분석가, 기존 보안 도구, 신중한 검증을 필요로 한다.

Cisco가 7월에 실제로 공개한 것

Cisco는 자율 취약점 탐지기가 아니라 집중형 코드 검색 시스템을 공개했다.

2026년 7월 21일, Cisco는 Antares-350M과 Antares-1B를 오픈 웨이트 소형 언어 모델로 소개했다. 이들의 목적은 취약점 위치 파악으로, 설명된 약점을 포함할 수 있는 파일을 찾는 작업이다.

이 구분은 중요하다. 위치 파악은 취약점 관리의 한 단계일 뿐이기 때문이다. Antares는 익스플로잇 가능성을 독립적으로 확인하거나, 심각도를 판단하거나, 완전한 패치를 만들거나, 프로덕션 배포용 코드를 승인하지 않는다.

대신 각 모델은 리포지터리와 Common Weakness Enumeration 설명을 받는다. CWE는 부적절한 입력 검증과 같이 반복적으로 나타나는 소프트웨어 약점을 설명하는 표준화된 범주다.

모델은 터미널 명령어를 사용해 읽기 전용 리포지터리를 탐색한다. 관련 패턴을 검색하고, 후보 파일을 읽고, 증거를 평가하며, 검색 경로가 비생산적으로 보이면 방향을 바꾼다.

Cisco는 Antares release에서 이러한 동작을 설명한다. 시스템은 가능성이 높은 파일의 순위 목록과 탐색 과정에서 사용한 명령어 기록을 반환한다.

이 기록은 보안 운영에 중요하다. 분석가는 근거 없는 취약점 판정을 받는 대신 모델이 어떻게 답에 도달했는지 확인할 수 있다.

Antares-350M은 제약된 컴퓨팅 환경을 겨냥하며 32,000토큰 컨텍스트 윈도우를 지원한다. Antares-1B는 128,000토큰을 지원하며 단일 그래픽 프로세서에서 작동하도록 설계됐다.

로컬 실행도 또 하나의 핵심 기능이다. 기업은 리포지터리를 호스팅 모델 제공업체로 전송하지 않고도 독점 코드를 검사할 수 있다. 이 선택지는 클라우드 기반 보안 분석을 가로막는 경우가 많은 프라이버시, 데이터 레지던시, 계약상 우려를 해소한다.

Cisco는 모델 측정을 위해 VLoc Bench도 도입했다. 이 벤치마크는 290개 리포지터리, 6개 패키지 생태계, 147개 고유 CWE 범주에서 추출한 500개 작업을 포함한다.

각 작업에는 알려진 취약점이 있는 리포지터리 스냅샷이 포함된다. 정답 레이블은 해당 보안 패치에서 변경된 파일로부터 가져온다.

이 벤치마크는 위치 파악과 검증을 분리한다. 위치 파악 단계에서 모델은 약점과 연관된 파일을 찾아야 한다. 검증 단계에서는 패치된 리포지터리를 조사하고, 이미 수정된 문제를 잘못 보고하지 않아야 한다.

이 구조는 완전한 침투 테스트보다 범위가 좁다. 동시에 준비된 프롬프트에서 코드 스니펫을 검색하는 일보다 더 까다롭다.

모델은 제한된 정보 아래 낯선 리포지터리를 탐색해야 한다. 따라서 이 벤치마크는 방어자가 구현 위치를 찾기 전에 약점 범주를 아는 경우가 많은 보안 권고문 분류에 적합하다.

Cisco는 Antares를 정적 분석, 소프트웨어 구성 분석, 시크릿 스캐닝, 동적 테스트, 사람의 검토와 함께 배치한다. 이 모델들을 그러한 통제 수단의 대체재로 제시하지는 않는다.

따라서 즉각적인 변화는 실용적이지만 제한적이다. 보안팀은 대규모 리포지터리를 더 작은 후보 파일 집합으로 줄일 수 있는 두 개의 다운로드 가능 모델을 얻었다.

이 첫 번째 축소 단계는 반복적 조사에서 필요한 주의력을 아낄 수 있다. 그러나 선택된 파일이 취약하다는 사실을 확정하거나, 누락된 파일이 안전하다는 점을 증명할 수는 없다.

Google News가 진짜 쟁점을 놓친 이유

Google News의 헤드라인은 7월을 출시의 흐름으로 규정했지만, 실제 변화는 누가 지속적인 코드 검토를 감당할 수 있는지에 관한 것이다.

애플리케이션 보안팀은 리포지터리를 한 번만 검사하지 않는다. 코드는 바뀌고, 의존성은 이동하며, 권고문은 도착하고, 이전에는 허용됐던 동작도 새로운 공격 기법 아래에서는 위험해진다.

호스팅된 프런티어 모델은 이러한 검토를 지원할 수 있다. 하지만 리포지터리 규모의 반복 분석은 상당한 추론 자원을 소모하고, 민감한 코드를 기업 인프라 밖으로 전송해야 할 수도 있다.

소형 로컬 모델은 이 운영 방정식을 바꾼다. 모든 스캔을 고가의 외부 서비스에 의존시키지 않고도 좁은 작업을 반복 수행할 수 있다.

이 트레이드오프는 여러 집단에 동시에 압력을 가한다. 프런티어 모델 제공업체는 더 폭넓은 추론이 더 높은 운영 부담을 정당화할 만큼 충분한 추가 가치를 만든다는 점을 보여야 한다.

보안 공급업체는 특화 모델을 기존 스캐너, 분류 콘솔, 지속적 통합 파이프라인에 넣을지 결정해야 한다. 내부 보안팀은 모델이 생성한 파일 순위가 실제로 분석가의 업무량을 줄이는지 판단해야 한다.

Cisco의 접근법은 AI 보안을 챗봇 도입 결정으로 다뤄온 조직에도 압력을 가한다. 취약점 위치 파악은 리포지터리 접근, 증거 수집, 권한, 사람의 에스컬레이션이 얽힌 워크플로 문제다.

유용한 배포 방식은 Antares를 통제된 리포지터리 스냅샷에 연결하는 것이다. 검색 기록을 보존하고, 후보 파일을 반환하며, 이 후보들을 분석가에게 전달해야 한다.

분석가는 결과를 의존성 데이터, 정적 분석 결과, 테스트, 원래의 권고문과 비교해야 한다. 그 뒤에야 조직은 수정 조치가 필요한지 결정할 수 있다.

이 업무 분담은 취약점 작업이 비대칭적 결과를 낳기 때문에 중요하다. 거짓 양성은 분석가의 시간을 소모하지만, 거짓 음성은 위험한 코드를 발견되지 않은 채 남긴다.

7월 출시작은 어느 한 모델이 전체 프로세스를 맡을 필요가 없음을 시사한다. 한 모델은 의심스러운 코드를 위치 파악하고, 다른 모델은 익스플로잇 가능성을 평가하거나 수정안을 작성할 수 있다.

Google DeepMind도 CodeMender 프로그램을 통해 특화 사이버 모델을 도입하며 비슷한 관점을 밝혔다. Microsoft 역시 내부 훈련한 사이버보안 모델과 관련 보안 에이전트를 발표했다.

industry comparison은 세 기업 모두 작업 특화 시스템을 추구한다고 설명했다. 이들이 공유하는 동기에는 접근 제약과 프런티어 모델을 대규모로 운영하는 비용이 포함된다.

이러한 수렴은 Cisco의 작업에 단일 제품 출시 이상의 의미를 부여한다. 특화 보안 모델은 결정론적 스캐너와 범용 AI 어시스턴트 사이의 독자적인 계층으로 자리 잡고 있다.

정적 도구는 유지관리자가 신뢰할 수 있는 규칙을 정의할 수 있을 때 여전히 효과적이다. 프런티어 모델은 작업에 폭넓은 추론, 수정 코드 생성, 다수 시스템에 걸친 상호작용이 필요할 때 여전히 유용하다.

소형 보안 모델은 그 사이에 들어맞는다. 조사형 검색 패턴을 학습하면서도 통제된 빈번한 배포가 가능할 만큼 작게 유지될 수 있다.

경쟁의 핵심 질문은 Antares가 더 큰 모든 모델을 능가할 수 있는지가 아니다. 특화 시스템 포트폴리오가 일상적인 방어 워크플로 전반에서 충분한 정확도를 제공할 수 있는지다.

이 모델이 작동한다면 구매자는 작업 경제성과 운영 적합성을 통해 AI를 평가하게 될 것이다. 일반 벤치마크의 명성은 분류 시간의 측정 가능한 감소보다 비중이 낮아질 것이다.

소형 보안 모델이 프런티어 경제성에 도전하다

Antares는 엄격히 정의된 보안 작업에서는 파라미터 수보다 훈련된 검색 행동이 더 중요할 수 있다고 주장한다.

범용 코딩 모델은 많은 무관한 능력과 함께 취약점 작업을 학습한다. 이들은 작성, 설명, 계획, 코드 생성, 폭넓은 소프트웨어 추론을 지원해야 한다.

Antares는 목표를 좁힌다. 검색하고, 증거를 조사하고, 경로를 수정하며, 주어진 약점 설명과 연관된 파일을 식별하도록 학습한다.

이처럼 좁은 훈련 목표는 Cisco가 모델 용량을 리포지터리 탐색에 집중하게 해 준다. 이 접근법은 보안 용어를 기억하는 챗봇보다 도구를 통해 작업하는 훈련된 조사관에 가깝다.

모델은 제한된 증거로 시작한다. 파일명과 코드 패턴을 검색하고, 관련 파일을 검사하며, 새로운 단서를 활용해 이후 명령을 이끌 수 있다.

유용한 에이전트는 약한 가설도 버릴 수 있어야 한다. 이런 행동이 없다면 리포지터리 탐색은 중복 검색으로 이루어진 비용 큰 연속 과정이 될 수 있다.

Cisco의 벤치마크는 명령어 제한 아래에서 이 과정을 시험한다. 따라서 리포지터리 구조는 프롬프트 안에 숨겨진 배경 정보가 아니라 작업의 일부가 된다.

결과는 Cisco의 특화 논지를 뒷받침한다. 공개된 벤치마크 데이터에 따르면 Antares-1B는 VLoc Bench에서 0.209의 File F1 점수를 기록했다.

미출시 Antares-3B는 0.223에 도달했다. 선두 GPT-5.5 구성은 0.229를 기록해 Cisco의 평가에서 수치상 격차는 작았다.

파라미터 수만으로 순위가 결정되지는 않았다. Cisco는 목적 훈련한 3B 모델이 1,000억 개가 넘는 파라미터를 가진 범용 시스템과 동등하거나 더 나은 성능을 보였다고 보고한다.

더 큰 요점은 3B 모델이 프런티어 시스템과 전반적으로 동등해졌다는 것이 아니다. 그렇지 않다. 이 비교는 하나의 제한된 작업, 하나의 하니스, 하나의 채점 방식만을 다룬다.

Cisco는 이후 같은 웨이트를 CyberGym localization과 Cognition 보안 평가의 공개 재구성본에서 시험했다. 모델은 개발자가 만든 벤치마크에서 가장 강해 보이는 경우가 많기 때문에 이 단계는 중요하다.

CyberGym은 188개 오픈소스 프로젝트의 약 1,500개 취약점을 포함한다. 전체 벤치마크는 익스플로잇 생성을 평가하지만, Cisco는 그보다 앞선 위치 파악 단계를 분리했다.

Antares-1B는 이 위치 파악 테스트에서 67.2% 재현율을 달성했다. 미출시 3B 모델은 73.7%에 도달했고, 선두 프런티어 모델은 89.1%를 기록했다.

이 수치는 전이 가능성과 지속되는 역량 격차를 모두 보여준다. 소형 모델들은 외부 작업에서도 유용한 행동을 유지했지만, 최고 프런티어 결과에는 도달하지 못했다.

Cisco의 external benchmark tests에는 Cognition 보안 평가의 커뮤니티 재구성본도 포함됐다. 원래 50개 픽스처 중 공개적으로 이용 가능한 것은 34개뿐이었다.

Cisco는 공개된 부분집합을 바탕으로 외삽해 해당 비교의 결과를 추정했다. 또한 이 수치가 진정한 정면 비교가 아니라 방향성을 보여주는 지표라고 명시했다.

이 단서는 매우 중요하다. 에이전트마다 프롬프트, 명령 제한, 인프라, 컨텍스트 관리, 종료 규칙이 다를 수 있다.

두 시스템이 동일한 리포지터리를 받더라도, 이를 둘러싼 하니스가 결과에 상당한 영향을 줄 수 있다. 에이전트 벤치마크는 고립된 지능이 아니라 모델과 시스템의 결합을 측정한다.

그럼에도 경제적 논거는 여전히 설득력이 있다. 로컬 모델은 사용량 기반 토큰 소비를 피할 수 있고, 소스 코드를 외부로 반출하지 않은 채 반복 분석을 가능하게 한다.

이 때문에 대량 스크리닝에서는 전문화가 매력적이다. 더 큰 모델은 이후 심층 조사가 필요한 소수의 리포지터리나 파일을 다룰 수 있다.

따라서 예상되는 아키텍처는 계층형이다. 저렴한 특화 모델이 폭넓은 위치 식별을 처리하고, 고가의 시스템과 인간 전문가가 모호한 사례를 검토한다.

이 접근법은 기존 보안 운영 방식을 닮았다. 조직들은 이미 저비용 자동화 제어를 사용해 활동을 필터링한 뒤, 불확실한 발견 사항을 상위 단계로 이관한다.

Antares는 프로세스에서 프런티어 모델을 제거하지 않는다. 팀이 이를 어디에 우선 배정할지를 바꾼다.

벤치마크 승리에는 경고가 따른다

Cisco의 가장 강력한 근거는 Antares가 상당한 현지 검증 없이는 보안 게이트가 될 수 없는 이유도 보여준다.

Antares-3B와 GPT-5.5의 헤드라인 비교는 인상적으로 들린다. 그러나 절대 점수는 그리 편안한 이야기를 들려주지 않는다.

VLoc Bench에서 가장 높은 성능을 보인 시스템도 File F1 0.229에 그쳤다. File F1은 예측된 파일과 알려진 패치로 변경된 파일을 비교할 때 정밀도와 재현율을 결합한 지표다.

낮은 점수는 관련 파일을 놓쳤거나, 무관한 제안을 했거나, 둘 다였음을 의미할 수 있다. 어느 경우든 결과를 받는 보안팀에 업무나 위험을 초래한다.

벤치마크의 공개된 결과에 따르면, 500개 과제 중 190개는 평가된 모든 모델이 해결하지 못했다. 전체의 38%에 해당한다.

성능은 가장 작은 리포지터리에서 가장 큰 리포지터리로 갈수록 13배 하락했다. Cisco는 취약점 범주보다 구조적 복잡성이 난이도를 더 강하게 예측한다고 결론지었다.

이 발견은 이야기의 핵심적인 반전을 만든다. 전문화는 소형 모델이 훨씬 큰 모델과 경쟁하도록 돕지만, 리포지터리 규모의 취약점 탐지를 신뢰할 수 있게 만들지는 않는다.

같은 한계는 제품의 경계에서도 나타난다. Antares는 후보 파일을 식별하지만, 해당 약점이 실제로 존재하는지와 악용 가능한지는 여전히 분석가가 판단해야 한다.

리포지터리에는 하나의 패턴에 대한 여러 구현이 존재할 수 있다. 생성 코드, 래퍼, 테스트, 벤더 종속성, 호환성 계층은 검색을 혼란스럽게 만들 수 있다.

보안 패치 역시 불완전한 형태의 정답 데이터다. 유지관리자는 직접 취약하지 않은 보조 파일을 변경하기도 하고, 초기 수정에서 관련 위치를 누락하기도 한다.

따라서 벤치마크는 보안 이해도를 완전히 측정하지 못한 채 과거 패치와의 일치를 보상할 수 있다. 여전히 유용하지만, 점수를 보편적인 탐지율로 받아들여서는 안 된다.

Cisco의 외부 테스트는 완전한 벤치마크 과적합에 대한 우려를 줄인다. 하지만 엔터프라이즈 리포지터리 전반에서 독립적으로 재현할 필요성을 없애지는 않는다.

Antares를 도입하는 조직은 과거 사례부터 시작해야 한다. 팀은 이전에 수정된 취약점을 제공하고 모델이 알려진 파일을 식별하는지 측정할 수 있다.

또한 무관한 제안, 누락된 파일, 명령 사용량, 실행 시간, 분석가 검토 시간을 기록해야 한다. 코드베이스마다 서로 다른 오류 패턴이 나타날 것이다.

모델의 컨텍스트 윈도우가 전체 리포지터리 이해를 보장하지는 않는다. Antares는 터미널 명령으로 탐색하므로, 성공 여부는 올바른 검색과 증거를 선택하는 데 달려 있다.

대규모 모노리포지터리는 특히 어려움을 만든다. 하나의 약점 설명이 서비스, 생성된 클라이언트, 공유 라이브러리, 여러 구현 언어에 걸쳐 적용될 수 있다.

벤치마크는 이 리포지터리 규모 문제를 확인한다. 또한 단순히 파라미터 수를 늘리는 것만으로 모든 구조적 장애물을 제거할 수는 없음을 시사한다.

보안 책임자는 모델의 확신을 정책 권한으로 전환하려는 유혹을 경계해야 한다. Antares가 독자적으로 릴리스를 차단하거나, 취약점 티켓을 종료하거나, 패치를 인증해서는 안 된다.

신중한 구현에서는 그 출력을 자문용으로 다룰 것이다. 상위에 랭크된 파일은 더 이른 인간의 주의를 받고, 기존 제어는 더 넓은 코드베이스를 계속 검사한다.

독립 보도도 비슷한 결론에 도달했다. 한 배포 평가는 이 모델들이 취약점을 확인하거나 심각도를 지정하거나 수정책을 생성하지 않는다고 지적했다.

해당 보고서는 분석 환경을 격리해야 할 필요성도 강조했다. 로컬 실행은 코드를 현장에 유지하지만, 주변 시스템을 자동으로 보호하지는 않는다.

터미널 접근 권한이 있는 모델은 여전히 민감한 리포지터리와 추론 종속성에 상호작용한다. 관리자는 최소 권한 접근, 네트워크 제한, 로그, 검증된 모델 아티팩트가 필요하다.

오픈 웨이트는 검사와 배포 선택지를 제공한다. 그러나 변조, 안전하지 않은 통합, 부적절한 권한에 대한 보장을 제공하지는 않는다.

오픈 웨이트가 무제한 신뢰를 의미하지는 않는다

Cisco는 더 폭넓은 방어적 접근과 보안 모델이 공격자를 도울 수 있다는 가능성 사이에서 균형을 잡고 있다.

회사는 적격 사용자가 학습된 파라미터를 얻을 수 있기 때문에 Antares를 오픈 웨이트라고 부른다. 그러면 모델의 동작은 Cisco의 호스팅 서비스 외부 인프라에서 실행될 수 있다.

하지만 공개된 모델을 내려받으려면 연락처 정보와 승인이 필요하다. Cisco는 범죄자가 도구를 확보할 가능성을 줄이기 위해 접근을 심사한다고 밝혔다.

이 통제된 배포는 통상적인 오픈 대 클로즈드 논쟁을 복잡하게 만든다. Antares는 익명적이고 즉각적인 접근을 허용하지 않으면서도 로컬 배포와 검사 가능한 웨이트를 제공한다.

Cisco는 모델 안전성과 공개 결정에 관해 미국 정부 기관들과 협의한 것으로 전해진다. 이는 취약점 연구의 이중 용도 특성을 반영한다.

위치 식별 모델은 방어자가 노출된 코드를 찾도록 도울 수 있다. 같은 역량은 공격자가 접근 가능한 리포지터리에서 알려진 약점을 찾는 범위를 좁히는 데 도움을 줄 수 있다.

Cisco의 모델은 익스플로잇 생성 이전에 멈추지만, 그 경계가 오용을 없애지는 않는다. 관련 파일을 찾는 일은 익스플로잇 개발의 중요한 첫 단계인 경우가 많다.

공개 관련 보도는 Antares를 오픈 보안 도구를 향한 더 큰 움직임의 일부로 설명한다. Capital One은 같은 기간 별도의 취약점 특화 에이전트를 공개했다.

오픈 보안 연구에는 오랜 장점이 있다. 공유된 규칙, 벤치마크, 테스트 사례는 방어자가 결과를 재현하고 시스템을 비교할 수 있게 한다.

이는 감시도 강화한다. 연구자는 폐쇄형 서비스가 감출 수 있는 평가 오류, 숨은 가정, 안전하지 않은 기본 설정을 식별할 수 있다.

도구가 더 많은 자율성을 얻을수록 위험은 커진다. 파일 순위만 매기는 모델은 코드를 실행하거나 네트워크에 접근하거나 리포지터리를 수정할 수 있는 에이전트보다 권한이 적다.

배포 팀은 이 제한된 권한을 유지해야 한다. 읽기 전용 리포지터리 접근, 샌드박스 실행, 제한된 명령, 검토 가능한 추적 기록은 기본 제어로 남아야 한다.

Cisco의 더 광범위한 연구도 이러한 주의를 뒷받침한다. 15개 독점 프런티어 모델을 평가한 결과, 단일 턴 공격과 적응형 다중 턴 공격 사이에 큰 차이가 나타났다.

다중 턴 공격 성공률은 7.89%에서 88.30%까지였다. 같은 집단의 단일 턴 비율은 2.19%에서 64.91%까지였다.

다중 턴 연구는 한 번의 프롬프트로 이뤄지는 안전성 테스트가 각 거부 이후 적응하는 공격자를 제대로 나타내지 못한다고 주장한다. 이 교훈은 방어 에이전트에도 적용된다.

리포지터리 검색 에이전트는 관찰과 행동의 연속을 통해 작동한다. 고립된 하나의 출력만 테스트해서는 모든 안전하지 않은 궤적이나 권한 실패를 드러낼 수 없다.

이 때문에 Antares의 벤치마크 전략은 모델 공개 자체보다 더 흥미롭다. Cisco는 모델, 과업 특화 평가, 통제된 에이전트 시스템을 위한 사양을 함께 구축하고 있다.

이 요소들은 AI 보안을 어떻게 구매해야 하는지에 관한 논거를 형성한다. 구매자는 정의된 워크플로, 공격 조건, 권한, 실패율에 대한 증거가 필요하다.

모델 카드나 일반적인 리더보드는 그런 운영상 질문에 답할 수 없다. 호의적인 Google News 헤드라인도 마찬가지다.

보안팀에는 자신들의 리포지터리와 제약을 닮은 평가 아티팩트가 필요하다. 또한 모델이 언제 방향을 바꿨는지와 왜 특정 파일을 선택했는지를 보여주는 기록도 필요하다.

그러한 증거는 감사와 사고 검토를 뒷받침할 수 있다. 또한 모델이 의미 있는 코드 관계 대신 표면적인 이름에 의존한 시점을 드러낼 수 있다.

오픈 웨이트는 이런 현지 테스트를 더 쉽게 만든다. 그러나 통제된 접근은 커뮤니티 참여를 제한하고 독립적 재현을 늦출 수 있다.

Cisco는 자사의 검토 절차가 정당한 연구자에게 실질적인 접근을 제공한다는 점을 보여야 한다. 그렇지 않으면 개방성에 대한 주장은 그 명칭이 시사하는 것보다 더 제한적으로 남을 것이다.

보안팀이 다음으로 지켜봐야 할 것

다음 세 가지 신호가 특화 보안 모델이 인프라가 될지, 인상적인 연구 시연에 머물지를 결정할 것이다.

첫 번째 신호는 독립적인 벤치마크 재현이다. 연구자들은 Cisco가 선택하지 않은 리포지터리, 언어, 취약점 클래스에서 Antares를 실행해야 한다.

분포 밖 CyberGym 결과는 이미 유용한 증거를 제공한다. 더 폭넓은 테스트는 일관된 하니스 아래에서 정밀도, 거짓 음성, 실행 시간, 분석가 노력을 측정해야 한다.

긍정적인 결과는 Cisco의 전문화 논지를 강화할 것이다. 성능이 크게 하락한다면, 모델이 전이 가능한 조사 역량이 아니라 벤치마크 특화 검색 패턴을 학습했음을 시사할 수 있다.

두 번째 신호는 프로덕션 통합이다. Antares는 보안 플랫폼이 순위가 매겨진 파일을 기존 조사 및 수정 워크플로에 배치할 수 있을 때 운영상 의미를 갖는다.

팀은 지속적 통합 시스템, 정적 스캐너, 권고 관리 플랫폼, 표준화된 SARIF 결과와의 통합을 주시해야 한다. SARIF는 정적 분석 결과를 교환하기 위한 일반적인 형식이다.

통합만으로 도입이 이뤄지는 것은 아니다. Cisco 또는 그 파트너는 분석가가 더 많은 취약점을 놓치지 않으면서 조사를 더 빨리 종료한다는 점을 보여야 한다.

가장 유용한 증거는 배포 전후의 분석가 시간을 비교하는 것이다. 사례 연구는 리포지터리 규모, 언어 적용 범위, 인간 검토 절차도 공개해야 한다.

파일럿을 수행하는 조직은 자체 평가 노트, 코드 컨텍스트, 권고, 검토자 결정을 보존해야 한다. 검색 가능한 지식 베이스는 팀이 반복 테스트 전반에 걸쳐 그러한 증거를 유지하는 데 도움을 줄 수 있다.

세 번째 신호는 경쟁적 대응이다. Microsoft, Google, OpenAI, 보안 공급업체, 오픈소스 연구자들은 모두 특화 사이버 모델이나 에이전트를 탐색하고 있다.

이들이 재현 가능한 하니스를 갖춘 과업 수준 벤치마크를 공개하는지 지켜봐야 한다. 또한 이들의 시스템이 위치 식별, 검증, 익스플로잇, 수정 단계를 분리하는지도 살펴봐야 한다.

명확한 분리는 보안 에이전트에 대한 Cisco의 모듈식 관점을 뒷받침할 것이다. 일관되게 더 강력한 엔드투엔드 결과를 내는 통합 시스템은 전용 위치 식별 모델의 논거를 약화할 것이다.

Antares-3B는 이러한 흐름을 뒷받침하는 또 하나의 구체적인 시험 사례다. Cisco는 7월 평가를 공개할 당시 결과를 포함했지만 가중치는 배포하지 않았다.

가중치가 공개되면 독립 연구자들은 최첨단에 근접한 VLoc Bench 성능이 서로 다른 리포지토리에서도 재현되는지 검증할 수 있다. 또한 공개된 350M 및 1B 변형 모델과의 동작 차이도 비교할 수 있다.

보안 구매 담당자는 하나의 만능 승자를 기다리지 말아야 한다. 이미 확보된 근거는 모델 선택이 작업 범위, 개인정보 보호 요구사항, 리포지토리 복잡도, 검토 역량에 따라 달라질 것임을 시사한다.

Google News는 앞으로도 이러한 공개를 모델 발표와 벤치마크 순위로 압축해 전달할 것이다. 실무자는 더 어려운 질문을 던져야 한다. 이 시스템이 새로운 실패 모드를 감추지 않으면서 검증된 보안 업무를 줄여 주는가?

과거 사례를 대상으로 범위가 제한된 파일럿을 실행하고, 모든 검색 추적 기록을 보존하며, 결과를 기존 통제 수단과 비교하라. 이 근거를 통해 특화 AI가 보안 파이프라인에 들어갈 자격이 있는지 판단할 수 있다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page