top of page

AI가 버그 증가를 부추기자 NIST, 고위험 취약점 우선순위화

NIST는 사상 최대 규모의 레코드를 처리하는 와중에 소프트웨어 취약점 검토 방식을 바꾼 뒤 Google News의 주목을 받았다. 이 기관에 따르면 CVE 제출 건수는 2020년부터 2025년 사이 263% 증가했다. 인공지능은 이제 이 압박의 양쪽에 자리하고 있다. 더 많은 코드를 만들고 검사하는 데 도움을 주는 한편, NIST는 그 결과로 쌓이는 취약점 데이터를 관리하기 위한 자동화를 검토하고 있다.

이것이 이 이야기의 핵심적인 역설이다. AI 지원 개발이 빨라질수록 검토가 필요한 소프트웨어의 양도 늘어난다. AI 기반 보안 도구 역시 취약점을 더 빠르게 찾아내며, 사람이 검증하고 우선순위를 정하고 수정해야 할 보고서를 만들어 낸다.

NIST는 보고된 모든 결함을 동일하게 취급해서는 이 문제를 해결할 수 없다. National Vulnerability Database, 즉 NVD는 긴급한 노출과 영향이 작은 잡음을 구분해야 한다. 이에 따라 이 기관은 보다 자동화된 워크플로를 개발하면서 일괄적인 보강 방식에서 위험 기반 우선순위화로 전환했다.

이 변화는 연방 데이터베이스를 훨씬 넘어서는 의미를 갖는다. 보안 스캐너, 자산 플랫폼, 정부 팀, 보험사, 소프트웨어 공급업체는 모두 NVD 데이터에 의존한다. 원래 CVE 레코드가 계속 제공되더라도, 보강 지연이나 축소는 불확실성을 하류로 전가할 수 있다.

Google News 독자에게는 매력적인 해답처럼 보일 수 있다. AI가 촉발한 버그 쓰나미를 AI로 관리하자는 것이다. 현실은 더 어렵다. 자동화된 분류는 처리 역량을 높일 수 있지만, 취약한 근거와 잘못된 분류, 근거 없는 확신까지 대규모로 확산시킬 수 있다.

NIST는 즉각적인 주의를 받을 취약점을 변경했다

NIST는 모든 CVE를 즉시 보강하는 방식을 더 이상 지속 가능한 운영 모델로 보지 않는다.

Common Vulnerabilities and Exposures 레코드, 즉 CVE는 공개된 보안 결함에 표준 식별자를 부여한다. NVD 보강은 방어자가 해당 레코드를 해석하는 데 도움이 되는 정보를 추가한다. 여기에는 심각도, 영향을 받는 제품, 취약점 분류, 구성 데이터가 포함될 수 있다.

2026년 4월 15일, NIST는 NVD를 위한 위험 기반 운영 모델을 발표했다. 이 기관은 제출된 모든 CVE가 계속 데이터베이스에 표시될 것이라고 밝혔다. 다만 정의된 기준을 충족하는 레코드만 즉시 보강을 받는다.

첫 번째 우선순위는 Cybersecurity and Infrastructure Security Agency의 Known Exploited Vulnerabilities 카탈로그에 포함된 취약점을 다룬다. 이 카탈로그는 실제 환경에서 악용된 증거가 있는 결함을 추적한다. NIST는 이들 레코드를 영업일 기준 하루 안에 보강하는 것을 목표로 삼았다.

두 번째 우선순위는 연방 정부가 사용하는 소프트웨어를 다룬다. 세 번째는 Executive Order 14028과 관련된 정의에 따른 중요 소프트웨어를 다룬다. 그 밖의 CVE는 즉각적인 보강이 없는 최저 우선순위 범주에 들어간다.

이는 단순한 대기열 관리 조정 이상의 변화다. NIST는 이전에 모든 CVE를 분석하고 자체적인 보조 데이터를 추가하는 것을 목표로 했다. 새 모델은 모든 레코드를 빠르게 보강하는 방식이 더 이상 유입 보고서의 규모와 맞지 않는다는 점을 인정한다.

NIST는 심각도 점수 산정 방식도 바꿨다. CVE Numbering Authority가 이미 점수를 제공한 경우, NIST는 별도의 점수를 일상적으로 만들지 않는다. CVE Numbering Authority는 식별자를 할당하고 레코드를 발행하도록 승인된 조직이다.

이 기관은 2026년 3월 1일 이전에 게시된 적체 레코드를 “Not Scheduled” 범주로 옮겼다. 알려진 악용 취약점은 이 적체 처리에서 제외됐다. 사용자는 우선순위가 낮은 레코드가 주의를 받을 가치가 있다고 판단할 경우 보강을 요청할 수 있다.

NIST의 NVD 운영 업데이트는 이 결정의 배경이 된 규모를 설명한다. CVE 제출 건수는 2020년부터 2025년 사이 263% 증가했다. 2026년 1분기 제출 건수는 2025년 같은 기간보다 거의 3분의 1 많았다.

이 기관은 2025년 동안 거의 42,000건의 CVE를 보강했다. NIST에 따르면 이는 이전 어느 해보다도 45% 많은 수치다. 그러나 이 기록적인 처리량조차 제출 증가세를 따라가지 못했다.

이 수치는 단순한 인력 설명을 약화한다. NIST가 분석가의 생산성이 떨어져서 더 적은 레코드를 처리한 것만은 아니다. 유입량은 인간 중심의 보강 프로세스가 확장할 수 있는 속도보다 더 빠르게 늘었다.

공개 NVD는 계속 운영되며 CVE를 수신하고 있다. 실질적인 변화는 각 레코드가 표준화된 맥락 정보를 얼마나 빨리 얻는지에 관한 것이다. 이 맥락 정보는 취약점 플랫폼이 결함을 조직의 실제 시스템과 연결할 수 있는지를 좌우하는 경우가 많다.

보안 팀에게는 단순 CVE와 보강된 NVD 레코드가 서로 대체 가능한 것이 아니다. 레코드는 결함을 식별할 수 있지만, 신뢰할 수 있는 우선순위 결정을 위한 구조화된 데이터를 충분히 제공하지 못할 수 있다. 제품 매핑과 심각도 세부 정보는 스캐너, 대시보드, 수정 대기열에 영향을 미친다.

이 차이가 Google News의 논점을 만들었다. NIST는 제한된 분석 역량을 시스템적으로 중요한 위험에 집중하는 동시에 광범위한 공개 범위를 유지해야 한다. 자동화는 앞으로 나아갈 한 가지 경로를 제공하지만, 우선순위화는 이미 오늘날 데이터베이스의 형태를 바꾸고 있다.

Google News가 AI 주도 버그 급증을 주목하는 이유

취약점 급증에는 여러 요인이 작용하며, AI는 그중 하나 이상을 증폭한다.

AI 코딩 보조 도구는 함수, 테스트, 구성 파일, 전체 애플리케이션 구성 요소까지 생성할 수 있다. 이러한 생산성은 조직이 검토해야 할 코드의 양을 늘린다. 또한 깊은 보안 경험 없이도 소프트웨어를 구축하는 데 필요한 노력을 낮춘다.

코드가 많아진다고 해서 자동으로 취약점이 많아지는 것은 아니다. 코드 품질은 모델, 프롬프트, 아키텍처, 검토 관행, 배포 통제에 달려 있다. 그러나 생산량 증가는 실수가 나타날 수 있는 표면을 넓힌다.

보안 연구는 기능적으로 동작하는 코드와 안전한 코드 사이에 반복적으로 간극이 있음을 확인해 왔다. 모델은 권한 확인이나 안전하지 않은 입력 제어를 빠뜨린 채 정상적으로 실행되는 소프트웨어를 만들 수 있다. 따라서 기능적 성공은 보안 실패를 가릴 수 있다.

Veracode는 2025년 보안 연구를 위해 코딩 작업 전반에서 100개 이상의 대규모 언어 모델을 테스트했다. 이 회사는 생성된 샘플의 45%가 보안 테스트에 실패했다고 보고했다. AI 코드 조사 결과는 더 강한 기능적 성능이 더 안전한 결과물을 보장하지는 않는다고도 시사했다.

이 연구는 AI가 NVD 적체를 만들었다는 점을 증명하지는 않는다. NIST는 운영 변경의 이유를 생성된 코드가 차지하는 측정된 비율이 아니라 증가하는 CVE 제출 건수로 설명한다. 취약점 공개에는 여러 동인이 존재하므로, 이 관계는 신중한 표현이 필요하다.

보안 연구자들은 이제 AI를 활용해 소스 코드를 분석하고, 패치를 비교하며, 테스트를 생성하고, 의심스러운 동작을 조사한다. 이러한 도구는 이전에 공개되지 않았던 취약점을 찾아낼 수 있다. 더 나은 탐지는 소프트웨어 품질이 일정하게 유지되더라도 유용한 보고를 늘린다.

조직은 오픈소스 저장소, 클라우드 서비스, 플러그인, 연결형 기기, 의존성 생태계를 통해 더 많은 소프트웨어를 공개한다. CVE 프로그램 역시 승인된 발행 기관 네트워크를 확대해 왔다. 두 변화 모두 공개 시스템으로 유입되는 레코드 수를 늘린다.

AI는 저품질 보고서 작성 비용도 낮춘다. 모델은 그럴듯한 취약점 설명, 심각도 추정치, 개념 증명 개요를 만들어 낼 수 있다. 이런 요소는 유지관리자가 근본 주장을 테스트하기 전까지 신뢰할 만해 보일 수 있다.

cURL 프로젝트는 유지관리자들이 허위 주장이 담긴 AI 생성 보고서를 받았다고 설명하면서 이러한 압박을 보여줬다. 그러한 제출물은 유효한 CVE가 되지 않더라도 시간을 소모한다. 비용은 보고서를 만드는 단계에서 그 보고서가 틀렸음을 입증하는 단계로 이동한다.

이로 인해 서로 다른 두 가지 홍수가 발생한다. 하나는 더 빠른 연구를 통해 발견된 실제 취약점으로 이루어져 있다. 다른 하나는 중복, 취약한 결과, 악용 불가능한 조건, 조작된 보고서로 구성된다. 방어자가 책임 있게 대응하기 전에 둘 다 검토가 필요하다.

AI 지원 발견은 소프트웨어 출시와 보안 검토 사이의 시간도 압축한다. 연구자는 에이전트에게 데이터 흐름을 추적하고, 의존성을 검사하며, 악용 경로를 제안하도록 요청할 수 있다. 그러한 경로가 실제로 작동하는지는 여전히 인간 전문가가 검증해야 한다.

따라서 규모 문제는 NVD 보강 이전에 시작된다. 유지관리자는 유입 보고서를 평가해야 한다. CVE Numbering Authority는 문제가 프로그램 규칙을 충족하는지 결정해야 한다. 공급업체는 NIST가 하류 맥락 정보를 추가하기 전에 패치를 준비하고 공개 절차를 조율해야 한다.

Google News를 통해 이 글을 접한 독자들은 편리하지만 뒷받침되지 않는 결론을 경계해야 한다. AI 생성 코드는 기록적인 CVE 증가의 유일한 원인이 아니다. 이는 소프트웨어 생산과 취약점 발견 전반의 더 큰 변화 안에서 작용하는 하나의 가속 요인이다.

더 설득력 있는 결론은 더 좁다. AI는 코드를 생산하고 그 안의 취약점을 탐색하는 비용을 낮춘다. 검증과 수정이 이러한 활동과 함께 확장되지 않는다면, 보안 대기열은 여러 지점에서 동시에 늘어난다.

이 압박은 개발자에게 직접 닿는다. 팀은 보안 인력이 고정된 상태에서 더 많은 AI 지원 변경을 병합할 수 있다. 분석가가 어떤 패턴이 접근 가능하고 악용 가능한 위험을 만드는지 판단할 수 없다면, 의심스러운 패턴을 10배 더 찾는 것은 도움이 되지 않는다.

이는 널리 사용되는 오픈소스 프로젝트의 유지관리자에게도 영향을 미친다. 이들은 전담 보안 팀이 없는 경우가 많다. AI 생성 보고서는 그 결론이 틀린 것으로 판명되더라도 재현 작업에 수시간을 요구할 수 있다.

정부 시스템도 관련된 문제에 직면한다. 기관은 방대한 자산 목록 전반에서 일관된 취약점 데이터를 필요로 한다. 누락되거나 지연된 제품 매핑은 실제 결함을 설치된 소프트웨어와 연결하기 어렵게 만들 수 있다.

NVD 변경은 이러한 불균형을 인정한다. NIST는 동등한 보강 속도를 약속하는 대신 중대한 결과를 초래할 취약점에 맞춰 최적화하고 있다. 과부하 상황에서는 타당한 선택이지만, 더 많은 판단 책임을 공급업체, 보안 플랫폼, 사용자에게 전가한다.

AI는 규모의 원인이자 NIST가 제안하는 대응책이다

NIST는 수동 보강이 끝없는 증가를 흡수할 수 없기 때문에 AI를 검토하고 있지만, 자동화는 문제를 없애기보다 실패 양식을 바꾼다.

NIST는 수년간 소프트웨어 보증 측정 작업을 해왔다. Software Assurance Metrics and Tool Evaluation 프로그램은 보안 관련 취약점을 식별하는 도구 연구를 지원한다. 이 프로그램은 현재의 생성형 코딩 보조 도구 물결보다 앞서 시작됐다.

이제 특히 관련성이 큰 프로젝트가 하나 있다. NIST는 AI Bug Finder를 소스 코드에서 버그를 찾는 AI 기반 방법을 평가하기 위한 모듈형 테스트베드로 설명한다. 테스트베드는 서로 다른 시스템을 비교하기 위한 통제된 작업과 데이터를 제공한다.

이 프로젝트는 NIST의 더 광범위한 Bugs Framework 작업에 속한다. 이 프레임워크는 버그, 결함, 취약점, 보안 취약점을 공식 구조로 설명하는 것을 목표로 한다. 이러한 구조는 전적으로 산문에 의존하는 대신 기계가 읽을 수 있는 분석을 지원할 수 있다.

Bugs Framework 기반 AI 시스템은 취약점을 식별하고, 분석하고, 우선순위를 정하고, 완화하는 데 도움을 줄 수 있다. NIST의 공개 AI 취약점 시스템은 모델이 파서와 검증 단계에서 확인할 수 있는 공식 명세를 생성한다고 설명한다.

이 차이는 중요하다. 범용 챗봇에게 CVE를 요약하도록 요청하는 것은 제약된 분석 워크플로를 구축하는 것과 다르다. 공식 스키마는 소프트웨어가 검증하고, 비교하고, 거부할 수 있는 필드를 제공한다.

자동화는 여러 NVD 작업을 지원할 수 있다. 제품 이름을 추출하고, 버전 범위를 연결하며, 취약점 분류를 제안하고, 공급업체 권고문을 비교하고, 누락된 필드를 식별할 수 있다. 또한 알려진 악용 패턴과 유사한 레코드를 표시할 수도 있다.

AI는 분석가가 더 심층적인 검토를 수행하기 전에 대기열을 분류하는 데 도움을 줄 수 있다. 시스템은 관련 보고서를 묶고, 상충하는 증거를 드러내거나, 어떤 기록에 사람의 주의가 필요한지 추천할 수 있다. 이는 반복적인 데이터 변환에 소요되는 시간을 줄인다.

하지만 모든 이점에는 그에 상응하는 위험이 따른다. 제품명은 공급업체, 패키지 관리자, 운영체제에 따라 서로 다르다. 잘못된 매핑은 실제로는 설치된 소프트웨어가 영향을 받고 있는데도 조직에 안전하다고 알릴 수 있다.

버전 범위도 또 다른 과제다. 권고문은 종종 문구, 브랜치, 빌드 번호 또는 백포트된 패치를 통해 릴리스를 설명한다. 모델은 이 텍스트를 구조화된 데이터로 변환하면서도 그 의미를 조용히 바꿔버릴 수 있다.

심각도 역시 맥락에 따라 달라진다. 동일한 코드 취약점도 권한, 네트워크 접근성, 구성, 필요한 사용자 상호작용에 따라 서로 다른 결과를 낳을 수 있다. 자동 점수화는 정밀한 숫자 뒤에 불확실성을 숨길 수 있다.

익스플로잇 상태는 더욱 민감하다. 공개 토론, 개념 증명 코드, 관찰된 공격은 서로 다른 형태의 증거다. 이를 하나로 뭉뚱그리는 분류기는 추정적 보고서를 과대평가하거나 실제 악용을 놓칠 수 있다.

그렇기에 NIST의 방향성은 전문가 판단을 대체하는 것이 아니라, 검증된 자동화로 이해해야 한다. 이 기관의 역사적 역할은 측정, 표준, 시험 방법에 중심을 두고 있다. 모든 AI 시스템에는 정확성과 실패 모두를 드러내는 벤치마크가 필요하다.

NIST의 현재 NVD 변경 사항에는 이미 기관 외부의 구조화된 우선순위 지정이 반영돼 있다. 2026년 6월, NIST는 CISA의 이해관계자별 취약점 분류 데이터를 추가했다. SSVC는 취약점 대응의 우선순위를 정하기 위한 의사결정 프레임워크다.

NVD 상태 페이지는 스키마 업데이트가 기존 취약점의 약 95%에 영향을 미쳤다고 설명한다. NVD 피드와 API에 계산된 SSVC 정보와 영향받는 제품 데이터를 추가했다. NIST는 소비자에게 더 큰 페이로드와 일시적인 지연을 예상하라고 경고했다.

이 배포는 NVD 현대화가 전체 생태계에 어떤 영향을 미칠 수 있는지 보여준다. 스키마 변경은 사용 가능한 맥락을 개선하지만, 모든 다운스트림 데이터 파이프라인이 이를 올바르게 수집해야 한다. 자동화는 통합이 신뢰성을 유지할 때에만 역량을 만든다.

따라서 이 이야기의 주된 대립 구도는 NIST와 소프트웨어 공급업체 간의 대립이 아니다. 자동화된 규모와 검증된 판단 간의 대립이다. AI 코딩과 AI 분류 모두 정보의 흐름을 더 빠르게 만들지만, 검증은 여전히 희소한 자원이다.

Google News 보도는 이 긴장을 단순한 순환 구조로 압축할 수 있다. AI가 버그를 만들고, 다시 AI가 이를 찾는다는 식이다. 그러나 운영 현실에는 여러 관문이 있다. 누군가는 결함을 확인하고, 영향을 받는 시스템을 평가하며, 악용 여부를 판단하고, 패치를 공개하고, 완화 조치를 전달해야 한다.

AI는 각 관문을 가속할 수 있다. 하지만 상충하는 증거를 사라지게 만들 수는 없다. 성숙한 시스템은 불확실성을 드러내고, 출처의 계보를 보존하며, 모호한 사례를 사람에게 넘겨야 한다.

기업 환경에서는 동일한 원칙이 개발 파이프라인 내부에도 적용된다. 수천 건의 결과를 내놓는 AI 스캐너는 우선순위 지정이 부족할 경우 보안 업무를 더 악화시킬 수 있다. 대부분의 경고가 의미 있는 노출에 해당하지 않으면 엔지니어는 알림을 무시하기 시작한다.

유용한 지표는 생성된 경고의 수가 아니다. 악용되기 전에 완화된, 검증되고 실제 도달 가능한 위험의 수다. NIST의 현대화 노력은 NVD 사용자 전반에서 이 결과를 개선할 때에만 성공할 것이다.

위험 기반 보강이 다운스트림으로 부담을 옮긴다

NIST의 분류 모델은 긴급 취약점에 주의를 집중하도록 돕지만, 낮은 우선순위의 기록도 개별 조직에는 여전히 매우 중요할 수 있다.

취약점은 연방 소프트웨어, 중요 소프트웨어, 알려진 악용 취약점 카탈로그의 범위 밖에 있으면서도 특정 기업에는 위협이 될 수 있다. 특수 산업 도구, 지역 제품, 규모가 작은 오픈소스 패키지는 즉각적인 NVD 보강을 받지 못할 수 있다.

NIST도 이 한계를 인정한다. 그 기준은 모든 조직의 로컬 노출이 아니라 시스템적 위험을 중심으로 설계돼 있다. 사용자는 보강을 요청할 수 있지만, 그 과정 역시 누군가 누락된 우선순위를 인지해야 한다.

보안 공급업체가 그 공백의 일부를 메울 것이다. 많은 플랫폼은 NVD 기록을 공급업체 권고문, 익스플로잇 인텔리전스, 패키지 메타데이터, 고객 자산 데이터와 결합한다. 이러한 추가 출처는 NIST가 보강을 마치기 전에 의사결정을 지원할 수 있다.

대형 공급업체는 자체 심각도 점수와 영향받는 버전 데이터를 제공할 수도 있다. 새로운 NVD 프로세스는 CVE 번호 부여 기관이 제공하는 정보에 더 크게 의존한다. 이 접근법은 업스트림 데이터가 완전할 때 중복 작업을 피한다.

문제는 업스트림 품질이 제각각일 때 나타난다. 일부 조직은 패치 링크와 정확한 버전 범위를 포함한 상세 기록을 공개한다. 다른 조직은 중요한 질문을 답하지 못한 채 짧은 설명만 제공한다.

독립 연구자들은 심각도나 보고된 동작이 취약점에 해당하는지 여부에서 공급업체와 의견이 다를 수도 있다. NIST는 이전에 또 하나의 분석 계층을 제공했다. 일상적인 점수화가 축소되면 사용자는 일관되지 않은 평가를 비교하게 될 수 있다.

CISA의 Known Exploited Vulnerabilities 카탈로그는 악용 증거를 요구하기 때문에 강력한 신호를 제공한다. 이 카탈로그 기준은 KEV를 긴급 완화 조치에 유용하게 만든다. 다만 이 카탈로그는 의도적으로 위험한 결함 전체보다 더 좁은 범위를 다룬다.

노출된 시스템의 경우 악용 증거를 기다리는 것은 너무 늦을 수 있다. 새로 공개된 취약점은 방어자가 공격을 관찰하기 전에도 명백한 위험을 제시할 수 있다. 따라서 조직은 KEV를 유일한 우선순위 지정 출처로 사용할 수 없다.

새 모델은 주목할 만한 유인도 만든다. 연구자와 공급업체는 연방 사용 여부, 중요 소프트웨어 상태 또는 KEV 포함 여부가 보강을 앞당길 수 있다는 점을 알고 있다. 이러한 라벨을 둘러싼 논쟁은 더 중요해질 수 있다.

자동화된 요청도 또 다른 노이즈 원인이 될 수 있다. 사용자가 NIST에 낮은 우선순위 기록의 보강을 요청할 수 있다면, AI 시스템은 그럴듯한 상향 요청을 대량으로 생성할 수 있다. NIST는 원래의 적체를 재현하지 않으면서 접근성을 보존하는 통제가 필요할 것이다.

오탐은 가장 눈에 띄는 AI 위험이지만, 미탐은 더 큰 잠재적 피해를 낳는다. 무해한 패턴을 잘못 상향하는 모델은 분석가의 시간을 낭비한다. 원격으로 악용 가능한 결함을 놓치는 모델은 방어자에게 경고를 제공하지 못한다.

학습 데이터의 편향은 두 종류의 오류 모두를 형성할 수 있다. 모델은 문서화가 잘 된 제품과 흔한 취약점 유형에서 더 쉽게 학습한다. 잘 알려지지 않은 소프트웨어, 이례적인 언어, 새로운 악용 연쇄는 더 약한 분석을 받을 수 있다.

공격자는 자동화 파이프라인을 조작할 수도 있다. 악의적인 권고문에는 추출 시스템에 영향을 주도록 설계된 오해의 소지가 있는 제품명, 조작된 설명 또는 참조가 포함될 수 있다. 모든 AI 기반 보강 워크플로에는 신뢰할 수 없는 입력에 대한 방어가 필요하다.

이는 자동화를 거부해야 할 이유가 아니다. 사람만으로 처리하는 방식은 이미 역량 한계에 도달했다. 핵심 질문은 자동화가 어디에서 작동하며, 그 권고가 어떻게 검증되는지에 관한 것이다.

저위험 작업에는 형식 정규화, 누락 필드 탐지, 중복 참조 연결이 포함된다. 고위험 작업에는 검증 없이 악용 가능성을 판단하고, 영향받는 버전 범위를 변경하며, 완화 조치의 긴급성을 부여하는 일이 포함된다.

NIST는 자동화 구성 요소의 평가 방법과 오류율을 공개함으로써 신뢰를 보존할 수 있다. 사용자는 어떤 필드가 공급업체, CISA, NIST 분석가 또는 기계 생성 권고에서 왔는지 알아야 한다.

출처 계보가 중요한 이유는 소비자가 NVD 데이터를 인프라로 취급하기 때문이다. 보안 팀은 특정 매핑이나 우선순위가 기록에 부여된 이유를 살펴볼 수 있어야 한다. 설명되지 않는 모델 출력은 그러한 책임성을 제공할 수 없다.

AI 생성 코드를 사용하는 엔지니어링 팀에도 같은 교훈이 적용된다. 가능하다면 코드 검토는 프롬프트, 모델 변경 사항, 테스트 결과, 소유권 결정을 보존해야 한다. 검색 가능한 엔지니어링 지식 베이스는 팀이 생성된 변경 사항을 아키텍처 및 보안 증거와 연결하는 데 도움이 될 수 있다.

문서화가 안전하지 않은 코드를 안전하게 만들지는 않는다. 하지만 발견 사항에서 그 결정을 도입하거나 수용한 판단까지 검토자가 더 명확하게 추적할 수 있는 경로를 제공한다. 소프트웨어 생성 속도가 빨라질수록 이러한 맥락의 가치는 더 커진다.

기업은 또한 “일정 미정”을 “취약하지 않음”으로 해석하지 않아야 한다. 이 라벨은 NIST의 보강 대기열을 설명한다. 기업 환경 내 악용 가능성을 측정하는 것이 아니다.

이 의미상의 차이는 대시보드 안에서 사라질 수 있다. 공급업체는 NVD 상태를 보안 위험과 별도로 제시해야 한다. 그렇지 않으면 사용자는 연방 차원의 보강 부재를 낮은 우선순위의 완화 결정으로 혼동할 수 있다.

자동화된 취약점 분류가 입증해야 할 것

AI 기반 분류는 방어자가 이를 핵심 보안 인프라로 취급하기 전에 측정 가능한 신뢰성을 입증해야 한다.

첫 번째 시험은 제품 식별에 관한 것이다. 시스템은 취약점을 올바른 공급업체, 패키지, 버전, 배포 맥락과 신뢰성 있게 연결해야 한다. 작은 명명 오류도 광범위한 인벤토리 오류를 일으킬 수 있다.

두 번째 시험은 증거 처리에 관한 것이다. 모델은 공급업체 주장, 독립적인 시연, 공개 익스플로잇 코드, 확인된 공격을 구분해야 한다. 각 출처는 서로 다른 수준의 신뢰도를 뒷받침한다.

세 번째는 불확실성에 관한 것이다. 책임 있는 시스템은 증거가 충돌하거나 불완전한 상태로 남아 있을 때 판단을 유보해야 한다. 모든 기록에 자신 있는 답을 생성하는 것은 보안 요구사항이 아니라 제품 동작이다.

네 번째는 재현성에 관한 것이다. 기초 증거가 변하지 않았을 때 분석가는 동일한 구조화된 결론을 받아야 한다. 워크플로가 출력을 제약하지 않으면 모델의 무작위성은 감사 추적을 복잡하게 만들 수 있다.

다섯 번째는 적대적 공격에 대한 저항성에 관한 것이다. 취약점 보고서는 신뢰할 수 없는 입력이며, 그중 일부에는 악성 콘텐츠가 포함될 것이다. 보강 에이전트는 통제 없이 내장된 지시를 따르거나 안전하지 않은 리소스를 가져와서는 안 된다.

여섯 번째는 적시성에 관한 것이다. 긴급 기록을 처리하는 데 수주가 걸리는 고정확도 시스템은 운영상 가치가 제한적이다. NIST에는 정확성과 유용한 처리 시간이 모두 필요하다.

일곱 번째는 수정에 관한 것이다. 새로운 증거는 취약점 평가를 정기적으로 바꾼다. 자동화 워크플로는 그러한 수정의 배경이 되는 이력을 지우지 않고 이전 결론을 업데이트해야 한다.

전통적인 머신러닝 벤치마크는 종종 전체 정확도를 보고한다. 여기서는 그 수치만으로 충분하지 않다. 실제로 악용 중인 원격 코드 실행 관련 오류는 경미한 로컬 조건 관련 오류보다 더 큰 비중을 가져야 한다.

NIST는 위험 가중 평가를 통해 이를 해결할 수 있다. 테스트 세트에는 불완전한 권고문, 상충하는 버전 데이터, 잘 알려지지 않은 제품, 악성 텍스트, 새롭게 발견된 취약점 패턴이 포함돼야 한다. 정제된 과거 기록만으로는 평가가 비현실적으로 쉬워질 것이다.

사람과의 비교도 필요하다. 분석가도 실수하고, 의견이 다르며, 시간 압박 속에서 일한다. 목표는 모든 과거 NVD 결정과 완벽하게 일치하는 것이어서는 안 된다.

더 강력한 벤치마크는 다운스트림 효용을 비교할 것이다. AI 지원 워크플로는 수정률을 낮추고, 영향받는 제품 범위를 개선하며, 긴급 보강 시간을 단축하는가? 모호한 사례에 대한 분석가의 주의를 보존하는가?

독립적인 테스트는 모델 드리프트도 살펴봐야 한다. 공급업체는 상용 모델을 업데이트하고, 로컬 모델은 새로운 학습과 튜닝을 거친다. NIST의 주변 코드가 그대로여도 자동화 워크플로의 동작은 바뀔 수 있다.

공공 부문 활용에는 조달 관련 우려도 더해진다. NIST는 데이터 처리, 모델 접근, 서비스 연속성, 재현성을 고려해야 한다. 독점 모델은 빠르게 개선될 수 있지만 장기적인 검증을 복잡하게 만들 수 있다.

오픈 모델은 검토 가능성과 로컬 제어를 제공하지만, 여전히 평가가 필요합니다. 모델 가중치만으로는 특정 결론이 왜 도출됐는지 알 수 없습니다. 투명한 입력, 규칙, 검증은 계속 필요합니다.

공격자는 공개된 모든 우선순위 결정 시스템을 연구할 것입니다. 더 느린 대응을 받는 제품이나 취약점 유형을 표적으로 삼을 수 있습니다. 또한 제한된 검토 역량을 소진시키기 위해 고우선순위 레코드처럼 보이도록 공개 자료를 설계할 수도 있습니다.

이러한 적대적 압력은 특히 에스컬레이션 결정에서 사람의 감독을 필수로 만듭니다. 자동화는 분석가에게 제시되는 질문의 품질을 높여야 합니다. 눈에 보이는 백로그를 보이지 않는 모델 오류로 대체하는 데 그쳐서는 안 됩니다.

상용 AI 트리아지 도구를 평가하는 보안 책임자도 비슷한 질문을 던져야 합니다. 각 발견 사항은 어떤 데이터를 근거로 하는가? 시스템은 영향을 받는 코드 경로를 보여줄 수 있는가? 도달 가능성을 측정하는가? 상충하는 증거는 어떻게 처리하는가?

또한 수정 처리량도 측정해야 합니다. 발견 사항 수가 두 배가 되었지만 수정 건수가 그대로라면, 그 도구는 보안이 아니라 업무량을 늘린 것입니다. 발견 건수는 우선순위 결정과 엔지니어링 역량이 함께 확장될 때에만 유용합니다.

NIST의 사례는 같은 제약을 국가 차원에서 보여줍니다. 취약점 정보가 많아진다고 해서 방어력이 자동으로 향상되지는 않습니다. 정보는 시스템이 이를 검증되고 시의적절한 조치로 전환한 뒤에야 가치가 생깁니다.

Google News의 주목 이후 지켜볼 세 가지 신호

다음 단계는 보강 성과, 자동화 투명성, 그리고 후속 의사결정의 품질에 따라 결정될 것입니다.

첫 번째 신호는 위험 기반 모델에서의 NVD 처리량입니다. NIST가 알려진 악용 취약점에 대해 영업일 기준 1일 목표를 지속적으로 달성하는지 지켜봐야 합니다. 예정되지 않은 대기열이 계속 늘어나는지도 확인해야 합니다.

긴급 레코드가 더 빠르고 일관되게 보강된다면 새 모델은 신뢰를 얻게 됩니다. 더 좁은 우선순위에도 지연이 지속된다면, 트리아지만으로는 역량 문제를 해결하지 못한 것입니다.

두 번째 신호는 자동화 워크플로에 관한 기술적 공개입니다. NIST는 장기적 지속 가능성을 위해 자동화 시스템과 워크플로 개선을 개발하고 있다고 밝혔습니다. 중요한 세부 사항은 검증, 출처, 판단 보류, 사람의 검토에 관한 내용일 것입니다.

AI 지원 보강을 위한 공개 벤치마크는 신뢰를 강화할 수 있습니다. 연구자들은 제품과 취약점 유형 전반의 실패 사례를 검토할 수 있게 됩니다. 명확한 필드별 출처 표기는 후속 사용자들이 데이터 품질을 판단하는 데도 도움이 됩니다.

공개 내용이 빈약하면 AI 지원 확장에 대한 주장은 약화됩니다. 보안 인프라에는 모델 정확도 주장 이상의 것이 필요합니다. 사용자는 자동화된 출력이 어떻게 레코드에 들어가며 어떻게 수정되는지 이해해야 합니다.

세 번째 신호는 NVD에 의존하는 플랫폼과 기업 팀의 행동입니다. 공급업체가 SSVC, 공급업체 제공 심각도, 영향 제품 데이터, KEV 신호를 서로 교환 가능한 것처럼 제시하지 않고 통합하는지 지켜봐야 합니다.

성공적인 적응은 출처가 드러나는 더 명확한 우선순위 결정을 만들어낼 것입니다. 부실한 적응은 상충하는 대시보드, 누락된 매핑, 예정되지 않은 레코드에 대한 잘못된 안도감을 초래할 것입니다.

조직은 지금 자체적인 NVD 보강 의존도를 점검해야 합니다. 팀은 어떤 스캐너가 NVD 심각도, CPE 매핑 또는 NIST 작성 분석을 사용하는지 목록화할 수 있습니다. 이후 공급업체 권고문과 패키지 데이터가 필요한 백업을 제공하는 지점을 파악할 수 있습니다.

개발자는 AI 지원 코드 변경과 관련해 취약점 발견 사항도 추적해야 합니다. 목표는 생성된 코드를 금지하는 것이 아닙니다. 검토, 테스트, 수정이 산출물 증가 속도를 따라가는지 판단하는 것입니다.

보안 팀은 발견과 종결을 위한 별도 지표를 만들 수 있습니다. 관련 지표에는 검증된 발견 사항, 악용 가능한 발견 사항, 중앙값 수정 시간, 재발 이슈, 오탐 검토 비용이 포함됩니다. 이러한 지표는 AI가 방어를 개선하는지 보여줍니다.

Google News를 통해 이 이야기를 따라가는 독자는 보편적 주장보다 운영상의 증거를 더 많이 기대해야 합니다. 유용한 질문은 AI가 안전하지 않은 코드를 작성하는지 여부가 아닙니다. 모든 개발 방식은 안전하지 않은 코드를 만들 수 있습니다.

더 날카로운 질문은 검증 역량이 자동화된 생산과 발견의 증가에 맞춰 성장하는지 묻습니다. NIST의 정책 변경은 기존의 균형이 이미 국가적 규모에서 실패했음을 보여줍니다.

AI 지원 트리아지는 특히 반복적인 보강 작업에 그럴듯한 대응책을 제공합니다. 그러나 증거, 불확실성, 책임 있는 검토를 보존해야 합니다. 그렇지 않으면 자동화는 취약점 데이터를 더 빠르게 움직이게 할 뿐, 더 신뢰할 수 있게 만들지는 못할 것입니다.

NIST는 이제 코딩 에이전트를 도입하는 모든 소프트웨어 조직이 공유하는 시험대에 섰습니다. 산출물 규모를 완료된 보안 작업으로 혼동하지 않으면서 자동화를 활용해야 합니다.

팀은 다음에 무엇을 해야 할까요? NVD 데이터가 보안 의사결정에 들어가는 지점을 파악하고, 대체 출처를 보존하며, 경보 수가 아닌 수정 성과를 측정해야 합니다. 그다음 NIST의 자동화가 중대한 오류를 숨기지 않으면서 검증된 보강을 개선하는지 지켜봐야 합니다.

이것이 Google News 헤드라인 뒤에 있는 진짜 이야기입니다. AI는 소프트웨어 생성과 취약점 발견의 속도를 높였습니다. 남은 병목은 판단이며, 어떤 모델도 이를 가리도록 허용해서는 안 됩니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

​머릿속에 검색창을 추가하세요

remio에게 물어보기만 하면 됩니다

모든 것을 기억하세요

정리는 필요 없습니다

bottom of page