top of page

Trail of Bits, 1Password AI 패치 벤치마크가 보안 담당자들을 오도한다고 지적

43분 전
12분 분량

Trail of Bits는 1Password AI 패치 벤치마크가 공개된 지 6주 후, 핵심 지표로 제시된 26%의 완전 수정률이 오해를 불러일으킨다고 비판했다.

이번 논쟁은 단순히 AI가 안전한 코드를 작성할 수 있는지에 관한 문제가 아니다. 잘못된 지시, 제한된 도구, 일관되지 않은 채점 환경에서 에이전트가 작동할 때 벤치마크가 실제로 무엇을 측정하는지에 대한 문제다.

1Password의 Off-by-1 Labs는 여섯 가지 난이도 높은 취약점에서 6,080개의 패치를 테스트했다. 보고서에 따르면 26%는 애플리케이션 동작을 실질적으로 바꾸지 않으면서 취약점을 완전히 수정했다.

또 다른 20.1%는 동작을 변경하면서 보고된 취약점을 수정했다. 나머지 53.9%는 문제를 고치지 못했거나, 다른 취약점을 도입했거나, 둘 다에 해당했다.

Trail of Bits는 이러한 실패가 무해하다고 주장하지 않는다. 대신 연구진은 종합 결과가 실질적으로 서로 다른 패치 작업을 나타내는 실험 조건들을 하나로 합쳐 놓았다고 주장한다.

회사 측은 데이터세트의 22%가 에이전트에게 잘못된 수정 방향을 지시한 프롬프트에서 나왔다고 말한다. 또 다른 36%는 에이전트가 코드를 컴파일하거나 테스트할 수 없었던 시험에서 나왔다.

Trail of Bits는 비판과 함께 두 가지 에이전트 스킬도 공개했다. 하나는 원래 버그, 관련 변형, 회귀를 기준으로 패치를 검증한다. 다른 하나는 엔지니어를 위한 대화형 리뷰 안내를 만든다.

이 대응은 벤치마크에 대한 이견을 AI 지원 보안을 둘러싼 더 큰 논쟁으로 확장한다. 핵심 질문은 팀이 에이전트를 독립적인 패치 생성기로 평가해야 하는지, 아니면 검증된 엔지니어링 프로세스의 참여자로 평가해야 하는지다.

1Password AI 패치 벤치마크는 매우 다른 실험을 함께 묶었다

Trail of Bits는 26%라는 결과가 일반적인 개발 도구를 갖춘 에이전트를 나타내는 것이 아니라, 여러 조건이 섞인 실험을 설명한다고 주장한다.

Off-by-1 Labs는 2026년 8월 6일 FLAWED 연구를 공개했다. FLAWED는 Fix-Like Artifacts With Embedded Defects의 약자다.

이 연구는 최근 공개된 여섯 가지 취약점을 대상으로 ChatGPT-5.5와 Opus 4.8을 조사했다. 대상에는 Linux, ActiveMQ, Chrome, Exim, Spring AI, Gemini CLI가 포함됐다.

연구진은 업스트림 수정이 여러 파일, 함수 또는 코드 경로에 걸친 취약점을 선택했다. 최근 취약점을 대상으로 삼아 모델이 완성된 패치를 암기했을 가능성도 낮췄다.

이 설계에는 타당한 목적이 있었다. 어렵고 낯선 취약점은 일반적인 코딩 벤치마크가 숨기는 불완전한 추론을 드러낼 수 있다.

다만 이는 독자가 평균 수치를 얼마나 폭넓게 적용할 수 있는지도 제한한다. Trail of Bits 분석에 따르면, 여섯 대상의 완전 수정률은 3%에서 60%까지 분포했다.

따라서 여섯 대상의 평균은 대상 선정에 크게 좌우된다. 이는 일상적인 패치, 더 단순한 취약점 또는 대표적인 소프트웨어 백로그의 실패율을 확정할 수 없다.

실험은 에이전트의 작업 방식도 달리했다. 원샷 실행은 셸 접근을 허용하지 않았고 모델이 영향을 받은 소프트웨어를 빌드하거나 실행하지 못하게 했다.

반복 실행은 재현 스크립트를 제공하고 여러 번의 시도를 허용했다. 탐색 실행은 개발 환경 접근을 제공했지만, 에이전트가 자체 작업을 어떻게 검증할지 결정하도록 했다.

이 모드는 서로 다른 질문에 답한다. 원샷 응답은 심각한 제약 아래에서의 코드 생성을 측정한다. 반복형 에이전트는 실행 가능한 피드백을 활용한 패치를 측정한다.

둘을 하나의 핵심 수치로 합치면 이러한 차이가 가려진다. 컴파일 접근 권한이 없는 패치 에이전트는 인간 개발자가 기본적인 엔지니어링 관행으로 여기는 피드백 루프를 활용할 수 없다.

Trail of Bits는 테스트 불가 모드가 보고된 데이터의 36%를 차지했다고 말한다. 이 비중은 도구 제한이 전체 결과의 주요 입력 요소임을 뜻한다.

프롬프트 구성도 또 다른 차이를 더했다. FLAWED 연구는 각 취약점에 대해 잘못되거나 불완전한 지침이 포함된 프롬프트를 비롯해 9개의 구조화된 프롬프트 템플릿을 사용했다.

모델이 나쁜 조언에 저항하는지 시험하는 일은 가치가 있다. 이는 자동화 편향을 드러내고 에이전트가 잘못된 진단을 얼마나 쉽게 따르는지 보여줄 수 있다.

그러나 Trail of Bits는 두 프롬프트가 에이전트에게 명시적으로 잘못된 수정 방향을 지시했다고 말한다. 이 프롬프트들은 데이터세트의 22%를 차지했다.

자율 패치를 평가하는 조직은 이 실패 모드에 관심을 가져야 한다. 그러나 정확한 취약점 보고서와 함께 에이전트를 평가하는 개발자는 다른 상황에 놓인다.

따라서 논쟁은 실험이 존재해야 하는지 여부가 아니라 집계 방식에 관한 것이다. Trail of Bits는 오도하는 프롬프트를 일반적인 수정 시도와 분리해 보고해야 한다고 본다.

이 재분석은 에이전트가 코드를 실행할 수 있었고 잘못된 수정 방향으로 유도되지 않았던 시험을 유지했다. 또한 업스트림 패치를 참고한 것으로 표시된 시도는 제외했다.

그 조건에서 3,067개 패치 중 2,634개가 제공된 익스플로잇을 차단했다. 이는 필터링된 시도의 86%에 해당한다.

하나의 익스플로잇을 차단했다고 해서 완전한 보안 수정이 입증되는 것은 아니다. Trail of Bits도 이 한계를 명시적으로 인정한다.

좁은 범위의 방어 조치는 제공된 입력을 막을 수 있지만, 근본적 약점은 다른 경로를 통해 여전히 도달 가능할 수 있다. 86% 결과는 즉각적인 익스플로잇 차단을 측정한 것이지, 완전한 해결을 측정한 것은 아니다.

그럼에도 필터링된 결과는 실험 조건이 중요한 이유를 보여준다. 동일한 데이터세트가 비관적인 완전 수정률 수치와 더 낙관적인 익스플로잇 차단 결과를 모두 뒷받침할 수 있다.

두 비율만으로 AI 에이전트가 신뢰할 수 있는 패치 작성자인지 결론낼 수는 없다. 함께 보면, 벤치마크의 라벨은 테스트한 워크플로를 정확히 설명해야 한다는 점을 보여준다.

프롬프트 설계와 테스트 접근 권한이 답을 바꾸는 이유

이번 벤치마크 논란은 에이전트 평가의 기본 원칙을 드러낸다. 즉, 작업 조건은 측정 대상 시스템의 일부다.

코딩 에이전트는 단순한 언어 모델이 아니다. 지침, 도구, 실행 환경, 컨텍스트, 종료 규칙, 검증 프로세스도 모두 포함한다.

어느 구성 요소를 바꾸든 결과는 달라질 수 있다. 재현기를 실행할 수 있는 모델은 정적 텍스트만으로 한 번의 응답을 생성하는 모델이 얻지 못하는 증거를 받는다.

원래의 FLAWED 보고서는 세 가지 운영 모드를 설명한다. 각각은 격리, 반복, 에이전트 자율성 사이에서 서로 다른 균형을 나타낸다.

원샷 모드는 셸과 인터넷 접근을 차단했다. 모델은 한 번의 응답으로 완전한 패치를 만들어야 했다.

이 설정은 매우 제한적인 환경을 나타낼 수 있다. 하지만 수정 루프에서 컴파일, 테스트, sanitizer, 디버깅, 검사 명령을 제거한다.

반복 모드는 재현 스크립트를 제공하고 여러 번의 시도를 허용했다. 에이전트는 메모리 파일을 통해 이전 실행의 피드백을 사용할 수 있었다.

탐색 모드는 준비된 재현기를 제공하지 않은 채 유사한 접근 권한을 허용했다. 에이전트는 완료를 보고하기 전에 자체 검증 경로를 선택해야 했다.

이 모드들은 단지 편의성만 다른 것이 아니다. 서로 다른 역량을 테스트한다.

원샷 생성은 모델이 소스 코드와 설명으로부터 완전한 수정을 추론할 수 있는지 묻는다. 반복형 패치는 실행을 통해 실패를 진단하고 개선할 수 있는지를 묻는다.

탐색형 패치는 또 다른 부담을 더한다. 에이전트는 과업의 일부로 증거를 제공받는 대신, 자신의 변경이 작동한다는 증거를 직접 구성해야 한다.

Trail of Bits는 벤치마크가 이런 조건들의 영향을 공개해야 한다고 주장한다. 이들의 합산 평균을 일반적인 역량 점수로 취급해서는 안 된다는 것이다.

프롬프트 품질도 비슷한 문제를 만든다. 보안 보고서에는 흔히 익스플로잇, 추정 근본 원인, 영향을 받는 경로, 완화 지침이 포함된다.

그 입력은 불완전하거나 틀릴 수 있다. 각 조건에서의 모델 행동을 측정하면 팀이 더 안전한 워크플로를 설계하는 데 도움이 될 수 있다.

하지만 의도적으로 잘못된 지침은 적대적이거나 잘못 설정된 과업 조건을 나타낸다. 일반적인 AI 패치를 설명하는 데 쓰이는 수치에 조용히 반영되어서는 안 된다.

유용한 보고서는 정확한 지침, 불완전한 지침, 잘못된 지침, 유도 없는 탐색에 대한 완전 수정률을 보여줄 것이다. 그러면 독자는 결과를 자신의 환경에 맞춰 해석할 수 있다.

추론 설정은 세 번째 변수다. 이 실험은 기본 설정에 따라 ChatGPT-5.5를 중간 수준의 노력으로, Opus 4.8을 높은 수준의 노력으로 실행했다.

Trail of Bits는 어느 모델도 사용 가능한 최고 설정을 사용하지 않았다고 지적한다. 또한 실험은 노력 수준이 수정 품질에 미친 영향을 분리하지 않았다.

이 누락이 관찰된 패치를 무효화하는 것은 아니다. 다만 각 모델이 달성 가능한 성능에 관한 주장은 제한된다.

모델이 서로 다른 설정을 받을 때 이 문제는 더 중요해진다. 그렇지 않으면 독자는 차이를 모델의 역량이 아니라 구성 효과로 봐야 할 결과를 모델 역량 차이로 해석할 수 있다.

채점은 또 다른 층위를 더한다. FLAWED는 다른 모델의 교차 검토를 포함해 패치 평가에 모델을 사용했다.

Trail of Bits에 따르면 모델 채점은 검토된 사례에서 완전한 5개 범주 결과에 대해 인간 검토자와 65.9% 일치했다.

검토자가 원래 취약점이 수정되었는지만 물었을 때 일치율은 87.7%로 상승했다. 새 버그가 나타났는지에 대해서는 70.5%로 떨어졌다.

Trail of Bits는 두 모델 채점기가 동일한 패치의 36.8%에 서로 다른 결과를 부여했다고 보고한다. 이러한 판단을 평균낸다고 해서 불일치가 사라지는 것은 아니다.

이는 완전 수정 상태가 여러 판단을 결합하기 때문에 중요하다. 채점기는 기존 취약점이 남아 있는지, 동작이 바뀌었는지, 또 다른 약점이 생겼는지를 판단해야 한다.

채점기가 의도된 동작 변경을 회귀로 취급하면 올바른 패치도 불리한 라벨을 받을 수 있다. 반대로 테스트가 다른 취약 경로를 놓치면 불완전한 패치가 통과할 수 있다.

Trail of Bits는 ActiveMQ 판정의 8%가 의도된 변경을 회귀로 처벌했다고 말한다. 또한 불완전한 use-after-free 수정을 허용했다고 주장되는 Chromium 채점 경로도 지목한다.

비판은 또한 off-by-one 취약점이 있는 Linux 참조 패치를 언급한다. 모델들은 이 오류를 생성된 248개 패치에서 반복했고, 자동 채점기는 그중 24개를 포착했다.

이러한 주장은 Trail of Bits의 재분석에서 나온 것이며, 현재 진행 중인 방법론적 논쟁의 일부로 남아 있다. 이는 Off-by-1 Labs가 문서화한 실패한 패치를 지우지는 않는다.

이는 AI 벤치마크가 자체 평가기에 대한 검증을 필요로 하는 이유를 보여준다. 채점 파이프라인도 패치 파이프라인처럼 거짓 양성과 거짓 음성을 만들 수 있다.

실제 쟁점은 AI 패치 생성과 검증된 수정의 차이다

1Password는 생성된 패치가 얼마나 자주 완전한 수정으로 분류되는지를 측정하는 반면, Trail of Bits는 제안을 승인된 수정으로 바꾸는 엔지니어링 프로세스를 강조한다.

원래의 1Password 조사 결과는 중요한 경고를 담고 있다. 그럴듯한 코드는 취약점의 근본 원인을 해결하지 않은 채 개념 증명을 차단할 수 있다.

Off-by-1 Labs는 성공으로 분류된 패치의 3분의 1 이상에 보안상 취약한 요소가 포함되어 있음을 발견했다. 이러한 패치는 완전한 해결 대신 좁은 범위의 검사에 의존했다.

Spring AI는 유용한 사례를 제공했다. 모델들은 근본적인 표현식 언어 노출을 해결하는 대신, 제공된 악성 입력의 문자를 이스케이프하는 경우가 많았다.

그러한 패치는 하나의 페이로드를 무력화할 수 있지만 대체 입력은 여전히 허용할 수 있다. 하나의 테스트에 대한 기능적 성공이 잘못된 확신을 만들게 된다.

Trail of Bits는 이 교훈을 부정하지 않는다. 새 검증 스킬은 동일한 실패로 이어지는 두 번째 경로를 요구함으로써 비슷한 우려를 반영한다.

불일치는 생성 전후에 무엇이 일어나는지를 두고 있다. 벤치마크는 원시 모델 응답을 평가할 수도 있고, 에이전트가 보조한 개발 과정을 평가할 수도 있다.

이러한 분석 단위는 서로 다른 결론을 낳는다. 원시 생성 결과는 모델의 실패 양상을 드러낸다. 완료된 워크플로는 엔지니어가 에이전트의 도움을 받아 올바른 결과에 도달할 수 있는지를 측정한다.

Trail of Bits는 Patch the Planet 이니셔티브를 통해 두 번째 관점을 뒷받침한다. 엔지니어들이 에이전트를 지휘하고, 그 작업을 검토한 뒤 오픈소스 유지관리자에게 패치를 제출했다.

이 회사는 9월 14일까지 유지관리자가 병합하거나 종료한 공개 풀 리퀘스트 186건을 조사했다. 유지관리자는 126건을 병합했으며, 수용률은 67.7%였다.

병합된 제출물 가운데 91건은 보안과 관련된 수정이 관찰되지 않은 채 처음 제안된 보안 수정안을 유지했다. 나머지 33건은 수용 전에 보안 관련 변경을 거쳤다.

이 수치가 정확성을 입증하는 것은 아니다. 유지관리자는 결함이 있는 코드를 병합할 수 있으며, 공개 검토 결과만으로는 이후 발생하는 모든 회귀를 드러낼 수 없다.

Trail of Bits도 이러한 한계를 인정한다. 회사는 수용을 완벽한 보안의 증거가 아니라 실질적 유용성과 수정 부담에 관한 근거로 제시한다.

회사는 Patch the Planet 프로젝트 전반에서 이후 이루어진 약 33,500개의 커밋도 검토했다. 자사 패치가 도입한 문제를 바로잡는 변경을 찾았다.

이 조사에서는 기능 버그가 최소 10건, 빌드·테스트·릴리스 자동화 버그가 4건, 성능 문제가 1건 발견됐다. 악용 가능한 보안 취약점은 보고되지 않았다.

발견된 취약점이 없다는 것은 그러한 취약점이 존재하지 않는다는 증거가 아니다. Trail of Bits는 더 광범위한 검토가 계속 진행 중이라고 밝혔다.

한 사례는 인간 대 에이전트라는 구도가 왜 오해를 부를 수 있는지 보여 준다. 한 에이전트는 freenginx의 내장 Perl 모듈에 있는 메모리 안전성 문제를 위한 패치를 제안했다.

해당 패치는 취약한 경로 하나를 열어 둔 채 정리 과정에서의 크래시를 도입했다. Off-by-1 Labs는 이를 정확히 비판했다.

한 유지관리자는 취약한 세 경로를 모두 포괄하는 별도의 수정안을 만들었다. 이 인간 작성 변경 역시 같은 정리 과정 크래시를 도입했다.

두 작성자 모두 콜백을 더 오래 유지한 뒤 요청을 더 이상 사용할 수 없게 된 후 해제했다. 정리 과정은 유효하지 않은 요청에 접근하는 Perl 코드를 실행할 수 있었다.

이 사례는 인간과 에이전트의 동등성을 입증하지 않는다. 다만 둘 다 즉각적인 익스플로잇 경로 밖의 결과를 놓칠 수 있음을 보여 준다.

Trail of Bits는 이 사례를 자사의 컨설팅 기록과 비교했다. 2024년부터 2026년까지 수행된 236건의 보안 평가에서 2,265개 취약점에 대한 최초 수정안을 검토했다.

개발자들은 첫 시도에서 283개 문제를 완전히 해결하지 못했다. 이는 12.5%에 해당하며, 보고된 95% 신뢰구간은 10.5%에서 14.5%다.

이 개발자들은 자신의 소프트웨어를 잘 알고 있었고, 상세한 취약점 보고서를 받았다. 또한 Trail of Bits가 변경 사항을 검토할 것이라는 점도 알고 있었다.

이 비교에는 여전히 한계가 있다. 인간 개발자와 벤치마크 에이전트는 동일한 조건에서 동일한 과제를 해결한 것이 아니다.

그럼에도 이 데이터는 인간이 작성한 패치가 자동으로 올바르다는 비현실적인 기준에 이의를 제기한다. 보안 수정은 언제나 검토, 테스트, 수정에 의존해 왔다.

이 맥락은 실질적인 질문을 바꾼다. 팀에 필요한 것은 첫 패치가 절대 틀리지 않는 에이전트가 아니다.

필요한 것은 허용 가능한 한계를 넘어 잔존 위험을 높이지 않으면서 처리량을 개선하는지에 관한 근거다. 이를 측정하려면 비교 가능한 팀, 과제, 검증 관문이 필요하다.

Trail of Bits의 패치 이니셔티브는 이러한 워크플로 관점을 반영한다. 에이전트가 생성과 조사를 수행하고, 엔지니어와 유지관리자는 수용에 대한 책임을 계속 진다.

1Password의 보고서는 다른 우려를 반영한다. 빠른 생성은 완성된 것처럼 보이지만 미묘한 결함을 포함한 패치로 검토자를 압도할 수 있다.

두 우려는 모두 사실일 수 있다. 에이전트 지원은 수정 가능한 취약점의 수를 늘리는 동시에 강력한 검증의 중요성을 더 높일 수 있다.

두 가지 Agent Skill이 비판을 검증 가능한 워크플로로 전환한다

Trail of Bits는 단지 데이터를 더 유리하게 해석하는 데 그치지 않고, 운영 통제로 벤치마크에 대응하고 있다.

회사는 제출 전 보안 수정을 점검하는 post-patch-validation을 공개했다. 이 도구는 취약점 보고서와 취약 코드 및 패치된 코드의 리비전을 입력으로 받는다.

첫 번째 작업은 원래 버그를 재현하는 것이다. 이 skill은 취약한 코드에서는 실패하고 패치 후에는 통과하는 검사를 요구한다.

이 조건은 흔한 테스트 실수를 막는다. 두 리비전 모두에서 통과하는 테스트는 변경이 취약점을 제거했음을 보여 줄 수 없다.

두 번째 작업은 동일한 실패로 이어지는 별도의 경로를 겨냥한다. 이 경로는 원래의 개념 증명을 반복하는 것이 아니라 근본 원인을 따라야 한다.

예를 들어 에이전트는 다른 호출자, 대체 입력, 오류 경로 또는 정리 순서를 조사할 수 있다. freenginx 크래시는 정리 과정에 주목해야 하는 이유를 보여 준다.

세 번째 작업은 수정된 코드 주변의 회귀와 새로운 취약점을 점검한다. 두 리비전에서 안정적으로 유지되어야 할 동작을 비교한다.

검증 계획에는 더 광범위한 근거도 포함되어야 한다. Trail of Bits는 프로젝트 테스트, sanitizer 검사 또는 범위가 제한된 퍼징을 가능한 구성 요소로 언급한다.

sanitizer는 잘못된 메모리 접근과 같은 런타임 오류 유형을 탐지한다. 범위가 제한된 퍼징은 정의된 시간 또는 범위 내에서 생성된 입력을 탐색한다.

네 번째 작업은 인프라 실패를 결론 불가로 취급한다. 빌드 실패나 누락된 의존성은 취약점이 재현됐다는 증거로 간주될 수 없다.

이 규칙은 자명하게 들리지만, 자동화 파이프라인은 실행 오류를 통과 또는 실패 레이블로 축소하는 경우가 많다. 유효하지 않은 증거를 분리하면 최종 판정을 보호할 수 있다.

이 skill은 유지관리자를 위해 검사와 결과를 보존한다. 따라서 검토자에게 텍스트로 된 보증을 신뢰하라고 요구하는 대신 에이전트의 결론을 점검할 수 있게 한다.

두 번째 공개 도구인 review-walkthrough는 워크플로의 인간 측면을 다룬다. 완전한 브랜치 diff를 상호작용적이고 순서화된 검토로 전환한다.

변경 사항은 원시 파일 순서가 아니라 논리적인 읽기 순서로 표시된다. 발견 사항은 관련 코드 옆에 배치되어 엔지니어가 확인하고 대응할 수 있다.

이 walkthrough는 GitHub 리뷰를 준비할 수 있지만, 제출되는 댓글에 대한 책임은 검토자에게 남는다. 이 경계는 책임성 측면에서 중요하다.

두 도구는 공개 security skills repository를 통해 이용할 수 있다. 이들은 변형 분석, 속성 기반 테스트, 뮤테이션 테스트를 위한 기존 skill에 합류한다.

변형 분석은 코드베이스 전반에서 결함과 관련된 사례를 찾는다. 속성 기반 테스트는 소수의 사람이 선정한 사례가 아니라 생성된 입력 전반에서 동작을 점검한다.

뮤테이션 테스트는 테스트 스위트가 잘못된 동작을 포착하는지 확인하기 위해 코드를 의도적으로 변경한다. 살아남은 변이는 누락된 assertion이나 취약한 커버리지를 드러낼 수 있다.

이 기법들은 함께 검증 사다리를 만든다. 재현은 보고된 익스플로잇을 점검하고, 변형 테스트는 패치의 근본 원인 포괄성을 검증한다.

회귀 테스트는 의도된 동작을 보호한다. sanitizer와 fuzzer는 예상된 사례를 넘어선 실패를 찾는다.

그다음 뮤테이션 테스트는 그러한 테스트가 의미 있는 오류를 탐지할 수 있는지 평가한다. 인간 검토는 설계, 유지보수성, 자동화된 커버리지 밖의 위험을 평가한다.

이 워크플로가 안전한 패치를 보장하지는 않는다. 유한한 테스트 스위트로는 모든 취약점이 없음을 입증할 수 없다.

하지만 더 강력한 결정을 뒷받침하는 산출물을 만든다. 검토자는 이전에 무엇이 실패했는지, 지금 무엇이 통과하는지, 어떤 경로가 아직 테스트되지 않았는지를 확인할 수 있다.

이것이 Trail of Bits 대응의 가장 강력한 부분이다. 회사는 방법론적 이의를 다른 팀이 평가할 수 있는 실천으로 전환한다.

이 skill들은 비판의 잠재적 약점도 드러낸다. 합리적인 절차를 담고 있다는 이유만으로 그 가치를 가정해서는 안 되며, 측정해야 한다.

post-patch-validation은 블로그 게시물에서 분석한 Patch the Planet 작업에 사용되지 않았다. 따라서 결함률에 미치는 영향은 아직 알려지지 않았다.

팀은 이 도구가 알려진 불완전한 수정, 새로 주입된 회귀, 제공된 개념 증명 밖의 결함을 포착하는지 테스트해야 한다.

오탐과 검토 시간도 측정해야 한다. 과도한 노이즈를 만드는 검증 도구는 결과를 개선하지 못한 채 병목만 옮길 수 있다.

같은 기준은 review-walkthrough에도 적용된다. 더 나은 표현은 이해를 개선할 수 있지만, 설명이 틀리면 근거 없는 확신을 만들 수도 있다.

상호작용형 서술은 검사를 지원해야 하며 이를 대체해서는 안 된다. 검토자는 여전히 전체 diff, 테스트, 빌드 출력, 프로젝트 맥락에 접근할 수 있어야 한다.

Trail of Bits는 반증 가능한 방향을 확립했다. 다음 단계는 각 skill이 패치 품질과 검토 효율을 얼마나 개선하는지 보여 주는 비교 근거다.

보안 팀이 다음으로 주시해야 할 사항

논쟁은 더 매력적인 헤드라인 비율을 고르는 것이 아니라, 통제된 비교와 재현 가능한 산출물로 해결될 것이다.

첫 번째 신호는 1Password 또는 독립 연구자가 조건별로 분류된 결과를 공개하는지 여부다. 독자는 프롬프트 품질, 도구 접근성, 운영 모드, 추론 노력별로 묶인 결과를 필요로 한다.

이 분석은 현실적인 개발 조건에서 26%의 완전 수정률이 여전히 낮게 유지되는지를 보여 줄 것이다. 또한 어떤 제약이 가장 큰 하락을 유발하는지도 드러낼 것이다.

6개 대상은 크게 달랐기 때문에 취약점별 결과도 중요하다. 평균값은 에이전트가 특정 언어, 아키텍처 또는 취약점 유형에서 어려움을 겪는지 감출 수 있다.

연구자들은 익스플로잇 차단과 근본 원인 해결을 모두 보고해야 한다. 전자는 즉각적인 유용성을, 후자는 수정의 완결성을 측정한다.

두 번째 신호는 논란이 된 등급에 대한 전문가 재현이다. 검토자는 공개된 기준 아래 동일한 패치를 검토하고 판단이 갈리는 지점을 기록해야 한다.

이 작업에는 Linux의 off-by-one 사례, Chromium의 콜백 경로, Trail of Bits가 지적한 ActiveMQ 동작 변경이 포함되어야 한다.

광범위한 등급 오류를 확인하는 재현은 벤치마크의 헤드라인을 약화시킬 것이다. 원래 레이블과의 강한 일치는 Trail of Bits의 비판을 약화시킬 것이다.

세 번째 신호는 두 신규 skill에 대한 통제된 평가다. 에이전트는 검증 워크플로의 적용 여부에 따라 동일한 취약점을 패치해야 한다.

이 비교는 완전 수정, 해결되지 않은 변형, 도입된 회귀, 검토자 시간, 수용 전 필요한 수정 횟수를 측정해야 한다.

비교 가능한 조건의 인간 전용 팀과 에이전트 보조 팀도 포함해야 한다. 이 기준선이 없으면 개발자를 대체하거나 능가한다는 주장은 뒷받침되지 않는다.

조직은 정책을 수립하기 전에 모든 연구를 기다릴 필요는 없다. 이미 패치 생성과 패치 승인을 분리할 수 있다.

AI가 만든 패치는 익숙하지 않은 기여자의 변경과 동일한 검토 시스템에 들어가야 한다. 그 출처가 신뢰를 부여하거나 자동 거부를 촉발해서는 안 된다.

팀은 취약점 보고서, 재현 도구, 에이전트 transcript, 패치, 검증 명령, 결과를 보존해야 한다. 이러한 산출물은 실패를 진단 가능하게 하고 추후 감사를 가능하게 한다.

승인 전에 근본 원인 설명을 요구해야 한다. 제공된 페이로드만 필터링하는 패치는 더 엄격한 검토가 필요하다.

고위험 변경에는 인증, 메모리 안전성, 암호화, 파서, 접근 제어, 수명 주기 정리 주변의 더 광범위한 검사가 필요하다. 이 영역은 좁은 수정에 가혹하다.

내부 검토 시스템을 구축하는 조직은 이전 취약점, 거부된 패치, 반복되는 실패 패턴을 위해 검색 가능한 engineering knowledge base도 유지할 수 있다.

그 기록은 검토자가 여러 저장소에서 반복되는 실수를 식별하는 데 도움이 될 수 있다. 또한 겉보기에는 단순한 수정안이 왜 거부됐는지도 보존할 수 있다.

1Password AI 패치 벤치마크를 에이전트가 4분의 3의 확률로 실패한다는 주장으로 축소해서는 안 된다. 이 데이터는 실제로 중대한 영향을 미치는 복구 실패를 기록한다.

Trail of Bits의 비판 역시 에이전트가 86%의 확률로 성공한다는 주장으로 축소해서는 안 된다. 제공된 익스플로잇을 차단하는 것은 안전한 복구를 완성하는 것보다 약한 기준이다.

유의미한 결론은 그 두 수치 사이에 있다. AI 에이전트는 가치 있는 패치를 만들 수 있지만, 벤치마크 설계와 검증 방식이 그 패치가 무엇을 의미하는지 결정한다.

보안 리더에게 필요한 즉각적인 조치는 구체적이다. 모든 패치 지표의 전제 조건을 감사한 뒤, 에이전트가 실제로 사용될 워크플로 안에서 테스트해야 한다.

에이전트가 컴파일하고, 문제를 재현하며, 변형 사례를 탐색하고, 회귀를 감지할 수 있었는지 물어야 한다. 이어서 깔끔해 보이는 diff를 신뢰하는 대신, 전문가가 증거를 검토했는지도 확인해야 한다.

이 과정은 어느 한쪽의 헤드라인보다 더 나은 판단을 제공한다. 1Password AI 패치 벤치마크의 진정한 시험대는 그 결과가 방어 가능한 자동화를 위축시키지 않으면서 검증을 개선하는지 여부다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page