Anthropic Google AI 경쟁, Claude의 잘못 보도된 포스트 양자 보안 테스트와 맞물리다
- Ethan Carter

- 7월 30일
- 10분 분량
Anthropic은 Claude가 일부 헤드라인에서 묘사된 4시간 미만이 아니라 60시간 동안 포스트 양자 서명 후보에 대한 새로운 공격을 찾아냈다고 밝혔다. 이 차이는 중요하다. Claude Mythos Preview는 의미 있는 암호학 연구를 수행했지만, 실제 배포된 포스트 양자 보안을 뚫거나 현재 시스템을 노출시키지는 않았다.
이 결과는 최첨단 모델이 독창적인 과학 연구를 수행할 수 있는지를 둘러싼 더 광범위한 anthropic google 경쟁 속에 암호해석을 위치시킨다. Google 연구진은 최근 Gemini를 활용해 미해결 수학 문제를 다뤘다. Anthropic은 이제 오류가 곧바로 보안 문제로 이어질 수 있는 분야에서 Claude가 전문가의 작업을 확장할 수 있다고 주장하고 있다.
Claude는 AES-128의 축소된 7라운드 버전에 대한 공격도 개선했다. 완전한 AES-128은 10라운드를 사용하며 영향을 받지 않는다. 따라서 실제 이야기는 암호화 비상사태보다는 좁은 범위지만, 또 하나의 벤치마크 승리보다는 더 중요한 의미를 지닌다.
HAWK 테스트에서 Claude가 실제로 찾아낸 것
Claude는 제안된 서명 체계에서 수학적 약점을 찾아냈지만, 보고된 테스트는 실제 배포된 포스트 양자 보안의 붕괴를 의미하지는 않았다.
Anthropic은 2026년 7월 28일 연구 결과를 공개했다. 연구진은 National Institute of Standards and Technology가 검토 중인 디지털 서명 설계 HAWK를 조사하기 위해 Claude Mythos Preview를 사용했다.
디지털 서명은 메시지나 소프트웨어 패키지가 예상된 발신자로부터 왔으며 변조되지 않았음을 증명한다. 포스트 양자 서명은 미래의 양자 컴퓨터에 맞서 이러한 보증을 유지하는 것을 목표로 한다.
HAWK는 NIST의 Additional Digital Signatures 절차에 남아 있는 후보 중 하나다. 이 절차는 알고리즘이 표준이 되기 전에 제안안을 의도적으로 공개 분석에 노출한다.
Anthropic의 연구 결과에 따르면, HAWK는 약 2년에 걸쳐 두 차례의 전문가 검토를 통과했다. 이후 Claude는 약 60시간의 작업 동안 개선된 키 복구 공격을 식별하는 데 도움을 줬다.
이 시간대는 원문 헤드라인에 붙은 4시간 미만이라는 설명과 직접적으로 모순된다. Anthropic의 상세 설명에 따르면 HAWK 공격을 찾고, 개발하고, 검증하는 데 총 약 60시간이 걸렸다.
이 모델은 에이전트형 하니스 안에서 반자율적으로 작동했다. 이 하니스는 프롬프트, 여러 Claude 작업자, 공개 논문, 수학 소프트웨어, 계산 실험용 샌드박스를 결합했다.
인간 연구자가 때때로 프로젝트 방향을 제시했다. Anthropic은 운영자가 이론 컴퓨터 과학 경험은 있었지만 격자 암호 전문가는 아니었다고 밝혔다.
Claude는 문헌 검토로 시작해 이전 공격을 살펴보고 수학적 가설을 시험했다. 두 작업자 에이전트가 결국 성공한 아이디어를 탐색했지만, 그중 하나는 처음에 이를 비현실적이라고 판단했다.
유용한 통찰은 HAWK를 뒷받침하는 수학적 격자 내부의 대칭인 비자명한 자기동형사상과 관련됐다. 기존 연구는 그러한 대칭을 찾으면 더 강력한 공격이 가능해진다는 점을 확립해 두었다.
Claude의 기여는 HAWK의 특정 구조에서 악용 가능한 대칭을 식별한 데 있었다. 이어 생성된 키를 대상으로 공격을 시험할 수 있는 엔드투엔드 검증 파이프라인을 구축했다.
작은 HAWK-256 챌린지 매개변수의 경우, Anthropic은 추정 공격 비용이 2^64회 연산에서 2^38회 연산으로 낮아졌다고 보고했다. 이 감소는 작은 테스트 매개변수를 실질적으로 복구 가능한 수준으로 만든다.
하지만 이 결과가 Claude가 모든 HAWK 구성을 무너뜨렸다는 뜻은 아니다. Anthropic은 더 큰 제안 키 크기에 대한 공격은 여전히 계산상 비현실적이라고 설명한다.
이 공격은 HAWK에만 특화돼 있다. 다른 격자 기반 시스템이나 NIST가 이미 선정한 포스트 양자 표준으로 자동 전이되지는 않는다.
이 범위는 이번 사건을 이해하는 데 핵심적이다. Claude는 현재 운영 환경의 트래픽, 금융 시스템, 저장된 비밀번호 또는 소프트웨어 서명을 손상시키지 않았다.
대신 모델은 바로 이런 문제를 찾아내기 위해 마련된 검토 과정에서 설계상 약점을 발견했다. 이는 성공적인 스트레스 테스트이지, 실제 보안 침해의 증거는 아니다.
이제 암호학까지 포함하는 Anthropic Google 연구 경쟁
anthropic google 경쟁은 질문에 답하는 단계에서, 인간 전문가가 독립적으로 검증해야 하는 연구를 만들어내는 단계로 옮겨가고 있다.
최첨단 AI 연구소들은 수년간 코딩 테스트, 과학 문제, 표준화된 추론 벤치마크를 통해 모델을 비교해 왔다. 이러한 평가는 대체로 정답이 알려져 있고 채점 기준이 명확하다.
암호해석은 기준을 바꾼다. 유용한 결과는 새로워야 하고, 수학적으로 타당해야 하며, 계산적으로 재현 가능해야 하고, 알고리즘을 둘러싼 보안 가정과 관련성이 있어야 한다.
따라서 Anthropic의 작업은 Google, OpenAI 및 다른 모델 개발사에 더 어려운 역량 척도를 제시한다. 이제 문제는 모델이 전문가 지식을 재현할 수 있는지가 아니다.
새로운 시험은 AI 시스템이 거대한 기술적 탐색 공간을 훑은 뒤 그 지식을 확장할 수 있는지를 묻는다. 또한 기초 수학을 이해하는 전문가들의 검토를 견뎌야 한다.
Google은 이미 중요한 비교 지점을 제공한다. Anthropic의 연구는 Google 연구진이 Gemini를 사용해 여러 미해결 Erdős 수학 문제를 해결했다고 언급한다.
OpenAI 연구진도 미해결 수학 추측에서 진전을 보고한 바 있다. 이 사례들은 기업 간 암호학 대결이라기보다 연구 수준의 추론을 둘러싼 더 넓은 경쟁을 보여준다.
두 회사 모두 범용 모델을 특화 도구와 연결하고 있다는 점에서 anthropic google 비교는 여전히 중요하다. 이 도구들은 모델이 문헌을 읽고, 코드를 작성하며, 실험을 수행하고, 병렬 시도를 조율하도록 돕는다.
HAWK 결과는 이 결합이 왜 중요한지 보여준다. Claude는 단 한 번의 대화형 응답으로 성공적인 공격을 생성한 것이 아니다.
여러 작업자, 외부 참고자료, 수학 소프트웨어 및 반복 검증을 포함한 장기 프로젝트 전반에서 작동했다. 이 워크플로는 전통적인 챗봇 세션보다 계산 연구 그룹에 더 가깝다.
Anthropic은 ETH Zurich, Tel Aviv University, TU Berlin의 연구진과 함께 개발한 CryptanalysisBench도 이번 결과와 함께 공개했다. 이 벤치마크는 6개 암호학 계열에 걸친 191개 과제를 포함한다.
세 가지 등급은 알려진 실용적 공격, 축소형 변형을 갖춘 더 강력한 체계, 그리고 연구 최전선에 가까운 운영용 원시구성요소를 포함한다. 이 설계는 기억해 낸 공격과 더 까다로운 암호해석 작업을 구분한다.
보도에 따르면 5개의 최첨단 모델은 1등급 체계의 65~86%를 해결했다. 또한 최대 강도에서 여러 2등급 체계를 무너뜨리고 다른 설계에서 새로운 결과를 냈다.
이 수치가 모델이 운영 환경의 암호화를 일상적으로 깰 수 있음을 입증하지는 않는다. 암호해석이 빠른 역량 변화를 추적할 만큼 측정 가능한 분야가 됐다는 점을 보여준다.
이는 Google과 다른 연구소가 비교 가능한 방법론을 공개해야 한다는 압박을 만든다. 독창적 연구라는 주장은 기록, 재현 가능한 코드, 기술 논문, 외부 검토 없이는 설득력이 떨어진다.
표준화 기구와 암호 설계자에게도 압박이 된다. 검토자가 산출되는 물량을 검증할 수 있다는 전제 아래, 후보 알고리즘은 배포 전에 훨씬 더 많은 자동화된 검증을 받게 될 수 있다.
경쟁 우위는 단순히 벤치마크 점수가 가장 높은 모델이 아니라 최고의 연구 시스템을 구축한 연구소에 돌아갈 수 있다. 도구 접근성, 실험 설계, 검증, 전문가 감독이 제품의 일부가 된다.
이 발전은 일반 수학 결과에는 없는 보안 차원을 anthropic google 경쟁에 부여한다. 잘못된 정리는 연구 시간을 낭비하지만, 놓친 암호학적 결함은 디지털 인프라에 영향을 미칠 수 있다.
60시간 헤드라인보다 중요한 메커니즘
Claude의 가장 강력한 기여는 기계적 직관의 단 한 번의 번뜩임이 아니라 문헌, 수학, 실험을 아우르는 지속적인 탐색이었다.
Anthropic은 여러 Claude 작업자가 가설과 비판을 교환하는 다중 에이전트 과정을 설명한다. 이 구조는 하나의 대화가 모든 세부 사항을 유지하도록 강요하지 않으면서 시스템이 경쟁하는 방향을 탐색하게 했다.
성공한 HAWK 아이디어는 의견 충돌에서 나왔다. 한 작업자는 대칭 접근법을 기각했지만, 다른 작업자는 이를 활용할 방법을 찾아냈다.
이 사례는 AI 보조 연구를 위한 유용한 메커니즘을 보여준다. 병렬 에이전트는 성급한 결론에 이의를 제기하고, 하나의 추론 경로가 버린 아이디어를 보존할 수 있다.
Claude는 수학 계산에 쓰이는 소프트웨어 시스템 Sage에도 접근할 수 있었다. 코드를 작성하고, 예시를 생성하며, 추측을 시험하고, 결과를 이론적 기대와 비교할 수 있었다.
계산 검증이 수학적 추론을 대체한 것은 아니다. 탐색 범위를 좁히고 추상적 공격이 실제 HAWK 인스턴스에서 작동하는지 확인하는 데 도움을 줬다.
암호학적 논증은 작은 가정이나 복잡도 오류로도 실패할 수 있기 때문에 엔드투엔드 구현은 중요하다. 알려진 테스트 키를 복구하는 것은 설득력 있는 글만으로 제시하는 것보다 더 강한 증거를 제공한다.
그럼에도 이 과정은 완전 자율적이지 않았다. 인간이 프로젝트를 관리하고, 조직적 접근법을 제안하며, Claude를 유용한 계산 라이브러리로 안내했다.
Anthropic은 외부 학계 전문가와도 협의했고, 6월에 HAWK 공격을 저자들과 공유했다. 회사는 관련 NIST 메일링 리스트와 공개 절차를 조율했다.
이 순서는 새롭게 형성되는 역할 분담을 보여준다. 모델은 다수의 후보 아이디어를 생성하고 시험할 수 있으며, 인간은 목표를 선택하고, 가정에 이의를 제기하며, 책임 있는 공개를 관리한다.
Claude의 AES 작업은 자율성을 한 단계 더 밀어붙였다. 한 연구자는 모델이 가설을 제안하고, 실험을 실행하며, 실패한 접근법을 기각할 수 있게 하는 발판을 구축했다.
대상은 AES-128의 7라운드 형태였다. 완전한 AES-128은 10라운드의 변환을 적용하므로, 연구자들은 공격 기법이 완전한 암호에 얼마나 근접하는지 연구하기 위해 축소된 버전을 사용한다.
Claude는 처음에는 의미 있는 개선 가능성이 낮다고 주장했다. 인간 프롬프트는 시스템에 목표를 유지하고 쉬운 접근법 너머를 탐색하라고 거듭 지시했다.
며칠 뒤 모델은 Möbius Bridge라고 부른 핑거프린팅 방법을 개발했다. 이 방법은 기존 중간 지점 공격에서 하나의 추측을 제거했다.
중간 지점 공격은 중간 계산 결과를 저장하고 양방향에서 이를 대조한다. 이 기법은 더 낮은 계산 시간을 위해 대규모 메모리 요구량을 감수한다.
Anthropic은 새 방법이 기존 공격을 200배에서 800배까지 가속했다고 밝혔다. 하지만 기본 위협 모델은 여전히 2^105개의 선택 평문에 접근할 수 있다고 가정한다.
이 요구사항은 현실적으로 수집 가능한 범위를 벗어난다. 이 공격은 7라운드만 겨냥하므로 완전한 10라운드 암호는 영향을 받지 않는다.
Anthropic 연구진은 이후 AES 결과를 검증하는 데 수백 시간을 들였다. 보도에 따르면 두 연구자는 그 정확성을 확신하는 데 거의 한 달이 걸렸다.
이 검증 격차가 전체 이야기에서 가장 중요한 메커니즘일 수 있다. AI는 자격을 갖춘 인간이 인증할 수 있는 속도보다 더 빠르게 그럴듯한 기술적 발견을 만들어낼 수 있다.
이러한 시스템을 사용하는 조직에는 지속 가능한 연구 기록이 필요합니다. 검색 가능한 엔지니어링 지식 베이스는 가설, 코드, 실패한 실험, 검토, 공개 결정 사항을 보존할 수 있습니다.
그런 기록이 없다면, 빠른 생성은 오히려 책임이 됩니다. 팀은 실제 공격과 그럴듯하지만 무효한 추론 사슬을 구분하기 어려워질 것입니다.
수치가 보여주지 않는 것
어느 결과도 오늘날 운영 환경의 암호화를 위협하지 않으며, Anthropic의 증거는 여전히 지속적인 독립 검증이 필요합니다.
HAWK 결과가 극적으로 들리는 이유는 이 체계의 유효 키 강도를 거의 절반으로 낮추기 때문입니다. 다만 이 설명에는 두 가지 단서가 필요합니다.
첫째, HAWK는 채택된 운영 표준이 아니라 후보입니다. 조직들은 이를 사용해 가동 중인 시스템을 보호하고 있지 않습니다.
둘째, 더 큰 HAWK 파라미터는 여전히 공격하기 어렵습니다. 이 결과는 설계를 약화하고 표준화 가능성에 타격을 줄 수 있지만, 모든 구성을 즉시 해독 가능하게 만들지는 않습니다.
키 강도 역시 단순한 물리적 행위로 떨어지는 것이 아닙니다. 2^64와 2^38이라는 수치는 정해진 공격 모델에서 추정한 계산 작업량을 뜻합니다.
이는 모든 컴퓨터에서의 실제 경과 시간을 의미하지 않습니다. 하드웨어, 구현 선택, 메모리, 병렬화 모두 실제 실행에 영향을 줍니다.
AES 결과에는 더욱 강한 주의가 필요합니다. Claude는 현재 컴퓨팅 전반에서 사용되는 AES-128 암호화를 해독하지 않았습니다.
열 라운드가 아닌 일곱 라운드로 구성된 버전에 대한 학술 공격을 개선했습니다. 축소 라운드 설계를 연구하면 연구자들이 보안 여유를 측정하는 데 도움이 되지만, 이런 설계는 의도적으로 더 약하게 만들어집니다.
가정된 2^105개의 선택 평문 역시 이 공격을 실행 불가능하게 만듭니다. 상당한 속도 향상에도 이 방법이 실전 도구로 바뀌지는 않습니다.
독립 암호학자들은 이 구분을 강조해 왔습니다. 격자 연구에 참여한 암호학 교수 Chris Peikert는 HAWK 결과를 후보 체계에 대한 गंभीर한 수학적 공격이라고 설명했습니다.
다른 연구자들은 AES 결과를 일반적인 암호화 데이터가 노출됐다는 주장으로 바꾸어 말해서는 안 된다고 경고했습니다. 연구의 진전과 즉각적인 운영상 영향은 서로 다른 문제이므로, 두 관점은 모두 옳을 수 있습니다.
Anthropic 역시 두 핵심 결과 모두 운영 시스템에 영향을 주지 않는다고 밝히고 있습니다. 이 발견 때문에 변경해야 하는 배포 소프트웨어는 없습니다.
또한 회사는 HAWK 공격이 다른 NIST 포스트양자 후보에 영향을 주지 않는다고 말합니다. 이 결과를 논의할 때마다 그 경계는 분명히 해야 합니다.
역사적 선례는 이 작업을 폄하하지 않으면서도 신중함을 뒷받침합니다. SIKE 포스트양자 후보는 연구자들이 일반 노트북에서 이를 해독하기 전까지 수년간의 검토를 견뎠습니다.
그 실패는 모든 포스트양자 암호가 건전하지 않다는 뜻이 아니었습니다. 숨겨진 약점이 있는 후보를 제거하는 방식으로 공개 표준화가 작동한다는 점을 보여주었습니다.
HAWK도 이제 비슷한 시험에 직면합니다. 설계자는 구조를 수정하거나, 파라미터를 늘리거나, 분석에 이의를 제기하거나, 트레이드오프가 더 이상 표준화를 정당화하지 못한다는 점을 받아들일 수 있습니다.
4시간 미만이라는 주장은 별도의 신뢰성 문제를 제기합니다. Anthropic의 원자료는 HAWK 발견 및 검증 과정에 60시간이 걸렸다고 제시합니다.
더 작은 HAWK-256 공격은 일단 개발되면 빠르게 실행될 수 있습니다. Anthropic은 또한 한 시간 이내에 실행되는 축소 라운드 LEA에 대한 더 최근의 공격도 설명합니다.
이 পৃথ পৃথ한 사실들이 부정확한 헤드라인으로 압축됐을 수 있습니다. 독자는 그러한 압축을 사건의 검증된 타임라인으로 받아들여서는 안 됩니다.
anthropic google 구도는 점수표가 되어 버리면 또 다른 왜곡을 만들 수 있습니다. Google은 HAWK를 제출하지 않았고, Gemini가 이 시험에 직접 참여했다는 보도도 없었습니다.
Google의 역할은 맥락적입니다. 그 수학 연구는 여러 최전선 모델 프로그램이 독창적인 과학 작업을 향해 나아가고 있다는 증거를 제공합니다.
가장 강한 결론은 더 제한적입니다. Claude는 제안된 포스트양자 체계 하나에서 심각한 약점을 찾았고, 확립된 암호 두 가지의 약화된 버전에 대한 연구를 개선했습니다.
이는 AI 보조 암호해석의 인상적인 증거입니다. Claude가 현재의 암호화 통신을 해제할 수 있다는 증거는 아닙니다.
AI 암호해석은 병목을 인간 검토로 옮긴다
즉각적인 압력은 이전보다 더 빠르게 기계 생성 결과를 검증해야 하는 검토자, 표준화 기구, 보안 팀에 가해집니다.
전통적인 암호학 검토는 비교적 작은 전문가 공동체에 의존합니다. 연구자들은 구조를 발표하고, 증명을 분석하며, 구현을 시험하고, 수년에 걸쳐 보안 가정에 이의를 제기합니다.
최전선 모델은 시도되는 공격의 수를 늘릴 수 있습니다. 방대한 문헌을 읽고 통상적인 근무 시간 제약 없이 계산 실험을 수행할 수 있습니다.
이러한 확장은 모델이 채택 전에 후보 표준을 검토할 때 방어자에게 유리합니다. 알고리즘을 변경하기 쉬운 시점에 더 많은 검토가 약한 가정을 드러낼 수 있습니다.
같은 역량은 배포 후에는 위험을 만듭니다. 널리 사용되는 기본 암호 요소에 대한 유효한 공격은 신중한 공개, 신속한 검증, 조율된 패치, 명확한 대외 커뮤니케이션을 필요로 합니다.
Anthropic은 공개 전에 학계, 정부 관계자, 산업 파트너, HAWK 저자들과 협의했다고 말합니다. 이 과정은 AI 생성 암호학 결과를 다루는 초기 모델을 제시합니다.
하지만 검증에는 여전히 전문가의 주의가 많이 필요합니다. Anthropic의 AES 사례는 모델의 발견 시간보다 훨씬 더 많은 인간 검증 시간을 요구했습니다.
전문가 공동체보다 모델 출력이 더 빠르게 늘어난다면 이 비대칭은 악화될 것입니다. 연구자들은 각각을 검토할 시간이 부족한 상황에서 기술적으로 그럴듯한 공격 수백 건을 받을 수 있습니다.
주장이 실행 가능한 키 복구로 이어질 때는 자동 검사가 도움이 될 수 있습니다. HAWK 테스트 키는 생성하고, 공격하고, 알려진 정답과 비교할 수 있습니다.
증명 중심의 발견은 더 어렵습니다. 미묘한 이론적 공격은 테스트 코드가 완전히 포착할 수 없는 가정에 의존할 수 있습니다.
따라서 암호학 표준화 기구에는 새로운 제출 규칙이 필요합니다. 기계 보조 작업에는 재현 가능한 코드, 완전한 복잡도 추정치, 가정, 실패 사례, 상세한 출처 이력이 포함되어야 합니다.
같은 요구 사항은 기업 내부에도 적용됩니다. 보안 책임자는 모델이 설득력 있는 익스플로잇도 생성했다는 이유만으로 AI 생성 수정안을 배포해서는 안 됩니다.
발견과 검증을 분리해야 합니다. 서로 다른 검토자, 도구, 모델 실행이 각 주장을 반증하려 시도해야 합니다.
NIST 표준화 절차는 이미 이 구조의 일부를 제공합니다. 후보 제출물은 표준화 전 공개 검토를 받으므로, 배포된 사용자를 노출하지 않고도 약점이 드러날 수 있습니다.
AI는 검토량을 늘릴 수 있지만 거버넌스의 필요성을 없앨 수는 없습니다. 공격을 찾는 시스템은 접근 통제와 신중한 공개가 필요한 민감한 정보도 만들어 냅니다.
anthropic google 경쟁은 주목할 만한 유인을 더합니다. 연구소는 자사 모델이 전문가 수준의 발견을 할 수 있는 것처럼 보일 때 이득을 얻습니다.
이러한 유인은 논문과 재현 가능한 산출물을 포함한 유익한 투명성을 장려할 수 있습니다. 또한 독립 검토가 합의에 이르기 전에 극적인 공개 프레이밍을 보상할 수도 있습니다.
그러므로 독자는 세 층위의 증거를 구분해야 합니다. 첫째는 모델이 무엇을 했는지에 대한 회사의 설명입니다.
둘째는 다른 연구자들이 시험할 수 있는 재현 가능한 기술 자료입니다. 셋째는 새로움, 정확성, 영향에 대한 독립적 확인입니다.
Anthropic은 보도자료 이상의 자료를 제공했습니다. 기술 논문, HAWK용 시연 코드, AES 추론 과정을 다시 작성한 기록을 공개했습니다.
이 증거는 주장을 검증 가능하게 만듭니다. 그렇다고 비판적 검토가 선택 사항이 되는 것은 아닙니다.
Claude 보안 테스트 이후 주목할 세 가지 신호
다음 단계는 이것이 고립된 성공인지, 재현 가능한 연구 방법인지, 혹은 검증 위기의 시작인지를 드러낼 것입니다.
첫 번째 신호는 NIST 절차에서 HAWK의 지위입니다. 검토자들은 더 큰 파라미터가 제안의 경쟁력을 유지하기에 충분한 효율성과 보안을 보존하는지 결정해야 합니다.
HAWK가 성공적으로 수정된다면 Claude의 작업은 생산적인 배포 전 검토로 보일 것입니다. 후보가 철회된다면, 이 발견은 실제 표준화 결정을 바꾼 것이 됩니다.
어느 결과든 AI 보조 테스트의 가치를 강화합니다. 탈락이 포스트양자 암호 전반의 실패를 뜻하지는 않습니다.
두 번째 신호는 AES 분석의 독립 재현입니다. 연구자들은 Möbius Bridge 방법, 그 복잡도 추정치, 주장된 속도 우위를 검증해야 합니다.
재현에 성공하면 Claude의 결과는 오랜 암호해석 연구 계보를 실질적으로 확장한 것으로 자리매김할 것입니다. 상당한 수정이 필요하다면 자율적 전문가 수준 성능에 대한 주장은 약화될 것입니다.
세 번째 신호는 향후 벤치마크 버전에서의 성능입니다. CryptanalysisBench는 블록 암호, 해시 함수, 기타 기본 요소 전반에서 공통 시험을 제공합니다.
연구자들은 Claude, Gemini, GPT, 오픈 웨이트 모델이 오염 없이 알려진 공격을 재현하는지 지켜봐야 합니다. 새로운 결과 역시 전문가 검토를 견뎌야 합니다.
일관된 개선은 anthropic google 경쟁을 과학 연구 시스템을 위한 군비 경쟁으로 바꿀 것입니다. 불규칙한 결과는 모델 브랜드보다 스캐폴딩과 연구자 판단이 여전히 더 결정적임을 시사할 것입니다.
보안 팀은 이 발표 때문에 운영 암호화를 교체할 필요가 없습니다. 대신 검토와 공개 절차가 더 많은 기계 생성 발견을 수용할 수 있는지 점검해야 합니다.
이 준비에는 실험 로그 보존, 발견과 승인 분리, 긴급 주장이 도착하기 전 전문가 식별이 포함됩니다. 또한 압축된 헤드라인에 반응하기보다 표준화 지침을 추적하는 일도 포함됩니다.
보도된 4시간 미만의 성과가 이 이야기의 지속적인 버전이 되어서는 안 됩니다. 검증된 HAWK 프로젝트는 약 60시간이 걸렸으며, 그 대상은 배포되지 않았습니다.
Claude의 실제 성취는 과장된 주장보다 더 유용합니다. 어려운 수학적 공간을 탐색해 검증 가능한 약점을 찾았고, 인간이 암호학 검토의 속도를 재고하게 만들었습니다.
그것은 모든 보안 및 연구 조직에 하나의 실질적인 질문을 남깁니다. 다음 AI 생성 공격이 배포된 시스템에 영향을 미친다면, 헤드라인이 증거를 앞지르기 전에 누가 이를 검증할 것인가?


