Astra Enigma 해독이 Claude Opus에 두 번째 목표를 안겼다
OpenAI의 GPT-6 Astra는 2005년부터 연구자들의 해독을 피해 온 82자 Enigma 메시지를 이틀간의 작업 끝에 복원했다. Astra Enigma 해독 결과가 나온 지 6일 뒤, Anthropic의 Claude Opus 5를 활용한 또 다른 해독도 성공했다. 두 프로젝트는 역사적 암호해독을 최첨단 AI 에이전트의 역량을 검증하는 이례적으로 구체적인 시험대로 만들었다.
이것은 챗봇이 읽을 수 있는 독일어를 추측해 낸 이야기가 아니다. 두 프로젝트 모두 기록 자료, 실행 가능한 소프트웨어, 암호학적 탐색, 그리고 모델 자체의 결론을 넘어선 검증을 결합했다. 중요한 점은 그 연구 순환 과정 중 얼마나 많은 부분을 AI가 수행할 수 있었는지에 있다.
두 시스템은 서로 다른 방식으로 답에 도달했다. Astra는 연구자 주도의 조사 속에서 목표를 선정하고 도구의 상당 부분을 개발했다. Claude는 준비된 작업 환경, 역사 자료, 그리고 더 강한 인간의 지침을 받았다. 이 차이 때문에 Astra와 Claude Opus의 비교는 벤치마크 경쟁이라기보다 두 연구 워크플로의 사례 연구에 가깝다.
Astra Enigma 해독은 2005년부터 풀리지 않던 메시지를 복원했다
핵심 변화는 Enigma가 다시 해독됐다는 사실이 아니라, AI 보조 조사가 현대 연구자들이 이전에는 복원하지 못했던 특정 메시지를 해결했다는 점이다.
MVUEH로 식별된 이 메시지는 1941년 7월 10일 발신됐다. 전술 호출부호 2ny를 사용한 독일 육군 무선국이 이를 SS-토텐코프 사단의 병참 무선국으로 전송했다. 수신국은 오후 5시 30분에 이를 메시지 번호 172로 기록했다.
역사 암호해독가들은 이미 Enigma의 기계 구조와 일반적인 약점을 이해하고 있었다. 그러나 남아 있는 단일 메시지를 해독하려면 정확한 기계 설정, 정확한 암호문, 그리고 누락된 평문에 관한 유용한 단서가 여전히 필요하다.
MVUEH는 세 측면 모두에서 문제를 안고 있었다. 암호화된 글자가 82자에 불과해 통계 분석에 쓸 텍스트가 제한적이었다. 남아 있는 사본에는 불확실하거나 잘못 전사된 문자도 포함돼 있었다.
기계 설정은 같은 날짜에 사용된 다른 알려진 키와 달랐다. 로터 순서는 253이었으며, 관련 키 두 개는 순서 512를 사용했다. 72번째 글자에서 왼쪽 로터가 드물게 회전한 점도 또 다른 복잡성을 더했다.
개발자 Carter Leffen은 Crypto Cellar Research가 공개한 미해독 메시지를 GPT-6 Astra에 검토하게 하며 조사를 시작했다. Astra는 MVUEH를 가장 유망한 목표로 선정했다. 이어 평문이 이미 복원된 또 다른 전문 SIPVX와 이 메시지를 연결했다.
그 관련 메시지에는 ROSENOWROSENOW라는 지명이 반복해서 등장했다. 조사는 이 14자를 crib, 즉 가능한 Enigma 설정에 대입해 검증하는 추정 평문 조각으로 활용했다.
crib가 답을 직접 드러내는 것은 아니다. 이는 추정 구절을 만들어 낼 수 없는 설정을 제거해 탐색 범위를 좁힌다. 남은 글자들은 하나의 일관된 기계 키 아래에서 여전히 의미 있는 텍스트를 구성해야 한다.
공개된 MVUEH 사례 연구에 따르면, 조사는 키를 복원하기 전에 암호문의 불확실한 위치 12곳을 기록했다. 이 대안들은 13,824개의 허용 가능한 판독을 만들었다.
이 순서가 중요하다. 답을 보기 전에 불확실성을 기록하면, 선호하는 결과에 맞을 때까지 불명확한 필체를 재해석하고 싶은 유혹을 줄일 수 있다.
Astra와 전문 에이전트들은 자료를 검토하고, 탐색 프로그램을 구축하며, 실험을 실행하고, 중간 결과에 이의를 제기했다. 조사는 Python과 C++로 Enigma 시뮬레이션 및 Bombe 방식 탐색 소프트웨어를 개발했다.
그 결과의 키는 재구성된 본문 82자 전체를 해독했다. 또한 최종 평문을 선택하는 데 사용되지 않았던 독립 기록 메시지 헤더와도 일치했다.
복원된 독일어 텍스트는 대략 행군 경로를 요청하고, 발신자의 위치가 Rosenow임을 알리며, 즉각적인 무선 응답을 요청하는 내용이다. 추정 서명은 Waschbusch이지만, 이 판독은 아직 잠정적이다.
이 결과는 2026년 9월 15일 역사 암호학 연구자 Frode Weierud에게 보고됐다. Weierud는 키와 평문을 검토한 뒤 해답이 정확하다고 결론지었다.
상세한 암호해독 검토는 이 작업이 이전 전사의 오류도 드러냈다고 지적한다. 또한 이 메시지가 7월 10일의 다른 알려진 통신과 완전히 다른 키를 사용했음을 확인했다.
따라서 이 프로젝트는 그럴듯한 독일어를 생성하는 데 그치지 않았다. 암호문, 독립 헤더, 관련 통신, Enigma 시뮬레이터의 동작을 모두 설명하는 설정을 찾아냈다.
이러한 결합이 바로 이 결과가 주목받을 만한 이유다. 언어 모델은 역사적 메시지를 복원하지 않고도 설득력 있는 텍스트를 생성할 수 있다. 여기서는 실행 가능한 증거와 문서 증거가 그러한 경향에 경계를 설정했다.
진짜 성과는 운 좋은 평문이 아니라 연구 순환 과정이었다
Astra의 가장 강력한 기여는 연구자들이 보통 별도 도구와 반복적인 수동 인계로 수행하는 여러 형태의 작업을 조율한 데 있다.
조사는 좁게 규정된 해독 요청이 아니라 목표 선정으로 시작됐다. Astra는 미해결 메시지 모음을 검토하고, 관련 자료가 결과를 검증할 여러 독립적인 방법을 제공한다는 이유로 MVUEH를 선택했다.
공개된 수신 전사본과 희미한 발신 사본을 비교했다. 인접 통신과 알려진 일일 키도 조사했다. 또한 명시적 제약 조건 아래에서 기계 설정을 시험할 수 있는 소프트웨어 구축에도 기여했다.
이 순서는 일반적인 질의응답보다 전문 연구에 가깝다. 모델은 불완전한 문서, 역사적 가설, 코드, 실패한 탐색, 검증 사이를 오가야 했다.
여러 초기 접근법은 실패했다. 같은 날의 알려진 키로는 메시지가 해독되지 않았다. 케이블 설정 가설은 승인할 만한 결과를 내놓지 못했고, 초기 hill-climbing 탐색은 통제된 조건에서도 성능이 좋지 않았다.
이러한 실패는 조사 과정에서 가정을 다시 검토하게 만들었다. 반복된 Rosenow 구절은 결국 MVUEH를 이미 해독된 관련 메시지와 연결했기 때문에 더 강력한 경로를 제공했다.
최종 분석은 14자 crib에만 의존하지 않았다. 주변의 68자는 제약을 받지 않은 상태였으며, 일관된 결과를 만들어 내야 했다. 이후 기록된 헤더는 복원된 설정을 별도로 시험하는 수단이 됐다.
연구자들은 그 헤더를 기준으로 14,829,646개의 물리적 키 조합을 독립적으로 확인했다. 그중 923개만 호환성을 유지했으며, 전체 판독 검토가 필요했다.
별도 구현에서도 메시지와 헤더 결과가 재현됐다. 기계 제약을 형식 논리 문제로 표현하는 독립적인 만족성 모델 역시 표본 추출된 42개 상태 전반에서 일치했다.
재암호화는 또 하나의 필수 검증을 제공했다. 복원된 설정은 제안된 평문을 재구성된 암호문으로 다시 변환했다.
이 검사는 내부 일관성을 확인하지만, 그 자체로 역사적 해석을 확립하지는 않는다. 잘못된 전사나 부적절하게 선택된 crib는 일관된 계산도 오도할 수 있다.
조사는 재암호화를 헤더, 관련 메시지, 사전에 선언된 출처 대안, 외부 검토와 결합해 주장의 강도를 높였다. 특히 서명을 둘러싼 편집상 불확실성은 여전히 남아 있어, 이 증거가 모든 불확실성을 제거하는 것은 아니다.
첫 번째 독립 검토에도 한계는 있었다. SWARM은 다른 시뮬레이터를 사용해 예상 본문과 헤더 결과를 재현했지만, 전체 탐색을 반복하지는 않았다. 따라서 복원된 설정은 확인했지만, 이를 독립적으로 다시 발견한 것은 아니다.
이 구분은 Astra가 Enigma를 해독한 방식을 이해하는 데 핵심적이다. 여러 AI 에이전트가 서로 일치한다고 해서 독립적인 확인으로 간주할 수는 없다. 이들은 동일한 잘못된 출처, 가정 또는 소프트웨어 결함을 물려받을 수 있다.
의미 있는 검증은 대화 바깥의 증거에서 나왔다. 여기에는 메시지 양식, 독립적으로 기록된 헤더 데이터, 별도 구현, 역사적 통신, 숙련된 암호해독가의 검토가 포함됐다.
이 워크플로는 암호학을 넘어 AI 보조 연구에 유용한 모델을 제시한다. 에이전트는 문서를 탐색하고, 분석 코드를 작성하며, 설명을 제안할 수 있다. 그러나 그 결론이 신뢰를 얻으려면 외부 증거가 그럴듯한 오류를 배제할 수 있어야 한다.
좋은 지식 관리가 기술적 엄밀성의 일부가 되는 지점도 여기다. 연구자에게는 출처 문서, 가정, 실험, 수정 이력 사이의 추적 가능한 연결이 필요하다.
구조화된 AI knowledge base는 이러한 연결을 보존할 수 있다. 암호를 검증할 수는 없지만, 인간 검토자가 증거 사슬을 계속 확인할 수 있게 한다.
Claude Opus는 다른 유형의 Enigma 해독으로 뒤를 이었다
Claude Opus 5는 또 다른 유효한 결과에 도달했지만, 더 강한 인간의 지침이 목표와 탐색 전략 모두를 형성했다.
9월 20일, 사이버보안 연구자 Jack Willis는 또 다른 메시지 FMNGI의 키를 복원했다. 그는 MVUEH 해법이 검증을 위해 제출된 지 6일 뒤인 다음 날 Weierud에게 이를 알렸다.
FMNGI는 1941년 7월 31일자 수신 메시지였다. SS-토텐코프 사단의 병참 무선국이 이를 수신했고, 메시지 번호 285로 기록했다.
Willis는 Go로 작성된 암호해독 작업 환경과 관련 역사 자료를 Claude Opus 5에 제공했다. 이 구성은 Astra가 받은 환경보다 더 좁고 잘 준비된 환경을 모델에 제공했다.
결정적 단서는 관련 통신에서 나왔다. Friedrich Hartjenstein과 연관된 끝맺음 서명은 14자 crib XHARTJENSTEINX를 제공했다.
역사 암호해독가들은 이전에 Hartjenstein 서명의 여러 형태를 기록해 두었다. 이 때문에 그의 이름은 출력 결과를 본 뒤 만들어 낸 구절이 아니라, 기대할 수 있는 평문의 신뢰할 만한 출처가 됐다.
Claude는 제공된 작업 환경과 자료를 활용해 메시지를 조사했다. FMNGI 기술 보고서에 따르면, 최종 키 탐색에는 Apple M2 컴퓨터에서 13분 28초가 걸렸다.
복원된 평문에는 독일어로 종대를 뜻하는 단어의 오류가 포함돼 있었다. Weierud는 이 오류가 암호화, 전사 또는 Morse 전송 중 발생했을 수 있다고 설명했다.
이 불완전성은 중요한 점을 강화한다. 역사적 메시지는 깨끗한 벤치마크 입력값이 아니다. 운용자, 무선 환경, 필체, 이후의 전사는 모두 노이즈를 유입할 수 있다.
두 번째 기록 사본은 특히 유용했다. Weierud는 2026년 7월 독일 Bundesarchiv에서 보급 부서 통신 자료 모음을 발견했다.
메시지 번호 205 NF와 연관된 사본은 이전에 공개된 번호 285 버전보다 더 정확한 암호문을 보존하고 있었다. 또한 Hartjenstein과의 연관성도 뒷받침했다.
이용 가능한 평문 모음은 더 직접적인 해법을 가능하게 했을 수도 있다. 그러나 Willis는 해독을 시작했을 당시 이 완전한 평문을 가지고 있지 않았다.
대신 Claude 보조 탐색은 장교의 서명을 crib로 활용했다. 이로 인해 더 넓은 메시지 본문은 복원된 키를 검증하는 역할을 하게 됐다.
이 방법은 과정 초반에 더 많은 인간 전문성을 배치했다. Willis는 자원을 선택하고, 작업 환경을 제공했으며, 역사적으로 뒷받침되는 단서를 향해 조사를 이끌었다.
Astra의 프로젝트는 목표 선정과 도구 개발을 더 많이 위임했다. 연구자는 여전히 목표를 설정하고, 진행 상황을 평가하며, 작업을 추진했지만 모델은 더 넓은 문제 공간을 탐색했다.
그 차이는 단순한 Astra 대 Claude Opus의 점수 비교보다 더 중요하다. 한 워크플로는 더 폭넓은 연구 자율성을 시험했다. 다른 워크플로는 전문가, 유능한 모델, 준비된 기술 인프라 사이의 집중적인 협업을 시험했다.
두 경우 모두 유용한 결과를 냈다. 어느 쪽도 모델이 암호분석가, 기록보관인, 소프트웨어 엔지니어, 역사 검토자를 독립적으로 대체할 수 있음을 보여주지는 않는다.
대신 인간 연구자가 목표를 통제하고 검증 가능한 증거를 요구할 때, 최전선 모델이 그러한 역할들을 효과적으로 넘나들 수 있음을 보여준다.
튜링의 또 다른 시험은 모방이 아니라 증거다
역사적 대칭성은 매력적이지만, 이 프로젝트들이 최전선 모델이 전시 Enigma 해독이라는 성취를 재현했음을 입증하지는 않는다.
Alan Turing은 훗날 튜링 테스트로 불리게 된 모방 게임과 밀접하게 연관돼 있다. 이는 글을 통한 상호작용으로 기계가 사람과 구별되지 않게 할 수 있는지를 묻는다.
그의 전시 업무는 다른 문제를 다뤘다. Turing, Gordon Welchman, 폴란드 암호분석가들, 운용 인력, 엔지니어들, 그리고 수천 명의 Bletchley Park 직원은 계속 변하는 독일 암호 체계를 중심으로 정보 시스템을 구축했다.
현대의 설명은 종종 이 집단적 노력을 한 명의 천재와 한 대의 기계로 압축한다. 실제 작전은 감청된 통신, 절차상의 실수, 노획 자료, 통계적 추론, 전기기계식 Bombe, 그리고 지속적인 인간 판단을 결합했다.
영국의 Bombe는 크립에서 도출된 논리적 모순을 이용해 가능한 Enigma 설정을 탐색하는 데 도움을 줬다. 단순히 암호문을 받아 읽을 수 있는 답을 출력한 것은 아니었다.
최근 프로젝트들은 익숙한 챗봇 서사보다 이 오래된 패턴을 더 밀접하게 따른다. 인간은 역사 자료와 연구 목표를 제공했다. 모델은 단서를 정리하고, 도구를 작성하며, 가능성을 탐색했다. 외부 증거가 그 답이 살아남을지를 결정했다.
하지만 이 결과를 Turing의 전시 업무와 동등하다고 부르는 것은 두 역사를 모두 왜곡한다. 원래의 암호분석가들은 절차와 키가 지속적으로 바뀌는 능동적 적과 맞섰다.
Astra와 Claude는 Enigma의 설계가 수십 년간 이해된 뒤 보존된 메시지를 다뤘다. 이들은 공개된 키, 알려진 통신 기록, 현대 컴퓨터, 기록 보관소의 발견, 확립된 암호분석 기법을 활용할 수 있었다.
책임 있는 주장은 더 제한적이다. 최전선 AI는 정확한 설정이 이전의 시도들에 저항해 온 개별 메시지 두 건을 복원하는 데 도움을 줬다.
Leffen의 프로젝트 자체도 Enigma를 처음으로 해독했다고 주장하는 것은 아니라고 명시한다. 이 단서는 모든 재서술에 계속 붙어 있어야 한다.
그럼에도 헤드라인의 비유는 실제 무언가를 포착한다. 이 모델들은 설득력 있는 언어만으로는 충분하지 않은 과제에 직면했다. 다른 사람이 실행하고 검토할 수 있는 산출물을 만들어야 했다.
이는 일반적인 벤치마크보다 더 까다로운 평가다. 벤치마크는 대개 모델이 시작하기 전에 질문, 채점 기준, 기대 답안을 고정한다.
기록 보관소 기반 암호분석에는 그런 명확한 경계가 없다. 원본에는 오류가 있을 수 있다. 가장 유용한 단서는 다른 컬렉션에 있을 수 있다. 그럴듯한 답도 여러 무관한 이유로 틀릴 수 있다.
따라서 성공은 불확실성을 조용히 다시 쓰지 않고 헤쳐 나가는 데 달려 있다. 모델은 언제 검색하고, 코드를 작성하고, 기록을 비교하고, 전사를 의심하고, 외부 검증을 요청해야 하는지 알아야 한다.
이것이 튜링의 또 다른 시험이 가진 더 유용한 의미다. 이는 AI 시스템이 전문가처럼 들리는지가 아니라, 엄격한 탐구의 연쇄에 참여할 수 있는지를 측정한다.
전시 기록 역시 암호 해독을 고독한 천재성으로 다루는 데 주의를 촉구한다. 효과적인 암호분석은 언제나 인간의 통찰, 기계, 절차, 제도적 지식을 결합해 왔다.
2026년의 결과는 그 협업 속 기계를 업데이트한다. 협업 자체를 없애지는 않는다.
Astra와 Opus의 결과가 입증하지 않는 것
성공 사례 두 건만으로는 일반적 신뢰성, 완전한 자율성, 또는 현대 암호를 광범위하게 무력화할 새로운 능력을 입증할 수 없다.
Enigma는 역사적으로 중요하지만, 현재 암호 보안을 대표하지는 않는다. 현대 암호화는 서로 다른 수학적 구성, 구현, 위협 모델에 의존한다.
따라서 이 메시지 복원 사례는 최전선 모델이 올바르게 배포된 현대 암호화를 해독할 수 있는지에 대해 거의 말해주지 않는다. 암호화된 현대 통신이 갑자기 노출됐다는 증거로 제시되어서는 안 된다.
사례들은 또한 광범위한 기존 인간 작업의 혜택을 받았다. Crypto Cellar Research는 메시지 코퍼스를 유지하고, 미해결 사례를 문서화하고, 키를 보존하며, 관련 통신을 연결했다.
연구자들은 이미 인접한 메시지를 복원하고 반복되는 서명을 연구했다. 새로운 Bundesarchiv 발견은 AI 지원 공격 직전에 중복 암호문과 맥락적 증거를 추가했다.
Astra는 SIPVX에서 반복된 Rosenow 문구라는 유용한 단서를 얻었다. Claude는 Hartjenstein의 서명, 준비된 역사 자료, 작동하는 암호분석 환경을 제공받았다.
이러한 이점이 결과를 사소하게 만들지는 않는다. 이는 시스템이 실제로 완료한 과제를 규정한다.
가장 강력한 해석은 연구 압축에 관한 것이다. 보도에 따르면 Astra는 Weierud가 인간 연구자에게 수주 또는 수개월이 걸릴 수 있다고 본 작업을 이틀 만에 완료했다.
이 비교는 통제된 생산성 연구가 아니라 경험 많은 참가자의 견해에서 나온 것이다. 보편적 측정치가 아니라 정보에 근거한 판단으로 다뤄야 한다.
Astra 조사에서 자율적으로 수행된 부분도 추가 검토가 필요하다. 그 로그에는 Crypto Cellar 웹사이트에서 이용할 수 없었던 정확한 Bundesarchiv 파일 식별자가 언급됐다.
Weierud는 모델이 해당 참조를 어떻게 찾았는지 확신하지 못한다고 보고했다. 다른 온라인 위치에 나타났거나, 접근 가능한 카탈로그 기록에서 왔거나, 다른 경로를 통해 모델에 들어갔을 수 있다.
신비한 설명을 꾸며낼 필요는 없다. 적절한 대응은 로그를 보존하고, 검색 경로를 식별하며, 출처 발견과 뒷받침되지 않는 추론을 구분하는 것이다.
이 사례는 오염 문제도 제기한다. 관련 자료가 이미 학습 데이터나 검색 환경에 존재할 때 모델은 독립적으로 추론하는 것처럼 보일 수 있다.
MVUEH는 조사가 시작될 당시에도 미해결로 등재돼 있었다. 하지만 연구자들은 일반적 추론에 공을 돌리기 전에 접근 가능한 모든 출처를 여전히 문서화해야 한다.
재현성 역시 아직 완전하지 않다. 최종 검증기를 다시 실행하는 일은 전체 발견 과정을 반복하는 것보다 쉽다.
완전한 재현은 동일한 공개 코퍼스에서 시작해 동일한 출처 불확실성을 보존하고, 발견된 크립 배치를 재사용하지 않은 채 독립적으로 키를 복원해야 한다.
FMNGI에도 관련된 한계가 있다. 연구자가 작업 환경과 강력한 서명 단서를 제공한 뒤 Claude의 탐색은 빨랐다. 13분의 실행 시간은 그 단서를 식별하는 데 필요한 기록 보관 작업을 측정하지 않는다.
이러한 주의사항이 성취를 지우지는 않는다. 자율 과학에 관한 주장이 성공적인 역사 조사에 관한 주장보다 더 엄격한 증거를 필요로 하는 이유를 보여준다.
가장 방어 가능한 결론은 구체적이다. 연구자 주도의 두 프로젝트는 최전선 모델을 사용해 서로 다른 미해결 Enigma 메시지를 해결했으며, 경험 많은 외부 전문가는 두 키를 모두 받아들였다.
그보다 폭넓은 주장은 여전히 열린 연구 질문이다.
이것이 반복 가능한 방법이 되는지를 보여줄 세 가지 신호
다음 시험은 다른 연구자들이 워크플로를 재현하고, 더 어려운 메시지를 풀며, 모든 결정에 대한 검증 가능한 기록을 보존할 수 있는지다.
첫 번째 신호는 MVUEH의 독립적인 엔드투엔드 재현이다. 새로운 팀은 해결 전 코퍼스와 문서화된 출처 대안에서 시작해야 한다.
그 팀이 공개된 해결책을 들여오지 않고 같은 키를 복원한다면, 재사용 가능한 AI 연구 방법이라는 주장은 더 강해진다. 재현에 공개되지 않은 단서가 필요하다면 자율성 주장은 약해진다.
두 번째 신호는 남은 코퍼스에서의 진전이다. Crypto Cellar Research는 컬렉션에 약 1,000개의 Enigma 및 Truppenschlüssel 메시지가 포함돼 있다고 보고한다.
9월의 두 해독 이후에도 Enigma 메시지 7건은 미해결로 남아 있다. 또 다른 퍼즐인 WEUWY 번호 138은 병렬 메시지에서 온 알려진 평문이 있지만, 여전히 원래 키가 없다.
이 대상들은 동등하지 않다. 일부는 남아 있는 암호문에 오류가 너무 많거나, 메시지가 너무 짧거나, 유용한 크립이 없어서 미해결일 수 있다.
연구자들이 실패한 접근법, 출처 불확실성, 코드, 검증 자료를 공개한다면 추가 성공은 가장 큰 의미를 갖는다. 평문만으로는 훨씬 약한 증거가 된다.
세 번째 신호는 역사 암호분석 외부에서의 채택이다. 핵심 워크플로는 소프트웨어 고고학, 과학 문헌 검토, 문서 포렌식, 불완전한 기록을 다루는 기타 연구로 이전될 수 있다.
모델은 관련 증거를 찾고, 도구를 작성하고, 경쟁하는 설명을 시험하며, 검토를 위해 자신의 가정을 드러내야 한다. 또한 매끄러운 사후 서사를 제시하는 대신 부정적 결과도 보존해야 한다.
이 마지막 요건은 기업과 지식 근로자에게 중요하다. 많은 AI 시스템이 이제 문서를 설득력 있게 요약하지만, 출처에서 결론까지 추적 가능한 연쇄를 유지하는 시스템은 더 적다.
Astra Enigma 암호 해독 프로젝트는 더 나은 기준을 제시한다. 모델은 검토 가능한 중간 산출물을 생성해야 하며, 독립적 증거는 답을 뒤집을 수 있는 힘을 유지해야 한다.
개발자들은 모델 제공업체가 그러한 워크플로를 더 쉽게 감사할 수 있게 만드는지 지켜봐야 한다. 유용한 기능에는 지속적인 연구 로그, 출처 수준 인용, 재현 가능한 도구 실행, 검색된 사실과 모델 추론 사이의 명확한 구분이 포함된다.
연구자들은 누가 목표 선택을 통제하는지도 물어야 한다. Astra의 상대적 자유는 더 폭넓은 역량을 드러내는 데 도움이 됐지만, 자율성은 숨은 가정과 무관한 탐색의 범위도 넓힌다.
Claude의 제약된 환경은 그러한 자유를 줄이는 대신 과정을 더 쉽게 해석하게 했다. 어느 구성도 자동으로 우월하지는 않다.
올바른 설계는 오류의 비용과 외부 검증의 가용성에 달려 있다. 개방형 발견에는 탐색이 유리한 반면, 고위험 결론에는 더 엄격한 검토 관문이 필요하다.
이 사례들은 독자에게 실용적인 질문을 남긴다. AI 시스템은 단지 답을 만들어낼 수 있는가, 아니면 회의적인 전문가가 시험할 수 있는 기록을 구축하는 데 도움을 줄 수 있는가?
Astra와 Claude Opus의 경우, 오래된 Enigma 메시지 두 건은 고무적인 증거를 제공했다. 다음 프로젝트들은 이 방법이 새로운 연구자, 새로운 기록 보관소, 알려진 해법이 없는 대상에서도 살아남는지를 보여줘야 한다.



