Anthropic·Google 연구 경쟁, OpenAI의 10개 증명 주장과 맞붙다
- Sophie Larsen

- 8월 2일
- 13분 분량
OpenAI가 Astra라는 미공개 모델이 생성했다는 수학 및 이론 컴퓨터 과학 분야의 10개 성과를 내세우며 Anthropic·Google 연구 경쟁에 뛰어들었다.
회사는 이것이 벤치마크 과제나 익숙한 올림피아드 문제가 아니라고 말한다. 각 문제는 핵심 결과 측면에서 최소 10년간 진전 없이 미해결 상태로 남아 있었다. 일부는 그보다 훨씬 오랫동안 수학자들의 도전을 버텨 왔다.
이런 차이는 이번 발표를 또 하나의 모델 점수 발표보다 더 중대한 사안으로 만든다. OpenAI는 하나의 시스템이 10개 전문 분야에서 독창적인 논증을 만들어 내고, 이를 기계 검증 가능한 Lean 4 인증서로 변환했다고 주장하고 있다.
시점도 중요하다. Anthropic은 최근 Claude Mythos Preview가 암호학적 구조를 겨냥한 새로운 공격을 찾아냈다고 설명했다. Google DeepMind는 수년간 올림피아드 증명에서 수학 연구용 도구로 나아가기 위해 노력해 왔다.
이제 OpenAI는 세 곳 중 가장 광범위한 연구 주장을 내놓고 있다. Astra가 기하학, 부호 이론, 군론, 양자 복잡도, 암호학, 조합론에 걸친 결과를 생성했다고 말한다.
다만 이 발표는 핵심적인 간극도 드러낸다. Lean 인증서는 형식 명제가 인코딩된 가정으로부터 따라 나오는지 검증할 수 있다. 그러나 해당 명제가 의도된 모든 정리, 역사적 의존성, 분야별 미묘한 맥락을 포착하는지는 확립할 수 없다.
따라서 10개 결과는 검토 절차의 끝이 아니라 시작점이다. 수학자들은 원고, 정의, 독창성 주장, 선행 연구와의 관계를 살펴봐야 한다.
그 부담은 상당하다. 몇몇 결과라도 전문가 심사를 통과한다면 Anthropic·Google 경쟁은 더 이상 코딩, 벤치마크, 과학 지원에만 집중되지 않을 것이다. 새로운 연구의 생산까지 포함하게 된다.
OpenAI, Astra가 장기간 정체됐던 10개 결과를 냈다고 주장
OpenAI의 핵심 주장은 Astra가 주어진 문제를 푸는 수준을 넘어 출판 가능한 수학 연구를 생성했다는 것이다.
회사는 2026년 8월 1일 이 연구를 발표했다. 함께 공개한 연구 논문은 순수수학과 이론 컴퓨터 과학에 걸친 10개 문제를 다룬다.
OpenAI는 Astra의 내부 버전이 수학적 논증을 찾아냈다고 말한다. 이후 인간 연구자들이 같은 모델의 도움을 받아 이 논증들을 원고로 정리했다.
Astra는 이어 각 결과를 Lean 4로 형식화했다. Lean은 형식 논증이 명시적으로 제시된 정의와 규칙을 따르는지 검사하는 증명 보조기다.
OpenAI는 공개 ten-proofs repository를 통해 이 인증서들을 공개했다. 이 저장소에는 주장된 각 결과에 대한 별도 Lean 파일과 mathlib으로 이를 빌드하는 방법이 포함돼 있다.
첫 번째 결과는 고차원 구 포장에 관한 것이다. 이 분야는 차원이 일반적인 기하학의 범위를 훨씬 넘어설 때 동일한 구를 얼마나 빽빽하게 배치할 수 있는지 묻는다.
OpenAI는 Cohn-Elkies 임계값에 도달하는 개선된 일반 상한을 제시했다고 주장한다. 논문은 이를 1978년 이후 일반 점근 구 포장 지수에 대한 첫 개선으로 설명한다.
두 번째 결과는 이진 및 구형 부호에 관한 것이다. 이러한 부호는 최소 분리 거리가 정보가 잡음을 얼마나 안정적으로 견딜 수 있는지를 결정하는 배열을 나타낸다.
Astra는 정해진 모든 최소 거리에서 이진 부호에 대해 지수적으로 더 강한 상한을 찾아냈다고 전해진다. 회사는 관련 구형 부호 상한이 새로운 구 포장 지수를 재현한다고 말한다.
세 번째 결과는 비소픽 군을 구성한다. 소픽 군은 유한 순열 구조를 통해 근사할 수 있으며, 수학자들은 모든 가산 군이 이 성질을 지니는지 오랫동안 물어 왔다.
주장된 구성은 이에 부정적으로 답한다. 받아들여진다면 군론, 동역학, 연산자 대수를 연결하는 핵심 질문을 해결하게 된다.
네 번째 결과는 Connes의 강직성 추측에 대한 반례를 제시한다. OpenAI는 Astra가 동일한 군 von Neumann 대수를 공유하는 무한히 많은 비동형 군을 구성했다고 말한다.
다섯 번째 결과는 산술 회로 복잡도를 겨냥한다. 이는 행렬식과 유사하지만 단순화에 쓰이는 부호가 없는 행렬 함수인 영구함수 계산에 대한 새로운 하한을 제시한다.
하한은 제한된 계산 시스템이 어떤 작업을 효율적으로 수행할 수 없는지를 식별하기 때문에 중요하다. 복잡도 이론에서 강력한 무조건적 결과는 여전히 유난히 어렵다.
여섯 번째 결과는 모든 유한 2인 양자 게임에 대해 지수적 병렬 반복이 성립한다고 주장한다. 병렬 반복은 게임을 반복해서 진행할 때 모든 사본에서 이길 확률이 어떻게 변하는지 연구한다.
일곱 번째는 최근접 벡터 문제를 다룬다. 이는 주어진 목표점에 가장 가까운 격자점을 찾는 문제로, 계산 복잡도와 격자 암호학의 일부를 뒷받침한다.
OpenAI는 유클리드 버전의 근사에 대해 다항식 인자 난이도를 보고했다. 논문은 복호화 및 관련 격자 문제에 대한 함의도 주장한다.
여덟 번째 결과는 Ehrhart의 부피 추측에 관한 것이다. 내부 격자점으로 오직 무게중심만을 포함하는 특정 볼록체의 정확한 최대 부피를 규명한다.
아홉 번째는 다색 삼각형 Ramsey 수에 대한 초지수적 하한을 제시한다. OpenAI는 이것이 Paul Erdős와 관련된 문제 모음의 183번 문제를 해결한다고 말한다.
마지막 결과는 두 개의 극값 그래프 이론 추측에 대한 반례를 제공한다. 이 구성들은 Erdős 문제 146번과 180번을 해결한다고 전해진다.
이 범위 자체가 주장의 일부다. Astra는 하나의 좁은 형식 체계나 단일 수학 분야에만 특화되지 않았다는 것이다.
OpenAI는 해당 문제들이 최소 10년간 핵심 결과 측면에서 진전을 보지 못했다고 말한다. 이 선정 기준은 진정한 연구와 일상적인 정리 완성을 구분하려는 시도다.
그럼에도 “핵심 결과에 진전이 없었다”는 표현은 신중히 해석해야 한다. 어떤 분야는 대표적인 질문을 해결하지 못한 채로도 기법, 부분 결과, 인접 영역의 통찰을 축적할 수 있다.
이러한 발전은 이후 해법에 필수적인 요소를 제공할 수 있다. 따라서 Astra의 기여를 확립하려면 최종 증명 항을 확인하는 것 이상이 필요하다.
모든 논증이 문헌과 어떤 관계를 맺는지 재구성해야 한다. 이 지점에서 발표는 엔지니어링 시연을 넘어 학술 검토로 옮겨간다.
Anthropic·Google 경쟁에 이제 독창적 연구가 포함되는 이유
경쟁의 목표는 어려운 질문에 답하는 데서 인간이 작성한 경로 없이 질문을 선정하고, 해결하고, 인증하는 것으로 옮겨갔다.
Google DeepMind는 중요한 초기 기준점을 마련했다. AlphaGeometry는 언어 모델과 기호 추론을 결합해 합성 훈련 데이터를 통해 어려운 기하학 문제를 풀었다.
이후 AlphaProof는 강화학습과 Lean을 사용해 국제수학올림피아드 문제에 도전했다. Google은 AlphaProof와 AlphaGeometry 2가 함께 2024년 대회에서 은메달 수준의 성과에 도달했다고 보고했다.
올림피아드 문제는 까다롭지만 알려진 해답과 신중히 제한된 명제를 갖고 있다. 공개 연구는 경로도 답도 알려져 있지 않다는 점에서 다른 도전을 제시한다.
Google은 이후 이보다 넓은 목표를 향해 나아가고 있다. AI for Math initiative는 연구자들을 Gemini Deep Think, AlphaEvolve, AlphaProof와 연결한다.
AlphaEvolve는 언어 모델과 자동 평가기를 결합해 알고리즘을 탐색한다. AlphaProof는 검사기가 명확한 정답 신호를 제공할 수 있는 형식 증명 완성에 초점을 둔다.
이제 Anthropic·Google 구도에는 연구 자동화의 세 번째 모델이 등장했다. OpenAI의 Astra 주장은 서로 무관한 전문 분야 전반에서 열린 형태의 논증 생성과 형식 인증을 결합한다.
Anthropic의 최근 암호학 연구가 가장 가까운 비교 대상이다. 회사는 Claude Mythos Preview가 면밀히 연구된 두 암호학적 구조에 대한 개선된 공격을 찾아냈다고 말한다.
하나는 포스트 양자 암호학에서 검토되는 디지털 서명 설계인 HAWK였다. Anthropic은 모델이 장기간 자율 작업 끝에 이전에 알려지지 않은 공격을 찾아냈다고 말한다.
다른 하나는 실사용 AES보다 변환 라운드 수가 적은 연구용 변형인 축소 라운드 AES였다. Mythos는 해당 변형에 대한 기존 공격을 가속한 것으로 전해진다.
Anthropic은 두 결과 모두 배포된 암호화를 깨지 않았다고 명시했다. 중요성은 현재 시스템을 훼손한 데 있지 않고, 모델이 새로운 암호해석 아이디어에 기여했다는 데 있다.
암호학 평가는 최전선 연구소들이 평가 방식을 어떻게 바꾸고 있는지도 보여 준다. 이들은 점점 미해결 상태이면서 전문적으로 의미 있는 과제에서 모델을 시험하고 있다.
전통적인 벤치마크는 문제가 훈련 데이터나 공개 해설 아카이브에 들어가면 정보력이 떨어진다. 공개 문제는 더 신선한 증거를 제공하지만, 표준화된 비교도 약화시킨다.
연구소는 문제를 선택하고, 계산 자원을 배분하며, 어떤 성공 사례를 공개할지 결정한다. 외부인은 시도한 문제 중 얼마나 많은 것이 유용한 결과를 내지 못했는지 거의 알 수 없다.
그 분모가 중요하다. 10번의 시도에서 10번 성공한 것과 훨씬 더 큰 탐색 뒤에 골라낸 10개의 성공 사례는 서로 다른 의미를 갖는다.
OpenAI는 성공 사례에 대한 상세 결과물을 공개했다. 그러나 Astra의 실패한 연구 시도나 더 넓은 선정 과정에 대한 완전한 설명은 제공하지 않았다.
이는 Astra, Mythos, Google 시스템 간의 직접 비교를 제한한다. 각 회사는 서로 다른 분야, 도구, 예산, 감독 방식, 성공의 정의를 사용한다.
그럼에도 이들의 방향은 일치한다. 최전선 연구소들은 연구 발견을 제품 역량이자 모델 평가 수단으로 다루고 있다.
그에 따른 압력은 세 회사를 넘어 확산된다. 전문 정리 증명 스타트업들은 자사 시스템이 더 나은 신뢰성, 접근성, 연구자 통제력을 제공하는지 보여줘야 한다.
대학들도 압박을 받는다. 민간 연구소 내부에서 나온 주장을 재현하려면 연구자들에게 충분한 접근 권한과 인프라가 필요하다.
출판사와 학회는 AI가 생성한 연구를 어떻게 심사할지 결정해야 한다. 전통적인 동료 심사는 인간 저자가 선택을 설명하고, 이의 제기에 답하며, 지적 책임을 질 수 있다고 가정한다.
OpenAI의 발표는 그 가정에 도전한다. 회사는 논증은 Astra가 만들었고 인간은 이를 정리하고 형식화했다고 말한다.
이런 공로 귀속은 이례적으로 직접적이다. 기계가 생성한 아이디어를 전적으로 인간의 작업으로 제시하지는 않지만, 책임을 모델과 운영자 사이에 분산시킨다.
경쟁의 질문은 더 이상 어느 시스템이 더 많은 답을 맞히는지가 아니다. 기계가 생성한 연구를, 신뢰성의 기준을 스스로 정의하는 공동체에 어느 조직이 더 설득력 있게 제시할 수 있는지가 핵심이다.
Lean 인증서는 검증을 바꾸지만 과학적 판단을 대체하지는 않는다
형식 검증은 오류가 발생할 여지를 좁히지만, 기업의 발표를 확정된 수학으로 바꾸지는 않는다.
전통적인 수학 증명은 전문가 독자를 위해 작성된다. 심사자들은 논리가 성립하는지, 인용된 결과가 적용되는지, 숨은 가정이 결론을 훼손하지 않는지 검토한다.
Lean 증명은 다르게 작동한다. 모든 단계가 형식 언어에 맞아야 하며, 증명 보조기의 작은 신뢰 커널이 결과 항을 검사한다.
이는 흔히 발생하는 많은 오류에 대한 강력한 안전장치를 제공한다. Lean이 이를 입증하는 항을 요구한다면, 모델은 어려운 함의를 단순히 건너뛸 수 없다.
공개 저장소는 독립 검토자에게 실제로 실행해 볼 수 있는 구체적인 자료도 제공한다. 해당 파일들은 Lean 4.32.0을 대상으로 하며, 형식화된 수학을 지원하는 커뮤니티 라이브러리인 mathlib에 의존한다.
OpenAI는 Comparator 과제를 통해 두 번째 검증 경로도 포함했다. Comparator는 생성된 지원 코드에 대한 신뢰 의존도를 낮추면서 인증서 검증을 돕도록 설계됐다.
이러한 선택은 이 작업을 모델 대화 기록 모음보다 더 감사 가능하게 만든다. 필요한 환경을 갖춘 누구나 정의를 검토하고 형식화를 빌드할 수 있다.
그러나 컴파일된 증명은 정확한 질문에 답한다. 즉, 이 형식 환경 안에서 인코딩된 가정들로부터 이 인코딩된 정리가 따라오는가?
그것이 인코딩된 정리가 비형식적 헤드라인과 일치하는지까지 자동으로 답해 주지는 않는다. 그 대응 관계에는 여전히 수학적 판단이 필요하다.
정의는 전문가들이 필수적이라고 여기는 조건을 빠뜨릴 수 있다. 형식 정리는 독자가 설명을 통해 추론하는 것보다 약한 명제를 확립할 수도 있다.
가져온 라이브러리 결과에도 맥락이 있다. 검토자들은 Astra가 기존 정리를 적절히 활용했는지, 그리고 형식 명제가 의도된 적용 범위를 유지하는지 이해해야 한다.
새로움은 또 다른 과제를 만든다. Lean은 역사적 문헌을 검색해 어떤 논증이 수십 년 전 다른 용어로 이미 등장했는지 판단하지 않는다.
이 작업에는 해당 분야의 기법과 공개되지 않은 관행을 아는 전문가가 필요하다. 인증서의 컴파일 여부를 확인하는 일보다 더 오래 걸릴 수 있다.
원고는 이해 가능한 형태가 되어야 한다. 수학은 연구자들이 아이디어를 재사용하고, 다른 연구와 연결하며, 그 메커니즘이 왜 성공하는지 설명할 수 있을 때 발전한다.
거대한 형식 항은 그러한 이해를 제공하지 않고도 정확성을 인증할 수 있다. OpenAI의 추론 설명은 이 간극을 메우려 하지만, 여전히 모델이 생성한 서사다.
이 구분은 검증된 소프트웨어와 닮아 있다. 프로그램은 형식 명세를 충족할 수 있지만, 그 명세가 사용자가 실제로 필요로 하는 것을 표현하지 못할 수 있다.
이는 형식 검증의 가치를 낮추지 않는다. 오히려 더 큰 증거 체계 안에서 형식 검증이 하나의 강력한 층위임을 분명히 한다.
10개 증명의 공개는 자연어 기반 발견과 형식 검증의 주목할 만한 결합을 보여 준다. 이전 시스템들은 종종 한쪽에서는 뛰어났지만 다른 쪽에서는 어려움을 겪었다.
언어 모델은 많은 분야에서 그럴듯한 논증을 생성할 수 있다. 증명 보조기는 잘못된 단계를 거부할 수 있지만, 정밀한 표현과 방대한 보조 정의를 요구한다.
이 두 방식 사이를 효과적으로 오가는 시스템은 주요 병목을 줄인다. 느슨하게 탐색하고 논증을 구성한 뒤, 결과를 기계 검증 가능한 객체로 번역할 수 있다.
이 워크플로는 인간의 역할도 바꾼다. 수학자들은 국소적인 유도 과정을 수정하는 데 드는 시간을 줄이고, 정의를 선택하고 새로움을 검토하며 재사용 가능한 개념을 추출하는 데 더 많은 시간을 쓸 수 있다.
그러나 독자가 형식적 타당성과 과학적 중요성을 구분하지 못할 때 인증은 잘못된 확신을 낳을 수 있다. 검증된 정리는 옳을 수 있지만 사소하거나, 중복되거나, 오해를 부를 방식으로 제시될 수 있다.
이 10개 결과는 표면상 사소해 보이지 않는다. OpenAI에 따르면, 그중 일부는 이름이 붙은 추측이나 오랜 질문을 해결한다.
실제 중요성은 독립적인 검토, 단순화 시도, 후속 연구를 통해 드러날 것이다. 증명은 컴파일만으로가 아니라 커뮤니티의 활용을 통해 가치를 얻는다.
이 때문에 Anthropic과 Google의 연구 경쟁은 단일 벤치마크로 점수를 매길 수 없다. 관련 산출물은 논증, 도구, 그리고 새로운 탐구의 방향이다.
그 가치는 외부 연구자들이 이를 검토하고 토대로 발전시킬 수 있는지에 달려 있다. 공개 인증서는 그 가능성을 높이지만, Astra에 대한 접근은 여전히 제한돼 있다.
신중해야 할 가장 큰 이유는 빠진 분모다
OpenAI는 선별된 10건의 성공 사례를 제시했지만, 실패한 탐색의 규모와 결과는 알려지지 않았다.
연구 생산성은 성공한 산출물만으로 추론할 수 없다. 독자들은 그러한 산출물을 둘러싼 시도, 개입, 평가 기준을 어느 정도는 알아야 한다.
OpenAI는 Astra가 논증을 생성하고 이후 이를 형식화했다고 밝혔다. 그러나 이 공개 자료는 인간이 문제를 어떻게 선정했는지, 또는 정체된 실행을 어떻게 재조정했는지를 충분히 설명하지 않는다.
수학적 검토에서 탈락한 후보 해법이 얼마나 많았는지도 공개하지 않는다. 이 빠진 분모 때문에 효율성 주장을 해석하기 어렵다.
가장 강력한 결과만 공개된다면 시스템은 비정상적으로 생산적인 것처럼 보일 수 있다. 과학적 평가는 일반적으로 사전등록, 반복 실험, 독립적 재현을 통해 이를 경계한다.
개방형 수학은 이런 방식에 깔끔하게 들어맞지 않는다. 문제마다 차이가 매우 크고, 하나의 아이디어가 수백 번의 실패 시도보다 더 중요할 수 있다.
그럼에도 연구소는 더 충실한 기록을 제공할 수 있다. 문제 선정 규칙, 실패한 실행, 개입 로그, 고정된 평가 기간을 공개할 수 있다.
이러한 자료는 외부인이 일반적인 연구 능력과 신중하게 선별된 포트폴리오를 구분하는 데 도움이 된다. 또한 인간의 판단이 어느 지점에서 개입했는지도 드러낼 것이다.
인간의 관여는 결함이 아니다. 수학 연구는 늘 협업적이었고, 도구는 연구자가 탐색하는 경로를 일상적으로 형성해 왔다.
문제는 기여의 귀속이다. 독자들은 Astra가 결정적인 아이디어를 만들어 냈는지, 아니면 전문가 운영자가 제공한 구조를 완성했는지 이해할 수 있을 만큼의 세부 정보를 필요로 한다.
OpenAI는 이 문제에 대해 이례적으로 분명한 입장을 취한다. 수학적 논증이 전적으로 자사 시스템에서 생성된 증명에 인간 저자를 부여하는 것은 사실을 왜곡한다고 말한다.
이 입장은 Leiden Declaration이 제기한 우려에 직접 대응한다. 이 선언은 투명성, 적절한 기여 표기, 재현 가능성, 지속적인 인간 책임을 요구한다.
또한 자동화 기법이 그럴듯하지만 신뢰할 수 없는 논증을 만들어 낼 수 있다고 경고한다. 형식 인증서는 이 우려의 일부를 다루지만, 모든 제도적 결과를 해결하지는 않는다.
비공개 모델은 어떤 문제에 관심이 쏠릴지를 좌우할 수 있다. 연구소는 실험, 해석 또는 사회적 맥락을 요구하는 연구를 소홀히 한 채, 자동화된 피드백이 명확한 분야를 우선시할 수 있다.
접근성은 또 다른 긴장을 만든다. 폐쇄형 모델은 공개 증명을 생성할 수 있지만, 운영자 네트워크 밖의 연구자들은 비교 가능한 조건에서 그 행동을 탐색할 수 없다.
Google과 Anthropic도 같은 압력을 받고 있다. 이들의 가장 강력한 연구 시스템 역시 비공개 인프라, 독점적 학습 방법, 통제된 접근에 의존한다.
이러한 구조는 연구 의제 설정 권한을 집중시킨다. 소수의 기업이 어떤 과학 문제에 막대한 컴퓨팅 자원을 투입할지 선택할 수 있다.
대학 간 불평등도 확대할 수 있다. 부유한 기관의 연구자들은 파트너십을 확보할 수 있는 반면, 다른 연구자들은 공개된 산출물만 다뤄야 할 수 있다.
컴퓨터 보조 증명의 역사는 유용한 선례를 제공한다. 4색 정리는 일반적인 수작업 검증을 넘어서는 대규모 계산이 필요했기 때문에 처음에는 회의론을 불러일으켰다.
시간이 지나며 더 명확한 방법과 독립적으로 검증 가능한 구현이 수용성을 높였다. 이 논쟁은 수학이 계산적 증거에 대한 기준을 다듬는 데 기여했다.
Astra의 결과는 더 큰 규모에서 유사한 문제를 제시한다. 이 기계는 사례를 확인하는 데 그치지 않고, 핵심 개념적 논증까지 생성하는 것으로 전해진다.
적절한 대응은 자동적 거부도 즉각적 수용도 아니다. 더 깊은 공개, 독립적 검증, 명시적인 책임이 필요하다.
저장소는 형식 산출물을 공개한다는 점에서 의미 있는 출발점이다. 논문과 설명 자료는 전문가들을 위한 추가 자료를 제공한다.
그러나 가장 강력한 검증은 OpenAI와 무관한 연구자들에게서 나올 것이다. 이들은 명제를 확인하고, 선행 문헌과 비교하며, 자신의 언어로 논증을 설명해야 한다.
오류는 여전히 드러날 수 있다. 일부 주장은 더 제한적인 표현, 추가 가설, 또는 새로움에 대한 설명의 수정이 필요할 수 있다.
그러한 수정이 반드시 Astra의 연구 능력을 무효화하는 것은 아니다. 인간이 쓴 논문도 동료 심사 과정에서, 때로는 상당히 크게 바뀐다.
핵심 기준은 그 과정이 신뢰할 수 있는 지식으로 효율적으로 수렴하는지 여부다. 그럴듯한 막다른 길을 대량으로 생성하는 시스템은 부족한 검토 역량을 압도할 수 있다.
이 위험은 연구 출판 전반에서 이미 드러나고 있다. 모델은 전문가가 평가할 수 있는 속도보다 더 빠르게 기술적 문서를 생산할 수 있다.
형식화는 잘못된 추론을 걸러내는 데 도움이 된다. 그러나 문헌 검토, 중요성 평가, 제한된 전문 인력의 문제를 해결하지는 못한다.
따라서 다음 연구 벤치마크는 수학적이라기보다 제도적일 수 있다. 최첨단 연구소는 검토할 수 없는 주장으로 공동체를 압도하지 않으면서 결과를 생성할 수 있음을 보여야 한다.
10개 증명이 압박하는 대상
Astra는 연구 워크플로, 전문 AI 시스템, 그리고 독창적인 수학에는 인간이 생성한 증명 전략이 필요하다는 가정에 압력을 가한다.
개발자에게 직접적인 교훈은 아키텍처에 관한 것이다. 중요한 역량은 고립된 텍스트 생성이 아니라, 탐색과 도구, 형식 피드백, 수정을 연결하는 순환 구조다.
Lean은 유난히 명확한 신호를 제공하는 평가기를 갖춘다. 후보 증명은 커널을 통과하거나, 다음 시도를 이끄는 오류를 낸다.
비슷한 평가기는 소프트웨어 개발, 회로 설계, 일부 과학 시뮬레이션에 존재한다. 신뢰할 수 있는 피드백이 없는 분야는 자동화하기가 여전히 더 어렵다.
이는 수학이 에이전트형 시스템의 주요 개척 분야가 된 이유를 설명하는 데 도움이 된다. 수학은 깊은 지적 문제와 점점 성숙해지는 검증 도구를 함께 제공한다.
이 결과는 전문 정리 증명기에도 압력을 가한다. 10개 분야에 걸쳐 작동하는 범용 모델은 더 좁은 형식 과제에 맞춰 학습된 시스템과 경쟁할 수 있다.
전문 시스템은 더 낮은 운영 요구 사항, 재현 가능성, 수학 라이브러리와의 긴밀한 통합 등 장점을 유지한다. 개방형 시스템은 독립적인 실험도 지원할 수 있다.
승리하는 접근법은 이들을 결합할 수 있다. 범용 모델이 전략을 제안하고, 전문 증명기가 국소적으로 탐색하며 모든 단계를 검증하는 방식이다.
수학자에게 이 변화는 즉각적인 대체보다는 워크플로의 재배분에 가깝다. 문헌 검색, 보조정리 발견, 증명 수정, 형식 번역은 모두 자동화 후보가 된다.
가장 가치 있는 인간의 기여는 문제 선정과 개념적 해석으로 옮겨갈 수 있다. 어떤 명제가 중요한지, 어떤 추상화가 이를 밝혀 주는지는 여전히 연구자들이 결정할 것이다.
이러한 결정은 겉치레가 아니다. 기술적으로 올바른 정리도 누군가가 그것이 더 넓은 아이디어 체계와 어떻게 연결되는지 보기 전까지는 무미건조하게 남을 수 있다.
기업도 검증 패턴에 주목해야 한다. Astra의 발표는 최첨단 모델의 산출물이 외부 검사기를 통과해야 할 때 더 유용해진다는 점을 시사한다.
이 원칙은 수학 밖에도 적용된다. 코드는 테스트를 거칠 수 있고, 데이터베이스 쿼리는 스키마를 거칠 수 있으며, 분석적 주장은 재현 가능한 계산을 거칠 수 있다.
지식 노동자는 모든 결론을 형식화할 수는 없다. 그래도 다른 사람이 결과를 감사할 수 있도록 출처, 가정, 의사결정 경로를 보존할 수 있다.
검색 가능한 AI 지식 베이스는 모델이 더 많은 양의 후보 연구를 생성함에 따라 더욱 중요해진다. 검증은 각 결론의 근거가 되는 증거를 보존하는 데 달려 있다.
이 압력은 동료 심사에도 미친다. 저널은 비형식 원고와 증명 보조기 코드를 모두 읽을 수 있는 검토자가 필요할 수 있다.
형식적 산출물은 언젠가 일부 검증 업무를 줄일 수 있다. 그러나 초기에는 검토자가 각 결과의 두 가지 표현을 대조해야 하므로 오히려 업무가 늘어날 수 있다.
학술적 공로 배분 정책도 비슷한 개편이 필요하다. 하나의 논문에는 모델이 생성한 아이디어, 인간의 선별, 형식화, 엔지니어링, 독립적인 수학적 해설이 함께 담길 수 있다.
모든 기여자를 저자로 부르면 의미 있는 차이가 흐려질 수 있다. 반대로 인간 운영자를 배제하면 핵심적인 지적·기술적 노동이 가려질 수 있다.
OpenAI의 명시적인 귀속 표기는 기관들이 논의할 수 있는 구체적인 사례를 제공한다. 이 회사는 책임을 수용하면서도, 인간이 Astra의 수학적 논증을 만들어냈다고 주장하지는 않는다.
오류가 발견될 경우 이 체계는 시험대에 오를 것이다. 책임에는 수정, 문서화, 그리고 독립적 검토를 위한 지원이 포함돼야 한다.
Anthropic과 Google의 비교는 연구 결과가 외부적 위험을 초래할 수 있다는 점에서 이 문제를 더욱 선명하게 드러낸다. 암호학적 발견은 완전한 공개에 앞서 조율된 공개 절차를 요구한다.
순수수학은 대체로 즉각적인 보안 우려를 덜 낳는다. 하지만 가장 가까운 벡터 결과는 탈양자 암호와 밀접하게 관련된 분야에 닿아 있다.
계산 복잡도에 관한 정리는 실제로 배포된 취약점을 드러내지 않더라도 보안 가정에 영향을 줄 수 있다. 전문가들은 그 환원이 정확히 무엇을 확립하는지 해석해야 한다.
수학적 발견과 운영상 위험의 이러한 상호작용은 더욱 커질 것이다. 여러 학문 분야를 넘나드는 모델은 그 영향이 원래의 평가 범위를 넘어서는 결과를 찾아낼 수 있다.
연구소에는 이러한 연결고리를 인식하는 검토 절차가 필요하다. 수학적으로 타당한 결과라도 공개 전에 보안, 정책 또는 분야별 평가가 요구될 수 있다.
Astra가 수학을 바꿨는지를 가를 세 가지 신호
다음 단계는 독립 검증, 재현 가능한 모델 접근성, 그리고 10개의 증명이 후속 인간 연구를 낳는다는 증거에 달려 있다.
첫 번째 신호는 10편의 원고와 Lean 인증서에 대한 전문가 검토다. 연구자들은 각 형식적 진술이 알려진 결과와 일치하는지 확인해야 한다.
구면 포장, 군론, 양자 복잡도, 극값 조합론 분야 전문가들의 공개 설명을 주시해야 한다. 이들의 평가는 일반적인 AI 논평보다 더 큰 무게를 지닌다.
여러 연구 공동체가 사소한 수정만으로 결과를 받아들인다면 OpenAI의 핵심 주장은 훨씬 강해진다. 중대한 공백이나 축소된 진술이 나오면 그 주장은 약화될 것이다.
두 번째 신호는 OpenAI가 Astra 또는 밀접하게 관련된 모델에 대한 재현 가능한 평가를 가능하게 하는지다. 공개된 결과물만으로는 이 시스템이 연구를 얼마나 신뢰성 있게 수행하는지 입증할 수 없다.
신뢰할 만한 평가는 이전에 보지 못한 문제, 고정된 조건, 독립적인 심사자를 활용해야 한다. 성공 사례뿐 아니라 실패한 시도도 보고해야 한다.
Google과 Anthropic도 같은 기대에 직면할 것이다. Anthropic과 Google의 경쟁은 외부인이 의미 있는 조건에서 시스템을 비교할 수 있을 때에만 과학적으로 유의미해진다.
세 번째 신호는 후속 수학 연구다. 중요한 증명은 대개 다른 연구자들이 변형·단순화하거나 다른 곳에 적용하는 기법을 제시한다.
OpenAI는 이전의 AI 생성 Erdős 단위거리 추측 반증이 이미 관련 연구에 영감을 주었다고 언급한다. 이제 10개의 새로운 결과도 같은 실질적 시험에 직면한다.
연구자들이 재사용 가능한 아이디어를 끌어낸다면, 이번 발표는 단순한 증명 생산의 가속을 넘어선 의미를 지닐 것이다. 모델이 수학의 진화하는 언어에 기여할 수 있음을 보여줄 것이다.
논증이 불투명한 형식적 산출물로 남는다면 그 영향력은 더 제한적일 것이다. 정확성도 중요하지만, 결과가 얼마나 멀리 퍼져 나가는지는 이해 가능성이 결정한다.
향후 몇 달은 다른 연구소들이 비슷한 미해결 문제 포트폴리오로 응답하는지도 보여줄 것이다. Google은 형식 시스템을 보유하고 있고, Anthropic은 암호학에서 장시간의 자율 연구를 보여준 바 있다.
응답이 또 다른 10개 결과 목록일 필요는 없다. 독립적으로 검증된 발견이 더 적은 수로 제시되더라도 더 강력한 증거가 될 수 있다.
독자들은 이를 기업 간 메달 순위표로 받아들이지 말아야 한다. 수학은 한 번의 발표에서 가장 많은 추측을 쌓는다고 이기는 분야가 아니다.
더 깊은 경쟁은 신뢰할 수 있는 연구 인프라를 둘러싼 것이다. 시스템은 아이디어를 생성하고, 증거를 공개하며, 수정을 수용하고, 전문가가 무엇이 바뀌었는지 이해할 수 있도록 해야 한다.
OpenAI는 이 경쟁을 위해 이례적으로 구체적인 산출물을 제시했다. 논문, 해설 자료, Lean 저장소는 전문가에게 보도자료 이상의 검토 대상을 제공한다.
하지만 전체 실험의 분모나 Astra에 대한 폭넓은 접근성은 제공하지 않았다. 이러한 공백은 모델의 일반적인 연구 능력에 대한 최종 판단을 막는다.
그럼에도 Anthropic과 Google의 연구 경쟁은 하나의 문턱을 넘었다. 최전선 연구소들은 이제 독창적인 과학적 결과를 단순한 후속 응용이 아니라 모델 역량의 증거로 제시한다.
이는 개발자, 연구자, 기관이 무엇을 물어야 하는지를 바꾼다. 핵심 질문은 더 이상 AI가 설득력 있는 증명을 만들 수 있는지가 아니다.
독립 전문가가 그 진술을 검증하고, 아이디어를 이해하며, 과정을 재현하고, 그로부터 가치 있는 무언가를 구축할 수 있는지다.
발표가 아니라 인증서를 따라가라. 그리고 수학자들이 그것으로 무엇을 하는지 지켜보라.


