Terence Tao의 AI 수학 경고, 벤치마크 경쟁에 도전하다
Terence Tao는 최근의 인상적인 성과에도 불구하고 AI 기업들이 미해결 수학 문제를 벤치마크 경쟁으로 바꾸고 있다고 경고한 다른 24명의 필즈상 수상자들과 함께했다. Terence Tao의 AI 수학 경고는 올바른 증명을 만들어내는 것과 수학적 이해를 진전시키는 것 사이에 점점 커지는 간극을 겨냥한다.
이 단체는 지난주 초기 서명자들 사이의 논의를 거쳐 2026년 9월 11일 선언문을 발표했다. 시점은 의미심장했다. OpenAI는 최근 Navier-Stokes Millennium Prize 문제의 해결을 주장하는 내용을 포함해 여러 수학적 진전을 발표했다.
이 선언은 AI 보조 연구를 거부하지 않는다. 기업들이 홍보, 모델 평가 또는 경쟁적 위치 선점을 위해 결과를 최적화할 때 유명 문제를 푸는 일이 해로워질 수 있다고 주장한다. 따라서 갈등은 AI 대 수학자가 아니다. 벤치마크 중심의 증명 생산과 증명을 공유된 지식으로 전환하는 더 느린 과정의 대립이다.
이 구분은 순수수학을 넘어 중요하다. 연구자, 개발자, 기업 팀은 점점 채점하기 쉬운 결과물로 AI 시스템을 평가한다. 그러나 측정 가능한 결과는 취약한 기여도 인정, 불투명한 방법, 막대한 자원 사용, 또는 책임 있는 전문가가 설명할 수 없는 작업을 가릴 수 있다.
25명의 필즈상 수상자가 실제로 말한 것
이 선언은 기계가 연구에 참여해야 하는지 여부가 아니라, AI 기업이 수학적 진보를 정의하는 방식을 문제 삼는다.
“수학에서의 AI의 심각한 정렬 불일치(A Severe Misalignment of AI in Mathematics)”라는 제목의 성명은 대규모 언어 모델의 급격한 발전을 인정하는 것으로 시작한다. 저자들은 이 시스템들이 이제 여러 수학 분야의 주요 미해결 문제를 풀 수 있다고 말한다.
이러한 인정은 비판을 신기술에 대한 저항으로 치부하기 어렵게 만든다. 많은 서명자는 계산 도구, 증명 보조기, 또는 AI 시스템과 함께 작업해 왔다. Tao는 수학자들이 기계의 도움으로 얻을 수 있는 이점을 반복적으로 설명해 왔다.
이의는 해당 시스템들 앞에 놓인 목표에 관한 것이다. AI 기업들은 인지도가 높은 수학 문제를 모델 역량을 보여주는 데 활용한다. 하나의 추측이 해결되면 명확한 발표, 경쟁적 비교, 기억에 남는 성취가 만들어진다.
필즈상 수상자 선언은 이러한 틀이 대리 지표를 연구의 진정한 목적과 혼동한다고 주장한다. 문제 해결은 전통적으로 누군가 유용한 개념, 방법 또는 통찰을 발전시켰다는 신호였다. 그것이 수학의 완전한 목적이었던 적은 없다.
서명자들은 연구를 인간 활동의 긴 사슬로 묘사한다. 결과는 신중하게 작성되고, 검토되고, 논의되고, 단순화되며, 이전 연구와 연결되고, 마침내 가르쳐져야 한다. 각 단계는 최초의 답보다 더 큰 가치를 드러낼 수 있다.
어려운 정리는 그 증명이 재사용 가능한 기법을 도입하기 때문에 전체 연구 프로그램을 만들어낼 수 있다. 다른 연구자들은 그 한계를 검증하고 다른 질문에 맞게 적용한다. 학생들은 그 방법을 배우고 결국 확장한다.
단순한 답만으로는 그러한 발전이 전혀 보장되지 않는다. 형식적으로 검증된 증명조차 전문가들이 핵심 아이디어를 이해하거나 기존 이론 안에 위치시킬 수 없다면 고립된 채 남을 수 있다.
선언문은 성급한 발표가 적절한 설명과 기여도 인정에 필요한 시간을 너무 적게 남긴다고 경고한다. 이러한 누락은 어떤 아이디어가 진정으로 새로운 것이고 어떤 것이 기존 인간 연구에서 왔는지에 대한 불확실성을 만든다.
비판은 전문 분야의 유인 구조와도 관련된다. 수학 공동체는 선행성, 출판, 눈에 띄는 문제 해결을 보상한다. AI 기업은 학술지, 심사자, 연구자가 결과를 흡수하는 속도보다 더 빠르게 결과를 만들어 이러한 압력을 강화할 수 있다.
초기 서명자 25명에는 Artur Avila, Manjul Bhargava, Martin Hairer, June Huh, Peter Scholze, Maryna Viazovska, Tao가 포함된다. 이들의 필즈상 수상 연도는 1978년부터 2026년까지에 걸쳐 있다.
이처럼 폭넓은 구성은 선언문에 이례적인 제도적 무게를 부여한다. 이는 하나의 연구실이나 전문 협회가 아니라 서로 다른 세대와 수학 전문 분야의 연구자들을 대표한다.
성명은 조건부 판단으로 끝난다. AI는 진정한 연구와 이해를 향상할 수 있지만, 이 기술을 통제하는 인간이 전체 효과가 건설적인지 파괴적인지를 결정할 것이다.
이 입장은 금지도 무조건적인 수용도 아니다. 기업 벤치마크가 성공을 대신 정의하기 전에 수학 공동체가 성공의 의미를 규정해야 한다고 요구한다.
AI 수학 벤치마크가 쟁점이 된 이유
수학은 정답이 객관적으로 보이는 반면, 그 답 뒤에 숨은 조건은 비교하기 어렵기 때문에 매력적인 AI 벤치마크가 되었다.
소프트웨어 기업은 어떤 모델이 다른 모델보다 더 유능하다는 가시적 증거를 필요로 한다. 수학 과제는 그런 증거를 제공하는 듯 보인다. 제안된 해법은 검토할 수 있고, 형식적 증명은 때로 소프트웨어로 검증할 수 있다.
증명 보조기는 각 단계가 명시된 논리 규칙을 따르는지 확인하는 프로그램이다. Lean은 대표적인 사례다. 이러한 시스템은 저자의 명성에 전적으로 의존하지 않고 형식적 정확성을 확립할 수 있다.
이 특성은 수학을 추론 모델 평가에 매력적으로 만든다. 주관적 판단을 이진 결과로 대체하는 것처럼 보인다. 정리는 명시된 가정 아래 확립되었거나 그렇지 않다.
그러나 이진 점수는 중요한 변수를 압축한다. 결과에는 반복 시도, 광범위한 프롬프팅, 특수 도구, 숨겨진 인간의 안내, 또는 대규모 컴퓨팅 예산이 포함될 수 있다. 공개 발표가 항상 이러한 조건을 일관되게 공개하는 것은 아니다.
Tao는 새 선언 이전에도 이 문제를 다뤘다. 그의 수학 에세이에서 그는 보고된 AI 성공 사례가 실패, 인간의 발판 제공, 컴퓨팅 비용, 기존 문헌에 대한 노출 가능성을 자주 생략한다고 지적했다.
이러한 누락은 모델 비교의 과학성을 떨어뜨린다. 또한 기저 과정이 불분명한 상황에서도 대중이 눈에 띄는 결과를 일반 지능의 척도로 받아들이도록 부추긴다.
통제된 평가는 더 유용한 이야기를 들려준다. Tao는 현직 수학자들이 제공한 미공개 연구 문제로 시스템을 시험하는 First Proof 프로젝트를 인용했다. 답안은 정확성과 설명을 기준으로 전문가 검토를 받는다.
두 번째 배치에는 10개의 문제가 포함됐고, 공개적으로 접근 가능한 AI 시스템 4개를 평가했다. Tao의 설명에 따르면 최소 한 시스템은 7개 문제에서 합격 등급을 받았다.
이 결과는 AI의 수학적 추론이 실질적으로 중요해지고 있음을 보여준다. 그렇다고 모델이 연구를 둘러싼 제도를 독립적으로 대체할 수 있다는 뜻은 아니다.
기업들이 유명한 미해결 문제를 선택하면 벤치마크 문제는 더 날카로워진다. 이 문제들은 이미 문화적 가치와 대중적 인지도를 지닌다. 하나를 푸는 일은 설명을 개선하거나 평범한 논문 수백 편을 검토하는 것보다 더 큰 홍보 효과를 제공한다.
OpenAI는 8월 내부 버전의 Astra가 만들어낸 10가지 수학적 진전을 발표하며 이러한 매력을 보여줬다. 회사는 이 작업이 오랜 질문들을 해결하거나 상당히 진전시켰다고 밝혔다.
이 발표는 수학자들에게 결과를 연구하고 더 폭넓은 연구와 연결해 보라고 권했다. 그러나 형식은 여전히 하나의 시스템 아래 여러 성취를 묶은 모델 역량 발표와 닮아 있었다.
이것이 Terence Tao의 AI 수학 경고 뒤에 있는 유인 구조다. 기업은 생성된 결과를 빠르게 측정할 수 있다. 공동체의 이해, 학생의 성장, 장기적인 이론적 가치는 같은 속도로 측정할 수 없다.
Goodhart의 법칙은 그 위험을 설명한다. 측정 지표가 목표가 되면 최적화는 그 지표를 원래 그것이 나타내던 품질에서 분리할 수 있다.
역사적으로 어려운 문제를 푸는 일은 대개 그 수학적 영역에 대한 이해를 요구했다. 이 관계는 문제 해결을 통찰의 합리적인 대리 지표로 만들었다. AI 시스템은 인간이 따라갈 수 없는 규모로 가능성을 탐색함으로써 이 연결을 약화시킬 수 있다.
따라서 어떤 증명은 그 방법이 왜 작동하는지에 대한 명확한 설명 없이도 옳을 수 있다. 또한 그 연결을 밝히지 않은 채 문헌 속에서 간과된 논증을 재현할 수도 있다.
점수판에는 또 하나의 해결된 문제가 기록된다. 연구 공동체에는 해석, 검증, 기여도 인정이라는 더 어려운 작업이 남는다.
진짜 갈등은 증명 산출물과 이해의 대립이다
핵심적인 상충 관계는 인간의 추론과 기계의 추론 사이가 아니라, 풍부한 증명 산출물과 희소한 전문가의 주의력 사이에 있다.
Tao는 증명 부족에서 증명 과잉으로의 가능한 전환을 설명해 왔다. 수학은 신뢰할 만한 새로운 증명을 만드는 일이 어렵고 비교적 드물었던 이전 조건에 맞춰 대부분의 제도를 구축했다.
학술지, 학회, 상, 채용 시스템은 전문가들이 평가할 수 있을 만큼 새로운 결과가 천천히 도착한다는 가정에 기반한다. 동료 심사는 주된 업무와 병행해 이 일을 수행하는 연구자들에게 크게 의존한다.
AI는 검토 측을 자동으로 확장하지 않은 채 생산 측을 바꾼다. 모델은 후보 논증을 지속적으로 생성할 수 있다. 이를 검토할 자격을 갖춘 전문가의 수는 같은 비율로 늘어나지 않는다.
이 불일치는 Tao가 증명 소화불량이라고 부르는 상황을 만들 수 있다. 후보 증명은 전문가들이 검증할 수 있는 속도보다 빠르게 쌓인다. 검증된 증명은 저자들이 설명하거나 공동체가 흡수할 수 있는 속도보다 더 빠르게 축적될 수 있다.
정확성은 여전히 필수적이지만, 그것은 한 단계일 뿐이다. 가치 있는 결과는 핵심 메커니즘도 전달해야 한다. 연구자들은 어려운 아이디어와 일상적인 계산을 구분하고, 어떤 부분이 일반화되는지 이해해야 한다.
인간이 쓴 논문은 종종 발견 과정의 흔적을 보존한다. 이례적인 보조정리나 신중한 표기 변경은 실제 난관이 어디에 있었는지를 드러낼 수 있다. 매우 정제된 기계 생성 증명은 이러한 신호를 지워버릴 수 있다.
따라서 설명은 장식적 포장이 아니다. 이는 암묵지를 전달하는 데 도움을 준다. 암묵지란 전문가들이 사용하지만 좀처럼 형식적 규칙으로 환원하지 않는 실질적 이해를 뜻한다.
기여도 인정은 또 다른 과제를 제기한다. 모델은 훈련 데이터, 검색된 문서, 사용자 상호작용 또는 도구 출력의 아이디어를 결합할 수 있다. 결과 증명은 하나의 순서로서는 새로울 수 있지만, 여전히 식별 가능한 인간의 기여에 의존할 수 있다.
선언문은 성급한 발표가 문헌 검토에 필요한 시간을 거의 남기지 않기 때문에 표절과 공로 인정 문제를 구체적으로 제기한다. 모델 개발자가 결과물이 어떻게 나왔는지 완전히 재구성할 수 없을 때 이 문제는 더 심각해진다.
OpenAI의 9월 발표는 이 문제를 대중의 시야로 끌어냈다. 회사는 GPT-6 Astra보다 더 유능한 시스템이 Navier-Stokes Millennium Prize 문제의 해법을 만들어냈다고 밝혔다.
Navier-Stokes 방정식은 유체의 운동을 설명한다. Millennium Prize 문제는 특정 조건 아래 매끄러운 3차원 해가 항상 정칙성을 유지하는지를 묻는다.
OpenAI는 Navier-Stokes 관련 설명에서 자사 시스템이 공식 정식화의 일부에 대해 유한 시간 특이점을 확립했다고 밝혔다. 또한 Lean 형식화도 제공했다.
OpenAI는 수학자 Levent Alpöge와 Tristan Buckmaster의 관련 연구에 관한 소문을 들은 뒤 프로젝트를 시작했다고 밝혔다. 회사는 접근법이 이들의 것과 달랐으며, Buckmaster의 비공개 Codex 프롬프트가 시스템에 영향을 미치지 않았다고 부인했다.
그러한 주장에는 독립적인 수학적·절차적 검토가 필요하다. 형식 검증은 인코딩된 단계의 정확성을 뒷받침할 수 있지만, 지적 기원의 모든 문제를 해결할 수는 없다.
이 사건은 AI 수학 벤치마크가 왜 제도적 압박을 만들어내는지 보여준다. 연구자들이 중대한 결과에 다가가고 있다는 소식이 들리면, 한 연구소는 즉시 막대한 컴퓨팅 자원을 투입할 수 있다.
개별 수학자들은 그런 조건에서 경쟁할 수 없다. 또한 연구에 사용하는 모델에 접근하기 위해 같은 기업들에 의존해야 할 수도 있다.
이는 자원의 문제인 동시에 신뢰의 문제를 낳는다. 연구자들은 비공개 초안, 프롬프트, 실험이 출판 전에 자신의 연구 방향을 드러내지 않는다는 확신이 필요하다.
비공개 데이터가 전혀 사용되지 않았더라도, 불평등한 접근성에 대한 인식은 행동을 바꿀 수 있다. 연구자들은 상업용 도구를 피하거나, 초기 아이디어를 감추거나, 우선권을 확보하기 위해 미완성 작업을 서둘러 발표할 수 있다.
그러한 대응은 수학에 필요한 협업을 약화시킬 것이다. 그 결과 벤치마크 경쟁은 미래 AI 시스템이 필요로 하는 바로 그 정보 환경을 훼손할 수 있다.
AI 모델은 잘 정리된 인간 지식으로부터 학습한다. 연구자들이 신중한 설명을 만들거나 미완성 아이디어를 공유하는 일을 멈춘다면, 미래의 학습 데이터는 더 빈약하고 신뢰도도 낮아진다.
이 갈등은 순환적이다. AI는 수학 정전의 혜택을 받지만, 통제되지 않은 생산 경쟁은 그 정전을 유지하는 과정을 약화시킬 수 있다.
Terence Tao의 AI 수학 경고는 반(反)AI가 아니다
Tao의 입장은 고도화된 AI가 의미 있는 연구를 수행하게 될 것임을 받아들이면서, 그 역량을 어떤 인간적 가치가 이끌어야 하는지 묻는다.
이 구분은 이 선언을 수학 기술의 발전을 멈추라는 요구와 분리한다. Tao는 AI 도구를 사용해 왔으며, 자신의 글에서 그러한 도움을 공개하기도 했다. 그는 기계가 생성한 해법을 평가하는 작업에도 참여했다.
그의 논지는 강한 전제를 받아들이는 데서 시작한다. AI 도구는 유용한 정확도와 수용 가능한 비용, 그리고 다양한 수준의 인간 감독 아래 연구 수준의 수학 과제 중 의미 있는 부분을 처리하게 될 것이다.
그 전제를 받아들이고 나면, 이 기술이 실재하는지를 논하는 일은 덜 중요해진다. 더 어려운 질문은 수학자들이 자신의 제도가 무엇을 최적화하기를 원하는가다.
Tao는 여러 목표를 제시한다. 수학은 문제를 해결하고, 이론을 발전시키며, 자연 현상을 설명하고, 공동체를 유지하며, 후속 세대를 양성하고, 오래 지속되는 지적 작업을 만들어낸다.
역사적으로 이 목표들은 서로를 강화해 왔다. 정리를 추구하는 연구자는 그 과정에서 방법론을 발전시키고, 학생을 가르치며, 여러 분야를 연결하곤 했다.
AI는 이러한 결과들을 분리할 수 있다. 학생을 훈련하지 않고도 증명 생성을 최적화할 수 있고, 공동체를 강화하거나 지속 가능한 설명을 만들지 않고도 올바른 논증을 생산할 수 있다.
이러한 분리가 선언문이 “misalignment”라는 단어를 사용하는 이유를 설명한다. 여기서 정렬은 최적화된 목표가 사람들이 실제로 중요하게 여기는 더 넓은 목표를 뒷받침하는지 여부를 뜻한다.
AI 기업은 시스템 능력을 입증하는 결과를 추구한다. 수학자에게는 이해 가능하고, 공로를 귀속할 수 있으며, 재사용 가능하고, 가르칠 수 있는 결과가 필요하다.
이 목표들은 겹칠 수 있다. 하지만 자동으로 겹치지는 않는다.
더 건설적인 AI 연구 시스템은 지식 파이프라인 전체를 지원할 것이다. 관련 문헌을 찾고, 불확실한 단계를 드러내며, 비형식적 논증을 형식 언어로 옮기고, 더 명료한 표현을 제안하는 데 도움을 줄 수 있다.
또한 연구자들이 증명 전략을 비교하고 재사용 가능한 기법을 식별하도록 도울 수 있다. 이런 지원은 단순히 산출량을 늘리기보다 수학적 이해를 더 쉽게 확산시킬 것이다.
이 모델은 연구 협력자 또는 검증 계층에 가깝다. 수천 개의 에이전트를 유명 문제에 투입해 그중 하나가 발표 가능한 결과를 내놓을 때까지 돌리는 방식과는 다르다.
2026년 초 Tao와 진행한 Nature 인터뷰는 이러한 균형을 담아냈다. 그는 수학자의 역할이 변화하고 있다고 설명하면서도, 인간의 판단을 계속 핵심으로 보았다.
가장 강력한 회의적 반론은 올바른 결과가 나온 뒤에는 이해가 따라온다는 주장이다. 역사에는 처음에는 어렵고, 설명이 부족했거나, 계산에 의존했던 많은 증명이 있다. 연구자들은 결국 이를 명확히 했다.
이 주장은 검토할 가치가 있다. 즉각적인 우아함을 요구하면 유용한 발견을 배제할 수 있다. 일부 기계 생성 결과는 다른 수학자들이 그 아이디어를 재구성한 뒤에야 이해 가능해질 것이다.
이 선언은 기계 출력이 반드시 통찰을 파괴한다는 점을 증명하지는 않는다. 대신 속도와 홍보가 평가를 지배할 때 그런 결과를 낳을 수 있는 유인을 지적한다.
또 다른 이의는 접근성에 관한 것이다. 연구에서 AI 사용을 제한하면 기존 위계를 보존하고, 소규모 기관이 유용한 도움을 받지 못하게 할 수 있다. 저렴한 추론 도구는 고등 수학 참여를 확대할 수 있다.
그 이점은 실재한다. 가까이에 전문가가 없는 학생도 AI 시스템을 활용해 정의를 탐색하고, 예시를 시험하거나, 논문을 이해할 수 있다. 자금이 부족한 기관의 연구자들도 한때 주요 연구소에만 허용되던 계산 지원을 얻을 수 있다.
정책 과제는 이러한 이득을 유지하면서 벤더가 연구 의제를 통제하지 못하게 하는 것이다. 가장 강력한 시스템이 비공개이고 운용 비용이 높게 유지된다면 수학은 더욱 불평등해질 것이다.
해답은 전면 금지가 아니다. 모델 사용을 공개, 공로 귀속, 재현성, 인간의 책임성과 연결하는 거버넌스다.
연구자들은 자신의 출처와 추론에 대한 통제력을 유지하도록 돕는 워크플로도 필요하다. 개인 지식 베이스는 최종 답만을 유일하게 가치 있는 산출물로 취급하지 않으면서 초안, 참고문헌, 토론을 정리할 수 있다.
수학 외의 지식 노동자에게도 같은 원칙이 적용된다. AI는 출처 자료에서 방어 가능한 이해에 이르는 경로를 강화해야 하며, 그 경로를 매끄럽게 다듬어진 답변으로 대체해서는 안 된다.
수학에는 이미 정책의 출발점이 있다
실질적인 대응은 AI가 생성한 증명이 인간 출판 속도를 전제로 구축된 시스템을 압도하기 전에 연구 규범을 재설계하는 것이다.
9월 성명은 상세한 내용보다 긴급성을 더 강조한다. 유해한 유인을 지적하고, 수학자·기업·사회가 이를 해결할 것을 촉구한다.
더 넓은 정책 프레임워크는 이미 존재한다. Leiden Declaration은 국제 공동체의 이니셔티브에 따라 2026년 6월 2일 발표됐다. 국제수학연맹은 이를 지지했다.
그 권고안은 개인 연구자, 기관, 연구비 지원 기관, 정부, 산업계를 대상으로 한다. 핵심은 투명성, 신뢰성, 자율성, 공평한 접근성, 책임성이다.
가장 즉각적인 요구사항은 공개다. 논문은 어떤 자동화 도구가 기여했는지, 해당 도구가 무엇을 했는지, 어떤 컴퓨팅 자원이 사용됐는지를 설명해야 한다.
그 기록은 브레인스토밍, 증명 생성, 형식 검증, 문헌 검색, 편집을 구분해야 한다. 각각의 활동은 서로 다른 위험과 공로 귀속 의무를 낳는다.
공개는 평가자가 벤치마크 주장을 해석하는 데도 도움이 된다. 한 번의 시도로 문제를 푼 모델은 수천 번의 병렬 시도와 광범위한 인간 조향을 사용한 시스템과는 다른 근거를 제시한다.
재현성도 마찬가지로 중요하다. 연구소는 개인정보 보호와 보안이 허용하는 범위에서 프롬프트, 도구 구성, 문제 진술, 검증 절차를 보존해야 한다.
외부 연구자가 이용할 수 없는 내부 모델에 의존한 결과는 여전히 검토하기 어렵다. 최종 증명을 공개한다고 해서 시스템의 실패율이나 탐색 과정이 드러나는 것은 아니다.
공로 귀속은 모델에 인용문을 요청하는 것 이상을 요구한다. 개발자와 저자는 체계적인 문헌 검색, 전문가 검토, 누락을 바로잡는 절차를 마련해야 한다.
인간 제출자는 계속 책임을 져야 한다. 조작된 인용이나 차용한 아이디어를 모델 탓으로 돌린다면 영향을 받은 연구자들은 실질적인 구제 수단을 잃게 된다.
학술지에도 새로운 선별 시스템이 필요하다. 편집자는 그럴듯해 보이는 기계 생성 증명을 모두 무급 전문가에게 보낼 수 없다. 투고 규정은 도구 사용 공개, 형식 검증, 그리고 전문가가 해당 작업을 이해한다는 증거를 요구할 수 있다.
Tao는 자신의 에세이에서 까다로운 기준을 제시한다. 저자들은 출판 전에 올바른 공로 귀속과 함께 자신의 결과를 명확하고 전문가 수준으로 발표할 수 있어야 한다.
이 기준은 AI 지원을 배제하지 않는다. 대신 책임 있는 사람이 기여를 이해하고 방어할 것을 요구한다.
평가는 소화 작업에도 보상해야 한다. AI가 생성한 결과를 검증하고, 단순화하고, 설명하거나, 통합하는 연구자들은 필수적인 지적 작업을 수행한다.
현재의 학계 유인은 종종 최초의 증명에 최종적 설명보다 더 큰 공로를 부여한다. 증명이 넘쳐나는 상황에서는 이러한 불균형을 유지할 수 없다.
연구비 지원 기관은 형식화, 큐레이션, 부정적 결과를 위한 인프라를 지원할 수 있다. 대학은 채용 결정에서 검토와 해설 작업을 인정할 수 있다.
AI 기업은 시스템과 관련 텔레메트리의 상당 부분을 모두 통제하기 때문에 추가적인 책임을 진다. 이들은 집계된 자원 사용량, 벤치마크 선정 방식, 실패한 시도를 공개할 수 있다.
또한 고객 데이터에 관한 명확한 경계를 설정할 수 있다. 연구자들은 프롬프트, 업로드한 원고, 도구 세션이 모델 학습이나 내부 연구에 기여하는지에 대해 이해하기 쉬운 보장을 필요로 한다.
독립 감사는 그러한 보장을 더 신뢰할 수 있게 만들 것이다. 결과를 내는 것으로도 이익을 얻는 기업의 경우, 기업의 보장만으로 모든 이해충돌을 해결할 수는 없다.
벤치마크 자체도 더 폭넓어져야 한다. 유용한 평가는 시스템이 선행 연구를 식별하는지, 핵심 아이디어를 전달하는지, 불확실성을 표시하는지, 다른 수학자가 결과를 확장하도록 돕는지를 측정할 수 있다.
이러한 특성은 최종 답보다 점수화하기 어렵다. 바로 그 어려움 때문에 기업은 가장 쉬운 지표를 실제 목표로 대체해서는 안 된다.
같은 교훈은 기업 AI 도입에도 적용된다. 팀은 응답 속도나 작업 완료 여부를 측정하는 경우가 많다. 그 수치들은 쉽게 얻을 수 있기 때문이다.
그러나 시스템은 자동화가 끝난 뒤 추적 가능성, 직원 학습, 조직 기억을 줄이면서도 산출량은 늘릴 수 있다. 리더들은 작업이 여전히 설명 가능하고 재사용 가능한지를 측정해야 한다.
수학은 이른 시기의, 유난히 가시적인 사례를 제공한다. 수학의 형식적 구조는 지표 실패를 더 쉽게 드러내지만, 근본적인 문제는 모든 지식 전문직에 영향을 미친다.
Fields Medal 수상자 선언 이후 주목할 점
다음 시험대는 또 다른 모델이 또 다른 유명 문제를 푸는지가 아니라, 연구소·학술지·연구자들이 관행을 바꾸는지 여부다.
첫 번째 신호는 향후 AI 수학 발표를 둘러싼 공개 수준이 될 것이다. 기업들은 시도 횟수, 인간의 안내, 컴퓨팅 자원, 검증 방법, 문헌 검토 절차를 보고해야 한다.
더 완전한 공개는 선언의 핵심 판단을 강화할 것이다. 이는 연구소가 수학적 결과를 단지 성능 시연이 아니라 연구 기여로 받아들인다는 점을 보여줄 것이다.
빈약한 발표는 반대 방향을 가리킬 것이다. 그것은 경쟁 압박이 여전히 재현성과 맥락에 대한 요구를 압도하고 있음을 시사할 것이다.
두 번째 신호는 주목받는 주장에 대한 독립 검토에서 나올 것이다. OpenAI의 Navier-Stokes 결과는 정확성, 독창성, 범위, 공로 귀속이 각각 별도의 평가를 필요로 하기 때문에 즉각적인 사례를 제공한다.
형식적인 Lean 증명은 그 인코딩 범위 안에서 논리적 타당성을 다룬다. 수학자들은 여전히 형식 진술이 의도된 문제와 일치하는지, 그리고 그 기여가 적절히 공로를 인정받은 아이디어를 사용하는지 확인해야 한다.
독립 전문가들이 결과를 검증하고 명확한 새로운 방법을 찾아낸다면, AI가 생성한 작업도 수학의 정전에 들어갈 수 있음을 보여줄 것이다. 그렇다고 해서 이 경고가 무효가 되는 것은 아니다.
오히려 이는 책임 있는 통합에 무엇이 필요한지를 보여줄 것이다. 해당 증명은 전문가의 해석, 공로 인정, 설명을 통해 가치를 얻게 된다.
중대한 수정이나 공로 배분 분쟁이 계속된다면, 선언문이 제기한 우려는 더욱 구체화될 것이다. 이 문제는 문화적 전망의 영역에서 연구 관행의 문서화된 실패로 옮겨가게 된다.
세 번째 신호는 새로운 규칙의 제도적 채택이 될 것이다. 저널, 대학, 학회, 연구비 지원기관은 AI 지원 결과를 어떻게 심사하고 공로를 부여할지 결정해야 한다.
정책은 공개 요건과 저자 책임을 명확히 해야 한다. 또한 미공개 작업을 보호하고 검증에 드는 노동을 인정해야 한다.
의미 있는 채택은 증명 생성보다 증명 소화에 더 큰 위상을 부여하게 될 것이다. 검토자, 형식화 작업자, 해설자는 결과를 신뢰할 수 있고 유용하게 만드는 데 기여한 공로를 더 크게 인정받게 된다.
약하거나 일관성 없는 정책은 기업이 조건을 정하도록 내버려 둘 것이다. 그러면 연구자들은 저널과 기관마다 서로 다른 기대에 직면하게 되고, 이는 비공개와 전략적 행동을 부추길 수 있다.
Terence Tao의 AI 수학 경고는 궁극적으로 누가 진보를 정의할 권한을 갖는지 묻는다. AI 연구소는 유명한 이름의 문제들에 도전함으로써 놀라운 시스템을 입증할 수 있다.
그러나 수학은 올바른 명제만으로 발전하지 않는다. 사람들은 그 명제가 왜 참인지 이해하고, 그 이해를 바탕으로 더 나은 질문을 던질 때 수학은 발전한다.
따라서 이 선언문의 가장 중요한 주장은 지식의 관리에 관한 것이다. 기계가 과정의 한 부분을 가속하더라도, 연구 공동체는 지식이 축적될 수 있는 조건을 지켜야 한다.
독자들은 다음 대형 AI 증명 발표를 다른 방식으로 바라봐야 한다. 헤드라인 결과도 중요하지만, 그 뒤에 있는 실패한 시도, 인간의 입력, 출처, 설명 역시 중요하다.
전문가들이 그 결과를 재현할 수 있는지 물어야 한다. 누가 공로를 인정받는지, 핵심 아이디어가 이해 가능한지, 학생들이 이를 바탕으로 발전시킬 수 있는지도 물어야 한다.
이 질문들은 정리의 개수보다 더 나은 기준을 제공한다. AI 기업들이 자발적으로 이에 답하기 시작한다면, 현재의 갈등은 실행 가능한 연구 파트너십으로 발전할 수 있다.



