top of page

Claude의 실패한 리만 가설 시도는 다른 결과를 낳았다

Anthropic은 아직 공개되지 않은 Claude 모델에 무리한 과제를 맡겼지만, 그 실패는 수학자들이 검토할 가치가 있다고 봤다고 회사가 말하는 결과를 낳았다. Anthropic techmeme 이야기는 제타 함수의 영점에 관한 유명한 미해결 문제인 리만 가설에 대한 진지한 시도다. Claude는 이를 풀지 못했다.

대신 Anthropic은 이 모델이 오랫동안 유지돼 온 하한을 끌어올릴 방법을 찾아냈다고 말한다. 이 하한은 가설의 임계선 위에 놓이는 것으로 알려진 관련 영점의 비율에 관한 것이다. Anthropic에 따르면 그 수치는 41.6%에서 67.2%로 높아졌다.

이 수치적 도약은 실제보다 훨씬 해법에 가까운 것처럼 들린다. 거의 모든 영점을 포괄하는 명제조차 모든 영점이 그 선 위에 있다고 확립하는 것은 아닐 수 있다. 따라서 진짜 쟁점은 Claude와 하나의 유명한 추측의 대결이 아니다. 이는 자율적 탐색과 연구 수학의 엄격한 검증 기준 간의 대립이다.

Anthropic의 실험은 AI 보조 수학 작업에 관한 여러 차례의 대대적인 공개 시연 이후에 나왔다. OpenAI, Google DeepMind, 그리고 학계 연구팀은 점점 더 올림피아드 문제, 형식 증명, 열린 연구 질문을 모델로 시험해 왔다. 이 사례는 Claude가 접근법을 선택하고, 다른 에이전트를 조율하며, 논문을 검색하고, 자신의 결과에 이의를 제기했다고 전해지기 때문에 벤치마크 답변을 넘어선다.

원래 임무가 실패했기에 이 결과는 더욱 중요하다. 기존 벤치마크라면 실패로 기록했을 것이다. 하지만 독립 전문가들이 그 결과가 정확하고 새로운 것임을 확립할 수 있다면, 실패한 경로가 다른 결과를 드러냈을 때 연구 과정은 여전히 가치를 낼 수 있다.

Anthropic Techmeme 헤드라인이 실제로 설명하는 것

Claude는 리만 가설의 일부를 풀지 못했다. 대신 관련 하한에 대해 더 강한 결과를 확립했다고 전해진다.

리만 가설은 리만 제타 함수의 모든 비자명 영점이 실수부가 2분의 1인 수직선 위에 놓인다고 예측한다. 제타 함수는 복소해석학과 소수의 분포를 연결한다. 이 함수의 비자명 영점은 수학자들이 소수들 사이의 불규칙성을 얼마나 정밀하게 설명할 수 있는지를 좌우한다.

이 문제는 베른하르트 리만의 1859년 논문으로 거슬러 올라간다. 또한 이는 Clay Mathematics Institute의 7대 유명 난제 중 하나인 밀레니엄 문제다. 이러한 위상은 관심을 설명하지만, 점진적 진전을 오해하게 만드는 축약 표현을 부추길 수도 있다.

수학자들은 이미 무한히 많은 영점이 임계선 위에 놓인다는 사실을 알고 있다. 또한 그곳에서 발견되는 영점 비율에 대한 하한도 증명했다. Anthropic이 보고한 작업 이전에는 관련 무조건적 하한이 약 41.6%였다.

Anthropic은 Claude가 Brian Conrey, Dan Goldston, Kyle Pratt를 비롯한 여러 수학자와 관련 수론 연구자들의 기존 작업을 결합했다고 말한다. 제안된 논증은 그 하한을 67.2%까지 높였다고 전해진다. 회사는 연구 설명에서 이 결과를 설명하면서도 Claude가 원래 가설을 풀지 못했다고 신중하게 밝힌다.

이 구분은 자연 밀도와 관련이 있다. 자연 밀도는 연구자들이 임계 띠의 더 높은 위치에 있는 영점을 살펴볼 때 어떤 성질을 만족하는 영점의 극한 비율을 설명한다. 67.2%의 하한은 정리의 조건 아래 적어도 그 비율이 임계선 위에 놓인다는 뜻이다. 이는 리만 가설의 해결률을 나타내는 수치가 아니다.

선 밖에 놓인 예외적 영점 집합이 존재하지만 전체 수열에서는 밀도가 0이라고 가정해 보자. 밀도에 관한 명제는 모든 예외를 배제하지 못한 채 여전히 100%에 가까워질 수 있다. 이 가설은 점근적 다수가 아니라 모든 비자명 영점에 관한 보편 명제를 요구한다.

컴퓨터는 이미 선 밖의 영점을 발견하지 못한 채 막대한 유한 구간을 검증했다. 발표된 한 계산 검증은 높이 3조까지 가설을 확인했다. 이 증거는 인상적이지만, 어떤 유한 구간을 확인하더라도 무한한 주장까지 증명할 수는 없다.

Claude의 보고된 결과는 단순한 수치 검증이 아니라 정리 구성의 영역에 속한다. 이 모델은 또 다른 영점 묶음을 확인하는 대신 점근적으로 적용되는 논증을 만들었다고 전해진다. 이 차이 때문에 리만의 문제를 푸는 것과는 거리가 멀더라도 이 주장은 주목할 가치가 있다.

Anthropic은 이 시스템을 공개되지 않은 연구용 버전으로 설명하기 때문에 모델의 공개 제품명을 밝히지 않았다. 따라서 독자들은 일반적으로 이용 가능한 Claude 출시판을 사용해 이 실험을 재현할 수 없다. 결과 논문은 독립적으로 평가할 수 있더라도, 이는 모델 자체에 대한 외부 평가를 제한한다.

따라서 공개된 주장은 두 층위로 읽어야 한다. 하나는 전문가들이 검토, 재현, 그리고 잠재적으로 반박할 수 있는 수학적 명제다. 다른 하나는 발견 과정에서 모델이 얼마나 많은 부분을 자율적으로 수행했는지에 대한 Anthropic의 설명이다.

이 두 층위에는 서로 다른 증거가 필요하다. 정확한 논문은 수학적 결과를 뒷받침할 것이다. 그렇다고 프롬프팅, 에이전트 조율, 실패한 아이디어, 인간의 개입에 관한 모든 운영상 주장을 자동으로 검증하는 것은 아니다.

실패한 시도는 자율 연구 시험으로 바뀌었다

주목할 만한 변화는 가설의 해결이 아니라, 개방형 실패를 검증 가능한 연구 기여로 전환했다고 전해지는 시스템이었다.

회사 설명에 따르면 Anthropic 직원 Jarred Sumner가 이 프로젝트를 시작했다. Sumner는 해석적 수론 전문가는 아니며, 소프트웨어 엔지니어이자 Bun JavaScript runtime의 제작자다. 그의 초기 지시는 Claude에게 이 문제에 진지하게 도전해 보라고 요청한 것으로 전해진다.

Anthropic에 따르면 모델은 먼저 약 650개의 아이디어를 생성하고 시험했다. 그중 어느 것도 부여된 과제를 해결하지 못했다. 이 실패 단계는 알려진 하나의 경로를 중심으로 세심하게 연출된 시연과 이 작업을 구분하기 때문에 중요하다.

그 후 Claude는 약 하루 반 동안 약 60개의 하위 에이전트를 조율했다고 전해진다. 하위 에이전트는 제한된 연구 또는 검증 과제에 배정된 또 다른 모델 인스턴스다. 이 그룹은 약 2,400개의 셸 명령을 실행하고 수백 개의 Python 스크립트를 생성한 것으로 알려졌다.

Anthropic은 에이전트들이 알려진 영점을 대상으로 수천 건의 수치 검사를 수행했다고 말한다. 또한 제안된 논증을 검토하고, 반례를 찾고, 가장 강한 결과를 독립적으로 재현하려 했다. 두 번의 Claude Code 세션에서 시스템은 약 3,100만 개의 출력 토큰을 생성했다고 전해진다.

이 수치들은 정확성이 아니라 규모를 설명한다. 에이전트와 토큰이 많을수록 시스템이 탐색할 수 있는 경로의 수는 증가한다. 동시에 반복되는 오류, 숨겨진 의존성, 유사한 약점을 공유하는 모델들 사이의 겉보기 합의가 발생할 기회도 늘어난다.

유용한 메커니즘은 구조화된 불일치다. 한 에이전트가 보조정리를 제안하면, 다른 에이전트는 반례를 찾거나 원래 도출 과정에 의존하지 않고 증명을 재구성한다. 이는 적대적 검토와 닮았지만, 검토자들이 같은 학습과 아키텍처를 공유한다면 진정으로 독립적이지는 않다.

Anthropic에 따르면 Claude는 결과나 그 구성 요소가 이미 존재하는지 확인하는 과정에서 arXiv 논문 54편도 내려받았다. 문헌 검색은 이미 알려진 정리를 재발견하는 것과 새로운 결과를 만들어 내는 것이 다르기 때문에 필수적이다. 특히 논문마다 용어가 다를 수 있어 인용 일치만으로는 새로움을 입증할 수 없다.

그럼에도 보고된 작업 흐름은 긴 챗봇 대화 이상의 것이었다. 이는 기호 추론, 실행 가능한 실험, 문서 검색, 위임된 검토, 형식화를 결합했다. 이러한 조합은 언어 모델을 연구 도구 모음의 오케스트레이터로 바꾼다.

이러한 조율은 동적 워크플로에 관한 Anthropic의 더 폭넓은 작업과 닮아 있다. 회사는 Bun의 대대적인 재작성 등을 포함해 대규모 소프트웨어 마이그레이션을 위해 Claude가 여러 에이전트를 조율하는 사례를 설명해 왔다. 수학 프로젝트는 정의, 보조정리, 수치 시험, 선행 문헌에 유사한 운영 패턴을 적용했다.

따라서 Claude의 리만 가설 시도는 순수한 수학 능력만큼이나 지속성을 시험했다. 대부분의 벤치마크 질문은 모델이 하나의 응답을 낸 뒤 끝난다. 이 시스템은 더 좁은 주장으로 노력을 전환하기 전까지 수백 개의 비생산적 방향을 계속 추적했다고 전해진다.

인간 연구자들도 야심 찬 프로젝트가 의도한 정리 대신 유용한 보조정리를 낳을 때 비슷한 일을 한다. 차이는 속도와 범위다. 에이전트 집단은 지치지 않고 많은 변형을 검토하고, 계산을 수행하며, 참고문헌을 교차 확인할 수 있다.

양이 판단의 필요성을 없애지는 않는다. 누군가는 부수적 결과가 의미 있는지, 가정들이 들어맞는지, 증명이 문헌을 진전시키는지 결정해야 한다. 이는 이 실험을 더 큰 인간 검증 체계 안에서 이루어지는 AI 수학 연구의 시험으로 만든다.

왜 67.2%는 해법의 67.2%가 아닌가

핵심적인 반전은 수학적이다. 더 큰 비율은 실제 정리가 될 수 있지만, 보편 명제를 증명하는 데 비례해서 가까워지는 것은 아니다.

대중적 요약은 당연히 41.6%에서 67.2%로의 변화에 초점을 맞춘다. 이 증가는 구체적이고 기억하기 쉬우며, 몰리파이어와 영점 밀도 추정을 포함하는 기술적 논증보다 훨씬 전달하기 쉽다. 하지만 이는 잘못된 사고 모형을 불러온다.

몰리파이어는 제타 함수의 평균을 제어하고 그 영점에 관한 정보를 드러내기 위해 사용되는 정교하게 구성된 보조 함수다. 연구자들은 어려운 식을 다룰 수 있게 만들기 위해 그 형태와 길이를 선택한다. 개선은 종종 오차항이 주된 결과를 압도하지 않도록 하면서 추정을 결합하는 데 달려 있다.

영점의 적어도 67.2%가 임계선 위에 있음을 증명하는 것은 무한한 목록의 처음 67.2%를 확인하는 것과 동등하지 않다. 자연 밀도는 확장되는 범위 전반의 거동을 설명한다. 드문 예외 집합은 무한히 많은 원소를 포함하면서도 극한 비율에서는 보이지 않을 수 있다.

이 차이는 정수에 관한 명제와 비슷하다. 소수는 양의 정수 가운데 자연 밀도가 0이지만, 무한히 많은 소수가 존재한다. 따라서 어떤 성질은 밀도상으로 100%의 대상에서 성립하면서도 예외를 가질 수 있다.

리만 가설의 경우, 선 밖의 비자명 영점 하나만으로도 이 추측은 반증된다. 매우 큰 비율에 관한 정리는 그 단 하나의 반례를 배제할 수 없다. 전문가들이 이 결과를 리만 가설을 67.2% 해결한 것으로 설명할 때 반대하는 이유가 여기에 있다.

그 결과는 여전히 중요할 수 있다. 무조건적 하한을 끌어올리려면 더 정밀한 추정, 확립된 기법의 더 나은 결합, 또는 별개의 논문들 사이에서 이전에는 발견되지 않았던 양립 가능성이 필요할 수 있다. 그 가치는 방법론과 다른 연구자들이 거기서 무엇을 도출할 수 있는지에 달려 있다.

Anthropic은 Claude가 완전히 새로운 수학적 틀을 만들기보다 기존 작업을 결합했다고 말한다. 이러한 설명은 기계의 독창성에 대한 주장을 절제해야 한다. 알려진 아이디어를 재조합하는 일도 새로운 정리를 낳는다면 독창적 연구가 될 수 있다.

수학에는 종합을 통해 구축된 진전의 사례가 많다. 기존 도구들이 특정 방식으로 함께 맞물린다는 사실을 아무도 이전에는 인식하지 못했기 때문에, 증명은 새로울 수 있다. 결정적인 질문은 모든 구성 요소가 새로웠는지가 아니다. 논증과 결과가 이전에 알려지지 않았는지다.

그 질문에 답하려면 철저한 문헌 검토가 필요하다. Claude가 54편의 논문을 검색한 일은 의미가 있지만, 완전성을 보장하지는 못한다. 논문마다 표기법이 다르고, 미공개 연구는 비공개로 유통되며, 오래된 결과는 arXiv 밖의 서적이나 학회 발표 논문집에 실려 있을 수 있다.

Anthropic techmeme의 프레이밍은 제타 함수 연구의 다른 곳에서 등장하는 서로 다른 비율도 하나로 압축한다. 일부 발표된 결과는 추가 가정하에 단순 영점에 관한 것이다. 다른 결과는 그런 가정 없이 임계선 위의 영점에 관한 것이다. 비슷한 수치가 기술적으로는 서로 다른 명제를 설명할 수 있다.

따라서 책임 있는 해석은 정리를 정확히 보존해야 한다. 가정, 계수 대상 영점의 정의, 극한 절차, 부등식의 엄격성 모두가 중요하다. 작은 불일치 하나가 겉보기의 개선을 기존 연구의 재진술로 바꿀 수 있다.

Anthropic은 소속 수학자 두 명이 이 결과를 검토했다고 밝혔다. 또한 논문을 검토한 외부 전문가로 수론가 Brian Conrey와 Dan Goldston을 언급했다. 전문가의 검토는 의미 있는 증거를 제공하지만, 완료된 학술지 동료 심사와 같은 것은 아니다.

이 이야기의 가장 강한 버전은 여전히 검증을 전제로 한다. 보도에 따르면 Claude는 상당한 수학적 주장을 만들어냈고, 관련 지식을 가진 사람들이 진지하게 검토할 만큼 신빙성이 있다고 판단했다. 이 결과가 받아들여진 수학 지식이 될지는 논문에 대한 학계의 반응이 결정할 것이다.

형식 검증은 도움이 되지만, 모든 것을 해결하지는 않는다

기계 검증 증명은 논리적 단계를 확인할 수 있지만, 독창성·중요성·충실한 번역은 여전히 인간의 판단 영역으로 남는다.

Anthropic에 따르면 Claude는 선언된 규칙과 앞선 명제로부터 각 형식 단계가 따라오는지를 검사하는 증명 보조기 Lean으로 결과를 형식화했다. Lean 검증에 성공하면 형식화된 논증 내부에서 통상적인 논리적 비약이 있을 위험이 크게 줄어든다.

형식 검증은 같은 모델에게 자신의 산문을 다시 읽게 하는 것보다 더 강력한 안전장치를 제공한다. 증명 보조기는 그럴듯하게 들린다는 이유로 단계를 받아들이지 않는다. 신뢰할 수 있는 논리 커널에 대해 정밀하게 인코딩된 항을 검증한다.

다만 이 안전장치에는 경계가 있다. Lean은 실제로 인코딩된 정리를 검사한다. 형식 명제가 논문에서 의도한 정리와 다르다면, 공개된 주장을 입증하지 못하면서도 증명은 통과할 수 있다.

정의와 가정은 특히 중요하다. 형식 정리에는 산문에서 불명확하게 제시된 조건이 포함될 수 있고, 어려운 보조정리 하나만 형식화했을 수도 있다. 독자는 “Lean으로 검증됨”을 보편적인 보증으로 받아들이기 전에 기계화된 결과의 범위를 알아야 한다.

형식화는 독창성을 입증하지도 않는다. Lean은 어떤 정리가 수십 년 전 다른 표기법으로 이미 발표됐는지를 판단할 수 없다. 또한 전문가들이 그 개선을 개념적으로 중요하다고 보는지, 아니면 기술적으로 일상적인 것으로 보는지도 결정할 수 없다.

그럼에도 이 프로젝트는 증명 보조기가 AI 수학 연구의 중심으로 떠오르는 이유를 보여준다. 언어 모델은 유창하지만 유효하지 않은 논증을 만들어낼 수 있다. 형식 시스템은 그럴듯한 산문이 명시적인 수학으로 바뀌어야 하는 엄격한 접점을 제공한다.

이 결합은 실질적인 연구 순환을 바꾼다. 모델은 전략을 제안하고, Python으로 예시를 시험하며, 핵심 명제를 Lean으로 인코딩하고, 실패 사례를 다시 탐색 과정으로 돌려보낼 수 있다. 각 도구는 서로 다른 종류의 오류를 포착한다.

수치 검사는 명백한 반례를 드러내지만 무한 정리를 확립할 수는 없다. 문헌 검색은 독창성을 시험하지만 잘 알려지지 않은 출처를 놓칠 수 있다. 에이전트 검토는 추론에 이의를 제기하지만 공통된 편향을 재현할 수 있다. 형식 검증은 인코딩된 논리를 검사하지만 정확한 명세에 의존한다.

이 신호들을 통합할 책임은 여전히 인간 전문가에게 있다. 이들은 형식 명제가 의도한 수학과 일치하는지 평가한다. 또한 독창성, 관련성, 설명 방식, 기존 연구와의 연결도 판단한다.

Anthropic이 Claude를 유능한 연구 시스템으로 제시하는 데 상업적 이해관계를 갖고 있기 때문에 검증 사슬은 더욱 중요해진다. 그렇다고 주장이 무효가 되는 것은 아니다. 다만 회사의 운영 설명을 독립적인 증거로 취급해서는 안 된다는 뜻이다.

공개되지 않은 모델은 또 다른 불확실성을 만든다. 외부 연구자들은 논문과 형식 증명을 검토할 수 있지만, 이를 만들어낸 정확한 시스템을 시험할 수는 없다. 아직은 비슷한 실행이 얼마나 자주 실패하는지, 알려진 결과를 재발견하는지, 혹은 그럴듯한 잘못된 단서를 생성하는지를 측정할 수 없다.

단 한 건의 성공 사례만으로는 기본 발생률을 거의 알 수 없다. Anthropic은 이번 실행에서 수백 개의 실패한 아이디어가 있었다고 보고했지만, 더 넓은 분모는 여전히 알려지지 않았다. 회사는 이 사례를 선택하기 전 몇 개의 미해결 문제를 시도했는지 공개적으로 밝히지 않았다.

선별 효과는 모든 프런티어 모델 시연에서 중요하다. 연구소가 많은 문제를 시도한 뒤 가장 강한 결과를 발표하면, 공개된 사례는 전형적인 신뢰성을 과장할 수 있다. 유용성을 추정하려면 반복적이고 사전에 문서화된 실험이 필요하다.

이는 이 결과를 마케팅으로 축소하지 않는다. 인상적인 사례 연구에서 신뢰할 수 있는 과학적 방법으로 나아가기 위해 필요한 증거를 가리킨다. 재현 가능한 산출물, 상세한 프롬프팅 기록, 독립적 재현은 주장을 크게 강화할 것이다.

Anthropic은 벤치마크와 연구 워크플로에 압박을 가하고 있다

이 실험은 AI 연구소들에 고정된 수학 시험에서의 더 높은 점수가 아니라 생산적인 연구 행동을 보여 달라는 압박을 가한다.

수학 벤치마크는 모델 진전을 가장 명확하게 측정해 온 수단 중 하나다. 경시대회 문제는 알려진 답, 간결한 채점, 다양한 난이도를 제공한다. 이는 많은 대화형 평가보다 추론을 더 직접적으로 시험한다.

Google DeepMind의 AlphaProof와 AlphaGeometry는 형식 추론과 특화 시스템을 통한 다른 경로를 보여줬다. 프런티어 언어 모델 개발사들도 국제수학올림피아드 문제에서 높은 성능을 보고해 왔다. 이런 성과는 통제된 조건에서 모델이 신중하게 선정된 질문을 풀 수 있는지를 측정한다.

개방형 연구는 다르게 작동한다. 답은 알려지지 않았고, 문헌은 불완전하며, 적절한 중간 질문조차 불분명할 수 있다. 유용한 시스템은 무엇을 시도할지 결정하고, 실패를 인식하며, 회복하고, 전문가가 감사할 수 있는 산출물을 만들어야 한다.

Claude의 리만 가설 프로젝트는 이보다 넓은 순환을 다룬다. 보고된 기여는 원래 프롬프트에 답하는 데서 나오지 않았다. 부수 결과가 집중적인 발전을 받을 가치가 있음을 인식한 데서 나왔다.

이러한 행동은 Anthropic, OpenAI, Google 간의 벤치마크 우선 경쟁에 도전한다. 모델은 높은 점수를 받으면서도 지속적인 탐구에는 서툴 수 있다. 반대로, 핵심 문제를 풀지 못한 시스템도 유용한 보조정리나 반례를 발견해 가치를 만들 수 있다.

이 사례는 단일 모델 응답에서 주변 연구 인프라로도 주의를 옮긴다. Claude는 셸 명령, 코드 실행, 논문, 다수의 에이전트, 형식 증명 환경에 접근할 수 있었다. 결과는 그 완전한 시스템에 속한다.

이 구분은 기업 및 학술 구매자에게 중요하다. 벤치마크 점수만으로 모델을 선택하면 검색 품질, 도구 사용, 검증, 관찰 가능성, 워크플로 제어를 간과하게 된다. 이러한 역량이 장시간 실행되는 연구 작업이 감사 가능한 결과물을 만드는지를 결정한다.

지식 관리는 문제의 일부가 된다. 연구 에이전트는 수백만 토큰에 걸쳐 가정, 실패한 방향, 출처, 수치적 증거, 검토자의 이의를 추적해야 한다. 인간 팀도 기계가 생성한 작업을 평가할 때 같은 과제에 직면한다.

검색 가능한 AI 지식 베이스는 연구자가 이 증거 추적을 보존하는 데 도움이 될 수 있다. 수학을 검증하지는 않지만, 주장을 원문 논문, 실험, 검토 결정과 연결해 둘 수 있다.

개발자들은 기술적 결과 뒤에 숨은 경제성에도 주목해야 한다. 3,100만 개의 출력 토큰과 수십 개의 에이전트는 상당한 연산을 의미한다. Anthropic은 이 연구 모델을 제공하지 않았으며, 이 글은 해당 워크플로가 일반 사용자에게 경제적이라고 가정해서는 안 된다.

따라서 경쟁의 질문은 어느 회사가 가장 똑똑한 모델을 보유했는지보다 더 넓다. 인간 감독을 감당하기 어렵게 만들지 않으면서 추론을 반복 가능하고 검증 가능한 연구로 전환할 수 있는 연구소가 어디인지에 관한 문제다.

OpenAI와 Google은 진정한 개방형 작업에서 나온 비슷한 증거를 공개해야 한다는 압박에 직면한다. Anthropic은 외부인이 과학적 역량과 선택적으로 제시된 시연을 구분할 수 있도록 충분한 산출물을 제공해야 한다는 압박을 받는다.

수학자들이 받는 압박은 다르다. 이들은 기계 보조 작업의 기여를 어떻게 표기할지, 계산 탐색을 어떻게 기록할지, 기계 속도로 생성된 증명을 어떻게 검토할지를 결정해야 한다. 전통적 동료 심사는 광범위한 자동화 실험이 뒷받침하는 그럴듯한 원고의 홍수를 위해 설계되지 않았다.

학술 연구 그룹은 곧 전문가들이 평가할 수 있는 양보다 더 많은 후보 논증을 생성할 수 있다. 이는 검증 병목을 만든다. 희소한 자원은 아이디어 생성 자체가 아니라 신뢰할 수 있는 전문가의 관심이 된다.

따라서 AI 수학 연구의 더 큰 약속은 선별과 분리할 수 없다. 시스템은 자체 발견을 순위화하고, 취약한 단계를 드러내며, 증거를 효율적으로 패키징해야 한다. 그렇지 않으면 저렴한 생성이 과학 공동체에 비싼 검토 비용을 부과할 수 있다.

Anthropic의 워크플로는 한 가지 가능한 답을 가리킨다. 제안 에이전트와 비판 에이전트를 분리하고, 실행 가능한 검사를 사용하며, 문헌을 검색하고, 핵심 주장을 형식화하는 방식이다. 이 방법은 타당하지만, 얼마나 신뢰성 있게 오류를 걸러내는지는 독립적 증거가 보여줘야 한다.

이 결과가 지속될지를 결정할 세 가지 신호

다음 단계는 또 다른 극적인 프롬프트가 아니라 독립적 검증, 재현성, 그리고 워크플로가 일반화된다는 증거다.

첫 번째 신호는 전체 논문과 형식 산출물에 대한 수학계의 반응이다. 전문가들은 정리의 가정을 검증하고, 이전 경계와 비교하며, 기존 기법의 결합을 검토해야 한다.

수정이 이루어진다고 해서 실험이 무가치해지는 것은 아니지만, 교훈은 달라질 것이다. 미묘한 결함은 대규모 에이전트 집단과 형식 도구에도 더 강력한 명세 통제가 필요함을 보여줄 것이다. 폭넓은 수용은 Claude가 정당한 연구 결과를 만들어냈다는 Anthropic의 주장을 뒷받침할 것이다.

출판이나 지속적인 전문가 지지는 anthropic techmeme 서사를 강화할 것이다. 독창성 논쟁, 약화된 정리, 또는 철회된 증명은 이를 약화할 것이다. 결정적인 증거는 회사 밖의 연구자들에게서 나와야 한다.

두 번째 신호는 재현성이다. Anthropic은 논문, Lean 코드, 계산 스크립트, 인간 개입에 관한 명확한 설명을 포함해 추론 경로를 재구성할 수 있을 만큼의 정보를 공개해야 한다.

정확한 모델 가중치는 계속 비공개일 수 있지만, 연구 산출물은 여전히 결과를 검토에 노출할 수 있다. 독립 팀은 표준 도구를 사용해 수치 검사를 다시 실행하고 형식 증명을 검증할 수 있어야 한다.

이 실험은 자율성에 관한 주장을 하기 때문에 과정 기록이 중요하다. 연구자들은 모델이 생성한 선택과 인간의 수정, 숨겨진 전문가 프롬프트, 편집적 재구성을 구분해야 한다. 그 기록이 없다면 최종 수학적 주장만 독립적으로 평가할 수 있다.

세 번째 신호는 새로운 문제 전반에 걸친 일반화다. 성공적인 부수 결과 한 건으로 자율 에이전트가 수학을 신뢰성 있게 발전시킨다고 확립할 수는 없다. Anthropic이나 다른 연구소는 성공뿐 아니라 실패도 포함하는 전향적 연구를 보고해야 한다.

유용한 측정 지표로는 실제로 새로운 결과를 내놓는 프로젝트의 비중, 검증에 필요한 전문가 시간, 그럴듯하지만 틀린 주장이 발생하는 빈도 등이 있다. 또 다른 중요한 기준은 시스템이 새로운 기법을 도입하는지, 아니면 알려진 기법을 주로 재조합하는지다.

서로 다른 분야에서 나온 결과는 특히 많은 정보를 제공할 것이다. 해석적 수론은 기호 조작, 문헌 종합, 대규모 계산 탐색에 보상을 준다. 기하학, 위상수학, 확률론, 응용수학은 서로 다른 검증 요구를 만든다.

이 증거가 축적되는 동안 독자들은 두 가지 성급한 결론을 피해야 한다. Claude가 리만 가설을 풀지 못했다고 해서 이번 실행이 무의미한 것은 아니다. 보고된 67.2% 경계 역시 완전한 증명이 가까워졌다는 뜻은 아니다.

더 타당한 해석은 그 양극단 사이에 있다. Anthropic은 공개 문제에 대해 미출시 모델을 시험했고, 초기 전문가 검토를 통과한 더 좁은 주장을 얻은 것으로 보인다. 이를 뒷받침하는 산출물이 검증된다면, 이는 의미 있는 연구 신호다.

개발자에게 실질적인 교훈은 워크플로 설계에 관한 것이다. 장시간 실행되는 에이전트에는 검색, 실행 가능한 테스트, 적대적 검토, 지속 가능한 기록이 필요하다. 유창한 답변만으로는 연구 시스템이 될 수 없다.

지식 노동자에게 이 사례는 AI가 많은 문서와 중간 주장을 종합할 때 추적 가능성이 왜 중요한지를 보여준다. knowledge blending을 지원하는 도구는 증거를 정리할 수 있지만, 그 증거가 무엇을 입증하는지는 여전히 도메인 전문가가 판단해야 한다.

수학자에게 당면한 질문은 구체적이다. 이 증명은 면밀한 검토를 견뎌낼 수 있는가, 그리고 그 방법은 또 다른 경로를 여는가? AI 사용자에게 질문은 더 넓다. 최전선 연구소의 비공개 인프라 없이도 같은 과정으로 유용한 발견을 만들어낼 수 있는가?

Anthropic의 Techmeme 헤드라인은 인상적인 실패와 예상치 못한 결과를 포착했다. 오래 남을 이야기는 헤드라인 이후에 무엇이 일어나는지에 달려 있다. 독립 전문가들이 정리를 검증하고, 연구소들이 전체 연구 과정을 공개할 때 말이다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64)M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page