top of page

Anthropic AI 과학적 발견 주장이 더 엄격한 시험대에 오르다

9월 30일
12분 분량

Anthropic은 약 950개의 Claude 에이전트가 21시간 동안 유전체 데이터를 검색한 끝에 이전에 특성화되지 않은 효소 시스템을 발견했다고 밝혔다. Anthropic의 AI 과학적 발견 주장은 중요하지만, “발견”이라는 단어는 성공적인 데이터베이스 검색보다 더 큰 무게를 지닌다.

Claude는 이례적인 역전사효소를 선택하고 인근 DNA를 조사한 뒤 CRISPR 시스템의 일부를 닮은 반복 구조를 포착했다. 이후 인간 과학자들이 이 후보를 검토하고 실험실 연구를 설계했으며, 모든 물리적 실험을 수행하고 그 증거를 해석했다.

이 역할 분담이 핵심 쟁점을 만든다. Claude는 의미 있는 지적 기여를 한 것으로 보이지만, 이 발견은 생물학적 기능이 알려지지 않은 프리프린트에 여전히 머물러 있다. Anthropic의 기술 보고서에 따르면, 이 검색은 추가로 진행된 10개 캠페인에서 같은 관찰을 재현하지 못했다.

따라서 이 이야기는 하나의 효소 후보를 넘어선다. 기업, 학술지 또는 연구팀이 AI 시스템이 과학적 발견을 했다고 말하기 전에 어떤 증거가 존재해야 하는지 묻는 문제다.

Anthropic과 Claude가 실제로 발견한 것

Claude는 논문을 요약하는 수준을 넘어섰지만, 독립적인 과학 조사를 완결한 것은 아니다.

Anthropic은 2026년 봄 분자생물학 연구 그룹을 만들었다. 베이 에어리어의 이 연구실은 Claude의 계산 기반 검색과 인간 과학자가 수행하는 물리적 실험을 결합한다.

이 그룹은 특성화되지 않은 생물학적 시스템을 찾기 위해 유전체 데이터베이스를 검색한다. 유전체 데이터베이스에는 생물, 바이러스, 환경 시료의 DNA 염기서열이 들어 있으며, 그중에는 기능이 아직 밝혀지지 않은 유전자도 많다.

첫 공개 프로젝트에서 Anthropic은 Claude에게 역전사효소를 조사하도록 요청했다. 역전사효소, 즉 RT는 RNA를 DNA로 복사하는 효소다.

회사는 Claude의 에이전트가 20만 개가 넘는 RT 염기서열을 수집했다고 말한다. 이들은 약 3,500개의 후보 시스템을 식별하고, 상세 보고서 작성을 위해 범위를 20개 후보로 좁혔다.

이 캠페인에는 약 950개의 병렬 에이전트가 사용됐고, 21시간 동안 실행됐으며, 약 2억 1,000만 토큰을 소비했다. 이 수치는 Anthropic이 제시한 것으로, 독립적인 운영 검증을 받지는 않았다.

한 Claude 에이전트는 거대 박테리오파지에서 발견된 특이한 RT 주변의 원시 DNA를 조사했다. 박테리오파지는 박테리아를 감염시키는 바이러스이며, 거대 파지는 유전체가 유난히 크다.

이 에이전트는 RT 옆에서 반복되는 DNA 염기서열의 긴 배열을 발견했다. 또한 파트너 단백질을 암호화할 가능성이 있는 인접 유전자도 식별했다.

Claude는 반복 서열의 수를 세고 간격을 조사했으며, 유전체 배열을 알려진 시스템과 비교하고 관련 문헌을 검색했다. 그 후 이 후보를 인간 검토에 제출했다.

Anthropic은 이 세 부분으로 구성된 배열을 배열 연관 역전사효소, 즉 ART라고 명명했다. 이 시스템은 RT, 인접한 파트너 유전자, 그리고 반복 DNA 염기서열 배열로 구성된다.

회사의 실험실 실험은 반복 배열이 서로 구별되는 짧은 RNA 분자로 전사된다는 사실을 발견했다. 이 관찰은 구성 요소들이 우연히 같은 영역을 차지한 것이 아니라 하나의 생물학적 시스템에 속한다는 견해를 뒷받침한다.

Anthropic은 두 시스템 모두 RNA를 생성하는 반복 서열을 포함한다는 점에서 이 배열이 CRISPR를 연상시킨다고 설명한다. 그러나 이 수준의 유사성만으로 동등한 기능이 입증되지는 않는다.

연구자들은 ART가 DNA를 절단하는지, 특정 염기서열을 표적하는지, 유전자를 편집하는지, 또는 바이러스에 대한 면역을 제공하는지를 보여주지 못했다. 자연 상태에서의 기능은 여전히 알려지지 않았다.

회사는 9월 23일 효소 발표에서 결과를 공개했다. 또한 동료 심사를 거친 논문이 아닌 기술 프리프린트를 공개했다.

이 차이는 중요하다. 현재 증거는 이전에 특성화되지 않았던 유전체 배열과 그에 연관된 RNA 산물을 뒷받침한다. 아직 ART를 새로운 유전자 편집 메커니즘으로 묘사할 근거는 되지 않는다.

그럼에도 Claude의 기여는 일반적인 문헌 검색보다 더 실질적인 것으로 보인다. 핵심 관찰은 Anthropic의 초기 프롬프트에 포함되지 않았다. 한 에이전트가 주변 DNA를 조사하기로 선택하고 반복 배열을 잠재적으로 의미 있는 것으로 해석했다.

이것이 Anthropic의 AI 과학적 발견 주장 가운데 가장 강력한 부분이다. 모델은 인간이 제공한 답을 단순히 순위 매기지 않았다. 방향을 선택하고, 이상 징후를 포착하며, 검증 가능한 생물학적 가설을 구성했다.

한계는 다음 단계에서 드러난다. 인간은 어떤 연구 분야를 탐색할지 결정하고, 에이전트 인프라를 구축했으며, 보고서를 검토하고, 살아남은 후보를 선택해 실험을 수행했다.

이 사건은 인간이 통제하는 발견 시스템 안에서 AI가 발원한 단서로 이해하는 것이 가장 적절하다. 이것이 더 짧은 표현인 “AI 발견”이라는 이름을 받을 만한지는 적용하는 기준에 달려 있다.

Anthropic AI 과학적 발견의 검증 기준

신뢰할 수 있는 AI 발견에는 참신성, 인과적 기여, 검증, 재현성, 투명한 출처 추적이 필요하다.

과학적 발견은 하나의 행위가 아니다. 문제를 선택하고, 패턴을 식별하며, 설명을 제안하고, 그 설명을 시험하고, 다른 연구자들에게 결과가 실재함을 설득하는 과정을 포함한다.

AI 시스템이 가치 있는 기여를 하려면 모든 단계를 수행할 필요는 없다. 인간 연구자 역시 팀, 도구, 데이터베이스, 전문 연구실에 걸쳐 과학적 업무를 분담한다.

더 어려운 질문은 인과적 중요성에 관한 것이다. Claude가 프로젝트의 경로를 바꿨는가, 아니면 결국 같은 결과를 낳았을 단계를 자동화했을 뿐인가?

이 가능성들을 구분하는 데 다섯 가지 검증 기준이 도움이 될 수 있다.

첫 번째 기준은 참신성이다. 결과는 이미 공개 문헌에서 확인할 수 있거나 입력값에 명확히 담겨 있던 내용을 넘어서는 무언가를 더해야 한다.

Anthropic은 보고서에서 ART를 세 부분으로 구성된 시스템으로 설명한 선행 출판물을 찾지 못했다고 밝혔다. 이는 공식 과학 기록에서의 참신성을 뒷받침한다.

하지만 공개 문헌에 없다는 것은 인간의 지식에 없다는 것과 같지 않다. 연구자들은 일상적으로 미공개 결과, 논문 초안, 학회 논의, 미완성 분석을 보유한다.

두 번째 기준은 지적 기여다. AI는 조사를 실질적으로 바꾸는 결정을 내려야 한다.

Claude는 이 기준의 일부를 충족한다. 초기 프롬프트는 흥미로운 RT 시스템을 요청했지만, 에이전트들에게 핵심 반복 배열을 찾으라고 지시하지는 않았다. 한 에이전트가 인근 DNA를 읽기로 선택하고 예상치 못한 구조를 표시했다.

이 결정은 중요하다. 전통적인 염기서열 검색 파이프라인도 관련 효소를 수집할 수는 있지만, 이들의 유전체 주변 환경을 해석하지는 못할 수 있다. Claude는 여러 단서를 더 큰 생물학적 제안으로 연결했다.

세 번째 기준은 실험적 검증이다. 계산적으로 포착된 패턴은 물리적 실험이 가설이 예측한 증거를 만들어낼 때 더욱 설득력을 얻는다.

Anthropic의 인간 과학자들은 반복 배열과 연관된 짧은 RNA 산물을 발견했다. 이 결과는 배열이 생물학적으로 활성 상태라는 주장을 강화한다.

그러나 이는 초기 단계의 검증에 머문다. 이 실험은 시스템의 주된 기능, 표적, 또는 파트너 단백질의 역할을 확립하지 못한다.

네 번째 기준은 재현성이다. 다른 팀이 문서화된 조건에서 결과 또는 과정을 반복할 수 있어야 한다.

다른 연구자들도 ART의 유전체 염기서열을 조사할 수 있다. 독립적인 연구실은 반복 서열이 RNA를 생성하는지 시험할 수도 있다.

발견 과정 자체는 재현성이 낮다. Anthropic은 검색 캠페인을 10회 재실행했지만, 그 어느 캠페인도 핵심 반복 배열을 다시 발견하지 못했다고 전했다.

관련 유전자 좌위는 대부분의 재실행에서 나타났지만, 에이전트들은 결정적 패턴이 포함된 상류 DNA를 조사하지 않았다. 이는 최초의 성공이 드문 조사 선택에 의존했음을 뜻한다.

드문 성공도 발견일 수 있다. 많은 인간의 발견에는 우연, 호기심, 또는 다른 사람이 지나친 무언가를 연구자가 알아차리는 일이 관여한다.

그러나 10회의 재실행 실패는 Anthropic이 신뢰할 수 있는 발견 엔진을 구축했다는 더 광범위한 주장을 약화시킨다. 이는 하나의 경로에서 역량을 보였을 뿐, 반복 캠페인 전반에서 신뢰할 수 있는 성능을 보여준 것은 아니다.

다섯 번째 기준은 출처 추적이다. 연구자들은 어떤 모델이 어떤 데이터를 받았는지, 어떤 도구를 사용했는지, 인간이 무엇을 변경했는지, 후보가 어떻게 선택됐는지를 보여주는 기록이 필요하다.

언어 모델의 학습 데이터는 실험실 노트처럼 쉽게 조사할 수 없기 때문에 출처 추적은 특히 중요하다. 관련 정보가 불분명한 경로를 통해 모델에 영향을 미쳤더라도 결과는 새롭게 보일 수 있다.

이 다섯 기준은 이분법적 판정보다 더 유용한 설명을 제공한다. Claude는 잠재적으로 새로운 단서를 생성하고, 중요한 관찰에 기여했으며, 검증 가능한 가설의 형성에 도움을 줬다.

인간은 연구 목표, 평가 기준, 실험실 증거, 과학적 책임을 제공했다. Claude의 구체적 기여가 이례적으로 자율적이었더라도, 전체 결과는 협업의 산물이다.

이 프레임워크는 완전한 독립성을 요구하는 비생산적인 기준도 피한다. 과학자들은 도구, 동료, 선행 논문, 소프트웨어, 제도적 지식에 의존한다. AI 시스템 역시 더 큰 연구 조직 안에서 작동하게 될 것이다.

관련 기준점은 Claude가 혼자 일했는지가 아니다. 전문가들이 사전에 구체적으로 지시하지 않았고, 이후 증거가 뒷받침한 추적 가능한 기여를 시스템이 했는지가 중요하다.

이제 가장 논쟁적인 증거는 참신성이다

핵심 논쟁은 DNA 패턴의 존재 여부가 아니라, Claude가 연구자들이 이미 알고 있던 사실에 독립적으로 도달했는지에 있다.

Anthropic이 ART를 발표한 뒤 코펜하겐대학교 계산생물학자 Mario Rodríguez Mestre는 이 독창성 서사에 이의를 제기했다.

Rodríguez Mestre는 자신의 그룹이 약 4년 동안 관련 역전사효소와 연관 분자를 연구해 왔다고 말했다. 그의 팀은 이 효소들에 “jumbotrons”라는 비공식 명칭을 사용했다.

그는 또한 그룹 구성원들이 연구 지원을 위해 모델을 사용하는 과정에서 Claude에 미공개 자료를 제공했다고 말했다. 이 자료에는 논문 초안과 실험 정보가 포함된 것으로 전해졌다.

따라서 그의 우려는 구체적이다. Claude가 공개 유전체 데이터로부터 독립적으로 추론했을 수도 있고, 반대로 미공개 인간 연구가 알 수 없는 경로를 통해 출력에 영향을 미쳤을 수도 있다.

Anthropic은 ART 시스템을 설명한 공개 연구를 알지 못했다고 반박했다. 회사는 또한 Claude가 고객 대화 기록으로 학습되지 않았으며, 분자생물학 팀은 해당 대화에 접근할 수 없다고 밝혔다.

독립 보도에서 다뤄진 상반된 설명은 출처 추적 문제를 해소하지 못한다.

Rodríguez Mestre의 미공개 연구가 Anthropic의 발견을 자동으로 무효화하는 것은 아니다. 특히 같은 공개 데이터 세트를 조사할 때 독립 연구 그룹이 유사한 결과에 도달하는 일은 흔하다.

그의 설명은 현재 AI 발견 주장에 존재하는 약점을 드러낸다. 기업은 프롬프트와 에이전트 기록을 문서화할 수 있지만, 모델 개발 과정에서 내재된 정보에 대한 완전한 설명을 제공하지 못할 수 있다.

이로 인해 몇 가지 별개의 참신성 문제가 생긴다.

출판물 기준의 참신성은 결과가 공식 문헌에 나타나는지를 묻는다. Anthropic은 완전한 ART 배열을 설명한 이전 논문을 찾지 못했다고 밝혔다.

데이터 신규성은 기존 유전체 기록에서 해당 패턴이 보였는지를 묻는다. 그랬다. Claude가 공개 시퀀스 데이터를 검색해 이를 찾아냈기 때문이다.

해석 신규성은 누군가 이미 그 구성 요소들을 하나의 생물학적 시스템으로 인식했는지를 묻는다. 이 지점에는 이견이 있다.

모델 신규성은 Claude가 캠페인 중 해석을 도출했는지, 아니면 이전에 습득한 지식을 재현했는지를 묻는다. 공개된 증거만으로는 이 질문에 단정적으로 답할 수 없다.

이 범주들이 하나로 뭉뚱그려지면 과학적 공로의 귀속은 어려워진다. 패턴은 오래된 데이터에 존재할 수 있지만, 그 해석은 새로울 수 있다. 또 다른 팀이 한 그룹이 비공개적으로 먼저 도달한 뒤에도 유효한 독립 발견을 발표할 수 있다.

이 논쟁은 AI 연구 시스템에 매끈하게 다듬어진 대화 기록 발췌본보다 더 강력한 공개가 필요한 이유를 보여준다. 팀은 모델 버전, 데이터 접근, 검색 출처, 인간의 개입, 후보 필터, 알려진 노출 위험을 밝혀야 한다.

연구자들에게는 기밀 작업을 위한 정책도 필요하다. 과학자들은 코딩, 편집, 데이터 분석, 문헌 검토에 범용 어시스턴트를 점점 더 많이 활용하고 있다. 이들은 저장, 학습, 검색, 조직 내 접근에 관한 명확한 보장을 필요로 한다.

이 문제는 Anthropic에만 국한되지 않는다. AI 공급업체는 연구소를 운영하고 연구를 발표하며 외부 과학자에게 도구를 판매할 수도 있다. 기술적 보호 장치가 데이터 유출을 막더라도 이러한 역할은 이해상충으로 인식될 수 있다.

따라서 신뢰는 기업의 부인만이 아니라 감사 가능한 분리에 달려 있다. 공급업체는 외부 연구자들이 평가할 수 있도록 데이터 통제를 충분히 이해 가능한 방식으로 제시해야 한다.

연구팀은 AI 상호작용을 정보 거버넌스 시스템의 일부로 다뤄 자신을 보호할 수 있다. 프롬프트, 업로드한 초안, 모델 출력, 접근 정책은 실험실 기록과 함께 검색 가능한 지식 베이스에 포함되어야 한다.

이 관행이 숨겨진 학습 데이터를 밝혀낼 수는 없다. 하지만 연구 그룹이 무엇을 공유했는지, 언제 공유했는지, 어떤 모델이 해당 자료를 처리했는지는 확립할 수 있다.

경쟁 연구가 발표되기 전까지 ART 독창성 논쟁은 해결되지 않은 상태로 남는다. 그렇다고 Claude의 문서화된 검색 행동을 지워서도, 사소한 커뮤니케이션 문제로 치부해서도 안 된다.

신규성은 발견의 토대 중 하나다. 연구자들이 AI가 도출한 아이디어의 출처를 감사할 수 없다면, 아무리 강력한 헤드라인도 취약한 상태로 남을 것이다.

한 번의 행운보다 신뢰성이 더 중요하다

한 번의 성공적인 캠페인은 Claude가 발견에 기여할 수 있음을 보여주지만, 열 번의 실패는 Anthropic이 아직 재현 가능한 과정을 약속할 수 없음을 보여준다.

재실행 실패는 각주가 아니다. 이는 인상적인 시연과 신뢰할 수 있는 과학 시스템의 차이를 규정한다.

Claude의 원래 캠페인은 방대한 의사결정 트리를 탐색했다. 에이전트는 단백질 패밀리를 선택하고, 유전체 이웃을 추적하며, 후보를 제외하고, 어떤 원시 시퀀스를 더 면밀히 살펴볼지 결정했다.

결정적인 경로에는 관련 상류 DNA를 읽는 선택이 포함된 경우가 단 한 번뿐이었다. 이어 모델은 반복 배열을 포착하고 이를 인접한 RT와 연결했다.

이는 인간의 우연한 발견과 닮았다. 과학자는 한 샘플이 특이해 보였기 때문에, 또는 예상치 못한 결과가 추가 검사를 촉발했기 때문에 중요한 관찰을 할 수 있다.

과학은 원래의 사고 과정이 동일하게 재현될 것을 요구하지 않는다. 그 대신 결과로 나온 주장이 독립적인 검토를 견뎌낼 것을 요구한다.

그런 이유로 Claude가 ART를 다시 발견하지 못하더라도 ART는 과학적으로 흥미로울 수 있다. 에이전트가 다른 경로를 택한다고 해서 생물학적 배열이 사라지는 것은 아니다.

다만 재실행 실패는 제품 및 역량 주장에는 여전히 중요하다. 실패율을 알지 못한 채 예측 불가능하게 성공하는 에이전트를 중심으로 연구 역량을 계획할 수는 없다.

Anthropic이 보고한 퍼널은 이 문제를 잘 보여준다. 20만 개가 넘는 RT가 3,500개의 후보가 되었고, 이어 20개의 상세 보고서로 좁혀진 뒤 단 하나의 결정적 관찰로 이어졌다.

완전한 평가는 성공 사례만으로는 충분하지 않다. 거짓양성, 알려진 시스템의 중복, 주석 오류, 폐기된 보고서, 과학자 검토 시간, 컴퓨팅 사용량, 실험실 비용도 포함해야 한다.

부정적인 캠페인 결과도 보고해야 한다. 성공한 검색만 공개하면 불안정한 시스템이 실제보다 더 신뢰할 수 있어 보일 수 있다.

이는 자율 연구 에이전트가 마주한 검증 격차다. 모델은 전문가가 확인할 수 있는 속도보다 훨씬 빠르게 가설을 생성할 수 있다.

Anthropic에 따르면 하나의 캠페인은 수백 또는 수천 개의 후보 보고서를 생성할 수 있다. 추가되는 모든 보고서는 전문가의 관심, 실험 재료, 실험실 시간, 안전성 검토를 두고 경쟁한다.

따라서 병목은 이동한다. AI는 가능성을 제안하는 비용을 줄이지만, 어떤 가능성이 신뢰할 만한지 결정하는 비용은 늘릴 수 있다.

이 변화는 연구자들이 무엇을 최적화해야 하는지를 바꾼다. 순위 시스템이 한정된 실험 자원을 더 나은 후보로 이끌 때에만 더 많은 가설 생성이 유용하다.

신뢰할 수 있는 벤치마크는 이전까지 공개되지 않은 발견이나 결과가 알려진 데이터세트를 사용해야 한다. AI는 답을 보지 않은 상태에서 관련 단서를 식별해야 하며, 평가자는 재현율, 정밀도, 비용, 전문가 노동을 측정해야 한다.

전향적 연구는 한층 더 강력한 시험을 제공한다. 팀은 연구 목표를 등록하고, 모델과 에이전트 시스템을 고정하며, 평가 규칙을 공개한 다음, 실험 결과가 나오기 전에 모든 후보를 기록할 수 있다.

독립 재현은 또 하나의 층위를 더한다. 외부 실험실은 어떤 단서가 인간에서 나왔고 어떤 단서가 AI에서 나왔는지 모르는 상태에서 선정된 단서를 시험할 수 있다.

이러한 관행이 까다롭게 들리는 이유는 과학적 발견 자체가 까다로운 일이기 때문이다. 챗봇 벤치마크는 하나의 정답을 받아들일 수 있다. 생물학 연구는 오염된 샘플, 잡음이 많은 분석법, 불완전한 주석, 대안적 설명을 다뤄야 한다.

신뢰성은 단계별로도 다르다. Claude는 대규모 시퀀스 컬렉션 검색에는 효과적일 수 있지만, 실험 대조군 선정이나 모호한 실험실 결과 해석에는 덜 신뢰할 수 있다.

정직한 평가는 이러한 역량을 별도로 보고해야 한다. 전체 시스템을 자율적이라고 부르면 인간이 판단을 제공하는 지점과 모델이 실제로 잘 수행하는 지점이 가려진다.

ART 캠페인이 현재 뒷받침하는 결론은 제한적이다. Claude는 때때로 공개 유전체 데이터를 탐색하고, 지시되지 않은 구조적 패턴을 포착하며, 시험할 가치가 있는 가설을 정식화할 수 있다.

이는 Claude가 중요한 생물학을 반복해서 찾아내거나, 전문가 검토를 대체하거나, 엔드투엔드 실험실 조사를 수행한다는 사실을 입증하지는 않는다.

그처럼 제한적인 결론도 여전히 의미가 있다. 대부분의 실용 기술은 엔지니어링이 신뢰성을 확보하기 전에 일관성 없이 작동하는 역량으로 시작한다.

Anthropic의 다음 과제는 또 하나의 기억에 남는 대화 기록을 만드는 일이 아니다. 드문 성공을 측정 가능한 연구 성과로 전환하는 일이다.

AI 연구소는 동일한 연구 모델로 수렴하고 있다

Anthropic은 가설 생성 에이전트를 실험적 검증과 연결하려는 더 광범위한 경쟁에 합류하고 있다.

Google은 여러 전문 에이전트를 기반으로 한 AI 공동 과학자를 개발했다. 연구 목표가 주어지면 이 시스템은 가설을 생성하고, 비판하고, 순위를 매기고, 개선한다.

발표된 Co-Scientist 연구는 신규성, 개연성, 검증 가능성, 안전성을 포함한 기준을 설명한다. 도메인 전문가는 여전히 연구 목표를 정의하고 결과물을 평가한다.

이전 시스템들은 언어 모델을 실험실 하드웨어와 연결했다. 2023년의 한 화학 에이전트는 기술 문서를 검색하고, 절차를 계획하며, 자동화 장비에 명령을 내렸다.

이 프로젝트들은 자율성과 과학적 범위에서 차이가 있지만 하나의 아키텍처를 공유한다. AI가 검색과 계획을 맡고, 도구가 계산 작업을 실행하며, 인간 또는 기계가 실험을 수행한다.

Anthropic의 접근 방식은 물리적 실험실에서 의도적으로 인간이 운영하도록 유지된다. 회사는 프로젝트가 완전 자동화에 맞지 않는 유연한 절차를 포함하기 때문에 자사 과학자들이 모든 습식 실험을 수행한다고 말한다.

이 설계는 실용적인 안전장치를 제공한다. 훈련된 생물학자들은 약한 가설을 기각하고, 실험 문제를 포착하며, 안전하지 않거나 무의미한 절차를 막을 수 있다.

동시에 공로 귀속을 복잡하게 만든다. 인간의 판단은 Claude의 기여 전후에 개입하지만, 회사는 최종 결과를 AI 발견이라는 단수 표현으로 설명한다.

더 나은 비교 대상은 AI 과학자와 인간 과학자가 아니다. 하나의 연구 조직과 다른 연구 조직이다.

한 조직은 기존 생물정보학을 활용하는 과학자 다섯 명을 고용할 수 있다. 다른 조직은 수백 개의 모델 세션을 조율하는 과학자 다섯 명을 고용할 수 있다. 이들의 상대적 가치는 시간, 비용, 전문가 관심 단위당 검증된 발견에 달려 있다.

이러한 조직적 관점은 압박을 받는 주체도 보여준다.

생물정보학 플랫폼은 시퀀스 데이터와 분석 도구에 대해 에이전트 친화적인 접근을 더 많이 제공하라는 요구에 직면할 것이다. 실험실 자동화 기업은 제어, 권한, 완전한 활동 로그를 보존하는 인터페이스를 마련해야 한다.

출판사는 더 명확한 기여 명세를 필요로 하게 될 것이다. 기존 저자 목록은 모델이 연구 방향을 선택했는지, 실험을 설계했는지, 데이터를 분석했는지, 아니면 단지 문장을 편집했는지를 좀처럼 설명하지 못한다.

대학에는 기밀 자료를 위한 규칙이 필요하다. 기관 정책이 모든 AI 상호작용을 비공식 대화로 취급한다면 연구자들은 우선권 분쟁을 평가할 수 없다.

연구비 지원 기관도 AI 비중이 큰 프로젝트가 진정한 지식을 만들어내는지, 아니면 저비용 가설로 검토자를 압도하는지 물을 수 있다. 제안서 평가는 검증 역량에 관한 더 강력한 증거를 필요로 할 것이다.

OECD가 개발한 자동화 프레임워크는 이러한 질문 다수를 예상했다. 과학 자동화는 개별 모델 출력이 아니라 워크플로 전반에 걸쳐 평가되어야 한다.

따라서 경쟁 우위는 모델 지능만이 아니라 통합에서 나올 수 있다. 가치 있는 시스템에는 신뢰할 수 있는 데이터 접근, 도메인 도구, 실험 역량, 엄격한 기록이 필요하다.

Anthropic의 연구소는 네 가지 구성 요소를 모두 갖추고 있다. 이 회사는 자사 과학자들이 어떤 가설을 받아들이거나 기각하는지에 따라 에이전트 지침을 업데이트할 수 있다.

이 피드백 루프는 상업적으로나 과학적으로 중요하다. 회사는 전문가의 판단을 이후 검색을 위한 더 나은 절차로 전환할 수 있다.

이는 외부 평가를 더 중요하게 만들기도 한다. 비공개 연구소는 공개되지 않는 실패를 관찰하고 시스템을 개선한 뒤 가장 강력한 사례만 발표할 수 있다.

동료 심사는 이 불균형을 부분적으로 해결하지만, 전통적 심사는 최종 과학적 주장만 검토한다. 모델의 학습 노출, 에이전트 로그, 선택 퍼널, 폐기된 후보까지 감사하지는 않을 수 있다.

새로운 보고 기준은 생물학과 발견 과정 모두를 다뤄야 한다. 그렇지 않으면 독자는 효소 시스템은 검증할 수 있어도 누가 이를 발견했는지에 관한 주장은 검증할 수 없다.

세 가지 신호가 이 주장의 성립 여부를 결정할 것이다

다음 증거는 생물학적 가치, 독립적 신규성, 반복 가능한 AI 성능을 보여줘야 한다.

첫 번째 신호는 ART의 기능적 특성 규명이다.

Anthropic의 현재 실험은 반복 배열이 짧은 RNA를 생성한다는 점을 보여준다. 연구자들은 여전히 RT가 무엇을 복제하는지, 이웃 단백질이 무엇을 하는지, 그리고 이 시스템이 다른 분자를 표적으로 삼는지를 밝혀야 한다.

일관된 생물학적 기능의 증거는 결과의 과학적 중요성을 강화할 것이다. 그렇다고 ART가 CRISPR처럼 작동한다는 점이 자동으로 입증되는 것은 아니다.

프로그래밍 가능한 활동이 확인된다면 그 중요성은 한층 커질 것이다. 그러나 현재 ART가 유전자를 편집하거나 생명공학 플랫폼이 될 수 있다는 주장을 뒷받침하는 증거는 없다.

두 번째 신호는 Copenhagen 그룹과 다른 독립 연구자들의 논문 발표다.

이들의 결과는 동일한 시스템이 이미 알려져 있었는지, 그 특성 규명이 어디까지 진행됐는지, 그리고 그 해석이 Anthropic의 해석과 일치하는지를 분명히 할 수 있다.

문서화된 타임라인이 중요해질 것이다. 초안 작성일, 실험 기록, 서열 식별자, 학회 자료, Claude 상호작용 로그는 동시 발견과 사전 지식을 구분하는 데 도움이 될 수 있다.

Anthropic은 상세한 출처 경위 설명을 제공함으로써 자신의 입장을 강화할 수 있다. 이 설명에는 에이전트가 어떤 공개 리소스에 접근했는지와 고객 데이터가 어떻게 배제됐는지가 담겨야 한다.

각 그룹이 독립적으로 이 시스템을 식별했다면, 이 사례는 익숙한 과학적 패턴을 닮게 될 것이다. 새로운 데이터나 도구가 문제를 해결 가능하게 만들면 여러 팀이 같은 결론에 도달하는 경우가 흔하다.

반대로 미공개 연구가 Claude에 영향을 미쳤다면, 이 사건은 기밀 연구에 상용 AI 시스템을 사용하는 데 대한 경고가 될 것이다. 과학적 결과 자체는 유효할 수 있지만, 그 공로의 귀속은 크게 달라질 수 있다.

세 번째 신호는 Anthropic의 에이전트 워크플로를 전향적으로 재현하는 일이다.

Anthropic은 에이전트나 평가자가 답을 알지 못하는 분야를 대상으로 추가 탐색을 수행해야 한다. 과제를 등록하고, 모든 실행 기록을 보존하며, 성공률을 공개해야 한다.

가장 강력한 연구는 Claude 에이전트를 전문가 팀, 기존 생물정보학 파이프라인, 더 단순한 언어 모델 워크플로와 비교하는 방식일 것이다. 각 그룹에는 동일한 데이터와 평가 기간이 주어져야 한다.

연구자들은 이후 중요한 결과를 측정할 수 있다. 검증된 새로운 후보, 거짓 양성, 발견까지 걸린 시간, 컴퓨팅 사용량, 실험실 투입 노력, 전문가 검토 시간 등이 이에 해당한다.

반복된 성공은 Anthropic의 AI 과학 발견 서사를 강화할 것이다. 반대로 희귀하고 재현 불가능한 경로에 계속 의존한다면, 더 제한적인 설명이 타당해진다. Claude는 유용한 탐색 도구라는 설명이다.

이처럼 제한적인 역할을 실패로 여겨서는 안 된다. 과학 장비는 인간적인 의미의 발견자가 되지 않더라도 연구를 변화시킬 수 있다.

발견이라는 언어는 자금 지원, 대중의 기대, 과학적 공로, 신뢰를 형성하기 때문에 중요하다. 기업은 모델에 행위성을 부여할 때 주목을 받지만, 인간 기여자는 제품명 뒤로 사라질 수 있다.

공정한 기준은 주변의 기관과 조직이 존재하지 않는 척하지 않으면서도 의미 있는 기계의 기여를 인정해야 한다.

현재로서는 Claude가 중요한 문턱을 넘은 것으로 보인다. 인간 과학자들이 무엇을 시험할지 바꾸게 만든, 지시받지 않은 관찰을 했기 때문이다.

그러나 모든 문턱을 넘은 것은 아니다. 기능은 여전히 알려지지 않았고, 독창성은 논쟁 중이며, 연구는 동료 심사를 기다리고 있고, 반복된 캠페인에서는 결정적인 단서를 놓쳤다.

따라서 가장 방어 가능한 결론은 조건부다. AI 시스템의 새롭고 추적 가능한 결정이 검증된 결과를 실질적으로 형성하고 독립적 검증을 견뎌낼 때, 그 시스템은 발견 공로를 받을 수 있다.

Anthropic은 그 결정과 초기 검증에 관한 증거를 제시했다. 그러나 과학 공동체에 독창성, 출처 경위, 재현 가능성에 관한 더 강한 증거를 제시해야 할 책임은 여전히 남아 있다.

독자들은 명칭이 아니라 실험을 지켜봐야 한다. ART는 명확히 정의된 기능을 획득하는가? 외부 연구실이 이를 확인하는가? Claude는 전향적 시험에서 비슷하게 가치 있는 후보를 만들어낼 수 있는가?

이 질문들에 대한 답이 이것이 우연히 나온 AI 보조 관찰이었는지, 아니면 신뢰할 수 있는 연구 방법의 시작이었는지를 결정할 것이다. 그때까지 “AI scientific discovery”는 확정된 성취가 아니라 검증 중인 주장으로 표현돼야 한다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page