top of page

Anthropic AI 과학적 발견, 인간 현실의 검증대에 오르다

9월 28일
12분 분량

Anthropic은 약 950개의 AI 에이전트가 21시간 동안 유전체 데이터를 탐색해 특이한 효소 시스템을 식별한 뒤 Claude가 과학적 발견을 했다고 밝혔다. Anthropic의 AI 과학적 발견은 주목할 만한 실체가 있지만, “자율적”이라는 표현은 현재 공개된 증거가 뒷받침하는 것보다 더 큰 의미를 담고 있다.

Claude는 박테리아를 감염시키는 바이러스인 박테리오파지에서, 이전에 특성이 규명되지 않았던 유전자와 반복 DNA 서열의 배열을 발견했다. Anthropic은 이 시스템을 array-associated reverse transcriptases, 즉 ARTs라고 명명했다. 이후 인간 과학자들이 유력 후보를 선정하고, 실험실 작업을 설계하거나 수행했으며, 결과를 해석하고 아직 심사를 거치지 않은 프리프린트를 발표했다.

이러한 역할 분담은 중요하다. Claude는 단순히 논문을 요약하거나 과학자의 제한적인 질문에 답하는 수준을 넘어섰다. 원시 생물학 데이터를 탐색하고, 수천 개의 후보를 걸러내며, 예상 밖의 패턴을 찾아냈다. 그러나 Anthropic 연구진은 여전히 연구 방향, 실험실 인프라, 판단, 물리적 검증을 제공했다.

따라서 이 결과는 두 가지 단순한 서사를 모두 흔든다. 언어 모델은 텍스트를 재조합할 뿐이라는 주장보다 강력하지만, 독립적인 기계 과학자라는 관념보다는 약하다. 가장 정확한 설명은 인간이 설계한 과학적 과정 안에서 AI가 주도한 계산 기반 탐색이라는 것이다.

Anthropic과 Claude가 실제로 발견한 것

Claude는 신뢰할 만한 생물학 연구 단서를 식별했을 뿐, 완성된 유전자 편집 기술이나 충분히 설명된 분자 메커니즘을 제시한 것은 아니다.

Anthropic은 2026년 9월 23일 새로운 생명과학 연구 그룹과 분자생물학 연구실을 발표하며 이 발견을 공개했다. 회사에 따르면 베이 지역의 이 연구실은 위험도가 낮은 BSL-1 및 BSL-2 연구를 수행한다. 모든 물리적 실험은 인간 과학자가 수행한다.

프로젝트는 인간이 제시한 광범위한 지시에서 시작됐다. Anthropic 연구진은 Claude에게 대규모 DNA 데이터베이스에서 흥미로운 역전사효소 사례를 찾도록 요청했다. 역전사효소는 RNA를 DNA로 복제하는 효소다.

Anthropic은 21시간의 계산 작업 동안 약 950개의 Claude 에이전트를 조율했다. 이들은 합쳐 약 2억 1,000만 토큰을 사용했다. 에이전트들은 20만 개가 넘는 역전사효소를 수집하고 3,500개의 후보 시스템을 식별했다.

그 후 이들은 더 깊은 분석과 사람이 읽을 수 있는 보고서를 위해 해당 집합을 20개의 후보로 좁혔다. Anthropic은 이에 상응하는 유전체 마이닝 작업이 숙련된 과학자에게 수주 또는 수개월이 걸릴 수 있다고 말한다.

한 에이전트는 거대 파지에서 발견된 특이한 역전사효소에 주목했다. 이 효소 자체는 이전 연구에 등장한 바 있으므로 Claude가 단백질 자체를 발견한 것은 아니다. Claude의 기여는 기존 연구자들이 특성화하지 못했던 더 큰 배열을 인식한 데 있다.

Claude는 효소 유전자 옆에서 파트너 유전자와 균등한 간격으로 배열된 DNA 반복 서열을 발견했다. 이 반복 서열은 CRISPR 시스템과 연관된 구조의 일부를 닮았다.

CRISPR는 과학자들이 프로그래밍 가능한 유전자 편집 도구로 발전시킨 자연적 미생물 방어 시스템이다. 이 반복 배열은 연관 단백질을 특정 유전적 표적으로 유도하는 RNA 가이드를 생성하는 데 도움이 된다.

보고된 ART 배열은 역전사효소, 인접한 보조 유전자, 긴 반복 배열의 세 가지 구성 요소로 이뤄진다. Anthropic의 초기 실험은 이 배열이 서로 분리된 짧은 RNA 분자를 생성한다는 점을 시사한다.

이 관찰이 ART를 과학적으로 흥미롭게 만든다. RNA 분자가 시스템의 활동을 유도하거나 영향을 미칠 가능성을 제기하기 때문이다. 다만 연구진은 아직 이 시스템의 자연적 생물학적 역할을 확립하지 못했다.

Anthropic은 ART가 박테리오파지 내부나 감염된 세균 세포에서 무엇을 하는지 알지 못한다. 또한 연구자들이 이 시스템을 프로그래밍하거나 선택한 DNA로 유도하거나 안전하게 활용할 수 있다는 점도 보여주지 못했다.

회사의 자체 연구 발표도 이 간극을 인정한다. 이 시스템이 CRISPR를 연상시키는 특성을 지닌다고 말하면서도, 기능은 여전히 알려지지 않았다고 밝힌다.

함께 공개된 기술 프리프린트는 Anthropic이 결과를 공개했을 당시 동료 심사를 마치지 않은 상태였다. 동료 심사가 모든 의문을 해결하지는 않겠지만, 방법과 해석을 독립적인 전문가들의 검토에 노출할 수 있다.

MIT 교수이자 CRISPR 선구자인 Feng Zhang은 Anthropic의 발표 전에 프리프린트를 검토했다. 그는 RNA-반복 서열의 연관성을 “진정으로 흥미롭다”고 평가하며, 추가 조사가 필요하다고 말했다.

이는 의미 있는 지지이지만 의도적으로 제한적인 평가다. “흥미롭다”는 말은 이것이 유용하거나, 프로그래밍 가능하거나, 유전자 편집 메커니즘으로 검증됐다는 뜻이 아니다. 이 패턴이 더 많은 실험을 정당화한다는 의미다.

그러므로 정확한 사건의 범위는 헤드라인 버전보다 좁다. Claude의 효소 발견은 새로운 후보 분자 시스템과 그 반복 배열이 RNA로 발현된다는 초기 증거를 만들어냈다. 그 메커니즘과 활용 가치는 여전히 열린 질문이다.

Anthropic AI 과학적 발견이 중요한 이유

중요한 변화는 소프트웨어가 과학자를 대체했다는 점이 아니라, 범용 AI 시스템이 이례적으로 거대한 생물학 탐색 전반에서 유용한 판단을 내렸다는 점이다.

계산생물학은 수십 년간 자동화에 의존해 왔다. 연구자들은 일상적으로 알고리즘을 사용해 서열을 비교하고, 단백질을 군집화하며, 구조를 예측하고, 함께 나타나는 유전자를 식별한다.

Claude의 역할은 하나의 고정된 분석을 실행하는 데 그치지 않았다. Anthropic에 따르면 에이전트들은 문헌을 읽고, 알려진 결과를 재현하며, 코드를 작성하고, 유전체 주변 맥락을 조사하고, 특이한 후보의 순위를 매기고, 추론을 설명하는 보고서를 작성했다.

이 워크플로는 연구자들이 보통 분리해 수행하는 여러 활동을 결합했다. 여기에는 정보 검색, 프로그래밍, 통계적 조사, 패턴 인식, 문헌 비교, 서면 과학 논증이 포함됐다.

전통적인 파이프라인도 이러한 단계의 다수를 더 빠르고 예측 가능하게 수행할 수 있다. 그러나 과학자들은 대체로 그 순서, 임계값, 산출물을 사전에 정의한다. Claude는 더 넓은 목표를 부여받았고 탐색 과정에서 중간 선택을 내렸다.

이 차이가 프로젝트가 주목받은 이유를 설명한다. 보도에 따르면 이 시스템은 한 역전사효소 계열이 추가 조사를 받을 가치가 있다고 판단하고, 인근 DNA를 조사해 반복 배열을 인식했다.

에이전트들은 대부분의 후보도 제외했다. 생물학 데이터베이스에는 셀 수 없이 많은 상관관계와 이상 현상이 존재하기 때문에, 무엇을 추적하지 않을지 선택하는 일은 과학 연구의 핵심이다.

Anthropic은 전문가들이 Claude가 생성한 가설을 수용하거나 거부하는 방식을 연구한다고 말한다. 그런 다음 회사는 이 판단을 바탕으로 향후 지시를 개선하며, 사실상 시스템에 과학적 안목의 일부를 가르친다.

이 접근법은 병목 지점을 옮긴다. 소프트웨어가 수백 건의 그럴듯한 보고서를 생성할 수 있다면, 아이디어를 만드는 일은 쉬워진다. 어떤 아이디어가 실험실 시간을 투자할 만한지 결정하는 일은 더 중요해진다.

이 변화는 연구자들과 AI 경쟁사에도 압박을 만든다. Google DeepMind는 아미노산 서열에서 단백질 구조를 예측하는 AlphaFold로 가장 잘 알려진 선례를 세웠다. 그 영향력은 정의된 과학 문제를 대규모로 해결한 데서 나왔다.

Anthropic은 더 폭넓은 모델을 추구하고 있다. Claude가 하나의 워크플로 안에서 문헌, 데이터, 소프트웨어 도구, 실험 피드백을 탐색하도록 만들고자 한다. Anthropic의 science workbench는 Claude를 60개가 넘는 과학 데이터베이스 및 전문 연구 시스템과 연결한다.

다른 연구실들도 관련된 에이전트 기반 방법을 탐구하고 있다. Stanford 연구진은 AI 에이전트 그룹을 활용해 신약 개발 전략을 제안하고 평가해 왔다. Sakana AI의 AI Scientist 프로젝트는 머신러닝 실험과 논문 작성을 자동화하려 시도했다.

이러한 노력은 과학적 품질과 자율성 면에서 크게 다르다. 그럼에도 이들은 공통된 경쟁을 가리킨다. 즉, 어느 조직이 유능한 모델을 신뢰할 수 있는 데이터, 전문가 검토, 물리적 실험과 가장 잘 연결할 수 있는가의 경쟁이다.

Anthropic의 AI 과학적 발견은 범용 모델을 사용했다는 점에서도 중요하다. Claude는 역전사효소를 찾거나 특정 유전체 특징을 인식하기 위해서만 만들어진 시스템이 아니다.

범용 시스템은 연구 질문마다 새 모델 없이도 과제를 넘나들 수 있다. 데이터세트, 가설, 소프트웨어 도구가 끊임없이 변하는 연구실에는 이러한 유연성이 매력적이다.

동시에 평가는 더 어려워진다. 특화 모델은 정의된 벤치마크를 기준으로 테스트할 수 있다. 에이전트형 연구 과정에는 수많은 결정이 포함되며, 성공은 프롬프트, 도구, 데이터베이스, 인간 개입에 부분적으로 좌우된다.

보고된 수치는 규모를 보여 주지만 효율성을 입증하지는 않는다. 950개 에이전트를 21시간 운용한 것은 전문가의 수개월 노동과 비교하면 빨라 보인다. 그러나 Anthropic은 전통적인 계산 파이프라인과의 완전한 경제성 비교를 공개하지 않았다.

토큰 수는 총 연산 비용, 엔지니어링 시간, 실패한 캠페인, 도구와 데이터를 준비하는 데 투입된 노동을 보여주지 않는다. Anthropic은 ART 후보가 수월한 챗봇 대화에서 나온 것이 아니라, 더 광범위한 연구 프로그램의 한 결과였다고 지적한다.

따라서 올바른 교훈은 탐색 역량에 관한 것이다. Claude는 소규모 전문가 팀이 검토할 수 있는 생물학적 가능성의 수를 넓힐 수 있는 것으로 보인다. 인간이 모든 중대한 결정을 계속 내리더라도, 이는 발견을 가속할 수 있다.

현업 과학자에게 이는 독립적인 동료라기보다 확장된 연구 그룹에 가깝다. 에이전트는 병렬적인 단서를 조사할 수 있고, 인간은 실험실 접근을 관리하며 어떤 증거가 유효한지 결정한다.

생물학 밖의 지식 노동자들도 이 패턴을 알아볼 것이다. AI는 흩어진 정보를 연결하고, 맥락을 유지하며, 검토를 위해 추론을 제시할 수 있을 때 가장 유용해진다. 신중하게 관리된 AI knowledge base는 인간의 판단이 사라졌다고 가장하지 않으면서도 유사한 검토 가능한 워크플로를 지원할 수 있다.

진짜 쟁점은 Anthropic의 자율성 주장이다

핵심 논쟁은 Claude가 기여했는지가 아니라, 그 기여가 시스템을 “스스로” 발견했다고 말할 만큼 충분한지에 있다.

Anthropic은 이 작업을 높은 수준의 방향 제시만으로 이뤄진 자율적 발견으로 설명한다. 이 표현은 중요한 기술적 성취를 포착하지만, 긴 인간 선택의 연쇄를 압축한다.

연구자들은 역전사효소를 광범위한 탐색 영역으로 선택했다. 이들은 관련 도구와 데이터베이스를 수집하거나 접근 가능하게 만들었다. 또한 다수의 Claude 세션을 조율하는 프레임워크를 구축했다.

어떤 결과가 실험실 자원을 투입할 가치가 있는지 결정한 것도 인간이었다. Anthropic은 에이전트들이 탐색 범위를 20개의 유력 후보로 좁혔다고 말하지만, 전문가 검토는 여전히 선정 과정의 일부였다.

계산 기반 선별 이후, 인간 과학자들은 실험실 균주에서 단백질을 발현하고 생화학적·구조적으로 특성화했다. 이들은 Claude의 도움을 받아 결과를 해석했다.

최종 주장은 그러한 협업에서 나왔다. Claude는 패턴을 찾아냈지만, 그 패턴이 잠재적으로 새로운 시스템에 해당하고 발표할 가치가 있다고 판단한 것은 인간이었다.

그렇다고 Claude를 수동적인 도구로 축소할 수는 없다. 현미경은 어디를 볼지 선택하지 않으며, 일반적인 검색 소프트웨어도 이상 현상을 발견한 뒤 조사 계획을 작성하는 경우는 드물다.

그러나 “스스로”라는 표현은 질문 선정, 증거 수집, 실험, 해석, 검증 전반에서의 독립성을 시사한다. 공개된 워크플로는 그 기준에 부합하지 않는다.

더 나은 틀은 주도성과 자율성을 분리한다. Claude는 분석 단계를 선택하고 예상치 못한 후보를 추적했기 때문에 제한된 과제 안에서 주도성을 보였다. 그러나 연구 프로그램을 독립적으로 수립하거나 증거 사슬을 완성하지는 않았다.

과학적 발견에도 여러 기준점이 있을 수 있다. 보고되지 않은 패턴을 찾는 것은 하나의 기준점이다. 재현 가능한 분자 기능을 입증하는 것은 또 다른 기준점이다. 실용적 가치를 확립하는 일은 훨씬 더 높은 기준이다.

Anthropic은 첫 번째 기준점을 넘었고 두 번째에 접근하기 시작했다. 회사는 이전에 특성화되지 않았던 유전적 배열을 발견하고, 그 반복 배열이 RNA를 생성한다는 실험적 증거를 보고했다.

그 RNA 분자들이 무엇을 하는지는 아직 밝혀지지 않았다. 또한 ART가 유전자를 편집하거나, 숙주를 방어하거나, 표적 서열을 복제하거나, 다른 프로그래밍 가능한 작동을 수행할 수 있다는 점도 입증되지 않았다.

이 구분은 CRISPR와의 비교를 약화한다. ART의 반복 서열은 구조적으로 CRISPR 배열을 연상시키지만, 시각적 또는 유전체적 유사성이 동등한 작동 방식을 입증하지는 않는다.

CRISPR가 혁신적 기술이 된 것은 수년간의 연구를 통해 기능이 확립되고 연구자들이 이를 프로그래밍하는 방법을 익힌 뒤였다. ART는 여전히 그 여정의 초입에 있다.

독립 보도 역시 이러한 신중함을 반영했다. Nature 분석은 시스템의 기능이 여전히 해결되지 않았음을 강조하면서, 이 결과를 Anthropic의 새로운 연구실을 엿볼 수 있는 사례로 설명했다.

이 발견은 Anthropic 관계자들이 작성한 프리프린트에도 실렸다. 이는 초기 과학 연구를 공유하는 일반적인 방식이지만, 상업적 AI 주장을 제기한 기관이 초기 과학적 증거도 생산했다는 뜻이다.

독립적인 재현은 이러한 이해 상충을 줄일 수 있다. 다른 연구 그룹이 동일한 ART 계열을 찾아내고, RNA 관련 결과를 재현하며, 제안된 메커니즘을 검증할 수 있어야 한다.

문제는 기업 소속 과학자들이 타당한 연구를 수행할 수 있느냐가 아니다. 그들은 분명히 할 수 있다. 우려는 제품 포지셔닝이 근거가 뒷받침하는 수준보다 더 강한 공개 표현을 부추길 수 있다는 점이다.

Claude를 자율적 발견자로 부르는 것은 Anthropic의 더 폭넓은 상업적 논지에 도움이 된다. 이 회사는 Claude를 길고 복잡한 지식 업무를 처리할 수 있는 시스템으로 판매하고 있다.

신뢰할 수 있는 과학적 결과는 역량의 증거이자 채용 도구, 그리고 제약 또는 생명공학 고객을 위한 시연이 된다. 그렇다고 발견 자체가 거짓이라는 뜻은 아니지만, 투명성에 대한 기준을 높인다.

완전한 설명이라면 각 단계에 어느 정도의 인간 입력이 들어갔는지를 보여야 한다. 초기 프롬프트, 도구 구성, 순위 산정 방식, 인간의 제외 기준, 실패한 탐색 실행을 제시해야 한다.

또한 에이전트 워크플로를 더 단순한 기준선과 비교해야 한다. 기존의 유전체 마이닝 파이프라인이 더 적은 연산으로 같은 반복 서열을 찾을 수 있었을까? 확립된 소프트웨어를 사용하는 숙련된 대학원생이 ART를 비슷하게 순위화했을까?

그러한 비교 없이는 대중이 새로움은 판단할 수 있어도 상대적 효율성은 판단할 수 없다. Claude는 흥미로운 것을 발견했지만, 에이전트 군집이 이용 가능한 최선의 방법이었다는 점을 증거가 확립하지는 않는다.

Anthropic의 AI 과학 발견은 협업적 성과로 설명할 때 가장 타당하다. 모델은 대규모 탐색과 유연한 분석을 제공했다. 과학자들은 목표, 인프라, 물리적 실험, 그리고 인식론적 책임을 제공했다.

Claude 효소 발견이 여전히 입증하지 못한 것

가장 큰 불확실성은 생물학적 측면에 있다. 아직 아무도 ART의 자연적 기능이나 그 특이한 구조가 실용적 가치를 지니는지 알지 못하기 때문이다.

첫 번째 검증은 메커니즘에 관한 것이다. 연구자들은 역전사효소가 무엇을 복제하는지, 반복 서열 유래 RNA가 그것과 어떻게 상호작용하는지, 보조 단백질이 어떤 역할을 하는지 판단해야 한다.

또한 박테리오파지 내부에서 이 시스템이 어떤 목적을 지니는지도 규명해야 한다. 바이러스 복제를 돕거나, 숙주 방어를 바꾸거나, 정보를 기록하거나, 다른 바이러스와 경쟁하거나, 전혀 다른 기능을 수행할 수 있다.

이러한 가능성은 여전히 가설이다. 효소 옆의 반복 배열은 강력한 단서지만, 생물학에는 표면적 유사체와 기능이 다른 구조가 많다.

두 번째 검증은 프로그래밍 가능성이다. CRISPR가 유용해진 이유는 연구자들이 설계된 RNA 서열을 이용해 그 활성을 다른 표적으로 유도할 수 있었기 때문이다. ART는 유사한 표적화 능력을 입증하지 못했다.

과학자들은 ART 반복 서열을 바꾸고 그 변화가 예측 가능하게 시스템의 방향을 전환한다는 점을 보여야 한다. 또한 정확도, 효율성, 의도하지 않은 영향을 측정해야 한다.

세 번째 검증은 재현성이다. 독립 연구실은 RNA 산물이 존재하며 구성 요소들이 하나의 시스템으로 함께 작동한다는 점을 확인해야 한다.

네 번째 검증은 범위에 관한 것이다. Anthropic은 ART가 주로 박테리오파지에서 나타난다고 보고한다. 연구자들은 이 계열이 얼마나 널리 존재하는지와 변이체들이 어떻게 다른지를 확립해야 한다.

공개 유전체 데이터에서 발견된 결과는 기반 서열이 이미 이용 가능했더라도 새로울 수 있다. 과학적 새로움은 종종 아무도 이전에 기술하지 않았던 관계를 인식하는 데서 나온다.

그럼에도 접근 가능한 데이터의 존재는 유용한 재현 검증을 가능하게 한다. 외부 팀은 같은 기록을 검색해 해당 패턴이 다른 방법에서도 유지되는지 판단할 수 있다.

다섯 번째 검증은 Claude 자체의 역할에 관한 것이다. Anthropic은 연구자들이 모델의 추론과 파이프라인 설계, 무차별적 병렬 처리를 구분할 수 있을 만큼 충분한 세부 정보를 제공해야 한다.

약 950개의 에이전트와 2억1천만 토큰은 상당한 계산 노력을 의미한다. 총량은 여전히 전문가 노동과 비교해 유리할 수 있지만, Anthropic은 표준화된 생산성 지표를 제시하지 않았다.

성공률도 중요하다. 하나의 흥미로운 결과만으로는 같은 과정이 오해를 부르는 후보를 얼마나 자주 만들어 내는지 알 수 없다. 그럴듯한 이야기를 많이 생성하는 시스템은 실험실 업무를 줄이기보다 늘릴 수 있다.

Anthropic은 대부분의 후보가 제외된다고 인정한다. 연구자들은 가치 있는 제안과 더 약한 제안을 가르는 요인을 연구하고 있으며, 이는 필터링 문제가 여전히 상당함을 시사한다.

언어 모델은 우연한 패턴에 대해서도 자신감 있는 설명을 만들어 낼 수 있다. 생물학 데이터베이스는 방대한 규모 탓에 우연한 연관성이 불가피하므로 특히 취약하다.

인간 검토는 일부 실패를 막지만 확증 편향을 도입할 수 있다. AI 에이전트가 이례적인 시스템을 발견할 것이라 기대하는 연구자들은 경계선상의 패턴을 더 관대하게 해석할 수 있다.

투명한 부정적 결과가 도움이 될 것이다. Anthropic은 실행 가능한 후보가 나오지 않은 캠페인이 몇 건인지, 실험실 검증이 몇 번 실패했는지, 전문가 순위가 얼마나 자주 바뀌었는지를 보고할 수 있다.

회사는 제거 연구도 공개할 수 있다. 이러한 검증은 에이전트 계획, 문헌 접근, 병렬 실행 가운데 무엇이 관찰된 이점을 만들었는지 보여주기 위해 워크플로의 일부를 제거한다.

프리프린트의 심사 상태도 동등한 주목을 받을 만하다. 동료 심사는 완벽하지 않지만, 심사자는 간과된 선행 연구, 약한 통제 조건, 대안적 해석을 찾아낼 수 있다.

과학 저널 게재가 Anthropic의 자율성 주장을 자동으로 검증하지는 않는다. 그러나 ART가 진정으로 새로운 시스템이라는 생물학적 근거는 강화할 것이다.

더 폭넓은 연구 역시 일반 AI 창의성에 대한 신중함을 뒷받침한다. 수천 명의 과학자가 참여한 2026년 연구는 현재 시스템이 여러 분야에서 전문가들이 독창적이면서 유용하다고 판단하는 아이디어를 만들어 내는 데 어려움을 겪는다고 밝혔다.

그 과학자 평가는 ART 결과를 무효화하지 않는다. 이는 하나의 성공 사례가 기계 주도 과학에 관한 보편적 주장으로 확대되어서는 안 되는 이유를 보여준다.

생물학은 새로운 사회 이론이나 맥락적 해석이 필요한 분야보다 에이전트 기반 탐색에 더 적합할 수도 있다. 유전체 데이터베이스에는 소프트웨어가 반복적으로 대규모로 조사할 수 있는 구조화된 기록이 담겨 있다.

따라서 이 결과는 일반적 과학 자율성을 입증하지 않으면서도 의미 있는 분야 특화 성공을 나타낼 수 있다. 이 해석은 증거에 부합하며 성취를 보존한다.

안전성 측면의 긴장도 존재한다. 유용한 메커니즘을 찾기 위해 생물학 데이터를 탐색하는 동일한 시스템은 해로운 메커니즘을 조사하는 데 필요한 노력도 줄일 수 있다.

Anthropic은 최근 고급 생물학 연구와 관련한 안전장치를 강화하고 조정했다. 정당한 연구자들은 때때로 안전 필터가 일반적인 과학 질문을 중단시킨다고 보고했다.

회사는 이제 두 가지 상충하는 요구에 직면해 있다. Claude가 야심 찬 생물학 연구를 수행하기를 바라면서도, 외부 사용자가 유사한 역량을 위험한 병원체에 적용하지 못하도록 막아야 한다.

ART 자체는 인간을 감염시키는 바이러스가 아니라 박테리오파지에서 유래한다. Anthropic은 자사 연구실이 인간 병원체를 다루지 않는다고 말한다. 이러한 사실은 이 프로젝트의 즉각적인 위험을 제한한다.

더 큰 거버넌스 문제는 남는다. 에이전트 시스템이 실험 제안 능력을 높인다면, 조직은 연구자 신원, 프로젝트 목적, 물질, 실험실 접근성을 바탕으로 한 통제가 필요해질 것이다.

이 논의가 과학적 결과를 가려서는 안 되지만, 규모에 관한 모든 평가에는 포함되어야 한다. 더 빠른 가설 생성은 더 많은 기회와 함께 책임 있는 검토가 필요한 더 많은 후보를 만든다.

세 가지 신호가 이 주장의 성립 여부를 결정할 것이다

다음 단계는 홍보성 표현을 독립적인 생물학적 증거, 재현 가능한 워크플로, 측정 가능한 연구 생산성으로 대체해야 한다.

첫 번째 신호는 검증된 ART 메커니즘이다. 연구자들은 시스템이 무엇을 하는지 보여주고, 역전사효소와 반복 서열 유래 RNA, 보조 단백질이 어떻게 상호작용하는지 설명해야 한다.

ART가 의료 도구가 되지 않더라도 설득력 있는 결과는 Anthropic의 과학적 주장을 강화할 것이다. 발견에는 즉각적인 상용화가 필요하지 않다.

프로그래밍 가능한 활성이 입증되면 중요성은 더 커질 것이다. 과학자들이 ART를 선택한 표적으로 유도할 수 있다면 CRISPR와의 비교도 실질적 근거를 얻게 된다.

일관된 메커니즘을 찾지 못한다면 이야기는 약화될 것이다. ART는 유효한 유전체 관찰로 남을 수 있지만, 주요 분자 발견이라는 지위는 잃을 수 있다.

두 번째 신호는 독립 재현이다. 관련이 없는 연구실이 공유된 방법 또는 동등한 도구를 사용해 계산상 발견과 핵심 실험을 재현해야 한다.

재현은 생물학과 워크플로를 모두 검증할 것이다. Claude가 안정적인 패턴을 발견했는지, 아니면 Anthropic의 내부 설정이 결과를 형성했는지를 드러낼 수 있다.

외부 연구자들은 간과된 선행 기술도 찾아야 한다. 새로움에 관한 주장은 전문가들이 새로운 결과를 잘 알려지지 않은 이전 연구와 연결하면서 종종 좁아진다.

확인은 Claude 효소 발견이 진정한 지식을 더했다는 논거를 강화할 것이다. 중대한 수정은 프리프린트와 기업 발표가 신중하게 다뤄져야 하는 이유를 보여줄 것이다.

세 번째 신호는 여러 프로젝트에서의 반복된 성과다. Anthropic은 신뢰할 수 있는 새로운 연구 방법을 입증하려면 성공적인 후보 하나 이상이 필요하다.

향후 보고서에는 전체 캠페인 수, 실패한 가설, 실험실 전환율, 인간 투입 시간, 연산 사용량, 확립된 파이프라인과의 비교가 포함되어야 한다.

이러한 지표는 연구 조직이 마주한 실질적 질문에 답할 것이다. AI 에이전트는 전문가 시간 단위당 더 많은 검증된 발견을 만들어 내는가, 아니면 주로 검토할 자료만 더 많이 만들어 내는가?

Anthropic은 이미 이를 뒷받침하는 인프라를 구축했다. 이 회사의 생명과학 그룹에는 신약 발견, 과학 도구, 생물학 및 화학을 위한 모델 훈련을 담당하는 팀들이 포함돼 있다.

이 회사는 Allen Institute와 Howard Hughes Medical Institute를 비롯한 연구기관과도 파트너십을 맺었다. 이러한 협업은 Anthropic 자체 연구실 밖에서 Claude를 시험할 기회를 제공한다.

외부 활용 사례는 또 한 번의 내부 시연보다 더 많은 정보를 제공할 것이다. 독립 연구자들은 서로 다른 질문, 기준, 인센티브를 갖고 있다.

경쟁사들의 반응도 보조 증거로 중요할 것이다. Google DeepMind, OpenAI, 전문 생명공학 기업, 학술 연구실은 모두 AI 지원 연구 시스템을 개발하고 있다.

여러 그룹이 범용 에이전트를 통해 재현 가능한 발견을 보고하기 시작한다면, ART는 더 광범위한 전환의 초기 사례로 보일 것이다. 반대로 유사한 결과가 드물게 유지된다면, 이는 더욱 예외적인 사례로 보일 것이다.

독자들은 이 논쟁을 사기와 완전한 자율성 사이의 선택으로 받아들여서는 안 된다. 현재의 증거는 더 중요한 중간 지점을 뒷받침한다.

Claude는 일반적으로 숙련된 연구자가 필요로 하는 실제 분석 작업을 수행한 것으로 보인다. 다만 인간 과학자들은 연구 환경을 계속 통제했고, 모든 물리적 주장에 대한 책임을 맡았다.

이러한 방식은 완전히 독립적으로 일하는 기계 과학자를 만들지 않고도 과학을 변화시킬 수 있다. 가장 중대한 기술들은 대개 사람을 제거하기 전에 노동 분업부터 바꾼다.

따라서 Anthropic의 AI 과학 발견은 오늘날 무엇을 보여 주는지에 주목할 만하다. 범용 AI 에이전트는 생물학 데이터를 탐색하고, 이상 징후를 추적하며, 실험실에서 검증할 수 있는 가설을 생성할 수 있다.

그러나 이는 질문에서 검증된 결론에 이르는 독립적 과학을 아직 입증하지는 못한다. 특히 Claude가 스스로 행동했다는 뉘앙스를 줄 때 Anthropic의 표현은 이러한 증거보다 앞서 나간다.

실질적인 대응은 수식어가 아니라 실험을 지켜보는 것이다. 명확히 규정된 ART 메커니즘, 독립적 재현, 그리고 여러 연구 프로그램에 걸친 투명한 성능을 확인해야 한다.

연구자와 지식 노동자도 자신의 AI 워크플로에 같은 기준을 적용해야 한다. 출처를 보존하고, 프롬프트와 결정을 기록하며, 불확실한 단계를 드러내고, 검증은 자격을 갖춘 사람이 책임지도록 해야 한다.

ART는 프로그래밍 가능한 생물학 도구가 될 것인가, 아니면 오래된 데이터에서 발견된 흥미로운 패턴으로 남을 것인가? 이 답도 중요하지만, 워크플로 역시 그에 못지않게 중요한 시험대에 놓여 있다. Anthropic은 외부의 검증 아래에서도 Claude가 이 성과를 반복할 수 있음을 보여야 한다. 그때까지 가장 강력한 결론은 신중하지만 분명하다. Claude는 타당한 과학적 단서를 만드는 데 기여했지만, 그 단서를 과학으로 완성한 것은 여전히 인간이었다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page