top of page

HHS AI 임상시험 추진, 고정된 단계 대신 적응형 근거 겨냥

10월 2일
9분 분량

HHS는 기존 신약 임상시험에 내재된 고정된 단계, 중복 인프라, 지연된 의사결정에 도전하는 5개년 프로그램을 출범시켰다. HHS AI 임상시험 이니셔티브는 예측 모델, 지속적 분석, 자동화 운영을 하나의 연구 프레임워크 아래 결합한다.

핵심은 Simulation-augmented, Real-time Platform Adaptive Seamless Trials의 약자인 SURPASS다. 보건고등연구계획국(ARPA-H)은 임상시험 사이트, 건강 데이터, 환자 내비게이션을 위한 세 개의 지원 프로젝트와 함께 이 프로그램을 운영한다.

당장의 약속은 속도다. 더 어려운 과제는 적응형 소프트웨어가 대체하려는 기존 절차만큼 신뢰할 수 있는 근거를 만들어낼 수 있음을 입증하는 일이다. 이 충돌은 규제기관, 의약품 개발사, 임상시험수탁기관, 임상시험 사이트, 통계팀에 동시에 압박을 가한다.

HHS AI 임상시험, 고정된 단계를 넘어선다

SURPASS는 기존 임상시험에 AI 보조 도구를 단순히 추가하는 것이 아니다. 임상 근거를 생성하는 다른 운영 모델을 제안한다.

HHS는 2026년 9월 30일 SURPASS를 발표했다. 부처의 임상시험 프로그램에 따르면, 이 이니셔티브는 예측 계산 모델, 공유 인프라, 공통 대조군, 실시간 분석을 결합한다.

이 프로그램은 5년간 운영되도록 설계됐다. 통계, AI, 임상시험 설계, 운영, 규제를 아우르는 팀을 대상으로 늦가을에 제안서 모집을 시작할 것으로 예상된다.

HHS는 초기 발표에서 프로그램 예산을 공개하지 않았다. 또한 성공적인 참여자에게 어떤 규제 유연성이 제공될지도 설명하지 않았다고 초기 SURPASS 보도는 전했다.

이러한 공백은 SURPASS가 행정 자동화를 넘어서는 프로그램이기 때문에 중요하다. 세 가지 기술 영역은 임상시험 설계, 통계적 추론, 운영을 다룬다.

첫 번째 영역은 단계 없는 설계 엔진이다. 이는 연구 시작 전 디지털 트윈과 관련 예측 모델을 활용해 가능한 임상 및 운영 결과를 시뮬레이션한다. 디지털 트윈은 예상 결과를 탐색하기 위해 환자 또는 프로세스를 계산적으로 표현한 모델이다.

“단계 없음”이라는 표현은 임상시험이 안전성 관문을 잃는다는 뜻이 아니다. 전통적으로 분리된 시험 단계 사이의 경직된 인계를 줄일 수 있는 보다 연속적인 구조를 뜻한다.

두 번째 영역은 지속적 추론 엔진이다. 이는 반복 검토 과정에서도 타당성을 유지하도록 설계된 통계 규칙을 사용해 축적되는 데이터를 분석한다. 그러면 연구진은 하나의 고정된 분석 날짜를 기다리지 않고 치료군을 추가, 중단 또는 조정할 수 있다.

세 번째 영역은 에이전틱 운영 계층이다. 이 맥락에서 에이전트는 제한된 인간 지시만으로 정의된 운영 작업 순서를 완료할 수 있는 소프트웨어를 뜻한다. HHS는 이러한 시스템이 임상시험 준비, 데이터 정제, 치료군 도입, 데이터세트 구축을 지원하기를 바란다.

따라서 SURPASS는 하나의 새 모델에 의존하기보다 이미 확립된 여러 아이디어를 결합한다. 적응형 임상시험은 축적되는 근거에 따라 사전에 정해진 변경을 이미 허용한다. 플랫폼 임상시험은 공유 프로토콜 아래 여러 치료법을 시험할 수 있다. 계산 모델은 이미 일부 신약 개발 의사결정에 활용되고 있다.

제안된 변화는 이러한 요소들을 하나의 지속적인 시스템 안에 배치하는 것이다. 이 시스템은 설계, 모집, 분석, 보고를 대부분 분리된 단계로 다루는 대신 임상시험 진행 중 학습하게 된다.

HHS는 의약품과 생물학적 제제 개발이 흔히 10년 이상 걸리고 평균 최대 20억 달러의 비용이 들며 90% 이상 실패한다고 밝혔다. 이 수치는 기관 발표에서 나온 것이며, 프로그램의 근거로 이해해야 한다.

유용한 질문은 현행 절차가 느린지 여부가 아니다. 이 점을 두고 이견을 제기하는 참여자는 거의 없다. 핵심은 지속적 플랫폼이 불확실성을 감사하기 더 어려운 모델로 옮기지 않으면서 지연을 제거할 수 있는지다.

이 구분이 이 글의 핵심 긴장을 만든다. 더 빠른 운영은 가치가 있지만, 임상 근거는 시험의 방향이 바뀐 뒤에도 해석 가능해야 한다.

네 개 프로젝트, 네 가지 병목을 공략한다

HHS는 느린 임상시험을 더 나은 알고리즘 부족만의 문제가 아니라 설계, 사이트, 데이터, 환자를 아우르는 시스템 문제로 보고 있다.

SURPASS는 임상시험 설계와 실행을 다룬다. 상호 보완적인 세 개의 ARPA-H 프로젝트는 적응형 연구가 국가 규모에서 운영될 수 있는지를 결정하는 조건을 다룬다.

STACK은 임상 사이트 역량을 겨냥한다. HHS는 이 프로젝트가 AI를 활용해 사이트 활성화를 가속하고, 연구 경험이 없는 의료시설도 임상시험 수행 역량을 갖춘 사이트가 되도록 지원할 것이라고 밝혔다.

사이트 활성화에는 계약, 직원 준비, 기술 구축, 규제 검토, 의뢰사 자격 심사가 포함된다. 참여 병원이 환자 등록을 시작하는 데 수개월이 걸린다면 더 빠른 통계 설계는 큰 이점을 제공하지 못한다.

STACK에는 지리적 접근성에 관한 논리도 있다. 자격을 갖춘 사이트가 늘어나면 환자들은 주요 학술 의료센터까지 반복적으로 이동하지 않고 집 가까이에서 연구에 참여할 수 있다.

이러한 확대는 실질적 검증 과제를 낳는다. 새 사이트는 일관된 데이터를 수집하고, 참여자를 보호하며, 복잡한 프로토콜을 따라야 한다. 서류 작업 자동화가 경험 많은 연구자, 훈련된 코디네이터, 신뢰할 수 있는 임상 시스템을 대체할 수는 없다.

COMMONS는 데이터 인프라를 다룬다. HHS는 이를 동의와 규제 수준의 데이터 접근을 위한 프라이버시 바이 디자인 시스템으로 설명한다.

규제 수준의 데이터는 추적 가능하고 통제되어야 하며, 치료의 안전성과 유효성에 관한 의사결정에 적합해야 한다. 일반적인 데이터 통합이 자동으로 이 기준을 충족하는 것은 아니다.

COMMONS는 등록, 예측 모델링, 임상시험 운영에 필요한 정보를 연결하는 것을 목표로 한다. 잘 구현된다면 반복적인 데이터 요청을 줄이고 적격 환자 식별을 쉽게 만들 수 있다.

동시에 이 이니셔티브의 가장 큰 구현 과제 중 하나를 드러낼 수도 있다. 병원과 연구 네트워크는 서로 다른 거버넌스 규칙 아래 서로 다른 형식으로 정보를 저장하며, 데이터 품질도 균일하지 않다.

동의는 또 다른 과제다. 정보 제공에 대한 환자의 허가는 데이터가 기관 간 이동하거나 새로운 계산 분석을 지원할 때에도 이해하기 쉬워야 한다.

CINCH는 환자 측면에 초점을 맞춘다. 이 프로젝트는 사람들이 실제 환경 데이터를 제공하고, 치료를 조율하며, 자신의 상황에 맞는 임상시험을 찾도록 돕는 것을 목표로 한다.

실제 환경 데이터는 엄격히 통제된 연구 방문이 아니라 일상 진료와 생활에서 나온다. 여기에는 전자의무기록, 청구 데이터, 검사 결과, 등록 데이터, 연결형 기기로 수집한 정보가 포함될 수 있다.

이러한 자료는 치료 효과를 더 폭넓게 보여줄 수 있다. 그러나 누락 정보, 일관되지 않은 측정값, 불평등한 의료 접근성으로 형성된 패턴도 포함할 수 있다.

따라서 CINCH는 환자 기록에서 키워드를 매칭하는 수준을 넘어야 한다. 유용한 내비게이션 시스템은 특정 연구가 왜 관련 있어 보이는지 설명하고, 적격성 판단에 임상의가 계속 참여하도록 해야 한다.

SURPASS, STACK, COMMONS, CINCH는 함께 계층형 프로그램을 이룬다. SURPASS는 임상시험을 재설계한다. STACK은 시험을 수행할 수 있는 장소를 확장한다. COMMONS는 거버넌스가 적용된 정보를 제공한다. CINCH는 환자를 시스템과 연결한다.

이 구조는 이번 발표를 더 좁은 범위의 임상 AI 프로젝트와 구분한다. HHS는 하나의 예측 모델이 성공적인 의약품을 선택할 것이라고 약속하는 것이 아니다. 반복적인 근거 생성을 위한 공유 기반을 만들려 하고 있다.

이처럼 더 넓은 야심은 실행 위험도 키운다. 네 프로젝트는 서로 의존하지만, 각기 다른 기관, 기술 표준, 법적 의무를 수반한다.

어느 한 계층의 실패도 다른 계층을 제한할 수 있다. 더 나은 매칭은 이용할 수 없는 사이트를 해결하지 못한다. 더 빠른 사이트가 쓸 수 없는 데이터를 보완할 수도 없다. 강력한 모델도 거버넌스가 부실한 프로토콜을 구할 수는 없다.

진짜 경쟁은 속도와 검증 가능한 근거의 대결이다

핵심 충돌은 AI와 인간 연구자 사이의 대립이 아니다. 지속적 적응의 약속과 안정적이고 재현 가능한 결론의 필요성 사이의 대립이다.

전통적인 단계 경계는 지연을 만들지만, 책임도 체계화한다. 의뢰사는 다음 단계로 진행하기 전에 어떤 근거가 필요한지 안다. 검토자는 언제 프로토콜이 변경됐는지, 어떤 데이터세트가 의사결정을 뒷받침했는지 확인할 수 있다.

지속적 플랫폼은 이러한 익숙한 경계를 약화한다. 이는 중복 작업을 없앨 수 있지만, 통계적 계획과 감사 가능성을 더 중요하게 만든다.

적응형 플랫폼 임상시험은 이러한 상충관계를 보여준다. 하나의 마스터 프로토콜 아래 여러 중재를 시험하고, 효과 없는 치료군을 제거하며, 새 후보를 추가하고, 대조군을 공유할 수 있다.

COVID-19 팬데믹 동안 플랫폼 임상시험은 기존 프로그램이 속도 문제로 고전하는 가운데 중요한 치료 근거를 만들었다. 그 성공은 적응 가능한 인프라가 긴급한 질문에 효율적으로 답할 수 있음을 보여줬다.

그러나 적응은 연구자가 자신의 선택에 영향을 줄 수 있는 결과를 보기 전에 명시되어야 한다. 계획되지 않은 변경은 편향을 만들고, 거짓 양성 위험을 높이며, 치료 효과를 해석하기 어렵게 할 수 있다.

주요 플랫폼 임상시험 검토는 이러한 연구에 필요한 설계, 수행, 감독, 보고 요건을 설명한다. 핵심 교훈은 유연성에는 더 적은 계획이 아니라 더 많은 계획이 필요하다는 점이다.

공유 대조군에도 비슷한 규율이 필요하다. 공통 대조군은 표준 치료에 배정되는 참여자 수를 줄이고 여러 비교의 효율성을 높일 수 있다.

새 치료군을 훨씬 이전에 등록된 환자와 비교할 때 문제가 발생한다. 의료 관행, 질병 양상, 진단 방법, 환자 특성은 시간이 지나며 변할 수 있다.

연구자들은 이러한 이전 참여자를 비동시 대조군이라고 부른다. 이를 사용하면 통계적 검정력을 높일 수 있지만, 시간 관련 편향을 도입할 수도 있다.

SURPASS는 반복 분석과 적응을 다루기 위해 항상 타당한 추론 엔진을 제안한다. HHS는 아직 이 엔진의 통계 명세, 검증 벤치마크, 규제 수용 기준을 공개하지 않았다.

디지털 트윈에도 동일한 근거 부담이 적용된다. 모델은 등록 전에 예상 결과를 시뮬레이션해 팀이 가정을 시험하거나 취약한 프로토콜 선택을 식별하도록 도울 수 있다.

시뮬레이션은 어디까지나 추정치다. 이는 학습 데이터에 표현된 환자, 변수, 관계를 반영한다.

디지털 트윈이 고령자, 농촌 환자, 임신한 사람, 복수의 질환을 가진 환자를 충분히 대표하지 못한다면, 그 결과로 만들어진 임상시험은 불완전한 환자 집단을 중심으로 효율화될 수 있다.

따라서 검증은 평균 예측 정확도 이상을 살펴봐야 한다. 의뢰사와 규제기관은 모델이 어디에서 실패하는지, 불확실성이 어떻게 보정되는지, 사이트별로 성능이 달라지는지를 알아야 한다.

또한 모델 업데이트 절차도 필요하다. 지속적으로 개선되는 모델은 매력적으로 들리지만, 임상시험 중 소프트웨어를 변경하면 과거 의사결정을 재구성하기 복잡해질 수 있다.

영향력 있는 모든 권고는 특정 모델 버전, 입력 데이터세트, 규칙, 인간의 승인과 연결되어야 한다. 그러한 기록이 없다면 속도는 책임성을 약화시킬 수 있다.

HHS는 이미 AI 지원 생의학 연구가 재현성, 투명한 방법론, 편향 없는 검토를 중시해야 한다고 밝혔습니다. HHS의 AI 전략 역시 AI 증거로 뒷받침되는 규제 제출을 측정 가능한 성과로 제시합니다.

SURPASS는 이러한 원칙이 실제 운영 플랫폼에서도 유지될 수 있는지 시험할 것입니다. HHS는 결과물인 도구, 표준, 규제 사례가 더 폭넓은 연구 시스템에 도움이 되기를 바라기 때문에 공개 문서화는 특히 중요합니다.

목표는 모든 임상시험을 적응형으로 만드는 것이 되어서는 안 됩니다. 일부 질문에는 안정적이고 전통적인 설계가 적합합니다. 또 다른 질문은 실시간 변경을 이끌 만큼 빠르게 측정할 수 없는 결과를 포함합니다.

장기 생존율, 지연성 이상반응, 서서히 진행되는 질환이 소프트웨어가 유입 데이터를 더 빠르게 분석한다고 해서 즉각적인 결과가 되는 것은 아닙니다.

설계는 의학적 질문을 따라야 합니다. 그렇지 않으면 이 프로그램은 적응을 방법이 아니라 목표로 취급할 위험이 있습니다.

Operation TrialBlazer, 경쟁의 판돈을 높이다

SURPASS는 특히 중국의 임상연구 역량이 성장하는 상황에서, 미국을 의약품 개발이 더 빠르게 이루어지는 곳으로 만들려는 더 큰 연방 차원의 시도에 속합니다.

HHS는 2026년 6월 부처 전반의 임상연구 이니셔티브로 Operation TrialBlazer를 도입했습니다. 이 프로그램은 ARPA-H, FDA, NIH, National Cancer Institute 및 연방 보건기술 관계자들의 업무를 조율합니다.

이 이니셔티브의 정치적 논리는 직접적입니다. HHS는 초기 단계 연구가 해외로 이전되고 있으며, 미국이 이에 수반되는 투자, 전문성, 신약 개발 활동을 잃을 위험이 있다고 말합니다.

중국은 가장 눈에 띄는 비교 대상입니다. IQVIA 데이터에 따르면 중국 기업의 글로벌 임상시험 시작 건수 비중은 2009년 1%에서 2024년 30%로 증가했습니다.

미국은 여전히 대규모 제약 시장, 경험 많은 규제기관, 선도적인 연구병원, 두터운 생명공학 자금 조달 등 주요 강점을 보유하고 있습니다.

그러나 임상시험 속도는 기업이 어디에서 제품을 시험하고 투자자가 어디에 자본을 배치하는지에 영향을 미칩니다. 기관들이 여전히 존경받더라도, 느리게 움직이는 과학 프로그램은 기회를 잃을 수 있습니다.

SURPASS는 설계 및 운영 지연을 겨냥합니다. TrialBlazer의 다른 조치는 규제 심사와 제출 요건에 초점을 둡니다.

FDA는 최초 인간 대상 연구를 위한 신속 임상시험계획 승인 신청(Investigational New Drug) 파일럿을 시작했습니다. 선정된 스폰서는 적격 연구기관과 협력하고 신청서 구성 요소를 순차적으로 제출할 수 있습니다.

순차 제출을 통해 규제기관은 전체 패키지가 준비되기 전에 완료된 섹션을 검토할 수 있습니다. FDA는 일부 기관생명윤리위원회 검토와 시험기관 가동 작업도 신청서 개발과 병행하기를 원합니다.

FDA는 단계에 맞는 화학 및 제조 관련 기대치를 명확히 하면 기업이 6~12개월을 절약할 수 있다고 말합니다. 이러한 추정치는 정량적 용량 선택과 후기 단계 마스터 프로토콜도 다루는 개발 로드맵에 제시되어 있습니다.

후기 개발과 관련해 FDA는 엄격한 핵심 임상시험 하나와 확증적 증거가 언제 승인 근거가 될 수 있는지 명확히 했습니다. 또한 바스켓, 엄브렐라, 플랫폼 임상시험에 관한 지침 초안도 개정했습니다.

이 정책들은 ARPA-H가 단독으로 규제 수용성을 만들어낼 수 없기 때문에 중요합니다. SURPASS는 도구와 실증 프로젝트에 자금을 지원할 수 있지만, 결과 증거가 의료제품 결정의 근거가 되는지는 FDA가 판단합니다.

기관 간 관계는 도입 양상을 결정할 것입니다. 규제기관이 해당 시스템의 산출물을 평가할 수 있다는 명확한 증거가 없으면, 스폰서는 새로운 시스템을 중심으로 임상시험 프로그램을 재구축하는 데 주저할 것입니다.

반대 방향의 위험도 존재합니다. 더 빠른 국내 개발을 위한 정책 추진은 불확실성을 관대하게 해석하라는 압력으로 이어질 수 있습니다.

가장 강력한 방어책은 투명한 검증입니다. 더 빠른 심사는 더 이른 조율, 더 명확한 요건, 중복 업무 감소를 의미해야 합니다. 안전성이나 유효성 기준의 약화를 의미해서는 안 됩니다.

TrialBlazer의 연방 이니셔티브는 현대화가 과학적 엄밀성을 보존해야 한다고 명시합니다. 이제 이 원칙은 관찰 가능한 실행으로 이어져야 합니다.

이 때문에 프로그램의 성공은 단지 더 짧아진 일정으로만 측정되어서는 안 됩니다. HHS는 프로토콜 일탈, 대표성, 이상반응 탐지, 재현성, 모델 예측과 임상 결과 간 일치도도 추적해야 합니다.

국내 경쟁력은 긴급성을 더하지만 증거 문제를 해결하지는 않습니다. 다른 규제기관, 임상의 또는 환자가 결론을 신뢰하지 않는다면, 더 빠른 임상시험이 미국에 가져다주는 이점은 크지 않습니다.

HHS가 다음으로 입증해야 할 것

다음 이정표는 SURPASS가 검증된 도구, 규제기관이 활용할 수 있는 증거, 더 넓은 환자 접근성을 동시에 만들어낼 수 있음을 보여야 합니다.

첫 번째 신호는 ARPA-H 공모의 구조입니다. 신청자는 속도, 비용, 참여자 부담, 통계적 타당성, 인구집단 포괄성에 대한 측정 가능한 목표를 제시해야 합니다.

대부분 자동화 기능에 초점을 둔 공모는 프로그램의 주장을 약화시킬 것입니다. 강력한 공모는 전통적 접근법에 대한 전향적 검증과 명확한 실패 기준을 요구할 것입니다.

팀은 인구통계학적 집단과 참여 기관 전반에서 모델을 어떻게 감사할지도 제시해야 합니다. 임상시험 참여 여부나 지속할 치료를 결정하는 판단에서 전체 정확도만으로는 충분하지 않습니다.

두 번째 신호는 규제 정렬입니다. FDA의 참여는 혁신적 설계에 대한 일반적 지지에서 SURPASS 산출물을 평가하기 위한 구체적 방법으로 발전해야 합니다.

스폰서는 허용 가능한 디지털 트윈 검증, 모델 변경, 공유 대조군, 연속 분석, 문서화에 관한 지침이 필요합니다. 또한 전통적 설계가 여전히 필요한 경우도 알아야 합니다.

공개 사례가 도움이 될 것입니다. 규제기관이 검토한 프로토콜, 시뮬레이션 계획, 분석 프레임워크는 이 프로그램을 지원받는 팀을 넘어 유용하게 만들 수 있습니다.

대규모 임상시험이 이에 의존하기 전에 명확한 표준이 마련된다면 규제 정렬은 이 이니셔티브를 강화할 것입니다. 소프트웨어의 기술적 성능과 관계없이 지속적인 모호성은 도입을 늦출 것입니다.

세 번째 신호는 STACK, COMMONS, CINCH의 운영 증거입니다. HHS는 신규 기관이 더 빠르게 가동되는지, 대표성 있는 인구집단을 모집하는지, 환자가 동의 절차를 이해할 수 있는지 보고해야 합니다.

더 많은 기관 수가 자동으로 의미를 갖는 것은 아닙니다. 기관들은 참여자를 등록하고, 데이터 품질을 유지하며, 인력을 유지하고, 환자를 보호해야 합니다.

COMMONS는 연결된 기록의 양이 아니라 추적 가능한 규제 수준 데이터의 가용성으로 평가되어야 합니다. CINCH는 적절한 매칭, 완료된 등록, 환자 이해도를 기준으로 평가되어야 합니다.

이러한 측정 지표는 HHS의 AI 임상시험이 접근성을 확대하는지, 아니면 이미 참여 역량을 갖춘 기관의 업무만 가속하는지를 보여줄 것입니다.

이 프로그램은 부정적 결과도 공개해야 합니다. 특정 질환 영역에서 성능이 떨어지는 디지털 트윈도 그 접근법이 적용되어서는 안 될 영역에 관한 귀중한 증거를 제공할 수 있습니다.

그러한 투명성은 과학 인프라와 기술 조달 캠페인을 구분하는 데 도움이 될 것입니다. 또한 HHS가 만들고자 한다는 재사용 가능한 표준을 뒷받침할 것입니다.

임상팀의 단기 과제는 준비입니다. 참여를 고려하는 조직은 지금 데이터 출처, 모델 거버넌스, 동의 문구, 의사결정 로그를 점검해야 합니다.

통계학자, 임상의, 데이터 엔지니어, 규제 전문가, 기관 운영자의 지식은 연구 전반에 걸쳐 연결되어 있어야 합니다. 팀은 검색 가능한 지식 베이스를 활용해 이들 그룹 전반의 가정, 결정, 모델 문서를 보존할 수 있습니다.

이 이니셔티브의 가장 중요한 성과는 AI가 임상시험을 더 빠르게 만들었다는 주장이 아닐 것입니다. 연구자들이 불필요한 부담을 줄이고 엄밀성의 숨겨진 손실 없이 더 빨리 신뢰할 수 있는 답에 도달했다는 증거가 될 것입니다.

HHS는 목표를 정의했습니다. 이제 ARPA-H는 방법을 보여야 하고, FDA는 증거 경로를 명확히 해야 하며, 지원받는 팀은 외부인이 재현할 수 있는 결과를 공개해야 합니다. 첫 SURPASS 프로젝트는 속도를 홍보하는 만큼 명확하게 검증 규칙을 공개할까요?

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page