top of page

Cognita Imaging FDA 계약, LLM 배심원이 방사선학 AI를 안전하게 평가할 수 있는지 시험

5일 전
12분 분량

Cognita Imaging은 약 100만 건의 환자 검사를 대상으로 LLM 배심원을 시험하기 위한 129만 달러 규모의 FDA 계약을 수주했다. 18개월간 진행되는 이 프로젝트는 모든 사례를 인간 검토자에게 배정하지 않고 완전한 방사선 판독 보고서를 생성하는 AI 시스템을 평가하는 까다로운 규제 문제를 겨냥한다.

Cognita Imaging FDA 계약은 의료기기를 허가하거나 회사의 기술을 승인하는 것이 아니다. 대신 여러 대규모 언어 모델이 보고서를 일관되게 평가할 수 있는지를 조사하는 규제과학 연구에 자금을 지원한다. 방사선 전문의는 전체 데이터세트를 수작업으로 검토하는 대신, 임상적으로 중요한 불일치를 살펴볼 예정이다.

이 구분에는 핵심적인 긴장이 담겨 있다. 자동화된 평가는 100만 건 규모의 연구를 가능하게 하지만, 보고서 생성기와 인간 전문가 사이에 또 하나의 오류 가능성이 있는 AI 계층을 도입한다. 따라서 이 프로젝트는 보고서 작성 모델과 그 결과를 평가하는 모델 모두를 검증해야 한다.

Cognita는 소프트웨어 코드, LLM 배심원 구축 가이드라인, 검증 코호트 비교, 방사선 전문의가 검토한 불일치 연구를 제공할 계획이다. FDA는 프로젝트 결과와 한계를 다룬 보고서도 받게 된다.

결과는 Cognita를 넘어 중요하다. 의료 AI 개발자들은 점점 완전한 임상 텍스트 생성을 원하고 있으며, 규제당국은 그러한 더 광범위한 시스템을 어떤 근거로 뒷받침할 수 있을지 결정해야 한다. 이 계약은 자동화가 임상적 의미를 약화시키지 않으면서 그 근거를 확장할 수 있는지 시험할 것이다.

Cognita Imaging FDA 계약이 실제로 지원하는 것

이 계약은 평가 방법에 자금을 지원하는 것이지, 자율 방사선학 제품의 판매 허가가 아니다.

FDA는 Cognita Imaging에 1,294,042달러 규모의 확정총액 계약을 수여했다. 연방 계약 기록에는 방사선 판독 보고서 평가를 위한 AI 기반 가상 분야별 전문가 에이전트를 다루는 계약 번호 75F40126C00035로 기재돼 있다.

계약은 2026년 6월 22일 발효됐으며 2027년 12월 21일까지 진행된다. Cognita는 9월 16일 이 프로젝트를 공개 발표했다. 회사는 규제과학 연구를 위한 FDA의 Broad Agency Announcement 프로그램을 통해 계약을 수주했다.

프로젝트 명칭은 “Virtual Subject Matter Expert Agents for Radiology Report Evaluation”이다. Cognita는 여러 LLM이 사람이 작성한 방사선 판독 보고서와 AI가 생성한 방사선 판독 보고서를 평가하는 프레임워크를 개발하고 검증할 예정이다.

LLM 배심원은 동일한 결과물을 독립적으로 평가하는 언어 모델 집단이다. 이들의 종합 판단은 단일 자동 평가기가 숨길 수 있는 불일치를 드러낼 수 있다.

이 방법은 이후 미국의 대규모 코호트에서 수집된 약 100만 건의 환자 검사에 적용된다. 연구는 환자 집단, 진료 환경, 영상 장비, 질환, 희귀 소견 전반의 성능을 검토할 예정이다.

이 규모는 제안의 핵심이다. 기존 판독자 연구에서는 방사선 전문의가 참조 사례와 비교해 모델 결과를 검토한다. 이러한 연구는 여전히 필수적이지만, 전문가의 시간은 검토할 수 있는 사례의 수와 다양성을 제한한다.

완전한 보고서는 범위가 좁은 탐지 시스템보다 더 넓은 평가 영역을 만든다. 트리아지 모델은 의심되는 혈전이나 폐허탈을 식별할 수 있다. 출력이 제한돼 있어 정의된 기준과 비교할 수 있다.

생성된 보고서에는 수많은 소견, 단서, 비교, 권고가 포함될 수 있다. 이상 소견을 누락하거나, 존재하지 않는 소견을 만들어 내거나, 중증도를 잘못 기술하거나, 올바른 소견을 모호하게 설명할 수 있다.

Cognita의 접근법은 여러 LLM에게 이러한 차이를 대규모로 분류하도록 한다. 배심원이 임상적으로 중요한 불일치를 식별하면 방사선 전문의가 개입한다.

회사의 계약 발표에 따르면, 검토자들은 문제가 생성된 보고서, LLM 배심원, 원래 방사선 전문의 보고서 중 어디에서 비롯됐는지 판단한다. 참조 보고서가 자동으로 완벽한 것은 아니므로, 이 세 방향 판정은 매우 중요하다.

연구는 Cognita 공동 창업자인 Akshay Chaudhari가 이끈다. 그는 Stanford University의 방사선학 및 생의학 데이터 과학 부교수이기도 하다. Cognita CEO이자 공동 창업자인 Louis Blankemeier는 공동 연구자로 참여한다.

Cognita는 Radiology Partners가 소유한 Mosaic Clinical Technologies의 완전 자회사다. 이러한 관계를 통해 연구팀은 다양한 진료 환경 전반의 임상 인프라와 방사선학 전문성에 접근할 수 있다.

Radiology Partners는 자사 광범위한 네트워크에 3,400곳이 넘는 의료 시설에서 진료하는 4,000명 이상의 방사선 전문의가 포함된다고 밝힌다. 또한 연간 5,500만 건 이상의 영상 검사를 판독한다고 보고한다.

이 회사 수치는 계약의 검증 결과가 아니라 잠재적인 운영 맥락을 설명한다. 100만 건 검사 코호트는 여전히 정의, 시험, 보고가 필요하며, 다른 이들이 그 대표성을 평가할 수 있을 만큼 충분한 세부 정보가 제공돼야 한다.

계약상 산출물은 이 프로젝트를 비공개 벤치마크보다 더 실질적인 것으로 만든다. Cognita는 코드, 구현 가이드, 대규모·소규모 코호트 분석, 판정된 불일치 연구, 문서화된 한계를 제공해야 한다.

다만 FDA는 이 프레임워크를 규제 표준으로 채택하겠다고 약속하지 않았다. 이 연구는 모든 생성형 방사선학 제품에 필수 경로가 되지 않으면서도 향후 정책에 정보를 제공할 수 있다.

계약 자금 지원과 제품 허가는 서로 다른 목적을 수행하므로 이 경계는 중요하다. Cognita의 별도 흉부 X선 모델은 혁신 의료기기 지정을 받았지만, 시판 허가는 받지 못했다.

원 보도 역시 연구 계약과 혁신 의료기기 지정이 별개의 이니셔티브임을 확인한다. 어느 쪽도 향후 의료기기 제출을 뒷받침하는 근거를 대체하지는 않는다.

완전한 보고서가 기존 평가 모델을 무너뜨리는 이유

생성형 방사선학 시스템은 평가를 좁은 정확도 시험에서 개방형 임상 비교 문제로 바꾼다.

역사적으로 허가된 방사선학 AI의 대부분은 범위가 한정된 작업을 수행했다. 시스템은 장기를 분할하거나, 긴급 스캔을 표시하거나, 구조를 측정하거나, 특정 이상 소견을 탐지할 수 있다.

이러한 기능도 복잡한 시험을 요구할 수 있다. 하지만 개발자는 일반적으로 연구에 앞서 예상 출력, 참조 표준, 대상 집단을 정의할 수 있다.

완전한 보고서 생성은 다르다. 모델은 이미지와 경우에 따라 임상 맥락을 받아, 관련 있다고 판단하는 모든 내용을 포괄하는 서술을 만든다.

한 검사에는 임상적 우선순위가 서로 다른 여러 이상 소견이 포함될 수 있다. 다른 검사는 정상일 수 있지만, 질환으로 오인해서는 안 되는 수술 후 변화가 포함될 수 있다.

생성된 보고서는 사실상 정확하면서도 우선순위 설정이 부적절할 수 있다. 올바른 소견을 언급하더라도 긴급성을 바꾸는 표현으로 기술할 수 있다. 이미지가 뒷받침하지 않는 그럴듯한 문장을 생성할 수도 있다.

환각은 신뢰할 만해 보이지만 근거가 되는 증거의 뒷받침이 없는 정보를 뜻한다. 누락은 보고서에 문서화돼야 할 소견이 포함되지 않는 경우에 발생한다.

두 오류 모두 단순한 텍스트 일치로는 다루기 어렵다. 두 명의 유능한 방사선 전문의는 동일한 이미지를 다르게 기술할 수 있으며, 반대로 유사한 두 보고서는 임상적으로 의미 있는 차이를 지닐 수 있다.

전통적인 언어 지표는 흔히 공통된 단어나 구를 보상한다. 무해한 표현 변경과 환자 관리에 영향을 미치는 오류를 신뢰성 있게 구분하지 못한다.

Cognita는 이전에 Generative Radiology Report Evaluation and Error Notation의 약자인 GREEN 개발을 지원했다. GREEN은 언어 모델을 사용해 생성 보고서와 참조 보고서 사이의 임상적으로 중요한 차이를 식별, 분류, 설명한다.

동료 심사를 거친 GREEN 논문은 여러 기존 텍스트 지표보다 전문가 평가와 더 강한 일치도를 보고했다. 또한 단순히 유사도 점수만 반환하는 것이 아니라 설명과 오류 수를 함께 제공했다.

FDA 계약은 기본 개념을 두 가지 방식으로 확장한다. 하나의 모델에 의존하는 대신 여러 모델 판정을 사용하며, 자동화된 판단이 임상적으로 중요해지는 사례에 방사선 전문의를 참여시킨다.

배심원은 한 모델의 선호도에 대한 의존성을 줄일 수 있지만, 구성원들이 실질적으로 다른 판단을 제공할 때만 가능하다. 여러 모델은 학습 출처, 추론 실패, 동일한 표현에 대한 민감도를 공유할 수 있다.

따라서 합의는 정확성과 동일하지 않다. 같은 실수를 저지르는 다섯 개의 모델은 유효한 근거를 더하지 않으면서도 더 큰 확신을 만들 수 있다.

제안된 불일치 절차는 이러한 위험의 일부를 다룬다. 판정 모델들이 임상적으로 중요한 사안에서 의견이 갈리면, 방사선 전문의가 보고서를 검토하고 무엇이 실패했는지 판단할 수 있다.

그러나 일치 자체도 시험할 필요가 있다. 모든 배심원 구성원이 동일한 누락을 간과한다면, 불일치 기반의 상향 검토는 해당 사례를 인간 검토자에게 보내지 못할 것이다.

따라서 프로젝트에는 별도로 표본 추출된 인간 검토 집합이 필요하다. 이 집합은 만장일치와 의견이 갈린 배심원 결정 모두에서 오류를 추정할 수 있다.

대규모 및 소규모 코호트 비교도 중요하다. 회사는 수백 건의 선별된 사례를 넘어 평가가 확대될 때 어떤 추가 실패 패턴이 드러나는지 보여줘야 한다.

100만 건의 검사는 더 많은 희귀 질환과 이례적인 조합을 포함해야 한다. 또한 스캐너, 기관, 환자 집단, 임상 환경과 관련된 성능 변화를 드러낼 수 있다.

그러나 규모만으로 포괄성이 보장되지는 않는다. 대규모 데이터세트도 중요한 집단, 흔하지 않은 장비, 출처 네트워크 밖의 환경을 충분히 대표하지 못할 수 있다.

이 때문에 코호트 구성은 최종 분석의 일부로 남아야 한다. 독자들은 이 방법이 실제 미국 진료 환경을 반영하는지 판단하기 위해 헤드라인 수치 이상의 정보를 필요로 한다.

FDA에는 생성형 AI에 부합하는 근거가 필요하다

이 계약은 FDA가 기존 의료기기 규칙을 더 광범위하고 예측하기 어려운 출력을 갖는 시스템에 어떻게 적용할지 결정하는 시점에 체결됐다.

8월 18일 FDA는 생성형 AI 기반 의료기기에 관한 토론 문서를 공개했다. FDA는 위험 평가, 시판 전 평가, 시판 후 모니터링, 수명주기 관리에 대한 의견을 요청했다.

이 시점은 Cognita Imaging FDA 계약의 관련성을 특히 높인다. FDA는 개별 제품만 검토하는 것이 아니다. 새로운 콘텐츠를 생성하는 의료기기에 기존 평가 방법이 적합한지도 살피고 있다.

FDA의 토론 문서는 출력이 가변적이거나 개방형일 때 성능을 측정하는 문제를 제기한다. 또한 개발자가 환각을 어떻게 탐지하고, 인간 감독을 평가하며, 배포 후 제품을 모니터링해야 하는지도 묻는다.

AI가 생성한 방사선 판독 보고서는 이러한 모든 사안과 맞닿아 있다. 출력은 실행마다 달라질 수 있고, 여러 임상적 주장을 담을 수 있으며, 방사선 전문의가 최종 보고서에 서명하더라도 의사결정에 영향을 줄 수 있다.

시판 전 연구는 허가 전에 안전성과 유효성을 입증해야 한다. 하지만 제한된 시험 집합은 이후 임상 사용에서 나타나는 희귀한 조합을 놓칠 수 있다.

시판 후 모니터링은 더 폭넓은 근거를 제공하지만, 배포된 모든 보고서를 검토하면 큰 운영 부담이 발생한다. 자동화된 판정 모델은 전문가의 주의가 필요한 사례를 식별하는 데 도움이 될 수 있다.

이는 출시 전 검증과 실제 환경 감시를 연결하는 잠재적 가교를 만든다. 동일한 평가 프레임워크로 출시 전 모델을 시험하고, 배포 후에는 선별된 출력을 모니터링할 수 있다.

이 프레임워크에는 여전히 명확한 기준값이 필요하다. 치료를 바꾸는 불일치는 문체상의 이견이나 무해한 표현 차이와는 다른 대응을 받아야 한다.

추적 가능한 기록도 필요하다. 규제기관과 병원은 자동화된 심사자가 특정 오류 범주를 부여한 이유와 사례가 인간 검토자에게 전달된 이유를 재구성할 수 있어야 한다.

모델 업데이트는 또 다른 과제를 더한다. 보고서 생성기가 바뀌면 오류 분포도 달라질 수 있다. 배심원 구성원이 바뀌면 평가 시스템의 판단 역시 달라질 수 있다.

이로써 하나가 아니라 두 개의 가변 시스템이 생긴다. 검증된 보고서 생성기가 평가자 업데이트만으로 더 좋아 보이거나 더 나빠 보일 수 있다.

따라서 버전 관리, 고정된 테스트 세트, 재현 가능한 프롬프트가 필요하다. 개발자는 검토 대상 제품과 이를 평가하는 모든 심사자를 모두 문서화해야 한다.

FDA는 이미 여러 의료 전문 분야의 허가 제품을 포괄하는 AI device list를 유지하고 있다. 영상의학은 여전히 목록에 포함된 기기에서 큰 비중을 차지한다.

FDA는 향후 목록 업데이트에서 LLM 기반 기능을 포함한 기기를 더 명확히 식별하고자 한다고 밝힌다. 이는 생성형 기능이 의료 제품에 진입함에 따라 더 정밀한 규제 가시성이 필요하다는 신호다.

기존 영상의학 AI 시장 역시 경쟁 압력을 높인다. Aidoc, Viz.ai, Lunit, Annalise.ai, Rad AI, DeepHealth 같은 기업들은 탐지, 분류, 워크플로, 보고 도구를 서로 다른 방식으로 결합해 왔다.

확장 가능한 보고서 평가 방법이 Cognita에 자동으로 유리하게 작용하는 것은 아니다. FDA가 광범위하게 적용 가능한 지침을 발표하면 경쟁사도 유사한 증거 전략을 활용할 수 있다.

오히려 압박은 제한된 판독자 연구를 바탕으로 폭넓은 성능 주장을 하는 모든 개발자에게 가해진다. 규제기관과 구매자는 수백 건의 선별된 사례가 실제 임상 변이 전반에서의 모델 행동을 보여 주는지 물을 수 있다.

병원도 조달 과정에서 같은 질문을 제기할 수 있다. 모델이 현지 스캐너, 프로토콜, 환자군, 보고 관행 전반에서 작동한다는 증거가 필요하다.

계약이 신뢰할 수 있는 방법론을 산출한다면, 더 큰 검증 코호트는 증거 패키지의 필수 요소가 될 수 있다. 이는 시험 요구를 높이는 한편, 선택적 사례만으로 광범위한 생성형 주장을 뒷받침하기 어렵게 만들 것이다.

LLM 배심원도 검증받아야 한다

핵심적인 상충관계는 명확하다. LLM 심사자는 확장성을 제공하지만, 자체 오류가 규제기관이 받는 증거를 왜곡할 수 있다.

LLM은 중립적인 위치에서 보고서를 평가하지 않는다. 그 판단은 학습 데이터, 프롬프트, 모델 버전, 평가 순서, 각 후보 보고서의 표현 방식에 따라 달라진다.

심사자는 추가 텍스트가 임상적 위험을 만들더라도 더 긴 답변을 선호할 수 있다. 익숙한 문체를 선호하거나 자신의 응답과 유사한 출력에 더 높은 점수를 부여할 수도 있다.

모델은 반복 평가에서도 일관되지 않은 결정을 내릴 수 있다. 개발자가 규제 제출을 위해 안정적인 측정값을 필요로 할 때 이는 재현성 문제를 만든다.

의료 분야에서는 미묘한 차이가 중요하기 때문에 위험이 더 크다. 일반 의료 질문에서 좋은 성능을 보이는 평가자라도 불확실성, 좌우 구분, 시간적 비교, 영상 특화 용어를 잘못 처리할 수 있다.

최근 LLM judge systems에 관한 의료 분야 검토는 자동화된 평가가 유망하다고 설명하면서도 검증, 투명성, 인간 감독의 필요성을 강조한다.

Cognita 프로젝트는 이러한 우려 가운데 여러 항목을 조사하도록 구성됐다. 여러 심사자는 불안정성을 드러낼 수 있으며, 영상의학 전문의의 판정은 불일치가 임상적으로 중요한 불확실성을 가리키는지 시험할 수 있다.

그러나 배심원 구조가 편향을 자동으로 제거하는 것은 아니다. 구성원은 모델 수에 따라 모으는 것이 아니라 상호 보완적인 성능을 기준으로 선정되고 검증돼야 한다.

연구는 심사자들이 서로 다른 모델 계열에서 왔는지 공개해야 한다. 또한 어떤 심사자가 보고서 생성기와 기술, 데이터, 최적화 방식을 공유하는지도 설명해야 한다.

자기 선호는 특히 우려되는 문제다. 한 모델 계열은 자체 구조, 장황함, 추론 패턴과 유사한 출력을 선호할 수 있다.

개발자가 관련 모델을 사용해 생성기를 평가할 경우 이 문제는 더욱 심각해진다. 겉보기에 높은 점수는 임상적 정확성보다 문체적 친화성을 반영할 수 있다.

프롬프트 민감성도 검토가 필요하다. 지침의 작은 변화만으로도 심사자가 누락, 불확실성, 임상적 중요성을 평가하는 방식이 달라질 수 있다.

규제 프레임워크는 문서화되지 않은 하나의 구성에서만 작동하는 프롬프트에 의존할 수 없다. 프롬프트, 온도, 모델 버전, 의사결정 규칙은 재현 가능해야 한다.

배심원은 보고서 품질과 영상상의 사실을 구분해야 한다. 텍스트 전용 심사자는 두 보고서를 비교할 수 있지만, 어느 설명이 스캔과 일치하는지는 독립적으로 확인할 수 없다.

원본 보고서가 소견을 놓친 경우, 생성된 보고서는 이를 정확히 추가했음에도 불이익을 받을 수 있다. 두 텍스트가 같은 오류에 동의할 때는 반대 상황도 발생할 수 있다.

Cognita가 제안한 영상의학 전문의 검토는 이미지로 돌아가 이러한 충돌 일부를 해결할 수 있다. 최종 방법론은 영상 검토가 선택 사항이 아니라 필수인 시점을 명시해야 한다.

완전히 영상 인지형인 평가자도 자체적인 복잡성을 안고 있다. 시각-언어 모델은 이미지와 텍스트를 모두 검사할 수 있지만, 그 시각적 해석 역시 검증돼야 한다.

이는 계층화된 보증 문제를 만든다. 모델을 추가할 때마다 기능은 확장되지만, 조용히 실패할 수 있는 구성 요소도 하나 더 늘어난다.

임상적으로 중요한 불일치 역시 고정된 범주가 아니다. 한 환자에게는 사소한 표현 차이도 추적 관찰, 긴급도, 치료에 영향을 미치면 중요해질 수 있다.

프레임워크에는 명시적인 오류 범주와 중증도 정의가 필요하다. 영상의학 전문의들은 이러한 규칙을 적용할 때 의미 있는 수준의 합의를 보여야 한다.

판독자 간 불일치를 제거해야 할 잡음으로 취급해서는 안 된다. 이는 이미지, 보고서, 임상 맥락에 존재하는 실제 모호성을 드러낼 수 있다.

따라서 가장 유용한 결과는 단일한 보편 점수보다 보정된 불확실성일 수 있다. 불확실한 사례를 신뢰성 있게 식별하는 시스템은 전문가 판단을 대체하는 척하지 않으면서 감독을 지원할 수 있다.

비용과 지연 시간도 도입에 영향을 미친다. 100만 건의 보고서에 여러 독점 모델을 실행하려면 상당한 컴퓨팅 자원과 반복 처리가 필요할 수 있다.

이러한 경제성이 접근법을 무효화하는 것은 아니지만, 소규모 개발자도 이를 재현할 수 있는지에 영향을 준다. 대형 조직만 평가 인프라를 감당할 수 있다면 규제 방법의 유용성은 떨어진다.

Cognita의 코드와 구현 지침은 도움이 될 수 있다. 다만 최종 산출물은 하드웨어 요구사항, 모델 접근성, 처리 시간, 비공개 모델 업데이트에 대한 민감도도 설명해야 한다.

따라서 이 계약의 성공은 영상의학 전문의와의 표면적 일치도만이 아니라 투명성과 반복 가능성으로 판단돼야 한다. 신뢰할 수 있는 부정적 결과 역시 유용한 규제 증거가 될 수 있다.

LLM 배심원이 특정 오류 범주에서 실패한다면 FDA는 그에 맞춰 역할을 제한할 수 있다. 이 연구는 평가 관행을 개선하기 위해 보편적 신뢰성을 입증할 필요는 없다.

100만 건의 검사에서 성공한다는 의미

성공적인 결과는 인간 검토를 더 정교하게 표적화하는 것이지, 영상의학 전문의를 선택 사항으로 만드는 것이 아니다.

이 프로젝트의 핵심 운영 모델은 선택적 에스컬레이션이다. 자동화된 심사자가 광범위한 데이터세트를 처리하고, 전문가는 의미 있는 불확실성이나 불일치가 있는 사례에 집중한다.

이 설계는 제한된 전문가 시간을 더 넓게 활용할 수 있게 한다. 또한 검토자를 모델의 약점을 드러낼 가능성이 가장 높은 사례에 집중시킬 수 있다.

이점은 분류 민감도에 달려 있다. 배심원은 무해한 차이로 인해 전문의를 압도하지 않으면서, 실제로 문제가 있는 보고서를 충분히 많이 영상의학 전문의에게 보내야 한다.

위음성은 더 큰 안전 우려를 제기한다. 이는 배심원이 임상적으로 중요한 보고 오류를 받아들이고 인간 검토를 전혀 요청하지 않을 때 발생한다.

위양성은 다른 부담을 만든다. 안전한 보고서가 너무 많이 에스컬레이션되면 약속된 효율성은 사라지고, 시스템은 또 하나의 전면적 판독자 연구에 가까워진다.

연구는 다양한 오류 중증도에서 두 결과를 모두 보고해야 한다. 단일 일치율은 운영상의 상충관계를 가릴 것이다.

성능은 질환, 영상 기법, 환자 특성, 시설 유형, 장비별로도 나뉘어야 한다. 집계 결과는 소규모 집단에서의 취약한 성능을 감출 수 있다.

희귀 소견에는 특별한 주의가 필요하다. 모델은 드물지만 긴급한 상태에서 실패하면서도 높은 전체 정확도를 달성할 수 있다.

100만 건의 검사는 희귀 사건 분석을 더 현실적으로 만들지만, 실제 건수는 여전히 중요하다. 사례가 몇 건뿐인 희귀 하위 집단은 안정적인 결론을 뒷받침할 수 없다.

소규모와 대규모 검증 코호트의 비교는 특히 유익할 것이다. 사례 구성이 확대될 때 기존 연구에서 도출한 결론이 안정적으로 유지되는지 보여 줄 수 있다.

순위나 오류율이 실질적으로 달라진다면, 개발자와 규제기관은 소규모 평가가 중요한 행동을 놓친다는 증거를 얻게 된다. 배심원 자체에 보완이 필요하더라도, 이 결과는 연구 설계를 재편할 수 있다.

성공은 시판 후 모니터링에도 영향을 미칠 것이다. 병원은 운영 중인 보고서를 표본 추출하고, 승인된 평가 방법을 적용하며, 고위험 불일치를 품질 관리팀에 전달할 수 있다.

이러한 모니터링에는 현지 거버넌스가 필요하다. 의료 시스템은 경보, 검토 기한, 시정 조치, 공급업체와의 소통에 대한 명확한 책임 체계를 갖춰야 한다.

자동화된 평가는 보고 안전 문제 보고를 대체해서는 안 된다. 이는 기존 품질 및 규제 절차를 뒷받침하는 증거를 생성해야 한다.

이 방법은 제품 버전을 비교하는 데도 도움이 될 수 있다. 개발자는 업데이트가 알려진 오류를 수정하면서 다른 영역에서 새로운 오류를 만들지 않는지 평가할 수 있다.

이 용도에는 안정적인 벤치마크와 고정된 평가자 구성이 필요하다. 그렇지 않으면 배심원의 변화가 제품의 변화로 오인될 수 있다.

더 광범위한 경쟁 효과도 상당할 수 있다. 생성형 영상의학 개발자들은 자신의 시스템이 포괄적인 보고서를 초안 작성하거나 생성할 수 있다고 점점 더 주장한다.

평가자가 크고 다양한 코호트를 검토할 수 있게 되면 이러한 주장은 더 시험 가능해진다. 증거가 제한적인 기업은 하위 집단 결과와 판정된 오류율을 공개하라는 압박을 받을 수 있다.

그럼에도 FDA 계약은 Cognita에 방법론 형성에서 초기 역할을 부여한다. 이 회사는 자체 영상의학 AI를 개발하기 때문에, 이해상충 관리와 외부 재현성이 중요할 것이다.

독립 팀은 다른 보고서 생성기에서도 프레임워크를 시험할 수 있어야 한다. 또한 Cognita의 비공개 시스템에 의존하지 않고 핵심 결과를 재현할 수 있어야 한다.

오픈 코드는 이 과정을 지원할 수 있지만, 코드만으로는 충분하지 않다. 외부 검증에는 접근 가능한 데이터세트, 문서화된 프롬프트, 오류 정의, 모델 버전 기록이 필요하다.

환자 개인정보 보호는 공개할 수 있는 원본 데이터의 양을 제한할 것이다. 프로젝트는 통제된 접근, 비식별화 벤치마크, 독립 검증 환경을 통해 이를 해결할 수 있다.

가장 강력한 결과는 규모와 감사 가능성을 결합하는 것이다. 그러면 규제기관은 불투명한 점수를 받아들이는 대신 결과가 어떻게 산출됐는지 검사할 수 있다.

이 기준은 의료 구매자에게도 도움이 될 것이다. 병원은 공급업체가 정의한 정확도 수치 대신 임상적 결과와 연결된 오류 범주를 사용해 주장을 비교할 수 있다.

세 가지 신호가 LLM 배심단의 준비 상태를 보여줄 것이다

다음 증거는 Cognita의 프레임워크가 임상 안전성을 측정하는지, 아니면 언어 모델 간의 합의만 자동화하는지를 드러내야 한다.

첫 번째 신호는 상세한 검증 프로토콜이다. 여기에는 배심단 구성원, 프롬프트, 모델 버전, 코호트 구성, 오류 분류 체계, 에스컬레이션 규칙이 명시되어야 한다.

이러한 세부 사항은 접근 방식의 재현 가능성을 결정한다. 또한 배심단이 실질적으로 서로 다른 평가자로 구성됐는지, 아니면 밀접하게 연관된 모델들로 이뤄졌는지도 보여줄 것이다.

강력한 프로토콜이라면 연구자들이 만장일치 결정 사례를 사람의 검토 대상으로 어떻게 표본 추출하는지 명시해야 한다. 합의는 공통된 실수를 가릴 수 있으므로, 이 검증은 필수적이다.

두 번째 신호는 영상의학 전문의가 판정한 불일치 분석이다. 연구자들은 생성된 보고서, 원본 보고서, LLM 배심단이 각각 어디에서 실패했는지 보고해야 한다.

이 분석은 환각, 누락, 잘못된 중증도 판단, 좌우 측 오류, 근거 없는 권고, 그리고 상대적으로 영향이 적은 표현상의 차이를 구분해야 한다.

하위 그룹별 성능도 공개해야 한다. 드문 질환, 충분히 대표되지 않은 인구집단, 또는 특정 진료 환경에서의 취약한 평가를 안정적인 전체 결과가 보완할 수는 없다.

배심단이 검토 업무량을 관리 가능한 수준으로 유지하면서 임상적으로 중요한 불일치를 찾아낸다면, 이 계약의 핵심 논지는 힘을 얻는다. 높은 누락률이나 과도한 에스컬레이션은 이를 약화시킬 것이다.

세 번째 신호는 연구가 성숙한 뒤 FDA가 어떻게 대응하는지다. FDA는 가이드라인, 공개 워크숍, 의료기기 심사 또는 시판 후 모니터링 제안에서 이 방법론을 언급할 수 있다.

이 프로젝트가 의미를 갖기 위해 FDA가 LLM 배심단을 의무화할 필요는 없다. 제한적인 수용만으로도 대규모 코호트 평가와 인간 판정에 관한 기대 기준을 형성할 수 있다.

침묵 역시 의미 있는 신호가 될 수 있다. 이는 해당 방법에 추가 검증이 필요하거나, 규제 당국이 제품별 증거를 선호한다는 뜻일 수 있다.

대중은 Cognita Imaging의 FDA 계약을 AI가 스스로를 안전하게 감독할 수 있다는 증거로 해석해서는 안 된다. 이 프로젝트는 바로 그 질문이 여전히 해결되지 않았기 때문에 존재한다.

더 방어 가능한 전제는 더 좁다. 자동화된 판단 시스템은 자체 성능도 동등한 엄격성으로 측정된다면, 영상의학 전문의가 훨씬 더 많은 증거를 검토하도록 도울 수 있다.

개발자, 임상의, 의료 서비스 구매자는 최종 결과물이 실패 양식을 하나의 점수로 압축하는 대신 드러내는지 지켜봐야 한다. 또한 독립적인 팀이 결과를 재현할 수 있는지도 물어야 한다.

결정적인 질문은 여러 LLM이 보고서에 대해 합의할 수 있는지가 아니다. 이들의 합의와 불일치가 가장 중요한 사례로 인간의 주의를 신뢰성 있게 이끄는지 여부다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page