top of page

GPT-4 폐 생검 계획, 더 짧은 바늘 경로 제시했지만 두 건은 검토에서 탈락

6분 전
9분 분량

GPT-4의 폐 생검 계획은 30건 중 28건에서 수용 가능한 바늘 경로를 제안했지만, 두 건의 실패는 중대한 안전성 공백을 드러냈다. 이 모델은 실제 시술 중 바늘을 제어하거나 환자를 평가한 것이 아니라, 주석이 추가된 2차원 CT 이미지를 바탕으로 작동했다.

Memorial Sloan Kettering Cancer Center의 연구진은 GPT-4가 CT 유도 폐 생검의 진입 각도를 권고할 수 있는지 후향적으로 시험했다. 독립 영상의학 전문의들은 모델이 제안한 경로의 93.3%가 생검 수행에 적절하다고 판단했다.

AI 경로는 폐 조직을 중앙값 5밀리미터 통과했으며, 이는 숙련된 임상의가 기존에 선택한 경로의 23밀리미터와 비교된다. 그러나 더 짧다고 해서 자동으로 더 안전한 것은 아니다. 검토에서 제외된 한 경로는 해당 수동 경로보다 네 배 더 많은 폐 조직을 통과했고, 다른 한 경로는 바늘 안정성 문제를 야기할 가능성이 있었다.

이러한 긴장은 핵심 비율보다 더 중요하다. 이 연구는 범용 멀티모달 모델이 신중하게 준비된 의료 영상을 해석하고 그럴듯한 기하학적 계획을 만들 수 있음을 시사한다. GPT-4가 결과를 개선하거나 합병증을 줄이거나, 광범위한 인간의 준비와 감독 없이 생검을 계획할 수 있음을 보여주지는 않는다.

GPT-4 폐 생검 계획 연구가 실제로 시험한 것

이 실험은 환자 대상 AI 유도 시술이 아니라 과거 영상에서 제안된 진입 각도를 평가했다.

오픈 액세스 연구는 CVIR Oncology에 게재됐으며, 연속적으로 시행된 폐 생검 시술 30건을 포함했다. 연구진은 3명의 중재영상의학 전문의가 이미 수행한 시술에서 비식별화된 영상을 사용했다.

각 임상의는 최소 10년의 경험을 보유했다. 환자 코호트는 남성 17명과 여성 13명으로 구성됐으며, 중앙 연령은 65세였다. 폐 결절의 직경은 5~45밀리미터였고, 중앙 직경은 21밀리미터였다.

표본에는 폐첨부 병변 5건, 흉막하 병변 7건, 종격동 인접 병변 3건, 폐기저부 인접 병변 4건이 포함됐다. 이러한 위치는 갈비뼈, 혈관, 폐 조직, 바늘 안정성과 관련된 서로 다른 계획 과제를 제시했다.

CT 유도 폐 생검에서는 의사가 흉벽을 통과해 의심 병변까지 바늘을 전진시킨다. 경로는 뼈, 폐엽간열, 종격동 및 주요 혈관을 피하면서 진단에 적합한 조직에 도달해야 한다.

계획에는 바늘이 통과하는 정상 폐 조직의 양도 고려된다. 더 긴 폐내 경로는 더 많은 조직을 노출할 수 있지만, 경로 길이는 시술 위험을 구성하는 한 요소일 뿐이다.

연구진은 GPT-4에 수정되지 않은 CT 검사를 제공하지 않았다. 연구자가 축상 영상을 선택해 자르고 확대했으며, GIMP를 사용해 방사형 격자를 추가했다. 영상은 원래의 의료 형식에서 PNG 파일로 변환됐다.

한 저자는 표적을 파란색 원으로 표시하고 민감한 구조물을 빨간색으로 윤곽 처리했다. 이러한 주석은 실제 배포 가능한 시스템이라면 궁극적으로 자동 식별해야 할 정보를 모델에 제공했다.

연구진은 표준화된 프롬프트를 통해 다섯 가지 계획 기준을 제공했다. 요청된 경로는 표적에 도달하고, 폐 조직 통과를 줄이며, 뼈·엽간열·종격동을 피해야 했다.

각 사례는 새로운 채팅 세션에서 시작됐다. 첫 응답이 모든 조건을 다루지 못한 경우 연구진은 추가 프롬프트를 이어갈 수 있었다. 모델은 중앙값 두 번의 반복이 필요했으며, 사분위 범위는 한 번에서 세 번이었다.

연구팀은 요청된 모든 매개변수를 반영한 첫 번째 응답을 기록했다. 원래 시술에 참여하지 않은 숙련된 중재영상의학 전문의 2명이 경로의 출처를 모르는 상태에서 결과 경로를 독립적으로 검토했다.

이 설정은 실행 가능성과 임상 성과를 구분한다. 모델은 인간 전문가가 영상을 선택하고, 표적을 표시하고, 위험 요소를 식별하고, 규칙을 정한 뒤에 각도를 제안했다. 모든 중요한 단계에서 영상의학 전문의는 여전히 필요했다.

따라서 이 연구는 좁은 질문을 시험했다. 멀티모달 범용 모델이 준비된 영상에서 그럴듯한 진입 각도를 생성할 수 있는가? 자율 분할, 3차원 계획, 실시간 내비게이션 또는 로봇 바늘 제어는 시험하지 않았다.

이 구분은 유망한 계획 실험이 자동화 수술에 대한 근거 없는 주장으로 바뀌는 것을 막는다.

더 짧은 경로가 연구의 가장 강력한 신호를 만들었다

GPT-4는 폐 조직을 통과하는 경로를 훨씬 짧게 제안했지만, 연구는 그러한 경로가 더 안전한 임상 결과를 낳는다고 확립하지 않았다.

독립 검토자들은 모델이 제안한 30개 경로 중 28개가 생검 수행에 적절하다고 평가했다. 이 결과가 연구의 93.3% 실행 가능성 수치를 만들었다.

AI 생성 경로는 폐 조직을 중앙값 5밀리미터 통과했다. 사분위 범위는 0~25밀리미터였다.

이에 비해 완료된 시술에서 사용된 수동 경로는 중앙값 23밀리미터를 통과했다. 이들의 사분위 범위는 5~57밀리미터였다.

보고된 p값은 0.0063으로, 차이는 통계적으로 유의했다. 폐 조직을 전혀 통과하지 않은 경로는 흉막 표면 옆에 위치한 흉막하 결절과 관련됐다.

이러한 병변으로 직접 진입하는 경로는 가스 교환에 관여하는 기능적 조직인 정상 폐 실질을 통과하지 않을 수 있다. 이는 짧은 경로를 기하학적으로 매력적으로 만들지만, 기하학만으로 최선의 임상 접근법을 정의할 수는 없다.

AI의 평균 진입 각도는 179도였고, 임상의가 사용한 경로는 174도였다. 이 차이는 통계적으로 유의하지 않았다.

유사한 평균값이 모델이 인간의 결정을 재현했다는 의미는 아니었다. 주요 결과에 따르면 연구가 명시한 비교 기준에서 30건 중 단 8건만 좋은 일치도를 보였다.

저자들은 진입 각도가 10도 이내이고 조직면을 통과하는 경로가 유사한 경우를 일치로 정의했다. 다른 부분에서는 세 건이라는 더욱 엄격한 일치 해석을 보고했으며, 이는 선택한 정의에 대한 민감성을 부각한다.

이러한 불일치는 중심 평균이 상당한 사례별 차이를 가릴 수 있기 때문에 주목할 필요가 있다. 두 경로 집단은 평균 각도가 비슷하면서도 개별 환자에서는 크게 달라질 수 있다.

따라서 AI는 완료된 시술을 단순히 모방한 것이 아니라 대안 경로를 찾은 것으로 보인다. 일부 대안은 더 짧아 보였고 검토자에게도 수용 가능했다. 다른 일부는 집계 결과가 쉽게 가릴 수 있는 약점을 드러냈다.

비교 자체도 구조적으로 동등하지 않았다. 수동 경로는 환자에게 성공적으로 시행된 반면, AI 경로는 계획 영상 위에 그어진 선으로만 존재했다.

제안 경로는 하나의 축상 단면에서는 합리적으로 보일 수 있지만, 인접 단면 전반에서 평가하면 비현실적일 수 있다. 실제 시술에서는 호흡 움직임, 신체 위치, 바늘 고정, 장비 제약, 변화하는 해부학을 고려해야 한다.

원래 시술에서는 중대한 합병증이 발생하지 않았다. 4명의 환자에게서는 개입 없이 해소된 미세 기흉이 발생했고, 2명에게서는 경미하고 자연적으로 멈춘 객혈이 나타났다.

모델이 시술을 안내하지 않았으므로 이러한 결과를 AI에 귀속할 수는 없다. 연구진은 또한 AI 경로를 사용했을 경우 이러한 합병증이 달라졌을지 시뮬레이션하지 않았다.

따라서 짧은 경로라는 결과는 유용한 가설이다. 특히 기하학적으로 유효한 선택지가 여러 개일 때, 자동화 계획이 임상의가 놓칠 수 있는 경로를 드러낼 수 있는지 시험할 근거를 제공한다.

GPT-4가 폐 생검을 더 안전하게 만들었다고 말할 근거는 되지 않는다. 그러한 주장을 확립하려면 통제된 조건에서 임상 결과를 비교하는 전향적 연구가 필요하다.

두 개의 제외된 경로가 최단 경로가 항상 가장 안전하지는 않은 이유를 보여준다

모델의 실패는 눈에 보이는 지표를 최적화하는 것과 실제 생검 중 바늘의 거동을 이해하는 것 사이의 충돌을 드러낸다.

19번 사례에서 GPT-4는 폐 조직을 20밀리미터 통과하는 경로를 제안했다. 수동 경로는 5밀리미터만 통과했다.

따라서 AI 권고안은 프롬프트에서 제시된 최적화 목표와 달리 폐 조직을 네 배 더 멀리 통과했다. 또한 정확하고 명확하게 선호되는 계획 대신 가능한 진입 각도의 넓은 범위를 반환했다.

검토자들은 이 경로가 이론적으로는 가능하지만 좋은 임상 관행을 대표하지는 않는다고 판단했다. 이 구분은 명백한 장애물을 피하는 것과 신뢰할 수 있는 시술 계획을 수립하는 것 사이의 격차를 포착한다.

27번 사례는 다른 문제를 드러냈다. 표적은 흉막하 결절로, 폐의 외부 표면에 가까이 위치했다.

제안된 AI 경로는 불필요하게 5밀리미터의 폐 조직을 통과했다. 검토자들은 바늘 안정성에 대한 우려도 제기했다.

지지 조직을 통과하는 경로가 지나치게 짧으면 동축 생검 바늘이 충분히 고정되지 않을 수 있다. 채취 과정에서 바늘이 움직이거나 이탈하기 쉬워질 수 있다.

이는 연구의 핵심 상충 관계를 만든다. 정상 폐 조직을 통과하는 거리를 줄이는 것은 본질적으로 유익해 보이지만, 안정적인 경로는 바늘을 안전하게 유지할 만큼 충분한 조직 결합을 필요로 할 수 있다.

모델은 시술 관행을 완전하게 표현한 정보가 아니라 단순화된 규칙을 받았다. 영상의학 전문의가 덜 직접적인 접근법을 선택할 수 있는 모든 이유를 이해하지 못한 채, 해당 규칙을 충족하는 각도를 탐색할 수 있었다.

연구진은 분석이 2차원에 머물렀음을 인정했다. 인간 영상의학 전문의는 보통 여러 CT 단면을 스크롤하고 다평면 재구성을 사용해 3차원 해부학을 이해한다.

단일 축상 영상은 해당 평면 위나 아래로 이어지는 구조물을 완전히 나타낼 수 없다. 또한 겉보기에는 명확한 선이 바늘의 완전한 3차원 경로 전반에서 어떻게 바뀌는지도 보여주지 못한다.

영상은 GPT-4에 전달되기 전에 수동으로 주석 처리됐다. 모델은 모든 병변을 독립적으로 찾거나, 장기를 분할하거나, 중요 해부학 구조 주변의 안전 여유를 신뢰성 있게 정의하지 않았다.

연구는 쇄골하 및 액와 신경혈관 다발로부터의 최소 5밀리미터 여유 기준도 명시하지 않았다. 환자 자세로 인해 이러한 구조물은 평가된 경로에서 멀리 떨어져 있었지만, 향후 시스템은 같은 조건을 가정할 수 없다.

프롬프팅은 또 다른 변동성 원인이 됐다. 연구진은 표준화된 프롬프트로 시작했지만, 모델이 기준을 놓쳤을 때의 후속 상호작용은 완전히 스크립트화되지 않았다.

따라서 두 사용자는 동일한 모델을 서로 다른 답변으로 유도할 수 있다. 임상 계획 시스템에는 즉흥적 대화 없이 감사 가능한 결과를 내는 재현 가능한 프로세스가 필요하다.

사례는 별도 세션에서 처리돼 사례 간 오염을 줄였다. 그러나 연구는 동일한 영상에서 반복 실행했을 때 같은 각도가 반환되는지는 확립하지 않았다.

권고안이 침습적 시술에 영향을 미칠 때 일관성은 중요하다. 실행마다 계획이 달라지는 시스템에는 그러한 차이를 설명하고, 순위를 정하며, 해결하는 방법이 필요하다.

모델 버전도 또 다른 과제를 제시한다. 범용 AI 서비스는 시간이 지나면서 바뀌며, 임상 사용자에게 모든 기술적 변경 사항을 공개하지 않는 경우도 있다.

하나의 GPT-4 구성에서 얻은 결과가 이후 모델로 자동 이전될 수는 없다. 의료 검증은 통제된 시스템 버전, 정의된 입력, 문서화된 운영 프로세스에 연결돼야 한다.

목적 특화 시스템이 범용 모델을 바라보는 관점을 제공한다

GPT-4의 결과가 주목할 만한 이유는 범용 모델을 사용했다는 점이지만, 전문 알고리즘은 이미 더 구조화되고 재현 가능한 계획 수립 방법을 제공하고 있다.

2024년 경로 계획 연구는 경흉부 폐 생검을 위해 특별히 개발된 소프트웨어를 평가했다. 이 시스템은 3차원 병변 탐지와 베이지안 최적화를 결합해 경로를 제안했다.

이 시스템은 219건의 스캔에서 얻은 2,147개 결절을 사용해 학습됐다. 연구진은 354개 병변을 포함한 추가 235건의 스캔으로 병변 탐지 성능을 검증했다.

모델의 보고된 수신자 조작 특성 곡선 아래 면적은 97.4%였다. 평균 민감도는 93.5%, 평균 특이도는 93.2%에 도달했다.

연구진은 150명의 환자에서 제안된 경로를 실제 생검 경로와 비교했다. 각도 차이가 5도 미만인 경우를 일치로 분류했다.

이 시스템은 평가 사례의 85.3%에서 실행 가능한 경로를 생성했다. 연구 정의에 따라 82%가 실제 경로와 일치했으며, 일치한 경로의 평균 각도 편차는 2.30도였다.

이 시스템은 GPT-4가 수행하지 못한 3차원 분할과 병변 탐지 등의 작업을 다뤘다. 그러나 이 역시 환자 결과 개선을 입증한 연구가 아니라 후향적 평가에 머물렀다.

더 이른 연구에서도 규칙 기반 AI 계획과 전문의 판단을 비교했다. 2023년 개념 증명 연구는 28명의 환자 각각에 대해 5개의 후보 경로를 생성했다.

경험 많은 의사 4명이 140개의 경로를 평가했다. 컴퓨터와 의사는 사례의 57.9%에서 동일한 점수를 부여했으며, 알고리즘이 선택한 최적 경로 28개는 모두 안전한 것으로 평가됐다.

보다 최근의 연구는 이 비교를 확장했다. TRAX로 알려진 CT 유도 생검용 경로 추천 알고리즘은 의사가 표적을 식별한 뒤 약 20,000개의 후보 경로를 생성하고 순위를 매긴다.

53명의 환자를 대상으로 한 TRAX 비교 연구에서, 눈가림 평가를 수행한 영상의학과 의사들은 AI가 선택한 모든 경로와 의사가 선택한 모든 경로를 안전하다고 평가했다. 비교의 58%에서는 평가가 동일했다.

검토자들은 23%에서 TRAX를, 19%에서 의사 경로를 선호했다. 이 차이는 통계적으로 유의하지 않았지만, TRAX 경로는 평균적으로 약간 더 짧았다.

TRAX는 표준 축상면 밖의 경로도 더 많이 선택했다. 해당 시스템 경로의 절반은 기울어진 평면을 사용한 반면, 의사 경로의 81.1%는 축상면에 머물렀다.

이 연구들은 한 명의 승자가 나오는 단순한 경쟁을 보여주지 않는다. 입력값, 정의, 데이터셋, 경로 일치 임계값이 모두 다르기 때문이다.

목적에 맞게 구축된 시스템은 해부학적 제약을 인코딩하고, 거리를 정량화하며, 수천 개의 경로에 일관되게 순위를 매길 수 있다. 멀티모달 언어 모델은 더 큰 유연성을 제공하지만 이미지 준비, 프롬프팅, 인간의 해석에 더 크게 의존한다.

따라서 GPT-4의 역할은 경로 엔진보다는 계획 수립 보조 도구에 더 가까울 수 있다. 임상의가 선택지를 비교하고, 놓친 접근법을 식별하거나, 특정 선택의 근거를 문서화하는 데 도움을 줄 수 있다.

이러한 보조 역할에도 안전장치는 필요하다. 인터페이스는 모델 제안과 승인된 계획을 구분해야 하며, 전체 해부학적 경로를 보여주고 인간 검토 기록을 보존해야 한다.

의미 있는 경쟁은 AI와 영상의학과 의사 간의 대결이 아니다. 이미지 위의 선을 안전한 시술로 바꾸는 데 필요한 완전한 임상 판단과 자동화된 기하학적 제안 간의 비교다.

GPT-4 폐 생검 계획에는 여전히 전향적 검증이 필요하다

다음 근거는 또 하나의 높은 실행 가능성 비율이 아니라 재현성, 3차원 성능, 환자 이득을 보여줘야 한다.

첫 번째로 주목할 신호는 재현성이다. 연구진은 통제된 세션에서 동일한 사례를 반복 실행하고, 모델이 같은 경로를 얼마나 자주 선택하는지 측정해야 한다.

모든 프롬프트와 후속 조건도 표준화해야 한다. 사람의 수정이 계속 필요하다면, 연구는 그 발생 빈도와 추천 결과를 얼마나 바꾸는지를 기록해야 한다.

재현 가능한 시스템은 정식 계획 수립 워크플로 내에서 생성형 AI를 활용해야 한다는 근거를 강화할 것이다. 검토자들이 대부분의 개별 결과를 그럴듯하다고 평가하더라도 실행 간 변동이 크다면 그 근거는 약화된다.

두 번째 신호는 네이티브 3차원 분석이다. 미래의 시스템은 수동으로 선택한 PNG 이미지가 아니라 전체 CT 볼륨에 접근해야 한다.

그 워크플로는 병변, 폐, 혈관, 늑골, 엽간열, 종격동 및 기타 관련 구조를 자동으로 분할해야 한다. 또한 명시적인 안전 여유를 계산하고 전체 경로를 표시해야 한다.

언어 모델을 전용 의료 분할 기술과 결합하면 현 연구의 인위적인 준비 과정 일부를 해결할 수 있다. 동시에 별도 검증이 필요한 새로운 통합 위험도 발생한다.

3차원 분석은 서로 다른 스캐너, 재구성 설정, 환자 자세, 병변 위치를 처리해야 한다. 한 암센터에서의 성능이 다른 병원으로 이전되지 않을 수 있으므로 다기관 데이터가 필수적이다.

세 번째 신호는 전향적 임상 비교다. 이러한 연구는 시술 전에 AI 보조 계획을 평가하되, 모든 최종 결정은 자격을 갖춘 영상의학과 의사가 책임지도록 해야 한다.

연구진은 진단 수율, 기흉, 출혈, 시술 시간, 방사선 노출, 바늘 재위치 조정, 회복 시간을 비교할 수 있다. 평균값이 실패 사례를 가리지 않도록, 성공하지 못한 추천은 별도로 보고해야 한다.

전향적 검증은 신중하게 시작해야 한다. 섀도 모드는 진료에 영향을 주지 않고 추천을 생성해, 연구자가 실제 환경에서 AI 계획과 실제 결정을 비교할 수 있게 한다.

이후의 임상시험에서는 시스템을 사용하는 임상의가 더 나은 또는 더 일관된 계획을 수립하는지 평가할 수 있다. 직접적인 로봇 실행으로 나아가려면 훨씬 강한 근거와 기기 수준의 감독이 필요하다.

30건 사례 연구는 제안된 경로가 사용되지 않았기 때문에 진단 수율에 관한 답을 제공하지 못한다. 또한 더 짧은 경로가 관찰된 경미한 합병증을 줄였을지 역시 보여줄 수 없다.

이 연구의 가치는 범용 멀티모달 모델이 엄격히 제한된 계획 수립 과제에 참여할 수 있음을 보여준 데 있다. 이 발견은 더 나은 실험을 정당화하지만, 즉각적인 임상 도입을 정당화하지는 않는다.

진정한 진전은 검증 가능한 계획 가설이다

이 실행 가능성 연구는 생성형 AI 경로 계획을 측정 가능한 연구 질문으로 전환하면서도, 임상적 책임은 확고히 전문의에게 남긴다.

GPT-4는 독립 전문가들이 적절하다고 평가한 경로를 30건의 과거 사례 중 28건에서 식별했다. 모델이 제안한 경로의 중앙값은 완료된 수동 경로보다 폐 조직을 18밀리미터 덜 통과했다.

이 수치들은 이 방법을 조사할 가치가 있음을 보여준다. 동시에 두 개의 거부된 계획, 수동 이미지 준비, 스크립트화되지 않은 후속 프롬프트, 3차원 해부학의 2차원 관점이라는 한계도 함께 존재한다.

가장 유용한 해석은 무조건적인 기각도 찬양도 아니다. 범용 AI 모델은 그럴듯한 대안을 제안할 만큼 충분한 시각적·절차적 구조를 인식했지만, 신뢰할 수 있는 계획에 필요한 완전한 맥락은 갖추지 못했다.

영상의학과 의사에게 이 연구는 임상 판단을 대체하기보다 경로를 비교하는 의사결정 지원의 방향을 제시한다. 의료 AI 팀에게는 챗봇 실험과 검증된 소프트웨어 사이에 아직 남아 있는 엔지니어링 과제를 정의한다.

병원과 환자에게 기준은 결과 중심으로 유지돼야 한다. AI 지원이 조직 채취를 개선하고, 합병증을 줄이며, 시술을 단축하거나, 다양한 진료 환경에서 전문의 계획의 일관성을 높이는가?

다음 연구는 통제된 시스템, 전체 CT 볼륨, 외부 데이터셋, 전향적 임상 평가를 통해 이러한 질문에 답해야 한다. 그때까지 GPT-4 폐 생검 계획은 준비된 이미지에 대한 흥미로운 제2의 의견일 뿐, 실제 바늘을 안내하는 내비게이터는 아니다.

 
 

무료로 시작하세요

개인 지식 관리 기능을 갖춘 로컬 우선 AI 어시스턴트

더 나은 AI 경험을 위해

현재 remio는 Windows 10+ (x64) 및 M-Chip Macs만 지원합니다.

업무를 위한 AI 파트너
remio와 더 많은 일을 해내세요

계획하고, 만들고, 완성하세요
모든 일을 한곳에서

bottom of page