top of page

GPT-4による肺生検計画、より短い針経路を発見するも2件はレビュー不合格

8 分前
読了時間: 15分

GPT-4による肺生検計画は、30症例中28症例で許容可能な針の進入経路を提案した。しかし、残る2件の失敗は、重大な安全性のギャップを浮き彫りにした。このモデルが扱ったのは注釈付きの2次元CT画像であり、針を操作したり、実際の手技中に患者を評価したりしたわけではない。

Memorial Sloan Kettering Cancer Centerの研究者らは、GPT-4がCTガイド下肺生検の進入角を推奨できるかを後ろ向きに検証した。独立した放射線科医は、同モデルが提案した経路の93.3%を、生検の実施に十分なものと判定した。

AIが示した経路は、経験豊富な臨床医が従来選択した経路の23ミリメートルに対し、肺組織を通過する距離の中央値が5ミリメートルだった。ただし、短いことが自動的に安全性の高さを意味するわけではない。不採用となった経路の一つは、対応する手動経路の4倍の肺組織を横切り、別の一つでは針の安定性に問題が生じる可能性があった。

この緊張関係は、見出しのパーセンテージ以上に重要である。この研究は、汎用マルチモーダルモデルが慎重に準備された医療画像を解釈し、もっともらしい幾何学的な計画を作成できることを示唆する。しかし、GPT-4が転帰を改善すること、合併症を減らすこと、あるいは広範な人間による準備と監督なしに生検を計画できることを示したものではない。

GPT-4による肺生検計画の研究で実際に検証されたこと

この実験で評価されたのは過去の画像に基づく進入角の提案であり、患者に対するAI誘導手技ではない。

このオープンアクセス研究はCVIR Oncologyに掲載され、連続した30件の肺生検手技を対象とした。研究者らは、3人のIVR放射線科医がすでに実施した手技から、匿名化画像を使用した。

各臨床医には少なくとも10年の経験があった。患者コホートは男性17人、女性13人で、年齢中央値は65歳だった。肺結節の直径は5~45ミリメートルで、中央値は21ミリメートルだった。

標本には、肺尖部病変5件、胸膜下病変7件、傍縦隔病変3件、肺底部近傍の病変4件が含まれた。これらの部位では、肋骨、血管、肺組織、針の安定性に関する異なる計画上の課題が生じる。

CTガイド下肺生検では、医師が胸壁を通して疑わしい病変まで針を進める。経路は、骨、肺裂、縦隔、大血管を避けながら、診断に適した組織へ到達しなければならない。

計画では、針が通過する正常肺組織の量も考慮する。肺内を通る経路が長いほど、より多くの組織が曝露される可能性があるが、経路長は手技リスクを構成する一要素にすぎない。

この研究では、GPT-4に未加工のCT検査画像を与えたわけではない。研究者が軸位画像を選択し、切り抜いて拡大したうえで、GIMPを用いて放射状のグリッドを追加した。画像は元の医療用形式からPNGファイルへ変換された。

その後、著者の一人が青い円で標的を示し、重要な構造を赤で囲んだ。こうした注釈は、実運用システムであれば最終的に自動識別する必要がある情報をモデルに与えるものだった。

研究者らは、標準化されたプロンプトで5つの計画基準を提示した。求められた経路は、標的に到達し、肺組織内の通過距離を減らし、骨、肺裂、縦隔を避ける必要があった。

各症例は新しいチャットセッションで開始した。最初の応答がすべての条件に対応していない場合、研究者は追加でプロンプトを提示できた。モデルが必要とした反復回数の中央値は2回で、四分位範囲は1~3回だった。

チームは、要求されたすべてのパラメータを取り入れた最初の応答を記録した。元の手技に関与していない経験豊富なIVR放射線科医2人が、経路の出所を伏せられた状態で、結果として得られた経路を独立にレビューした。

この設定は、実現可能性と臨床パフォーマンスを切り分ける。人間の専門家が画像を選び、標的をマーキングし、危険因子を特定し、ルールを定式化した後に、モデルは角度を提案した。重要なすべての段階で、放射線科医は依然として必要だった。

したがって、この研究が検証したのは限定的な問いである。すなわち、マルチモーダルの汎用モデルは、準備済みの画像からもっともらしい進入角を生成できるか、という問いだ。自律的なセグメンテーション、3次元計画、リアルタイムナビゲーション、ロボットによる針制御は検証していない。

この区別は、有望な計画実験が自動手術に関する根拠のない主張へと変わることを防ぐ。

より短い経路が研究で最も強いシグナルを生んだ

GPT-4は肺組織を通る大幅に短い経路を提案したが、その経路がより安全な臨床転帰をもたらすことは、この研究では確立されていない。

独立したレビュー担当者は、モデルが提案した30本の経路のうち28本を、生検の実施に十分と評価した。この結果が、研究で示された93.3%という実現可能性の数値につながった。

AIが生成した経路は、肺組織を通過する距離の中央値が5ミリメートルだった。四分位範囲は0~25ミリメートルだった。

これに対し、完了済みの手技で使用された手動経路は、中央値で23ミリメートルの肺組織を横切った。四分位範囲は5~57ミリメートルだった。

この差は統計的に有意で、報告されたp値は0.0063だった。肺組織をまったく通過しない経路は、胸膜表面に接する胸膜下結節に関するものだった。

このような病変へ直接進む経路では、ガス交換に関わる機能組織である正常肺実質を横切らずに済む場合がある。このため短い経路は幾何学的には魅力的だが、幾何学だけで最適な臨床アプローチを定義することはできない。

AIの平均進入角は179度で、臨床医が使用した経路の174度と比べられた。この差は統計的に有意ではなかった。

平均値が似ていても、モデルが人間の判断を再現したことにはならない。主要な結果によると、研究で定められた比較基準において良好な一致を示したのは30症例中8症例だけだった。

著者らは、進入角が10度以内で、組織平面を通る経路が類似していることを一致の条件とした。別の箇所では、3症例というさらに厳格な一致解釈も報告しており、選択する定義への感度を浮き彫りにしている。

中心的な平均値は症例レベルでの大きな差異を隠し得るため、この不一致には注意を払う必要がある。2つの経路群は平均角度が近くても、個々の患者では大きく異なる可能性がある。

したがってAIは、完了した手技を単に模倣するのではなく、代替経路を見いだしたように見える。いくつかの代替案はより短く、レビュー担当者にも許容された。一方で、集計結果では簡単に隠れてしまう弱点を示すものもあった。

比較は構造的にも対等ではなかった。手動経路は患者で成功裏に実施済みであった一方、AI経路は計画画像上に描かれた線としてのみ存在した。

ある軸位断面では合理的に見える提案経路でも、隣接する断面を通じて評価すると実用的でない可能性がある。実際の手技では、呼吸運動、体位、針の固定、機器上の制約、変化する解剖学的構造を考慮しなければならない。

元の手技では重大な合併症は発生しなかった。4人の患者に介入を必要とせずに解消した軽微な気胸が生じ、2人には軽度で自然軽快した喀血が見られた。

モデルは手技を誘導していないため、これらの転帰をAIに帰することはできない。研究者らは、その経路を用いた場合にこれらの合併症が変化したかどうかもシミュレーションしていない。

したがって、より短い経路という結果は有用な仮説である。複数の幾何学的に有効な選択肢がある場合に、臨床医が見落とし得る経路を自動計画が明らかにできるかどうかを検証する根拠となる。

しかし、GPT-4が肺生検をより安全にしたと述べる根拠にはならない。その主張を確立するには、統制された条件下で臨床転帰を比較する前向き研究が必要である。

最短経路が常に最も安全とは限らないことを示した2つの不採用経路

モデルの失敗は、目に見える指標を最適化することと、実際の生検中に針がどう振る舞うかを理解することの間にある対立を明らかにしている。

症例19では、GPT-4は20ミリメートルの肺組織を横切る経路を提案した。手動経路が横切った距離はわずか5ミリメートルだった。

したがってAIの推奨は、プロンプトで与えられた最適化目標に反して、肺組織内を4倍長く進むものだった。また、精密で明確に優先される計画ではなく、可能な進入角の広い範囲を返した。

レビュー担当者は、その経路は理論上実行可能だが、優れた臨床実践を代表するものではないと判断した。この区別は、明白な障害物を回避することと、信頼できる手技計画を作ることの隔たりを捉えている。

症例27では別の問題が明らかになった。標的は胸膜下結節であり、肺の外表面に近接していた。

AIが提案した経路は、不要にもかかわらず5ミリメートルの肺組織を横切った。レビュー担当者は、針の安定性についても懸念を示した。

支持組織を通る経路が非常に短い場合、同軸式生検針が十分に固定されない可能性がある。採取中に針が動いたり、抜けたりしやすくなる可能性がある。

ここに研究の中心的なトレードオフがある。正常肺組織を通る距離を減らすことは本質的に有益に聞こえるが、安定した経路には針を確実に保持するための十分な組織への係留が必要な場合がある。

モデルに与えられたのは、手技実践を完全に表現したものではなく、単純化されたルールだった。そのため、放射線科医がより直接的でないアプローチを選ぶ理由をすべて理解することなく、これらのルールを満たす角度を探索できた。

研究者らは、分析が2次元にとどまることを認めている。人間の放射線科医は通常、複数のCTスライスをスクロールし、多断面再構成を用いて3次元的に解剖を理解する。

単一の軸位画像では、その平面の上下に広がる構造を完全に表現できない。また、一見明瞭な線が、針の完全な3次元的経路に沿ってどのように変化するかも示せない。

画像はGPT-4に渡される前に手作業で注釈付けされていた。モデルはすべての病変を独立して特定したわけではなく、臓器をセグメント化したわけでも、重要な解剖構造の周囲に安全域を確実に定義したわけでもない。

この研究では、鎖骨下および腋窩の神経血管束から最低5ミリメートル離すという明示的なマージンも省略されていた。患者の体位によってこれらの構造は評価対象の経路から離れていたが、将来のシステムは同じ条件を前提にできない。

プロンプトも別の変動要因をもたらした。研究者らは標準化されたプロンプトで開始したが、モデルが基準を見落とした際の追加対話は完全にはスクリプト化されていなかった。

そのため、2人のユーザーが同じモデルを異なる回答へ導く可能性がある。臨床計画システムには、即興的な対話なしに監査可能な結果を生み出す、再現可能なプロセスが必要になる。

症例は別々のセッションで処理され、症例間の汚染は抑えられた。しかし、同じ画像で反復実行した場合に同じ角度が返されるかどうかは、この研究では確立されていない。

推奨が侵襲的手技に影響する場合、一貫性は重要である。実行ごとに計画が変わるシステムには、その差異を説明し、順位付けし、解決する方法が必要だ。

モデルのバージョンも別の課題をもたらす。汎用AIサービスは時間とともに変化し、臨床ユーザーにすべての技術的変更が公開されるとは限らない。

あるGPT-4構成で得られた結果を、後のモデルに自動的に移行することはできない。医療における検証は、管理されたシステムバージョン、定義済みの入力、文書化された運用プロセスに結び付ける必要がある。

目的特化型システムが汎用モデルを相対化する

GPT-4の結果が注目されるのは汎用モデルを用いた点にあるが、専門アルゴリズムはすでに、より構造化され再現性の高い計画手法を提供している。

2024年の経路計画研究では、経胸壁肺生検向けに特化して開発されたソフトウェアが評価された。三次元病変検出とベイズ最適化を組み合わせ、穿刺経路を提案する仕組みである。

このシステムは、219件のスキャンに含まれる2,147個の結節を用いて学習された。研究者らはさらに、354病変を含む235件のスキャンで病変検出を検証した。

同モデルは、受信者動作特性曲線下面積が97.4%だったと報告されている。平均感度は93.5%、平均特異度は93.2%に達した。

研究者らは、提案された経路を150人の患者で実際に行われた生検経路と比較した。角度差が5度未満の場合を一致と分類した。

同システムは、評価対象症例の85.3%で実行可能な経路を生成した。研究での定義に基づき82%が実際の経路と一致し、一致した経路の平均角度偏差は2.30度だった。

このシステムは、三次元セグメンテーションや病変検出など、GPT-4が実施していない課題にも対応していた。ただし、これも患者アウトカムの改善を示すものではなく、後ろ向き評価にとどまる。

それ以前の研究でも、ルールベースAIによる計画と専門医の判断が比較されている。2023年の概念実証研究では、28人の患者それぞれについて5本の候補経路を生成した。

経験豊富な医師4人が、計140本の経路を評価した。コンピューターと医師の評価は57.9%の症例で一致し、アルゴリズムが選んだ28本の最適経路はすべて安全と判断された。

より新しい研究では、この比較がさらに広がっている。CTガイド下生検向けのTrajectory Recommendation Algorithm(TRAX)は、医師が標的を指定した後、約20,000本の候補経路を生成して順位付けする。

53人を対象としたTRAX比較研究では、盲検化された放射線科医が、AI選択経路と医師選択経路のすべてを安全と評価した。評価は比較の58%で一致した。

評価者は23%でTRAXを、19%で医師の経路を選好した。この差は統計的に有意ではなかったが、TRAXの経路は平均してわずかに短かった。

TRAXは、標準的な軸位断面以外の経路もより多く選択した。TRAXの経路の半数は角度の付いた平面を用いた一方、医師の経路の81.1%は軸位のままだった。

これらの研究は、単純に一方の勝者を決める競争ではない。入力、定義、データセット、経路一致のしきい値がそれぞれ異なるためだ。

目的特化型システムは、解剖学的制約を組み込み、距離を定量化し、数千本の経路を一貫して順位付けできる。マルチモーダル言語モデルはより高い柔軟性を備える一方、画像準備、プロンプト、人間による解釈への依存度が高い。

したがって、GPT-4の役割は経路生成エンジンというより、計画支援アシスタントに近い可能性がある。臨床医が選択肢を比較し、見落とされたアプローチを特定し、選択理由を記録する際に役立つかもしれない。

そのような補助的役割にも、安全策が必要である。インターフェースはモデルの提案と承認済み計画を区別し、完全な解剖学的経路を表示し、人間によるレビューの記録を保持しなければならない。

重要な競争は、AI対放射線科医ではない。自動化された幾何学的提案と、画像上の一本の線を安全な処置へと変えるために必要な包括的な臨床判断との比較である。

GPT-4による肺生検計画には、なお前向き検証が必要

次に求められる証拠は、別の高い実現可能性割合ではなく、再現性、三次元性能、患者利益を示すものでなければならない。

最初に注目すべき指標は再現性である。研究者は、統制されたセッションで同一症例を繰り返し実行し、モデルがどの程度同じ経路を選択するかを測定すべきだ。

また、すべてのプロンプトと追加指示の条件を標準化する必要がある。人間による修正が引き続き必要であれば、研究ではその頻度と、推奨内容をどれだけ変更したかを記録しなければならない。

再現性のあるシステムであれば、正式な計画ワークフロー内で生成AIを使用する根拠が強まる。各実行間のばらつきが大きければ、評価者が個々の出力の大半を妥当とみなしたとしても、その根拠は弱まる。

2つ目の指標は、ネイティブな三次元解析である。将来のシステムは、人手で選択したPNG画像ではなく、完全なCTボリュームにアクセスする必要がある。

そのワークフローは、病変、肺、血管、肋骨、葉間裂、縦隔、その他の関連構造を自動でセグメント化すべきである。また、明示的な安全マージンを計算し、経路全体を表示する必要がある。

言語モデルと医療向けの専用セグメンテーションを組み合わせれば、現行研究における人工的な準備の一部に対処できる可能性がある。一方で、別途検証を要する新たな統合リスクも生じる。

三次元解析では、異なるスキャナー、再構成設定、患者体位、病変位置に対応しなければならない。あるがんセンターでの性能が他院へ移転可能とは限らないため、多施設データが不可欠となる。

3つ目の指標は、前向きな臨床比較である。このような研究では、処置前にAI支援計画を評価しつつ、最終判断の責任はすべて資格を有する放射線科医が負うべきだ。

研究者は、診断率、気胸、出血、処置時間、放射線被ばく、針の再位置決め、回復時間を比較できる。不成功だった推奨は、平均値に埋もれさせず、個別に報告すべきである。

前向き試験は慎重に始めるべきだ。シャドーモードでは、診療に影響を与えずに推奨を生成できるため、研究者は実際の臨床判断とAI計画を実環境で比較できる。

その後の試験では、システムを用いる臨床医がより優れた、あるいはより一貫した計画を立てられるかを評価できる。ロボットによる直接実行へ進むには、はるかに強い証拠と医療機器レベルの監督が必要となる。

30症例の研究は、提案経路が実際には使われていないため、診断率について答えを示していない。また、より短い経路が観察された軽微な合併症を減らしたかどうかも示せない。

その価値は、汎用マルチモーダルモデルが厳しく制約された計画演習に参加できることを示した点にある。この発見は、直ちに臨床導入する根拠ではなく、より優れた実験を正当化するものである。

真の前進は、検証可能な計画仮説にある

この実現可能性研究は、生成AIによる経路計画を測定可能な研究課題へと変える一方、臨床責任を専門医に明確に委ねている。

GPT-4は、独立した専門家が適切と判断した経路を、過去の30症例中28症例で特定した。GPT-4が提案した経路の中央値は、実施済みの手動経路より18ミリメートル少ない肺組織を通過した。

これらの数値は、この手法を検討する価値があることを示している。同時に、却下された2件の計画、人手による画像準備、定型化されていない追加プロンプト、三次元解剖を二次元で見るという制約も存在する。

最も有用な解釈は、否定でも称賛でもない。汎用AIモデルは、もっともらしい代替案を提案できるだけの視覚的・手技的構造を認識したが、信頼できる計画に必要な完全な文脈は欠いていた。

放射線科医にとって、この研究は臨床判断を置き換えるのではなく、経路を比較する意思決定支援を示唆している。医療AIチームにとっては、チャットボット実験と検証済みソフトウェアの間に残るエンジニアリング作業を明確にする。

病院と患者にとって、基準は引き続きアウトカムに基づくべきである。AI支援は組織採取を改善するのか、合併症を減らすのか、処置を短縮するのか、あるいは医療環境をまたいで専門的な計画をより一貫したものにするのか。

次の研究では、統制されたシステム、完全なCTボリューム、外部データセット、前向き臨床評価を用いて、これらの問いに答えるべきである。それまでは、GPT-4による肺生検計画は、準備済み画像に対する興味深い第二意見にとどまり、生検針をリアルタイムで誘導するナビゲーターではない。

 
 

無料で始めましょう

ローカルファーストのパーソナル知識管理付きAIアシスタント

より良いAI体験のために、

remio は現在、 Windows 10+ (x64)とM-Chip Mac のみをサポートしています。

仕事のAIパートナー
remioでもっと仕事が進む

計画・作成・仕上げまで
すべてをひとつに

bottom of page