2枚のX線シルエットから3D大腿骨を生成、ただし難題は対応付けだった
Horizon MachineLearningで、2枚のX線シルエットと50個の参照大腿骨メッシュだけを基盤とする3D再構成パイプラインが話題になっている。投稿者は、再構成時にニューラルネットワークも患者CTも使わず、選定したホールドアウト形状でミリメートル級の誤差を報告している。
より重要な結果は、必ずしも好意的なものではない。一般的な複数の対応付け手法では、元のCT由来ジオメトリよりはるかに粗い表面が生成された。投稿者が事前に定めた受け入れ基準を通過したのは、テストした手法の中でShapeWorksだけだった。
これにより論点は、ニューラルネットワークと古典的モデリングの対立から外れる。中心となる争点は、コンパクトな解剖学的事前分布と、実際の患者に見られる幾何学的多様性の間にある。モデルは係数を完全に最適化できても、対象となる解剖学的形状が学習済みの形状空間の外にあれば失敗し得る。
この取り組みは公開投稿として共有されたものであり、査読済み研究として発表されたものではない。数値結果は独立して再現されておらず、実際のX線画像での検証も未完了である。それでもこの実験は、この種の再構成が成功する場所、破綻する場所、そして臨床的意義を持たせるために必要なエビデンスを浮き彫りにしている。
このプロジェクトは2つの2D輪郭に3D形状を適合させる
報告されたパイプラインは、相当な幾何学的準備を経たうえで、制約付き逆問題を小規模な最適化問題へと変換する。
two-view reconstructionの投稿によると、対象は患者固有の遠位大腿骨である。これは膝関節を構成する丸みを帯びた表面を含む、大腿骨の下端部分だ。
提案される入力は、直交する2枚のシルエットである。1枚は後前方向のビュー、もう1枚は側面ビューを表す。各画像が記録するのは、投影されたピクセルが骨の輪郭の内側に属するか外側に属するかだけである。
これらのシルエットでは、内部密度、皮質骨の厚み、海綿骨構造は失われる。2方向から外形を制約できる一方、隠れた表面上のすべての点を一意に決定することはできない。
この曖昧さを扱うため、投稿者はCT由来の50個の大腿骨メッシュから統計的形状モデルを構築した。統計的形状モデルは、平均表面と限られた数の協調的な変形パターンによって、解剖学的な変動を表現する。
このモデルは主成分分析、すなわちPCAを用いて、対応する表面点間の変動を圧縮する。パイプラインは各頂点を独立して最適化する代わりに、10個の形状係数を調整する。
これらの係数は、参照コレクションで見つかった主要な変動パターンに沿って、平均大腿骨を動かす。この制約により最適化が扱いやすくなり、任意で解剖学的に不自然な変形を防ぐ。
パイプラインにはマハラノビス事前分布も適用される。このペナルティは、係数の組み合わせがモデルで観測された分布に対してどれほど異例かを測定する。そのため、大きい変形や起こりにくい変形は、フィッティング中により高コストとなる。
各最適化ステップでは、現在の3D候補を両方のカメラビューに投影する。投影されたシルエットを目標シルエットと比較し、得られた損失で形状係数を更新する。
投稿者によれば、Adamはおよそ1,000回の反復を実行する。Adamは、損失最小化を繰り返す過程で各パラメータの更新量を適応させる勾配ベースの最適化手法である。
この勾配は、微分可能レンダリングから得られる。PyTorch3Dのレンダラーは、画像空間の差異を、それを生じさせた頂点とパラメータへと結び付ける。
従来のラスタライズでは、三角形がピクセルを覆うかどうかをハードに判断する。この判断は不連続性を生み、最適化で扱いにくい。
ソフトラスタライズは、三角形の辺の周囲にある鋭い境界を連続的な確率へ置き換える。これにより、投影された輪郭は突然で情報量の少ない信号を受けるのではなく、目標へ向けて徐々に移動できる。
投稿者は最適化中にレンダラーのsigmaパラメータをアニーリングしている。Sigmaは境界の柔らかさを制御するため、アニーリングでは寛容な勾配から始め、より鋭い輪郭で終える。
このアプローチでは、解剖学的形状を予測するニューラルネットワークを学習させない。事前計算済みの統計モデルに対して、患者固有の最適化を行う。参照メッシュは依然として事前知識を提供するが、学習済みの画像から形状への予測器は存在しない。
この違いは重要だ。このプロジェクトは、問題から学習データをなくしているわけではない。大規模な教師あり画像データセットを、より小規模で慎重に処理された、整列済み解剖学的表面のコレクションに置き換えている。
根底にある考え方も、この実験に先行している。研究者たちはこれまでに、統計モデルと輪郭マッチングを用いて、キャリブレーション済みの二平面画像から大腿骨を再構成してきた。新しい要素は、現在のオープンソースコンポーネントで構築されたアクセスしやすい実装である。
対応付けこそがHorizon MachineLearningでの本当の焦点になった
決定的なエンジニアリング上の課題は大腿骨をレンダリングすることではなく、50本の異なる骨にまたがって、どの表面点が同じ解剖学的部位を表すかを決めることだった。
PCAは、すべての入力に一貫した意味を持つ変数が含まれることを前提とする。画像ではピクセルグリッドがその一貫性を提供する。解剖学的メッシュでは、通常そうではない。
ある大腿骨の頂点4,000は顆の近くにあるかもしれない。別の大腿骨の頂点4,000は異なる特徴部位を占めるか、意味のある関係がまったくない可能性もある。
メッシュの解像度は異なり得る。三角形のレイアウトも変わり得る。表面サンプリングは一部の領域に集中し、他の領域では疎になることがある。
頂点の対応がずれた統計モデルは、きれいな解剖学的構造を学習しない。無関係な位置を混ぜ合わせ、不安定な変形モードと、目に見えて粗い再構成表面を生み出す。
投稿者はまず、KD-treeによる最近傍マッチングを試した。この手法は空間的近接性に従って点を対応付けるが、近いことが解剖学的等価性を保証するわけではない。
最近傍マッチングでは、狭い隙間をまたいで対応が折り返されたり、滑らかな表面に沿ってずれたりすることがある。局所的な小さな誤りは、コホート全体に蓄積する。
投稿では、このアプローチが参照CT表面の50.7倍の表面粗さを生んだと報告している。この数値は投稿者が報告した診断指標であり、独立して確立されたベンチマークではない。
Coherent Point Drift、すなわちCPDもテストされた。CPDは一方の点集合を確率的混合モデルの中心として扱い、それらをもう一方の集合へ向けて一貫性を保ちながら移動させる。
報告された粗さは、CT由来の参照値の28.2倍にとどまった。ベイズCPDは47.5倍に達したとされ、FilterRegは投稿者の環境では正常に完了しなかった。
これらの結果を、レジストレーションソフトウェアの普遍的な順位付けにすべきではない。実装、初期化、前処理、ハイパーパラメータ、トポロジー、表面品質は、各手法に大きく影響し得る。
ただし、これらはこの特定のワークフローにおいて、ペアワイズレジストレーションが不十分だったことを示している。各大腿骨を1つのテンプレートに独立して対応付けても、PCAに適した集団全体の座標系は作れなかった。
ShapeWorksはこの結果を変えた。そのparticle correspondenceワークフローは、局所的な近接性を対応として受け入れるのではなく、形状コレクション全体にわたってランドマークを最適化する。
このソフトウェアは2つの目標のバランスを取る。粒子は各個別表面を正確に表すべきであり、同時に集団全体にわたる分布はコンパクトな統計モデルを作るべきである。
投稿では、ShapeWorks使用後の表面粗さはCT参照値の3.3倍だったと報告されている。これは、投稿者の5倍という受け入れ基準を下回った唯一のテスト結果だった。
この受け入れ基準についても検討が必要だ。投稿によると、これはテスト前に選定されたため、事後的な閾値選択の一形態は抑えられている。ただし、5倍の粗さ比に臨床的な意味付けは与えられていない。
表面粗さは再構成精度と同じではない。滑らかな大腿骨でも寸法が間違っている可能性があり、正確な表面にも小さなセグメンテーション由来のアーティファクトが残ることがある。
完全な評価には、モデル品質と患者レベルの両方の測定が必要である。コンパクト性、汎化性能、特異性は統計モデルを表す。表面距離と解剖学的ランドマークはフィッティング結果を表す。
下流の測定も重要だ。膝の形状は、インプラント計画、アライメント解析、バイオメカニクスシミュレーションに影響する。臨床的に重要なランドマーク周辺の誤差は、骨幹に沿った同程度の誤差より重要となる場合がある。
それでも、対応付けの結果には最も強い一般的な教訓がある。高度な最適化器でも、形状空間が不適切に構築されていれば救えない。
より良い損失関数でシルエットの一致度を改善できるかもしれない。反復回数を増やせば目的関数を下げられるかもしれない。しかし、参照メッシュ間でそもそも同じ意味を持たなかった解剖学的変数を、どちらの変更も修復することはできない。
小規模な形状事前分布がデータ集約型再構成に挑む
このプロジェクトは、強力な解剖学的制約により、必要なデータ量と教師信号を減らせることを示し、ニューラル再構成パイプラインに問いを投げかけている。
医用画像チームは、画像からジオメトリへのマッピングに際してニューラルモデルを選ぶことが多い。この手法は複雑な関係を学習できるが、適切な学習ペアと慎重な外部検証を必要とする。
ここでは、ペアデータの取得が特に難しい。有用なデータセットには、キャリブレーション済みのX線画像、高品質なセグメンテーション、同一患者に由来する対応CT形状が含まれる必要がある。
アクセス、同意、プロトコルの違い、アノテーション作業が収集を複雑にする。臨床集団も、年齢、性別、疾患、インプラント、撮影ハードウェアにわたって異なる。
統計モデルは異なる立場を取る。人間の大腿骨には変動があるが、可能なメッシュの全宇宙を占めるわけではない。コンパクトな事前分布は、繰り返し現れる解剖学的関係を直接エンコードできる。
プロジェクトの参照形状は、MedShapeNetから得られたとされる。より広範なmedical shape datasetは、23のコンポーネントデータセットにまたがる10万超のアノテーション済み形状とともに発表された。
この合計値を、プロジェクトの大腿骨コホートと混同すべきではない。Redditの投稿者によると、このモデルに入ったCT由来の大腿骨メッシュは50個だけだった。
10個の係数により、フィッティングプロセスは数百万の無制約座標を予測するのではなく、狭い部分空間を探索する。これにより、このシステムは多くのエンドツーエンドモデルより解釈しやすくなる。
各係数はモデルモードに結び付け、可視化し、制約を設け、学習分布と比較できる。マハラノビス項は、候補が参照集団からどれほど離れているかも明らかにする。
この透明性が、結果を本質的に安全にするわけではない。一部の失敗メカニズムを調べやすくするだけである。
モデルの中心的な制約は明確だ。平均形状と保持されたモードで表現された解剖学的構造しか生成できない。形状基底が除外した変形を新たに作り出すことはできない。
ニューラルモデルも、学習分布の外では苦戦する。しかし、その表現はもっともらしい出力と確信度の高い予測の背後に、その失敗を隠してしまう可能性がある。
統計的アプローチでは、その境界がより見えやすい。係数が許容範囲の端に達することは、モデルのカバレッジが不足している直接的な警告となる。
この特性は、有用な棄却システムを支え得る。すべてのケースで安心感のあるメッシュを返すのではなく、CTまたは手作業によるレビューが必要な患者をソフトウェアが識別できる可能性がある。
しかし、少量データという利点は、コストの高い前段作業に依存する。50個の表面には、セグメンテーション、クリーンアップ、アライメント、対応関係の最適化、品質管理が必要だった。
したがって、このプロジェクトはあるデータ負担を別の負担と引き換えにしている。大規模なラベル付き画像コレクションは不要にする一方で、幾何学的に一貫した解剖学的コホートを求める。
この手法は、通常の写真から汎用的な物体を再構築する方法とも異なる。X線シルエットは、キャリブレーション済みの撮影幾何学のもとで得られる解剖学的構造の投影であり、テクスチャや照明の手がかりを持つカラー画像ではない。
特にカメラが直交している場合、2つのビューは1つのビューよりもスケールと輪郭をよく制約する。それでも、見えないくぼみや奥行き方向の変化には曖昧さが残る。
モデルは、そうした空白を母集団統計で補う。これが、その効率性とリスクの双方を生む仕組みである。
より大規模なニューラルシステムであれば、より多様な解剖学的形状、画像ノイズ、セグメンテーション挙動を取り込める可能性がある。コンパクトなモデルは、より明確な制約、低いデータ要件、より狭い動作範囲を提供する。
抽象的にどちらの手法が優れているかを決めることはできない。重要な問いは、システムが患者がその動作範囲を外れたことを認識できるかどうかだ。
ミリメートル単位の結果が隠すカバレッジの失敗
有望な誤差は範囲内の合成ターゲットに適用される一方、極端な解剖学的形状ではモデルと初期アライメントの失敗が露呈した。
著者は、5つのホールドアウト大腿骨を用いたleave-one-outテストを報告している。各テストでは、1つのターゲットを除外し、残る49個のメッシュからモデルを構築する。
モデルが表現する範囲内のターゲットでは、報告された誤差は0.86~1.43ミリメートルに及ぶ。公開投稿には、完全なプロトコル、領域別誤差、信頼区間、ダウンロード可能な評価成果物は示されていない。
これらの値は、この分野では技術的にもっともらしい。以前の大腿骨遠位部研究では、キャリブレーション済みの二平面画像から形状再構築を評価する前に、サブミリメートル精度の剛体レジストレーションが報告されている。
ほかの研究では、制御された二平面条件下での下肢再構築について、おおむねミリメートルスケールの平均誤差が報告されている。データセット、指標、キャリブレーション、対象解剖学が異なるため、比較には依然として限界がある。
現在のプロジェクトにおける2つの極端なケースは、最良の数値よりも多くを示している。投稿によれば、両ターゲットは第1PCAモードに沿って49形状モデルのカバレッジ外に位置していた。
ターゲットがそのサポート範囲を超えると、最適化器にはそれを再現できる有効な係数が存在しなかった。反復回数を増やしても、欠けている解剖学的方向を新たに生み出すことはできない。
これは単なる最適化器の失敗ではない。表現の失敗である。
著者は、これらのケースでインライア率0.6という不良なブリッジICPアライメントも報告している。ICP(iterative closest point)は、近傍の幾何形状を繰り返し対応付け、変換を更新することでアライメントを推定する。
投稿では、この初期化誤差は失敗した再構築において、形状フィッティングより大きく影響したとされる。ここには、相互に作用する2つの境界がある。
まず、シルエット最適化が正しく収束するためには、ターゲットをモデルに十分近い位置へ配置しなければならない。次に、モデルがターゲットを表現するのに十分な解剖学的変動を含んでいなければならない。
パイプラインはいずれのテストにも失敗し得る。また、画像損失を満たしながら、誤った隠れた幾何形状を返すこともある。
2つのシルエットは、多数の等価またはほぼ等価な投影を生み出す。大腿骨は両方の輪郭に一致していても、どちらのビューも強く制約しない領域では異なり得る。
マハラノビス事前分布は、そうした可能性の中からもっともらしい解を選ぶ。ただし、そのもっともらしさは49個の学習形状を反映するものであり、普遍的な患者集団を反映するものではない。
この区別は、変形、外傷、小児の解剖学的形状、過去の手術、腫瘍、非典型的な形態で重要になる。こうしたケースこそ、患者固有の幾何形状が最も重要になる場合がある。
比較的典型的な成人解剖学で学習したモデルは、再構築が臨床的に最も必要とされない場面で最良の性能を示すかもしれない。三次元評価を必要とするケースそのものを棄却したり、平滑化してしまったりする可能性がある。
小規模な検証セットでは、サブグループ性能を確立できない。5つのホールドアウト表面はデバッグには有用だが、臨床的信頼性に関する主張を裏付けることはできない。
leave-one-outテストでは、各評価にほぼコホート全体が再利用される。そのため、fold間の結果は相関し、テスト集団は開発データセットに近いままである。
独立した外部検証なら、より厳しいテストになる。別の施設、スキャナー、セグメンテーション工程、患者集団から得た大腿骨を用いるべきだ。
公開済みの文献も、この領域を慎重に扱っている。股関節形状のレビューでは、統計モデルがX線画像と3D解剖学的形状を結び付けられる一方、検証と母集団のギャップも指摘されている。
したがって、0.86~1.43ミリメートルという値の解釈は限定的であるべきだ。これは、シミュレーション条件下で、選定されたモデル対応メッシュに対する概念実証として報告された結果である。
これは、通常の臨床X線2枚がCTに取って代われる証拠ではない。診断用途、手術計画、インプラント選定の証拠でもない。
レンダラーのキャリブレーションは形状モデルを圧倒し得る
スケールに敏感な単一のレンダリングパラメータによって精度が87倍変化したと報告されており、画像空間最適化がいかに脆弱になり得るかを示している。
ソフトラスタライゼーションでは、投影された三角形境界の周囲に遷移幅が必要となる。この幅が大きすぎると、シルエットはぼやけ、損失は真の輪郭を精密に位置特定できなくなる。
開始時点で幅が小さすぎると、現在の境界から離れた場所では勾配が消失する。その結果、初期投影がターゲットを外している場合、最適化器はほとんど手がかりを得られない。
Sigma annealingは、この対立を解消する。初期の広い境界は候補形状を引き寄せ、最終段階の狭い境界は精密なフィッティングを支える。
著者によれば、annealingの終点は参照レンダリングの生成に使ったsigmaと一致させる必要があった。ある形状モデル向けに調整した定数を別のモデルに用いると、精度が87分の1に低下したと報告されている。
繰り返すが、これは公開プロジェクトの説明に基づく主張である。投稿には、この比率を検証したり、寄与するすべての変数を切り分けたりするのに十分な成果物は示されていない。
提案された修正では、終点をカメラ範囲に0.0001を乗じた値に結び付けた。カメラ範囲は、選択した座標系におけるレンダリングシーンのスケールを表す。
この正規化は概念的に理にかなっている。絶対的なモデル単位で表したsoftness値は、別のデータセットが異なるスケールを使う場合には異なる挙動を示す。
この教訓はsigmaにとどまらない。カメラキャリブレーション、メッシュ単位、画像解像度、投影タイプ、クリッピング平面、座標規約はいずれも再構築される幾何形状に影響し得る。
データセット固有の調整後に機能する方法でも、別の病院に移すと失敗する可能性がある。システムごとに、距離をミリメートル、メートル、正規化座標、ピクセル相対単位で符号化している場合がある。
同じレンダラーがターゲットを生成し、再構築を評価するため、合成実験ではこうした不一致を隠せる。フォワードモデルがそれ自体と完全に一致しているからだ。
実際のX線画像では、この対称性が崩れる。拡大、散乱、解剖学的構造の重なり、ノイズ、歪み、不完全な視野、取得メタデータの誤りが含まれる。
その輪郭も、二値化された合成シルエットほど明瞭ではない。大腿骨遠位部は、脛骨、膝蓋骨、軟部組織、インプラント、位置決め装置と重なる可能性がある。
現在のプロジェクトでは、骨の輪郭がすでに利用可能であると仮定している。著者は、自動セグメンテーションを未完了の作業として挙げている。
この欠落した段階は重大である。輪郭誤差は最適化器にとって幾何学的な指示となり、最適化器は誤ったピクセルを説明するために大腿骨を変形させる。
したがって、セグメンテーションの不確実性は再構築モデルに組み込むべきだ。システムは曖昧な境界の重みを下げたり、輪郭の不確実性を最終的な表面信頼度へ伝播させたりできる。
完全なシルエットだけをテストしても、この挙動は明らかにならない。制御された摂動を加えれば、欠損エッジ、ずれた輪郭、キャリブレーション誤差に対する感度を測定しやすくなる。
3つ目のビューは、追加投影の誤差を損失に加算できるため、制約を増やせる。ただし、取得の複雑性が増し、プロジェクトの2ビューという前提から離れることになる。
濃度情報は二値の輪郭より多くの証拠を提供し得るが、そのためにはより現実的な画像形成モデルが必要になる。また、露出、材料、減衰に関する仮定も導入することになる。
単純なシルエット定式化は、それらの変数を回避するため魅力的である。その弱点は、最適化が始まる前に情報を捨ててしまう点にある。
次に必要なのは、単に合成表面誤差を下げることではない。現実的な取得誤差がループに入った後も、パイプライン全体が安定しているかを検証することだ。
このアプローチが実用化へ進めるかを決める3つのテスト
報告された精度が実用的な意味を持つためには、ペア化された臨床検証、より広範な解剖学的カバレッジ、明示的な失敗検出が必要である。
最初の指標は、実際にペア化されたX線画像とCTデータでの性能である。各患者について、再構築用のキャリブレーション済みX線2枚と、独立比較用のCT由来表面を用意する。
このテストでは、CTの幾何形状をフィッティング工程の外に置くべきだ。また、セグメンテーション誤差、カメラキャリブレーション誤差、レジストレーション誤差、形状モデル誤差を分離すべきである。
領域別の表面距離は、単一の全体平均より有益である。顆、顆間窩、手術上のランドマーク周辺の誤差は、分けて報告する価値がある。
評価には、想定用途に関連する解剖学的測定を含めるべきだ。小さな平均距離が、正確な軸、幅、角度、インプラント接触領域を保証するとは限らない。
ペア化ケースで成功すれば、合成シルエットフィッティングが臨床画像へ移行できるという主張を強められる。大幅な低下が見られれば、現在のレンダラーがX線撮影よりもクリーンな問題を解いていることが示される。
2つ目の指標は、より広いコホートにわたる外部検証である。50個の参照メッシュで実現可能性は示せるが、人口統計学的・病理学的変動のカバレッジには限界がある。
より大規模な研究では、コホート構成、除外基準、病理、左右、セグメンテーション手順を開示すべきである。また、完全に独立したテストセットも確保すべきだ。
最も価値が高いケースは、モデル境界の近く、またはその外側に位置する。典型的な解剖学的形状だけをテストすれば、2つの極端な例で既に観察された限界そのものを隠してしまう。
研究者は、モデルに投入する参照形状とPCAモードを増やすにつれて精度がどう変化するかを報告すべきである。モードを増やせばカバレッジは改善し得るが、正則化が弱まり、不安定な変形が導入される可能性もある。
この実験により、現在の10係数モデルが持続的な解剖学的基底を捉えているのか、それとも小規模な1つのコレクションに効率よくフィットしているだけなのかが明らかになる。
3つ目の指標は、自動的な棄却メカニズムである。システムは、結果のメッシュが使われる前に、信頼できない入力を識別すべきだ。
考えられる警告には、モデル限界に近い係数、高いマハラノビス距離、不良なシルエット一致、低いICPインライア率、反復初期化間の不一致が含まれる。
有用な信頼度スコアは、未知の患者における実際の3D誤差と相関しなければならない。隠れた表面は輪郭が一致していても誤ったままであり得るため、最適化損失だけに依存することはできない。
前向き試験では、最終的な結果を確認する前に棄却閾値を定めるべきです。そうすることで、失敗が明らかになった後で都合のよい閾値が選ばれることを防げます。
この3つのシグナルがそろえば、このプロジェクトは単なる興味深い幾何学デモンストレーションを超えるものになります。定常的なCT撮影に頼らず、選択的かつ患者個別の再構築へ向けた、検証可能な道筋を提示できるでしょう。
実画像での精度が大きく低下した場合、より幅広いコホートでの有効性が裏付けられない場合、あるいは失敗を検出できない場合でも、より限定的な結論には依然として意義があります。微分可能レンダリングはシルエットに適合できますが、形状モデルにそもそも含まれていない解剖学的根拠を生み出すことはできません。
Horizon MachineLearningのスレッドを追う開発者にとって、当面の課題は再現性です。この分野には、コード、固定されたデータ分割、カメラパラメータ、対応付けの設定、そして完全な誤差分布が必要です。
医療チームにとっての問いは、さらに厳格です。この手法は、再構築すべきではない患者を認識できるのでしょうか。その答えは、最高のミリメートル単位の結果よりも重要です。



